統計2級第 1 章約 13 分図 5 点

データの要約:代表値と散らばり

データの「中心」を表す平均値・中央値・最頻値と、「散らばり」を表す分散・標準偏差を導入する。偏差を2乗する理由、n と n−1 の違い、電卓で速く計算する式まで、公式がなぜその形になるのかをたどる。

この章の到達目標

  • 平均値・中央値・最頻値を求め、分布の形や外れ値に応じて使い分けられる
  • 偏差の和が必ず 0 になることを示し、分散で偏差を2乗する理由を説明できる
  • 分散の計算式「2乗の平均 − 平均の2乗」を導き、電卓で分散・標準偏差を計算できる
  • 標本分散と不偏分散の違いを説明し、問題文の指示に従って使い分けられる
  • 変動係数と標準化(z スコア)を使って、単位や規模の異なるデータを比較できる
目次
  1. 代表値:平均値・中央値・最頻値
  2. 平均値と中央値がずれるとき
  3. 散らばり:偏差・分散・標準偏差
  4. 偏差の和は必ず 0
  5. 偏差を2乗する
  6. 分散を速く計算する式
  7. n で割るか、n − 1 で割るか
  8. 変動係数:規模の違うものの散らばりを比べる
  9. 標準化:z スコア
  10. 章末問題

データが何十個、何百個と並んでいても、そのままでは特徴がつかめません。 そこで、データを少数の数値に要約します。

要約には大きく2種類あります。 データの中心がどこにあるかを表す代表値と、 中心のまわりにどれだけ散らばっているかを表す散らばりの指標です。 統計検定2級のほぼすべての分野は、この2つの考え方の上に組み立てられています。

代表値:平均値・中央値・最頻値

nn 個のデータ x1,x2,…,xnx_1, x_2, \ldots, x_n があるとします。

xˉ=1n∑i=1nxi=x1+x2+⋯+xnn\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i = \frac{x_1 + x_2 + \cdots + x_n}{n}
平均値
  • 中央値(メジアン) … データを小さい順に並べたとき、ちょうど真ん中にくる値。 nn が偶数なら、真ん中の2つの平均をとる
  • 最頻値(モード) … 最も多く現れる値。度数分布表では、度数が最大の階級の階級値

平均値は「全員の値を合計して均等に分け直したら1人あたりいくつか」という量です。 中央値は「上から数えても下から数えても半分の位置」、 最頻値は「いちばんよくある値」です。3つは測っているものが違います。

平均値と中央値がずれるとき

5人の年収(万円)が次のとおりだったとします。

300,350,400,450,3000300,\quad 350,\quad 400,\quad 450,\quad 3000 xˉ=300+350+400+450+30005=45005=900\bar{x} = \frac{300 + 350 + 400 + 450 + 3000}{5} = \frac{4500}{5} = 900

中央値は3番目の 400400 です。

平均値 900900 は、図 1 のように5人のうち4人の年収を上回っています。 1人の極端に大きな値(外れ値)が合計を押し上げたからです。 一方、中央値は「真ん中が何か」しか見ないので、最大値が 30003000 でも 3000030000 でも 400400 のままです。

0100020003000外れ値30035040045030005人の年収(万円)平均値 900中央値 400平均値 900 を上回るのは5人中1人だけ
図 15人の年収を棒の高さで表した。たった1人の 3000 万円が平均値を 900 まで押し上げ、4人が平均値より下にいることに注目。中央値 400 は真ん中の人の値のまま動かない。
05001000値最頻値 250中央値 400平均値 464最頻値 < 中央値 < 平均値右に長い裾が平均値を引っぱる
図 2右に裾の長い分布の例(架空の100人、階級幅100)。山の頂上が最頻値 250、50人目と51人目の境が中央値 400、階級値で計算した平均値は 464。裾の長い右側ほど平均値が遠くへ引っぱられていることに注目。

散らばり:偏差・分散・標準偏差

平均値が同じでも、散らばり方がまったく違うデータはいくらでもあります。

A: 49, 50, 51B: 0, 50, 100\text{A}:\ 49,\ 50,\ 51 \qquad\qquad \text{B}:\ 0,\ 50,\ 100

どちらも平均は 5050 ですが、図 3 のように B のほうがはるかに散らばっています。 これを1つの数値で表したい。

平均 50050100A標準偏差 ≈ 0.82050100B標準偏差 ≈ 40.8
図 3A と B はどちらも平均 50。薄い帯は「平均 ± 標準偏差」の範囲で、A では点とほぼ重なるほど狭く、B では端から端まで広がることに注目。

偏差の和は必ず 0

各データが平均からどれだけ離れているかを偏差と呼びます。

xi−xˉx_i - \bar{x}

素朴に考えると「偏差の平均」で散らばりを測れそうですが、これはうまくいきません。 偏差の和は、どんなデータでも必ず 0 になるからです。

∑i=1n(xi−xˉ)=∑i=1nxi−∑i=1nxˉ=nxˉ−nxˉ=0\sum_{i=1}^{n}(x_i - \bar{x}) = \sum_{i=1}^{n} x_i - \sum_{i=1}^{n}\bar{x} = n\bar{x} - n\bar{x} = 0

1行目から2行目では、∑xi=nxˉ\sum x_i = n\bar{x}(平均の定義を nn 倍しただけ)と、 定数 xˉ\bar{x} を nn 回足すと nxˉn\bar{x} になることを使いました。

図 4 の左は、このあと電卓の例でも使うデータ 4, 7, 8, 10, 114,\ 7,\ 8,\ 10,\ 11(平均 88)の偏差を棒で描いたものです。 平均より下の棒の長さの合計と、上の棒の長さの合計が、どちらも 55 でちょうど釣り合っています。

偏差(平均からの棒)04812平均 84781011−4−1+2+3データ−5+5和 0偏差の2乗(正方形の面積)161049合計 16 + 1 + 0 + 4 + 9 = 30平均 30 ÷ 5 = 6 → 分散 s² = 6面積 6 の正方形の1辺√6 ≈ 2.45 → 標準偏差 s
図 4データ 4, 7, 8, 10, 11(平均 8)の偏差を棒で、偏差の2乗を正方形で描いた。左の負の棒(合計 −5)と正の棒(合計 +5)がちょうど打ち消し合い、右の正方形の面積の平均 6 が分散、その1辺 √6 が標準偏差になることに注目。

偏差を2乗する

符号を消す方法は、絶対値をとるか2乗するかです。 統計では主に2乗を使います。

s2=1n∑i=1n(xi−xˉ)2,s=s2s^2 = \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2, \qquad s = \sqrt{s^2}
分散と標準偏差

s2s^2 を分散、その正の平方根 ss を標準偏差と呼びます。 図 4 の右のように偏差の2乗を正方形の面積と見ると、分散は正方形の面積の平均で、 標準偏差はその平均の面積をもつ正方形の1辺の長さです。

先の例で確かめます。A は偏差が −1,0,1-1, 0, 1 なので s2=(1+0+1)/3=2/3s^2 = (1 + 0 + 1)/3 = 2/3、 B は偏差が −50,0,50-50, 0, 50 なので s2=(2500+0+2500)/3=5000/3s^2 = (2500 + 0 + 2500)/3 = 5000/3。 B の散らばりが大きいことが数値に出ました。

絶対値ではなく2乗を使う理由は、2乗のほうが計算で扱いやすいからです。 展開や微分ができ、このあと示す「電卓用の式」や、後の章の回帰分析・推定の理論がすべて 2乗の性質の上に成り立ちます。 その中でも基本になる性質を1つ導いておきます。

任意の数 aa について、xi−a=(xi−xˉ)+(xˉ−a)x_i - a = (x_i - \bar{x}) + (\bar{x} - a) と分けて2乗し、足し合わせます。

∑i=1n(xi−a)2=∑i=1n(xi−xˉ)2+2(xˉ−a)∑i=1n(xi−xˉ)+n(xˉ−a)2\sum_{i=1}^{n}(x_i - a)^2 = \sum_{i=1}^{n}(x_i - \bar{x})^2 + 2(\bar{x} - a)\sum_{i=1}^{n}(x_i - \bar{x}) + n(\bar{x} - a)^2

真ん中の項は、偏差の和が 00 なので消えます。したがって

∑i=1n(xi−a)2=∑i=1n(xi−xˉ)2+n(xˉ−a)2\sum_{i=1}^{n}(x_i - a)^2 = \sum_{i=1}^{n}(x_i - \bar{x})^2 + n(\bar{x} - a)^2

右辺第2項は 00 以上で、a=xˉa = \bar{x} のときだけ 00 になります。

分散を速く計算する式

定義どおりに分散を計算すると、全データの偏差を1つずつ求める必要があり、 平均が 12.3712.37 のような半端な数だと電卓でも大変です。 そこで、定義式を展開して別の形にします。

1n∑i=1n(xi−xˉ)2=1n∑i=1n(xi2−2xˉ xi+xˉ2)=1n∑i=1nxi2−2xˉ⋅1n∑i=1nxi+xˉ2\frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2 = \frac{1}{n}\sum_{i=1}^{n}\left(x_i^2 - 2\bar{x}\,x_i + \bar{x}^2\right) = \frac{1}{n}\sum_{i=1}^{n}x_i^2 - 2\bar{x}\cdot\frac{1}{n}\sum_{i=1}^{n}x_i + \bar{x}^2

真ん中の 1n∑xi\frac{1}{n}\sum x_i は xˉ\bar{x} そのものなので、

=x2‾−2xˉ2+xˉ2=x2‾−xˉ2= \overline{x^2} - 2\bar{x}^2 + \bar{x}^2 = \overline{x^2} - \bar{x}^2

ここで x2‾=1n∑xi2\overline{x^2} = \frac{1}{n}\sum x_i^2 は「2乗の平均」です。

s2=x2‾−xˉ2=1n∑i=1nxi2−(1n∑i=1nxi)2s^2 = \overline{x^2} - \bar{x}^2 = \frac{1}{n}\sum_{i=1}^{n}x_i^2 - \left(\frac{1}{n}\sum_{i=1}^{n}x_i\right)^2
分散の計算式

「2乗の平均 − 平均の2乗」です。 データを1回なめて ∑xi\sum x_i と ∑xi2\sum x_i^2 の2つを集めるだけで分散が出ます。 試験で「∑xi=⋯\sum x_i = \cdots、∑xi2=⋯\sum x_i^2 = \cdots」と合計だけが与えられる問題は、この式を使う前提です。

n で割るか、n − 1 で割るか

ここまで分散は nn で割りました。ところが統計では、n−1n-1 で割った量もよく使います。 統計検定2級では両者を区別します。

s2=1n∑i=1n(xi−xˉ)2(標本分散),u2=1n−1∑i=1n(xi−xˉ)2(不偏分散)s^2 = \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2 \quad(\text{標本分散}), \qquad u^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2 \quad(\text{不偏分散})
標本分散と不偏分散

目の前のデータそのものの散らばりを記述するなら nn で割ります。 一方、手元のデータを大きな集団(母集団)から取り出した一部(標本)とみなし、 母集団の散らばりを推し量るときは n−1n-1 で割ります。

なぜ n−1n-1 なのか、直観は先ほど導いた式にあります。 本当に知りたいのは母集団の平均 μ\mu からの2乗距離ですが、μ\mu は分からないので、 代わりに標本の平均 xˉ\bar{x} を使います。ところが

∑i=1n(xi−μ)2=∑i=1n(xi−xˉ)2+n(xˉ−μ)2\sum_{i=1}^{n}(x_i - \mu)^2 = \sum_{i=1}^{n}(x_i - \bar{x})^2 + n(\bar{x} - \mu)^2

なので、xˉ\bar{x} からの2乗距離は μ\mu からの2乗距離より必ず小さいか等しい。 xˉ\bar{x} は、そのデータにとって2乗距離が最小になる点だからです。 nn で割ったままでは、母集団の分散を系統的に小さく見積もってしまう。 分母を n−1n-1 に減らすのは、この目減りを補正するためです。

n−1n-1 という数そのものは「偏差の和が 00」から見えます。 偏差 nn 個のうち n−1n-1 個が決まれば、残り1個は和が 00 になるように自動的に決まります。 自由に動ける偏差は n−1n-1 個しかない。これを自由度と呼びます。

ちょうど n−1n-1 で割れば目減りが過不足なく補正されることの証明は、 確率変数の期待値を使うので、推定を扱う後の章で行います。

変動係数:規模の違うものの散らばりを比べる

ゾウの体重の標準偏差が 300 kg300\unit{kg}、ネズミの体重の標準偏差が 5 g5\unit{g} だったとします。 数値だけ見ればゾウのほうが散らばっていますが、そもそも体重の規模が違うので、この比較には意味がありません。

そこで標準偏差を平均で割り、平均に対して何割くらい散らばっているかを表します。

CV=sxˉCV = \frac{s}{\bar{x}}
変動係数

分子と分母が同じ単位なので、変動係数は単位のない数になります。 だから、単位や規模の違うデータどうしでも比べられます。 ただし、平均が正の値をとるデータ(重さ・金額・時間など)でしか意味を持ちません。 気温(℃)のように 00 の位置が人為的に決められた量では、平均が 00 付近になると値が暴れます。

標準化:z スコア

テスト A で 7878 点、テスト B で 6666 点をとったとき、どちらの成績が「よい」と言えるでしょうか。 点数だけでは比べられません。平均も散らばりもテストごとに違うからです。

そこで、各値から平均を引き、標準偏差で割ります。

zi=xi−xˉsz_i = \frac{x_i - \bar{x}}{s}
標準化(z スコア)

ziz_i は「平均から標準偏差何個ぶん離れているか」を表します。 z=2z = 2 なら平均より標準偏差2個ぶん上、z=−0.5z = -0.5 なら半個ぶん下です。

標準化したデータは、平均が 00、標準偏差が 11 になります。 平均が 00 になるのは、分子が偏差で、偏差の和が 00 だからです。 標準偏差が 11 になるのは、全データを ss で割ると散らばりもちょうど 1/s1/s 倍になるからです。

冒頭のテストの問いに戻ります。例えばテスト A が平均 7070・標準偏差 88、テスト B が平均 5454・標準偏差 66 だったとすると、 z スコアは A が (78−70)/8=1(78 - 70)/8 = 1、B が (66−54)/6=2(66 - 54)/6 = 2 です。 図 5 のように、点数の低い B のほうが、集団の中では上位にいることになります。

A:平均 70・標準偏差 8  B:平均 54・標準偏差 6(例)テスト A(点)46546270788694テスト B(点)36424854606672z スコア−3−2−10123偏差値2030405060708078点66点
図 5z スコアは「平均から標準偏差何個ぶんか」の共通の物差し。テスト A が平均 70・標準偏差 8、B が平均 54・標準偏差 6 だったとすると、A の 78 点は z = 1(偏差値 60)、B の 66 点は z = 2(偏差値 70)で、点数の低い B のほうが集団の中では上位にあることに注目。

標準化は、後の章で正規分布の確率を標準正規分布表から読むときに中心的な役割を果たします。

章末問題

問 1基本代表値と散らばり

次の5個のデータについて、以下を求めよ。

3,5,6,8,133,\quad 5,\quad 6,\quad 8,\quad 13

(1) 平均値と中央値 (2) 標本分散(nn で割る)と標準偏差(小数第2位まで) (3) 不偏分散(n−1n-1 で割る)

解答を見る

(1) 合計は 3+5+6+8+13=353 + 5 + 6 + 8 + 13 = 35 なので

xˉ=355=7\bar{x} = \frac{35}{5} = 7

小さい順に並んでいるので、中央値は3番目の 66 です。 平均値のほうが大きいのは、1313 が他より離れて大きいためです。

(2) 偏差は −4,−2,−1,1,6-4, -2, -1, 1, 6。和が 00 になることを確かめておきます(−7+7=0-7 + 7 = 0)。 偏差の2乗の和は

16+4+1+1+36=5816 + 4 + 1 + 1 + 36 = 58s2=585=11.6,s=11.6≈3.41s^2 = \frac{58}{5} = 11.6, \qquad s = \sqrt{11.6} \approx 3.41

計算式でも検算します。2乗の和は 9+25+36+64+169=3039 + 25 + 36 + 64 + 169 = 303 なので

s2=3035−72=60.6−49=11.6s^2 = \frac{303}{5} - 7^2 = 60.6 - 49 = 11.6

一致しました。

(3) 偏差の2乗の和 5858 を n−1=4n - 1 = 4 で割ります。

u2=584=14.5u^2 = \frac{58}{4} = 14.5

答: (1) 平均値 77、中央値 66 (2) 標本分散 11.611.6、標準偏差 3.413.41 (3) 不偏分散 14.514.5

問 2標準合計からの分散・変動係数・z スコア

店舗 A の10日間の来客数 x1,…,x10x_1, \ldots, x_{10}(人)について

∑i=110xi=1200,∑i=110xi2=146000\sum_{i=1}^{10} x_i = 1200, \qquad \sum_{i=1}^{10} x_i^2 = 146000

であった。

(1) 平均と標本分散、標準偏差(小数第1位まで)を求めよ。 (2) 店舗 B の来客数は平均 4040 人、標準偏差 88 人である。変動係数を比べ、相対的に来客数のばらつきが大きいのはどちらか答えよ。 (3) 店舗 A で来客数が 150150 人だった日の z スコアを小数第2位まで求めよ。

解答を見る

(1) 平均と2乗の平均は

xˉ=120010=120,x2‾=14600010=14600\bar{x} = \frac{1200}{10} = 120, \qquad \overline{x^2} = \frac{146000}{10} = 14600

計算式「2乗の平均 − 平均の2乗」より

s2=14600−1202=14600−14400=200s^2 = 14600 - 120^2 = 14600 - 14400 = 200s=200=102≈14.1 人s = \sqrt{200} = 10\sqrt{2} \approx 14.1\ \text{人}

(2) それぞれの変動係数は

CVA=14.14120≈0.118,CVB=840=0.20CV_A = \frac{14.14}{120} \approx 0.118, \qquad CV_B = \frac{8}{40} = 0.20

標準偏差そのものは A(約 14.114.1 人)のほうが大きいのに、 平均に対する割合では B(20%20\%)のほうが A(約 11.8%11.8\%)より大きい。 相対的なばらつきが大きいのは店舗 B です。

(3)

z=150−12014.14≈2.12z = \frac{150 - 120}{14.14} \approx 2.12

この日は平均より標準偏差約 2.12.1 個ぶん多かった、と読めます。

答: (1) 平均 120120 人、標本分散 200200、標準偏差 約 14.114.1 人 (2) 店舗 B (3) z≈2.12z \approx 2.12

問 3発展2つのグループを合わせた分散

グループ P(4人)とグループ Q(6人)の得点について、次のことが分かっている。 分散はいずれも nn で割った標本分散である。

人数平均分散
P44101044
Q66151599

2つのグループを合わせた10人の平均と分散を求めよ。 また、合わせた分散が P と Q の分散のどちらよりも大きくなる理由を説明せよ。

解答を見る

平均: 合計点は P が 4×10=404 \times 10 = 40、Q が 6×15=906 \times 15 = 90 なので

xˉ=40+9010=13\bar{x} = \frac{40 + 90}{10} = 13

分散: 各グループの「2乗の和」を復元し、全体で計算式を使います。 計算式 s2=x2‾−xˉ2s^2 = \overline{x^2} - \bar{x}^2 を x2‾=s2+xˉ2\overline{x^2} = s^2 + \bar{x}^2 と読み替えると

P: x2‾=4+102=104  ⇒  ∑x2=4×104=416\text{P}:\ \overline{x^2} = 4 + 10^2 = 104 \;\Rightarrow\; \sum x^2 = 4 \times 104 = 416Q: x2‾=9+152=234  ⇒  ∑x2=6×234=1404\text{Q}:\ \overline{x^2} = 9 + 15^2 = 234 \;\Rightarrow\; \sum x^2 = 6 \times 234 = 1404

全体の2乗の平均は

x2‾=416+140410=182010=182\overline{x^2} = \frac{416 + 1404}{10} = \frac{1820}{10} = 182s2=182−132=182−169=13s^2 = 182 - 13^2 = 182 - 169 = 13

理由: 全体の分散は、次の2つの和に分解できます。

4×4+6×910⏟グループ内の散らばり+4×(10−13)2+6×(15−13)210⏟グループ平均どうしの散らばり=7010+6010=7+6=13\underbrace{\frac{4 \times 4 + 6 \times 9}{10}}_{\text{グループ内の散らばり}} + \underbrace{\frac{4 \times (10 - 13)^2 + 6 \times (15 - 13)^2}{10}}_{\text{グループ平均どうしの散らばり}} = \frac{70}{10} + \frac{60}{10} = 7 + 6 = 13

(各グループで本文の式 ∑(xi−a)2=∑(xi−xˉ)2+n(xˉ−a)2\sum(x_i - a)^2 = \sum(x_i - \bar{x})^2 + n(\bar{x} - a)^2 を a=13a = 13 として使い、足し合わせたものです。)

グループの平均が 1010 と 1515 で離れているため、グループ内の散らばりに 「平均どうしのずれ」による散らばり 66 が上乗せされます。 そのため、どちらのグループ単独の分散よりも大きくなります。

答: 平均 1313、分散 1313。

次に読むなら