データが何十個、何百個と並んでいても、そのままでは特徴がつかめません。
そこで、データを少数の数値に要約 します。
要約には大きく2種類あります。
データの中心 がどこにあるかを表す代表値 と、
中心のまわりにどれだけ散らばっているか を表す散らばりの指標 です。
統計検定2級のほぼすべての分野は、この2つの考え方の上に組み立てられています。
代表値:平均値・中央値・最頻値
n n n 個のデータ x 1 , x 2 , … , x n x_1, x_2, \ldots, x_n x 1 , x 2 , … , x n があるとします。
平均値
中央値(メジアン) … データを小さい順に並べたとき、ちょうど真ん中にくる値。
n n n が偶数なら、真ん中の2つの平均をとる
最頻値(モード) … 最も多く現れる値。度数分布表では、度数が最大の階級の階級値
平均値は「全員の値を合計して均等に分け直したら1人あたりいくつか」という量です。
中央値は「上から数えても下から数えても半分の位置」、
最頻値は「いちばんよくある値」です。3つは測っているものが違います。
平均値と中央値がずれるとき
5人の年収(万円)が次のとおりだったとします。
300 , 350 , 400 , 450 , 3000 300,\quad 350,\quad 400,\quad 450,\quad 3000 300 , 350 , 400 , 450 , 3000
x ˉ = 300 + 350 + 400 + 450 + 3000 5 = 4500 5 = 900 \bar{x} = \frac{300 + 350 + 400 + 450 + 3000}{5} = \frac{4500}{5} = 900 x ˉ = 5 300 + 350 + 400 + 450 + 3000 = 5 4500 = 900
中央値は3番目の 400 400 400 です。
平均値 900 900 900 は、図 1 のように5人のうち4人の年収を上回っています。
1人の極端に大きな値(外れ値 )が合計を押し上げたからです。
一方、中央値は「真ん中が何か」しか見ないので、最大値が 3000 3000 3000 でも 30000 30000 30000 でも 400 400 400 のままです。
0 1000 2000 3000 外れ値 300 350 400 450 3000 5人の年収(万円) 平均値 900 中央値 400 平均値 900 を上回るのは5人中1人だけ
図 1 5人の年収を棒の高さで表した。たった1人の 3000 万円が平均値を 900 まで押し上げ、4人が平均値より下にいることに注目。中央値 400 は真ん中の人の値のまま動かない。
◆ 平均値は外れ値に引っぱられ、中央値は引っぱられない ポイント
平均値はすべての値の大きさ を使うので、極端な値の影響をそのまま受けます。
中央値は順番 だけを使うので、端の値がいくら大きくなっても動きません。
この性質を頑健性 (ロバスト性)と呼びます。
年収や貯蓄額のように、大多数が低めの値に集まり、ごく一部が非常に大きい値をとる分布
(右に裾の長い分布 )では、
最頻値 < 中央値 < 平均値 \text{最頻値} < \text{中央値} < \text{平均値} 最頻値 < 中央値 < 平均値 の順に並ぶことが多くなります(図 2)。
「平均貯蓄額」が多くの人の実感より高く聞こえるのはこのためです。
典型的な人の姿を知りたいなら中央値、総額を人数で割った量が必要なら平均値、と
目的で選ぶ のが正しい使い分けです。
0 500 1000 値 最頻値 250 中央値 400 平均値 464 最頻値 < 中央値 < 平均値 右に長い裾が平均値を引っぱる
図 2 右に裾の長い分布の例(架空の100人、階級幅100)。山の頂上が最頻値 250、50人目と51人目の境が中央値 400、階級値で計算した平均値は 464。裾の長い右側ほど平均値が遠くへ引っぱられていることに注目。
! 「平均値=ふつうの人の値」ではない つまずきやすい点
「平均年収が 900 900 900 万円なら、だいたいの人は 900 900 900 万円前後もらっている」と読むのは誤りです。
上の例のとおり、平均値より下に大多数がいることは珍しくありません。
平均値が「真ん中」や「典型」を表すのは、分布が左右対称で山が1つ のときに限ります。
その場合は平均値・中央値・最頻値がほぼ一致します。
3つが大きくずれていたら、それ自体が「分布が歪んでいる」という情報です。
散らばり:偏差・分散・標準偏差
平均値が同じでも、散らばり方がまったく違うデータはいくらでもあります。
A : 49 , 50 , 51 B : 0 , 50 , 100 \text{A}:\ 49,\ 50,\ 51 \qquad\qquad \text{B}:\ 0,\ 50,\ 100 A : 49 , 50 , 51 B : 0 , 50 , 100
どちらも平均は 50 50 50 ですが、図 3 のように B のほうがはるかに散らばっています。
これを1つの数値で表したい。
平均 50 0 50 100 A 標準偏差 ≈ 0.82 0 50 100 B 標準偏差 ≈ 40.8
図 3 A と B はどちらも平均 50。薄い帯は「平均 ± 標準偏差」の範囲で、A では点とほぼ重なるほど狭く、B では端から端まで広がることに注目。
偏差の和は必ず 0
各データが平均からどれだけ離れているかを偏差 と呼びます。
x i − x ˉ x_i - \bar{x} x i − x ˉ
素朴に考えると「偏差の平均」で散らばりを測れそうですが、これはうまくいきません。
偏差の和は、どんなデータでも必ず 0 になる からです。
∑ i = 1 n ( x i − x ˉ ) = ∑ i = 1 n x i − ∑ i = 1 n x ˉ = n x ˉ − n x ˉ = 0 \sum_{i=1}^{n}(x_i - \bar{x})
= \sum_{i=1}^{n} x_i - \sum_{i=1}^{n}\bar{x}
= n\bar{x} - n\bar{x} = 0 i = 1 ∑ n ( x i − x ˉ ) = i = 1 ∑ n x i − i = 1 ∑ n x ˉ = n x ˉ − n x ˉ = 0
1行目から2行目では、∑ x i = n x ˉ \sum x_i = n\bar{x} ∑ x i = n x ˉ (平均の定義を n n n 倍しただけ)と、
定数 x ˉ \bar{x} x ˉ を n n n 回足すと n x ˉ n\bar{x} n x ˉ になることを使いました。
図 4 の左は、このあと電卓の例でも使うデータ 4 , 7 , 8 , 10 , 11 4,\ 7,\ 8,\ 10,\ 11 4 , 7 , 8 , 10 , 11 (平均 8 8 8 )の偏差を棒で描いたものです。
平均より下の棒の長さの合計と、上の棒の長さの合計が、どちらも 5 5 5 でちょうど釣り合っています。
偏差(平均からの棒) 0 4 8 12 平均 8 4 7 8 10 11 −4 −1 +2 +3 データ −5 +5 和 0 偏差の2乗(正方形の面積) 16 1 0 4 9 合計 16 + 1 + 0 + 4 + 9 = 30 平均 30 ÷ 5 = 6 → 分散 s² = 6 面積 6 の正方形の1辺 √6 ≈ 2.45 → 標準偏差 s
図 4 データ 4, 7, 8, 10, 11(平均 8)の偏差を棒で、偏差の2乗を正方形で描いた。左の負の棒(合計 −5)と正の棒(合計 +5)がちょうど打ち消し合い、右の正方形の面積の平均 6 が分散、その1辺 √6 が標準偏差になることに注目。
偏差を2乗する
符号を消す方法は、絶対値をとるか2乗するかです。
統計では主に2乗 を使います。
分散と標準偏差
s 2 s^2 s 2 を分散 、その正の平方根 s s s を標準偏差 と呼びます。
図 4 の右のように偏差の2乗を正方形の面積と見ると、分散は正方形の面積の平均で、
標準偏差はその平均の面積をもつ正方形の1辺の長さです。
先の例で確かめます。A は偏差が − 1 , 0 , 1 -1, 0, 1 − 1 , 0 , 1 なので s 2 = ( 1 + 0 + 1 ) / 3 = 2 / 3 s^2 = (1 + 0 + 1)/3 = 2/3 s 2 = ( 1 + 0 + 1 ) /3 = 2/3 、
B は偏差が − 50 , 0 , 50 -50, 0, 50 − 50 , 0 , 50 なので s 2 = ( 2500 + 0 + 2500 ) / 3 = 5000 / 3 s^2 = (2500 + 0 + 2500)/3 = 5000/3 s 2 = ( 2500 + 0 + 2500 ) /3 = 5000/3 。
B の散らばりが大きいことが数値に出ました。
絶対値ではなく2乗を使う理由は、2乗のほうが計算で扱いやすい からです。
展開や微分ができ、このあと示す「電卓用の式」や、後の章の回帰分析・推定の理論がすべて
2乗の性質の上に成り立ちます。
その中でも基本になる性質を1つ導いておきます。
任意の数 a a a について、x i − a = ( x i − x ˉ ) + ( x ˉ − a ) x_i - a = (x_i - \bar{x}) + (\bar{x} - a) x i − a = ( x i − x ˉ ) + ( x ˉ − a ) と分けて2乗し、足し合わせます。
∑ i = 1 n ( x i − a ) 2 = ∑ i = 1 n ( x i − x ˉ ) 2 + 2 ( x ˉ − a ) ∑ i = 1 n ( x i − x ˉ ) + n ( x ˉ − a ) 2 \sum_{i=1}^{n}(x_i - a)^2
= \sum_{i=1}^{n}(x_i - \bar{x})^2
+ 2(\bar{x} - a)\sum_{i=1}^{n}(x_i - \bar{x})
+ n(\bar{x} - a)^2 i = 1 ∑ n ( x i − a ) 2 = i = 1 ∑ n ( x i − x ˉ ) 2 + 2 ( x ˉ − a ) i = 1 ∑ n ( x i − x ˉ ) + n ( x ˉ − a ) 2
真ん中の項は、偏差の和が 0 0 0 なので消えます。したがって
∑ i = 1 n ( x i − a ) 2 = ∑ i = 1 n ( x i − x ˉ ) 2 + n ( x ˉ − a ) 2 \sum_{i=1}^{n}(x_i - a)^2
= \sum_{i=1}^{n}(x_i - \bar{x})^2 + n(\bar{x} - a)^2 i = 1 ∑ n ( x i − a ) 2 = i = 1 ∑ n ( x i − x ˉ ) 2 + n ( x ˉ − a ) 2
右辺第2項は 0 0 0 以上で、a = x ˉ a = \bar{x} a = x ˉ のときだけ 0 0 0 になります。
! 分散の単位は元の単位の2乗 つまずきやすい点
データが c m \mathrm{cm} cm なら、分散の単位は c m 2 \mathrm{cm^2} c m 2 です。
身長の分散が 36 36 36 だからといって「平均から 36 c m 36\unit{cm} 36 cm くらい散らばっている」とは読めません。
元の単位に戻すために平方根をとったのが標準偏差で、この例なら s = 6 c m s = 6\unit{cm} s = 6 cm です。
散らばりの大きさを言葉で述べるときは標準偏差 を使ってください。
分散は計算の途中で使う量、と考えると混乱しません。
分散を速く計算する式
定義どおりに分散を計算すると、全データの偏差を1つずつ求める必要があり、
平均が 12.37 12.37 12.37 のような半端な数だと電卓でも大変です。
そこで、定義式を展開して別の形にします。
1 n ∑ i = 1 n ( x i − x ˉ ) 2 = 1 n ∑ i = 1 n ( x i 2 − 2 x ˉ x i + x ˉ 2 ) = 1 n ∑ i = 1 n x i 2 − 2 x ˉ ⋅ 1 n ∑ i = 1 n x i + x ˉ 2 \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2
= \frac{1}{n}\sum_{i=1}^{n}\left(x_i^2 - 2\bar{x}\,x_i + \bar{x}^2\right)
= \frac{1}{n}\sum_{i=1}^{n}x_i^2 - 2\bar{x}\cdot\frac{1}{n}\sum_{i=1}^{n}x_i + \bar{x}^2 n 1 i = 1 ∑ n ( x i − x ˉ ) 2 = n 1 i = 1 ∑ n ( x i 2 − 2 x ˉ x i + x ˉ 2 ) = n 1 i = 1 ∑ n x i 2 − 2 x ˉ ⋅ n 1 i = 1 ∑ n x i + x ˉ 2
真ん中の 1 n ∑ x i \frac{1}{n}\sum x_i n 1 ∑ x i は x ˉ \bar{x} x ˉ そのものなので、
= x 2 ‾ − 2 x ˉ 2 + x ˉ 2 = x 2 ‾ − x ˉ 2 = \overline{x^2} - 2\bar{x}^2 + \bar{x}^2 = \overline{x^2} - \bar{x}^2 = x 2 − 2 x ˉ 2 + x ˉ 2 = x 2 − x ˉ 2
ここで x 2 ‾ = 1 n ∑ x i 2 \overline{x^2} = \frac{1}{n}\sum x_i^2 x 2 = n 1 ∑ x i 2 は「2乗の平均」です。
分散の計算式
「2乗の平均 − 平均の2乗」です。
データを1回なめて ∑ x i \sum x_i ∑ x i と ∑ x i 2 \sum x_i^2 ∑ x i 2 の2つを集めるだけで分散が出ます。
試験で「∑ x i = ⋯ \sum x_i = \cdots ∑ x i = ⋯ 、∑ x i 2 = ⋯ \sum x_i^2 = \cdots ∑ x i 2 = ⋯ 」と合計だけが与えられる問題は、この式を使う前提です。
▶ 電卓で分散と標準偏差を求める 例題
データ 4 , 7 , 8 , 10 , 11 4,\ 7,\ 8,\ 10,\ 11 4 , 7 , 8 , 10 , 11 の分散と標準偏差を求めます(図 4 と同じデータです)。
定義から : 平均は x ˉ = 40 / 5 = 8 \bar{x} = 40/5 = 8 x ˉ = 40/5 = 8 。偏差は − 4 , − 1 , 0 , 2 , 3 -4, -1, 0, 2, 3 − 4 , − 1 , 0 , 2 , 3 (和が 0 0 0 になることを確認)。
s 2 = 16 + 1 + 0 + 4 + 9 5 = 30 5 = 6 s^2 = \frac{16 + 1 + 0 + 4 + 9}{5} = \frac{30}{5} = 6 s 2 = 5 16 + 1 + 0 + 4 + 9 = 5 30 = 6 計算式から : 2乗の和は 16 + 49 + 64 + 100 + 121 = 350 16 + 49 + 64 + 100 + 121 = 350 16 + 49 + 64 + 100 + 121 = 350 。
s 2 = 350 5 − 8 2 = 70 − 64 = 6 s^2 = \frac{350}{5} - 8^2 = 70 - 64 = 6 s 2 = 5 350 − 8 2 = 70 − 64 = 6 どちらも 6 6 6 で一致します。標準偏差は s = 6 ≈ 2.449 s = \sqrt{6} \approx 2.449 s = 6 ≈ 2.449 。
電卓では 4 × 4 M+、7 × 7 M+、… と2乗をメモリーに足していき、
最後に MR ÷ 5 − 64 = とすれば、偏差を書き出さずに済みます。
◆ 大きな数は、先に定数を引いてから ポイント
データに同じ数を足しても引いても、分散は変わりません(全体が平行移動するだけで、散らばり方は同じ)。
1003 , 1007 , 1008 , 1010 , 1011 1003, 1007, 1008, 1010, 1011 1003 , 1007 , 1008 , 1010 , 1011 の分散は、1000 1000 1000 を引いた 3 , 7 , 8 , 10 , 11 3, 7, 8, 10, 11 3 , 7 , 8 , 10 , 11 の分散と等しくなります。
大きな数のまま計算式を使うと、ほぼ等しい2つの大きな数の引き算になり、桁落ちや入力ミスの原因になります。
キリのよい数を引いてから計算する のが、電卓での安全な手順です。
電卓を叩く前に答えの桁を見積もっておく習慣は「概数と暗算の技術」の章で扱っています。
n で割るか、n − 1 で割るか
ここまで分散は n n n で割りました。ところが統計では、n − 1 n-1 n − 1 で割った量もよく使います。
統計検定2級では両者を区別します。
標本分散と不偏分散
目の前のデータそのものの散らばりを記述する なら n n n で割ります。
一方、手元のデータを大きな集団(母集団 )から取り出した一部(標本 )とみなし、
母集団の散らばりを推し量る ときは n − 1 n-1 n − 1 で割ります。
なぜ n − 1 n-1 n − 1 なのか、直観は先ほど導いた式にあります。
本当に知りたいのは母集団の平均 μ \mu μ からの2乗距離ですが、μ \mu μ は分からないので、
代わりに標本の平均 x ˉ \bar{x} x ˉ を使います。ところが
∑ i = 1 n ( x i − μ ) 2 = ∑ i = 1 n ( x i − x ˉ ) 2 + n ( x ˉ − μ ) 2 \sum_{i=1}^{n}(x_i - \mu)^2 = \sum_{i=1}^{n}(x_i - \bar{x})^2 + n(\bar{x} - \mu)^2 i = 1 ∑ n ( x i − μ ) 2 = i = 1 ∑ n ( x i − x ˉ ) 2 + n ( x ˉ − μ ) 2
なので、x ˉ \bar{x} x ˉ からの2乗距離は μ \mu μ からの2乗距離より必ず小さいか等しい 。
x ˉ \bar{x} x ˉ は、そのデータにとって2乗距離が最小になる点だからです。
n n n で割ったままでは、母集団の分散を系統的に小さく見積もってしまう 。
分母を n − 1 n-1 n − 1 に減らすのは、この目減りを補正するためです。
n − 1 n-1 n − 1 という数そのものは「偏差の和が 0 0 0 」から見えます。
偏差 n n n 個のうち n − 1 n-1 n − 1 個が決まれば、残り1個は和が 0 0 0 になるように自動的に決まります。
自由に動ける偏差は n − 1 n-1 n − 1 個しかない。これを自由度 と呼びます。
ちょうど n − 1 n-1 n − 1 で割れば目減りが過不足なく補正されることの証明は、
確率変数の期待値を使うので、推定を扱う後の章で行います。
! どちらで割るかは問題文で決まる つまずきやすい点
「分散」と書いてあっても、教科書やソフトによって n n n で割るものと n − 1 n-1 n − 1 で割るものがあります。
統計検定では、問題文や選択肢で「標本分散」「不偏分散」「n n n で割った」などと指定されることが多いので、
必ず問題文の指示を確認してから計算してください。
関数電卓の統計モードには、σ n \sigma_n σ n (または σ x \sigma x σ x )と σ n − 1 \sigma_{n-1} σ n − 1 (または s x sx s x )の2つのキーがあります。
前者が n n n で割った標準偏差、後者が n − 1 n-1 n − 1 で割った標準偏差です。
また計算式 x 2 ‾ − x ˉ 2 \overline{x^2} - \bar{x}^2 x 2 − x ˉ 2 で出るのは標本分散 なので、不偏分散が必要なら
n n − 1 \dfrac{n}{n-1} n − 1 n 倍してください。
変動係数:規模の違うものの散らばりを比べる
ゾウの体重の標準偏差が 300 k g 300\unit{kg} 300 kg 、ネズミの体重の標準偏差が 5 g 5\unit{g} 5 g だったとします。
数値だけ見ればゾウのほうが散らばっていますが、そもそも体重の規模が違うので、この比較には意味がありません。
そこで標準偏差を平均で割り、平均に対して何割くらい散らばっているか を表します。
変動係数
分子と分母が同じ単位なので、変動係数は単位のない数 になります。
だから、単位や規模の違うデータどうしでも比べられます。
ただし、平均が正の値をとるデータ(重さ・金額・時間など)でしか意味を持ちません。
気温(℃)のように 0 0 0 の位置が人為的に決められた量では、平均が 0 0 0 付近になると値が暴れます。
標準化:z スコア
テスト A で 78 78 78 点、テスト B で 66 66 66 点をとったとき、どちらの成績が「よい」と言えるでしょうか。
点数だけでは比べられません。平均も散らばりもテストごとに違うからです。
そこで、各値から平均を引き、標準偏差で割ります。
標準化(z スコア)
z i z_i z i は「平均から標準偏差何個ぶん離れているか」を表します。
z = 2 z = 2 z = 2 なら平均より標準偏差2個ぶん上、z = − 0.5 z = -0.5 z = − 0.5 なら半個ぶん下です。
標準化したデータは、平均が 0 0 0 、標準偏差が 1 1 1 になります。
平均が 0 0 0 になるのは、分子が偏差で、偏差の和が 0 0 0 だからです。
標準偏差が 1 1 1 になるのは、全データを s s s で割ると散らばりもちょうど 1 / s 1/s 1/ s 倍になるからです。
◆ データを1次変換したときの平均と分散 ポイント
データ全体を y i = a x i + b y_i = a x_i + b y i = a x i + b と変換すると、
y ˉ = a x ˉ + b , s y 2 = a 2 s x 2 , s y = ∣ a ∣ s x \bar{y} = a\bar{x} + b, \qquad s_y^2 = a^2 s_x^2, \qquad s_y = |a|\, s_x y ˉ = a x ˉ + b , s y 2 = a 2 s x 2 , s y = ∣ a ∣ s x 足した定数 b b b は散らばりに効かず、掛けた定数 a a a は分散に2乗で効きます。
偏差 y i − y ˉ = a ( x i − x ˉ ) y_i - \bar{y} = a(x_i - \bar{x}) y i − y ˉ = a ( x i − x ˉ ) から b b b が消えることを確かめれば導けます。
標準化は a = 1 / s a = 1/s a = 1/ s 、b = − x ˉ / s b = -\bar{x}/s b = − x ˉ / s とした特別な場合です。
偏差値は 50 + 10 z 50 + 10z 50 + 10 z という1次変換で、平均 50 50 50 、標準偏差 10 10 10 にそろえたものです。
冒頭のテストの問いに戻ります。例えばテスト A が平均 70 70 70 ・標準偏差 8 8 8 、テスト B が平均 54 54 54 ・標準偏差 6 6 6 だったとすると、
z スコアは A が ( 78 − 70 ) / 8 = 1 (78 - 70)/8 = 1 ( 78 − 70 ) /8 = 1 、B が ( 66 − 54 ) / 6 = 2 (66 - 54)/6 = 2 ( 66 − 54 ) /6 = 2 です。
図 5 のように、点数の低い B のほうが、集団の中では上位にいることになります。
A:平均 70・標準偏差 8 B:平均 54・標準偏差 6(例) テスト A(点) 46 54 62 70 78 86 94 テスト B(点) 36 42 48 54 60 66 72 z スコア −3 −2 −1 0 1 2 3 偏差値 20 30 40 50 60 70 80 78点 66点
図 5 z スコアは「平均から標準偏差何個ぶんか」の共通の物差し。テスト A が平均 70・標準偏差 8、B が平均 54・標準偏差 6 だったとすると、A の 78 点は z = 1(偏差値 60)、B の 66 点は z = 2(偏差値 70)で、点数の低い B のほうが集団の中では上位にあることに注目。
標準化は、後の章で正規分布の確率を標準正規分布表から読むときに中心的な役割を果たします。
章末問題
問 1 基本 代表値と散らばり
次の5個のデータについて、以下を求めよ。
3 , 5 , 6 , 8 , 13 3,\quad 5,\quad 6,\quad 8,\quad 13 3 , 5 , 6 , 8 , 13 (1) 平均値と中央値
(2) 標本分散(n n n で割る)と標準偏差(小数第2位まで)
(3) 不偏分散(n − 1 n-1 n − 1 で割る)
解答を見る (1) 合計は 3 + 5 + 6 + 8 + 13 = 35 3 + 5 + 6 + 8 + 13 = 35 3 + 5 + 6 + 8 + 13 = 35 なので
x ˉ = 35 5 = 7 \bar{x} = \frac{35}{5} = 7 x ˉ = 5 35 = 7 小さい順に並んでいるので、中央値は3番目の 6 6 6 です。
平均値のほうが大きいのは、13 13 13 が他より離れて大きいためです。
(2) 偏差は − 4 , − 2 , − 1 , 1 , 6 -4, -2, -1, 1, 6 − 4 , − 2 , − 1 , 1 , 6 。和が 0 0 0 になることを確かめておきます(− 7 + 7 = 0 -7 + 7 = 0 − 7 + 7 = 0 )。
偏差の2乗の和は
16 + 4 + 1 + 1 + 36 = 58 16 + 4 + 1 + 1 + 36 = 58 16 + 4 + 1 + 1 + 36 = 58 s 2 = 58 5 = 11.6 , s = 11.6 ≈ 3.41 s^2 = \frac{58}{5} = 11.6, \qquad s = \sqrt{11.6} \approx 3.41 s 2 = 5 58 = 11.6 , s = 11.6 ≈ 3.41 計算式でも検算します。2乗の和は 9 + 25 + 36 + 64 + 169 = 303 9 + 25 + 36 + 64 + 169 = 303 9 + 25 + 36 + 64 + 169 = 303 なので
s 2 = 303 5 − 7 2 = 60.6 − 49 = 11.6 s^2 = \frac{303}{5} - 7^2 = 60.6 - 49 = 11.6 s 2 = 5 303 − 7 2 = 60.6 − 49 = 11.6 一致しました。
(3) 偏差の2乗の和 58 58 58 を n − 1 = 4 n - 1 = 4 n − 1 = 4 で割ります。
u 2 = 58 4 = 14.5 u^2 = \frac{58}{4} = 14.5 u 2 = 4 58 = 14.5 答: (1) 平均値 7 7 7 、中央値 6 6 6 (2) 標本分散 11.6 11.6 11.6 、標準偏差 3.41 3.41 3.41 (3) 不偏分散 14.5 14.5 14.5
問 2 標準 合計からの分散・変動係数・z スコア
店舗 A の10日間の来客数 x 1 , … , x 10 x_1, \ldots, x_{10} x 1 , … , x 10 (人)について
∑ i = 1 10 x i = 1200 , ∑ i = 1 10 x i 2 = 146000 \sum_{i=1}^{10} x_i = 1200, \qquad \sum_{i=1}^{10} x_i^2 = 146000 i = 1 ∑ 10 x i = 1200 , i = 1 ∑ 10 x i 2 = 146000 であった。
(1) 平均と標本分散、標準偏差(小数第1位まで)を求めよ。
(2) 店舗 B の来客数は平均 40 40 40 人、標準偏差 8 8 8 人である。変動係数を比べ、相対的に来客数のばらつきが大きいのはどちらか答えよ。
(3) 店舗 A で来客数が 150 150 150 人だった日の z スコアを小数第2位まで求めよ。
解答を見る (1) 平均と2乗の平均は
x ˉ = 1200 10 = 120 , x 2 ‾ = 146000 10 = 14600 \bar{x} = \frac{1200}{10} = 120, \qquad \overline{x^2} = \frac{146000}{10} = 14600 x ˉ = 10 1200 = 120 , x 2 = 10 146000 = 14600 計算式「2乗の平均 − 平均の2乗」より
s 2 = 14600 − 120 2 = 14600 − 14400 = 200 s^2 = 14600 - 120^2 = 14600 - 14400 = 200 s 2 = 14600 − 12 0 2 = 14600 − 14400 = 200 s = 200 = 10 2 ≈ 14.1 人 s = \sqrt{200} = 10\sqrt{2} \approx 14.1\ \text{人} s = 200 = 10 2 ≈ 14.1 人 (2) それぞれの変動係数は
C V A = 14.14 120 ≈ 0.118 , C V B = 8 40 = 0.20 CV_A = \frac{14.14}{120} \approx 0.118, \qquad CV_B = \frac{8}{40} = 0.20 C V A = 120 14.14 ≈ 0.118 , C V B = 40 8 = 0.20 標準偏差そのものは A(約 14.1 14.1 14.1 人)のほうが大きいのに、
平均に対する割合では B(20 % 20\% 20% )のほうが A(約 11.8 % 11.8\% 11.8% )より大きい。
相対的なばらつきが大きいのは店舗 B です。
(3)
z = 150 − 120 14.14 ≈ 2.12 z = \frac{150 - 120}{14.14} \approx 2.12 z = 14.14 150 − 120 ≈ 2.12 この日は平均より標準偏差約 2.1 2.1 2.1 個ぶん多かった、と読めます。
答: (1) 平均 120 120 120 人、標本分散 200 200 200 、標準偏差 約 14.1 14.1 14.1 人 (2) 店舗 B (3) z ≈ 2.12 z \approx 2.12 z ≈ 2.12
問 3 発展 2つのグループを合わせた分散
グループ P(4人)とグループ Q(6人)の得点について、次のことが分かっている。
分散はいずれも n n n で割った標本分散である。
人数 平均 分散 P 4 4 4 10 10 10 4 4 4 Q 6 6 6 15 15 15 9 9 9
2つのグループを合わせた10人の平均と分散を求めよ。
また、合わせた分散が P と Q の分散のどちらよりも大きくなる理由を説明せよ。
解答を見る 平均 : 合計点は P が 4 × 10 = 40 4 \times 10 = 40 4 × 10 = 40 、Q が 6 × 15 = 90 6 \times 15 = 90 6 × 15 = 90 なので
x ˉ = 40 + 90 10 = 13 \bar{x} = \frac{40 + 90}{10} = 13 x ˉ = 10 40 + 90 = 13 分散 : 各グループの「2乗の和」を復元し、全体で計算式を使います。
計算式 s 2 = x 2 ‾ − x ˉ 2 s^2 = \overline{x^2} - \bar{x}^2 s 2 = x 2 − x ˉ 2 を x 2 ‾ = s 2 + x ˉ 2 \overline{x^2} = s^2 + \bar{x}^2 x 2 = s 2 + x ˉ 2 と読み替えると
P : x 2 ‾ = 4 + 10 2 = 104 ⇒ ∑ x 2 = 4 × 104 = 416 \text{P}:\ \overline{x^2} = 4 + 10^2 = 104 \;\Rightarrow\; \sum x^2 = 4 \times 104 = 416 P : x 2 = 4 + 1 0 2 = 104 ⇒ ∑ x 2 = 4 × 104 = 416 Q : x 2 ‾ = 9 + 15 2 = 234 ⇒ ∑ x 2 = 6 × 234 = 1404 \text{Q}:\ \overline{x^2} = 9 + 15^2 = 234 \;\Rightarrow\; \sum x^2 = 6 \times 234 = 1404 Q : x 2 = 9 + 1 5 2 = 234 ⇒ ∑ x 2 = 6 × 234 = 1404 全体の2乗の平均は
x 2 ‾ = 416 + 1404 10 = 1820 10 = 182 \overline{x^2} = \frac{416 + 1404}{10} = \frac{1820}{10} = 182 x 2 = 10 416 + 1404 = 10 1820 = 182 s 2 = 182 − 13 2 = 182 − 169 = 13 s^2 = 182 - 13^2 = 182 - 169 = 13 s 2 = 182 − 1 3 2 = 182 − 169 = 13 理由 : 全体の分散は、次の2つの和に分解できます。
4 × 4 + 6 × 9 10 ⏟ グループ内の散らばり + 4 × ( 10 − 13 ) 2 + 6 × ( 15 − 13 ) 2 10 ⏟ グループ平均どうしの散らばり = 70 10 + 60 10 = 7 + 6 = 13 \underbrace{\frac{4 \times 4 + 6 \times 9}{10}}_{\text{グループ内の散らばり}}
+ \underbrace{\frac{4 \times (10 - 13)^2 + 6 \times (15 - 13)^2}{10}}_{\text{グループ平均どうしの散らばり}}
= \frac{70}{10} + \frac{60}{10} = 7 + 6 = 13 グループ内の散らばり 10 4 × 4 + 6 × 9 + グループ平均どうしの散らばり 10 4 × ( 10 − 13 ) 2 + 6 × ( 15 − 13 ) 2 = 10 70 + 10 60 = 7 + 6 = 13 (各グループで本文の式 ∑ ( x i − a ) 2 = ∑ ( x i − x ˉ ) 2 + n ( x ˉ − a ) 2 \sum(x_i - a)^2 = \sum(x_i - \bar{x})^2 + n(\bar{x} - a)^2 ∑ ( x i − a ) 2 = ∑ ( x i − x ˉ ) 2 + n ( x ˉ − a ) 2 を a = 13 a = 13 a = 13 として使い、足し合わせたものです。)
グループの平均が 10 10 10 と 15 15 15 で離れているため、グループ内の散らばりに
「平均どうしのずれ」による散らばり 6 6 6 が上乗せされます。
そのため、どちらのグループ単独の分散よりも大きくなります。
答: 平均 13 13 13 、分散 13 13 13 。