前の章では、データを平均や標準偏差といった数個の数値に要約しました。
しかし数値だけでは、分布が左右対称なのか、裾が長いのか、山が2つあるのかは分かりません。
この章では、分布の形を見るための表と図を扱います。
統計検定2級では、ヒストグラムと箱ひげ図を対応させる問題や、図から代表値の大小を読み取る問題が
頻繁に出ます。図を「眺める」のではなく、図の各部分が何の数値に対応しているかを正確に押さえます。
度数分布表
データをいくつかの区間(階級)に分け、各階級に入るデータの個数(度数)を数えた表を
度数分布表と呼びます。
階級の幅を階級幅、階級の中央の値を階級値と言います。
40人の通勤時間(分)を集計した例です。
| 階級(分) | 階級値 | 度数 | 相対度数 | 累積相対度数 |
|---|
| 0 以上 10 未満 | 5 | 4 | 0.100 | 0.100 |
| 10 以上 20 未満 | 15 | 10 | 0.250 | 0.350 |
| 20 以上 30 未満 | 25 | 14 | 0.350 | 0.700 |
| 30 以上 40 未満 | 35 | 8 | 0.200 | 0.900 |
| 40 以上 50 未満 | 45 | 3 | 0.075 | 0.975 |
| 50 以上 60 未満 | 55 | 1 | 0.025 | 1.000 |
| 計 | | 40 | 1.000 | |
- 相対度数 = 度数 ÷ 全体の個数。全体に占める割合で、合計は必ず 1 になる
- 累積相対度数 = その階級までの相対度数の合計。「その階級の上端未満のデータが全体の何割か」を表す
相対度数に直すと、人数の違うデータどうし(40人のクラスと200人の学年など)を同じ尺度で比べられます。
累積相対度数は、中央値がどの階級にあるかを教えてくれます。
0.5 を初めて超えるのは 20 以上 30 未満の階級(0.350→0.700)なので、中央値はこの階級に入ります。
同じ考え方で、0.25 と 0.75 を超える階級を探せば、後で扱う四分位数のおおよその位置も分かります。
累積相対度数を折れ線で描くと(図 1)、中央値のおおよその値まで読み取れます。
図 1表の累積相対度数を、各階級の上端の位置に打って線分で結んだ図(累積度数折れ線)。折れ線が 0.5 を横切る位置が中央値の目安で、20 + 10 × 0.15 ÷ 0.35 ≈ 24.3 分。階級の中でデータが一様に散らばると仮定した読み取りである点に注意。
度数分布表から平均を求める
元のデータが失われていて度数分布表しかないときは、
各階級のデータがすべて階級値に等しいとみなして平均を計算します。
xˉ≈n1k∑mkfk
mk は階級値、fk は度数です。上の表では
xˉ≈405×4+15×10+25×14+35×8+45×3+55×1=40990=24.75
これは「mk という値が fk 個ある」データの平均そのものです。
階級内でデータが偏っていなければ、真の平均に近い値になります。
度数が最大の階級の階級値 25 が、この表での最頻値です。
ヒストグラム
度数分布表を、横軸に階級、縦軸に度数をとった柱の図にしたものがヒストグラムです。
棒グラフと違い、柱と柱の間をあけません。横軸が連続した量だからです。
階級幅の選び方
階級幅を変えると、同じデータでもヒストグラムの見た目は大きく変わります。
- 幅が広すぎると、柱が少なくなり、山が2つあるといった特徴がつぶれて見えなくなる
- 幅が狭すぎると、各階級の度数が少なくなり、偶然の凸凹ばかりが目立つ
目安として、階級の数を 1+log2n 程度にするスタージェスの公式が知られています。
n=40 なら 1+log240≈6.3 で、6個前後です。
ただしこれは出発点にすぎません。いくつか幅を変えて描き、分布の特徴が安定して見える幅を選ぶのが実際的です。
図 2 は、上の表と一致するように作った40人のデータを、3通りの階級幅で描いたものです。
図 2同じ40人のデータ(表に合うように作った例)を、階級幅だけ変えて描いた。幅 2 分では1人の違いで柱が上下し、幅 30 分では山の位置も裾の長さも分からない。中段の幅 10 分で初めて分布の形が読めることに注目。
階級幅が不ぞろいなとき:高さではなく面積
年収の分布のように、値の大きい側でデータがまばらになる場合、
右側の階級だけ幅を広くとることがあります。
このとき柱の高さに度数をそのまま使ってはいけません。
例えば幅 200 の階級に 10 人、幅 400 の階級に 20 人いるとします。
高さを度数にすると、後者の柱は前者の2倍の高さで、しかも2倍の幅になり、面積は4倍に見えます。
しかし実際には「値 1 あたりの人数」は 10/200=20/400=0.05 で、まったく同じ密度です。
図 3 の左右を見比べてください。
図 3幅 200 の階級に 10 人、幅 400 の階級に 20 人いる例。左のように度数を高さにすると右の柱が面積4倍に見えるが、右のように高さを密度 0.05 にそろえると、面積の比が人数の比 1 : 2 に一致することに注目。
四分位数と箱ひげ図
四分位数
データを小さい順に並べ、個数で4等分する位置の値を四分位数と呼びます。
- 第1四分位数 Q1 … 下から 25% の位置
- 第2四分位数 Q2 … 50% の位置。中央値と同じ
- 第3四分位数 Q3 … 下から 75% の位置
本書では、日本の高校「数学Ⅰ」の教科書で一般的な次の方法を使います。
- 全体の中央値を求め、それを Q2 とする
- データを中央値を境に下半分と上半分に分ける。個数が奇数のときは、中央値そのものはどちらにも入れない
- 下半分の中央値を Q1、上半分の中央値を Q3 とする
11人の通勤時間(分)で求めてみます。
8, 12, 15, 18, 20, 22, 25, 27, 30, 35, 70
中央値は6番目の Q2=22。
下半分 8,12,15,18,20 の中央値が Q1=15、
上半分 25,27,30,35,70 の中央値が Q3=30 です。
図 4 は、この手順を点の並びで示したものです(下の外れ値の判定も書き込んであります)。
図 411人の通勤時間を点で並べ、中央値 22 を境に5個ずつの下半分と上半分に分けた。それぞれの真ん中の点が Q1 と Q3 で、その間隔 IQR = 15 の 1.5 倍を Q3 から伸ばした基準 52.5 の外にある 70 が外れ値になることに注目。
四分位範囲と外れ値
Q3−Q1 を四分位範囲(IQR: interquartile range)と呼びます。
データの中央の約半分が入っている区間の幅で、散らばりの指標の1つです。
範囲(最大値 − 最小値)は両端の2つの値だけで決まるので、外れ値が1つあるだけで大きく変わります。
四分位範囲は両端の 25% ずつを無視するので、外れ値の影響を受けにくい。
平均に対する中央値と同じく、頑健な散らばりの指標です。
外れ値を判定する基準として、次がよく使われます。
外れ値の基準(1.5×IQR)
上の例では IQR=30−15=15 なので、1.5×15=22.5。
Q1−22.5=−7.5,Q3+22.5=52.5
52.5 を超える 70 が外れ値と判定されます(図 4)。
1.5 という係数は「経験的にちょうどよい」として広まった慣習で、理論から一意に決まる値ではありません。
外れ値と判定されたデータは、機械的に削除するのではなく、入力ミスなのか本当に極端な値なのかを確かめる対象です。
箱ひげ図
箱ひげ図は、5つの値(最小値・Q1・中央値・Q3・最大値)を1本の図にまとめたものです。
- Q1 から Q3 までを箱で描き、中央値の位置に線を引く
- 箱の両端からひげを伸ばす
- 外れ値を区別する描き方では、ひげは外れ値を除いた最大値・最小値まで伸ばし、外れ値は点で別に描く
図 511人の通勤時間の箱ひげ図。ひげの右端は外れ値を除いた最大値 35 で、基準の 52.5 ではない。70 は外れ値として点で描いている。
箱ひげ図とヒストグラムを読み比べる
箱ひげ図の長所は、多数のグループを横に並べて比べやすいことです。
クラスごと・年度ごとの分布を10本並べても、中央値の上下や散らばりの違いが一目で分かります。
ヒストグラムを10枚並べるより、ずっと比較しやすい。
分布の歪みも読み取れます。
右に裾の長い分布では、中央値が箱の中で左に寄り、右のひげが長くなったり、右側に外れ値が現れたりします。
図 5 では中央値が箱のわずかに左寄りにあり、右側に外れ値 70 が離れて描かれています。
一方で、箱ひげ図は5つの数値しか使わないので、分布の細かい形を捨てています。
図 6山が2つある分布(左)と平らな分布(右)。ヒストグラムはまったく違うが、四分位数がほぼ同じなので箱ひげ図はほとんど区別できない(模式図)。
図 6 の A は、中央付近にほとんどデータがなく、両側に2つの山があります。
例えば「初心者と経験者が混ざったグループの得点」のように、性質の違う2つの集団が混ざるとこうなります。
ところが箱ひげ図では、中央値の周りにデータがないことは表現されません。
箱ひげ図で見えなくなる主なものは次のとおりです。
- 山の数(単峰か二峰か)
- 分布の途中にあるすき間
- データの個数(10個でも1万個でも同じ見た目になりうる)
図 7 は、図 2 と同じ40人のデータで、この対応を確かめたものです。
図 7表に合うように作った40人のデータのヒストグラム(上)と箱ひげ図(下)。Q1 = 17.5 は 10 以上 20 未満、中央値 23 は 20 以上 30 未満、Q3 = 31 は 30 以上 40 未満の階級に入り、累積相対度数で予想した階級と一致することに注目。59 分は上側の基準 51.2 を超えるので外れ値として点で描いた。
章末問題
問 1基本度数分布表
20人の小テストの得点を集計したところ、次の度数分布表を得た。
| 階級(点) | 度数 |
|---|
| 0 以上 10 未満 | 2 |
| 10 以上 20 未満 | 5 |
| 20 以上 30 未満 | 8 |
| 30 以上 40 未満 | 4 |
| 40 以上 50 未満 | 1 |
(1) 各階級の相対度数と累積相対度数を求めよ。
(2) 階級値を用いて平均を求めよ。
(3) 中央値が入る階級を答えよ。
解答を見る
(1) 相対度数は度数 ÷ 20、累積相対度数はそれを上から足したものです。
| 階級(点) | 度数 | 相対度数 | 累積相対度数 |
|---|
| 0 以上 10 未満 | 2 | 0.10 | 0.10 |
| 10 以上 20 未満 | 5 | 0.25 | 0.35 |
| 20 以上 30 未満 | 8 | 0.40 | 0.75 |
| 30 以上 40 未満 | 4 | 0.20 | 0.95 |
| 40 以上 50 未満 | 1 | 0.05 | 1.00 |
最後の累積相対度数が 1.00 になることで、計算の抜けがないことを確認できます。
(2) 階級値は 5,15,25,35,45 です。
xˉ≈205×2+15×5+25×8+35×4+45×1=2010+75+200+140+45=20470=23.5(3) 累積相対度数が初めて 0.5 を超えるのは 20 以上 30 未満の階級(0.35→0.75)です。
20人の中央値は10番目と11番目の平均で、どちらも8番目から15番目が入るこの階級にあります。
答: (2) 23.5 点 (3) 20 点以上 30 点未満
問 2標準四分位数と外れ値
次の12個のデータ(小さい順に並べてある)について答えよ。
四分位数は本文の方法(下半分・上半分それぞれの中央値)で求めること。
12, 15, 17, 18, 20, 21, 22, 24, 25, 27, 30, 52(1) Q1、中央値、Q3、四分位範囲を求めよ。
(2) 1.5×IQR の基準で外れ値を判定せよ。
(3) 外れ値を区別する箱ひげ図を描くとき、ひげの両端の値を答えよ。
解答を見る
(1) 12個は偶数なので、中央値は6番目と7番目の平均です。
Q2=221+22=21.5下半分は 12,15,17,18,20,21(6個)で、その中央値は3番目と4番目の平均。
Q1=217+18=17.5上半分は 22,24,25,27,30,52 で、同様に
Q3=225+27=26IQR=26−17.5=8.5(2) 1.5×8.5=12.75 なので、基準は
Q1−12.75=4.75,Q3+12.75=38.754.75 未満のデータはなく、38.75 を超えるのは 52 だけです。外れ値は 52。
(3) ひげは基準の内側にある実際のデータの端まで伸ばします。
下側は最小値 12(4.75 以上なので外れ値ではない)、
上側は 52 を除いた最大値 30 です。
答: (1) Q1=17.5、中央値 21.5、Q3=26、IQR =8.5 (2) 52 (3) 下端 12、上端 30
なお、表計算ソフトの関数では Q1=17.75、Q3=25.5 のように少し違う値になることがあります(定義の違い)。
この場合も IQR =7.75、上側の基準は 25.5+11.625=37.125 で、52 が外れ値という結論は変わりません。
問 3発展階級幅が不ぞろいなヒストグラム
ある地域の100世帯の年収を集計したところ、次の度数分布表を得た。
| 階級(万円) | 度数 |
|---|
| 0 以上 200 未満 | 10 |
| 200 以上 400 未満 | 30 |
| 400 以上 600 未満 | 40 |
| 600 以上 1000 未満 | 20 |
(1) 柱の面積が度数を表すヒストグラムを描くとき、各柱の高さ(度数 ÷ 階級幅、単位は 世帯/万円)を求めよ。
(2) 誤って度数をそのまま高さにして描くと、600 以上 1000 未満の柱はどのように誤解されるか説明せよ。
(3) 各階級の中でデータが一様に散らばっていると仮定して、年収が 500 万円以上 700 万円未満の世帯数を推定せよ。
(4) 同じ仮定のもとで、中央値を推定せよ。
解答を見る
(1)
20010=0.05,20030=0.15,20040=0.20,40020=0.05(2) 度数を高さにすると、600 以上 1000 未満の柱は高さ 20 で 0 以上 200 未満(高さ 10)の2倍になり、
幅も2倍なので面積は4倍に見えます。実際の世帯数は2倍にすぎず、
しかも (1) のとおり単位年収あたりの世帯数(密度)は両者とも 0.05 で同じです。
高所得の側に世帯が多く集まっているかのように誤解されます。
(3) 一様に散らばっていると仮定すると、区間に入る世帯数は「密度 × 区間の幅」です。
500∼600: 0.20×100=20,600∼700: 0.05×100=5合わせて 約 25 世帯。ヒストグラムでいえば、該当する部分の柱の面積を足したことになります。
(4) 100世帯の中央値は、下から 50 世帯目あたりの値です。
400 万円未満までの累積が 10+30=40 世帯なので、残り 10 世帯ぶんを 400 以上 600 未満の階級から取ります。
この階級の密度は 0.20 世帯/万円なので、必要な幅は 10÷0.20=50 万円。
中央値≈400+50=450 万円答: (1) 0.05, 0.15, 0.20, 0.05 (3) 約 25 世帯 (4) 約 450 万円