統計2級第 2 章約 13 分図 7 点

度数分布・ヒストグラム・箱ひげ図

データの分布の形を、度数分布表・ヒストグラム・箱ひげ図で目に見えるようにする。階級幅が不ぞろいなときの柱の高さ、四分位数の求め方と定義の違い、外れ値の判定、そして箱ひげ図が隠してしまう情報までを扱う。

この章の到達目標

  • 度数分布表から相対度数・累積相対度数を求め、階級値を使って平均を計算できる
  • 階級幅が異なるヒストグラムで、柱の面積が度数を表すように高さを決められる
  • 四分位数・四分位範囲を求め、1.5×IQR の基準で外れ値を判定して箱ひげ図を描ける
  • 箱ひげ図とヒストグラムの対応を読み取り、箱ひげ図では見えない分布の特徴を指摘できる

前提データの要約:代表値と散らばり

目次
  1. 度数分布表
  2. 度数分布表から平均を求める
  3. ヒストグラム
  4. 階級幅の選び方
  5. 階級幅が不ぞろいなとき:高さではなく面積
  6. 四分位数と箱ひげ図
  7. 四分位数
  8. 四分位範囲と外れ値
  9. 箱ひげ図
  10. 箱ひげ図とヒストグラムを読み比べる
  11. 章末問題

前の章では、データを平均や標準偏差といった数個の数値に要約しました。 しかし数値だけでは、分布が左右対称なのか、裾が長いのか、山が2つあるのかは分かりません。

この章では、分布の形を見るための表と図を扱います。 統計検定2級では、ヒストグラムと箱ひげ図を対応させる問題や、図から代表値の大小を読み取る問題が 頻繁に出ます。図を「眺める」のではなく、図の各部分が何の数値に対応しているかを正確に押さえます。

度数分布表

データをいくつかの区間(階級)に分け、各階級に入るデータの個数(度数)を数えた表を 度数分布表と呼びます。 階級の幅を階級幅、階級の中央の値を階級値と言います。

40人の通勤時間(分)を集計した例です。

階級(分)階級値度数相対度数累積相対度数
00 以上 1010 未満55440.1000.1000.1000.100
1010 以上 2020 未満151510100.2500.2500.3500.350
2020 以上 3030 未満252514140.3500.3500.7000.700
3030 以上 4040 未満3535880.2000.2000.9000.900
4040 以上 5050 未満4545330.0750.0750.9750.975
5050 以上 6060 未満5555110.0250.0251.0001.000
計40401.0001.000
  • 相対度数 = 度数 ÷ 全体の個数。全体に占める割合で、合計は必ず 11 になる
  • 累積相対度数 = その階級までの相対度数の合計。「その階級の上端未満のデータが全体の何割か」を表す

相対度数に直すと、人数の違うデータどうし(40人のクラスと200人の学年など)を同じ尺度で比べられます。

累積相対度数は、中央値がどの階級にあるかを教えてくれます。 0.50.5 を初めて超えるのは 2020 以上 3030 未満の階級(0.350→0.7000.350 \to 0.700)なので、中央値はこの階級に入ります。 同じ考え方で、0.250.25 と 0.750.75 を超える階級を探せば、後で扱う四分位数のおおよその位置も分かります。 累積相対度数を折れ線で描くと(図 1)、中央値のおおよその値まで読み取れます。

00.250.50.7510102030405060通勤時間(分)累積相対度数Q1 ≈ 16Q3 ≈ 32.50.1000.3500.7000.9000.9751.000中央値 ≈ 24.3 分
図 1表の累積相対度数を、各階級の上端の位置に打って線分で結んだ図(累積度数折れ線)。折れ線が 0.5 を横切る位置が中央値の目安で、20 + 10 × 0.15 ÷ 0.35 ≈ 24.3 分。階級の中でデータが一様に散らばると仮定した読み取りである点に注意。

度数分布表から平均を求める

元のデータが失われていて度数分布表しかないときは、 各階級のデータがすべて階級値に等しいとみなして平均を計算します。

xˉ≈1n∑kmkfk\bar{x} \approx \frac{1}{n}\sum_{k} m_k f_k

mkm_k は階級値、fkf_k は度数です。上の表では

xˉ≈5×4+15×10+25×14+35×8+45×3+55×140=99040=24.75\bar{x} \approx \frac{5 \times 4 + 15 \times 10 + 25 \times 14 + 35 \times 8 + 45 \times 3 + 55 \times 1}{40} = \frac{990}{40} = 24.75

これは「mkm_k という値が fkf_k 個ある」データの平均そのものです。 階級内でデータが偏っていなければ、真の平均に近い値になります。 度数が最大の階級の階級値 2525 が、この表での最頻値です。

ヒストグラム

度数分布表を、横軸に階級、縦軸に度数をとった柱の図にしたものがヒストグラムです。 棒グラフと違い、柱と柱の間をあけません。横軸が連続した量だからです。

階級幅の選び方

階級幅を変えると、同じデータでもヒストグラムの見た目は大きく変わります。

  • 幅が広すぎると、柱が少なくなり、山が2つあるといった特徴がつぶれて見えなくなる
  • 幅が狭すぎると、各階級の度数が少なくなり、偶然の凸凹ばかりが目立つ

目安として、階級の数を 1+log⁡2n1 + \log_2 n 程度にするスタージェスの公式が知られています。 n=40n = 40 なら 1+log⁡240≈6.31 + \log_2 40 \approx 6.3 で、6個前後です。 ただしこれは出発点にすぎません。いくつか幅を変えて描き、分布の特徴が安定して見える幅を選ぶのが実際的です。 図 2 は、上の表と一致するように作った40人のデータを、3通りの階級幅で描いたものです。

幅 2 分(30 階級)柱が細かすぎて、偶然の凸凹が目立つ5人幅 10 分(6 階級)表と同じ。山が1つで右に裾が長い形が見える14人幅 30 分(2 階級)柱が少なすぎて、形がつぶれる28人0102030405060通勤時間(分)
図 2同じ40人のデータ(表に合うように作った例)を、階級幅だけ変えて描いた。幅 2 分では1人の違いで柱が上下し、幅 30 分では山の位置も裾の長さも分からない。中段の幅 10 分で初めて分布の形が読めることに注目。

階級幅が不ぞろいなとき:高さではなく面積

年収の分布のように、値の大きい側でデータがまばらになる場合、 右側の階級だけ幅を広くとることがあります。 このとき柱の高さに度数をそのまま使ってはいけません。

例えば幅 200200 の階級に 1010 人、幅 400400 の階級に 2020 人いるとします。 高さを度数にすると、後者の柱は前者の2倍の高さで、しかも2倍の幅になり、面積は4倍に見えます。 しかし実際には「値 11 あたりの人数」は 10/200=20/400=0.0510/200 = 20/400 = 0.05 で、まったく同じ密度です。 図 3 の左右を見比べてください。

誤り:高さ = 度数1020度数10人20人200400800面積が 1 : 4 に見える正しい:高さ = 度数 ÷ 階級幅0.05密度10人20人200400800面積が 1 : 2 = 人数の比
図 3幅 200 の階級に 10 人、幅 400 の階級に 20 人いる例。左のように度数を高さにすると右の柱が面積4倍に見えるが、右のように高さを密度 0.05 にそろえると、面積の比が人数の比 1 : 2 に一致することに注目。

四分位数と箱ひげ図

四分位数

データを小さい順に並べ、個数で4等分する位置の値を四分位数と呼びます。

  • 第1四分位数 Q1Q_1 … 下から 25%25\% の位置
  • 第2四分位数 Q2Q_2 … 50%50\% の位置。中央値と同じ
  • 第3四分位数 Q3Q_3 … 下から 75%75\% の位置

本書では、日本の高校「数学Ⅰ」の教科書で一般的な次の方法を使います。

  1. 全体の中央値を求め、それを Q2Q_2 とする
  2. データを中央値を境に下半分と上半分に分ける。個数が奇数のときは、中央値そのものはどちらにも入れない
  3. 下半分の中央値を Q1Q_1、上半分の中央値を Q3Q_3 とする

11人の通勤時間(分)で求めてみます。

8, 12, 15, 18, 20, 22, 25, 27, 30, 35, 708,\ 12,\ 15,\ 18,\ 20,\ \mathbf{22},\ 25,\ 27,\ 30,\ 35,\ 70

中央値は6番目の Q2=22Q_2 = 22。 下半分 8,12,15,18,208, 12, 15, 18, 20 の中央値が Q1=15Q_1 = 15、 上半分 25,27,30,35,7025, 27, 30, 35, 70 の中央値が Q3=30Q_3 = 30 です。 図 4 は、この手順を点の並びで示したものです(下の外れ値の判定も書き込んであります)。

01020304050607080下半分 → Q1 = 15上半分 → Q3 = 30中央値 Q2 = 22(どちらの半分にも入れない)IQR = 151.5 × IQR = 22.5基準 52.552.5 を超える 70 は外れ値下側の基準は 15 − 22.5 = −7.5 で、これより小さいデータはない
図 411人の通勤時間を点で並べ、中央値 22 を境に5個ずつの下半分と上半分に分けた。それぞれの真ん中の点が Q1 と Q3 で、その間隔 IQR = 15 の 1.5 倍を Q3 から伸ばした基準 52.5 の外にある 70 が外れ値になることに注目。

四分位範囲と外れ値

Q3−Q1Q_3 - Q_1 を四分位範囲(IQR: interquartile range)と呼びます。 データの中央の約半分が入っている区間の幅で、散らばりの指標の1つです。

範囲(最大値 − 最小値)は両端の2つの値だけで決まるので、外れ値が1つあるだけで大きく変わります。 四分位範囲は両端の 25%25\% ずつを無視するので、外れ値の影響を受けにくい。 平均に対する中央値と同じく、頑健な散らばりの指標です。

外れ値を判定する基準として、次がよく使われます。

x<Q1−1.5×IQRまたはx>Q3+1.5×IQRx < Q_1 - 1.5 \times \mathrm{IQR} \quad \text{または} \quad x > Q_3 + 1.5 \times \mathrm{IQR}
外れ値の基準(1.5×IQR)

上の例では IQR=30−15=15\mathrm{IQR} = 30 - 15 = 15 なので、1.5×15=22.51.5 \times 15 = 22.5。

Q1−22.5=−7.5,Q3+22.5=52.5Q_1 - 22.5 = -7.5, \qquad Q_3 + 22.5 = 52.5

52.552.5 を超える 7070 が外れ値と判定されます(図 4)。 1.51.5 という係数は「経験的にちょうどよい」として広まった慣習で、理論から一意に決まる値ではありません。 外れ値と判定されたデータは、機械的に削除するのではなく、入力ミスなのか本当に極端な値なのかを確かめる対象です。

箱ひげ図

箱ひげ図は、5つの値(最小値・Q1Q_1・中央値・Q3Q_3・最大値)を1本の図にまとめたものです。

  • Q1Q_1 から Q3Q_3 までを箱で描き、中央値の位置に線を引く
  • 箱の両端からひげを伸ばす
  • 外れ値を区別する描き方では、ひげは外れ値を除いた最大値・最小値まで伸ばし、外れ値は点で別に描く
01020304050607080通勤時間(分)最小 8中央値 22ひげ端 35Q1 15Q3 30外れ値 70基準 52.5
図 511人の通勤時間の箱ひげ図。ひげの右端は外れ値を除いた最大値 35 で、基準の 52.5 ではない。70 は外れ値として点で描いている。

箱ひげ図とヒストグラムを読み比べる

箱ひげ図の長所は、多数のグループを横に並べて比べやすいことです。 クラスごと・年度ごとの分布を10本並べても、中央値の上下や散らばりの違いが一目で分かります。 ヒストグラムを10枚並べるより、ずっと比較しやすい。

分布の歪みも読み取れます。 右に裾の長い分布では、中央値が箱の中で左に寄り、右のひげが長くなったり、右側に外れ値が現れたりします。 図 5 では中央値が箱のわずかに左寄りにあり、右側に外れ値 7070 が離れて描かれています。

一方で、箱ひげ図は5つの数値しか使わないので、分布の細かい形を捨てています。

A:山が2つB:平らほぼ同じ箱ひげ図ほぼ同じ箱ひげ図
図 6山が2つある分布(左)と平らな分布(右)。ヒストグラムはまったく違うが、四分位数がほぼ同じなので箱ひげ図はほとんど区別できない(模式図)。

図 6 の A は、中央付近にほとんどデータがなく、両側に2つの山があります。 例えば「初心者と経験者が混ざったグループの得点」のように、性質の違う2つの集団が混ざるとこうなります。 ところが箱ひげ図では、中央値の周りにデータがないことは表現されません。

箱ひげ図で見えなくなる主なものは次のとおりです。

  • 山の数(単峰か二峰か)
  • 分布の途中にあるすき間
  • データの個数(10個でも1万個でも同じ見た目になりうる)

図 7 は、図 2 と同じ40人のデータで、この対応を確かめたものです。

4人10人14人8人3人1人0102030405060Q1 = 17.5中央値 = 23Q3 = 3110人10人10人10人箱ひげ図の区切りのあいだには、それぞれ全体の4分の1(10人)が入る
図 7表に合うように作った40人のデータのヒストグラム(上)と箱ひげ図(下)。Q1 = 17.5 は 10 以上 20 未満、中央値 23 は 20 以上 30 未満、Q3 = 31 は 30 以上 40 未満の階級に入り、累積相対度数で予想した階級と一致することに注目。59 分は上側の基準 51.2 を超えるので外れ値として点で描いた。

章末問題

問 1基本度数分布表

20人の小テストの得点を集計したところ、次の度数分布表を得た。

階級(点)度数
00 以上 1010 未満22
1010 以上 2020 未満55
2020 以上 3030 未満88
3030 以上 4040 未満44
4040 以上 5050 未満11

(1) 各階級の相対度数と累積相対度数を求めよ。 (2) 階級値を用いて平均を求めよ。 (3) 中央値が入る階級を答えよ。

解答を見る

(1) 相対度数は度数 ÷ 2020、累積相対度数はそれを上から足したものです。

階級(点)度数相対度数累積相対度数
00 以上 1010 未満220.100.100.100.10
1010 以上 2020 未満550.250.250.350.35
2020 以上 3030 未満880.400.400.750.75
3030 以上 4040 未満440.200.200.950.95
4040 以上 5050 未満110.050.051.001.00

最後の累積相対度数が 1.001.00 になることで、計算の抜けがないことを確認できます。

(2) 階級値は 5,15,25,35,455, 15, 25, 35, 45 です。

xˉ≈5×2+15×5+25×8+35×4+45×120=10+75+200+140+4520=47020=23.5\bar{x} \approx \frac{5 \times 2 + 15 \times 5 + 25 \times 8 + 35 \times 4 + 45 \times 1}{20} = \frac{10 + 75 + 200 + 140 + 45}{20} = \frac{470}{20} = 23.5

(3) 累積相対度数が初めて 0.50.5 を超えるのは 2020 以上 3030 未満の階級(0.35→0.750.35 \to 0.75)です。 20人の中央値は10番目と11番目の平均で、どちらも8番目から15番目が入るこの階級にあります。

答: (2) 23.523.5 点 (3) 2020 点以上 3030 点未満

問 2標準四分位数と外れ値

次の12個のデータ(小さい順に並べてある)について答えよ。 四分位数は本文の方法(下半分・上半分それぞれの中央値)で求めること。

12, 15, 17, 18, 20, 21, 22, 24, 25, 27, 30, 5212,\ 15,\ 17,\ 18,\ 20,\ 21,\ 22,\ 24,\ 25,\ 27,\ 30,\ 52

(1) Q1Q_1、中央値、Q3Q_3、四分位範囲を求めよ。 (2) 1.5×IQR の基準で外れ値を判定せよ。 (3) 外れ値を区別する箱ひげ図を描くとき、ひげの両端の値を答えよ。

解答を見る

(1) 12個は偶数なので、中央値は6番目と7番目の平均です。

Q2=21+222=21.5Q_2 = \frac{21 + 22}{2} = 21.5

下半分は 12,15,17,18,20,2112, 15, 17, 18, 20, 21(6個)で、その中央値は3番目と4番目の平均。

Q1=17+182=17.5Q_1 = \frac{17 + 18}{2} = 17.5

上半分は 22,24,25,27,30,5222, 24, 25, 27, 30, 52 で、同様に

Q3=25+272=26Q_3 = \frac{25 + 27}{2} = 26IQR=26−17.5=8.5\mathrm{IQR} = 26 - 17.5 = 8.5

(2) 1.5×8.5=12.751.5 \times 8.5 = 12.75 なので、基準は

Q1−12.75=4.75,Q3+12.75=38.75Q_1 - 12.75 = 4.75, \qquad Q_3 + 12.75 = 38.75

4.754.75 未満のデータはなく、38.7538.75 を超えるのは 5252 だけです。外れ値は 5252。

(3) ひげは基準の内側にある実際のデータの端まで伸ばします。 下側は最小値 1212(4.754.75 以上なので外れ値ではない)、 上側は 5252 を除いた最大値 3030 です。

答: (1) Q1=17.5Q_1 = 17.5、中央値 21.521.5、Q3=26Q_3 = 26、IQR =8.5= 8.5 (2) 5252 (3) 下端 1212、上端 3030

なお、表計算ソフトの関数では Q1=17.75Q_1 = 17.75、Q3=25.5Q_3 = 25.5 のように少し違う値になることがあります(定義の違い)。 この場合も IQR =7.75= 7.75、上側の基準は 25.5+11.625=37.12525.5 + 11.625 = 37.125 で、5252 が外れ値という結論は変わりません。

問 3発展階級幅が不ぞろいなヒストグラム

ある地域の100世帯の年収を集計したところ、次の度数分布表を得た。

階級(万円)度数
00 以上 200200 未満1010
200200 以上 400400 未満3030
400400 以上 600600 未満4040
600600 以上 10001000 未満2020

(1) 柱の面積が度数を表すヒストグラムを描くとき、各柱の高さ(度数 ÷ 階級幅、単位は 世帯/万円)を求めよ。 (2) 誤って度数をそのまま高さにして描くと、600600 以上 10001000 未満の柱はどのように誤解されるか説明せよ。 (3) 各階級の中でデータが一様に散らばっていると仮定して、年収が 500500 万円以上 700700 万円未満の世帯数を推定せよ。 (4) 同じ仮定のもとで、中央値を推定せよ。

解答を見る

(1)

10200=0.05,30200=0.15,40200=0.20,20400=0.05\frac{10}{200} = 0.05, \qquad \frac{30}{200} = 0.15, \qquad \frac{40}{200} = 0.20, \qquad \frac{20}{400} = 0.05

(2) 度数を高さにすると、600600 以上 10001000 未満の柱は高さ 2020 で 00 以上 200200 未満(高さ 1010)の2倍になり、 幅も2倍なので面積は4倍に見えます。実際の世帯数は2倍にすぎず、 しかも (1) のとおり単位年収あたりの世帯数(密度)は両者とも 0.050.05 で同じです。 高所得の側に世帯が多く集まっているかのように誤解されます。

(3) 一様に散らばっていると仮定すると、区間に入る世帯数は「密度 × 区間の幅」です。

500∼600: 0.20×100=20,600∼700: 0.05×100=5500 \sim 600:\ 0.20 \times 100 = 20, \qquad 600 \sim 700:\ 0.05 \times 100 = 5

合わせて 約 2525 世帯。ヒストグラムでいえば、該当する部分の柱の面積を足したことになります。

(4) 100世帯の中央値は、下から 5050 世帯目あたりの値です。 400400 万円未満までの累積が 10+30=4010 + 30 = 40 世帯なので、残り 1010 世帯ぶんを 400400 以上 600600 未満の階級から取ります。 この階級の密度は 0.200.20 世帯/万円なので、必要な幅は 10÷0.20=5010 \div 0.20 = 50 万円。

中央値≈400+50=450 万円\text{中央値} \approx 400 + 50 = 450\ \text{万円}

答: (1) 0.05, 0.15, 0.20, 0.050.05,\ 0.15,\ 0.20,\ 0.05 (3) 約 2525 世帯 (4) 約 450450 万円

次に読むなら