前の2章では、1つの量の分布を要約しました。
この章では、身長と体重、勉強時間と得点のように、2つの量の関係 を扱います。
問いは2つあります。
「2つの量はどのくらい強く連動しているか」と、
「一方の値から他方の値をどう予測するか」です。
前者に答えるのが相関係数 、後者に答えるのが回帰直線 です。
どちらも第1章の偏差と分散の考え方をそのまま2変数に広げたものです。
散布図
n n n 組のデータ ( x 1 , y 1 ) , ( x 2 , y 2 ) , … , ( x n , y n ) (x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n) ( x 1 , y 1 ) , ( x 2 , y 2 ) , … , ( x n , y n ) を平面上の点として描いた図を散布図 と呼びます。
散布図で見るべきことは次の3つです。
向き … 右上がり(一方が大きいと他方も大きい)なら正の相関 、右下がりなら負の相関
強さ … 点が直線の近くに集まっているほど強い
形 … 直線的か、曲がっているか。外れた点はないか
数値で要約する前に、必ず散布図を描いて形を確かめてください。
この章で扱う指標はすべて「直線的な 関係」を測るもので、曲線的な関係は正しく表せないからです。
共分散
偏差の積の符号
各点について、x x x の偏差 x i − x ˉ x_i - \bar{x} x i − x ˉ と y y y の偏差 y i − y ˉ y_i - \bar{y} y i − y ˉ の積 を考えます。
散布図を点 ( x ˉ , y ˉ ) (\bar{x}, \bar{y}) ( x ˉ , y ˉ ) を通る縦線と横線で4つの領域に分けると、積の符号は領域で決まります。
右上:(+)×(+)= 正 左上:(−)×(+)= 負 左下:(−)×(−)= 正 右下:(+)×(−)= 負 x̄ ȳ x y
図 1 平均の位置で散布図を4つに分ける。右上と左下の点は偏差の積が正、左上と右下の点は負になる。右上がりの散布図では正の点が多く、共分散は正になる。
右上がりの散布図では、右上と左下の点が多く、正の積が多数を占めます。
右下がりなら逆に負の積が多くなります。はっきりした傾向がなければ、正と負が打ち消し合います。
そこで、偏差の積を平均したものを関係の向きの指標にします。
共分散
y y y を x x x に置き換えると s x x = 1 n ∑ ( x i − x ˉ ) 2 = s x 2 s_{xx} = \frac{1}{n}\sum (x_i - \bar{x})^2 = s_x^2 s xx = n 1 ∑ ( x i − x ˉ ) 2 = s x 2 で、分散に戻ります。
共分散は分散の2変数版です。
分散と同じように展開すると、電卓向きの式が得られます。
s x y = 1 n ∑ i = 1 n ( x i y i − y ˉ x i − x ˉ y i + x ˉ y ˉ ) = x y ‾ − y ˉ x ˉ − x ˉ y ˉ + x ˉ y ˉ = x y ‾ − x ˉ y ˉ s_{xy} = \frac{1}{n}\sum_{i=1}^{n}\left(x_i y_i - \bar{y}\,x_i - \bar{x}\,y_i + \bar{x}\bar{y}\right)
= \overline{xy} - \bar{y}\bar{x} - \bar{x}\bar{y} + \bar{x}\bar{y}
= \overline{xy} - \bar{x}\,\bar{y} s x y = n 1 i = 1 ∑ n ( x i y i − y ˉ x i − x ˉ y i + x ˉ y ˉ ) = x y − y ˉ x ˉ − x ˉ y ˉ + x ˉ y ˉ = x y − x ˉ y ˉ
「積の平均 − 平均の積」です。分散の「2乗の平均 − 平均の2乗」と同じ形をしています。
! 共分散の大きさは、関係の強さを表さない つまずきやすい点
共分散の符号 は関係の向きを表しますが、大きさ は単位に左右されます。
身長を m \mathrm{m} m から c m \mathrm{cm} cm に直すと、偏差がすべて 100 100 100 倍になるので、共分散も 100 100 100 倍になります。
関係の強さは何も変わっていないのに、数値だけが大きくなる。
だから「共分散が 250 250 250 だから強い相関がある」とは言えません。
単位の影響を取り除いたのが、次の相関係数です。
相関係数
共分散を、それぞれの標準偏差で割ります。
相関係数
2つ目の形では分子・分母の 1 n \frac{1}{n} n 1 が約分されています。
そのため、n n n で割っても n − 1 n-1 n − 1 で割っても、相関係数の値は同じ です。
なぜ −1 から 1 の間に収まるのか
各データを標準化します。
z i = x i − x ˉ s x , w i = y i − y ˉ s y z_i = \frac{x_i - \bar{x}}{s_x}, \qquad w_i = \frac{y_i - \bar{y}}{s_y} z i = s x x i − x ˉ , w i = s y y i − y ˉ
第1章で見たとおり、標準化した値は平均 0 0 0 、分散 1 1 1 なので
1 n ∑ i = 1 n z i 2 = 1 , 1 n ∑ i = 1 n w i 2 = 1 \frac{1}{n}\sum_{i=1}^{n} z_i^2 = 1, \qquad \frac{1}{n}\sum_{i=1}^{n} w_i^2 = 1 n 1 i = 1 ∑ n z i 2 = 1 , n 1 i = 1 ∑ n w i 2 = 1
さらに、相関係数は標準化した値どうしの積の平均になっています。
1 n ∑ i = 1 n z i w i = 1 n ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) s x s y = s x y s x s y = r \frac{1}{n}\sum_{i=1}^{n} z_i w_i = \frac{1}{n}\sum_{i=1}^{n}\frac{(x_i - \bar{x})(y_i - \bar{y})}{s_x s_y} = \frac{s_{xy}}{s_x s_y} = r n 1 i = 1 ∑ n z i w i = n 1 i = 1 ∑ n s x s y ( x i − x ˉ ) ( y i − y ˉ ) = s x s y s x y = r
ここで、2乗の和は 0 0 0 以上であることを使います。
0 ≤ 1 n ∑ i = 1 n ( z i − w i ) 2 = 1 n ∑ z i 2 − 2 n ∑ z i w i + 1 n ∑ w i 2 = 1 − 2 r + 1 = 2 ( 1 − r ) 0 \le \frac{1}{n}\sum_{i=1}^{n}(z_i - w_i)^2 = \frac{1}{n}\sum z_i^2 - \frac{2}{n}\sum z_i w_i + \frac{1}{n}\sum w_i^2 = 1 - 2r + 1 = 2(1 - r) 0 ≤ n 1 i = 1 ∑ n ( z i − w i ) 2 = n 1 ∑ z i 2 − n 2 ∑ z i w i + n 1 ∑ w i 2 = 1 − 2 r + 1 = 2 ( 1 − r )
よって r ≤ 1 r \le 1 r ≤ 1 。z i − w i z_i - w_i z i − w i を z i + w i z_i + w_i z i + w i に替えると同様に 0 ≤ 2 ( 1 + r ) 0 \le 2(1 + r) 0 ≤ 2 ( 1 + r ) で、r ≥ − 1 r \ge -1 r ≥ − 1 。
§ 相関係数の範囲と等号の条件 法則
− 1 ≤ r ≤ 1 -1 \le r \le 1 − 1 ≤ r ≤ 1 r = 1 r = 1 r = 1 になるのは、すべての i i i で z i = w i z_i = w_i z i = w i 、つまりすべての点が右上がりの1本の直線上にある ときだけです。
r = − 1 r = -1 r = − 1 は右下がりの直線上にあるとき。
証明の中身を読むと、r r r は「標準化した x x x と y y y がどれだけ一致しているか」の指標だと分かります。
(これは数学でコーシー・シュワルツの不等式と呼ばれるものの、統計での姿です。)
相関係数には単位がありません。
x x x を a x + b a x + b a x + b (a > 0 a > 0 a > 0 )と変換しても、標準化した値 z i z_i z i は変わらないので、r r r も変わりません。
m \mathrm{m} m で測っても c m \mathrm{cm} cm で測っても同じ値になります。
(a < 0 a < 0 a < 0 なら符号だけが反転します。)
図 2 は、いろいろな大きさの相関係数をもつ散布図の例です。
散布図を見て r r r のおおよその値を見積もれるようにしておくと、散布図と相関係数を対応させる問題で役に立ちます。
r = −0.90 r = −0.50 r = 0.00 r = 0.30 r = 0.70 r = 0.95
図 2 40点ずつの散布図と、描いた点の座標から計算した相関係数。|r| が 1 に近いほど点が1本の直線のまわりに細く集まり、0 に近いほど丸く広がること、符号が右上がりか右下がりかを表すことに注目。r = 0.3 程度では、目で見て傾向を言い当てるのはかなり難しい。
! r が 0 でも「関係がない」とは限らない つまずきやすい点
相関係数が測るのは直線的な 関係の強さだけです。
x = − 2 , − 1 , 0 , 1 , 2 x = -2, -1, 0, 1, 2 x = − 2 , − 1 , 0 , 1 , 2 に対して y = x 2 y = x^2 y = x 2 とすると、y = 4 , 1 , 0 , 1 , 4 y = 4, 1, 0, 1, 4 y = 4 , 1 , 0 , 1 , 4 で、
y y y は x x x から完全に決まっています。ところが
s x y = x y ‾ − x ˉ y ˉ = − 8 − 1 + 0 + 1 + 8 5 − 0 × 2 = 0 s_{xy} = \overline{xy} - \bar{x}\,\bar{y} = \frac{-8 - 1 + 0 + 1 + 8}{5} - 0 \times 2 = 0 s x y = x y − x ˉ y ˉ = 5 − 8 − 1 + 0 + 1 + 8 − 0 × 2 = 0 で、r = 0 r = 0 r = 0 になります。右半分の右上がりと左半分の右下がりが打ち消し合ったのです。
逆に、1個の外れ値だけで r r r が大きくなることもあります。
相関係数を見る前に散布図を見る のは、このためです。
図 3 は、上の y = x 2 y = x^2 y = x 2 の例を偏差の積で見たものです。
−2 −1 1 2 x y ȳ = 2 積 +1 積 +4 積 −4 積 −1 積 0 偏差の積の和:(−4) + 1 + 0 + (−1) + 4 = 0 → r = 0 図 3 y = x² の5点。y は x から完全に決まるのに、平均の点(0, 2)から見た偏差の積は、左右で正と負が対になって打ち消し合い、和が 0 になることに注目。相関係数は「直線的な」関係しか測らない。
要約の数値がまったく同じでも、散布図がまるで違うことがあります。
図 4 は、統計学者アンスコムが1973年の論文で示した4組のデータです。
5 10 15 20 4 8 12 I ほぼ直線+ばらつき 5 10 15 20 4 8 12 II きれいな曲線 5 10 15 20 4 8 12 III 直線+外れ値1個 5 10 15 20 4 8 12 IV 1点だけで決まる傾き 4組とも x̄ = 9、ȳ ≈ 7.50、x の分散 10、y の分散 ≈ 3.75、r ≈ 0.816、回帰直線 ŷ ≈ 3 + 0.5x
図 4 アンスコムの例(F. J. Anscombe, 1973)。4組のデータは平均・分散・相関係数・回帰直線がそろって同じなのに、散布図の形はまったく違うことに注目。要約の数値だけで判断せず、必ず散布図を描いて確かめる理由がここにある。分散は n で割った値(n − 1 で割ると x は 11、y は約 4.12)。
相関と因果
相関係数が大きくても、「一方が他方の原因である」とは言えません。
夏には、アイスクリームの売上も水難事故の件数も増えます。
日ごとのデータをとれば両者には正の相関が出ますが、アイスを食べると溺れるわけではありません。
気温 という第3の要因が、両方を同時に増やしています。
このように、2つの量の両方に影響して見かけの相関を生む要因を交絡因子 (交絡変数)と呼び、
その結果として現れる相関を見かけの相関 (擬似相関)と言います。
図 5 に、この関係を矢印で示します。
気温 交絡因子 (両方を増やす) 暑いほど増える 暑いほど増える アイスの売上 水難事故の件数 相関 直接の因果はない(見かけの相関) 図 5 アイスの売上と水難事故に相関が出るしくみ。矢印(因果)は気温から両方へ向かっていて、下の2つのあいだには矢印がないことに注目。気温をそろえて比べれば、見かけの相関はほとんど消えるはずである。
! 相関があっても因果があるとは限らない つまずきやすい点
x x x と y y y に相関があるとき、考えられる説明は少なくとも次の4つです。
x x x が y y y の原因である
逆に y y y が x x x の原因である(逆因果)
第3の要因が x x x と y y y の両方に影響している(交絡)
たまたまである(データが少ないときに起こりやすい)
「病院の数が多い地域ほど病人が多い」から「病院が病気を生む」とは言えません。
人口という交絡因子もあれば、病人が多いから病院が増えたという逆因果もありえます。
因果を主張するには、無作為化比較実験 のように、交絡の影響を設計の段階で取り除く工夫が必要です。
実験の計画は後の章で扱います。
回帰直線:最小二乗法
相関係数は関係の強さを表しますが、x x x から y y y を予測する式は与えません。
そこで、散布図に直線 y = a + b x y = a + bx y = a + b x を当てはめます。
残差と最小二乗法
直線から予測される値 y ^ i = a + b x i \hat{y}_i = a + b x_i y ^ i = a + b x i と実際の値 y i y_i y i の差を残差 と呼びます。
e i = y i − ( a + b x i ) e_i = y_i - (a + b x_i) e i = y i − ( a + b x i )
残差は正にも負にもなるので、第1章の分散と同じく2乗して合計し、
それが最小になる a a a 、b b b を選びます。これを最小二乗法 と呼びます。
S ( a , b ) = ∑ i = 1 n ( y i − a − b x i ) 2 S(a, b) = \sum_{i=1}^{n}\left(y_i - a - b x_i\right)^2 S ( a , b ) = i = 1 ∑ n ( y i − a − b x i ) 2
切片:直線は平均の点を通る
まず b b b を固定して、a a a だけを動かすことを考えます。
u i = y i − b x i u_i = y_i - b x_i u i = y i − b x i とおくと
S = ∑ i = 1 n ( u i − a ) 2 S = \sum_{i=1}^{n}(u_i - a)^2 S = i = 1 ∑ n ( u i − a ) 2
これは第1章で扱った「データ u i u_i u i からの距離の2乗の合計」で、a a a が u i u_i u i の平均のとき最小になりました。
a = u ˉ = y ˉ − b x ˉ a = \bar{u} = \bar{y} - b\bar{x} a = u ˉ = y ˉ − b x ˉ
言い換えると y ˉ = a + b x ˉ \bar{y} = a + b\bar{x} y ˉ = a + b x ˉ 。回帰直線は必ず平均の点 ( x ˉ , y ˉ ) (\bar{x}, \bar{y}) ( x ˉ , y ˉ ) を通ります。
傾き:平方完成で決める
a = y ˉ − b x ˉ a = \bar{y} - b\bar{x} a = y ˉ − b x ˉ を S S S に代入すると
y i − a − b x i = ( y i − y ˉ ) − b ( x i − x ˉ ) y_i - a - b x_i = (y_i - \bar{y}) - b(x_i - \bar{x}) y i − a − b x i = ( y i − y ˉ ) − b ( x i − x ˉ )
となって、偏差だけの式になります。2乗して足すと
S = ∑ ( y i − y ˉ ) 2 − 2 b ∑ ( x i − x ˉ ) ( y i − y ˉ ) + b 2 ∑ ( x i − x ˉ ) 2 = n ( s y 2 − 2 b s x y + b 2 s x 2 ) S = \sum (y_i - \bar{y})^2 - 2b\sum (x_i - \bar{x})(y_i - \bar{y}) + b^2\sum (x_i - \bar{x})^2
= n\left(s_y^2 - 2b\, s_{xy} + b^2 s_x^2\right) S = ∑ ( y i − y ˉ ) 2 − 2 b ∑ ( x i − x ˉ ) ( y i − y ˉ ) + b 2 ∑ ( x i − x ˉ ) 2 = n ( s y 2 − 2 b s x y + b 2 s x 2 )
これは b b b の2次式なので、平方完成します。
S = n { s x 2 ( b − s x y s x 2 ) 2 + s y 2 − s x y 2 s x 2 } S = n\left\{ s_x^2\left(b - \frac{s_{xy}}{s_x^2}\right)^2 + s_y^2 - \frac{s_{xy}^2}{s_x^2} \right\} S = n { s x 2 ( b − s x 2 s x y ) 2 + s y 2 − s x 2 s x y 2 }
括弧の中の第1項は 0 0 0 以上で、b = s x y / s x 2 b = s_{xy}/s_x^2 b = s x y / s x 2 のときだけ 0 0 0 になります。これが最小を与える b b b です。
回帰直線(y の x への回帰)
b = r s y / s x b = r\,s_y/s_x b = r s y / s x という形は、s x y = r s x s y s_{xy} = r\,s_x s_y s x y = r s x s y を代入すれば得られます。
「x x x が標準偏差1個ぶん増えると、y ^ \hat{y} y ^ は y y y の標準偏差の r r r 個ぶん増える」と読めます。
微分を使う方法でも同じ結果になります。
S S S を a a a と b b b でそれぞれ偏微分して 0 0 0 とおいた連立方程式(正規方程式 )を解くと、上の a a a 、b b b が得られます。
▶ 回帰直線を求める 例題
5人の勉強時間 x x x (時間)と得点 y y y (点)です。
x x x 2 2 2 4 4 4 6 6 6 8 8 8 10 10 10 y y y 50 50 50 60 60 60 55 55 55 75 75 75 80 80 80
平均は x ˉ = 30 / 5 = 6 \bar{x} = 30/5 = 6 x ˉ = 30/5 = 6 、y ˉ = 320 / 5 = 64 \bar{y} = 320/5 = 64 y ˉ = 320/5 = 64 。偏差は
x − x ˉ : − 4 , − 2 , 0 , 2 , 4 y − y ˉ : − 14 , − 4 , − 9 , 11 , 16 x - \bar{x}:\ -4,\ -2,\ 0,\ 2,\ 4 \qquad y - \bar{y}:\ -14,\ -4,\ -9,\ 11,\ 16 x − x ˉ : − 4 , − 2 , 0 , 2 , 4 y − y ˉ : − 14 , − 4 , − 9 , 11 , 16 s x y = 56 + 8 + 0 + 22 + 64 5 = 150 5 = 30 , s x 2 = 16 + 4 + 0 + 4 + 16 5 = 8 s_{xy} = \frac{56 + 8 + 0 + 22 + 64}{5} = \frac{150}{5} = 30, \qquad
s_x^2 = \frac{16 + 4 + 0 + 4 + 16}{5} = 8 s x y = 5 56 + 8 + 0 + 22 + 64 = 5 150 = 30 , s x 2 = 5 16 + 4 + 0 + 4 + 16 = 8 s y 2 = 196 + 16 + 81 + 121 + 256 5 = 670 5 = 134 s_y^2 = \frac{196 + 16 + 81 + 121 + 256}{5} = \frac{670}{5} = 134 s y 2 = 5 196 + 16 + 81 + 121 + 256 = 5 670 = 134 b = 30 8 = 3.75 , a = 64 − 3.75 × 6 = 41.5 b = \frac{30}{8} = 3.75, \qquad a = 64 - 3.75 \times 6 = 41.5 b = 8 30 = 3.75 , a = 64 − 3.75 × 6 = 41.5 回帰直線は y ^ = 41.5 + 3.75 x \hat{y} = 41.5 + 3.75x y ^ = 41.5 + 3.75 x 。相関係数は
r = 30 8 × 134 = 30 1072 ≈ 30 32.74 ≈ 0.916 r = \frac{30}{\sqrt{8 \times 134}} = \frac{30}{\sqrt{1072}} \approx \frac{30}{32.74} \approx 0.916 r = 8 × 134 30 = 1072 30 ≈ 32.74 30 ≈ 0.916 電卓で検算するなら、∑ x y = 2070 \sum xy = 2070 ∑ x y = 2070 から s x y = 2070 / 5 − 6 × 64 = 414 − 384 = 30 s_{xy} = 2070/5 - 6 \times 64 = 414 - 384 = 30 s x y = 2070/5 − 6 × 64 = 414 − 384 = 30 としても同じです。
図 6 点をドラッグして動かせる散布図(空いた所をクリックすると点が増える)。各点の残差を1辺とする正方形を描いてあり、その面積の合計が残差の2乗和 S。回帰直線は S を最小にする直線で、「自分で引いた直線と比べる」を押すと、どう引いても S が回帰直線より小さくならないことを確かめられる。
決定係数
平方完成した式で b = s x y / s x 2 b = s_{xy}/s_x^2 b = s x y / s x 2 とすると、第1項が消えて、残差の2乗和の最小値が残ります。
S min = n ( s y 2 − s x y 2 s x 2 ) = n s y 2 ( 1 − s x y 2 s x 2 s y 2 ) = n s y 2 ( 1 − r 2 ) S_{\min} = n\left(s_y^2 - \frac{s_{xy}^2}{s_x^2}\right)
= n\, s_y^2\left(1 - \frac{s_{xy}^2}{s_x^2 s_y^2}\right)
= n\, s_y^2\,(1 - r^2) S m i n = n ( s y 2 − s x 2 s x y 2 ) = n s y 2 ( 1 − s x 2 s y 2 s x y 2 ) = n s y 2 ( 1 − r 2 )
n s y 2 = ∑ ( y i − y ˉ ) 2 n s_y^2 = \sum (y_i - \bar{y})^2 n s y 2 = ∑ ( y i − y ˉ ) 2 は、x x x を使わずに「全員を平均 y ˉ \bar{y} y ˉ で予測した」ときの2乗誤差の合計です。
回帰直線を使うと、それが ( 1 − r 2 ) (1 - r^2) ( 1 − r 2 ) 倍に減る。
減った割合を決定係数 と呼びます。
決定係数
「y y y の変動のうち、x x x との直線関係で説明できる割合」と読みます。
上の例では r 2 ≈ 0.916 2 ≈ 0.840 r^2 \approx 0.916^2 \approx 0.840 r 2 ≈ 0.91 6 2 ≈ 0.840 で、得点のばらつきの約 84 % 84\% 84% が勉強時間で説明できる、となります。
(検算: 残差は 1.0 , 3.5 , − 9.0 , 3.5 , 1.0 1.0, 3.5, -9.0, 3.5, 1.0 1.0 , 3.5 , − 9.0 , 3.5 , 1.0 で、2乗和は 107.5 107.5 107.5 。1 − 107.5 / 670 ≈ 0.840 1 - 107.5/670 \approx 0.840 1 − 107.5/670 ≈ 0.840 。)
図 7 は、この検算を図にしたものです。
平均 ȳ = 64 だけで予測 2 4 6 8 10 40 60 80 +11 +16 −14 −4 −9 2乗の和 670 回帰直線 ŷ = 41.5 + 3.75x で予測 2 4 6 8 10 40 60 80 +1 +3.5 +3.5 +1 −9 2乗の和 107.5 R² = 1 − 107.5 ÷ 670 ≈ 0.840
図 7 例の5人について、平均 64 で予測したときのずれ(左)と、回帰直線で予測したときの残差(右)を縦の線分で描いた。ずれの2乗の和が 670 から 107.5 に減り、減った割合が決定係数 0.840 になることに注目。
R 2 = r 2 R^2 = r^2 R 2 = r 2 が成り立つのは、説明変数が1つの単回帰 の場合です。
説明変数が複数ある重回帰では、R 2 R^2 R 2 は上の左辺の式で定義します。
+ 4つのパラメータがあれば象が描ける 発展
物理学者フリーマン・ダイソンは、若いころフェルミに自分の理論計算を見せたときの話を書き残しています。
データとよく合っていると説明するダイソンに、フェルミは「その計算には調整できるパラメータがいくつあるのか」と尋ね、
4つだと答えると、友人フォン・ノイマンの言葉を引きました。
「パラメータが4つあれば象の形に合わせられる。5つあれば鼻を動かせる」。
説明変数を増やせば、R 2 R^2 R 2 は下がることがなく、いくらでも 1 に近づけられます。
当てはまりのよさは、それだけではモデルの正しさの証拠にならない。 重回帰を扱う章で、この問題への対処(自由度調整済み決定係数など)を扱います。
回帰の向き
x x x から y y y を予測する直線と、y y y から x x x を予測する直線は、一般に別の直線 です。
y y y から x x x を予測する回帰直線(x x x の y y y への回帰)は、役割を入れ替えて同じ計算をすれば
x ^ = c + d y , d = s x y s y 2 , c = x ˉ − d y ˉ \hat{x} = c + d\,y, \qquad d = \frac{s_{xy}}{s_y^2}, \qquad c = \bar{x} - d\,\bar{y} x ^ = c + d y , d = s y 2 s x y , c = x ˉ − d y ˉ
2つの直線は、どちらも平均の点 ( x ˉ , y ˉ ) (\bar{x}, \bar{y}) ( x ˉ , y ˉ ) を通りますが、傾きが違います。
最小にしている量が違うからです。y y y の x x x への回帰は縦方向 の残差を、
x x x の y y y への回帰は横方向 の残差を最小にしています。
y の x への回帰 x の y への回帰 平均の点
図 8 同じ散布図に対する2本の回帰直線。y の x への回帰(実線)は縦方向の、x の y への回帰(破線)は横方向の残差を最小にするので、傾きが異なる。どちらも平均の点を通る。
! y = a + bx を x について解いても、x の予測式にはならない つまずきやすい点
y ^ = a + b x \hat{y} = a + bx y ^ = a + b x を x = ( y − a ) / b x = (y - a)/b x = ( y − a ) / b と変形しても、それは「y y y から x x x を予測する最良の式」ではありません。
傾きを比べると、x x x を横軸にとった平面で
y の x への回帰の傾き = s x y s x 2 , x の y への回帰の傾き = 1 d = s y 2 s x y \text{y の x への回帰の傾き} = \frac{s_{xy}}{s_x^2}, \qquad
\text{x の y への回帰の傾き} = \frac{1}{d} = \frac{s_y^2}{s_{xy}} y の x への回帰の傾き = s x 2 s x y , x の y への回帰の傾き = d 1 = s x y s y 2 で、両者の比は
s x y / s x 2 s y 2 / s x y = s x y 2 s x 2 s y 2 = r 2 \frac{s_{xy}/s_x^2}{s_y^2/s_{xy}} = \frac{s_{xy}^2}{s_x^2 s_y^2} = r^2 s y 2 / s x y s x y / s x 2 = s x 2 s y 2 s x y 2 = r 2 ∣ r ∣ = 1 |r| = 1 ∣ r ∣ = 1 のとき、つまり点が完全に一直線に並ぶときだけ2本は一致します。
それ以外では、何から何を予測するのか に応じて、正しい向きの回帰直線を使ってください。
章末問題
問 1 基本 共分散と相関係数
次の5組のデータについて答えよ。
x x x 1 1 1 2 2 2 3 3 3 4 4 4 5 5 5 y y y 2 2 2 4 4 4 5 5 5 4 4 4 5 5 5
(1) 共分散 s x y s_{xy} s x y を求めよ。
(2) 相関係数 r r r を小数第2位まで求めよ。
解答を見る (1) 平均は x ˉ = 15 / 5 = 3 \bar{x} = 15/5 = 3 x ˉ = 15/5 = 3 、y ˉ = 20 / 5 = 4 \bar{y} = 20/5 = 4 y ˉ = 20/5 = 4 。偏差と積は
x − x ˉ x - \bar{x} x − x ˉ − 2 -2 − 2 − 1 -1 − 1 0 0 0 1 1 1 2 2 2 y − y ˉ y - \bar{y} y − y ˉ − 2 -2 − 2 0 0 0 1 1 1 0 0 0 1 1 1 積 4 4 4 0 0 0 0 0 0 0 0 0 2 2 2
s x y = 4 + 0 + 0 + 0 + 2 5 = 6 5 = 1.2 s_{xy} = \frac{4 + 0 + 0 + 0 + 2}{5} = \frac{6}{5} = 1.2 s x y = 5 4 + 0 + 0 + 0 + 2 = 5 6 = 1.2 「積の平均 − 平均の積」でも検算します。∑ x y = 2 + 8 + 15 + 16 + 25 = 66 \sum xy = 2 + 8 + 15 + 16 + 25 = 66 ∑ x y = 2 + 8 + 15 + 16 + 25 = 66 なので
s x y = 66 5 − 3 × 4 = 13.2 − 12 = 1.2 s_{xy} = \frac{66}{5} - 3 \times 4 = 13.2 - 12 = 1.2 s x y = 5 66 − 3 × 4 = 13.2 − 12 = 1.2 (2) 分散は
s x 2 = 4 + 1 + 0 + 1 + 4 5 = 2 , s y 2 = 4 + 0 + 1 + 0 + 1 5 = 1.2 s_x^2 = \frac{4 + 1 + 0 + 1 + 4}{5} = 2, \qquad s_y^2 = \frac{4 + 0 + 1 + 0 + 1}{5} = 1.2 s x 2 = 5 4 + 1 + 0 + 1 + 4 = 2 , s y 2 = 5 4 + 0 + 1 + 0 + 1 = 1.2 r = 1.2 2 × 1.2 = 1.2 2.4 ≈ 1.2 1.549 ≈ 0.77 r = \frac{1.2}{\sqrt{2 \times 1.2}} = \frac{1.2}{\sqrt{2.4}} \approx \frac{1.2}{1.549} \approx 0.77 r = 2 × 1.2 1.2 = 2.4 1.2 ≈ 1.549 1.2 ≈ 0.77 答: (1) s x y = 1.2 s_{xy} = 1.2 s x y = 1.2 (2) r ≈ 0.77 r \approx 0.77 r ≈ 0.77
問 2 標準 要約統計量から回帰直線
ある集団の身長 x x x (c m \mathrm{cm} cm )と体重 y y y (k g \mathrm{kg} kg )について、次の値が得られている。
x ˉ = 170 , y ˉ = 62 , s x = 6 , s y = 8 , r = 0.6 \bar{x} = 170, \quad \bar{y} = 62, \quad s_x = 6, \quad s_y = 8, \quad r = 0.6 x ˉ = 170 , y ˉ = 62 , s x = 6 , s y = 8 , r = 0.6 (1) y y y の x x x への回帰直線を求めよ。
(2) 身長 180 c m 180\unit{cm} 180 cm の人の体重を予測せよ。
(3) 決定係数を求め、その意味を述べよ。
解答を見る (1) 傾きは
b = r s y s x = 0.6 × 8 6 = 0.8 b = r\,\frac{s_y}{s_x} = 0.6 \times \frac{8}{6} = 0.8 b = r s x s y = 0.6 × 6 8 = 0.8 回帰直線は平均の点を通るので
a = y ˉ − b x ˉ = 62 − 0.8 × 170 = 62 − 136 = − 74 a = \bar{y} - b\,\bar{x} = 62 - 0.8 \times 170 = 62 - 136 = -74 a = y ˉ − b x ˉ = 62 − 0.8 × 170 = 62 − 136 = − 74 y ^ = − 74 + 0.8 x \hat{y} = -74 + 0.8x y ^ = − 74 + 0.8 x 切片 − 74 -74 − 74 は「身長 0 c m 0\unit{cm} 0 cm の人の体重」を意味するわけではありません。
データのある範囲(170 c m 170\unit{cm} 170 cm 前後)で直線を当てはめた結果、式の上でそうなっているだけです。
(2)
y ^ = − 74 + 0.8 × 180 = − 74 + 144 = 70 k g \hat{y} = -74 + 0.8 \times 180 = -74 + 144 = 70\unit{kg} y ^ = − 74 + 0.8 × 180 = − 74 + 144 = 70 kg 平均より 10 c m 10\unit{cm} 10 cm 高いので、0.8 × 10 = 8 k g 0.8 \times 10 = 8\unit{kg} 0.8 × 10 = 8 kg 重いと予測した、と見ても同じです。
(3) 単回帰なので
R 2 = r 2 = 0.6 2 = 0.36 R^2 = r^2 = 0.6^2 = 0.36 R 2 = r 2 = 0. 6 2 = 0.36 体重のばらつき(分散)のうち、身長との直線関係で説明できるのは 36 % 36\% 36% で、残り 64 % 64\% 64% は身長以外の要因によるもの、という意味です。
答: (1) y ^ = − 74 + 0.8 x \hat{y} = -74 + 0.8x y ^ = − 74 + 0.8 x (2) 70 k g 70\unit{kg} 70 kg (3) 0.36 0.36 0.36
問 3 発展 回帰の向きと平均への回帰
父親の身長 x x x と息子の身長 y y y (いずれも c m \mathrm{cm} cm )について
x ˉ = y ˉ = 170 , s x = s y = 6 , r = 0.5 \bar{x} = \bar{y} = 170, \qquad s_x = s_y = 6, \qquad r = 0.5 x ˉ = y ˉ = 170 , s x = s y = 6 , r = 0.5 であった。
(1) 父親の身長が 182 c m 182\unit{cm} 182 cm のとき、息子の身長を回帰直線で予測せよ。
(2) 息子の身長が 182 c m 182\unit{cm} 182 cm のとき、父親の身長を回帰直線で予測せよ。
(3) (1) の回帰直線の傾き b b b と、x x x の y y y への回帰直線 x ^ = c + d y \hat{x} = c + dy x ^ = c + d y の係数 d d d について、一般に b d = r 2 bd = r^2 b d = r 2 が成り立つことを示せ。
(4) (1) と (2) の結果がどちらも 182 182 182 より平均に近くなる理由を説明せよ。
解答を見る (1) b = r s y / s x = 0.5 × 6 / 6 = 0.5 b = r\,s_y/s_x = 0.5 \times 6/6 = 0.5 b = r s y / s x = 0.5 × 6/6 = 0.5 。平均の点を通るので a = 170 − 0.5 × 170 = 85 a = 170 - 0.5 \times 170 = 85 a = 170 − 0.5 × 170 = 85 。
y ^ = 85 + 0.5 × 182 = 85 + 91 = 176 c m \hat{y} = 85 + 0.5 \times 182 = 85 + 91 = 176\unit{cm} y ^ = 85 + 0.5 × 182 = 85 + 91 = 176 cm (2) 役割を入れ替えます。d = r s x / s y = 0.5 d = r\,s_x/s_y = 0.5 d = r s x / s y = 0.5 、c = 170 − 0.5 × 170 = 85 c = 170 - 0.5 \times 170 = 85 c = 170 − 0.5 × 170 = 85 。
x ^ = 85 + 0.5 × 182 = 176 c m \hat{x} = 85 + 0.5 \times 182 = 176\unit{cm} x ^ = 85 + 0.5 × 182 = 176 cm (1) の式 y = 85 + 0.5 x y = 85 + 0.5x y = 85 + 0.5 x を x x x について解いて x = 2 y − 170 x = 2y - 170 x = 2 y − 170 とすると 2 × 182 − 170 = 194 c m 2 \times 182 - 170 = 194\unit{cm} 2 × 182 − 170 = 194 cm になりますが、
これは x x x の予測として正しくありません。予測に使うのは x x x の y y y への回帰直線です。
(3)
b d = s x y s x 2 ⋅ s x y s y 2 = s x y 2 s x 2 s y 2 = ( s x y s x s y ) 2 = r 2 b\,d = \frac{s_{xy}}{s_x^2}\cdot\frac{s_{xy}}{s_y^2} = \frac{s_{xy}^2}{s_x^2 s_y^2} = \left(\frac{s_{xy}}{s_x s_y}\right)^2 = r^2 b d = s x 2 s x y ⋅ s y 2 s x y = s x 2 s y 2 s x y 2 = ( s x s y s x y ) 2 = r 2 この問題では 0.5 × 0.5 = 0.25 = 0.5 2 0.5 \times 0.5 = 0.25 = 0.5^2 0.5 × 0.5 = 0.25 = 0. 5 2 で、確かに成り立っています。
(4) 標準化して考えます。s x = s y s_x = s_y s x = s y なので、回帰直線は
y ^ − y ˉ s y = r x − x ˉ s x \frac{\hat{y} - \bar{y}}{s_y} = r\,\frac{x - \bar{x}}{s_x} s y y ^ − y ˉ = r s x x − x ˉ と書けます。父親が平均より標準偏差 2 2 2 個ぶん高い(z = 12 / 6 = 2 z = 12/6 = 2 z = 12/6 = 2 )とき、
息子の予測は標準偏差 r × 2 = 1 r \times 2 = 1 r × 2 = 1 個ぶんだけ高い 176 c m 176\unit{cm} 176 cm です。
∣ r ∣ < 1 |r| \lt 1 ∣ r ∣ < 1 である限り、予測値は必ず平均の側に引き寄せられます。
これは、息子の身長が父親の身長だけでは決まらず、他の要因によるばらつきを含むからです。
予測はそのばらつきを平均して出すので、極端さが割り引かれます。
向きを逆にしても同じ理屈で、背の高い息子の父親は、平均すると息子ほどは極端ではありません。
この現象を平均への回帰 と呼びます。「世代を経るごとに身長の散らばりが縮む」という意味ではありません
(実際、この問題では s x = s y s_x = s_y s x = s y で散らばりは同じです)。
答: (1) 176 c m 176\unit{cm} 176 cm (2) 176 c m 176\unit{cm} 176 cm