tecktom.com

四分位数と順序統計量 — 「3つ選んで小さい順に並べる」と四分位が一致する理由

2026年9月23日教養

問いは木下が出したもので、答えは Claude Code と調べて書いたものです。

2026-09-23 の会話(「4n+3 項の等差数列から3つをランダムに選ぶと、その期待値が第一・第二・ 第三四分位になる」という話題)を骨組みに、裏を取って再構成した教材。噂として聞いた主張が どこまで正しいのか、どう一般化すると正しい定理になるのか、正規分布や他の対称分布では何が 残って何が壊れるのかを一本の筋で書く。検証スクリプトは 四分位数と順序統計量/四分位_基本照合同/理論検証同/補遺 に置いた(すべて全列挙の厳密計算か数値積分で、モンテカルロは検算にしか使っていない)。

組版した TeX 版(26頁・図6枚・例題5題)が 四分位数と順序統計量/四分位数と順序統計量 にある(2026-09-23 作成)。証明を定理・命題の形で書き下し、例題と完全解答、重要度バッジ、 参考文献を加えてある。この md は調査の一次記録で、読み物として通すなら TeX 版のほうがよい。

0. 結論の地図

聞いた話は正しい。しかも 4n+3 という条件は必要ではなく、主張はもっと広い定理の特別な場合 である。全体像は3層に分かれる。

主張 成立範囲
① 確率スケールの普遍則 mm 個を抽出したとき E[F(X(k))]=k/(m+1)E[F(X_{(k)})] = k/(m+1) 任意の連続分布。分布形に一切依らない
② 値スケールの等式 E[X(k)]=k(N+1)/(m+1)E[X_{(k)}] = k(N+1)/(m+1) 等差数列(=離散一様)と連続一様分布のみ
③ 見た目の綺麗さ 3つの期待値が数列の項そのものになる N=4n+3N = 4n+3 のときだけ

木下が聞いたのは③の層の話で、そこが目を引くのは「期待値が分数にならず、元の数列の項に ぴったり乗る」からである。しかし③は②の系にすぎず、②の本質は①にある。そして四分位という 定義が自然に見える理由も、突き詰めると①に行き着く。四分位はもともと確率スケール(累積確率 1/4, 2/4, 3/4)で定義された量であり、①はその確率スケールの等分が標本のサイズに依らず 成り立つと言っている。等差数列で値スケールの等式②まで綺麗に成り立つのは、一様分布の分位関数 F1F^{-1} が直線だから、確率の等分がそのまま値の等分に移るという、ただそれだけの事情である。

木下の言い方(「真ん中のやつを外して真ん中をとる」)も、実は③と同じ事実の別の見え方であり、 §2 でそれを確かめる。

1. 離散版 — 主張の厳密化と証明

1.1 主張

1 から NN までの整数(一般の等差数列でもよい。期待値は線形なので初項と公差は素通りする)から 非復元で mm 個を選び、小さい順に X(1)<X(2)<<X(m)X_{(1)} < X_{(2)} < \cdots < X_{(m)} と並べる。このとき

E[X(k)]=k(N+1)/(m+1)(k=1,,m)E[X_{(k)}] = k(N+1)/(m+1) \qquad (k = 1, \dots, m)

が成り立つ。m=3m = 3 と置けば E[X(k)]=k(N+1)/4E[X_{(k)}] = k(N+1)/4 で、k=1,2,3k = 1, 2, 3 がそれぞれ「N+1N+1 の 1/4, 2/4, 3/4」 の位置を指す。N=4n+3N = 4n+3 なら N+1=4(n+1)N+1 = 4(n+1) なので、3つの期待値は n+1,2n+2,3n+3n+1, 2n+2, 3n+3 という整数に なり、元の数列の項と一致する。これが聞いた話の正体である。

四分位数と順序統計量/四分位_理論検証 の (1) で、N=212N = 2\ldots12m=16m = 1\ldots6k=1mk = 1\ldots m の全組み合わせについて、 全列挙した厳密な有理数と公式を照合し、すべて一致することを確認した。

1.2 証明(間隙の対称性)

選ばれた mm 個が NN 個の並びを m+1m+1 個の隙間に切り分ける、と見るのが一番早い。

G0=X(1)1,Gi=X(i+1)X(i)1 (i=1,,m1),Gm=NX(m)G_0 = X_{(1)} - 1, \quad G_i = X_{(i+1)} - X_{(i)} - 1 \ (i = 1, \dots, m-1), \quad G_m = N - X_{(m)}

と定義すると、これらは選ばれなかった NmN - m 個の分配であり、G0+G1++Gm=NmG_0 + G_1 + \cdots + G_m = N - m を満たす。 ここで N+1N+1 個の位置を円環に並べて m+1m+1 個を選び、そのうち1つを「切れ目」と決めて直線に開く、 という見方をすると、m+1m+1 個の隙間は回転対称なので同分布になる。よって

E[Gi]=(Nm)/(m+1)E[G_i] = (N-m)/(m+1) (すべての ii について同じ)

が言える。X(k)=k+G0+G1++Gk1X_{(k)} = k + G_0 + G_1 + \cdots + G_{k-1} だから

E[X(k)]=k+k(Nm)/(m+1)=k(m+1+Nm)/(m+1)=k(N+1)/(m+1)E[X_{(k)}] = k + k(N-m)/(m+1) = k(m+1+N-m)/(m+1) = k(N+1)/(m+1)

となる。証明のどこにも「NN が 4 で割って 3 余る」は現れない。証明が使っているのは隙間の交換可能性 だけであり、これが主張の本当の中身である。

1.3 非復元であることは本質的

同じ数を2回選んでよい(復元抽出)と話は壊れる。N=7N = 7, m=3m = 3 で実際に計算すると、非復元なら (2,4,6)(2, 4, 6) ときれいに揃うのに対し、復元だと (16/7,4,40/7)(2.29,4,5.71)(16/7, 4, 40/7) \approx (2.29, 4, 5.71) となり、両端が 中央へ寄る。復元抽出では同じ値が重複して「並べ替えると差が詰まる」ので、両端の期待値が内側へ 食い込むためである。中央値だけは対称性から 4 のまま動かない。

2. なぜ N = 4n+3 が「真ん中を外して真ん中」と噛み合うのか

木下の言った操作、つまり「中央値を取り、その中央値を外して左右の半分に分け、各半分でまた 中央値を取る」を再帰と見て、N=4n+3N = 4n+3 で実行してみる。N=4n+3N = 4n+3 は奇数なので中央値は 2n+22n+2 番目の 項そのもので、これを外すと左右にちょうど 2n+12n+1 項ずつ残る。2n+12n+1 もまた奇数なので、それぞれの 中央値も項そのものであり、位置は n+1n+13n+33n+3 になる。これは §1 の E[X(k)]=k(n+1)E[X_{(k)}] = k(n+1) と完全に 一致する。

つまり N3(mod4)N \equiv 3 \pmod{4} は「2回続けて奇数個に割り切れる」ための条件であって、四分位の定義が そこで特別になるわけではない。この構造は深さ方向に一般化できる。四分位数と順序統計量/四分位_補遺 の (A) で、深さ dd の再帰(2d2^d 分位、つまり m=2d1m = 2^d - 1 個の抽出に対応)と公式 k(N+1)/(m+1)k(N+1)/(m+1) を突き合わせた。

深さ dd 分位 再帰と期待値が一致し、かつ全て整数になる NN
2 四分位 N3(mod4)N \equiv 3 \pmod{4}、つまり N=4n+3N = 4n+3 N=72,4,6N=7 \to 2, 4, 6
3 八分位 N7(mod8)N \equiv 7 \pmod{8}、つまり N=8n+7N = 8n+7 N=152,4,6,8,10,12,14N=15 \to 2, 4, 6, 8, 10, 12, 14
4 十六分位 N15(mod16)N \equiv 15 \pmod{16} N=312,4,,30N=31 \to 2, 4, \dots, 30

いずれも「N+1N+12d2^d で割り切れる」という同じ条件である。四分位の 4n+34n+3d=2d = 2 の場合にすぎない。 なお NN がこの条件を外れると、再帰の結果は期待値と一致しなくなる(d=2d = 2 では 3〜79 の範囲で 38 個の NN が不一致で、これは偶数の NN すべてに当たる)。偶数のときに半分の切り方が曖昧になり、流儀が 割れるという、四分位の定義論争そのものがここに顔を出している。

3. 世の中の四分位の定義と照合する

四分位の定義は一つではない。numpy が 9 種類、R が同じ 9 種類(Hyndman–Fan の type 1〜9)を 実装しており、高校数学 I の定義や Tukey のヒンジも別物である。E[X(k)]=k(N+1)/4E[X_{(k)}] = k(N+1)/4どの流儀が 一致するのかN=331N = 3\ldots31 で総当たりした(四分位数と順序統計量/四分位_理論検証 の (2))。

流儀 位置の取り方 期待値と一致する NN
Weibull(Hyndman–Fan type 6, numpy weibull p(N+1)p(N+1) すべての NN
高校数学 I(Moore–McCabe。中央値を除いて半分の中央値) NN が奇数のときすべて
inverted_cdf (type 1) / averaged_inverted_cdf (type 2) pN\lceil pN \rceil 近辺 N3(mod4)N \equiv 3 \pmod{4} のみ
Tukey のヒンジ(中央値を両半分に含める) 一致する NN は存在しない
linear (type 7, numpy と Excel の既定) (N1)p+1(N-1)p + 1 一致する NN は存在しない
hazen (type 5), median_unbiased (type 8), normal_unbiased (type 9) ほか 一致する NN は存在しない

読み取れることが3つある。

第一に、期待値と常に一致する唯一の流儀は Weibull(type 6)である。これは偶然ではなく、 type 6 の定義が「位置 p(N+1)p(N+1)」そのもので、公式 k(N+1)/4k(N+1)/4 と字面から同じだからである。水文学や 信頼性工学で使われる Weibull プロッティング位置 k/(N+1)k/(N+1) は、まさに「順序統計量の期待値が累積確率 のどこに来るか」という §4 の①から導かれたもので、ここで話が繋がる。

第二に、高校の定義は NN が奇数である限り常に期待値と一致するN=2m+1N = 2m+1 のとき下半分は mm 個で、 その中央値は (m+1)/2=(N+1)/4(m+1)/2 = (N+1)/4 になるからである。4n+34n+3 だけが特別なのではなく、4n+14n+1 でも一致する (ただし値は半整数になり、元の項には乗らない。N=5N = 5 なら 3/2, 3, 9/2)。日本の高校が採用している 「中央値を除いて半分の中央値」という素朴な定義は、この意味で期待値として正しい位置を指している。

第三に、Tukey のヒンジは一度も一致しない。奇数個のとき中央値を両方の半分に含めるので、 ヒンジが中央へ寄りすぎるためである。箱ひげ図の元祖である Tukey の流儀が期待値の意味では外れる、 というのは少し意外な結果だが、Tukey は手計算での書きやすさを優先していたので筋は通っている。

4. 連続分布へ — 何が普遍で、何が一様分布固有か

4.1 普遍に残るもの(確率スケール)

FF を連続な累積分布関数とし、mm 個を独立に抽出する。確率積分変換により F(X)F(X)U(0,1)U(0,1) に従い、 順序を保つ変換なので F(X(k))=U(k)F(X_{(k)}) = U_{(k)} となる。一様分布の順序統計量は Beta 分布に従い

U(k)Beta(k,mk+1),E[U(k)]=k/(m+1)U_{(k)} \sim \mathrm{Beta}(k, m-k+1), \quad E[U_{(k)}] = k/(m+1)

だから、どんな連続分布でも E[F(X(k))]=k/(m+1)E[F(X_{(k)})] = k/(m+1) が成り立つ。m=3m = 3 なら 1/4, 2/4, 3/4 である。 四分位数と順序統計量/四分位_理論検証 の (3) で、正規・指数・対数正規・t(2)t(2)・U字型 Beta(1/2,1/2)\mathrm{Beta}(1/2,1/2)・ 歪んだ Beta(2,5)\mathrm{Beta}(2,5) の6分布について 40 万回の抽出で確かめ、いずれも 0.25, 0.50, 0.75 に乗ることを 確認した。歪んでいようが裾が重かろうが、3点を抽出すれば、その3点は分布の確率質量を平均的に 4等分する。これが「四分位の定義は自然だ」と言えるための、分布によらない根拠である。

4.2 壊れるもの(値スケール)

値そのものの期待値は

E[X(k)]=E[F1(U(k))]=01F1(u)m!(k1)!(mk)!uk1(1u)mkduE[X_{(k)}] = E[F^{-1}(U_{(k)})] = \int_0^1 F^{-1}(u) \cdot \frac{m!}{(k-1)!(m-k)!} \cdot u^{k-1}(1-u)^{m-k}\, du

で、これが四分位 F1(k/4)F^{-1}(k/4) と一致するのは F1F^{-1}線形のとき、すなわち一様分布のときに限られる。 一般には E[F1(U(k))]F1(E[U(k)])E[F^{-1}(U_{(k)})] \neq F^{-1}(E[U_{(k)}]) であり、両者のずれはイェンセンの不等式が支配する。 F1F^{-1} が該当領域で凸なら期待値が四分位より外側へ、凹なら内側へずれる。

数値積分の結果を並べる(四分位数と順序統計量/四分位_基本照合)。

分布 E[X(1)]E[X_{(1)}] Q1Q_1 E[X(2)]E[X_{(2)}] Q2Q_2 E[X(3)]E[X_{(3)}] Q3Q_3 E[X(3)]Q3E[X_{(3)}] - Q_3
一様 U(0,1) 0.2500 0.2500 0.5000 0.5000 0.7500 0.7500 ±0
U字 Beta(1/2,1/2) 0.1960 0.1464 0.5000 0.5000 0.8040 0.8536 −0.0496
三角分布(対称) 0.3250 0.3536 0.5000 0.5000 0.6750 0.6464 +0.0286
半円(Wigner) −0.4323 −0.4040 0 0 0.4323 0.4040 +0.0283
余弦分布 −0.9740 −0.8317 0 0 0.9740 0.8317 +0.1423
正規 N(0,1) −0.8463 −0.6745 0 0 0.8463 0.6745 +0.1718
ロジスティック −1.5000 −1.0986 0 0 1.5000 1.0986 +0.4014
ラプラス −1.1250 −0.6931 0 0 1.1250 0.6931 +0.4319
t (df=3) −1.2405 −0.7649 0 0 1.2405 0.7649 +0.4756
t (df=2) −1.6661 −0.8165 0 0 1.6661 0.8165 +0.8496
指数 Exp(1) 0.3333 0.2877 0.8333 0.6931 1.8333 1.3863 +0.4470
対数正規 (σ=1) 0.5599 0.5094 1.2519 1.0000 3.1344 1.9630 +1.1714

4.3 対称分布で残るのは中央値だけ

表の中段を見ると、対称な分布(三角・半円・余弦・正規・ロジスティック・ラプラス・t・Beta(1/2,1/2)) では E[X(2)]E[X_{(2)}] が常に真の中央値と一致する。これは X(2)X_{(2)} の分布が分布の中心について対称に なるからで、mm が奇数なら常に成り立つ。「3つ選んで真ん中を取る」という操作は、対称分布に対して 中央値の不偏推定になっている。

一方で E[X(1)]E[X_{(1)}]E[X(3)]E[X_{(3)}] は対称性だけでは救われない。対称性は中央値の周りの符号を揃える だけで、F1F^{-1} の曲がり方までは制御しないからである。裾が重いほど最大値・最小値は外へ引っ張られ、 t(2)t(2) では E[X(3)]=1.666E[X_{(3)}] = 1.666 に対し Q3=0.817Q_3 = 0.817 と 2 倍以上の開きが出る。逆に U 字型の Beta(1/2,1/2)\mathrm{Beta}(1/2,1/2) では内側へずれる(E[X(3)]=0.804<Q3=0.854E[X_{(3)}] = 0.804 < Q_3 = 0.854)。質量が両端に張り付いている分布では、 3点のうち最大のものは端まで行かないことが多く、期待値が Q3Q_3 に届かないためである。

4.4 ずれの向きは分位関数の凸性で決まる

上の観察を対称 Beta(a, a) 族で系統的に確かめた(四分位数と順序統計量/四分位_理論検証 の (5))。

aa 0.3 0.5 0.7 0.9 1.0 1.1 1.5 2 3 5 10
E[X(3)]Q3E[X_{(3)}] - Q_3 −0.098 −0.050 −0.021 −0.005 0 +0.004 +0.014 +0.019 +0.022 +0.021 +0.017
u=0.75u = 0.75 での F1F^{-1} 直線

符号は F1F^{-1} の凸凹と完全に対応しており、イェンセンの不等式の予想どおりである。さらに aa について方程式 E[X(3)]=Q3E[X_{(3)}] = Q_3 を数値的に解くと a=1.000000a = 1.000000 のみが解で、対称 Beta 族の中では 一様分布が唯一であることも確認した。

ただし「値スケールの一致は一様分布に限る」と言い切ると言い過ぎになる。非対称な分布を許せば、 3つの等式のうち1つだけが偶然成り立つ分布はいくらでも作れる。たとえば Beta(1.5,1.1503)\mathrm{Beta}(1.5, 1.1503)E[X(3)]Q3E[X_{(3)}] - Q_3 が機械精度でゼロだが、E[X(1)]Q1=0.0229E[X_{(1)}] - Q_1 = -0.0229E[X(2)]Q2=0.0101E[X_{(2)}] - Q_2 = -0.0101 は外れる (四分位数と順序統計量/四分位_理論検証 の (6))。正しい言明は「3つ同時に一致するのは一様分布」である。

4.5 正規分布の閉じた形

正規分布については閉形式が知られている。3個の標準正規変量の最大値の期待値は

E[X(3)]=3/(2π)=0.8462843753E[X_{(3)}] = 3/(2\sqrt{\pi}) = 0.8462843753\ldots

で、数値積分と 10 桁一致し、200 万回のモンテカルロでも 0.8458 と合う。一方 $Q_3 = \Phi^{-1}(0.75) = 0.6744897502$ なので、比は E[X(3)]/Q3=1.2547E[X_{(3)}]/Q_3 = 1.2547 である。言い換えると、3点の最大値の期待値は 正規分布の 75 パーセンタイルではなく、Φ(0.8463)=80.1\Phi(0.8463) = 80.1 パーセンタイルに位置する。この 5 パーセンタイルぶんのずれが、一様分布を離れた瞬間に生じる誤差の大きさである。

5. 副産物 — レンジとジニ平均差の恒等式

3点抽出では、最大と最小の期待値の差に簡潔な表現がある。X(3)X_{(3)} の密度と X(1)X_{(1)} の密度の差が 3u23(1u)2=3(2u1)3u^2 - 3(1-u)^2 = 3(2u-1) となることから

E[X(3)]E[X(1)]=301F1(u)(2u1)du=32GMDE[X_{(3)}] - E[X_{(1)}] = 3\int_0^1 F^{-1}(u)(2u-1)\, du = \frac{3}{2}\cdot\mathrm{GMD}

が導かれる。ここで GMD=EX1X2=201F1(u)(2u1)du\mathrm{GMD} = E|X_1 - X_2| = 2\int_0^1 F^{-1}(u)(2u-1)\, duジニ平均差、つまり独立な 2標本の差の絶対値の期待値である。四分位数と順序統計量/四分位_理論検証 の (4) で 8 分布について 数値的に確認し、すべて一致した。

この量を四分位範囲 IQR と比べると、分布の裾の重さを測る指標になる。

分布 Beta(1/2,1/2)\mathrm{Beta}(1/2,1/2) 一様 三角 正規 ロジスティック / 指数 t(3)t(3) ラプラス
(E[X(3)]E[X(1)])/IQR(E[X_{(3)}] - E[X_{(1)}]) / \mathrm{IQR} 0.860 1.000 1.195 1.255 1.365 1.622 1.623

一様分布でちょうど 1 になり、裾が重くなるほど大きくなる。この比は「3点の広がりが四分位範囲の 何倍か」を測っており、正規分布なら 1.25 倍である。

6. 実用上の帰結

6.1 プロッティング位置の選び方

Q-Q プロットでは kk 番目の順序統計量を累積確率 pkp_k に対応づけて描く。この pkp_k の選び方には 流儀があり、§4.1 の①から素直に出るのは Weibull の k/(n+1)k/(n+1) である。しかし Q-Q プロットで 本当に欲しいのは E[X(k)]E[X_{(k)}] であって E[F(X(k))]E[F(X_{(k)})] ではない。正規分布に対しては F1F^{-1} が非線形なので、 k/(n+1)k/(n+1) を使うと端が合わなくなる。四分位数と順序統計量/四分位_補遺 の (C) で最小値の期待値と各流儀を 比べた。

nn 真の E[X(1)]E[X_{(1)}] Weibull k/(n+1)k/(n+1) Blom (k3/8)/(n+1/4)(k-3/8)/(n+1/4) Hazen (k1/2)/n(k-1/2)/n Tukey (k1/3)/(n+1/3)(k-1/3)/(n+1/3)
3 −0.84628 −0.67449 −0.86942 −0.96742 −0.84162
10 −1.53875 −1.33518 −1.54664 −1.64485 −1.51793
20 −1.86748 −1.66839 −1.86824 −1.95996 −1.84133

正規分布に対しては Blom の位置が n=20n = 20 で 4 桁目まで合っており、R の qqnorm が Blom を 既定に採っている理由がここにある(n10n \le 10 では Blom を使う)。確率スケールの等分が欲しいなら Weibull、値スケールで正規の期待値に合わせたいなら Blom、と使い分けるのが正しい。

6.2 推定量としての性能

「3点しかないとき、真の Q3Q_3 を推定するのに最大値 X(3)X_{(3)} を使ってよいか」を 40 万回の抽出で調べた (四分位数と順序統計量/四分位_補遺 の (D))。

分布 推定量 バイアス RMSE
一様 X(3)X_{(3)}(最大値) −0.0003 0.193
一様 type 7 の補間 −0.125 0.224
正規 X(3)X_{(3)}(最大値) +0.171 0.768
正規 type 7 の補間 −0.251 0.674
指数 X(3)X_{(3)}(最大値) +0.446 1.250
指数 type 7 の補間 −0.053 0.785

一様分布では最大値が無バイアスかつ RMSE も小さく、理論どおりである。しかし正規・指数では 最大値のバイアスが大きく、RMSE でも type 7 の補間に負ける。「3点の順序統計量が四分位だ」と いう美しい対応は、推定の実務としてはそのまま使えない。

6.3 「1/4」は平均であって中央値ではない

最後に一つ注意がある。F(X(k))Beta(k,4k)F(X_{(k)}) \sim \mathrm{Beta}(k, 4-k)平均k/4k/4 だが、中央値は違う (四分位数と順序統計量/四分位_補遺 の (B))。

kk F(X(k))F(X_{(k)}) の平均 中央値 最頻値
1 0.2500 0.2063 0
2 0.5000 0.5000 0.5
3 0.7500 0.7937 1

X(1)X_{(1)} が典型的に居るのは 20.6 パーセンタイルであり、最頻的には 0 パーセンタイル(分布の左端) である。つまり**「3点を選ぶと 25, 50, 75 パーセンタイルに来る」という言い方は、平均を取って はじめて正しくなる**。この違いを意識しないと、少数標本での議論を誤る。§6.1 で Blom などの プロッティング位置が競合するのも、結局は「平均で合わせるか、中央値で合わせるか」という選択の 問題である。

7. まとめ

聞いた話は正しく、証明も難しくない。整理し直すとこうなる。

  1. 等差数列 NN 項から mm 個を非復元抽出すると、E[X(k)]=k(N+1)/(m+1)E[X_{(k)}] = k(N+1)/(m+1) が成り立つ。証明は 「選ばれなかった項が作る m+1m+1 個の隙間が交換可能である」ことだけを使う。
  2. m=3m = 3 のとき右辺は k(N+1)/4k(N+1)/4 で、N=4n+3N = 4n+3 なら整数になって元の項に乗る。4n+34n+3 という条件は 「2回続けて奇数個に割れる」ための条件であり、木下の言う「真ん中を外して真ん中をとる」という 再帰が2段とも綺麗に決まる場合にほかならない。八分位なら 8n+78n+7、十六分位なら 16n+1516n+15 と続く。
  3. 世の四分位の定義のうち、この期待値と常に一致するのは Weibull(type 6)だけである。日本の 高校数学 I の定義は NN が奇数のときすべて一致する。Tukey のヒンジと numpy の既定である type 7 は一度も一致しない。
  4. 連続分布へ移すと、確率スケールの主張 E[F(X(k))]=k/4E[F(X_{(k)})] = k/4 は分布形に依らず普遍に成り立つ。 四分位という定義が自然に見える根拠はここにある。
  5. 値スケールの一致は一様分布(=等差数列)に固有である。対称分布では中央値だけが救われ、 両端は裾の重さに応じて外(裾が重い)か内(U 字型)へずれる。正規分布では E[X(3)]=3/(2π)=0.846E[X_{(3)}] = 3/(2\sqrt{\pi}) = 0.846 で、これは 75 でなく 80.1 パーセンタイルにあたる。
  6. 副産物として E[X(3)]E[X(1)]E[X_{(3)}] - E[X_{(1)}] = (3/2)・ジニ平均差という恒等式が出る。これを IQR で割った値は 一様で 1、正規で 1.25、ラプラスで 1.62 と、裾の重さの指標になる。

結局のところ、「四分位の定義は自然だ」という直観は正しいが、その自然さが宿っているのは 値の等分ではなく確率の等分のほうである。等差数列という一様な土俵の上では両者が一致するので、 値スケールの偶然の綺麗さ(4n+3)が目に飛び込んでくる。土俵を正規分布に移した瞬間に値スケールの 等式は崩れ、確率スケールの等式だけが残る。この残ったほうが定義の本体である。

参考

← ふとした疑問の一覧へ