ベルヌーイ分布とは、成功確率 p p p のもとで X = 1 X = 1 X = 1 (成功)または X = 0 X = 0 X = 0 (失敗)を取る確率変数 の分布です。0 < p < 1 0 < p < 1 0 < p < 1 なら 0 0 0 と 1 1 1 の2点に正の確率を持ち、不確実性を持つ分布の最小構成になります。一方、p = 0 p = 0 p = 0 または p = 1 p = 1 p = 1 もベルヌーイ分布に含まれ、この両端では結果が1点に確定する退化分布になります。
定義
確率変数 X X X がベルヌーイ分布に従うとき、候補となる値は 0 0 0 と 1 1 1 で、それぞれの確率は次の通りです。確率が正の値だけをsupport(台)と呼ぶ場合、0 < p < 1 0 < p < 1 0 < p < 1 ではsupportは2点、p = 0 p = 0 p = 0 または p = 1 p = 1 p = 1 ではsupportは1点です。
p p p を「成功確率」と呼びます。この 2 式を 1 本の式にまとめると、確率質量関数(PMF: probability mass function)は次のように書けます。
k = 1 k = 1 k = 1 を代入すると p 1 ( 1 − p ) 0 = p p^1 (1-p)^0 = p p 1 ( 1 − p ) 0 = p 、k = 0 k = 0 k = 0 を代入すると p 0 ( 1 − p ) 1 = 1 − p p^0 (1-p)^1 = 1 - p p 0 ( 1 − p ) 1 = 1 − p になり、上の 2 式に戻ります。記号を確認しておきます。X X X はベルヌーイ確率変数 、p p p は成功確率(0 0 0 以上 1 1 1 以下の実数)、k k k は X X X の取りうる値です。
性質
期待値 : E [ X ] = p E[X] = p E [ X ] = p 。確率そのものが期待値 になります
分散 : V a r [ X ] = p ( 1 − p ) \mathrm{Var}[X] = p(1-p) Var [ X ] = p ( 1 − p ) 。p = 1 / 2 p = 1/2 p = 1/2 のとき最大値 1 / 4 1/4 1/4 を取ります
退化する両端 : p = 0 p = 0 p = 0 では X = 0 X = 0 X = 0 、p = 1 p = 1 p = 1 では X = 1 X = 1 X = 1 に確率1で固定され、どちらも分散は 0 0 0 です
特殊例 p = 1 / 2 p = 1/2 p = 1/2 : 公平なコインに対応します。このとき分散は最大で、結果が最も予測しにくい状態です
二項分布 との関係 : n n n 個の独立 同一ベルヌーイ確率変数 の和が二項分布 B ( n , p ) B(n, p) B ( n , p ) になります。ベルヌーイ分布は n = 1 n = 1 n = 1 の二項分布 です
不確実性を持つ分布の中で最小の構造 : 0 < p < 1 0 < p < 1 0 < p < 1 のベルヌーイ分布は2点に正の確率を持ち、分散も正です。端点 p = 0 , 1 p = 0, 1 p = 0 , 1 ではベルヌーイ分布自身が1点supportの退化分布になります。確率の合計は常に p + ( 1 − p ) = 1 p + (1-p) = 1 p + ( 1 − p ) = 1 です
視覚的に見る
p = 0.3 p = 0.3 p = 0.3 のベルヌーイ分布の確率質量を 2 本の縦棒で示します。横軸は k ∈ { 0 , 1 } k \in \{0, 1\} k ∈ { 0 , 1 } 、縦軸は各値の確率です。
p = 0.3 のベルヌーイ分布: 確率質量の 2 点 P(X=0) = 0.7 P(X=1) = 0.3 E[X] = p = 0.3 0 1 k 0.0 0.3 0.5 0.7 P(X=k)
図を見て把握すべきことは 2 つです。第一に、ベルヌーイ分布の確率質量は 2 本の棒だけです。連続分布(正規分布など)が曲線で表されるのに対し、ベルヌーイ分布は k = 0 k = 0 k = 0 と k = 1 k = 1 k = 1 の 2 点にしか確率が乗りません。第二に、期待値 E [ X ] = p = 0.3 E[X] = p = 0.3 E [ X ] = p = 0.3 の縦線(青)は 0 0 0 と 1 1 1 の間に位置しますが、X X X はこの値を取りません。期待値 は「分布の重心」であって、実際に起こる値ではない点に注意が必要です。p p p を 0.1 0.1 0.1 や 0.9 0.9 0.9 に変えると、それぞれ左の棒が高くなる・右の棒が高くなるという変化が起き、期待値 の縦線はその位置に追従します。
実世界での使われ方
臨床試験の主要評価項目 では、患者ごとに「奏効した(X = 1 X = 1 X = 1 )」「奏効しなかった(X = 0 X = 0 X = 0 )」の 2 値を記録します。厚生労働省「医薬品の臨床試験の実施に関する基準(GCP 省令) 」が定めるエンドポイントでは、各患者の応答がベルヌーイ確率変数 X i X_i X i です。n n n 名の合計 ∑ X i \sum X_i ∑ X i は二項分布 B ( n , p ) B(n, p) B ( n , p ) に従い、奏効率の信頼区間の導出に使われます。
Web 広告・サイト改修の A/B テスト では、訪問者 1 人ごとに「クリックした(X = 1 X = 1 X = 1 )」「しなかった(X = 0 X = 0 X = 0 )」を記録します。総務省「令和 5 年 通信利用動向調査 」が集計するような Web 利用統計は、ベルヌーイ試行の累積として扱えます。クリック率の推定精度はサンプル数 n n n と成功確率 p p p の関数で決まり、p ( 1 − p ) / n p(1-p)/n p ( 1 − p ) / n が分散の縮小速度を与えます。
金融のデフォルト評価 では、企業 1 社の 1 年後の状態を「デフォルトした(X = 1 X = 1 X = 1 )」「しなかった(X = 0 X = 0 X = 0 )」で記号化します。日本銀行「金融システムレポート 」が用いる信用リスク評価では、企業ごとのデフォルト指示変数 I default I_{\text{default}} I default がベルヌーイ確率変数 です。ポートフォリオ全体の損失分布は ∑ I default , i \sum I_{\text{default},\, i} ∑ I default , i の分布として近似され、個々の X i X_i X i のパラメータ p p p がデフォルト確率(PD: probability of default)に対応します。
深掘り
指示変数 としての見方は他分野とのつながりを示す発展で、定義を理解するだけなら不要です。
任意の事象 A A A に対し、指示変数 (indicator variable)I A I_A I A を次のように定義します。
I A I_A I A はパラメータ p = P ( A ) p = P(A) p = P ( A ) のベルヌーイ確率変数 です。ここから E [ I A ] = P ( A ) E[I_A] = P(A) E [ I A ] = P ( A ) という等式が直ちに出ます。「期待値 は確率の一般化」という発想の起点です。この見方は実用的で、例えば「事象 A A A と B B B が排反 でないとき P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) P(A \cup B) = P(A) + P(B) - P(A \cap B) P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) 」という包除公式は、I A ∪ B = I A + I B − I A ∩ B I_{A \cup B} = I_A + I_B - I_{A \cap B} I A ∪ B = I A + I B − I A ∩ B の両辺の期待値 を取る操作として書き直せます。指示変数 を経由すると、確率の計算が期待値 の計算に統一されます。
二項分布 の構成要素としての位置
n n n 個の独立 同一分布(i.i.d.)なベルヌーイ確率変数 X 1 , … , X n X_1, \ldots, X_n X 1 , … , X n の和
は二項分布 B ( n , p ) B(n, p) B ( n , p ) に従います。i.i.d. の「独立 (i)」と「同一分布(i.d.)」の 2 つの仮定は、モーメントの計算で異なる役割を果たします。期待値の線形性 は独立性 を必要とせず、E [ S n ] = n E [ X 1 ] = n p E[S_n] = n E[X_1] = np E [ S n ] = n E [ X 1 ] = n p が出ます。一方、分散の加法性 V a r [ S n ] = n V a r [ X 1 ] = n p ( 1 − p ) \mathrm{Var}[S_n] = n \mathrm{Var}[X_1] = np(1-p) Var [ S n ] = n Var [ X 1 ] = n p ( 1 − p ) には独立性 が必要です。「i.d.」は各 X i X_i X i が同じ p p p を持つという条件で、E [ S n ] E[S_n] E [ S n ] の計算で E [ X 1 ] E[X_1] E [ X 1 ] を n n n 倍できる根拠になります。stats-06 節 6 で扱った「二項分布 の期待値 が 2 行で出る」という結果の背後にある構造です。
p = 1 / 2 p = 1/2 p = 1/2 で分散が最大になる理由
V a r [ X ] = p ( 1 − p ) \mathrm{Var}[X] = p(1-p) Var [ X ] = p ( 1 − p ) を p p p について微分すると 1 − 2 p 1 - 2p 1 − 2 p です。p = 1 / 2 p = 1/2 p = 1/2 で微分がゼロになり、最大値 1 / 4 1/4 1/4 を取ります。この最大性は「コインが公平なときに結果が最も予測しにくい」という直感に対応します。
情報理論の言葉では、この直感をエントロピー
として定式化できます。H ( X ) H(X) H ( X ) も p = 1 / 2 p = 1/2 p = 1/2 で最大値 log 2 \log 2 log 2 (1 ビット)を取ります。「2 値分布の中で最も予測困難」「最も分散が大きい」「最もエントロピーが高い」の 3 つの意味での「最大性」が同じ点 p = 1 / 2 p = 1/2 p = 1/2 で揃います。この対応は偶然ではなく、分散もエントロピーもともに「分布のばらつき」を測る量だという共通の背景から来ています。ベルヌーイ分布を通すと、確率論と情報理論がともに「ばらつき」を別の言葉で測っていることが見えてきます。
ベルヌーイ分布は「0 と 1 しか取らない」離散分布なので、連続曲線(密度関数)は存在しません。確率質量は 2 本の縦棒だけです。また、p p p は「必ず 1 / 2 1/2 1/2 」ではありません。公平なコインは p = 1 / 2 p = 1/2 p = 1/2 の特殊例で、p p p は [ 0 , 1 ] [0, 1] [ 0 , 1 ] の任意の値を取れます。
関連する用語
算術平均 (ベルヌーイ確率変数 の標本平均 X ˉ = S n / n \bar{X} = S_n / n X ˉ = S n / n がそのまま成功確率 p p p の推定値になります)
期待値 (E [ X ] = p E[X] = p E [ X ] = p という等式はベルヌーイ分布の中心的な結果で、指示変数 I A I_A I A の期待値 が確率 P ( A ) P(A) P ( A ) に等しいという事実の最小例です)
中央値 (ベルヌーイ分布では p < 1/2 のとき中央値 は 0 0 0 、p > 1/2 のとき 1 1 1 です。p = 1 / 2 p = 1/2 p = 1/2 のとき中央値 は 0 0 0 と 1 1 1 のどちらでもよい不定の区間になります)
歪度 (p ≠ 1 / 2 p \neq 1/2 p = 1/2 のベルヌーイ分布は左右非対称で、歪度 は ( 1 − 2 p ) / p ( 1 − p ) (1-2p)/\sqrt{p(1-p)} ( 1 − 2 p ) / p ( 1 − p ) です。p = 1 / 2 p = 1/2 p = 1/2 でのみ歪度 がゼロになります)
この用語を扱う本編記事
stats-06: 期待値の線形性 (ベルヌーイ確率変数 を導入し、n n n 個の和として二項分布 を構成して E [ B ( n , p ) ] = n p E[B(n,p)] = np E [ B ( n , p )] = n p を 2 行で導く節 6 を収録しています)