尤度 P(B∣A) とは、観測した結果 B を固定したうえで「もし原因が A だったとしたらこの B が出る確率」を表す量です。
定義
尤度の式は条件付き確率とまったく同じです。
ここで B は「観測した結果」、A は「考えられる原因や仮説」を指します。
条件付き確率では A を固定して B の確率を計算しますが、尤度では B を固定して A を動かす関数 として読みます。この視点の違いが「尤度」という別名を生む理由です。
A を動かす関数として明示するときは次の記法も使います。
セミコロン ; の左が「動かすもの」、右が「固定するもの」です。
性質
- 条件付き確率と同じ式、視点が違う: 条件付き確率は A を固定して B の確率を見ます。尤度は B を固定して A を動かします。式は共通ですが、何を変数とするかが正反対です。
- 尤度は確率分布ではない: A について総和を取ると ∑AP(B∣A) は 1 になりません。1 を超えることも 1 未満になることもあります。個々の値 P(B∣A) は確率ですが、A を動かす関数としての尤度は確率分布ではありません。
- ベイズの定理の分子: 事前確率 P(A) と掛け合わせた積 P(B∣A)⋅P(A) が事後確率の分子を作ります。
- 尤度の比較が判断の基準になる: P(B∣A1) と P(B∣A2) の比 Λ=P(B∣A1)/P(B∣A2) は「観測 B が仮説 A1 と A2 のどちらをより強く支持するか」の指標になります。
視覚的に見る
医療検査の例で確認します。疾患の有病率は 1%(P(病気)=0.01)とします。検査の感度(病気のとき陽性が出る確率)は 0.90、偽陽性率(健康のとき陽性が出る確率)は 0.09 です。
縦軸を「陽性か陰性か」、横軸を「病気か健康か」で描くと、尤度は 各帯の中の縦比率 として現れます。
帯の幅(横方向)が事前確率です。病気帯は幅 0.01、健康帯は幅 0.99 です。
尤度はこの帯の幅とは無関係で、帯の中の縦方向の比率です。病気帯の中で陽性が占める比率が 0.90、健康帯の中で陽性が占める比率が 0.09 です。この 2 つの値を「A を動かして比較する」操作が尤度を使うことの中身です。
A について和を取ると P(陽性∣病気)+P(陽性∣健康)=0.90+0.09=0.99 で、1 になりません。尤度が確率分布ではないことが数字で確認できます。
実世界での使われ方
医療検査の感度と特異度: 感度(sensitivity)は「病気のときに陽性が出る確率」で、尤度 P(陽性∣病気) そのものです。国立感染症研究所(感染症発生動向調査)が公表する検査性能指標はこの尤度を基準に設計されています。特異度(specificity)から 1−特異度=P(陽性∣健康) が逆方向の尤度を与えます。
不良率の最大尤度推定: 製品の不良率 p を推定するとき、n 個の検査結果 B=(X1,…,Xn) から「観測 B を最もよく説明する p」を L(p;B) の最大化として求めます。総務省「統計的品質管理」の基準で標準的に使われる手法です。
GARCH モデルのボラティリティ推定: 株式リターンのボラティリティを推定する GARCH モデルでは、観測リターン系列の尤度を最大化してパラメータを求めます。日本銀行「金融市場レポート」のボラティリティ推定に使われる標準手法です。
機械学習の損失関数: ロジスティック回帰やニューラルネットの学習は、訓練データの対数尤度 ∑i=1nlogP(yi∣xi;θ) を最大化するパラメータ θ を勾配法で探す操作です。「クロスエントロピー損失」は対数尤度の符号反転と等価で、損失の最小化は尤度の最大化と同じです(scikit-learn の実装解説: scikit-learn ロジスティック回帰、理論的背景は Bishop Pattern Recognition and Machine Learning, Springer, 2006)。
深掘り
尤度比の議論は仮説検定を学んだ段階で戻ってくれば十分で、初読では飛ばせます。
尤度比と仮説の支持度
2 つの仮説 A1,A2 に対して、観測 B の 尤度比 を次のように定義します。
医療検査の例では Λ=0.90/0.09=10 です。陽性という観測は病気仮説を健康仮説の 10 倍強く支持します。
ベイズの定理を整理すると 事後オッズ = 事前オッズ × 尤度比 という形になります。
観測 B が事前オッズを何倍に更新するかを示す乗数が尤度比です。Neyman と Pearson は 1933 年に「サイズ固定の検定で最大の検出力を持つのは尤度比に基づく検定である」(Neyman-Pearson 補題)を証明しました。
対数尤度と独立観測
独立な観測 B1,…,Bn に対して、結合尤度は積になります。
サンプルサイズが大きくなると積は数値的に 0 に近づいて扱いにくくなります。対数を取って和に直すと計算が安定します。
対数は単調増加関数なので、尤度の最大点と対数尤度の最大点は一致します。最大尤度推定では対数尤度の最大化が標準です(Fisher, 1922)。
Fisher 情報量と推定精度
A を連続パラメータとするとき、対数尤度関数の 2 階微分の期待値の符号を反転した量を Fisher 情報量 I(A) と呼びます。
Cramér(1946)と Rao(1945)は独立に、任意の不偏推定量の分散が 1/I(A) で下から押さえられることを証明しました(Cramér-Rao 下限)。Fisher 情報量が大きいほど観測から精度よくパラメータを推定できます。
直感的には、対数尤度のグラフが鋭く尖っているほど Fisher 情報量が大きく、最大点の位置を精度よく特定できます。平坦な対数尤度は情報量が少なく、推定精度が落ちます。
頻度主義とベイズでの使い方の違い
頻度主義と呼ばれる立場では、尤度 L(A;B) を A の関数として最大化します(最大尤度推定)。A は固定された真の値であり、確率を持ちません。
ベイズの立場では、尤度 L(A;B) を事前確率 P(A) と掛け合わせて事後確率を求めます。
A にも確率分布を割り当てる点が頻度主義と異なります。Fisher(頻度主義の最大尤度推定の提唱者)と Jeffreys(ベイズ統計の体系化者)の論争が代表的な対立です。現代の機械学習では変分推論・経験ベイズなど両者の中間的な手法が広く使われており、実用上の対立は薄れています。
関連する用語
- 条件付き確率(尤度 P(B∣A) は条件付き確率と同じ式。何を固定して何を動かすかの視点が異なります)
- 事前確率(ベイズの定理で尤度と掛け合わせて事後確率の分子を作ります)
- 事後確率(事前確率 × 尤度 / 周辺確率で計算される観測後の確率)
- ベイズの定理(事前確率・尤度・事後確率を結びつける公式)
- 周辺確率(ベイズの定理の分母 P(B)=∑AP(B∣A)⋅P(A))
この用語を扱う本編記事
- stats-07: 条件付き確率とベイズの面積(医療検査の例で P(陽性∣病気)=0.90 を感度として導入し、事前確率と尤度を動かしたときの事後確率の変化を扱います)
よくある誤解
「尤度は確率だから A について足すと 1 になる」という誤解があります。個々の値 P(B∣A) は確率ですが、A を動かす関数 L(A;B) は確率分布ではありません。∑AP(B∣A) は 1 になりません。医療検査の例では 0.90+0.09=0.99 です。B を固定して A を動かしているため、A の空間での総和が 1 になる保証はありません。