複合確率分布

提供: testwiki
ナビゲーションに移動 検索に移動

確率論および統計学における複合確率分布(ふくごうかくりつぶんぷ、テンプレート:Lang-en)または単に複合分布(ふくごうぶんぷ、テンプレート:Lang-en)とは、ある確率変数の従う確率分布が何らかのパラメータを持ち、そのパラメータ(の一部)もまた確率変数として扱われる場合の確率分布である。なお、Compoundは「混合」とも訳せるため、この概念が混合分布と訳出される場合もあるが、その場合は英語でmixture distributionと表される混合分布との混同に注意する必要がある。

複合分布は、興味のある変数以外の潜在変数について周辺化を行った分布とみなすこともできる。

定義

複合確率分布とは、確率変数 X がパラメータ θ を持つ分布 F に従い、θ もまた別の分布 G に従う場合の確率分布 H のことである。この場合、確率分布 H は F と G との複合分布であると呼ばれる。数学的には、無条件分布 H は未知の(複数の場合もある)パラメータ θ について G のもとで周辺化した分布である。その確率密度関数は

pH(x)=∫pF(x|θ)pG(θ)d⁡θ

で与えられる。

変数の一部または全体がベクトルである場合も、同様の式を当てはめることができる。

上記の式からもわかるように、複合分布とは本質的には特別な周辺分布のことである。 x と θ の同時分布は p(x,θ)=p(x|θ)p(θ) であり、これを θ で積分すると複合分布 p(x)=∫p(x,θ)d⁡θ が得られる。θ が離散的な値を取る場合、複合分布は混合分布の特別な場合として解釈される。

性質

一般的性質

複合分布 H はそれぞれの分布の具体的な表現や、分布 F のどのパラメータが G に依存しているかという情報に依存する。H のパラメータには、G のパラメータのうち周辺化されていないものが全て含まれる。H の台は F のそれに一致し、F で平均や分散が定義できる場合、いくつかの一般的な性質が成り立つ。

平均・分散

複合分布の平均や分散は以下で与えられる:

EH[X]=EG[EF[X|θ]]

VarH(X)=EG[VarF(X|θ)]+VarG(EF[X|θ])

例えば、F の平均値が G に従うパラメータであり、G が平均 μ と分散 σ2 を持つ場合は、上記の式から EH[X]=EG[θ]=μ および VarH(X)=VarF(X|θ)+VarG(Y)=τ2+σ2 が導かれる。ここで、τ2を F の分散とした。

導出

FおよびGを、平均と分散をパラメータにもつ確率分布とし、x∼ℱ(θ,τ2)θ∼𝒢(μ,σ2)を仮定する。確率密度関数は f(x|θ)=pF(x|θ)およびg(θ)=pG(θ)として表すこととし、h(x)をHの確率密度とすると、以下が成立する:EH[X]=∫Fxh(x)dx=∫Fx∫Gf(x|θ)g(θ)dθdx=∫G∫Fxf(x|θ)dx g(θ)dθ=∫GEF[X|θ]g(θ)dθここで、ℱと𝒢のパラメータの与え方からEF[X|θ]=∫Fxf(x|θ)dx=θEG[θ]=∫Gθg(θ)dθ=μであるので、結局複合分布の平均値についてEH[X]=μが示される。


Hの分散はEH[X2]−(EH[X])2で定義される。前者についてはEH[X2]=∫Fx2h(x)dx=∫Fx2∫Gf(x|θ)g(θ)dθdx=∫Gg(θ)∫Fx2f(x|θ)dx dθ=∫Gg(θ)(τ2+θ2)dθ=τ2∫Gg(θ)dθ+∫Gg(θ)θ2dθ=τ2+(σ2+μ2),と計算される。ただし ∫Fx2f(x∣θ)dx=EF[X2∣θ]=VarF(X∣θ)+(EF[X∣θ])2 および ∫Gθ2g(θ)dθ=EG[θ2]=VarG(θ)+(EG[θ])2を用いた。以上から、示すべきが得られる:VarH(X)=EH[X2]−(EH[X])2=τ2+σ2

応用

検定

一般的な検定統計量の分布は、帰無仮説の下では複合分布となる。例えば、T検定の検定統計量が従うT分布はそれぞれ正規分布・カイ二乗分布に従う2つのパラメータの比が従う分布であり、F検定の検定統計量が従うF分布もそれぞれ別個のカイ二乗分布に従うパラメータの比が従う分布となる。

過分散モデリング

過分散とは、観測された分散がモデルが予測する分散よりも大きい状況を指す。複合分布は、過分散を示すような結果をモデル化する上で有用である。例えば、計数は通常ポアソン分布に従うとモデル化される。理論的には、ポアソン分布の分散は平均に一致する。ここで、ポアソン分布の平均を表すパラメータのばらつきを許容すると、計数の分布を一般化することができる。具体的には、平均パラメータがガンマ分布に従うとした場合、複合分布は負の二項分布となる。この分布の形状はポアソン分布に類似しているが、その理論的分散ははるかに大きい。

同様に、二項分布の成功確率パラメータがベータ分布に従うとした場合の複合分布はベータ二項分布となる。

ベイズ推定

ベイズ推定においては、複合分布の特別な場合と見做せるありふれた周辺分布以外の用途がある。上記の記法に従えば、 F を将来の観測の分布、G を F のパラメータの観測を基にした事後確率分布とした場合の複合分布であり、 これらの複合分布は事後予測分布を与える。これに対して、事前予測分布は、F を将来のデータ点の分布、G をパラメータの事前確率分布とした場合の複合分布である。

畳み込み

確率変数の和が従う分布の導出には確率分布の畳み込みを行うが、これも複合分布の特別な場合とみなすことができる。 すなわち、一方の被加数をもう一方の被加数の分布の位置をランダムにずらすパラメータとしてみなすということである。[1]

複合分布の計算

指数型分布族に属する分布に由来する複合分布はしばしば解析的解を持つ。解析的積分が不可能であれば、数値的積分に頼ることとなる。

複合分布は、モンテカルロ法、すなわち確率変数の生成によって比較的容易に調査できる。p(θ)やp(x|θ)に従う乱数を生成し、それらを用いたギブスサンプリングによってp(x)に従う乱数を生成するという手法は、通常簡単である。

複合分布は、有限個の要素からなる混合分布で十分な水準まで近似することもできる。この近似によって、近似的な密度などを得ることができる。[1]

複合分布のもとでのパラメータ推定(最尤推定や最大事後確率推定)は、時にはEMアルゴリズムによって簡略化できる可能性がある。[2]

複合分布の例

類似する用語

テンプレート:仮リンクやテンプレート:仮リンクにおける「複合(テンプレート:Lang-en-short)」の意味は、本項目で記述されているそれとは異なる。この項目での意味合いは、階層ベイズモデルにおけるそれに対応する。

なお、ポアソン分布の比母数自体を確率変数と思った場合の(本項目における意味での)複合分布は、テンプレート:仮リンク(テンプレート:Lang-en-short)とも呼ばれる。

関連項目

脚注

テンプレート:Reflist

参考文献