混合分布

提供: testwiki
ナビゲーションに移動 検索に移動

混合分布(こんごうぶんぷ、テンプレート:Lang-en-short)は統計学における確率分布のカテゴリの一種。他の確率変数の集合から次のように導かれる確率変数が従う確率分布である:まず、ある選択確率に従って、確率変数の集合からランダムに1つが選択される。その後、選択された確率変数が実現させた値がそのまま出力される。基盤となる確率変数は、実数の確率変数である場合もあれば、(それぞれ同じ次元を持つ)テンプレート:仮リンクである場合もある。後者の場合、混合分布はそれらの同時分布となる。

基盤となる各確率変数が連続である場合、結果となる変数も連続変数となり、その確率密度関数は混合密度(テンプレート:Lang-en-short)と呼ばれることがある。累積分布関数(もし存在する場合は確率密度関数)は、基盤となる確率変数におけるそれらの凸結合となる。混合分布を構成するそれぞれの確率分布は英語ではmixture components(直訳:混合の構成要素)と呼ばれ、それらに関連づけられる確率(または重み)は英語で mixture weights(直訳:混合の重み)と呼ばれる。 混合分布を構成する分布の数は有限である場合に限定されることもあるが、可算無限であるような状況を考えることもある。より一般化し、構成要素が非可算無限個あるような状況における混合密度は複合確率分布(テンプレート:Lang-en-short)と呼ばれることもある。

なお、2つ以上の確率変数の(重み付き)和により定義される確率変数は、混合分布とは明確に別の概念であり、区別する必要がある。そのような分布は、構成要素の畳み込み演算子によって与えられる。例えば、分散が同じで平均だけが異なる正規分布2つから独立に選択された変数をそれぞれ1/2で選択する確率変数を記述する混合分布は、正規分布の中央値が十分離れている場合2つのピークを持つような分布となる。一方、この混合分布の構成要素から得られた確率変数の平均として定義される確率変数の従う分布は、別の正規分布であり、両者は明確に異なる分布である。

混合分布は文脈を問わず多くの場面で登場する。特に、統計的母集団が2つ以上の部分母集団(テンプレート:Lang-en-short)を含む場合には自然に生じる。また、正規分布ではない確率分布を表現する手段として用いられることもある。混合分布を含む統計モデルに関するデータ解析はテンプレート:仮リンク(テンプレート:Lang-en-short)という名称で扱われる。本項目では、混合分布の単純な確率的・統計的性質、およびそれらが基礎となる分布の性質とどのように関連しているかに焦点を当てる。

構成要素が有限・可算無限の場合

パラメータが異なる3つの正規分布 (テンプレート:Math, テンプレート:Math)を等重量で混ぜることで得られる混合分布。構成要素それぞれは、重み付けされた密度として表示されており、それぞれ積分すると1/3になる。

確率密度関数の有限集合 p1(x),…,pn(x) と、重み w1,…,wn があるとする。さらに、 k=1,2,…,n についてwk≥0 が成立し、かつ ∑k=1nwk=1 が成立しているものとする。この時、これらを構成要素と重みとする混合分布の確率密度関数は f(x)=∑i=1nwipi(x)として定義される。

もし、確率密度関数の代わりに累積分布関数 P1(x),…,Pn(x) が与えられている場合は、混合分布の累積分布関数が F(x)=∑i=1nwiPi(x)として定義される。

このような有限要素の総和によって得られる混合の取り方は、英語ではfinite mixture(直訳: 有限混合)と呼ばれる。n→∞ の極限を取ることで、可算無限集合の場合にも拡張することができる。

構成要素が非可算無限の場合

構成要素からなる集合が非可算集合の場合の混合分布は、複合確率分布(テンプレート:Lang-en-short)と呼ばれることもある。そのような混合分布の構成は構成要素が有限・可算無限の場合の構成方法と同様にして行える。ただし、有限(または可算無限)個の要素の足し合わせを、積分に置き換える必要がある。

p(x;a)を、 x に関する確率密度関数であって、を、 aを母数にとるものであるとする。すなわち、ある集合 A 上の任意の a について、p(x;a) は x に関する確率密度関数であるとする。ここで、A 上の関数 w(a) をとり、任意の a について w(a)≥0 かつ∫Aw(a)da=1が成立しているものとする(これらの条件を満たす w(a) は、A 上の確率密度関数となっている)。この時、

f(x)=∫Aw(a)p(x;a)da

という関数は、再び x に関する確率密度関数となっており、これを混合分布または複合確率分布と呼ぶ。

同様の積分は、累積分布関数に対しても記述できる。 なお、w(a) として超関数を取ることを許容すれば、デルタ関数の和を w(a) として取れるようになるので、上述の離散的な和で定義された混合分布もこの書き方で記述できる。

パラメトリック分布族内での混合

混合分布の構成要素は任意の確率分布たりうるが、母数の異なる同じ確率分布族をとることもある。そのような場合では、混合分布を例えば f(x;a1,…,an)=∑i=1nwip(x;ai) のように書ける。また、2つのパラメータからなる分布族であれば、 f(x;a1,…,an,b1,…,bn)=∑i=1nwip(x;ai,bi) のように書ける。パラメータの数がさらに増えても同様に記述できる。

性質

凸性

確率密度関数の線型結合は一般的には再び確率密度関数になるとは限らない。これは、線型結合された関数が負の値を取る可能性があるほか、積分結果が1でない可能性もあるからである。しかしながら、確率密度関数の凸結合は確率密度関数の性質(非負かつ積分結果が1)を保存するため、結果として混合分布は再び確率密度関数となる。

モーメント

混合分布を構成する n 個の確率変数を X1,…,Xn とし、混合分布に従う確率変数を X で表すとする。 X に関する任意の関数 H(X) について、それぞれの確率変数について期待値 E⁡[H(Xi)] が存在し、かつそれぞれの確率密度関数 pi(x) が存在する場合、

E⁡[H(X)]=∫−∞∞H(x)∑i=1nwipi(x)dx=∑i=1nwi∫−∞∞pi(x)H(x)dx=∑i=1nwiE⁡[H(Xi)]

が成立する。

ゼロまわりの j 次モーメントは、H(x)=xj と選択することで計算できる。一方、混合分布の平均値を μ、i 番目の確率変数の平均値を μi と表す時、μ まわりの j 次モーメントは H(x)=(x−μ)jを選択することで計算でき、さらに二項展開により次のように表せる:

E⁡[(X−μ)j]=∑i=1nwiE⁡[(Xi−μi+μi−μ)j]=∑i=1nwi∑k=0j(jk)(μi−μ)j−kE⁡[(Xi−μi)k]

一次元分布に関する混合分布であって、i 番目の構成要素に関連づけられた重みを wi、平均 μi、分散 σi2 で表すとする。この時、混合分布の平均および分散は μ=E⁡[X]=∑i=1nwiμi σ2=E⁡[(X−μ)2]=E⁡[X2]−μ2=(∑i=1nwiE⁡[Xi2])−μ2=∑i=1nwi(σi2+μi2)−μ2

で計算される。これらの関連性は、構成要素自体にそのような特徴が存在しない場合でも、歪度や尖度などの高次モーメントの非自明性や多峰性が混合分布に出現する可能性を浮き彫りにしている。MarronとWandの1992の研究[1]では、このフレームワークの柔軟性を具体的に説明している。

モード

混合分布がテンプレート:仮リンクであるかどうか、という問題は、簡単である場合もそうでない場合もある。簡単な場合の例として、指数分布だけからなる混合分布は常にテンプレート:仮リンクの分布となる[2]。難しい問題の例としては、正規分布だけからなる混合分布の場合がある。Ray & Rindsayによる研究では[3]、一変量[4][5]および多変量[6]の分布に関する先行研究を拡張し、多変量正規混合分布におけるモード数の条件について検討している。

具体例

2つの正規分布からなる混合分布

2つの正規分布があり、それらの分散は共通しているが、平均は異なるとする。これらを等重量で重み付けた混合分布を考察する。混合分布の尖度は構成要素となっているそれよりも小さくなり、各構成要素の平均値は、混合分布の「肩」の部分に位置する。もし、二つの分布の平均値が十分離れている(具体的には、 |μ1−μ2|>2σ が満たされている)場合、混合分布はピークを二つ持つ。そうでなければ、一つの広いピークを持つ[7]。混合分布の分散は、異なる平均値からの差を取る分だけ構成要素のそれよりも大きくなり、それゆえ分散 σ が固定された正規分布と比較するとテンプレート:仮リンクを示すことになる。ただし、母集団全体の分散と等しい分散を持つ正規分布と比較した場合には過分散とはならない。

一方、平均値が同じで分散が異なる正規分布2つを等しい重みのもと混合分布を作った場合、構成要素となる正規分布達と比べて混合分布は高い尖度を示し、鋭いピークと重いテールを持つ分布となる。

正規分布とコーシー分布からなる混合分布

以下のような正規分布とコーシー分布からなる混合分布を定義する: f(x)=(1−ε)𝒩(x|μ,σ)+εCauchy⁡(x|μ,γ)  ただし、 ε は限りなく小さい正の実数(例えばHampel[8]の記述では ε=10−10)とする。この混合分布からの独立同分布なサンプルから計算された標本平均は途方もなく大規模なサンプルサイズを取らない限りは「ノーマルに」振る舞う。しかし、コーシー分布を構成要素としてもつので、この混合分布の(理論的な)平均値はそもそも存在しない。

応用

混合分布は、特定のデータセット(データの異なる部分集合がそれぞれ異なる特性を示し、個別にモデル化するのが最適である場合)に対して優れたモデルを提供する点や、個々の成分が混合分布全体よりも容易に分析できるため数学的に扱いやすくなるという点を目的に利用される。

混合密度を用いることで、いくつかの部分集団から構成される統計的母集団をモデル化することができる。この場合、構成要素は各部分集団の密度であり、重みは母集団全体における各部分集団の割合となる。

また、外れ値や不純物による汚染も混合分布によりモデル化できる。具体的には、ほとんどのサンプルが対象となる現象を測定している一方で、一部のサンプルはそれとは異なる誤った分布に従っていると仮定する。誤差の存在を仮定しないテンプレート:仮リンクではしばしばこれらの混合分布をうまく扱えない。


個別の研究を研究対象としたメタアナリシスにおいては、テンプレート:仮リンクにより、結果の分布は混合分布となり、予測誤差に比べて結果の分散が大きくなる。例えば、統計調査において、標本サイズによって決定される誤差範囲は、標本誤差や繰り返し調査に由来する結果の分散を予測する。研究間異質性が存在する場合、すなわち各研究でテンプレート:仮リンクが異なる場合、誤差範囲に比べて分散が大きくなる。

関連項目


脚注

テンプレート:Reflist テンプレート:Normdaten