推定量の偏り

提供: testwiki
ナビゲーションに移動 検索に移動

推定量の偏り(すいていりょうのかたより、テンプレート:Lang-en-short)または推定量のバイアスは統計学における概念の一つであり、推定量の期待値と推定したい対象の真の値との差のことを指す。推定量の偏りが0であるよう偏りな推定量は不偏推定量(ふへんすいていりょう、テンプレート:Lang-en-short)と呼ばれる。統計学において、「偏り」は推定量の客観的な性質である。テンプレート:仮リンクは確率論的にパラメータの真の値に収束するが、偏りを含む場合も偏りを含まない場合もありうる。

他の条件がすべて同じであれば、不偏推定量は偏りのある推定量よりも好ましいが、実際には(一般的に小さい)偏りのある推定量が頻繁に使用される。偏りのある推定量を使用する場合、その偏りの上限と下限が算出される。偏りのある推定量が使用される理由はさまざまである。いくつか例を挙げると、母集団に関するさらなる仮定なしには不偏推定量が存在しない場合、推定量の計算が困難な場合(テンプレート:仮リンクなど)、異なる中央傾向の尺度に対して偏りのある推定量が不偏となる場合がある場合、偏りのある推定量が不偏推定量と比較して平均二乗誤差の値を小さくする場合、唯一の不偏推定量が実用的でない場合などである。

偏りは通常期待値との差で定義されるが、中央値との差で定義されることもある。平均に対する不偏性は非線形なデータ変換で失われるが、中央値に対する不偏性は保存される。

パラメータに対する不偏推定量が必ずしも存在するとは限らない。例えば、二項分布の成功率の逆数に対する不偏推定量は存在しない[1]。

定義

ある実数 θ をパラメータとして持つ統計モデルがあるとし、そのモデルのもとでの観測データ x の確率分布が Pθ(x)=P(x∣θ) で与えられるとする。 今、x から得られた θ の推定量を θ̂ とする。この時、推定量 θ̂ の θ に対する偏りは次で定義される[2]: Bias⁡(θ̂,θ)=Biasθ[θ̂]=Ex∣θ[θ̂]−θ=Ex∣θ[θ̂−θ]

ここで、 Ex∣θ は確率分布 P(x∣θ) のもとでの期待値を意味するものとした。

推定量が不偏であるとは、その推定量の偏りがいかなる θ に対しても0であることをいう。すなわち、θ̂ の期待値がいかなる θ に対しても θ に一致する場合を指す[3]。推定量の不偏性はデータ変換に対して保証されない。すなわち、たとえ θ̂ が θ に対する不偏推定量であっても、g(θ̂) が g(θ) の不偏推定量であるとは限らない。ただし、g が線型写像であれば不偏性は保存する[4]。

推定量の性質を調べるためのシミュレーション実験においては、推定量の偏りは上の数式をモンテカルロ的に解いた結果得られる テンプレート:仮リンクによって推定される。

具体例

標本分散

標本分散は、推定量の偏りとリスクについて2つの異なる問題を明示する。まず、「素朴な」推定量は真の分散に比べて小さく見積もられ、不偏推定量はベッセル補正と呼ばれる操作が必要になる。一方で、推定量が不偏であるということは必ずしも平均二乗誤差を最小化するということを意味しないという例でもある。

これを示すために、母集団の真の期待値が μ 、分散が σ2 であるような確率分布からの独立同分布な確率変数 X1,…,Xn からこれらを推定することを考える。もし、標本平均および標本共分散を

X‾=1n∑i=1nXiS2=1n∑i=1n(Xi−X‾)2

で与えたとすると、この式で定義された S2 は σ2 に対して偏りのある推定量となっている。このことは、テンプレート:仮リンクにより直ちに示される:

Var⁡(X)⏟σ2=E⁡[Var⁡(X∣X¯)]⏟E[S2]+Var⁡(E⁡[X∣X¯])⏟σ2/n⟹E[S2]=n−1nσ2

つまり、素朴に計算した標本分散の期待値はそれが推定している母集団の分散に一致しない。これを一致させるために係数をかける手続き、またはその係数そのものはベッセル補正として知られている。一方、標本平均は母集団平均の不偏推定量である[5][3]。右辺第二項の計算の詳細は、以下のように X1,…,Xn が独立なことを用いる:

Var⁡(E⁡[X∣X¯])=Var⁡(X‾)=Var⁡(1n∑i=1nXi)=1n2∑i=1nVar⁡(Xi)=1n2nσ2=σ2n

素朴な標本分散 S2 が偏りのある推定量となっているのは、標本平均 X‾ が ∑i=1n(Xi−X‾)2 を最小化するように選択されているからである。これは、X‾ を任意の別の値に置き換えると、たとえそれが真の平均値 μ≠X‾ であっても和が小さくなることを意味する:

1n∑i=1n(Xi−X‾)2<1n∑i=1n(Xi−μ)2, ゆえに E⁡[S2]=E⁡[1n∑i=1n(Xi−X‾)2]<E⁡[1n∑i=1n(Xi−μ)2]=σ2.

上記の議論は幾何学的にも行うことができる。n 次元のベクトル C→=(X1−μ,…,Xn−μ) は、ベクトル u→=(1,…,1) に平行な成分(「平均」部分)と、それに直交する成分(「分散」部分)の和として一意に表すことができる。それぞれの成分表示は具体的に計算可能であり、それぞれA→=(X‾−μ,…,X‾−μ)およびB→=(X1−X‾,…,Xn−X‾)である。A→ と B→ は互いに直交しているので、ピタゴラスの定理により|C→|2=|A→|2+|B→|2が成立する。成分表示に戻して期待値を取ることで、 nσ2=nE⁡[(X‾−μ)2]+nE⁡[S2]が得られる。

Xi が正規分布に従うなどの状況では、C→ が回転について対称となる。回転対称性のもとでは、n 次元のそれぞれの成分が平均的には同程度 |C→|2 へと寄与するので、 E⁡[(X‾−μ)2]=σ2n およびE⁡[S2]=n−1nσ2 が得られる。上述したように、これは実際には一般的に当てはまる。

ポアソン分布の推定

ポアソン分布は、偏りのある推定量がいかなる不偏推定量よりも優れる非常に極端な例である[6][7]。 母数 λ で特徴付けられるポアソン分布に従う確率変数があるとし、以下の量 P⁡(X=0)2=e−2λ

を単一の観測値から推定したいとする。これの不偏推定量 g(X) は、不偏性の定義より以下を満たす:

e−2λ=E⁡(g(X))=∑k=0∞g(k)λke−λk!

左辺のテイラー展開から、これを満たすような g(k) は次の形ただ一つに限定されることがわかる: g(x)=(−1)x

これは不偏でこそあるが、実用上機能しないことはすぐにわかる。まず、観測値がどれほど大きな偶数であったとしても(すなわち、λ が大きい値であることが示唆されても)、この推定量を使った λ の推定値は常に0となる。また、観測値が奇数であった場合、その推定値はさらに荒唐無稽なものとなる。推定対象の量 e−2λ は正でなければならないにもかかわらず、その推定値は負になってしまうのである。

この場合、(偏りのある)最尤推定量 e−2X

が不偏推定量よりも遥かによい推定量である。 不偏推定量の場合と異なりこの推定量は負になることがない上、平均二乗誤差も不偏推定量を使う場合よりも小さい。

なお、この場合における最尤推定量の偏りはeλ(1/e2−1)−e−2λである。

離散一様分布の最大値

テンプレート:Main 最尤推定量の偏りは非常に大きくなる可能性がある。1,2,…,n の番号が振られたくじから1枚をランダムに引いて、そのくじの番号が x であったとする。今、n が未知であるとして x からそれを推定する場合、 n の最尤推定量として x が得られる。しかし、この推定量の偏りは (n−1)/2 であり、n (または x)に比例して期待値からのずれが大きくなる。一方、この場合の不偏推定量は

n=E[g(X)]=1n∑k=1ng(k)

から g(X)=2X−1 と導かれる。よって、最尤推定量と比較してほぼ倍だけ異なる推定値が得られることになる。

中央値不偏推定量

一般的に偏りは真の平均に対して定義されるが、真の中央値に対して定義される場合がある。この理論は1947年にGeorge W. Brown によって再評価された[8]:

 テンプレート:Bquote

中央値不偏推定量のさらなる性質はLehmann[9]、 Birnbaum[10]、 van der Vaart[11] 、Pfanzagl[12]などによって指摘されてきた。特に、中央値不偏推定量は平均不偏推定量や最尤推定量が存在しない場合にも存在しうることが示されている。

中央値不偏推定量を構築する手法は、1パラメータのみを持つ指数型分布族に代表される単調な尤度関数を持つ確率分布に対して存在しており、こうして構築された推定量が(平均不偏推定量において考慮される最小分散性と同様の意味で)最適であることが保証される[13][14]。

偏り、分散、平均二乗誤差

偏りが推定量の期待値と真の値のずれを定量的に測る一方で、有限標本に基づく推定量は、標本に含まれるランダム性に起因する別種のずれが発生することが予想される。

これら2種類の差異の両方を反映しようと試みられる指標の一つが平均二乗誤差 (Mean square error, MSE)[2]である: MSE⁡(θ̂)=E⁡[(θ̂−θ)2]

偏りを最小化するような推定量は必ずしも平均二乗誤差を最小化しない。実際、MSEは偏りと分散を用いて次のように表される[2]: MSE⁡(θ̂)=(E⁡[θ̂]−θ)2+E⁡[(θ̂−E⁡[θ̂])2]=(Bias⁡(θ̂,θ))2+Var⁡(θ̂)

具体例:正規分布の分散の推定

具体例として、母集団が正規分布であるとした時、その分散の推定量として以下の形のものを考える[15]:

T2=c∑i=1n(Xi−X‾)2=cnS2

そして、今回はMSEを最小化するように c を選択するものとする。

X1,…,Xn は正規分布に従うとしたので、確率変数 nS2/σ2 は自由度 n−1 のカイ二乗分布に従う。したがって、

E⁡[nS2]=(n−1)σ2 and Var⁡(nS2)=2(n−1)σ4

が成立する。ゆえに

MSE⁡=(c(n−1)−1)2σ4+2c2(n−1)σ4

が得られる。若干の計算の末にこれを最小化する c は c=1/(n+1) であることが示される。これは偏りだけを最小化する場合( c=1/(n−1)) と異なる。

より一般的には、パラメータの値に依存せずにMSEを最小化する推定量が得られるのは限定された種類の問題に限られる。

しかし、偏りと分散のトレードオフが存在すると見なされることは非常に一般的である。すなわち、偏りをわずかに増加させることで分散をより大きく減少させることができ、その結果、全体としてより望ましい推定量が得られることになることが一般的である。

関連項目

テンプレート:ウィキポータルリンク

脚注

テンプレート:Reflist

参考文献

外部リンク

テンプレート:統計学テンプレート:バイアス