Articulo de referencia

Cramér-Rao se unió

Ilustración de la cota de Cramér-Rao: no existe un estimador insesgado que pueda estimar el parámetro (bidimensional) con una varianza menor que la cota de Cramér-Rao, ilustrada...

Ilustración de la cota de Cramér-Rao: no existe un estimador insesgado que pueda estimar el parámetro (bidimensional) con una varianza menor que la cota de Cramér-Rao, ilustrada como una elipse de desviación estándar .

En la teoría de la estimación y la estadística , la cota de Cramér-Rao ( CRB ) se relaciona con la estimación de un parámetro determinista (fijo, aunque desconocido). El resultado recibe su nombre en honor a Harald Cramér y Calyampudi Radhakrishna Rao , [ 1 ] [ 2 ] [ 3 ] pero también ha sido derivado independientemente por Maurice Fréchet , [ 4 ] Georges Darmois , [ 5 ] y por Alexander Aitken y Harold Silverstone . [ 6 ] [ 7 ] También se conoce como cota inferior de Fréchet-Cramér-Rao o Fréchet-Darmois-Cramér-Rao. Establece que la precisión de cualquier estimador insesgado es como máximo la información de Fisher ; o (equivalentemente) el recíproco de la información de Fisher es una cota inferior de su varianza .

Se dice que un estimador insesgado que alcanza este límite es (totalmente) eficiente . Dicha solución logra el menor error cuadrático medio posible entre todos los métodos insesgados y, por lo tanto, es el estimador insesgado de mínima varianza (MVU). Sin embargo, en algunos casos, no existe ninguna técnica insesgada que alcance el límite. Esto puede ocurrir si, para cualquier estimador insesgado, existe otro con una varianza estrictamente menor, o si existe un estimador MVU, pero su varianza es estrictamente mayor que el inverso de la información de Fisher.

La cota de Cramér-Rao también puede utilizarse para acotar la varianza de estimadores sesgados con un sesgo dado. En algunos casos, un enfoque sesgado puede dar como resultado una varianza y un error cuadrático medio inferiores a la cota inferior insesgada de Cramér-Rao; véase sesgo del estimador .

Anil Kumar Bhattacharyya propuso un progreso significativo sobre la cota inferior de Cramér-Rao a través de una serie de trabajos, denominados cota de Bhattacharyya . [ 8 ] [ 9 ] [ 10 ] [ 11 ]

Declaración

En esta sección se presenta la cota de Cramér-Rao para varios casos cada vez más generales, comenzando con el caso en que el parámetro es un escalar y su estimador es insesgado . Todas las versiones de la cota requieren ciertas condiciones de regularidad, que se cumplen para la mayoría de las distribuciones bien comportadas. Estas condiciones se enumeran más adelante en esta sección .

Caso escalar insesgado

Suponerθ{\displaystyle \theta }es un parámetro determinista desconocido que debe estimarse a partir denorte{\displaystyle n}observaciones independientes (mediciones) deincógnita{\displaystyle x}, cada uno de una distribución según alguna función de densidad de probabilidadF(incógnita;θ){\displaystyle f(x;\theta )}. La varianza de cualquier estimador insesgadoθ^{\displaystyle {\sombrero {\theta }}}deθ{\displaystyle \theta }entonces está acotado [ 12 ] por el recíproco de la información de FisherI(θ){\displaystyle I(\theta )}:

var(θ^)1I(θ){\displaystyle \operatorname {var} ({\hat {\theta }})\geq {\frac {1}{I(\theta )}}}

donde la información de FisherI(θ){\displaystyle I(\theta )}se define por

I(θ)=nortemiincógnita;θ[((incógnita;θ)θ)2]{\displaystyle I(\theta )=n\operatorname {E} _{X;\theta }\left[\left({\frac {\partial \ell (X;\theta )}{\partial \theta }}\right)^{2}\right]}

y(incógnita;θ)=registro(F(incógnita;θ)){\displaystyle \ell (x;\theta )=\log(f(x;\theta ))}es el logaritmo natural de la función de verosimilitud para una sola muestra.incógnita{\displaystyle x}ymiincógnita;θ{\displaystyle \operatorname {E} _{x;\theta }}denota el valor esperado con respecto a la densidadF(incógnita;θ){\displaystyle f(x;\theta )}deincógnita{\displaystyle X}. Si no se indica, en lo que sigue, la esperanza se toma con respecto a incógnita{\displaystyle X}.

Si(incógnita;θ){\displaystyle \ell (x;\theta )}Si es dos veces diferenciable y se cumplen ciertas condiciones de regularidad, entonces la información de Fisher también se puede definir de la siguiente manera: [ 13 ]

I(θ)=nortemiincógnita;θ[2(incógnita;θ)θ2]{\displaystyle I(\theta )=-n\operatorname {E} _{X;\theta }\left[{\frac {\partial ^{2}\ell (X;\theta )}{\partial \theta ^{2}}}\right]}

La eficiencia de un estimador insesgadoθ^{\displaystyle {\sombrero {\theta }}}mide qué tan cerca está la varianza de este estimador de este límite inferior; la eficiencia del estimador se define como

mi(θ^)=I(θ)1var(θ^){\displaystyle e({\hat {\theta }})={\frac {I(\theta )^{-1}}{\operatorname {var} ({\hat {\theta }})}}}

o la varianza mínima posible para un estimador insesgado dividida por su varianza real. El límite inferior de Cramér-Rao da, por lo tanto,

mi(θ^)1{\displaystyle e({\hat {\theta }})\leq 1}.

Caso escalar general

Se puede obtener una forma más general de la cota considerando un estimador sesgado.T(incógnita){\displaystyle T(X)}, cuya expectativa no esθ{\displaystyle \theta }pero una función de este parámetro, por ejemplo,ψ(θ){\displaystyle \psi (\theta )}. Por eso mi{T(incógnita)}θ=ψ(θ)θ{\displaystyle E\{T(X)\}-\theta =\psi (\theta )-\theta } no es generalmente igual a 0. En este caso, el límite viene dado por

var(T)[ψ(θ)]2I(θ){\displaystyle \operatorname {var} (T)\geq {\frac {[\psi '(\theta )]^{2}}{I(\theta )}}}

dóndeψ(θ){\displaystyle \psi '(\theta )}es el derivado deψ(θ){\displaystyle \psi (\theta )}(porθ{\displaystyle \theta }), yI(θ){\displaystyle I(\theta )}es la información de Fisher definida anteriormente.

Límite de la varianza de los estimadores sesgados

Además de ser una cota para los estimadores de funciones del parámetro, este enfoque puede utilizarse para derivar una cota para la varianza de los estimadores sesgados con un sesgo dado, como sigue. [ 14 ] Consideremos un estimadorθ^{\displaystyle {\hat {\theta }}}con sesgob(θ)=mi{θ^}θ{\displaystyle b(\theta )=E\{{\hat {\theta }}\}-\theta }y dejarψ(θ)=b(θ)+θ{\displaystyle \psi (\theta )=b(\theta )+\theta }. Según el resultado anterior, cualquier estimador insesgado cuya esperanza seaψ(θ){\displaystyle \psi (\theta )}tiene varianza mayor o igual que(ψ(θ))2/I(θ){\displaystyle (\psi '(\theta ))^{2}/I(\theta )}Por lo tanto, cualquier estimadorθ^{\displaystyle {\hat {\theta }}}cuyo sesgo viene dado por una funciónb(θ){\displaystyle b(\theta )}satisface [ 15 ]

var(θ^)[1+b(θ)]2I(θ).{\displaystyle \operatorname {var} \left({\hat {\theta }}\right)\geq {\frac {[1+b'(\theta )]^{2}}{I(\theta )}}.}

La versión imparcial de la cota es un caso especial de este resultado, conb(θ)=0{\displaystyle b(\theta )=0}.

Es trivial tener una varianza pequeña: un "estimador" que es constante tiene una varianza de cero. Pero de la ecuación anterior, encontramos que el error cuadrático medio de un estimador sesgado está acotado por

mi((θ^θ)2)[1+b(θ)]2I(θ)+b(θ)2,{\displaystyle \operatorname {E} \left(({\hat {\theta }}-\theta )^{2}\right)\geq {\frac {[1+b'(\theta )]^{2}}{I(\theta )}}+b(\theta )^{2},}

utilizando la descomposición estándar del MSE. Sin embargo, tenga en cuenta que si1+b(θ)<1{\displaystyle 1+b'(\theta )<1}Este límite podría ser menor que el límite imparcial de Cramér-Rao.1/I(θ){\displaystyle 1/I(\theta )}. Por ejemplo, en el ejemplo de estimación de la varianza que se muestra a continuación ,1+b(θ)=nortenorte+2<1{\displaystyle 1+b'(\theta )={\frac {n}{n+2}}<1}.

caso multivariado

Extendiendo la cota de Cramér-Rao a múltiples parámetros, defina un vector columna de parámetros.

θ=[θ1,θ2,,θd]TRd{\displaystyle {\boldsymbol {\theta }}=\left[\theta _{1},\theta _{2},\dots ,\theta _{d}\right]^{T}\in \mathbb {R} ^{d}}

con función de densidad de probabilidadF(incógnita;θ){\displaystyle f(x;{\boldsymbol {\theta }})}que satisface las dos condiciones de regularidad que se indican a continuación.

La matriz de información de Fisher es unad×d{\displaystyle d\times d}matriz con elementoImetro,k{\displaystyle I_{m,k}}definido como

Imetro,k=mi[θmetroregistroF(incógnita;θ)θkregistroF(incógnita;θ)]=mi[2θmetroθkregistroF(incógnita;θ)].{\displaystyle I_{m,k}=\operatorname {E} \left[{\frac {\partial }{\partial \theta _{m}}}\log f\left(x;{\boldsymbol {\theta }}\right){\frac {\partial }{\partial \theta _{k}}}\log f\left(x;{\boldsymbol {\theta }}\right)\right]=-\operatorname {E} \left[{\frac {\partial ^{2}}{\partial \theta _{m}\,\partial \theta _{k}}}\log f\left(x;{\boldsymbol {\theta }}\right)\right].}

DejarT(incógnita){\displaystyle {\boldsymbol {T}}(X)}ser un estimador de cualquier función vectorial de parámetros,T(incógnita)=(T1(incógnita),,Td(incógnita))T{\displaystyle {\boldsymbol {T}}(X)=(T_{1}(X),\ldots ,T_{d}(X))^{T}}y denotamos su vector de esperanzami[T(incógnita)]{\displaystyle \operatorname {E} [{\boldsymbol {T}}(X)]}porψ(θ){\displaystyle {\boldsymbol {\psi }}({\boldsymbol {\theta }})}. La cota de Cramér-Rao establece entonces que la matriz de covarianza deT(incógnita){\displaystyle {\boldsymbol {T}}(X)}Satisface

I(θ)ϕ(θ)Tcoberturaθ(T(incógnita))1ϕ(θ){\displaystyle I\left({\boldsymbol {\theta }}\right)\geq \phi (\theta )^{T}\operatorname {cov} _{\boldsymbol {\theta }}\left({\boldsymbol {T}}(X)\right)^{-1}\phi (\theta )},
coberturaθ(T(incógnita))ϕ(θ)I(θ)1ϕ(θ)T{\displaystyle \operatorname {cov} _{\boldsymbol {\theta }}\left({\boldsymbol {T}}(X)\right)\geq \phi (\theta )I\left({\boldsymbol {\theta }}\right)^{-1}\phi (\theta )^{T}}

dónde

  • La desigualdad matricialAB{\displaystyle A\geq B}se entiende que significa que la matrizAB{\displaystyle A-B}es semidefinida positiva y
  • ϕ(θ):=ψ(θ)/θ{\displaystyle \phi (\theta ):=\partial {\boldsymbol {\psi }}({\boldsymbol {\theta }})/\partial {\boldsymbol {\theta }}}es la matriz jacobiana cuyaij{\displaystyle ij}El elemento viene dado porψi(θ)/θj{\displaystyle \partial \psi _{i}({\boldsymbol {\theta }})/\partial \theta _{j}}.

SiT(incógnita){\displaystyle {\boldsymbol {T}}(X)}es un estimador insesgado deθ{\displaystyle {\boldsymbol {\theta }}}(es decir,ψ(θ)=θ{\displaystyle {\boldsymbol {\psi }}\left({\boldsymbol {\theta }}\right)={\boldsymbol {\theta }}}), entonces la cota de Cramér-Rao se reduce a

coberturaθ(T(incógnita))I(θ)1.{\displaystyle \operatorname {cov} _{\boldsymbol {\theta }}\left({\boldsymbol {T}}(X)\right)\geq I\left({\boldsymbol {\theta }}\right)^{-1}.}

Si resulta inconveniente calcular la inversa de la matriz de información de Fisher , entonces se puede simplemente tomar el recíproco del elemento diagonal correspondiente para encontrar una cota inferior (posiblemente aproximada). [ 16 ]

varθ(Tmetro(incógnita))=[coberturaθ(T(incógnita))]metrometro[I(θ)1]metrometro1I(θ)metrometro.{\displaystyle \operatorname {var} _{\boldsymbol {\theta }}(T_{m}(X))=\left[\operatorname {cov} _{\boldsymbol {\theta }}\left({\boldsymbol {T}}(X)\right)\right]_{mm}\geq \left[I\left({\boldsymbol {\theta }}\right)^{-1}\right]_{mm}\geq {\frac {1}{I\left({\boldsymbol {\theta }}\right)_{mm}}}.}

Condiciones de regularidad

El límite se basa en dos condiciones de regularidad débiles sobre la función de densidad de probabilidad ,F(incógnita;θ){\displaystyle f(x;\theta )}y el estimadorT(incógnita){\displaystyle T(X)}:

  • La información de Fisher siempre está definida; equivalentemente, para todosincógnita{\displaystyle x}de tal manera queF(incógnita;θ)>0{\displaystyle f(x;\theta )>0},θregistroF(incógnita;θ){\displaystyle {\frac {\partial }{\partial \theta }}\log f(x;\theta )}Existe y es finito.
  • Las operaciones de integración con respecto aincógnita{\displaystyle x}y diferenciación con respecto aθ{\displaystyle \theta }pueden intercambiarse con la expectativa deT{\displaystyle T}; eso es,θ[T(incógnita)F(incógnita;θ)dincógnita]=T(incógnita)[θF(incógnita;θ)]dincógnita{\displaystyle {\frac {\partial }{\partial \theta }}\left[\int T(x)f(x;\theta )\,dx\right]=\int T(x)\left[{\frac {\partial }{\partial \theta }}f(x;\theta )\right]\,dx}siempre que el lado derecho sea finito.
    Esta condición a menudo se puede confirmar utilizando el hecho de que la integración y la diferenciación se pueden intercambiar cuando se cumple cualquiera de los siguientes casos:
    1. La funciónF(incógnita;θ){\displaystyle f(x;\theta )}tiene apoyo limitado enincógnita{\displaystyle x}y los límites no dependen deθ{\displaystyle \theta };
    2. La funciónF(incógnita;θ){\displaystyle f(x;\theta )}tiene soporte infinito, es continuamente diferenciable y la integral converge uniformemente para todoθ{\displaystyle \theta }.

Prueba

Demostración para el caso general basada en la cota de Chapman-Robbins.

Prueba basada en [ 17 ] .

Prueba

Primera ecuación:

Dejarδ{\displaystyle \delta }sea ​​infinitesimal, entonces para cualquiervRnorte{\displaystyle v\in \mathbb {R} ^{n}}, enchufandoθ=θ+δv{\displaystyle \theta '=\theta +\delta v}Entramos, tenemos(miθ[T]miθ[T])=vTϕ(θ)δ;χ2(μθ;μθ)=vTI(θ)vδ2{\displaystyle (E_{\theta '}[T]-E_{\theta }[T])=v^{T}\phi (\theta )\delta ;\quad \chi ^{2}(\mu _{\theta '};\mu _{\theta })=v^{T}I(\theta )v\delta ^{2}}

Sustituyendo esto en la cota de Chapman-Robbins multivariada se obtieneI(θ)ϕ(θ)Covθ[T]1ϕ(θ)T{\displaystyle I(\theta )\geq \phi (\theta )\operatorname {Cov} _{\theta }[T]^{-1}\phi (\theta )^{T}}.

Segunda ecuación:

Basta con demostrar esto para el caso escalar, conh(incógnita){\displaystyle h(X)}tomando valores enR{\displaystyle \mathbb {R} }Porque en generalT(incógnita){\displaystyle T(X)}, podemos tomar cualquiervRmetro{\displaystyle v\in \mathbb {R} ^{m}}, luego definiendoh:=jvjTj{\textstyle h:=\sum _{j}v_{j}T_{j}}, el caso escalar daVarθ[h]=vTCovθ[T]vvTϕ(θ)I(θ)1ϕ(θ)Tv{\displaystyle \operatorname {Var} _{\theta }[h]=v^{T}\operatorname {Cov} _{\theta }[T]v\geq v^{T}\phi (\theta )I(\theta )^{-1}\phi (\theta )^{T}v}Esto se aplica a todosvRmetro{\displaystyle v\in \mathbb {R} ^{m}}, por lo que podemos concluirCovθ[T]ϕ(θ)I(θ)1ϕ(θ)T{\displaystyle \operatorname {Cov} _{\theta }[T]\geq \phi (\theta )I(\theta )^{-1}\phi (\theta )^{T}}El caso escalar establece queVarθ[h]ϕ(θ)TI(θ)1ϕ(θ){\displaystyle \operatorname {Var} _{\theta }[h]\geq \phi (\theta )^{T}I(\theta )^{-1}\phi (\theta )}conϕ(θ):=θmiθ[h]{\displaystyle \phi (\theta ):=\nabla _{\theta }E_{\theta }[h]}.

Dejarδ{\displaystyle \delta }sea ​​infinitesimal, entonces para cualquiervRnorte{\displaystyle v\in \mathbb {R} ^{n}}, tomandoθ=θ+δv{\displaystyle \theta '=\theta +\delta v}en la cota de Chapman-Robbins de una sola variable da Varθ[h]v,ϕ(θ)2vTI(θ)v{\displaystyle \operatorname {Var} _{\theta }[h]\geq {\frac {\langle v,\phi (\theta )\rangle ^{2}}{v^{T}I(\theta )v}}}.

Mediante álgebra lineal,sorberv0w,v2vTMETROv=wTMETRO1w{\displaystyle \sup _{v\neq 0}{\frac {\langle w,v\rangle ^{2}}{v^{T}Mv}}=w^{T}M^{-1}w}para cualquier matriz definida positivaMETRO{\displaystyle M}, así obtenemosVarθ[h]ϕ(θ)TI(θ)1ϕ(θ).{\displaystyle \operatorname {Var} _{\theta }[h]\geq \phi (\theta )^{T}I(\theta )^{-1}\phi (\theta ).}

Una demostración independiente para el caso escalar general.

Para el caso escalar general :

Supongamos queT=t(incógnita){\displaystyle T=t(X)}es un estimador con esperanzaψ(θ){\displaystyle \psi (\theta )}(basado en las observaciones)incógnita{\displaystyle X}), es decir quemi(T)=ψ(θ){\displaystyle \operatorname {E} (T)=\psi (\theta )}El objetivo es demostrar que, para todosθ{\displaystyle \theta },

var(t(incógnita))[ψ(θ)]2I(θ).{\displaystyle \operatorname {var} (t(X))\geq {\frac {[\psi ^{\prime }(\theta )]^{2}}{I(\theta )}}.}

Dejarincógnita{\displaystyle X}sea ​​una variable aleatoria con función de densidad de probabilidadF(incógnita;θ){\displaystyle f(x;\theta )}. AquíT=t(incógnita){\displaystyle T=t(X)}es una estadística que se utiliza como estimador paraψ(θ){\displaystyle \psi (\theta )}. DefinirV{\displaystyle V}como la puntuación :

V=θlnF(incógnita;θ)=1F(incógnita;θ)θF(incógnita;θ){\displaystyle V={\frac {\partial }{\partial \theta }}\ln f(X;\theta )={\frac {1}{f(X;\theta )}}{\frac {\partial }{\partial \theta }}f(X;\theta )}

donde se utiliza la regla de la cadena en la igualdad final anterior. Entonces la esperanza deV{\displaystyle V}, escritomi(V){\displaystyle \operatorname {E} (V)}es cero. Esto se debe a que:

mi(V)=F(incógnita;θ)[1F(incógnita;θ)θF(incógnita;θ)]dincógnita=θF(incógnita;θ)dincógnita=0{\displaystyle \operatorname {E} (V)=\int f(x;\theta )\left[{\frac {1}{f(x;\theta )}}{\frac {\partial }{\partial \theta }}f(x;\theta )\right]\,dx={\frac {\partial }{\partial \theta }}\int f(x;\theta )\,dx=0}

donde la integral y la derivada parcial se han intercambiado (justificado por la segunda condición de regularidad).

Si consideramos la covarianzacobertura(V,T){\displaystyle \operatorname {cov} (V,T)}deV{\displaystyle V}yT{\displaystyle T}, tenemoscobertura(V,T)=mi(VT){\displaystyle \operatorname {cov} (V,T)=\operatorname {E} (VT)}, porquemi(V)=0{\displaystyle \operatorname {E} (V)=0}. Ampliando esta expresión tenemos

cobertura(V,T)=mi(T[1F(incógnita;θ)θF(incógnita;θ)])=t(incógnita)[1F(incógnita;θ)θF(incógnita;θ)]F(incógnita;θ)dincógnita=θ[t(incógnita)F(incógnita;θ)dincógnita]=θmi(T)=ψ(θ){\displaystyle {\begin{aligned}\operatorname {cov} (V,T)&=\operatorname {E} \left(T\cdot \left[{\frac {1}{f(X;\theta )}}{\frac {\partial }{\partial \theta }}f(X;\theta )\right]\right)\\[6pt]&=\int t(x)\left[{\frac {1}{f(x;\theta )}}{\frac {\partial }{\partial \theta }}f(x;\theta )\right]f(x;\theta )\,dx\\[6pt]&={\frac {\partial }{\partial \theta }}\left[\int t(x)f(x;\theta )\,dx\right]={\frac {\partial }{\partial \theta }}E(T)=\psi ^{\prime }(\theta )\end{aligned}}}

Nuevamente, porque las operaciones de integración y diferenciación conmutan (segunda condición).

La desigualdad de Cauchy-Schwarz muestra que

var(T)var(V)|cobertura(V,T)|=|ψ(θ)|{\displaystyle {\sqrt {\operatorname {var} (T)\operatorname {var} (V)}}\geq \left|\operatorname {cov} (V,T)\right|=\left|\psi ^{\prime }(\theta )\right|}

por lo tanto

var(T)[ψ(θ)]2var(V)=[ψ(θ)]2I(θ){\displaystyle \operatorname {var} (T)\geq {\frac {[\psi ^{\prime }(\theta )]^{2}}{\operatorname {var} (V)}}={\frac {[\psi ^{\prime }(\theta )]^{2}}{I(\theta )}}}

lo cual demuestra la proposición.

Ejemplos

Distribución normal multivariada

Para el caso de una distribución normal de d variables

incógnitanorted(μ(θ),do(θ)){\displaystyle {\boldsymbol {x}}\sim {\mathcal {N}}_{d}\left({\boldsymbol {\mu }}({\boldsymbol {\theta }}),{\boldsymbol {C}}({\boldsymbol {\theta }})\right)}

La matriz de información de Fisher tiene elementos [ 18 ].

Imetro,k=μTθmetrodo1μθk+12tr(do1doθmetrodo1doθk){\displaystyle I_{m,k}={\frac {\partial {\boldsymbol {\mu }}^{T}}{\partial \theta _{m}}}{\boldsymbol {C}}^{-1}{\frac {\partial {\boldsymbol {\mu }}}{\partial \theta _{k}}}+{\frac {1}{2}}\operatorname {tr} \left({\boldsymbol {C}}^{-1}{\frac {\partial {\boldsymbol {C}}}{\partial \theta _{m}}}{\boldsymbol {C}}^{-1}{\frac {\partial {\boldsymbol {C}}}{\partial \theta _{k}}}\right)}

donde "tr" es el rastro .

Por ejemplo, dejemosw[j]{\displaystyle w[j]}ser una muestra denorte{\displaystyle n}observaciones independientes con media desconocidaθ{\displaystyle \theta }y varianza conocidaσ2{\displaystyle \sigma ^{2}}.

w[j]norted,norte(θ1,σ2I).{\displaystyle w[j]\sim {\mathcal {N}}_{d,n}\left(\theta {\boldsymbol {1}},\sigma ^{2}{\boldsymbol {I}}\right).}

Entonces, la información de Fisher es un escalar dado por

I(θ)=(μ(θ)θ)Tdo1(μ(θ)θ)=i=1norte1σ2=norteσ2,{\displaystyle I(\theta )=\left({\frac {\partial {\boldsymbol {\mu }}(\theta )}{\partial \theta }}\right)^{T}{\boldsymbol {C}}^{-1}\left({\frac {\partial {\boldsymbol {\mu }}(\theta )}{\partial \theta }}\right)=\sum _{i=1}^{n}{\frac {1}{\sigma ^{2}}}={\frac {n}{\sigma ^{2}}},}

y así el límite de Cramér-Rao es

var(θ^)σ2norte.{\displaystyle \operatorname {var} ({\hat {\theta }})\geq {\frac {\sigma ^{2}}{n}}.}

Varianza normal con media conocida

Supongamos que X es una variable aleatoria con distribución normal y media conocida.μ{\displaystyle \mu }y varianza desconocidaσ2{\displaystyle \sigma ^{2}}Consideremos la siguiente estadística:

T=i=1norte(incógnitaiμ)2norte.{\displaystyle T={\frac {\sum _{i=1}^{n}(X_{i}-\mu )^{2}}{n}}.}

Entonces T es imparcial paraσ2{\displaystyle \sigma ^{2}}, comomi(T)=σ2{\displaystyle E(T)=\sigma ^{2}}¿Cuál es la varianza de T ?

var(T)=var(i=1norte(incógnitaiμ)2norte)=i=1nortevar(incógnitaiμ)2norte2=nortevar(incógnitaμ)2norte2=1norte[mi{(incógnitaμ)4}(mi{(incógnitaμ)2})2]{\displaystyle \operatorname {var} (T)=\operatorname {var} \left({\frac {\sum _{i=1}^{n}(X_{i}-\mu )^{2}}{n}}\right)={\frac {\sum _{i=1}^{n}\operatorname {var} (X_{i}-\mu )^{2}}{n^{2}}}={\frac {n\operatorname {var} (X-\mu )^{2}}{n^{2}}}={\frac {1}{n}}\left[\operatorname {E} \left\{(X-\mu )^{4}\right\}-\left(\operatorname {E} \{(X-\mu )^{2}\}\right)^{2}\right]}

(la segunda igualdad se deduce directamente de la definición de varianza y del hecho de queincógnitai{\displaystyle X_{i}}(son independientes). El primer término es el cuarto momento respecto a la media y tiene valor3(σ2)2{\displaystyle 3(\sigma ^{2})^{2}}; el segundo es el cuadrado de la varianza, o(σ2)2{\displaystyle (\sigma ^{2})^{2}}. De este modo

var(T)=2(σ2)2norte.{\displaystyle \operatorname {var} (T)={\frac {2(\sigma ^{2})^{2}}{n}}.}

Ahora bien, ¿cuál es la información de Fisher en la muestra? Recordemos que la puntuaciónV{\displaystyle V}se define como

V=σ2registro[L(σ2,incógnita)]{\displaystyle V={\frac {\partial }{\partial \sigma ^{2}}}\log \left[L(\sigma ^{2},X)\right]}

dóndeL{\displaystyle L}es la función de verosimilitud . Por lo tanto, en este caso,

registro[L(σ2,incógnita)]=registro[12πσ2mi(incógnitaμ)2/2σ2]=registro(2πσ2)(incógnitaμ)22σ2{\displaystyle \log \left[L(\sigma ^{2},X)\right]=\log \left[{\frac {1}{\sqrt {2\pi \sigma ^{2}}}}e^{-(X-\mu )^{2}/{2\sigma ^{2}}}\right]=-\log({\sqrt {2\pi \sigma ^{2}}})-{\frac {(X-\mu )^{2}}{2\sigma ^{2}}}}
V=σ2registro[L(σ2,incógnita)]=σ2[registro(2πσ2)(incógnitaμ)22σ2]=12σ2+(incógnitaμ)22(σ2)2{\displaystyle V={\frac {\partial }{\partial \sigma ^{2}}}\log \left[L(\sigma ^{2},X)\right]={\frac {\partial }{\partial \sigma ^{2}}}\left[-\log({\sqrt {2\pi \sigma ^{2}}})-{\frac {(X-\mu )^{2}}{2\sigma ^{2}}}\right]=-{\frac {1}{2\sigma ^{2}}}+{\frac {(X-\mu )^{2}}{2(\sigma ^{2})^{2}}}}

donde la segunda igualdad proviene del cálculo elemental. Por lo tanto, la información en una sola observación es simplemente menos la esperanza de la derivada deV{\displaystyle V}, o

I=mi(Vσ2)=mi((incógnitaμ)2(σ2)3+12(σ2)2)=σ2(σ2)312(σ2)2=12(σ2)2.{\displaystyle I=-\operatorname {E} \left({\frac {\partial V}{\partial \sigma ^{2}}}\right)=-\operatorname {E} \left(-{\frac {(X-\mu )^{2}}{(\sigma ^{2})^{3}}}+{\frac {1}{2(\sigma ^{2})^{2}}}\right)={\frac {\sigma ^{2}}{(\sigma ^{2})^{3}}}-{\frac {1}{2(\sigma ^{2})^{2}}}={\frac {1}{2(\sigma ^{2})^{2}}}.}

Por lo tanto, la información en una muestra denorte{\displaystyle n}Las observaciones independientes son simplementenorte{\displaystyle n}veces esto, onorte2(σ2)2.{\displaystyle {\frac {n}{2(\sigma ^{2})^{2}}}.}

El límite de Cramér-Rao establece que

var(T)1I.{\displaystyle \operatorname {var} (T)\geq {\frac {1}{I}}.}

En este caso, la desigualdad se satura (se alcanza la igualdad), lo que demuestra que el estimador es eficiente .

Sin embargo, podemos lograr un error cuadrático medio menor utilizando un estimador sesgado. El estimador

T=i=1norte(incógnitaiμ)2norte+2.{\displaystyle T={\frac {\sum _{i=1}^{n}(X_{i}-\mu )^{2}}{n+2}}.}

Obviamente tiene una varianza menor, que es de hecho

var(T)=2norte(σ2)2(norte+2)2.{\displaystyle \operatorname {var} (T)={\frac {2n(\sigma ^{2})^{2}}{(n+2)^{2}}}.}

Su sesgo es

(1nortenorte+2)σ2=2σ2norte+2{\displaystyle \left(1-{\frac {n}{n+2}}\right)\sigma ^{2}={\frac {2\sigma ^{2}}{n+2}}}

por lo que su error cuadrático medio es

MSE(T)=(2norte(norte+2)2+4(norte+2)2)(σ2)2=2(σ2)2norte+2{\displaystyle \operatorname {MSE} (T)=\left({\frac {2n}{(n+2)^{2}}}+{\frac {4}{(n+2)^{2}}}\right)(\sigma ^{2})^{2}={\frac {2(\sigma ^{2})^{2}}{n+2}}}

lo cual es menor que lo que pueden lograr los estimadores insesgados según la cota de Cramér-Rao.

Cuando se desconoce la media, la estimación del mínimo error cuadrático medio de la varianza de una muestra de una distribución gaussiana se obtiene dividiendo por norte+1{\displaystyle n+1}, en vez denorte1{\displaystyle n-1}onorte+2{\displaystyle n+2}.

Véase también

Referencias y notas

  1. Cramér, Harald (1946). Métodos matemáticos de estadística . Princeton, NJ: Princeton Univ. Press. ISBN 0-691-08004-6OCLC 185436716 {{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  2. Rao, Calyampudi Radakrishna ( 1945). "Información y precisión alcanzable en la estimación de parámetros estadísticos". Boletín de la Sociedad Matemática de Calcuta . 37. Sociedad Matemática de Calcuta : 81–89 . MR 0015748 . 
  3. ^ Rao, Calyampudi Radakrishna (1994). S. Das Gupta (ed.). Artículos seleccionados de CR Rao . Nueva York: Wiley. ISBN 978-0-470-22091-7OCLC 174244259 
  4. ^ Fréchet, Maurice (1943). "Sobre la extensión de ciertas evaluaciones estadísticas au cas de petits échantillons". Rev. Inst. Int. Estatista . 11 (3/4): 182– 205. doi : 10.2307/1401114 . JSTOR 1401114 . 
  5. ^ Darmois, Georges (1945). "Sobre los límites de la dispersión de ciertas estimaciones". Rev. Int. Inst. Estatista . 13 (1/4): 9– 15. doi : 10.2307/1400974 . JSTOR 1400974 . 
  6. Aitken, AC; Silverstone, H. (1942). "XV.—Sobre la estimación de parámetros estadísticos" . Actas de la Royal Society de Edimburgo, Sección A: Matemáticas . 61 (2): 186– 194. doi : 10.1017/S008045410000618X . ISSN 2053-5902 . S2CID 124029876 .  
  7. Shenton, LR (1970). "La llamada desigualdad de Cramér-Rao". The American Statistician . 24 (2): 36. JSTOR 2681931 . 
  8. Dodge, Yadolah (2003). The Oxford Dictionary of Statistical Terms . Oxford University Press. ISBN 978-0-19-920613-1.
  9. Bhattacharyya, A. (1946). " Sobre algunos análogos de la cantidad de información y su uso en la estimación estadística" . Sankhyā . 8 (1): 1– 14. JSTOR 25047921. MR 0020242 .  
  10. Bhattacharyya, A. (1947). " Sobre algunos análogos de la cantidad de información y su uso en la estimación estadística (cont.)" . Sankhyā . 8 (3): 201– 218. JSTOR 25047948. MR 0023503 .  
  11. Bhattacharyya, A. (1948). "Sobre algunos análogos de la cantidad de información y su uso en la estimación estadística (conclusión)" . Sankhyā . 8 ( 4): 315–328 . JSTOR 25047897. MR 0026302 .  
  12. Nielsen, Frank (2013). «Cramér–Rao Lower Bound and Information Geometry». Connected at Infinity II . Texts and Readings in Mathematics. Vol. 67. Hindustan Book Agency, Gurgaon. págs. 18-37. arXiv : 1301.3578 . doi : 10.1007/978-93-86279-56-9_2 . ISBN   978-93-80250-51-9. S2CID 16759683 . 
  13. Suba Rao. "Conferencias sobre inferencia estadística" (PDF) . Archivado del original (PDF) el 26 de septiembre de 2020. Consultado el 24 de mayo de 2020 .
  14. «Cramér Rao Límite Inferior - Navipedia» . gssc.esa.int .
  15. "Cramér–Rao Bound" .
  16. Para el caso bayesiano, véase la ecuación (11) de Bobrovsky; Mayer-Wolf; Zakai (1987). "Algunas clases de límites globales de Cramér-Rao" . Ann. Stat . 15 (4): 1421–38 . doi : 10.1214/aos/1176350602 .
  17. Polyanskiy, Yury (2017). "Apuntes de clase sobre teoría de la información, capítulo 29, ECE563 (UIUC)" (PDF) . Apuntes de clase sobre teoría de la información . Archivado (PDF) del original el 24 de mayo de 2022. Recuperado el 24 de mayo de 2022 .
  18. Kay, SM (1993). Fundamentos del procesamiento estadístico de señales: Teoría de la estimación . Prentice Hall. pág. 47. ISBN  0-13-042268-1.

Lecturas adicionales

  • Amemiya, Takeshi (1985). Econometría avanzada . Cambridge: Harvard University Press. pp. 14-17 . ISBN  0-674-00560-0.
  • Bos, Adriaan van den (2007). Estimación de parámetros para científicos e ingenieros . Hoboken: John Wiley & Sons. pp. 45–98 . ISBN  978-0-470-14781-8.
  • Kay, Steven M. (1993). Fundamentos del procesamiento estadístico de señales, Volumen I: Teoría de la estimación . Prentice Hall. ISBN 0-13-345711-7.Capítulo 3.
  • Shao, Jun (1998). Estadística matemática . Nueva York: Springer. ISBN 0-387-98674-X.. Sección 3.1.3.
  • Incertidumbre posterior, ley asintótica y límite de Cramér-Rao, Control estructural y monitorización de la salud 25(1851):e2113 DOI: 10.1002/stc.2113
  • FandPLimitTool es un software con interfaz gráfica de usuario (GUI) para calcular la información de Fisher y el límite inferior de Cramér-Rao, con aplicación a la microscopía de molécula única.