
En la teoría de la estimación y la estadística , la cota de Cramér-Rao ( CRB ) se relaciona con la estimación de un parámetro determinista (fijo, aunque desconocido). El resultado recibe su nombre en honor a Harald Cramér y Calyampudi Radhakrishna Rao , [ 1 ] [ 2 ] [ 3 ] pero también ha sido derivado independientemente por Maurice Fréchet , [ 4 ] Georges Darmois , [ 5 ] y por Alexander Aitken y Harold Silverstone . [ 6 ] [ 7 ] También se conoce como cota inferior de Fréchet-Cramér-Rao o Fréchet-Darmois-Cramér-Rao. Establece que la precisión de cualquier estimador insesgado es como máximo la información de Fisher ; o (equivalentemente) el recíproco de la información de Fisher es una cota inferior de su varianza .
Se dice que un estimador insesgado que alcanza este límite es (totalmente) eficiente . Dicha solución logra el menor error cuadrático medio posible entre todos los métodos insesgados y, por lo tanto, es el estimador insesgado de mínima varianza (MVU). Sin embargo, en algunos casos, no existe ninguna técnica insesgada que alcance el límite. Esto puede ocurrir si, para cualquier estimador insesgado, existe otro con una varianza estrictamente menor, o si existe un estimador MVU, pero su varianza es estrictamente mayor que el inverso de la información de Fisher.
La cota de Cramér-Rao también puede utilizarse para acotar la varianza de estimadores sesgados con un sesgo dado. En algunos casos, un enfoque sesgado puede dar como resultado una varianza y un error cuadrático medio inferiores a la cota inferior insesgada de Cramér-Rao; véase sesgo del estimador .
Anil Kumar Bhattacharyya propuso un progreso significativo sobre la cota inferior de Cramér-Rao a través de una serie de trabajos, denominados cota de Bhattacharyya . [ 8 ] [ 9 ] [ 10 ] [ 11 ]
Declaración
En esta sección se presenta la cota de Cramér-Rao para varios casos cada vez más generales, comenzando con el caso en que el parámetro es un escalar y su estimador es insesgado . Todas las versiones de la cota requieren ciertas condiciones de regularidad, que se cumplen para la mayoría de las distribuciones bien comportadas. Estas condiciones se enumeran más adelante en esta sección .
Caso escalar insesgado
Suponeres un parámetro determinista desconocido que debe estimarse a partir deobservaciones independientes (mediciones) de, cada uno de una distribución según alguna función de densidad de probabilidad. La varianza de cualquier estimador insesgadodeentonces está acotado [ 12 ] por el recíproco de la información de Fisher:
donde la información de Fisherse define por
yes el logaritmo natural de la función de verosimilitud para una sola muestra.ydenota el valor esperado con respecto a la densidadde. Si no se indica, en lo que sigue, la esperanza se toma con respecto a .
SiSi es dos veces diferenciable y se cumplen ciertas condiciones de regularidad, entonces la información de Fisher también se puede definir de la siguiente manera: [ 13 ]
La eficiencia de un estimador insesgadomide qué tan cerca está la varianza de este estimador de este límite inferior; la eficiencia del estimador se define como
o la varianza mínima posible para un estimador insesgado dividida por su varianza real. El límite inferior de Cramér-Rao da, por lo tanto,
- .
Caso escalar general
Se puede obtener una forma más general de la cota considerando un estimador sesgado., cuya expectativa no espero una función de este parámetro, por ejemplo,. Por eso no es generalmente igual a 0. En este caso, el límite viene dado por
dóndees el derivado de(por), yes la información de Fisher definida anteriormente.
Límite de la varianza de los estimadores sesgados
Además de ser una cota para los estimadores de funciones del parámetro, este enfoque puede utilizarse para derivar una cota para la varianza de los estimadores sesgados con un sesgo dado, como sigue. [ 14 ] Consideremos un estimadorcon sesgoy dejar. Según el resultado anterior, cualquier estimador insesgado cuya esperanza seatiene varianza mayor o igual quePor lo tanto, cualquier estimadorcuyo sesgo viene dado por una funciónsatisface [ 15 ]
La versión imparcial de la cota es un caso especial de este resultado, con.
Es trivial tener una varianza pequeña: un "estimador" que es constante tiene una varianza de cero. Pero de la ecuación anterior, encontramos que el error cuadrático medio de un estimador sesgado está acotado por
utilizando la descomposición estándar del MSE. Sin embargo, tenga en cuenta que siEste límite podría ser menor que el límite imparcial de Cramér-Rao.. Por ejemplo, en el ejemplo de estimación de la varianza que se muestra a continuación ,.
caso multivariado
Extendiendo la cota de Cramér-Rao a múltiples parámetros, defina un vector columna de parámetros.
con función de densidad de probabilidadque satisface las dos condiciones de regularidad que se indican a continuación.
La matriz de información de Fisher es unamatriz con elementodefinido como
Dejarser un estimador de cualquier función vectorial de parámetros,y denotamos su vector de esperanzapor. La cota de Cramér-Rao establece entonces que la matriz de covarianza deSatisface
- ,
dónde
- La desigualdad matricialse entiende que significa que la matrizes semidefinida positiva y
- es la matriz jacobiana cuyaEl elemento viene dado por.
Sies un estimador insesgado de(es decir,), entonces la cota de Cramér-Rao se reduce a
Si resulta inconveniente calcular la inversa de la matriz de información de Fisher , entonces se puede simplemente tomar el recíproco del elemento diagonal correspondiente para encontrar una cota inferior (posiblemente aproximada). [ 16 ]
Condiciones de regularidad
El límite se basa en dos condiciones de regularidad débiles sobre la función de densidad de probabilidad ,y el estimador:
- La información de Fisher siempre está definida; equivalentemente, para todosde tal manera que,Existe y es finito.
- Las operaciones de integración con respecto ay diferenciación con respecto apueden intercambiarse con la expectativa de; eso es,siempre que el lado derecho sea finito.Esta condición a menudo se puede confirmar utilizando el hecho de que la integración y la diferenciación se pueden intercambiar cuando se cumple cualquiera de los siguientes casos:
- La funcióntiene apoyo limitado eny los límites no dependen de;
- La funcióntiene soporte infinito, es continuamente diferenciable y la integral converge uniformemente para todo.
Prueba
Demostración para el caso general basada en la cota de Chapman-Robbins.
Prueba basada en [ 17 ] .
Primera ecuación:
Dejarsea infinitesimal, entonces para cualquier, enchufandoEntramos, tenemos ;\quad \chi ^{2}(\mu _{\theta '};\mu _{\theta })=v^{T}I(\theta )v\delta ^{2}}
Sustituyendo esto en la cota de Chapman-Robbins multivariada se obtiene.
Segunda ecuación:
Basta con demostrar esto para el caso escalar, contomando valores enPorque en general, podemos tomar cualquier, luego definiendo, el caso escalar daEsto se aplica a todos, por lo que podemos concluirEl caso escalar establece quecon.
Dejarsea infinitesimal, entonces para cualquier, tomandoen la cota de Chapman-Robbins de una sola variable da .
Mediante álgebra lineal,para cualquier matriz definida positiva, así obtenemos
Una demostración independiente para el caso escalar general.
Para el caso escalar general :
Supongamos quees un estimador con esperanza(basado en las observaciones)), es decir queEl objetivo es demostrar que, para todos,
Dejarsea una variable aleatoria con función de densidad de probabilidad. Aquíes una estadística que se utiliza como estimador para. Definircomo la puntuación :
donde se utiliza la regla de la cadena en la igualdad final anterior. Entonces la esperanza de, escritoes cero. Esto se debe a que:
donde la integral y la derivada parcial se han intercambiado (justificado por la segunda condición de regularidad).
Si consideramos la covarianzadey, tenemos, porque. Ampliando esta expresión tenemos
Nuevamente, porque las operaciones de integración y diferenciación conmutan (segunda condición).
La desigualdad de Cauchy-Schwarz muestra que
por lo tanto
lo cual demuestra la proposición.
Ejemplos
Distribución normal multivariada
Para el caso de una distribución normal de d variables
La matriz de información de Fisher tiene elementos [ 18 ].
donde "tr" es el rastro .
Por ejemplo, dejemosser una muestra deobservaciones independientes con media desconociday varianza conocida.
Entonces, la información de Fisher es un escalar dado por
y así el límite de Cramér-Rao es
Varianza normal con media conocida
Supongamos que X es una variable aleatoria con distribución normal y media conocida.y varianza desconocidaConsideremos la siguiente estadística:
Entonces T es imparcial para, como¿Cuál es la varianza de T ?
(la segunda igualdad se deduce directamente de la definición de varianza y del hecho de que(son independientes). El primer término es el cuarto momento respecto a la media y tiene valor; el segundo es el cuadrado de la varianza, o. De este modo
Ahora bien, ¿cuál es la información de Fisher en la muestra? Recordemos que la puntuaciónse define como
dóndees la función de verosimilitud . Por lo tanto, en este caso,
donde la segunda igualdad proviene del cálculo elemental. Por lo tanto, la información en una sola observación es simplemente menos la esperanza de la derivada de, o
Por lo tanto, la información en una muestra deLas observaciones independientes son simplementeveces esto, o
El límite de Cramér-Rao establece que
En este caso, la desigualdad se satura (se alcanza la igualdad), lo que demuestra que el estimador es eficiente .
Sin embargo, podemos lograr un error cuadrático medio menor utilizando un estimador sesgado. El estimador
Obviamente tiene una varianza menor, que es de hecho
Su sesgo es
por lo que su error cuadrático medio es
lo cual es menor que lo que pueden lograr los estimadores insesgados según la cota de Cramér-Rao.
Cuando se desconoce la media, la estimación del mínimo error cuadrático medio de la varianza de una muestra de una distribución gaussiana se obtiene dividiendo por , en vez deo.
Véase también
Referencias y notas
- ↑ Cramér, Harald (1946). Métodos matemáticos de estadística . Princeton, NJ: Princeton Univ. Press. ISBN 0-691-08004-6OCLC 185436716
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - ↑ Rao, Calyampudi Radakrishna ( 1945). "Información y precisión alcanzable en la estimación de parámetros estadísticos". Boletín de la Sociedad Matemática de Calcuta . 37. Sociedad Matemática de Calcuta : 81–89 . MR 0015748 .
- ^ Rao, Calyampudi Radakrishna (1994). S. Das Gupta (ed.). Artículos seleccionados de CR Rao . Nueva York: Wiley. ISBN 978-0-470-22091-7OCLC 174244259
- ^ Fréchet, Maurice (1943). "Sobre la extensión de ciertas evaluaciones estadísticas au cas de petits échantillons". Rev. Inst. Int. Estatista . 11 (3/4): 182– 205. doi : 10.2307/1401114 . JSTOR 1401114 .
- ^ Darmois, Georges (1945). "Sobre los límites de la dispersión de ciertas estimaciones". Rev. Int. Inst. Estatista . 13 (1/4): 9– 15. doi : 10.2307/1400974 . JSTOR 1400974 .
- ↑ Aitken, AC; Silverstone, H. (1942). "XV.—Sobre la estimación de parámetros estadísticos" . Actas de la Royal Society de Edimburgo, Sección A: Matemáticas . 61 (2): 186– 194. doi : 10.1017/S008045410000618X . ISSN 2053-5902 . S2CID 124029876 .
- ↑ Shenton, LR (1970). "La llamada desigualdad de Cramér-Rao". The American Statistician . 24 (2): 36. JSTOR 2681931 .
- ↑ Dodge, Yadolah (2003). The Oxford Dictionary of Statistical Terms . Oxford University Press. ISBN 978-0-19-920613-1.
- ↑ Bhattacharyya, A. (1946). " Sobre algunos análogos de la cantidad de información y su uso en la estimación estadística" . Sankhyā . 8 (1): 1– 14. JSTOR 25047921. MR 0020242 .
- ↑ Bhattacharyya, A. (1947). " Sobre algunos análogos de la cantidad de información y su uso en la estimación estadística (cont.)" . Sankhyā . 8 (3): 201– 218. JSTOR 25047948. MR 0023503 .
- ↑ Bhattacharyya, A. (1948). "Sobre algunos análogos de la cantidad de información y su uso en la estimación estadística (conclusión)" . Sankhyā . 8 ( 4): 315–328 . JSTOR 25047897. MR 0026302 .
- ↑ Nielsen, Frank (2013). «Cramér–Rao Lower Bound and Information Geometry». Connected at Infinity II . Texts and Readings in Mathematics. Vol. 67. Hindustan Book Agency, Gurgaon. págs. 18-37. arXiv : 1301.3578 . doi : 10.1007/978-93-86279-56-9_2 . ISBN 978-93-80250-51-9. S2CID 16759683 .
- ↑ Suba Rao. "Conferencias sobre inferencia estadística" (PDF) . Archivado del original (PDF) el 26 de septiembre de 2020. Consultado el 24 de mayo de 2020 .
- ↑ «Cramér Rao Límite Inferior - Navipedia» . gssc.esa.int .
- ↑ "Cramér–Rao Bound" .
- ↑ Para el caso bayesiano, véase la ecuación (11) de Bobrovsky; Mayer-Wolf; Zakai (1987). "Algunas clases de límites globales de Cramér-Rao" . Ann. Stat . 15 (4): 1421–38 . doi : 10.1214/aos/1176350602 .
- ↑ Polyanskiy, Yury (2017). "Apuntes de clase sobre teoría de la información, capítulo 29, ECE563 (UIUC)" (PDF) . Apuntes de clase sobre teoría de la información . Archivado (PDF) del original el 24 de mayo de 2022. Recuperado el 24 de mayo de 2022 .
- ↑ Kay, SM (1993). Fundamentos del procesamiento estadístico de señales: Teoría de la estimación . Prentice Hall. pág. 47. ISBN 0-13-042268-1.
Lecturas adicionales
- Amemiya, Takeshi (1985). Econometría avanzada . Cambridge: Harvard University Press. pp. 14-17 . ISBN 0-674-00560-0.
- Bos, Adriaan van den (2007). Estimación de parámetros para científicos e ingenieros . Hoboken: John Wiley & Sons. pp. 45–98 . ISBN 978-0-470-14781-8.
- Kay, Steven M. (1993). Fundamentos del procesamiento estadístico de señales, Volumen I: Teoría de la estimación . Prentice Hall. ISBN 0-13-345711-7.Capítulo 3.
- Shao, Jun (1998). Estadística matemática . Nueva York: Springer. ISBN 0-387-98674-X.. Sección 3.1.3.
- Incertidumbre posterior, ley asintótica y límite de Cramér-Rao, Control estructural y monitorización de la salud 25(1851):e2113 DOI: 10.1002/stc.2113
Enlaces externos
- FandPLimitTool es un software con interfaz gráfica de usuario (GUI) para calcular la información de Fisher y el límite inferior de Cramér-Rao, con aplicación a la microscopía de molécula única.
- Desigualdades estadísticas
- Teoría de la estimación