Articulo de referencia

Información de Fisher

Sir Ronald Aylmer Fisher (1890–1962) en 1912, como moderador en la Primera Conferencia Internacional de Eugenesia. En estadística matemática , la información de Fisher es una fo...

Sir Ronald Aylmer Fisher (1890–1962) en 1912, como moderador en la Primera Conferencia Internacional de Eugenesia.

En estadística matemática , la información de Fisher es una forma de medir la cantidad de información que una variable aleatoria observable X contiene sobre un parámetro desconocido θ de una distribución que modela X. Formalmente, es la varianza de la puntuación , o el valor esperado de la información observada .

El papel de la información de Fisher en la teoría asintótica de la estimación de máxima verosimilitud fue destacado y explorado por el estadístico Sir Ronald Fisher (a partir de algunos resultados iniciales de Francis Ysidro Edgeworth ). La matriz de información de Fisher se utiliza para calcular las matrices de covarianza asociadas a las estimaciones de máxima verosimilitud . También puede emplearse en la formulación de estadísticos de prueba, como la prueba de Wald .

En estadística bayesiana , la información de Fisher desempeña un papel en la derivación de distribuciones a priori no informativas según la regla de Jeffreys . [ 1 ] También aparece como la covarianza de muestra grande de la distribución posterior , siempre que la distribución a priori sea suficientemente suave (un resultado conocido como teorema de Bernstein-von Mises , que fue anticipado por Laplace para familias exponenciales ). [ 2 ] El mismo resultado se utiliza al aproximar la distribución posterior con la aproximación de Laplace , donde la información de Fisher aparece como la covarianza de la gaussiana ajustada. [ 3 ]

Se ha demostrado que los sistemas estadísticos de naturaleza científica (física, biológica, etc.) cuyas funciones de verosimilitud obedecen a la invariancia de traslación obedecen a la información máxima de Fisher. [ 4 ] El nivel del máximo depende de la naturaleza de las restricciones del sistema.

Definición

La información de Fisher es una forma de medir la cantidad de información que contiene una variable aleatoria observable.incógnita{\displaystyle X}lleva consigo un parámetro desconocidoθ{\displaystyle \theta }sobre la cual la probabilidad deincógnita{\displaystyle X}Depende. DejaF(incógnita;θ){\displaystyle f(X;\theta )}sea ​​la función de densidad de probabilidad (o función de masa de probabilidad ) paraincógnita{\displaystyle X}condicionado al valor deθ{\displaystyle \theta }. Describe la probabilidad de que observemos un resultado determinado deincógnita{\displaystyle X}, dado un valor conocido deθ{\displaystyle \theta }. SiF{\displaystyle f}alcanza un pico pronunciado con respecto a los cambios enθ{\displaystyle \theta }, es fácil indicar el valor "correcto" deθ{\displaystyle \theta }a partir de los datos, o equivalentemente, que los datosincógnita{\displaystyle X}proporciona mucha información sobre el parámetroθ{\displaystyle \theta }. SiF{\displaystyle f}es plano y extendido, entonces se necesitarían muchas muestras deincógnita{\displaystyle X}para estimar el valor "verdadero" real deθ{\displaystyle \theta }que se obtendría utilizando toda la población muestreada. Esto sugiere estudiar algún tipo de varianza con respecto aθ{\displaystyle \theta }.

Formalmente, la derivada parcial con respecto aθ{\displaystyle \theta }El logaritmo natural de la función de verosimilitud se denomina puntuación . Bajo ciertas condiciones de regularidad, siθ{\displaystyle \theta }es el parámetro verdadero (es decir,incógnita{\displaystyle X}en realidad se distribuye comoF(incógnita;θ){\displaystyle f(X;\theta )}), se puede demostrar que el valor esperado (el primer momento ) de la puntuación, evaluado en el valor verdadero del parámetroθ{\displaystyle \theta }, es 0: [ 5 ]

mi[θregistroF(incógnita;θ)|θ]=RθF(incógnita;θ)F(incógnita;θ)F(incógnita;θ)dincógnita=θRF(incógnita;θ)dincógnita=θ1=0.{\displaystyle {\begin{aligned}\operatorname {E} \left[\left.{\frac {\partial }{\partial \theta }}\log f(X;\theta )\,\,\right|\,\,\theta \right]={}&\int _{\mathbb {R} }{\frac {{\frac {\partial }{\partial \theta }}f(x;\theta )}{f(x;\theta )}}f(x;\theta )\,dx\\[6pt]={}&{\frac {\partial }{\partial \theta }}\int _{\mathbb {R} }f(x;\theta )\,dx\\[6pt]={}&{\frac {\partial }{\partial \theta }}1\\[6pt]={}&0.\end{aligned}}}

La información de Fisher se define como la varianza de la puntuación: [ 6 ]

I(θ)=mi[(θregistroF(incógnita;θ))2|θ]=R(θregistroF(incógnita;θ))2F(incógnita;θ)dincógnita,{\displaystyle {\mathcal {I}}(\theta )=\operatorname {E} \left[\left.\left({\frac {\partial }{\partial \theta }}\log f(X;\theta )\right)^{2}\,\,\right|\,\,\theta \right]=\int _{\mathbb {R} }\left({\frac {\partial }{\partial \theta }}\log f(x;\theta )\right)^{2}f(x;\theta )\,dx,}

Tenga en cuenta queI(θ)0{\displaystyle {\mathcal {I}}(\theta )\geq 0}Una variable aleatoria con un alto valor de información de Fisher implica que el valor absoluto de la puntuación suele ser alto. La información de Fisher no depende de una observación particular, ya que la variable aleatoria X ha sido promediada.

Si log f ( x ; θ ) es dos veces diferenciable con respecto a θ , y bajo ciertas condiciones de regularidad adicionales, entonces la información de Fisher también puede escribirse como [ 7 ]

I(θ)=mi[2θ2registroF(incógnita;θ)|θ],{\displaystyle {\mathcal {I}}(\theta )=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\log f(X;\theta )\,\,\right|\,\,\theta \right],}

Así, la información de Fisher puede interpretarse como la curvatura de la curva de soporte (la gráfica de la log-verosimilitud). Cerca de la estimación de máxima verosimilitud , una información de Fisher baja indica que el máximo parece ser "sutil", es decir, existen muchos puntos en la vecindad que proporcionan una log-verosimilitud similar. Por el contrario, una información de Fisher alta indica que el máximo es "nítido".

Condiciones de regularidad

Las condiciones de regularidad son las siguientes: [ 8 ]

  1. La derivada parcial de f ( X ; θ ) con respecto a θ existe casi en todas partes . (Puede no existir en un conjunto nulo , siempre que este conjunto no dependa de θ ).
  2. La integral de f ( X ; θ ) se puede diferenciar bajo el signo integral con respecto a θ .
  3. El soporte de f ( X ; θ ) no depende de θ .

Si θ es un vector, entonces las condiciones de regularidad deben cumplirse para cada componente de θ . Es fácil encontrar un ejemplo de una densidad que no satisface las condiciones de regularidad: la densidad de una variable uniforme (0, θ ) no satisface las condiciones 1 y 3. En este caso, aunque la información de Fisher se puede calcular a partir de la definición, no tendrá las propiedades que normalmente se le atribuyen.

En términos de probabilidad

Dado que la probabilidad de θ en función de X es siempre proporcional a la probabilidad f ( X ; θ ), sus logaritmos necesariamente difieren en una constante independiente de θ , y las derivadas de estos logaritmos con respecto a θ son necesariamente iguales. Por lo tanto, se puede sustituir el logaritmo de la verosimilitud l ( θ ; X ) por el logaritmo de f ( X ; θ ) en las definiciones de la información de Fisher.

Muestras de cualquier tamaño

El valor X puede representar una muestra individual extraída de una única distribución o un conjunto de muestras extraídas de varias distribuciones. Si hay n muestras y las n distribuciones correspondientes son estadísticamente independientes , la información de Fisher será necesariamente la suma de los valores de información de Fisher de cada muestra individual, uno por cada muestra de su distribución. En particular, si las n distribuciones son independientes e idénticamente distribuidas , la información de Fisher será necesariamente n veces la información de Fisher de una muestra individual de la distribución común. Dicho de otro modo, la información de Fisher de observaciones i.i.d. de una muestra de tamaño n de una población es igual al producto de n y la información de Fisher de una sola observación de la misma población.

Derivación informal del límite de Cramér-Rao

La cota de Cramér-Rao [ 9 ] [ 10 ] establece que el inverso de la información de Fisher es una cota inferior de la varianza de cualquier estimador insesgado de θ . Van Trees (1968) y Frieden (2004) proporcionan el siguiente método para derivar la cota de Cramér-Rao , un resultado que describe el uso de la información de Fisher.

De manera informal, comenzamos considerando un estimador insesgado.θ^(incógnita){\displaystyle {\hat {\theta }}(X)}Matemáticamente, "imparcial" significa que

mi[θ^(incógnita)θ|θ]=(θ^(incógnita)θ)F(incógnita;θ)dincógnita=0 independientemente del valor de θ.{\displaystyle \operatorname {E} \left[\left.{\hat {\theta }}(X)-\theta \,\,\right|\,\,\theta \right]=\int \left({\hat {\theta }}(x)-\theta \right)\,f(x;\theta )\,dx=0{\text{ regardless of the value of }}\theta .}

Esta expresión es cero independientemente de θ , por lo que su derivada parcial con respecto a θ también debe ser cero. Por la regla del producto , esta derivada parcial también es igual a

0=θ(θ^(incógnita)θ)F(incógnita;θ)dincógnita=(θ^(incógnita)θ)FθdincógnitaFdincógnita.{\displaystyle 0={\frac {\partial }{\partial \theta }}\int \left({\hat {\theta }}(x)-\theta \right)\,f(x;\theta )\,dx=\int \left({\hat {\theta }}(x)-\theta \right){\frac {\partial f}{\partial \theta }}\,dx-\int f\,dx.}

Para cada θ , la función de verosimilitud es una función de densidad de probabilidad y, por lo tanto,Fdincógnita=1{\displaystyle \int f\,dx=1}. Utilizando la regla de la cadena en la derivada parcial deregistroF{\displaystyle \log f}y luego dividiendo y multiplicando porF(incógnita;θ){\displaystyle f(x;\theta )}, se puede verificar que

Fθ=FregistroFθ.{\displaystyle {\frac {\partial f}{\partial \theta }}=f\,{\frac {\partial \log f}{\partial \theta }}.}

Utilizando estos dos hechos anteriores, obtenemos:

(θ^θ)FregistroFθdincógnita=1.{\displaystyle \int \left({\hat {\theta }}-\theta \right)f\,{\frac {\partial \log f}{\partial \theta }}\,dx=1.}

Factorizar el integrando da como resultado

((θ^θ)F)(FregistroFθ)dincógnita=1.{\displaystyle \int \left(\left({\hat {\theta }}-\theta \right){\sqrt {f}}\right)\left({\sqrt {f}}\,{\frac {\partial \log f}{\partial \theta }}\right)\,dx=1.}

Elevando al cuadrado la expresión en la integral, la desigualdad de Cauchy-Schwarz produce:

1=([(θ^θ)F][FregistroFθ]dincógnita)2[(θ^θ)2Fdincógnita][(registroFθ)2Fdincógnita].{\displaystyle 1={\biggl (}\int \left[\left({\hat {\theta }}-\theta \right){\sqrt {f}}\right]\cdot \left[{\sqrt {f}}\,{\frac {\partial \log f}{\partial \theta }}\right]\,dx{\biggr )}^{2}\leq \left[\int \left({\hat {\theta }}-\theta \right)^{2}f\,dx\right]\cdot \left[\int \left({\frac {\partial \log f}{\partial \theta }}\right)^{2}f\,dx\right].}

El segundo factor entre paréntesis se define como la información de Fisher, mientras que el primer factor entre paréntesis es el error cuadrático medio (ECM) del estimador.θ^{\displaystyle {\hat {\theta }}}Dado que el estimador es insesgado, su MSE es igual a su varianza. Reordenando, la desigualdad nos dice que

Var(θ^)1I(θ).{\displaystyle \operatorname {Var} ({\hat {\theta }})\geq {\frac {1}{{\mathcal {I}}\left(\theta \right)}}.}

En otras palabras, la precisión con la que podemos estimar θ está fundamentalmente limitada por la información de Fisher de la función de verosimilitud.

Alternativamente, la misma conclusión se puede obtener directamente de la desigualdad de Cauchy-Schwarz para variables aleatorias ,|Cov(A,B)|2Var(A)Var(B){\displaystyle |\operatorname {Cov} (A,B)|^{2}\leq \operatorname {Var} (A)\operatorname {Var} (B)}, aplicado a las variables aleatoriasθ^(incógnita){\displaystyle {\hat {\theta }}(X)}yθregistroF(incógnita;θ){\displaystyle \partial _{\theta }\log f(X;\theta )}y observando que para estimadores insesgados tenemosCov[θ^(incógnita),θregistroF(incógnita;θ)]=θ^(incógnita)θF(incógnita;θ)dincógnita=θmi[θ^]=1.{\displaystyle \operatorname {Cov} [{\hat {\theta }}(X),\partial _{\theta }\log f(X;\theta )]=\int {\hat {\theta }}(x)\,\partial _{\theta }f(x;\theta )\,dx=\partial _{\theta }\operatorname {E} [{\hat {\theta }}]=1.}

Ejemplos

Experimento de Bernoulli de un solo parámetro

Un ensayo de Bernoulli es una variable aleatoria con dos resultados posibles, 0 y 1, donde 1 tiene una probabilidad de θ . El resultado puede considerarse determinado por el lanzamiento de una moneda trucada, donde la probabilidad de cara (1) es θ y la probabilidad de cruz (0) es 1 − θ .

Sea X un ensayo de Bernoulli de una muestra de la distribución. La información de Fisher contenida en X se puede calcular como:

I(θ)=mi[2θ2registro(θincógnita(1θ)1incógnita)|θ]=mi[2θ2(incógnitaregistroθ+(1incógnita)registro(1θ))|θ]=mi[incógnitaθ2+1incógnita(1θ)2|θ]=θθ2+1θ(1θ)2=1θ(1θ).{\displaystyle {\begin{aligned}{\mathcal {I}}(\theta )&=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\log \left(\theta ^{X}(1-\theta )^{1-X}\right)\right|\theta \right]\\[5pt]&=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\left(X\log \theta +(1-X)\log(1-\theta )\right)\,\,\right|\,\,\theta \right]\\[5pt]&=\operatorname {E} \left[\left.{\frac {X}{\theta ^{2}}}+{\frac {1-X}{(1-\theta )^{2}}}\,\,\right|\,\,\theta \right]\\[5pt]&={\frac {\theta }{\theta ^{2}}}+{\frac {1-\theta }{(1-\theta )^{2}}}\\[5pt]&={\frac {1}{\theta (1-\theta )}}.\end{aligned}}}

Debido a que la información de Fisher es aditiva, la información de Fisher contenida en n ensayos de Bernoulli independientes es, por lo tanto,

I(θ)=norteθ(1θ).{\displaystyle {\mathcal {I}}(\theta )={\frac {n}{\theta (1-\theta )}}.}

Siincógnitai{\displaystyle x_{i}}es uno de los2norte{\displaystyle 2^{n}}posibles resultados de n ensayos de Bernoulli independientes yincógnitaij{\displaystyle x_{ij}}es el j -ésimo resultado del i- ésimo ensayo, entonces la probabilidad deincógnitai{\displaystyle x_{i}}es dado por

pag(incógnitai,θ)=j=0norteθincógnitaij(1θ)incógnitaij{\displaystyle p(x_{i},\theta )=\prod _{j=0}^{n}\theta ^{x_{ij}}(1-\theta )^{x_{ij}}}

La media muestral del i- ésimo ensayo esμi=(1/norte)j=1norteincógnitaij{\displaystyle \mu _{i}=(1/n)\sum _{j=1}^{n}x_{ij}}. El valor esperado de la media muestral (sobre la distribución muestral ) es

mi(μ)=incógnitaiμipag(incógnitai,θ)=θ,{\displaystyle E(\mu )=\sum _{x_{i}}\mu _{i}\,p(x_{i},\theta )=\theta ,}

donde la suma es sobre todos2norte{\displaystyle 2^{n}}posibles resultados del ensayo. El valor esperado del cuadrado de la media muestral es

mi(μ2)=incógnitaiμi2pag(incógnitai,θ)=(1+(norte1)θ)θnorte{\displaystyle E(\mu ^{2})=\sum _{x_{i}}\mu _{i}^{2}\,p(x_{i},\theta )={\frac {(1+(n-1)\theta )\theta }{n}}}

por lo tanto, la varianza en el valor de la media es

mi(μ2)mi(μ)2=θ(1θ)norte{\displaystyle E(\mu ^{2})-E(\mu )^{2}={\frac {\theta (1-\theta )}{n}}}

Se observa que la información de Fisher es el recíproco de la varianza del número medio de éxitos en n ensayos de Bernoulli . Esto es generalmente cierto. En este caso, la cota de Cramér-Rao es una igualdad.

Estimar θ a partir de X ~ Bern (√ θ )

Como otro ejemplo sencillo, consideremos una variable aleatoria.incógnita{\displaystyle X}con posibles resultados 0 y 1, con probabilidadespag0=1θ{\displaystyle p_{0}=1-{\sqrt {\theta }}}ypag1=θ{\displaystyle p_{1}={\sqrt {\theta }}}, respectivamente, para algunosθ[0,1]{\displaystyle \theta \in [0,1]}Nuestro objetivo es estimarθ{\displaystyle \theta }a partir de observaciones deincógnita{\displaystyle X}.

La información de Fisher dice en este casoI(θ)=mi[(θregistroF(incógnita;θ))2|θ]=(1θ)(12θ(1θ))2+θ(12θ)2=14θ(11θ+1θ).{\displaystyle {\begin{aligned}{\mathcal {I}}(\theta )&=\mathrm {E} \left[\left({\frac {\partial }{\partial \theta }}\log f(X;\theta )\right)^{2}{\Bigg |}\,\theta \right]\\&=(1-{\sqrt {\theta }})\left({\frac {-1}{2{\sqrt {\theta }}(1-{\sqrt {\theta }})}}\right)^{2}+{\sqrt {\theta }}\left({\frac {1}{2\theta }}\right)^{2}\\&={\frac {1}{4\theta }}\left({\frac {1}{1-{\sqrt {\theta }}}}+{\frac {1}{\sqrt {\theta }}}\right)\end{aligned}}.}Esta expresión también puede derivarse directamente de la fórmula de cambio de reparametrización que se da a continuación. De manera más general, para cualquier función suficientemente regularF{\displaystyle f}de tal manera queF(θ)[0,1]{\displaystyle f(\theta )\in [0,1]}, la información de Fisher para recuperarθ{\displaystyle \theta }deincógnitaBerna(F(θ)){\displaystyle X\sim \operatorname {Bern} (f(\theta ))}se calcula de manera similar que esI(θ)=F(θ)2(11F(θ)+1F(θ)).{\displaystyle {\mathcal {I}}(\theta )=f'(\theta )^{2}\left({\frac {1}{1-f(\theta )}}+{\frac {1}{f(\theta )}}\right).}

Forma matricial

Cuando hay N parámetros, de modo que θ es un vector N × 1.θ=[θ1θ2θnorte]T,{\displaystyle \theta ={\begin{bmatrix}\theta _{1}&\theta _{2}&\dots &\theta _{N}\end{bmatrix}}^{\textsf {T}},}La información de Fisher toma la forma de una matriz N × N. Esta matriz se llama matriz de información de Fisher (FIM) y tiene elementos típicos.

[I(θ)]i,j=mi[(θiregistroF(incógnita;θ))(θjregistroF(incógnita;θ))|θ].{\displaystyle {\bigl [}{\mathcal {I}}(\theta ){\bigr ]}_{i,j}=\operatorname {E} \left[\left.\left({\frac {\partial }{\partial \theta _{i}}}\log f(X;\theta )\right)\left({\frac {\partial }{\partial \theta _{j}}}\log f(X;\theta )\right)\,\,\right|\,\,\theta \right].}

La FIM es una matriz semidefinida positiva de N × N. Si es definida positiva, define una métrica riemanniana [ 11 ] en el espacio de parámetros de N dimensiones . La geometría de la información utiliza esto para conectar la información de Fisher con la geometría diferencial , y en ese contexto, esta métrica se conoce como la métrica de información de Fisher .

Bajo ciertas condiciones de regularidad, la matriz de información de Fisher también puede escribirse como

[I(θ)]i,j=mi[2θiθjregistroF(incógnita;θ)|θ].{\displaystyle {\bigl [}{\mathcal {I}}(\theta ){\bigr ]}_{i,j}=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta _{i}\,\partial \theta _{j}}}\log f(X;\theta )\,\,\right|\,\,\theta \right]\,.}

El resultado es interesante en varios sentidos:

  • Es igual a menos el hessiano esperado de la entropía relativa .
  • Puede utilizarse como una métrica riemanniana para definir la geometría de Fisher-Rao cuando es definida positiva. [ 12 ]
  • Puede entenderse como una métrica derivada de la métrica euclidiana , tras un cambio de variable apropiado.
  • En su forma de valores complejos, es la métrica de Fubini-Study .
  • Es la parte clave de la demostración del teorema de Wilks , que permite estimaciones de la región de confianza para la estimación de máxima verosimilitud (para aquellas condiciones para las que se aplica) sin necesidad del Principio de Verosimilitud .
  • En los casos en que los cálculos analíticos de la FIM anterior sean difíciles, es posible formar un promedio de estimaciones Monte Carlo sencillas del Hessiano de la función de log-verosimilitud negativa como una estimación de la FIM. [ 13 ] [ 14 ] [ 15 ] Las estimaciones pueden basarse en valores de la función de log-verosimilitud negativa o en el gradiente de la función de log-verosimilitud negativa; no se necesita ningún cálculo analítico del Hessiano de la función de log-verosimilitud negativa.

Parámetros ortogonales de información

Decimos que dos vectores de componentes de parámetros θ 1 y θ 2 son ortogonales en cuanto a información si la matriz de información de Fisher es diagonal por bloques, con estos componentes en bloques separados. [ 16 ] Los parámetros ortogonales son fáciles de manejar en el sentido de que sus estimaciones de máxima verosimilitud no están correlacionadas asintóticamente. Al considerar cómo analizar un modelo estadístico, se recomienda al modelador invertir tiempo en buscar una parametrización ortogonal del modelo, en particular cuando el parámetro de interés es unidimensional, pero el parámetro de perturbación puede tener cualquier dimensión. [ 17 ]

Modelo estadístico singular

Si la matriz de información de Fisher es definida positiva para todo θ , entonces se dice que el modelo estadístico correspondiente es regular ; de lo contrario, se dice que el modelo estadístico es singular . [ 18 ] Ejemplos de modelos estadísticos singulares incluyen los siguientes: mezclas normales , mezclas binomiales, mezclas multinomiales, redes bayesianas , redes neuronales , funciones de base radial , modelos ocultos de Markov , gramáticas estocásticas libres de contexto , regresiones de rango reducido, máquinas de Boltzmann .

En el aprendizaje automático , si se diseña un modelo estadístico de manera que extraiga una estructura oculta de un fenómeno aleatorio, entonces naturalmente se vuelve singular. [ 19 ]

Distribución normal multivariada

La FIM para una distribución normal multivariada de N variables ,incógnitanorte(μ(θ),Σ(θ)){\displaystyle \,X\sim N\left(\mu (\theta ),\,\Sigma (\theta )\right)}tiene una forma especial. Sea el vector de parámetros de K dimensiones.θ=[θ1θK]T{\displaystyle \theta ={\begin{bmatrix}\theta _{1}&\dots &\theta _{K}\end{bmatrix}}^{\textsf {T}}}y el vector de variables aleatorias normales seaincógnita=[incógnita1incógnitanorte]T{\displaystyle X={\begin{bmatrix}X_{1}&\dots &X_{N}\end{bmatrix}}^{\textsf {T}}}Supongamos que los valores medios de estas variables aleatorias son:μ(θ)=[μ1(θ)μnorte(θ)]T{\displaystyle \,\mu (\theta )={\begin{bmatrix}\mu _{1}(\theta )&\dots &\mu _{N}(\theta )\end{bmatrix}}^{\textsf {T}}}y dejarΣ(θ){\displaystyle \,\Sigma (\theta )}Sea la matriz de covarianza . Entonces, para1metro,norteK{\displaystyle 1\leq m,\,n\leq K}, la entrada ( m , n ) del FIM es: [ 20 ]

Imetro,norte=μTθmetroΣ1μθnorte+12tr(Σ1ΣθmetroΣ1Σθnorte),{\displaystyle {\mathcal {I}}_{m,n}={\frac {\partial \mu ^{\textsf {T}}}{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \theta _{n}}}+{\frac {1}{2}}\operatorname {tr} \left(\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{n}}}\right),}

dónde()T{\displaystyle (\cdot )^{\textsf {T}}}denota la transpuesta de un vector,tr(){\displaystyle \operatorname {tr} (\cdot )}denota la traza de una matriz cuadrada y:

μθmetro=[μ1θmetroμ2θmetroμnorteθmetro]T;Σθmetro=[Σ1,1θmetroΣ1,2θmetroΣ1,norteθmetroΣ2,1θmetroΣ2,2θmetroΣ2,norteθmetroΣnorte,1θmetroΣnorte,2θmetroΣnorte,norteθmetro].{\displaystyle {\begin{aligned}{\frac {\partial \mu }{\partial \theta _{m}}}&={\begin{bmatrix}{\dfrac {\partial \mu _{1}}{\partial \theta _{m}}}&{\dfrac {\partial \mu _{2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \mu _{N}}{\partial \theta _{m}}}\end{bmatrix}}^{\textsf {T}};\\[8pt]{\dfrac {\partial \Sigma }{\partial \theta _{m}}}&={\begin{bmatrix}{\dfrac {\partial \Sigma _{1,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{1,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{1,N}}{\partial \theta _{m}}}\\[5pt]{\dfrac {\partial \Sigma _{2,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{2,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{2,N}}{\partial \theta _{m}}}\\\vdots &\vdots &\ddots &\vdots \\{\dfrac {\partial \Sigma _{N,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{N,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{N,N}}{\partial \theta _{m}}}\end{bmatrix}}.\end{aligned}}}

Tenga en cuenta que un caso especial, pero muy común, es aquel en el queΣ(θ)=Σ{\displaystyle \Sigma (\theta )=\Sigma }, una constante. Entonces

Imetro,norte=μTθmetroΣ1μθnorte. {\displaystyle {\mathcal {I}}_{m,n}={\frac {\partial \mu ^{\textsf {T}}}{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \theta _{n}}}.\ }

En este caso, la matriz de información de Fisher puede identificarse con la matriz de coeficientes de las ecuaciones normales de la teoría de estimación de mínimos cuadrados .

Otro caso especial se da cuando la media y la covarianza dependen de dos parámetros vectoriales diferentes, digamos β y θ . Esto es especialmente común en el análisis de datos espaciales, que a menudo utiliza un modelo lineal con residuos correlacionados. En este caso, [ 21 ]

I(β,θ)=diagnóstico(I(β),I(θ)){\displaystyle {\mathcal {I}}(\beta ,\theta )=\operatorname {diag} \left({\mathcal {I}}(\beta ),{\mathcal {I}}(\theta )\right)}

dónde

I(β)metro,norte=μTβmetroΣ1μβnorte,I(θ)metro,norte=12tr(Σ1ΣθmetroΣ1Σθnorte){\displaystyle {\begin{aligned}{\mathcal {I}}{(\beta )_{m,n}}&={\frac {\partial \mu ^{\textsf {T}}}{\partial \beta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \beta _{n}}},\\[5pt]{\mathcal {I}}{(\theta )_{m,n}}&={\frac {1}{2}}\operatorname {tr} \left(\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{m}}}{\Sigma ^{-1}}{\frac {\partial \Sigma }{\partial \theta _{n}}}\right)\end{aligned}}}

Propiedades

Regla de la cadena

De forma similar a la entropía o la información mutua , la información de Fisher también posee una descomposición mediante la regla de la cadena . En particular, si X e Y son variables aleatorias distribuidas conjuntamente, se cumple que: [ 22 ]

Iincógnita,Y(θ)=Iincógnita(θ)+IYincógnita(θ),{\displaystyle {\mathcal {I}}_{X,Y}(\theta )={\mathcal {I}}_{X}(\theta )+{\mathcal {I}}_{Y\mid X}(\theta ),}

dóndeIYincógnita(θ)=miincógnita[IYincógnita=incógnita(θ)]{\displaystyle {\mathcal {I}}_{Y\mid X}(\theta )=\operatorname {E} _{X}\left[{\mathcal {I}}_{Y\mid X=x}(\theta )\right]}yIYincógnita=incógnita(θ){\displaystyle {\mathcal {I}}_{Y\mid X=x}(\theta )}es la información de Fisher de Y relativa aθ{\displaystyle \theta }calculado con respecto a la densidad condicional de Y dado un valor específico X = x .   

Como caso especial, si las dos variables aleatorias son independientes , la información que proporcionan las dos variables aleatorias es la suma de la información de cada variable aleatoria por separado:

Iincógnita,Y(θ)=Iincógnita(θ)+IY(θ).{\displaystyle {\mathcal {I}}_{X,Y}(\theta )={\mathcal {I}}_{X}(\theta )+{\mathcal {I}}_{Y}(\theta ).}

En consecuencia, la información contenida en una muestra aleatoria de n observaciones independientes e idénticamente distribuidas es n veces mayor que la información contenida en una muestra de tamaño  1.

f -divergencia

Dada una función convexaF:[0,)(,]{\displaystyle f:[0,\infty )\to (-\infty ,\infty ]}esoF(incógnita){\displaystyle f(x)}es finito para todosincógnita>0{\displaystyle x>0},F(1)=0{\displaystyle f(1)=0}, yF(0)=límitet0+F(t){\displaystyle f(0)=\lim _{t\to 0^{+}}f(t)}, (que podría ser infinito), define una f -divergenciaDF{\displaystyle D_{f}}. Entonces siF{\displaystyle f}es estrictamente convexa en1{\displaystyle 1}, luego localmente enθΘ{\displaystyle \theta \in \Theta }, la matriz de información de Fisher es una métrica, en el sentido de que [ 23 ](δθ)TI(θ)(δθ)=1F(1)DF(PAGθ+δθPAGθ){\displaystyle (\delta \theta )^{T}I(\theta )(\delta \theta )={\frac {1}{f''(1)}}D_{f}(P_{\theta +\delta \theta }\parallel P_{\theta })}dóndePAGθ{\displaystyle P_{\theta }}es la distribución parametrizada porθ{\displaystyle \theta }Es decir, es la distribución con pdfF(incógnita;θ){\displaystyle f(x;\theta )}.

De esta forma, queda claro que la matriz de información de Fisher es una métrica riemanniana y varía correctamente ante un cambio de variables. (Véase la sección sobre reparametrización ).

Estadística suficiente

La información proporcionada por un estadístico suficiente es la misma que la de la muestra X. Esto se puede observar utilizando el criterio de factorización de Neyman para un estadístico suficiente. Si T ( X ) es suficiente para θ , entonces

F(incógnita;θ)=gramo(T(incógnita),θ)h(incógnita){\displaystyle f(X;\theta )=g(T(X),\theta )h(X)}

para algunas funciones g y h . La independencia de h ( X ) de θ implica

θregistro[F(incógnita;θ)]=θregistro[gramo(T(incógnita);θ)],{\displaystyle {\frac {\partial }{\partial \theta }}\log \left[f(X;\theta )\right]={\frac {\partial }{\partial \theta }}\log \left[g(T(X);\theta )\right],}

y la igualdad de información se deduce entonces de la definición de información de Fisher. De forma más general, si T = t ( X ) es un estadístico , entonces

IT(θ)Iincógnita(θ){\displaystyle {\mathcal {I}}_{T}(\theta )\leq {\mathcal {I}}_{X}(\theta )}

con igualdad si y solo si T es una estadística suficiente . [ 24 ]

Reparametrización

La información de Fisher depende de la parametrización del problema. Si θ y η son dos parametrizaciones escalares de un problema de estimación, y θ es una función continuamente diferenciable de η , entonces

Iη(η)=Iθ(θ(η))(dθdη)2{\displaystyle {\mathcal {I}}_{\eta }(\eta )={\mathcal {I}}_{\theta }(\theta (\eta ))\left({\frac {d\theta }{d\eta }}\right)^{2}}

dóndeIη{\displaystyle {\mathcal {I}}_{\eta }}yIθ{\displaystyle {\mathcal {I}}_{\theta }}son las medidas de información de Fisher de η y θ , respectivamente. [ 25 ]

En el caso vectorial, supongamos queθ{\displaystyle {\boldsymbol {\theta }}}yη{\displaystyle {\boldsymbol {\eta }}}son k -vectores que parametrizan un problema de estimación, y supongamos queθ{\displaystyle {\boldsymbol {\theta }}}es una función continuamente diferenciable deη{\displaystyle {\boldsymbol {\eta }}}, entonces, [ 26 ]

Iη(η)=JTIθ(θ(η))J{\displaystyle {\mathcal {I}}_{\boldsymbol {\eta }}({\boldsymbol {\eta }})={\boldsymbol {J}}^{\textsf {T}}{\mathcal {I}}_{\boldsymbol {\theta }}({\boldsymbol {\theta }}({\boldsymbol {\eta }})){\boldsymbol {J}}}

donde el elemento ( i , j ) de la matriz jacobiana k  × k J{\displaystyle {\boldsymbol {J}}}se define por

Jij=θiηj,{\displaystyle J_{ij}={\frac {\partial \theta _{i}}{\partial \eta _{j}}},}

y dóndeJT{\displaystyle {\boldsymbol {J}}^{\textsf {T}}}es la transpuesta de la matriz deJ.{\displaystyle {\boldsymbol {J}}.}

En geometría de la información , esto se considera un cambio de coordenadas en una variedad riemanniana , y las propiedades intrínsecas de la curvatura permanecen inalteradas bajo diferentes parametrizaciones. En general, la matriz de información de Fisher proporciona una métrica riemanniana (más precisamente, la métrica de Fisher-Rao) para la variedad de estados termodinámicos, y puede utilizarse como una medida de complejidad geométrica de la información para una clasificación de transiciones de fase ; por ejemplo, la curvatura escalar del tensor métrico termodinámico diverge en (y solo en) un punto de transición de fase. [ 27 ]

En el contexto termodinámico, la matriz de información de Fisher está directamente relacionada con la tasa de cambio de los parámetros de orden correspondientes . [ 28 ] En particular, dichas relaciones identifican transiciones de fase de segundo orden a través de divergencias de elementos individuales de la matriz de información de Fisher.

Desigualdad isoperimétrica

La matriz de información de Fisher desempeña un papel en una desigualdad como la desigualdad isoperimétrica . [ 29 ] De todas las distribuciones de probabilidad con una entropía dada, aquella cuya matriz de información de Fisher tiene la traza más pequeña es la distribución gaussiana. Esto es similar a cómo, de todos los conjuntos acotados con un volumen dado, la esfera tiene la superficie más pequeña.

La demostración implica tomar una variable aleatoria multivariada.incógnita{\displaystyle X}con función de densidadF{\displaystyle f}y añadiendo un parámetro de ubicación para formar una familia de densidades{F(incógnitaθ)θRnorte}{\displaystyle \{f(x-\theta )\mid \theta \in \mathbb {R} ^{n}\}}. Luego, por analogía con la fórmula de Minkowski-Steiner , el "área de superficie" deincógnita{\displaystyle X}se define como

S(incógnita)=límiteε0miH(incógnita+Zε)miH(incógnita)ε{\displaystyle S(X)=\lim _{\varepsilon \to 0}{\frac {e^{H(X+Z_{\varepsilon })}-e^{H(X)}}{\varepsilon }}}

dóndeZε{\displaystyle Z_{\varepsilon }}es una variable gaussiana con matriz de covarianzaεI{\displaystyle \varepsilon I}El nombre "área superficial" es apropiado debido a la entropía.miH(incógnita){\displaystyle e^{H(X)}}es el volumen del "conjunto de soporte efectivo", [ 30 ] asíS(incógnita){\displaystyle S(X)}es la "derivada" del volumen del conjunto de soporte efectivo, muy similar a la fórmula de Minkowski-Steiner. El resto de la demostración utiliza la desigualdad de potencia de entropía , que es similar a la desigualdad de Brunn-Minkowski . Se encuentra que la traza de la matriz de información de Fisher es un factor deS(incógnita){\displaystyle S(X)}.

Aplicaciones

Diseño óptimo de experimentos

La información de Fisher se utiliza ampliamente en el diseño experimental óptimo . Debido a la reciprocidad entre la varianza del estimador y la información de Fisher, minimizar la varianza corresponde a maximizar la información .

Cuando un modelo estadístico lineal (o linealizado ) tiene varios parámetros , la media del estimador de parámetros es un vector y su varianza es una matriz . La inversa de la matriz de varianza se denomina "matriz de información". Dado que la varianza del estimador de un vector de parámetros es una matriz, el problema de "minimizar la varianza" es complejo. Mediante la teoría estadística , los estadísticos comprimen la matriz de información utilizando estadísticas descriptivas de valor real ; al ser funciones de valor real, estos "criterios de información" pueden maximizarse.

Tradicionalmente, los estadísticos han evaluado estimadores y diseños considerando alguna estadística descriptiva de la matriz de covarianza (de un estimador insesgado), generalmente con valores reales positivos (como el determinante o la traza de la matriz ). Trabajar con números reales positivos ofrece varias ventajas: si el estimador de un solo parámetro tiene una varianza positiva, entonces tanto la varianza como la información de Fisher son números reales positivos; por lo tanto, pertenecen al cono convexo de números reales no negativos (cuyos miembros distintos de cero tienen recíprocos en este mismo cono).

Para varios parámetros, las matrices de covarianza y las matrices de información son elementos del cono convexo de matrices simétricas semidefinidas positivas en un espacio vectorial parcialmente ordenado , bajo el orden de Loewner (Löwner). Este cono es cerrado bajo la suma e inversión de matrices, así como bajo la multiplicación de números reales positivos y matrices. Una exposición de la teoría de matrices y el orden de Loewner aparece en Pukelsheim. [ 31 ]

Los criterios de optimalidad tradicionales son los invariantes de la matriz de información, en el sentido de la teoría de invariantes ; algebraicamente, los criterios de optimalidad tradicionales son funcionales de los valores propios de la matriz de información (Fisher) (véase diseño óptimo ).

Prior de Jeffreys en estadística bayesiana

En estadística bayesiana , la información de Fisher se utiliza para calcular la distribución a priori de Jeffreys , que es una distribución a priori estándar no informativa para parámetros de distribución continuos. [ 32 ]

Neurociencia computacional

La información de Fisher se ha utilizado para determinar los límites de la precisión de los códigos neuronales . En ese caso, X suele ser la respuesta conjunta de muchas neuronas que representan una variable de baja dimensión θ (como un parámetro de estímulo ). En particular, se ha estudiado el papel de las correlaciones en el ruido de las respuestas neuronales. [ 33 ]

Epidemiología

Se utilizó la información de Fisher para estudiar cuán informativas son las diferentes fuentes de datos para la estimación del número de reproducción del SARS-CoV-2. [ 34 ]

Aprendizaje automático

La información de Fisher se utiliza en técnicas de aprendizaje automático como la consolidación elástica de pesos , [ 35 ] que reduce el olvido catastrófico en las redes neuronales artificiales .

La información de Fisher se puede utilizar como alternativa al Hessiano de la función de pérdida en el entrenamiento de redes de descenso de gradiente de segundo orden. [ 36 ]

discriminación de color

Utilizando una métrica de información de Fisher , da Fonseca et al. [ 37 ] investigaron el grado en que las elipses de MacAdam (elipses de discriminación de color) pueden derivarse de las funciones de respuesta de los fotorreceptores de la retina.

Relación con la entropía relativa

La información de Fisher está relacionada con la entropía relativa . [ 38 ] La entropía relativa, o divergencia de Kullback-Leibler , entre dos distribucionespag{\displaystyle p}yq{\displaystyle q}se puede escribir como

KL(pag:q)=pag(incógnita)registropag(incógnita)q(incógnita)dincógnita.{\displaystyle KL(p:q)=\int p(x)\log {\frac {p(x)}{q(x)}}\,dx.}

Ahora, consideremos una familia de distribuciones de probabilidad.F(incógnita;θ){\displaystyle f(x;\theta )}parametrizado porθΘ{\displaystyle \theta \in \Theta }Entonces, la divergencia de Kullback-Leibler entre dos distribuciones de la familia se puede escribir como

D(θ,θ)=KL(pag(;θ):pag(;θ))=F(incógnita;θ)registroF(incógnita;θ)F(incógnita;θ)dincógnita.{\displaystyle D(\theta ,\theta ')=KL(p({}\cdot {};\theta ):p({}\cdot {};\theta '))=\int f(x;\theta )\log {\frac {f(x;\theta )}{f(x;\theta ')}}\,dx.}

Siθ{\displaystyle \theta }Si se fija, entonces la entropía relativa entre dos distribuciones de la misma familia se minimiza enθ=θ{\displaystyle \theta '=\theta }. Paraθ{\displaystyle \theta '}cerca deθ{\displaystyle \theta }, se puede expandir la expresión anterior en una serie hasta el segundo orden:

D(θ,θ)=12(θθ)T(2θiθjD(θ,θ))θ=θ(θθ)+o((θθ)2){\displaystyle D(\theta ,\theta ')={\frac {1}{2}}(\theta '-\theta )^{\textsf {T}}\left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}D(\theta ,\theta ')\right)_{\theta '=\theta }(\theta '-\theta )+o\left((\theta '-\theta )^{2}\right)}

Pero la derivada de segundo orden se puede escribir como

(2θiθjD(θ,θ))θ=θ=F(incógnita;θ)(2θiθjregistro(F(incógnita;θ)))θ=θdincógnita=[I(θ)]i,j.{\displaystyle \left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}D(\theta ,\theta ')\right)_{\theta '=\theta }=-\int f(x;\theta )\left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}\log(f(x;\theta '))\right)_{\theta '=\theta }\,dx=[{\mathcal {I}}(\theta )]_{i,j}.}

De este modo, la información de Fisher representa la curvatura de la entropía relativa de una distribución condicional con respecto a sus parámetros.

Historia

La información de Fisher fue discutida por varios estadísticos de la época, en particular F. Y. Edgeworth . [ 39 ] Por ejemplo, Savage [ 40 ] dice: "En ella [la información de Fisher], él [Fisher] fue anticipado en cierta medida (Edgeworth 1908–9 esp. 502, 507–8, 662, 677–8, 82–5 y referencias que [Edgeworth] cita, incluyendo Pearson y Filon 1898 [...])". Hay varias fuentes históricas tempranas [ 41 ] y varias revisiones de este trabajo inicial. [ 42 ] [ 43 ] [ 44 ]

Véase también

Otras medidas empleadas en la teoría de la información :

Notas

  1. Robert, Christian (2007). «Distribuciones previas no informativas». La elección bayesiana (2.ª  ed.). Springer. págs. 127–141 . ISBN  978-0-387-71598-8.
  2. Le Cam, Lucien (1986). Métodos asintóticos en la teoría de la decisión estadística . Nueva York: Springer. págs. 618-621 . ISBN  0-387-96307-3.
  3. Kass, Robert E.; Tierney, Luke; Kadane, Joseph B. (1990). "La validez de las expansiones posteriores basadas en el método de Laplace". En Geisser, S.; Hodges, JS; Press, SJ; Zellner, A. (eds.). Métodos bayesianos y de máxima verosimilitud en estadística y econometría . Elsevier. pp. 473–488 . ISBN  0-444-88376-2.
  4. Frieden y Gatenby (2013) .
  5. Suba Rao. "Conferencias sobre inferencia estadística" (PDF) . Archivado del original (PDF) el 26 de septiembre de 2020. Consultado el 12 de abril de 2013 .
  6. Fisher (1922) .
  7. Lehmann y Casella (1998) , ec. (2.5.16), Lema 5.3, pág. 116.
  8. ^ Schervish, Mark J. (1995). Teoría de la Estadística . Nueva York, Nueva York: Springer Nueva York. pag. 111.ISBN  978-1-4612-4250-5OCLC 852790658 
  9. Cramér (1946) .
  10. Rao (1945) .
  11. Nielsen, Frank (2023). "Un método de aproximación simple para la distancia de Fisher-Rao entre distribuciones normales multivariadas" . Entropy . 25 ( 4): 654. arXiv : 2302.08175 . Bibcode : 2023Entrp..25..654N . doi : 10.3390/e25040654 . PMC 10137715. PMID 37190442 .  
  12. Nielsen, Frank (2013). «Cramér-Rao Lower Bound and Information Geometry». Connected at Infinity II . Texts and Readings in Mathematics. Vol. 67. pp. 18–37 . arXiv : 1301.3578 . doi : 10.1007/978-93-86279-56-9_2 . ISBN   978-93-80250-51-9. S2CID 16759683 . 
  13. Spall, JC (2005). "Cálculo de Monte Carlo de la matriz de información de Fisher en entornos no estándar". Journal of Computational and Graphical Statistics . 14 (4): 889– 909. doi : 10.1198/106186005X78800 . S2CID 16090098 . 
  14. Spall, JC (2008), "Métodos mejorados para la estimación de Monte Carlo de la matriz de información de Fisher", Actas de la Conferencia Americana de Control , Seattle, WA, 11-13 de junio de 2008, pp. 2395-2400. https://doi.org/10.1109/ACC.2008.4586850
  15. Das, S.; Spall, JC; Ghanem, R. (2010). "Cálculo eficiente de la matriz de información de Fisher mediante el método de Monte Carlo utilizando información previa". Computational Statistics and Data Analysis . 54 (2): 272– 289. doi : 10.1016/j.csda.2009.09.018 .
  16. Barndorff-Nielsen, OE; Cox, DR (1994). Inferencia y asintótica . Chapman & Hall. ISBN 978-0-412-49440-6.
  17. Cox, DR; Reid, N. (1987). "Ortogonalidad de parámetros e inferencia condicional aproximada (con discusión)". J. Royal Statistical Soc. B . 49 : 1– 39. doi : 10.1111/j.2517-6161.1987.tb01422.x .
  18. Watanabe, S. (2008), "Método geométrico algebraico en la estimación estadística singular", en Accardi, L.; Freudenberg, W.; Ohya, M. (eds.), Quantum Bio-Informatics , World Scientific , pp. 325–336 , Bibcode : 2008qbi..conf..325W , doi : 10.1142/9789812793171_0024 , ISBN  978-981-279-316-4.
  19. Watanabe, S (2013). "Un criterio de información bayesiano de amplia aplicación". Journal of Machine Learning Research . 14 : 867–897 .
  20. Malagò, Luigi; Pistone, Giovanni (2015). «Geometría de la información de la distribución gaussiana desde la perspectiva de la optimización estocástica». Actas de la XIII Conferencia ACM de 2015 sobre Fundamentos de Algoritmos Genéticos . págs. 150–162 . doi : 10.1145/2725494.2725510 . ISBN  978-1-4503-3434-1. S2CID 693896 . 
  21. Mardia, KV; Marshall, RJ (1984). "Estimación de máxima verosimilitud de modelos para la covarianza residual en regresión espacial" . Biometrika . 71 (1): 135– 46. doi : 10.1093/biomet/71.1.135 .
  22. Zamir, R. (1998). "Una demostración de la desigualdad de información de Fisher mediante un argumento de procesamiento de datos". IEEE Transactions on Information Theory . 44 (3): 1246– 1250. CiteSeerX 10.1.1.49.6628 . doi : 10.1109/18.669301 . 
  23. Polyanskiy, Yury (2017). "Apuntes de clase sobre teoría de la información, capítulo 29, ECE563 (UIUC)" (PDF) . Apuntes de clase sobre teoría de la información . Archivado (PDF) del original el 24 de mayo de 2022. Recuperado el 24 de mayo de 2022 .
  24. ^ Schervish, Mark J. (1995). Teoría de la Estadística . Springer-Verlag. pag. 113. 
  25. Lehmann y Casella (1998) , ec. (2.5.11).
  26. Lehmann y Casella (1998) , ec. (2.6.16).
  27. Janke, W.; Johnston, DA; Kenna, R. (2004). "Geometría de la información y transiciones de fase". Physica A . 336 ( 1– 2): 181. arXiv : cond-mat/0401092 . Bibcode : 2004PhyA..336..181J . doi : 10.1016/j.physa.2004.01.023 . S2CID 119085942 . 
  28. Prokopenko, M.; Lizier, Joseph T.; Lizier, JT; Obst, O.; Wang, XR (2011). "Relacionando la información de Fisher con los parámetros de orden". Physical Review E . 84 (4) 041116. Bibcode : 2011PhRvE..84d1116P . doi : 10.1103/PhysRevE.84.041116 . PMID 22181096 . S2CID 18366894 .  
  29. Costa, M.; Cover, T. (noviembre de 1984). "Sobre la similitud de la desigualdad de potencia de entropía y la desigualdad de Brunn-Minkowski". IEEE Transactions on Information Theory . 30 (6): 837– 839. doi : 10.1109/TIT.1984.1056983 . ISSN 1557-9654 . 
  30. Cover, Thomas M. (2006). Elementos de la teoría de la información . Joy A. Thomas (2.ª ed.). Hoboken, NJ: Wiley-Interscience. p. 256. ISBN   0-471-24195-4OCLC 59879802 
  31. Pukelsheim, Friedrich (1993). Diseño óptimo de experimentos . Nueva York: Wiley. ISBN 978-0-471-61971-0.
  32. Bernardo, José M.; Smith, Adrian FM (1994). Teoría bayesiana . Nueva York: John Wiley & Sons. ISBN 978-0-471-92416-6.
  33. Abbott, Larry F.; Dayan, Peter (1999). "El efecto de la variabilidad correlacionada en la precisión de un código de población". Neural Computation . 11 (1): 91– 101. doi : 10.1162/089976699300016827 . PMID 9950724. S2CID 2958438 .  
  34. Parag, KV; Donnelly, CA; Zarebski, AE (2022). "Cuantificación de la información en curvas epidémicas ruidosas" . Nature Computational Science . 2 (9): 584– 594. doi : 10.1038/s43588-022-00313-1 . hdl : 10044/1/100205 . PMID 38177483. S2CID 248811793 .  
  35. Kirkpatrick, James; Pascanu, Razvan; Rabinowitz, Neil; Veness, Joel; Desjardins, Guillaume; Rusu, Andrei A.; Milan, Kieran; Quan, John; Ramalho, Tiago (2017-03-28). "Superando el olvido catastrófico en redes neuronales" . Actas de la Academia Nacional de Ciencias . 114 (13): 3521– 3526. arXiv : 1612.00796 . Bibcode : 2017PNAS..114.3521K . doi : 10.1073 /pnas.1611835114 . ISSN 0027-8424 . PMC 5380101. PMID 28292907 .   
  36. Martens, James (agosto de 2020). "Nuevas perspectivas y conocimientos sobre el método del gradiente natural". Journal of Machine Learning Research (21). arXiv : 1412.1193 .
  37. da Fonseca, Maria; Samengo, In'es (1 de diciembre de 2016). "Derivación de la capacidad de discriminación cromática humana a partir de una noción de distancia en el espacio de color desde la perspectiva de la teoría de la información". Neural Computation . 28 (12): 2628– 2655. arXiv : 1611.07272 . doi : 10.1162/NECO_a_00903 . PMID 27764598 . 
  38. Gourieroux y Montfort (1995), página 87
  39. Savage (1976) .
  40. Savage (1976) , pág. 156.
  41. Edgeworth (1908b) ; Edgeworth (1908c) .
  42. Pratt (1976) .
  43. Stigler (1978) ; Stigler (1986) ; Stigler (1999) .
  44. ^ Hald (1998) ; Hald (1999) .

Referencias

  • Cramér, Harald (1946). Métodos matemáticos de estadística . Serie matemática de Princeton. Princeton: Princeton University Press. ISBN 0-691-08004-6.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  • Edgeworth, FY (junio de 1908). "Sobre los errores probables de las constantes de frecuencia" . Journal of the Royal Statistical Society . 71 (2): 381–397 . doi : 10.2307/2339461 . JSTOR 2339461 . 
  • Edgeworth, FY (septiembre de 1908). "Sobre los errores probables de las constantes de frecuencia (continuación)" . Journal of the Royal Statistical Society . 71 (3): 499– 512. doi : 10.2307/2339293 . JSTOR 2339293 . 
  • Edgeworth, FY (dic. 1908). "Sobre los errores probables de las constantes de frecuencia (continuación)" . Journal of the Royal Statistical Society . 71 (4): 651– 678. doi : 10.2307/2339378 . JSTOR 2339378 . 
  • Fisher, RA (1922-01-01). "Sobre los fundamentos matemáticos de la estadística teórica" . Philosophical Transactions of the Royal Society of London, Serie A. 222 ( 594–604 ) : 309–368 . Bibcode : 1922RSPTA.222..309F . doi : 10.1098/rsta.1922.0009 . hdl : 2440/15172 .
  • Frieden, BR (2004). Ciencia a partir de la información de Fisher: una unificación . Cambridge Univ. Press. ISBN 0-521-00911-1.
  • Frieden, B. Roy; Gatenby, Robert A. (2013). "Principio de máxima información de Fisher a partir de los axiomas de Hardy aplicados a sistemas estadísticos" . Physical Review E. 88 ( 4) 042144. arXiv : 1405.0007 . Bibcode : 2013PhRvE..88d2144F . doi : 10.1103/PhysRevE.88.042144 . PMC 4010149. PMID 24229152 .  
  • Hald, A. (mayo de 1999). "Sobre la historia de la máxima verosimilitud en relación con la probabilidad inversa y los mínimos cuadrados" . Statistical Science . 14 (2): 214– 222. doi : 10.1214/ss/1009212248 . JSTOR 2676741 . 
  • Hald, A. (1998). Historia de la estadística matemática desde 1750 hasta 1930. Nueva York: Wiley. ISBN 978-0-471-17912-2.
  • Lehmann, EL ; Casella, G. (1998). Teoría de la estimación puntual (2.ª  ed.). Springer. ISBN 978-0-387-98502-2.
  • Le Cam, Lucien (1986). Métodos asintóticos en la teoría de la decisión estadística . Springer-Verlag. ISBN 978-0-387-96307-5.
  • Pratt, John W. (mayo de 1976). "FY Edgeworth y RA Fisher sobre la eficiencia de la estimación de máxima verosimilitud" . Annals of Statistics . 4 (3): 501– 514. doi : 10.1214/aos/1176343457 . JSTOR 2958222 . 
  • Rao, C. Radhakrishna (1945). «Información y precisión alcanzable en la estimación de parámetros estadísticos». Avances en estadística . Serie Springer en estadística. Vol.  37. págs. 81–91 . doi : 10.1007/978-1-4612-0919-5_16 . ISBN  978-0-387-94037-3. S2CID 117034671 . {{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) ; |journal=ignorado ( ayuda )
  • Savage, LJ (mayo de 1976). "Sobre la relectura de RA Fisher" . Annals of Statistics . 4 (3): 441– 500. doi : 10.1214/aos/1176343456 . JSTOR 2958221 . 
  • Schervish, Mark J. (1995). Teoría de la Estadística . Nueva York: Springer. ISBN 978-0-387-94546-0.
  • Stigler, SM (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Harvard University Press. ISBN 978-0-674-40340-6.
  • Stigler, SM (1978). "Francis Ysidro Edgeworth, estadístico" . Journal of the Royal Statistical Society, Serie A. 141 ( 3): 287– 322. doi : 10.2307/2344804 . JSTOR 2344804 . 
  • Stigler, SM (1999). Statistics on the Table: The History of Statistical Concepts and Methods . Harvard University Press. ISBN 978-0-674-83601-3.
  • Van Trees, HL (1968). Detección, estimación y teoría de la modulación, parte I. Nueva York: Wiley. ISBN 978-0-471-09517-0.