Articulo de referencia

estimación de máxima verosimilitud

En estadística , la estimación de máxima verosimilitud ( EMV ) es un método para estimar los parámetros de una distribución de probabilidad supuesta , dados algunos datos observ...

En estadística , la estimación de máxima verosimilitud ( EMV ) es un método para estimar los parámetros de una distribución de probabilidad supuesta , dados algunos datos observados. Esto se logra maximizando una función de verosimilitud de modo que, bajo el modelo estadístico supuesto , los datos observados sean lo más probables posible. El punto en el espacio de parámetros que maximiza la función de verosimilitud se denomina estimación de máxima verosimilitud. [ 1 ] La lógica de la máxima verosimilitud es intuitiva y flexible, y por ello el método se ha convertido en un medio dominante de inferencia estadística . [ 2 ] [ 3 ] [ 4 ]

Si la función de verosimilitud es diferenciable , se puede aplicar la prueba de la derivada para encontrar máximos. En algunos casos, las condiciones de primer orden de la función de verosimilitud se pueden resolver analíticamente; por ejemplo, el estimador de mínimos cuadrados ordinarios para un modelo de regresión lineal maximiza la verosimilitud cuando se supone que los errores aleatorios tienen distribuciones normales con la misma varianza. [ 5 ]

Desde la perspectiva de la inferencia bayesiana , la estimación de máxima verosimilitud ( EMV) es generalmente equivalente a la estimación de máxima probabilidad a posteriori (MAP) con una distribución a priori uniforme en la región de interés. En la inferencia frecuentista , la EMV es un caso especial de estimador de extremos , donde la función objetivo es la verosimilitud.

Principios

Modelamos un conjunto de observaciones como una muestra aleatoria de una distribución de probabilidad conjunta desconocida , expresada en términos de un conjunto de parámetros . El objetivo de la estimación de máxima verosimilitud es determinar los parámetros para los cuales los datos observados tienen la mayor probabilidad conjunta. Escribimos los parámetros que rigen la distribución conjunta como un vector.θ=[θ1,θ2,,θk]T{\displaystyle \;\theta =\left[\theta _{1},\,\theta _{2},\,\ldots ,\,\theta _{k}\right]^{\mathsf {T}}\;}de modo que esta distribución se encuentre dentro de una familia paramétrica{F(;θ)θΘ},{\displaystyle \;\{f(\cdot \,;\theta )\mid \theta \in \Theta \}\;,}dóndeΘ{\displaystyle \,\Theta \,}se denomina espacio de parámetros , un subconjunto de dimensión finita del espacio euclidiano . Evaluar la densidad conjunta en la muestra de datos observaday=(y1,y2,,ynorte){\displaystyle \;\mathbf {y} =(y_{1},y_{2},\ldots ,y_{n})\;}da una función de valor real, Lnorte(θ)=Lnorte(θ;y)=Fnorte(y;θ),{\displaystyle {\mathcal {L}}_{n}(\theta )={\mathcal {L}}_{n}(\theta ;\mathbf {y} )=f_{n}(\mathbf {y}  ;\theta )\;,} que se llama función de verosimilitud . Para variables aleatorias independientes ,Fnorte(y;θ){\displaystyle f_{n}(\mathbf {y} ;\theta )} será el producto de funciones de densidad univariadas : Fnorte(y;θ)=k=1norteFknorteivar(yk;θ) .{\displaystyle f_{n}(\mathbf {y} ;\theta )=\prod _{k=1}^{n}\,f_{k}^{\mathsf {univar}}(y_{k};\theta )~.}

El objetivo de la estimación de máxima verosimilitud es encontrar los valores de los parámetros del modelo que maximicen la función de verosimilitud sobre el espacio de parámetros, [ 6 ] es decir: θ^=argramometroaincógnitaθΘLnorte(θ;y) .{\displaystyle {\hat {\theta }}={\underset {\theta \in \Theta }{\operatorname {arg\;max} }}\,{\mathcal {L}}_{n}(\theta \,;\mathbf {y} )~.}

Intuitivamente, esto selecciona los valores de los parámetros que hacen que los datos observados sean más probables. El valor específico θ^=θ^norte(y)Θ {\displaystyle ~{\hat {\theta }}={\hat {\theta }}_{n}(\mathbf {y} )\in \Theta ~}que maximiza la función de verosimilitudLnorte{\displaystyle \,{\mathcal {L}}_{n}\,}se denomina estimación de máxima verosimilitud. Además, si la funciónθ^norte:RnorteΘ{\displaystyle \;{\hat {\theta }}_{n}:\mathbb {R} ^{n}\to \Theta \;}Si se define de esta manera y es medible , entonces se denomina estimador de máxima verosimilitud . Generalmente es una función definida sobre el espacio muestral , es decir, tomando una muestra dada como argumento. Una condición suficiente, pero no necesaria, para su existencia es que la función de verosimilitud sea continua sobre un espacio de parámetros.Θ{\displaystyle \,\Theta \,}que es compacto . [ 7 ] Para un abiertoΘ{\displaystyle \,\Theta \,}La función de verosimilitud puede aumentar sin llegar nunca a alcanzar un valor supremo.

En la práctica, suele ser conveniente trabajar con el logaritmo natural de la función de verosimilitud, denominado log-verosimilitud : (θ;y)=lnLnorte(θ;y) .{\displaystyle \ell (\theta \,;\mathbf {y} )=\ln {\mathcal {L}}_{n}(\theta \,;\mathbf {y} )~.} Dado que el logaritmo es una función monótona , el máximo de(θ;y){\displaystyle \;\ell (\theta \,;\mathbf {y} )\;}ocurre con el mismo valor deθ{\displaystyle \theta }como lo hace el máximo deLnorte .{\displaystyle \,{\mathcal {L}}_{n}~.}[ 8 ] Si(θ;y){\displaystyle \ell (\theta \,;\mathbf {y} )}es diferenciable enΘ,{\displaystyle \,\Theta \,,}Las condiciones necesarias para que se produzca un máximo (o un mínimo) son: θ1=0,θ2=0,,θk=0 ,{\displaystyle {\frac {\partial \ell }{\partial \theta _{1}}}=0,\quad {\frac {\partial \ell }{\partial \theta _{2}}}=0,\quad \ldots ,\quad {\frac {\partial \ell }{\partial \theta _{k}}}=0~,} conocidas como ecuaciones de verosimilitud. Para algunos modelos, estas ecuaciones se pueden resolver explícitamente paraθ^,{\displaystyle \,{\widehat {\theta \,}}\,,}pero en general no se conoce ni está disponible una solución de forma cerrada para el problema de maximización, y un MLE solo se puede encontrar mediante optimización numérica . Otro problema es que en muestras finitas, puede haber múltiples raíces para las ecuaciones de verosimilitud. [ 9 ] Si la raíz identificadaθ^{\displaystyle \,{\widehat {\theta \,}}\,}de las ecuaciones de verosimilitud es de hecho un máximo (local) depende de si la matriz de derivadas parciales y cruzadas de segundo orden, la llamada matriz hessiana

H(θ^)=[2θ12|θ=θ^2θ1θ2|θ=θ^2θ1θk|θ=θ^2θ2θ1|θ=θ^2θ22|θ=θ^2θ2θk|θ=θ^2θkθ1|θ=θ^2θkθ2|θ=θ^2θk2|θ=θ^] ,{\displaystyle \mathbf {H} \left({\widehat {\theta \,}}\right)={\begin{bmatrix}\left.{\frac {\partial ^{2}\ell }{\partial \theta _{1}^{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\left.{\frac {\partial ^{2}\ell }{\partial \theta _{1}\,\partial \theta _{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\dots &\left.{\frac {\partial ^{2}\ell }{\partial \theta _{1}\,\partial \theta _{k}}}\right|_{\theta ={\widehat {\theta \,}}}\\\left.{\frac {\partial ^{2}\ell }{\partial \theta _{2}\,\partial \theta _{1}}}\right|_{\theta ={\widehat {\theta \,}}}&\left.{\frac {\partial ^{2}\ell }{\partial \theta _{2}^{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\dots &\left.{\frac {\partial ^{2}\ell }{\partial \theta _{2}\,\partial \theta _{k}}}\right|_{\theta ={\widehat {\theta \,}}}\\\vdots &\vdots &\ddots &\vdots \\\left.{\frac {\partial ^{2}\ell }{\partial \theta _{k}\,\partial \theta _{1}}}\right|_{\theta ={\widehat {\theta \,}}}&\left.{\frac {\partial ^{2}\ell }{\partial \theta _{k}\,\partial \theta _{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\dots &\left.{\frac {\partial ^{2}\ell }{\partial \theta _{k}^{2}}}\right|_{\theta ={\widehat {\theta \,}}}\end{bmatrix}}~,}

es semidefinido negativo enθ^{\displaystyle {\widehat {\theta \,}}}, ya que esto indica concavidad local . Convenientemente, la mayoría de las distribuciones de probabilidad comunes , en particular la familia exponencial , son logarítmicamente cóncavas . [ 10 ] [ 11 ]

Espacio de parámetros restringido

Si bien el dominio de la función de verosimilitud —el espacio de parámetros— es generalmente un subconjunto de dimensión finita del espacio euclidiano , a veces es necesario incorporar restricciones adicionales al proceso de estimación. El espacio de parámetros se puede expresar comoΘ={θ:θRk,h(θ)=0} ,{\displaystyle \Theta =\left\{\theta :\theta \in \mathbb {R} ^{k},\;h(\theta )=0\right\}~,}

dóndeh(θ)=[h1(θ),h2(θ),,hr(θ)]{\displaystyle \;h(\theta )=\left[h_{1}(\theta ),h_{2}(\theta ),\ldots ,h_{r}(\theta )\right]\;}es una función vectorial que realiza una asignación .Rk{\displaystyle \,\mathbb {R} ^{k}\,}enRr .{\displaystyle \;\mathbb {R} ^{r}~.}Estimación del parámetro verdaderoθ{\displaystyle \theta }perteneciente aΘ{\displaystyle \Theta }Entonces, en la práctica, significa encontrar el máximo de la función de verosimilitud sujeto a la restricción. h(θ)=0 .{\displaystyle ~h(\theta )=0~.}

Teóricamente, el enfoque más natural para este problema de optimización con restricciones es el método de sustitución, es decir, "completar" las restricciones.h1,h2,,hr{\displaystyle \;h_{1},h_{2},\ldots ,h_{r}\;}a un conjuntoh1,h2,,hr,hr+1,,hk{\displaystyle \;h_{1},h_{2},\ldots ,h_{r},h_{r+1},\ldots ,h_{k}\;}de tal manera queh=[h1,h2,,hk]{\displaystyle \;h^{\ast }=\left[h_{1},h_{2},\ldots ,h_{k}\right]\;}es una función uno a uno deRk{\displaystyle \mathbb {R} ^{k}}a sí mismo, y reparametrizar la función de verosimilitud estableciendoϕi=hi(θ1,θ2,,θk) .{\displaystyle \;\phi _{i}=h_{i}(\theta _{1},\theta _{2},\ldots ,\theta _{k})~.}[ 12 ] Debido a la equivariancia del estimador de máxima verosimilitud, las propiedades del MLE también se aplican a las estimaciones restringidas. [ 13 ] Por ejemplo, en unadistribución normal multivariada,lamatriz de covarianzaΣ{\displaystyle \,\Sigma \,}debe ser definida positiva ; esta restricción puede imponerse reemplazandoΣ=ΓTΓ,{\displaystyle \;\Sigma =\Gamma ^{\mathsf {T}}\Gamma \;,}dóndeΓ{\displaystyle \Gamma }es una matriz triangular superior real yΓT{\displaystyle \Gamma ^{\mathsf {T}}}es su transpuesta . [ 14 ]

En la práctica, las restricciones se suelen imponer utilizando el método de Lagrange que, dadas las restricciones definidas anteriormente, conduce a las ecuaciones de verosimilitud restringida.θh(θ)Tθλ=0{\displaystyle {\frac {\partial \ell }{\partial \theta }}-{\frac {\partial h(\theta )^{\mathsf {T}}}{\partial \theta }}\lambda =0}yh(θ)=0,{\displaystyle h(\theta )=0\;,}

dónde λ=[λ1,λ2,,λr]T {\displaystyle ~\lambda =\left[\lambda _{1},\lambda _{2},\ldots ,\lambda _{r}\right]^{\mathsf {T}}~}es un vector columna de multiplicadores de Lagrange yh(θ)Tθ{\displaystyle \;{\frac {\partial h(\theta )^{\mathsf {T}}}{\partial \theta }}\;}es la matriz jacobiana k × r de derivadas parciales. [ 12 ] Naturalmente, si las restricciones no son vinculantes en el máximo, los multiplicadores de Lagrange deberían ser cero. [ 15 ] Esto a su vez permite una prueba estadística de la "validez" de la restricción, conocida como la prueba del multiplicador de Lagrange .

Estimación de máxima verosimilitud no paramétrica

La estimación de máxima verosimilitud no paramétrica se puede realizar utilizando la verosimilitud empírica .

Método de apoyo

El método de soporte es una técnica que se utiliza para realizar inferencias a partir de conjuntos de datos. Según AWF Edwards [ 16 ], este método busca realizar inferencias sobre parámetros desconocidos en función del soporte relativo, o log- verosimilitud , que proporciona un conjunto de datos para un valor de parámetro específico. La técnica puede utilizarse independientemente de si se dispone de información previa. El método de máxima verosimilitud forma parte del método de soporte, pero cabe destacar que este último también proporciona regiones de confianza definidas en función de su soporte.

Propiedades

Un estimador de máxima verosimilitud es un estimador de extremo que se obtiene maximizando, en función de θ , la función objetivo.^(θ;incógnita){\displaystyle {\widehat {\ell \,}}(\theta \,;x)}Si los datos son independientes e idénticamente distribuidos , entonces tenemos ^(θ;incógnita)=i=1nortelnF(incógnitaiθ),{\displaystyle {\widehat {\ell \,}}(\theta \,;x)=\sum _{i=1}^{n}\ln f(x_{i}\mid \theta ),} este es el análogo de muestra de la log-verosimilitud esperada(θ)=mi[lnF(incógnitaiθ)]{\displaystyle \ell (\theta )=\operatorname {\mathbb {E} } [\,\ln f(x_{i}\mid \theta )\,]}donde esta expectativa se toma con respecto a la densidad real.

Los estimadores de máxima verosimilitud no tienen propiedades óptimas para muestras finitas, en el sentido de que (cuando se evalúan en muestras finitas) otros estimadores pueden tener una mayor concentración alrededor del verdadero valor del parámetro. [ 17 ] Sin embargo, al igual que otros métodos de estimación, la estimación de máxima verosimilitud posee una serie de propiedades límite atractivas : a medida que el tamaño de la muestra aumenta hasta el infinito, las secuencias de estimadores de máxima verosimilitud tienen estas propiedades:

  • Consistencia : la secuencia de estimadores de máxima verosimilitud converge en probabilidad al valor que se está estimando.
  • Equivariancia : Siθ^{\displaystyle {\hat {\theta }}}es el estimador de máxima verosimilitud paraθ{\displaystyle \theta }y sigramo(θ){\displaystyle g(\theta )}es una transformación biyectiva deθ{\displaystyle \theta }, entonces el estimador de máxima verosimilitud paraα=gramo(θ){\displaystyle \alpha =g(\theta )}esα^=gramo(θ^){\displaystyle {\hat {\alpha }}=g({\hat {\theta }})}La propiedad de equivariancia puede generalizarse a transformaciones no biyectivas, aunque en ese caso se aplica al máximo de una función de verosimilitud inducida que no es la verdadera verosimilitud en general.
  • Eficiencia , es decir, alcanza el límite inferior de Cramér-Rao cuando el tamaño de la muestra tiende a infinito. Esto significa que ningún estimador consistente tiene un error cuadrático medio asintótico menor que el MLE (u otros estimadores que alcanzan este límite), lo que también significa que el MLE tiene normalidad asintótica .
  • Eficiencia de segundo orden tras la corrección del sesgo.

Consistencia

Bajo las condiciones descritas a continuación, el estimador de máxima verosimilitud es consistente . La consistencia significa que si los datos fueron generados porF(;θ0){\displaystyle f(\cdot \,;\theta _{0})}y tenemos un número suficientemente grande de observaciones n , entonces es posible encontrar el valor de θ 0 con precisión arbitraria. En términos matemáticos, esto significa que cuando n tiende a infinito, el estimadorθ^{\displaystyle {\widehat {\theta \,}}}converge en probabilidad a su valor verdadero:

θ^metrolmi pag θ0.{\displaystyle {\widehat {\theta \,}}_{\mathrm {mle} }\ {\xrightarrow {\text{p}}}\ \theta _{0}.}

En condiciones ligeramente más estrictas, el estimador converge casi con seguridad (o fuertemente ):

θ^metrolmi como θ0.{\displaystyle {\widehat {\theta \,}}_{\mathrm {mle} }\ {\xrightarrow {\text{a.s.}}}\ \theta _{0}.}

En aplicaciones prácticas, los datos nunca se generan porF(;θ0){\displaystyle f(\cdot \,;\theta _{0})}. Bastante,F(;θ0){\displaystyle f(\cdot \,;\theta _{0})}Un modelo, a menudo idealizado, representa el proceso generado por los datos. En estadística, es un aforismo común que todos los modelos son erróneos . Por lo tanto, la consistencia verdadera no se da en las aplicaciones prácticas. Sin embargo, la consistencia suele considerarse una propiedad deseable para un estimador.

Para establecer la consistencia, las siguientes condiciones son suficientes. [ 18 ]

  1. Identificación del modelo: θθ0F(θ)F(θ0).{\displaystyle \theta \neq \theta _{0}\quad \Leftrightarrow \quad f(\cdot \mid \theta )\neq f(\cdot \mid \theta _{0}).} En otras palabras, diferentes valores del parámetro θ corresponden a diferentes distribuciones dentro del modelo. Si esta condición no se cumpliera, habría algún valor θ 1 tal que θ 0 y θ 1 generarían una distribución idéntica de los datos observables. Entonces no podríamos distinguir entre estos dos parámetros incluso con una cantidad infinita de datos; estos parámetros habrían sido observacionalmente equivalentes . La condición de identificación es absolutamente necesaria para que el estimador ML sea consistente. Cuando esta condición se cumple, la función de verosimilitud límite ( θ |·) tiene un máximo global único en θ 0 .
  2. Compacidad: el espacio de parámetros Θ del modelo es compacto .

    La condición de identificación establece que la log-verosimilitud tiene un máximo global único. La compacidad implica que la verosimilitud no puede aproximarse arbitrariamente al valor máximo en algún otro punto (como se muestra, por ejemplo, en la imagen de la derecha).

    La compacidad es solo una condición suficiente y no una condición necesaria. La compacidad puede ser reemplazada por otras condiciones, tales como:

    • tanto la concavidad de la función de verosimilitud logarítmica como la compacidad de algunos conjuntos de nivel superior (no vacíos) de la función de verosimilitud logarítmica, o
    • existencia de un entorno compacto N de θ 0 tal que fuera de N la función de verosimilitud logarítmica sea menor que el máximo en al menos algún ε > 0 .
  3. Continuidad: la función ln f ( x | θ ) es continua en θ para casi todos los valores de x : PAG[lnF(incógnitaθ)do0(Θ)]=1.{\displaystyle \operatorname {\mathbb {P} } {\Bigl [}\;\ln f(x\mid \theta )\;\in \;C^{0}(\Theta )\;{\Bigr ]}=1.} La continuidad en este caso puede sustituirse por una condición ligeramente más débil de semicontinuidad superior .
  4. Dominancia: existe D ( x ) integrable con respecto a la distribución f ( x  | θ 0 )  tal que |lnF(incógnitaθ)|<D(incógnita) a pesar de θΘ.{\displaystyle {\Bigl |}\ln f(x\mid \theta ){\Bigr |}<D(x)\quad {\text{ for all }}\theta \in \Theta .} Por la ley uniforme de los grandes números , la condición de dominancia junto con la continuidad establecen la convergencia uniforme en probabilidad de la log-verosimilitud: sorberθΘ|^(θincógnita)(θ)| pag 0.{\displaystyle \sup _{\theta \in \Theta }\left|{\widehat {\ell \,}}(\theta \mid x)-\ell (\theta )\,\right|\ \xrightarrow {\text{p}} \ 0.}

La condición de dominancia puede emplearse en el caso de observaciones i.i.d. En el caso no i.i.d., la convergencia uniforme en probabilidad puede comprobarse demostrando que la secuencia^(θincógnita){\displaystyle {\widehat {\ell \,}}(\theta \mid x)}es estocásticamente equicontinua .

Si uno quiere demostrar que el estimador MLθ^{\displaystyle {\widehat {\theta \,}}}Si converge a θ 0 casi con seguridad , entonces debe imponerse una condición más fuerte de convergencia uniforme casi con seguridad: sorberθΘ^(θincógnita)(θ) como 0.{\displaystyle \sup _{\theta \in \Theta }\left\|\;{\widehat {\ell \,}}(\theta \mid x)-\ell (\theta )\;\right\|\ \xrightarrow {\text{a.s.}} \ 0.}

Además, si (como se supuso anteriormente) los datos fueron generados porF(;θ0){\displaystyle f(\cdot \,;\theta _{0})}, entonces, bajo ciertas condiciones, también se puede demostrar que el estimador de máxima verosimilitud converge en distribución a una distribución normal. Específicamente, [ 19 ]norte(θ^metrolmiθ0) d norte(0,I1){\displaystyle {\sqrt {n}}\left({\widehat {\theta \,}}_{\mathrm {mle} }-\theta _{0}\right)\ \xrightarrow {d} \ {\mathcal {N}}\left(0,\,I^{-1}\right)} donde I es la matriz de información de Fisher .

Invariancia funcional

El estimador de máxima verosimilitud selecciona el valor del parámetro que otorga a los datos observados la mayor probabilidad posible (o densidad de probabilidad, en el caso continuo). Si el parámetro consta de varios componentes, definimos sus estimadores de máxima verosimilitud separados como el componente correspondiente del MLE del parámetro completo. De acuerdo con esto, siθ^{\displaystyle {\widehat {\theta \,}}}es el MLE paraθ{\displaystyle \theta }y sigramo(θ){\displaystyle g(\theta )}es cualquier transformación deθ{\displaystyle \theta }, entonces el MLE paraα=gramo(θ){\displaystyle \alpha =g(\theta )}es por definición [ 20 ]

α^=gramo(θ^).{\displaystyle {\widehat {\alpha }}=g(\,{\widehat {\theta \,}}\,).\,}

Maximiza la denominada probabilidad de perfil :

L¯(α)=sorberθ:α=gramo(θ)L(θ).{\displaystyle {\bar {L}}(\alpha )=\sup _{\theta :\alpha =g(\theta )}L(\theta ).\,}

El MLE también es equivariante con respecto a ciertas transformaciones de los datos. Siy=gramo(incógnita){\displaystyle y=g(x)}dóndegramo{\displaystyle g}es uno a uno y no depende de los parámetros a estimar, entonces las funciones de densidad satisfacen

FY(y)=Fincógnita(gramo1(y))|(gramo1(y))|{\displaystyle f_{Y}(y)=f_{X}(g^{-1}(y))\,|(g^{-1}(y))^{\prime }|}

y por lo tanto las funciones de probabilidad paraincógnita{\displaystyle X}yY{\displaystyle Y}Se diferencian únicamente por un factor que no depende de los parámetros del modelo.

Por ejemplo, los parámetros MLE de la distribución log-normal son los mismos que los de la distribución normal ajustada al logaritmo de los datos. De hecho, en el caso log-normal siincógnitanorte(0,1){\displaystyle X\sim {\mathcal {N}}(0,1)}, entoncesY=gramo(incógnita)=miincógnita{\displaystyle Y=g(X)=e^{X}}sigue una distribución lognormal . La densidad de Y sigue conFincógnita{\displaystyle f_{X}}estándar Normal ygramo1(y)=registro(y){\displaystyle g^{-1}(y)=\log(y)},|(gramo1(y))|=1y{\displaystyle |(g^{-1}(y))^{\prime }|={\frac {1}{y}}}paray>0{\displaystyle y>0}.

Eficiencia

Como se supuso anteriormente, si los datos fueron generados por F(;θ0) ,{\displaystyle ~f(\cdot \,;\theta _{0})~,}Entonces, bajo ciertas condiciones, también se puede demostrar que el estimador de máxima verosimilitud converge en distribución a una distribución normal. Es n  -consistente y asintóticamente eficiente, lo que significa que alcanza la cota de Cramér-Rao . Específicamente, [ 19 ]

norte(θ^mlθ0)  d  norte(0, I1) ,{\displaystyle {\sqrt {n\,}}\,\left({\widehat {\theta \,}}_{\text{mle}}-\theta _{0}\right)\ \ \xrightarrow {d} \ \ {\mathcal {N}}\left(0,\ {\mathcal {I}}^{-1}\right)~,} dónde I {\displaystyle ~{\mathcal {I}}~}es la matriz de información de Fisher : Ijk=mi[2lnFθ0(incógnitat)θjθk] .{\displaystyle {\mathcal {I}}_{jk}=\operatorname {\mathbb {E} } \,{\biggl [}\;-{\frac {\partial ^{2}\ln f_{\theta _{0}}(X_{t})}{\partial \theta _{j}\,\partial \theta _{k}}}\;{\biggr ]}~.}

En particular, significa que el sesgo del estimador de máxima verosimilitud es igual a cero hasta el orden 1 / n  .

Eficiencia de segundo orden tras la corrección del sesgo

Sin embargo, cuando consideramos los términos de orden superior en la expansión de la distribución de este estimador, resulta que θ mle tiene un sesgo de orden 1 n . Este sesgo es igual a (componente por componente) [ 21 ]

bhmi[(θ^metrolmiθ0)h]=1nortei,j,k=1metroIhiIjk(12Kijk+Jj,ik){\displaystyle b_{h}\;\equiv \;\operatorname {\mathbb {E} } {\biggl [}\;\left({\widehat {\theta }}_{\mathrm {mle} }-\theta _{0}\right)_{h}\;{\biggr ]}\;=\;{\frac {1}{\,n\,}}\,\sum _{i,j,k=1}^{m}\;{\mathcal {I}}^{hi}\;{\mathcal {I}}^{jk}\left({\frac {1}{\,2\,}}\,K_{ijk}\;+\;J_{j,ik}\right)}

dóndeIjk{\displaystyle {\mathcal {I}}^{jk}}(con superíndices) denota el componente ( j,k ) de la matriz de información de Fisher inversa.I1{\displaystyle {\mathcal {I}}^{-1}}, y

12Kijk+Jj,ik=mi[123lnFθ0(incógnitat)θiθjθk+lnFθ0(incógnitat)θj2lnFθ0(incógnitat)θiθk] .{\displaystyle {\frac {1}{\,2\,}}\,K_{ijk}\;+\;J_{j,ik}\;=\;\operatorname {\mathbb {E} } \,{\biggl [}\;{\frac {1}{2}}{\frac {\partial ^{3}\ln f_{\theta _{0}}(X_{t})}{\partial \theta _{i}\;\partial \theta _{j}\;\partial \theta _{k}}}+{\frac {\;\partial \ln f_{\theta _{0}}(X_{t})\;}{\partial \theta _{j}}}\,{\frac {\;\partial ^{2}\ln f_{\theta _{0}}(X_{t})\;}{\partial \theta _{i}\,\partial \theta _{k}}}\;{\biggr ]}~.}

Utilizando estas fórmulas es posible estimar el sesgo de segundo orden del estimador de máxima verosimilitud y corregir dicho sesgo restándolo: θ^ml=θ^mlb^ .{\displaystyle {\widehat {\theta \,}}_{\text{mle}}^{*}={\widehat {\theta \,}}_{\text{mle}}-{\widehat {b\,}}~.} Este estimador es insesgado hasta los términos de orden 1 / n , y se denomina estimador de máxima verosimilitud corregido por sesgo .

Este estimador corregido por sesgo es eficiente de segundo orden (al menos dentro de la familia exponencial curva), lo que significa que tiene un error cuadrático medio mínimo entre todos los estimadores corregidos por sesgo de segundo orden, hasta los términos del orden 1 / n 2 . Es posible continuar este proceso, es decir , derivar el término de corrección de sesgo de tercer orden, y así sucesivamente. Sin embargo, el estimador de máxima verosimilitud no es eficiente de tercer orden. [ 22 ] 

Relación con la inferencia bayesiana

Un estimador de máxima verosimilitud coincide con el estimador bayesiano más probable dada una distribución a priori uniforme sobre los parámetros . De hecho, la estimación a posteriori máxima es el parámetro θ que maximiza la probabilidad de θ dados los datos, según el teorema de Bayes:

PAG(θincógnita1,incógnita2,,incógnitanorte)=F(incógnita1,incógnita2,,incógnitanorteθ)PAG(θ)PAG(incógnita1,incógnita2,,incógnitanorte){\displaystyle \operatorname {\mathbb {P} } (\theta \mid x_{1},x_{2},\ldots ,x_{n})={\frac {f(x_{1},x_{2},\ldots ,x_{n}\mid \theta )\operatorname {\mathbb {P} } (\theta )}{\operatorname {\mathbb {P} } (x_{1},x_{2},\ldots ,x_{n})}}}

dóndePAG(θ){\displaystyle \operatorname {\mathbb {P} } (\theta )}es la distribución previa para el parámetro θ y dondePAG(incógnita1,incógnita2,,incógnitanorte){\displaystyle \operatorname {\mathbb {P} } (x_{1},x_{2},\ldots ,x_{n})}es la probabilidad de los datos promediada sobre todos los parámetros. Dado que el denominador es independiente de θ , el estimador bayesiano se obtiene maximizandoF(incógnita1,incógnita2,,incógnitanorteθ)PAG(θ){\displaystyle f(x_{1},x_{2},\ldots ,x_{n}\mid \theta )\operatorname {\mathbb {P} } (\theta )}con respecto a θ . Si además asumimos que el anteriorPAG(θ){\displaystyle \operatorname {\mathbb {P} } (\theta )}es una distribución uniforme, el estimador bayesiano se obtiene maximizando la función de verosimilitudF(incógnita1,incógnita2,,incógnitanorteθ){\displaystyle f(x_{1},x_{2},\ldots ,x_{n}\mid \theta )}Por lo tanto, el estimador bayesiano coincide con el estimador de máxima verosimilitud para una distribución a priori uniforme.PAG(θ){\displaystyle \operatorname {\mathbb {P} } (\theta )}.

Aplicación de la estimación de máxima verosimilitud en la teoría de la decisión bayesiana.

En muchas aplicaciones prácticas del aprendizaje automático , la estimación de máxima verosimilitud se utiliza como modelo para la estimación de parámetros.

La teoría de la decisión bayesiana se centra en diseñar un clasificador que minimice el riesgo total esperado, especialmente cuando los costos (la función de pérdida) asociados a las diferentes decisiones son iguales; el clasificador minimiza el error en toda la distribución. [ 23 ]

Por lo tanto, la regla de decisión de Bayes se enuncia como

"decidirw1{\displaystyle \;w_{1}\;}si PAG(w1|incógnita)>PAG(w2|incógnita) ; {\displaystyle ~\operatorname {\mathbb {P} } (w_{1}|x)\;>\;\operatorname {\mathbb {P} } (w_{2}|x)~;~}De lo contrario, decidew2{\displaystyle \;w_{2}\;}"

dóndew1,w2{\displaystyle \;w_{1}\,,w_{2}\;}son predicciones de diferentes clases. Desde la perspectiva de minimizar el error, también se puede afirmar como w=argramometroaincógnitawPAG( errorincógnita)PAG(incógnita)dincógnita {\displaystyle w={\underset {w}{\operatorname {arg\;max} }}\;\int _{-\infty }^{\infty }\operatorname {\mathbb {P} } ({\text{ error}}\mid x)\operatorname {\mathbb {P} } (x)\,\operatorname {d} x~} dónde PAG( errorincógnita)=PAG(w1incógnita) {\displaystyle \operatorname {\mathbb {P} } ({\text{ error}}\mid x)=\operatorname {\mathbb {P} } (w_{1}\mid x)~} si decidimosw2{\displaystyle \;w_{2}\;}yPAG( errorincógnita)=PAG(w2incógnita){\displaystyle \;\operatorname {\mathbb {P} } ({\text{ error}}\mid x)=\operatorname {\mathbb {P} } (w_{2}\mid x)\;}si decidimosw1.{\displaystyle \;w_{1}\;.}

Aplicando el teorema de BayesPAG(wiincógnita)=PAG(incógnitawi)PAG(wi)PAG(incógnita),{\displaystyle \operatorname {\mathbb {P} } (w_{i}\mid x)={\frac {\operatorname {\mathbb {P} } (x\mid w_{i})\operatorname {\mathbb {P} } (w_{i})}{\operatorname {\mathbb {P} } (x)}},} y si además asumimos la función de pérdida cero o uno, que es la misma pérdida para todos los errores, la regla de decisión de Bayes se puede reformular como: hBayes=argramometroaincógnitaw[PAG(incógnitaw)PAG(w)],{\displaystyle h_{\text{Bayes}}={\underset {w}{\operatorname {arg\;max} }}\,{\bigl [}\,\operatorname {\mathbb {P} } (x\mid w)\,\operatorname {\mathbb {P} } (w)\,{\bigr ]}\;,} dóndehBayes{\displaystyle h_{\text{Bayes}}}es la predicción yPAG(w){\displaystyle \;\operatorname {\mathbb {P} } (w)\;}es la probabilidad previa .

Relación con la minimización de la divergencia de Kullback-Leibler y la entropía cruzada

Descubrimientoθ^{\displaystyle {\hat {\theta }}}que maximiza la probabilidad es asintóticamente equivalente a encontrar laθ^{\displaystyle {\hat {\theta }}}que define una distribución de probabilidad (Qθ^{\displaystyle Q_{\hat {\theta }}}) que tiene una distancia mínima, en términos de divergencia de Kullback-Leibler , a la distribución de probabilidad real a partir de la cual se generaron nuestros datos (es decir, generados porPAGθ0{\displaystyle P_{\theta _{0}}}). [ 24 ] En un mundo ideal, P y Q son lo mismo (y lo único desconocido esθ{\displaystyle \theta }que define P), pero incluso si no lo son y el modelo que usamos está mal especificado, el MLE aún nos dará la distribución "más cercana" (dentro de la restricción de un modelo Q que depende deθ^{\displaystyle {\hat {\theta }}}) a la distribución realPAGθ0{\displaystyle P_{\theta _{0}}}. [ 25 ]

Sesgo de predicción

Las estimaciones de máxima verosimilitud de los parámetros pueden sustituirse en expresiones para la función de densidad de probabilidad , la función de distribución acumulativa o la función cuantil , para generar predicciones de probabilidades o cuantiles de eventos fuera de la muestra. Este método para predecir probabilidades se recomienda en libros de texto de estadística [ 27 ] [ 28 ] [ 29 ] y libros de texto actuariales, [ 30 ] y se utiliza ampliamente en la literatura científica. Sin embargo, la predicción de máxima verosimilitud no propaga la incertidumbre alrededor de las estimaciones de parámetros de máxima verosimilitud en la predicción. [ 31 ] [ 32 ] Como resultado, las probabilidades predichas no están bien calibradas y no se debe esperar que correspondan a las frecuencias de eventos fuera de la muestra. En particular, las probabilidades de excedencia de cola y los cuantiles de excedencia de cola suelen subestimarse, a veces drásticamente. La subestimación es mayor cuando hay pocos datos de entrenamiento, se estiman muchos parámetros y para la cola lejana. En los casos en que este sesgo de predicción sea un problema, las predicciones bayesianas pueden proporcionar una solución si la distribución a priori se elige de manera que se reduzca o elimine el sesgo. [ 33 ] [ 34 ] [ 35 ]

Ejemplos

Distribución uniforme discreta

Consideremos un caso en el que se colocan n boletos numerados del 1 al n en una caja y se selecciona uno al azar ( véase distribución uniforme ); por lo tanto, el tamaño de la muestra es 1. Si n es desconocido, entonces el estimador de máxima verosimilitudnorte^{\displaystyle {\widehat {n}}}de n es el número m en el boleto sorteado. (La probabilidad es 0 para n  < m , 1 / n para nm , y es máxima cuando n = m . Nótese que la estimación de máxima probabilidad de n se produce en el extremo inferior de los valores posibles { m , m + 1, ...}, en lugar de en algún punto intermedio del rango de valores posibles, lo que resultaría en un menor sesgo). El valor esperado del número m en el boleto sorteado y, por lo tanto, el valor esperado de         norte^{\displaystyle {\widehat {n}}}, es ( n  +  1)/2. Como resultado, con un tamaño de muestra de 1, el estimador de máxima verosimilitud para n subestimará sistemáticamente n en ( n  1)/2.

Distribución discreta, espacio de parámetros finito

Supongamos que uno desea determinar cuán sesgada es una moneda injusta . Llamemos p a la probabilidad de lanzar una ' cara ' . El objetivo entonces es determinar p .

Supongamos que se lanza la moneda 80 veces: es decir, la muestra podría ser algo como x 1  =  H, x 2  =  T, ..., x 80  = T, y se observa  el número de caras "H".

La probabilidad de obtener cruz es 1  p (donde p es θ ). Supongamos que el resultado es 49 caras y 31 cruces , y que la moneda se extrajo de una caja que contiene tres monedas: una que da cara con probabilidad p = 1/3 , otra que da cara con probabilidad p = 1/2 y otra que da cara con probabilidad p = 2/3 . Las monedas han perdido sus etiquetas, por lo que se desconoce cuál era. Mediante la estimación de máxima verosimilitud, se puede encontrar la moneda con la mayor probabilidad, dados los datos observados. Utilizando la función de probabilidad de la distribución binomial con un tamaño de muestra de 80 y un número de éxitos de 49, pero para diferentes valores de p (la "probabilidad de éxito"), la función de verosimilitud (definida a continuación) toma uno de tres valores:         

PAG[H=49pag=13]=(8049)(13)49(113)310.000,PAG[H=49pag=12]=(8049)(12)49(112)310,012,PAG[H=49pag=23]=(8049)(23)49(123)310,054 .{\displaystyle {\begin{aligned}\operatorname {\mathbb {P} } {\bigl [}\;\mathrm {H} =49\mid p={\tfrac {1}{3}}\;{\bigr ]}&={\binom {80}{49}}({\tfrac {1}{3}})^{49}(1-{\tfrac {1}{3}})^{31}\approx 0.000,\\[6pt]\operatorname {\mathbb {P} } {\bigl [}\;\mathrm {H} =49\mid p={\tfrac {1}{2}}\;{\bigr ]}&={\binom {80}{49}}({\tfrac {1}{2}})^{49}(1-{\tfrac {1}{2}})^{31}\approx 0.012,\\[6pt]\operatorname {\mathbb {P} } {\bigl [}\;\mathrm {H} =49\mid p={\tfrac {2}{3}}\;{\bigr ]}&={\binom {80}{49}}({\tfrac {2}{3}})^{49}(1-{\tfrac {2}{3}})^{31}\approx 0.054~.\end{aligned}}}

La probabilidad se maximiza cuando p  = 2 / 3 , por lo que esta es la estimación de máxima verosimilitud para p .  

Distribución discreta, espacio de parámetros continuo

Ahora supongamos que solo hubiera una moneda, pero su valor p podría ser cualquier valor 0 ≤ p ≤ 1. La función de verosimilitud que se debe maximizar es L(pag)=FD(H=49pag)=(8049)pag49(1pag)31 ,{\displaystyle L(p)=f_{D}(\mathrm {H} =49\mid p)={\binom {80}{49}}p^{49}(1-p)^{31}~,}

y la maximización se realiza sobre todos los valores posibles 0 ≤ p ≤ 1 .

Función de verosimilitud para el valor proporcional de un proceso binomial ( n  =  10)

Una forma de maximizar esta función es derivando con respecto a p e igualando a cero:

0=pag((8049)pag49(1pag)31) ,0=49pag48(1pag)3131pag49(1pag)30=pag48(1pag)30[49(1pag)31pag]=pag48(1pag)30[4980pag] .{\displaystyle {\begin{aligned}0&={\frac {\partial }{\partial p}}\left({\binom {80}{49}}p^{49}(1-p)^{31}\right)~,\\[8pt]0&=49p^{48}(1-p)^{31}-31p^{49}(1-p)^{30}\\[8pt]&=p^{48}(1-p)^{30}\left[49(1-p)-31p\right]\\[8pt]&=p^{48}(1-p)^{30}\left[49-80p\right]~.\end{aligned}}}

Este es un producto de tres términos. El primer término es 0 cuando p  =  0. El segundo es 0 cuando p  =  1. El tercero es cero cuando p  = 49 / 80. La solución que maximiza la verosimilitud es claramente p = 49 / 80 (ya que p = 0 y p = 1 dan como resultado una verosimilitud de 0). Por lo tanto, el estimador de máxima verosimilitud para p es 49 / 80 .       

Este resultado se generaliza fácilmente sustituyendo el número 49 por una letra como la "s" para representar el número observado de "éxitos" en nuestros ensayos de Bernoulli , y el número 80 por una letra como la "n" para representar el número de ensayos de Bernoulli. El mismo cálculo da como resultado s / n, que es el estimador de máxima verosimilitud para cualquier secuencia de n ensayos de Bernoulli que resulten en s "éxitos".

Distribución continua, espacio de parámetros continuo

Para la distribución normalnorte(μ,σ2){\displaystyle {\mathcal {N}}(\mu ,\sigma ^{2})}que tiene función de densidad de probabilidad

F(incógnitaμ,σ2)=12πσ2 exp((incógnitaμ)22σ2),{\displaystyle f(x\mid \mu ,\sigma ^{2})={\frac {1}{{\sqrt {2\pi \sigma ^{2}}}\ }}\exp \left(-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}\right),}

La función de densidad de probabilidad correspondiente para una muestra de n variables aleatorias normales independientes e idénticamente distribuidas (la verosimilitud) es

F(incógnita1,,incógnitanorteμ,σ2)=i=1norteF(incógnitaiμ,σ2)=(12πσ2)norte/2exp(i=1norte(incógnitaiμ)22σ2).{\displaystyle f(x_{1},\ldots ,x_{n}\mid \mu ,\sigma ^{2})=\prod _{i=1}^{n}f(x_{i}\mid \mu ,\sigma ^{2})=\left({\frac {1}{2\pi \sigma ^{2}}}\right)^{n/2}\exp \left(-{\frac {\sum _{i=1}^{n}(x_{i}-\mu )^{2}}{2\sigma ^{2}}}\right).}

Esta familia de distribuciones tiene dos parámetros: θ  = ( μ , σ )  ; por lo tanto, maximizamos la verosimilitud,L(μ,σ2)=F(incógnita1,,incógnitanorteμ,σ2){\displaystyle {\mathcal {L}}(\mu ,\sigma ^{2})=f(x_{1},\ldots ,x_{n}\mid \mu ,\sigma ^{2})}, sobre ambos parámetros simultáneamente o, si es posible, individualmente.

Dado que la función logaritmo es una función continua estrictamente creciente en el rango de la verosimilitud, los valores que maximizan la verosimilitud también maximizarán su logaritmo (la log-verosimilitud en sí misma no es necesariamente estrictamente creciente). La log-verosimilitud se puede escribir de la siguiente manera:

registro(L(μ,σ2))=norte2registro(2πσ2)12σ2i=1norte(incógnitaiμ)2{\displaystyle \log \left({\mathcal {L}}(\mu ,\sigma ^{2})\right)=-{\frac {n}{2}}\log(2\pi \sigma ^{2})-{\frac {1}{2\sigma ^{2}}}\sum _{i=1}^{n}\left(x_{i}-\mu \right)^{2}}

(Nota: la log-verosimilitud está estrechamente relacionada con la entropía de la información y la información de Fisher ).

Ahora calculamos las derivadas de esta log-verosimilitud de la siguiente manera.

0=μregistro(L(μ,σ2))=02norte(incógnita¯μ)2σ2.{\displaystyle {\begin{aligned}0&={\frac {\partial }{\partial \mu }}\log \left({\mathcal {L}}(\mu ,\sigma ^{2})\right)=0-{\frac {-2n({\bar {x}}-\mu )}{2\sigma ^{2}}}.\end{aligned}}} dóndeincógnita¯{\displaystyle {\bar {x}}}es la media muestral . Esto se resuelve mediante

μ^=incógnita¯=i=1norteincógnitainorte.{\displaystyle {\widehat {\mu }}={\bar {x}}=\sum _{i=1}^{n}{\frac {\,x_{i}\,}{n}}.}

Este es, en efecto, el máximo de la función, ya que es el único punto de inflexión en μ y la segunda derivada es estrictamente menor que cero. Su valor esperado es igual al parámetro μ de la distribución dada.

mi[μ^]=μ,{\displaystyle \operatorname {\mathbb {E} } {\bigl [}\;{\widehat {\mu }}\;{\bigr ]}=\mu ,\,}

lo que significa que el estimador de máxima verosimilitudμ^{\displaystyle {\widehat {\mu }}}es imparcial.

De forma similar, diferenciamos la log-verosimilitud con respecto a σ y la igualamos a cero:

0=σregistro(L(μ,σ2))=norteσ+1σ3i=1norte(incógnitaiμ)2.{\displaystyle {\begin{aligned}0&={\frac {\partial }{\partial \sigma }}\log {\Bigl (}{\mathcal {L}}(\mu ,\sigma ^{2}){\Bigr )}=-{\frac {\,n\,}{\sigma }}+{\frac {1}{\sigma ^{3}}}\sum _{i=1}^{n}(\,x_{i}-\mu \,)^{2}.\end{aligned}}}

que se resuelve mediante

σ^2=1nortei=1norte(incógnitaiμ)2.{\displaystyle {\widehat {\sigma }}^{2}={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-\mu )^{2}.}

Insertar la estimaciónμ=μ^{\displaystyle \mu ={\widehat {\mu }}}obtenemos

σ^2=1nortei=1norte(incógnitaiincógnita¯)2=1nortei=1norteincógnitai21norte2i=1nortej=1norteincógnitaiincógnitaj.{\displaystyle {\widehat {\sigma }}^{2}={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}^{2}-{\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}x_{i}x_{j}.}

Para calcular su valor esperado, es conveniente reescribir la expresión en términos de variables aleatorias de media cero ( error estadístico ). δiμincógnitai{\displaystyle \delta _{i}\equiv \mu -x_{i}}Al expresar la estimación en estas variables se obtiene

σ^2=1nortei=1norte(μδi)21norte2i=1nortej=1norte(μδi)(μδj).{\displaystyle {\widehat {\sigma }}^{2}={\frac {1}{n}}\sum _{i=1}^{n}(\mu -\delta _{i})^{2}-{\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}(\mu -\delta _{i})(\mu -\delta _{j}).}

Simplificando la expresión anterior, utilizando los hechos quemi[δi]=0{\displaystyle \operatorname {\mathbb {E} } {\bigl [}\;\delta _{i}\;{\bigr ]}=0}ymi[δi2]=σ2{\displaystyle \operatorname {E} {\bigl [}\;\delta _{i}^{2}\;{\bigr ]}=\sigma ^{2}}, nos permite obtener

mi[σ^2]=norte1norteσ2.{\displaystyle \operatorname {\mathbb {E} } {\bigl [}\;{\widehat {\sigma }}^{2}\;{\bigr ]}={\frac {\,n-1\,}{n}}\sigma ^{2}.}

Esto significa que el estimadorσ^2{\displaystyle {\widehat {\sigma }}^{2}}está sesgado porσ2{\displaystyle \sigma ^{2}}También se puede demostrar queσ^{\displaystyle {\widehat {\sigma }}}está sesgado porσ{\displaystyle \sigma }pero que ambosσ^2{\displaystyle {\widehat {\sigma }}^{2}}yσ^{\displaystyle {\widehat {\sigma }}}son consistentes.

Formalmente decimos que el estimador de máxima verosimilitud paraθ=(μ,σ2){\displaystyle \theta =(\mu ,\sigma ^{2})}es

θ^=(μ^,σ^2).{\displaystyle {\widehat {\theta \,}}=\left({\widehat {\mu }},{\widehat {\sigma }}^{2}\right).}

En este caso, los estimadores de máxima verosimilitud (EMV) podrían obtenerse individualmente. En general, esto no suele ser así, y los EMV tendrían que obtenerse simultáneamente.

La función de verosimilitud logarítmica normal, en su valor máximo, adopta una forma particularmente sencilla:

registro(L(μ^,σ^))=norte2(registro(2πσ^2)+1){\displaystyle \log {\Bigl (}{\mathcal {L}}({\widehat {\mu }},{\widehat {\sigma }}){\Bigr )}={\frac {\,-n\;\;}{2}}{\bigl (}\,\log(2\pi {\widehat {\sigma }}^{2})+1\,{\bigr )}}

Se puede demostrar que esta máxima verosimilitud logarítmica es la misma para mínimos cuadrados más generales , incluso para mínimos cuadrados no lineales . Esto se utiliza a menudo para determinar intervalos de confianza y regiones de confianza aproximados basados ​​en la verosimilitud , que generalmente son más precisos que los que utilizan la normalidad asintótica descrita anteriormente.

Variables no independientes

Puede darse el caso de que las variables estén correlacionadas o, más generalmente, no sean independientes. Dos variables aleatoriasy1{\displaystyle y_{1}}yy2{\displaystyle y_{2}}son independientes solo si su función de densidad de probabilidad conjunta es el producto de las funciones de densidad de probabilidad individuales, es decir

F(y1,y2)=F(y1)F(y2){\displaystyle f(y_{1},y_{2})=f(y_{1})f(y_{2})\,}

Supongamos que se construye un vector gaussiano de orden n a partir de variables aleatorias.(y1,,ynorte){\displaystyle (y_{1},\ldots ,y_{n})}donde cada variable tiene medias dadas por(μ1,,μnorte){\displaystyle (\mu _{1},\ldots ,\mu _{n})}Además, sea la matriz de covarianza denotada porΣ{\displaystyle {\mathit {\Sigma }}}La función de densidad de probabilidad conjunta de estas n variables aleatorias sigue entonces una distribución normal multivariada dada por:

F(y1,,ynorte)=1(2π)norte/2det(Σ)exp(12[y1μ1,,ynorteμnorte]Σ1[y1μ1,,ynorteμnorte]T){\displaystyle f(y_{1},\ldots ,y_{n})={\frac {1}{(2\pi )^{n/2}{\sqrt {\det({\mathit {\Sigma }})}}}}\exp \left(-{\frac {1}{2}}\left[y_{1}-\mu _{1},\ldots ,y_{n}-\mu _{n}\right]{\mathit {\Sigma }}^{-1}\left[y_{1}-\mu _{1},\ldots ,y_{n}-\mu _{n}\right]^{\mathrm {T} }\right)}

En el caso bivariado , la función de densidad de probabilidad conjunta viene dada por:

F(y1,y2)=12πσ1σ21ρ2exp[12(1ρ2)((y1μ1)2σ122ρ(y1μ1)(y2μ2)σ1σ2+(y2μ2)2σ22)]{\displaystyle f(y_{1},y_{2})={\frac {1}{2\pi \sigma _{1}\sigma _{2}{\sqrt {1-\rho ^{2}}}}}\exp \left[-{\frac {1}{2(1-\rho ^{2})}}\left({\frac {(y_{1}-\mu _{1})^{2}}{\sigma _{1}^{2}}}-{\frac {2\rho (y_{1}-\mu _{1})(y_{2}-\mu _{2})}{\sigma _{1}\sigma _{2}}}+{\frac {(y_{2}-\mu _{2})^{2}}{\sigma _{2}^{2}}}\right)\right]}

En este y otros casos donde existe una función de densidad conjunta, la función de verosimilitud se define como se indicó anteriormente, en la sección " principios ", utilizando esta densidad.

Ejemplo

incógnita1, incógnita2,, incógnitametro{\displaystyle X_{1},\ X_{2},\ldots ,\ X_{m}}son recuentos en celdas / cajas 1 hasta m; cada caja tiene una probabilidad diferente (piensa en las cajas siendo más grandes o más pequeñas) y fijamos el número de bolas que caen a sernorte{\displaystyle n}:incógnita1+incógnita2++incógnitametro=norte{\displaystyle x_{1}+x_{2}+\cdots +x_{m}=n}. La probabilidad de cada caja espagi{\displaystyle p_{i}}, con una restricción:pag1+pag2++pagmetro=1{\displaystyle p_{1}+p_{2}+\cdots +p_{m}=1}. Este es un caso en el que elincógnitai{\displaystyle X_{i}}s no son independientes, la probabilidad conjunta de un vectorincógnita1, incógnita2,,incógnitametro{\displaystyle x_{1},\ x_{2},\ldots ,x_{m}}Se llama multinomial y tiene la forma:

F(incógnita1,incógnita2,,incógnitametropag1,pag2,,pagmetro)=norte¡incógnitai¡pagiincógnitai=(norteincógnita1,incógnita2,,incógnitametro)pag1incógnita1pag2incógnita2pagmetroincógnitametro{\displaystyle f(x_{1},x_{2},\ldots ,x_{m}\mid p_{1},p_{2},\ldots ,p_{m})={\frac {n!}{\prod x_{i}!}}\prod p_{i}^{x_{i}}={\binom {n}{x_{1},x_{2},\ldots ,x_{m}}}p_{1}^{x_{1}}p_{2}^{x_{2}}\cdots p_{m}^{x_{m}}}

Cada caja tomada por separado en comparación con todas las demás cajas es un binomio y esto es una extensión del mismo.

La verosimilitud logarítmica de esto es:

(pag1,pag2,,pagmetro)=registronorte¡i=1metroregistroincógnitai¡+i=1metroincógnitairegistropagi{\displaystyle \ell (p_{1},p_{2},\ldots ,p_{m})=\log n!-\sum _{i=1}^{m}\log x_{i}!+\sum _{i=1}^{m}x_{i}\log p_{i}}

Hay que tener en cuenta la restricción y utilizar los multiplicadores de Lagrange:

L(pag1,pag2,,pagmetro,λ)=(pag1,pag2,,pagmetro)+λ(1i=1metropagi){\displaystyle L(p_{1},p_{2},\ldots ,p_{m},\lambda )=\ell (p_{1},p_{2},\ldots ,p_{m})+\lambda \left(1-\sum _{i=1}^{m}p_{i}\right)}

Al igualar todas las derivadas a cero, se obtiene la estimación más natural.

pag^i=incógnitainorte{\displaystyle {\hat {p}}_{i}={\frac {x_{i}}{n}}}

Maximizar la verosimilitud logarítmica, con y sin restricciones, puede ser un problema irresoluble en forma cerrada, por lo que debemos utilizar procedimientos iterativos.

Procedimientos iterativos

Excepto en casos especiales, las ecuaciones de verosimilitud (θ;y)θ=0{\displaystyle {\frac {\partial \ell (\theta ;\mathbf {y} )}{\partial \theta }}=0}

no se puede resolver explícitamente para un estimadorθ^=θ^(y){\displaystyle {\widehat {\theta }}={\widehat {\theta }}(\mathbf {y} )}En cambio, deben resolverse iterativamente : comenzando desde una suposición inicial deθ{\displaystyle \theta }(decirθ^1{\displaystyle {\widehat {\theta }}_{1}}), se busca obtener una secuencia convergente{θ^r}{\displaystyle \left\{{\widehat {\theta }}_{r}\right\}}Existen muchos métodos para este tipo de problema de optimización , [ 36 ] [ 37 ] pero los más utilizados son algoritmos basados ​​en una fórmula de actualización de la forma θ^r+1=θ^r+ηrdr(θ^){\displaystyle {\widehat {\theta }}_{r+1}={\widehat {\theta }}_{r}+\eta _{r}\mathbf {d} _{r}\left({\widehat {\theta }}\right)}

donde el vectordr(θ^){\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)}indica la dirección de descenso del r -ésimo "paso" y el escalarηr{\displaystyle \eta _{r}}captura la "longitud del paso", [ 38 ] [ 39 ] también conocida como tasa de aprendizaje . [ 40 ]

(Nota: aquí se trata de un problema de maximización, por lo que el signo que precede al gradiente está invertido).

ηrR+{\displaystyle \eta _{r}\in \mathbb {R} ^{+}} que sea lo suficientemente pequeño para la convergencia ydr(θ^)=(θ^r;y){\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)=\nabla \ell \left({\widehat {\theta }}_{r};\mathbf {y} \right)}

El método de descenso de gradiente requiere calcular el gradiente en la iteración r , pero no necesita calcular la inversa de la derivada de segundo orden, es decir, la matriz hessiana. Por lo tanto, es computacionalmente más rápido que el método de Newton - Raphson.

ηr=1{\displaystyle \eta _{r}=1}ydr(θ^)=Hr1(θ^)sr(θ^){\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)=-\mathbf {H} _{r}^{-1}\left({\widehat {\theta }}\right)\mathbf {s} _{r}\left({\widehat {\theta }}\right)}

dóndesr(θ^){\displaystyle \mathbf {s} _{r}({\widehat {\theta }})}es la puntuación yHr1(θ^){\displaystyle \mathbf {H} _{r}^{-1}\left({\widehat {\theta }}\right)}es la inversa de la matriz hessiana de la función de log-verosimilitud, ambas evaluadas en la r -ésima iteración. [ 41 ] [ 42 ] Pero debido a que el cálculo de la matriz hessiana es computacionalmente costoso , se han propuesto numerosas alternativas. El popular algoritmo de Berndt-Hall-Hall-Hausman aproxima la hessiana con el producto exterior del gradiente esperado, de tal manera que

dr(θ^)=[1nortet=1norte(θ;y)θ((θ;y)θ)T]1sr(θ^){\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)=-\left[{\frac {1}{n}}\sum _{t=1}^{n}{\frac {\partial \ell (\theta ;\mathbf {y} )}{\partial \theta }}\left({\frac {\partial \ell (\theta  ;\mathbf {y} )}{\partial \theta }}\right)^{\mathsf {T}}\right]^{-1}\mathbf {s} _{r}\left({\widehat {\theta }}\right)}

Otros métodos cuasi-Newton utilizan actualizaciones de secante más elaboradas para dar una aproximación de la matriz hessiana.

La fórmula DFP encuentra una solución que es simétrica, definida positiva y la más cercana al valor aproximado actual de la derivada de segundo orden: Hk+1=(IγkykskT)Hk(IγkskykT)+γkykykT,{\displaystyle \mathbf {H} _{k+1}=\left(I-\gamma _{k}y_{k}s_{k}^{\mathsf {T}}\right)\mathbf {H} _{k}\left(I-\gamma _{k}s_{k}y_{k}^{\mathsf {T}}\right)+\gamma _{k}y_{k}y_{k}^{\mathsf {T}},}

dónde

yk=(incógnitak+sk)(incógnitak),{\displaystyle y_{k}=\nabla \ell (x_{k}+s_{k})-\nabla \ell (x_{k}),}γk=1ykTsk,{\displaystyle \gamma _{k}={\frac {1}{y_{k}^{\mathsf {T}}s_{k}}},}sk=incógnitak+1incógnitak.{\displaystyle s_{k}=x_{k+1}-x_{k}.}

BFGS también proporciona una solución simétrica y definida positiva:

Bk+1=Bk+ykykTykTskBkskskTBkTskTBksk ,{\displaystyle B_{k+1}=B_{k}+{\frac {y_{k}y_{k}^{\mathsf {T}}}{y_{k}^{\mathsf {T}}s_{k}}}-{\frac {B_{k}s_{k}s_{k}^{\mathsf {T}}B_{k}^{\mathsf {T}}}{s_{k}^{\mathsf {T}}B_{k}s_{k}}}\ ,}

dónde

yk=(incógnitak+sk)(incógnitak),{\displaystyle y_{k}=\nabla \ell (x_{k}+s_{k})-\nabla \ell (x_{k}),}sk=incógnitak+1incógnitak.{\displaystyle s_{k}=x_{k+1}-x_{k}.}

El método BFGS no garantiza la convergencia a menos que la función tenga una expansión de Taylor cuadrática cerca de un óptimo. Sin embargo, BFGS puede ofrecer un rendimiento aceptable incluso para instancias de optimización no suaves.

Otro método popular es reemplazar el Hessiano con la matriz de información de Fisher ,I(θ)=mi[Hr(θ^)]{\displaystyle {\mathcal {I}}(\theta )=\operatorname {\mathbb {E} } \left[\mathbf {H} _{r}\left({\widehat {\theta }}\right)\right]}, lo que nos da el algoritmo de puntuación de Fisher. Este procedimiento es estándar en la estimación de muchos métodos, como los modelos lineales generalizados .

Aunque populares, los métodos cuasi-Newton pueden converger a un punto estacionario que no necesariamente es un máximo local o global, [ 43 ] sino más bien un mínimo local o un punto de silla . Por lo tanto, es importante evaluar la validez de la solución obtenida para las ecuaciones de verosimilitud, verificando que la matriz hessiana, evaluada en la solución, sea definida negativa y esté bien condicionada . [ 44 ]

Historia

Ronald Fisher en 1913

Entre los primeros usuarios del método de máxima verosimilitud se encuentran Carl Friedrich Gauss , Pierre-Simon Laplace , Thorvald N. Thiele y Francis Ysidro Edgeworth . [ 45 ] [ 46 ] Sin embargo, fue Ronald Fisher , entre 1912 y 1922, quien creó por sí solo la versión moderna del método. [ 47 ] [ 48 ]

La estimación de máxima verosimilitud finalmente trascendió la justificación heurística en una demostración publicada por Samuel S. Wilks en 1938, ahora conocida como el teorema de Wilks . [ 49 ] El teorema muestra que el error en el logaritmo de los valores de verosimilitud para estimaciones de múltiples observaciones independientes se distribuye asintóticamente según una distribución χ² , lo que permite determinar convenientemente una región de confianza alrededor de cualquier estimación de los parámetros. La única parte difícil de la demostración de Wilks depende del valor esperado de la matriz de información de Fisher , que viene dado por un teorema demostrado por Fisher. [ 50 ] Wilks continuó mejorando la generalidad del teorema a lo largo de su vida, publicando su demostración más general en 1962. [ 51 ]

Varios autores han realizado revisiones del desarrollo de la estimación de máxima verosimilitud. [ 52 ] [ 53 ] [ 54 ] [ 55 ] [ 56 ] [ 57 ] [ 58 ] [ 59 ]

Véase también

  • Criterio de información de Akaike : un criterio para comparar modelos estadísticos, basado en la estimación de máxima verosimilitud (MLE).
  • Estimador extremo : una clase más general de estimadores a la que pertenece el estimador de máxima verosimilitud (MLE).
  • Información de Fisher : matriz de información, su relación con la matriz de covarianza de las estimaciones de máxima verosimilitud.
  • Error cuadrático medio : una medida de cuán "bueno" es un estimador de un parámetro de distribución (ya sea el estimador de máxima verosimilitud u otro estimador).
  • RANSAC : un método para estimar los parámetros de un modelo matemático a partir de datos que contienen valores atípicos.
  • Teorema de Rao-Blackwell : proporciona un proceso para encontrar el mejor estimador insesgado posible (en el sentido de tener un error cuadrático medio mínimo ); el estimador de máxima verosimilitud suele ser un buen punto de partida para el proceso.
  • Teorema de Wilks : proporciona un medio para estimar el tamaño y la forma de la región de estimaciones aproximadamente igualmente probables para los valores de los parámetros de la población, utilizando la información de una sola muestra, mediante una distribución chi-cuadrado.

Otros métodos de estimación

Referencias

  1. Rossi, Richard J. (2018). Estadística matemática: Una introducción a la inferencia basada en la verosimilitud . Nueva York: John Wiley & Sons. pág.  227. ISBN 978-1-118-77104-4.
  2. Hendry, David F. ; Nielsen, Bent (2007). Econometric Modeling: A Likelihood Approach . Princeton: Princeton University Press. ISBN 978-0-691-13128-3.
  3. Chambers, Raymond L.; Steel, David G.; Wang, Suojin; Welsh, Alan (2012). Estimación de máxima verosimilitud para encuestas por muestreo . Boca Raton: CRC Press. ISBN 978-1-58488-632-7.
  4. Ward, Michael Don ; Ahlquist, John S. (2018). Máxima verosimilitud para las ciencias sociales: estrategias de análisis . Nueva York: Cambridge University Press. ISBN 978-1-107-18582-1.
  5. Press, WH; Flannery, BP; Teukolsky, SA; Vetterling, WT (1992). «Mínimos cuadrados como estimador de máxima verosimilitud» . Numerical Recipes in FORTRAN: The Art of Scientific Computing (2.ª ed.). Cambridge: Cambridge University Press. pp. 651–655 . ISBN   0-521-43064-X.
  6. Myung, IJ (2003). "Tutorial sobre estimación de máxima verosimilitud". Journal of Mathematical Psychology . 47 (1): 90– 100. doi : 10.1016/S0022-2496(02)00028-7 .
  7. Gourieroux, Christian; Monfort, Alain (1995). Statistics and Econometrics Models . Cambridge University Press. p . 161. ISBN  0-521-40551-3.
  8. Kane, Edward J. (1968). Estadística económica y econometría . Nueva York, NY: Harper & Row. pág. 179 . 
  9. Small, Christopher G.; Wang, Jinfang (2003). "Trabajando con raíces" . Métodos numéricos para la estimación de ecuaciones no lineales . Oxford University Press. págs. 74–124 . ISBN  0-19-850688-0.
  10. Kass, Robert E.; Vos, Paul W. (1997). Fundamentos geométricos de la inferencia asintótica . Nueva York, NY: John Wiley & Sons. pág. 14. ISBN  0-471-82668-5.
  11. Papadopoulos, Alecos (25 de septiembre de 2013). "¿Por qué siempre ponemos log() antes de la pdf conjunta cuando usamos MLE (Estimación de máxima verosimilitud)?" . Stack Exchange .
  12. 1 2 Silvey, SD (1975). Inferencia estadística . Londres, Reino Unido: Chapman and Hall. pág. 79. ISBN  0-412-13820-4.
  13. Olive, David (2004). "¿El MLE maximiza la verosimilitud?" (PDF) . Universidad del Sur de Illinois .
  14. Schwallie, Daniel P. (1985). "Estimadores de covarianza de máxima verosimilitud definidos positivos". Economics Letters . 17 ( 1– 2): 115– 117. doi : 10.1016/0165-1765(85)90139-9 .
  15. Magnus, Jan R. (2017). Introducción a la teoría de la econometría . Ámsterdam: VU University Press. pp. 64–65 . ISBN  978-90-8659-766-6.
  16. Edwards, AWF 1972. Probabilidad. Cambridge University Press, Cambridge (edición ampliada, 1992, Johns Hopkins University Press, Baltimore). ISBN 0-8018-4443-6
  17. Pfanzagl (1994 , pág. 206) 
  18. Según el Teorema 2.5 en Newey, Whitney K.; McFadden, Daniel (1994). «Capítulo 36: Estimación de muestras grandes y prueba de hipótesis». En Engle, Robert; McFadden, Dan (eds.). Manual de Econometría, Vol. 4. Elsevier Science. pp. 2111–2245 . ISBN  978-0-444-88766-5.
  19. 1 2 Según el Teorema 3.3 en Newey, Whitney K.; McFadden, Daniel (1994). «Capítulo 36: Estimación de muestras grandes y prueba de hipótesis». En Engle, Robert; McFadden, Dan (eds.). Manual de Econometría, Vol. 4. Elsevier Science. págs. 2111–2245 . ISBN  978-0-444-88766-5.
  20. Zacks, Shelemyahu (1971). La teoría de la inferencia estadística . Nueva York: John Wiley & Sons. pág. 223. ISBN  0-471-98103-6.
  21. Véase la fórmula 20 en Cox, David R.; Snell , E. Joyce (1968). "Una definición general de residuos". Journal of the Royal Statistical Society, Serie B. 30 ( 2): 248–275 . doi : 10.1111/j.2517-6161.1968.tb00724.x . JSTOR 2984505 . 
  22. Kano, Yutaka (1996). "La eficiencia de tercer orden implica la eficiencia de cuarto orden" . Journal of the Japan Statistical Society . 26 : 101–117 . doi : 10.14490/jjss1995.26.101 .
  23. Christensen, Henrikt I. "Reconocimiento de patrones" (PDF) (conferencia). Teoría de la decisión bayesiana - CS 7616. Georgia Tech.
  24. cmplx96 ( https://stats.stackexchange.com/users/177679/cmplx96 ), divergencia de Kullback-Leibler, URL (versión: 18-11-2017): https://stats.stackexchange.com/q/314472 (en el vídeo de YouTube, ver de los minutos 13 al 25)
  25. Introducción a la inferencia estadística | Stanford (Clase 16 — Estimación de máxima verosimilitud bajo especificación incorrecta del modelo)
  26. Sycorax dice Reinstate Monica ( https://stats.stackexchange.com/users/22311/sycorax-says-reinstate-monica ), la relación entre maximizar la probabilidad y minimizar la entropía cruzada, URL (versión: 2019-11-06): https://stats.stackexchange.com/q/364237
  27. Coles, Stuart (2001). Introducción al modelado estadístico de valores extremos . Springer Series in Statistics. doi : 10.1007/978-1-4471-3675-0 . ISBN 978-1-84996-874-4ISSN 0172-7397 
  28. Análisis estadístico de valores extremos . 2007. doi : 10.1007/978-3-7643-7399-3 . ISBN 978-3-7643-7230-9.
  29. Embrechts, Paul; Klüppelberg, Claudia; Mikosch, Thomas (1997). Modelado de eventos extremos . doi : 10.1007/978-3-642-33483-2 . ISBN 978-3-642-08242-9.
  30. Modelos de pérdida . Serie Wiley en Probabilidad y Estadística. 2013. doi : 10.1002/9781118787106 . ISBN 978-1-118-34356-2.
  31. Gerrard, R.; Tsanakas, A. (2011). "Probabilidad de falla bajo incertidumbre de parámetros" . Risk Analysis . 31 (5): 727– 744. Bibcode : 2011RiskA..31..727G . doi : 10.1111/j.1539-6924.2010.01549.x . ISSN 1539-6924 . PMID 21175720 .  
  32. Jewson, Stephen; Sweeting, Trevor; Jewson, Lynne (2025-02-20). "Reducción del sesgo de fiabilidad en las evaluaciones del riesgo de fenómenos meteorológicos extremos mediante la calibración de priors" . Avances en Climatología Estadística, Meteorología y Oceanografía . 11 (1): 1– 22. Bibcode : 2025ASCMO..11....1J . doi : 10.5194/ascmo-11-1-2025 . ISSN 2364-3579 . 
  33. Severini, Thomas A.; Mukerjee, Rahul; Ghosh, Malay (2002-12-01). "Sobre una propiedad de coincidencia de probabilidad exacta de priors invariantes a la derecha" . Biometrika . 89 (4): 952– 957. doi : 10.1093/biomet/89.4.952 . ISSN 0006-3444 . 
  34. Gerrard, R.; Tsanakas, A. (2011). "Probabilidad de falla bajo incertidumbre de parámetros" . Risk Analysis . 31 (5): 727– 744. Bibcode : 2011RiskA..31..727G . doi : 10.1111/j.1539-6924.2010.01549.x . ISSN 1539-6924 . PMID 21175720 .  
  35. Jewson, Stephen; Sweeting, Trevor; Jewson, Lynne (2025-02-20). "Reducción del sesgo de fiabilidad en las evaluaciones del riesgo de fenómenos meteorológicos extremos mediante la calibración de priors" . Avances en Climatología Estadística, Meteorología y Oceanografía . 11 (1): 1– 22. Bibcode : 2025ASCMO..11....1J . doi : 10.5194/ascmo-11-1-2025 . ISSN 2364-3579 . 
  36. Fletcher, R. (1987). Métodos prácticos de optimización (Segunda edición). Nueva York, NY: John Wiley & Sons. ISBN  0-471-91547-5.
  37. Nocedal, Jorge ; Wright, Stephen J. (2006). Optimización numérica (Segunda edición). Nueva York, NY: Springer. ISBN  0-387-30303-0.
  38. Daganzo, Carlos (1979). Probit multinomial: La teoría y su aplicación a la previsión de la demanda . Nueva York: Academic Press. pp. 61–78 . ISBN  0-12-201150-3.
  39. Gould, William; Pitblado, Jeffrey; Poi, Brian (2010). Estimación de máxima verosimilitud con Stata (Cuarta ed.). College Station: Stata Press. págs. 13–20 . ISBN   978-1-59718-078-8.
  40. Murphy, Kevin P. (2012). Aprendizaje automático: una perspectiva probabilística . Cambridge: MIT Press. pág. 247. ISBN  978-0-262-01802-9.
  41. Amemiya, Takeshi (1985). Econometría avanzada . Cambridge: Harvard University Press. págs. 137–138 . ISBN  0-674-00560-0.
  42. Sargan, Denis (1988). «Métodos de optimización numérica». Apuntes de clase sobre teoría econométrica avanzada . Oxford: Basil Blackwell. pp. 161–169 . ISBN  0-631-14956-2.
  43. Véase el teorema 10.1 en Avriel, Mordecai (1976). Programación no lineal: análisis y métodos . Englewood Cliffs, NJ: Prentice-Hall. págs. 293–294 . ISBN  978-0-486-43227-4.
  44. Gill, Philip E.; Murray, Walter; Wright, Margaret H. (1981). Optimización práctica . Londres, Reino Unido: Academic Press. págs. 312-313 . ISBN  0-12-283950-1.
  45. Edgeworth, Francis Y. (septiembre de 1908). "Sobre los errores probables de las constantes de frecuencia" . Journal of the Royal Statistical Society . 71 (3): 499– 512. doi : 10.2307/2339293 . JSTOR 2339293 . 
  46. Edgeworth, Francis Y. (dic. 1908). "Sobre los errores probables de las constantes de frecuencia" . Journal of the Royal Statistical Society . 71 (4): 651– 678. doi : 10.2307/2339378 . JSTOR 2339378 . 
  47. Pfanzagl, Johann (1994). Teoría estadística paramétrica . Walter de Gruyter . págs. 207– 208. doi : 10.1515/9783110889765 . ISBN  978-3-11-013863-4. MR 1291393 . 
  48. Hald, Anders (1999). "Sobre la historia de la máxima verosimilitud en relación con la probabilidad inversa y los mínimos cuadrados" . Statistical Science . 14 (2): 214– 222. doi : 10.1214/ss/1009212248 . ISSN 0883-4237 . JSTOR 2676741 .  
  49. Wilks, SS (1938). "La distribución de muestras grandes de la razón de verosimilitud para probar hipótesis compuestas" . Annals of Mathematical Statistics . 9 : 60–62 . doi : 10.1214/aoms/1177732360 .
  50. Owen, Art B. (2001). Probabilidad empírica . Londres, Reino Unido; Boca Ratón, Florida: Chapman & Hall; CRC Press. ISBN 978-1-58488-071-4.
  51. Wilks, Samuel S. (1962). Estadística matemática . Nueva York, NY: John Wiley & Sons. ISBN 978-0-471-94650-2.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  52. Savage, Leonard J. (1976). "Sobre la relectura de RA Fisher" . The Annals of Statistics . 4 (3): 441– 500. doi : 10.1214/aos/1176343456 . JSTOR 2958221 . 
  53. Pratt, John W. (1976). "FY Edgeworth y RA Fisher sobre la eficiencia de la estimación de máxima verosimilitud" . The Annals of Statistics . 4 (3): 501– 514. doi : 10.1214/aos/1176343457 . JSTOR 2958222 . 
  54. Stigler, Stephen M. (1978). "Francis Ysidro Edgeworth, estadístico". Journal of the Royal Statistical Society, Serie A. 141 ( 3): 287– 322. doi : 10.2307/2344804 . JSTOR 2344804 . 
  55. Stigler, Stephen M. (1986). Historia de la estadística: la medición de la incertidumbre antes de 1900. Harvard University Press. ISBN 978-0-674-40340-6.
  56. Stigler, Stephen M. (1999). Statistics on the table: the history of statistical concepts and methods . Harvard University Press. ISBN 978-0-674-83601-3.
  57. Hald, Anders (1998). Historia de la estadística matemática desde 1750 hasta 1930. Nueva York, NY: Wiley. ISBN 978-0-471-17912-2.
  58. Hald, Anders (1999). "Sobre la historia de la máxima verosimilitud en relación con la probabilidad inversa y los mínimos cuadrados" . Statistical Science . 14 (2): 214– 222. doi : 10.1214/ss/1009212248 . JSTOR 2676741 . 
  59. Aldrich, John (1997). "RA Fisher y la creación de la máxima verosimilitud 1912–1922" . Statistical Science . 12 (3): 162– 176. doi : 10.1214/ss/1030037906 . MR 1617519 . 

Lecturas adicionales

  • Cramer, JS (1986). Aplicaciones econométricas de los métodos de máxima verosimilitud . Nueva York, NY: Cambridge University Press. ISBN 0-521-25317-9.
  • Eliason, Scott R. (1993). Estimación de máxima verosimilitud: lógica y práctica . Newbury Park: Sage. ISBN 0-8039-4107-2.
  • King, Gary (1989). Metodología política unificadora: la teoría de la verosimilitud de la inferencia estadística . Cambridge University Press. ISBN 0-521-36697-6.
  • Le Cam, Lucien (1990). "Máxima verosimilitud: una introducción". ISI Review . 58 (2): 153– 171. doi : 10.2307/1403464 . JSTOR 1403464 . 
  • Magnus, Jan R. (2017). «Máxima verosimilitud». Introducción a la teoría de la econometría . Ámsterdam, Países Bajos: VU University Press. pp. 53–68 . ISBN  978-90-8659-766-6.
  • Millar, Russell B. (2011). Estimación e inferencia de máxima verosimilitud . Hoboken, NJ: Wiley. ISBN 978-0-470-09482-2.
  • Pickles, Andrew (1986). Introducción al análisis de verosimilitud . Norwich: WH Hutchins & Sons. ISBN 0-86094-190-6.
  • Severini, Thomas A. (2000). Métodos de verosimilitud en estadística . Nueva York, NY: Oxford University Press. ISBN 0-19-850650-3.
  • Ward, Michael D.; Ahlquist, John S. (2018). Máxima verosimilitud para las ciencias sociales: estrategias de análisis . Cambridge University Press. ISBN 978-1-316-63682-4.
  • Tilevik, Andreas (2022). Máxima verosimilitud frente a mínimos cuadrados en regresión lineal (vídeo)
  • "Método de máxima verosimilitud" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
  • Purcell, S. "Estimación de máxima verosimilitud" . Archivado del original el 27 de octubre de 2019. Consultado el 24 de abril de 2007 .
  • Sargent, Thomas ; Stachurski, John. "Estimación de máxima verosimilitud" . Economía cuantitativa con Python .
  • Toomet, Ott; Henningsen, Arne (19 de mayo de 2019). "maxLik: un paquete para estimación de máxima verosimilitud en R" .
  • Lesser, Lawrence M. (2007) .Letra de la canción 'MLE' . Ciencias Matemáticas / Facultad de Ciencias. Universidad de Texas . El Paso, TX . Consultado el 6 de marzo de 2021 .