En estadística , la estimación de máxima verosimilitud ( EMV ) es un método para estimar los parámetros de una distribución de probabilidad supuesta , dados algunos datos observados. Esto se logra maximizando una función de verosimilitud de modo que, bajo el modelo estadístico supuesto , los datos observados sean lo más probables posible. El punto en el espacio de parámetros que maximiza la función de verosimilitud se denomina estimación de máxima verosimilitud. [ 1 ] La lógica de la máxima verosimilitud es intuitiva y flexible, y por ello el método se ha convertido en un medio dominante de inferencia estadística . [ 2 ] [ 3 ] [ 4 ]
Si la función de verosimilitud es diferenciable , se puede aplicar la prueba de la derivada para encontrar máximos. En algunos casos, las condiciones de primer orden de la función de verosimilitud se pueden resolver analíticamente; por ejemplo, el estimador de mínimos cuadrados ordinarios para un modelo de regresión lineal maximiza la verosimilitud cuando se supone que los errores aleatorios tienen distribuciones normales con la misma varianza. [ 5 ]
Desde la perspectiva de la inferencia bayesiana , la estimación de máxima verosimilitud ( EMV) es generalmente equivalente a la estimación de máxima probabilidad a posteriori (MAP) con una distribución a priori uniforme en la región de interés. En la inferencia frecuentista , la EMV es un caso especial de estimador de extremos , donde la función objetivo es la verosimilitud.
Principios
Modelamos un conjunto de observaciones como una muestra aleatoria de una distribución de probabilidad conjunta desconocida , expresada en términos de un conjunto de parámetros . El objetivo de la estimación de máxima verosimilitud es determinar los parámetros para los cuales los datos observados tienen la mayor probabilidad conjunta. Escribimos los parámetros que rigen la distribución conjunta como un vector.de modo que esta distribución se encuentre dentro de una familia paramétricadóndese denomina espacio de parámetros , un subconjunto de dimensión finita del espacio euclidiano . Evaluar la densidad conjunta en la muestra de datos observadada una función de valor real, ;\mathbf {y} )=f_{n}(\mathbf {y} ;\theta )\;,} que se llama función de verosimilitud . Para variables aleatorias independientes , ;\theta )} será el producto de funciones de densidad univariadas : ;\theta )=\prod _{k=1}^{n}\,f_{k}^{\mathsf {univar}}(y_{k};\theta )~.}
El objetivo de la estimación de máxima verosimilitud es encontrar los valores de los parámetros del modelo que maximicen la función de verosimilitud sobre el espacio de parámetros, [ 6 ] es decir:
Intuitivamente, esto selecciona los valores de los parámetros que hacen que los datos observados sean más probables. El valor específicoque maximiza la función de verosimilitudse denomina estimación de máxima verosimilitud. Además, si la funciónSi se define de esta manera y es medible , entonces se denomina estimador de máxima verosimilitud . Generalmente es una función definida sobre el espacio muestral , es decir, tomando una muestra dada como argumento. Una condición suficiente, pero no necesaria, para su existencia es que la función de verosimilitud sea continua sobre un espacio de parámetros.que es compacto . [ 7 ] Para un abiertoLa función de verosimilitud puede aumentar sin llegar nunca a alcanzar un valor supremo.
En la práctica, suele ser conveniente trabajar con el logaritmo natural de la función de verosimilitud, denominado log-verosimilitud : Dado que el logaritmo es una función monótona , el máximo deocurre con el mismo valor decomo lo hace el máximo de[ 8 ] Sies diferenciable enLas condiciones necesarias para que se produzca un máximo (o un mínimo) son: conocidas como ecuaciones de verosimilitud. Para algunos modelos, estas ecuaciones se pueden resolver explícitamente parapero en general no se conoce ni está disponible una solución de forma cerrada para el problema de maximización, y un MLE solo se puede encontrar mediante optimización numérica . Otro problema es que en muestras finitas, puede haber múltiples raíces para las ecuaciones de verosimilitud. [ 9 ] Si la raíz identificadade las ecuaciones de verosimilitud es de hecho un máximo (local) depende de si la matriz de derivadas parciales y cruzadas de segundo orden, la llamada matriz hessiana
es semidefinido negativo en, ya que esto indica concavidad local . Convenientemente, la mayoría de las distribuciones de probabilidad comunes , en particular la familia exponencial , son logarítmicamente cóncavas . [ 10 ] [ 11 ]
Espacio de parámetros restringido
Si bien el dominio de la función de verosimilitud —el espacio de parámetros— es generalmente un subconjunto de dimensión finita del espacio euclidiano , a veces es necesario incorporar restricciones adicionales al proceso de estimación. El espacio de parámetros se puede expresar como :\theta \in \mathbb {R} ^{k},\;h(\theta )=0\right\}~,}
dóndees una función vectorial que realiza una asignación .enEstimación del parámetro verdaderoperteneciente aEntonces, en la práctica, significa encontrar el máximo de la función de verosimilitud sujeto a la restricción.
Teóricamente, el enfoque más natural para este problema de optimización con restricciones es el método de sustitución, es decir, "completar" las restricciones.a un conjuntode tal manera quees una función uno a uno dea sí mismo, y reparametrizar la función de verosimilitud estableciendo[ 12 ] Debido a la equivariancia del estimador de máxima verosimilitud, las propiedades del MLE también se aplican a las estimaciones restringidas. [ 13 ] Por ejemplo, en unadistribución normal multivariada,lamatriz de covarianzadebe ser definida positiva ; esta restricción puede imponerse reemplazandodóndees una matriz triangular superior real yes su transpuesta . [ 14 ]
En la práctica, las restricciones se suelen imponer utilizando el método de Lagrange que, dadas las restricciones definidas anteriormente, conduce a las ecuaciones de verosimilitud restringida.y
dóndees un vector columna de multiplicadores de Lagrange yes la matriz jacobiana k × r de derivadas parciales. [ 12 ] Naturalmente, si las restricciones no son vinculantes en el máximo, los multiplicadores de Lagrange deberían ser cero. [ 15 ] Esto a su vez permite una prueba estadística de la "validez" de la restricción, conocida como la prueba del multiplicador de Lagrange .
Estimación de máxima verosimilitud no paramétrica
La estimación de máxima verosimilitud no paramétrica se puede realizar utilizando la verosimilitud empírica .
Método de apoyo
El método de soporte es una técnica que se utiliza para realizar inferencias a partir de conjuntos de datos. Según AWF Edwards [ 16 ], este método busca realizar inferencias sobre parámetros desconocidos en función del soporte relativo, o log- verosimilitud , que proporciona un conjunto de datos para un valor de parámetro específico. La técnica puede utilizarse independientemente de si se dispone de información previa. El método de máxima verosimilitud forma parte del método de soporte, pero cabe destacar que este último también proporciona regiones de confianza definidas en función de su soporte.
Propiedades
Un estimador de máxima verosimilitud es un estimador de extremo que se obtiene maximizando, en función de θ , la función objetivo.Si los datos son independientes e idénticamente distribuidos , entonces tenemos este es el análogo de muestra de la log-verosimilitud esperadadonde esta expectativa se toma con respecto a la densidad real.
Los estimadores de máxima verosimilitud no tienen propiedades óptimas para muestras finitas, en el sentido de que (cuando se evalúan en muestras finitas) otros estimadores pueden tener una mayor concentración alrededor del verdadero valor del parámetro. [ 17 ] Sin embargo, al igual que otros métodos de estimación, la estimación de máxima verosimilitud posee una serie de propiedades límite atractivas : a medida que el tamaño de la muestra aumenta hasta el infinito, las secuencias de estimadores de máxima verosimilitud tienen estas propiedades:
- Consistencia : la secuencia de estimadores de máxima verosimilitud converge en probabilidad al valor que se está estimando.
- Equivariancia : Sies el estimador de máxima verosimilitud paray sies una transformación biyectiva de, entonces el estimador de máxima verosimilitud paraesLa propiedad de equivariancia puede generalizarse a transformaciones no biyectivas, aunque en ese caso se aplica al máximo de una función de verosimilitud inducida que no es la verdadera verosimilitud en general.
- Eficiencia , es decir, alcanza el límite inferior de Cramér-Rao cuando el tamaño de la muestra tiende a infinito. Esto significa que ningún estimador consistente tiene un error cuadrático medio asintótico menor que el MLE (u otros estimadores que alcanzan este límite), lo que también significa que el MLE tiene normalidad asintótica .
- Eficiencia de segundo orden tras la corrección del sesgo.
Consistencia
Bajo las condiciones descritas a continuación, el estimador de máxima verosimilitud es consistente . La consistencia significa que si los datos fueron generados pory tenemos un número suficientemente grande de observaciones n , entonces es posible encontrar el valor de θ 0 con precisión arbitraria. En términos matemáticos, esto significa que cuando n tiende a infinito, el estimadorconverge en probabilidad a su valor verdadero:
En condiciones ligeramente más estrictas, el estimador converge casi con seguridad (o fuertemente ):
En aplicaciones prácticas, los datos nunca se generan por. Bastante,Un modelo, a menudo idealizado, representa el proceso generado por los datos. En estadística, es un aforismo común que todos los modelos son erróneos . Por lo tanto, la consistencia verdadera no se da en las aplicaciones prácticas. Sin embargo, la consistencia suele considerarse una propiedad deseable para un estimador.
Para establecer la consistencia, las siguientes condiciones son suficientes. [ 18 ]
- Identificación del modelo: En otras palabras, diferentes valores del parámetro θ corresponden a diferentes distribuciones dentro del modelo. Si esta condición no se cumpliera, habría algún valor θ 1 tal que θ 0 y θ 1 generarían una distribución idéntica de los datos observables. Entonces no podríamos distinguir entre estos dos parámetros incluso con una cantidad infinita de datos; estos parámetros habrían sido observacionalmente equivalentes . La condición de identificación es absolutamente necesaria para que el estimador ML sea consistente. Cuando esta condición se cumple, la función de verosimilitud límite ℓ ( θ |·) tiene un máximo global único en θ 0 .
- Compacidad: el espacio de parámetros Θ del modelo es compacto .

La condición de identificación establece que la log-verosimilitud tiene un máximo global único. La compacidad implica que la verosimilitud no puede aproximarse arbitrariamente al valor máximo en algún otro punto (como se muestra, por ejemplo, en la imagen de la derecha).
La compacidad es solo una condición suficiente y no una condición necesaria. La compacidad puede ser reemplazada por otras condiciones, tales como:
- tanto la concavidad de la función de verosimilitud logarítmica como la compacidad de algunos conjuntos de nivel superior (no vacíos) de la función de verosimilitud logarítmica, o
- existencia de un entorno compacto N de θ 0 tal que fuera de N la función de verosimilitud logarítmica sea menor que el máximo en al menos algún ε > 0 .
- Continuidad: la función ln f ( x | θ ) es continua en θ para casi todos los valores de x : La continuidad en este caso puede sustituirse por una condición ligeramente más débil de semicontinuidad superior .
- Dominancia: existe D ( x ) integrable con respecto a la distribución f ( x | θ 0 ) tal que Por la ley uniforme de los grandes números , la condición de dominancia junto con la continuidad establecen la convergencia uniforme en probabilidad de la log-verosimilitud:
La condición de dominancia puede emplearse en el caso de observaciones i.i.d. En el caso no i.i.d., la convergencia uniforme en probabilidad puede comprobarse demostrando que la secuenciaes estocásticamente equicontinua .
Si uno quiere demostrar que el estimador MLSi converge a θ 0 casi con seguridad , entonces debe imponerse una condición más fuerte de convergencia uniforme casi con seguridad:
Además, si (como se supuso anteriormente) los datos fueron generados por, entonces, bajo ciertas condiciones, también se puede demostrar que el estimador de máxima verosimilitud converge en distribución a una distribución normal. Específicamente, [ 19 ] donde I es la matriz de información de Fisher .
Invariancia funcional
El estimador de máxima verosimilitud selecciona el valor del parámetro que otorga a los datos observados la mayor probabilidad posible (o densidad de probabilidad, en el caso continuo). Si el parámetro consta de varios componentes, definimos sus estimadores de máxima verosimilitud separados como el componente correspondiente del MLE del parámetro completo. De acuerdo con esto, sies el MLE paray sies cualquier transformación de, entonces el MLE paraes por definición [ 20 ]
Maximiza la denominada probabilidad de perfil :
:\alpha =g(\theta )}L(\theta ).\,}
El MLE también es equivariante con respecto a ciertas transformaciones de los datos. Sidóndees uno a uno y no depende de los parámetros a estimar, entonces las funciones de densidad satisfacen
y por lo tanto las funciones de probabilidad paraySe diferencian únicamente por un factor que no depende de los parámetros del modelo.
Por ejemplo, los parámetros MLE de la distribución log-normal son los mismos que los de la distribución normal ajustada al logaritmo de los datos. De hecho, en el caso log-normal si, entoncessigue una distribución lognormal . La densidad de Y sigue conestándar Normal y,para.
Eficiencia
Como se supuso anteriormente, si los datos fueron generados porEntonces, bajo ciertas condiciones, también se puede demostrar que el estimador de máxima verosimilitud converge en distribución a una distribución normal. Es √ n -consistente y asintóticamente eficiente, lo que significa que alcanza la cota de Cramér-Rao . Específicamente, [ 19 ]
dóndees la matriz de información de Fisher :
En particular, significa que el sesgo del estimador de máxima verosimilitud es igual a cero hasta el orden 1 / √ n .
Eficiencia de segundo orden tras la corrección del sesgo
Sin embargo, cuando consideramos los términos de orden superior en la expansión de la distribución de este estimador, resulta que θ mle tiene un sesgo de orden 1 ⁄ n . Este sesgo es igual a (componente por componente) [ 21 ]
dónde(con superíndices) denota el componente ( j,k ) de la matriz de información de Fisher inversa., y
Utilizando estas fórmulas es posible estimar el sesgo de segundo orden del estimador de máxima verosimilitud y corregir dicho sesgo restándolo: Este estimador es insesgado hasta los términos de orden 1 / n , y se denomina estimador de máxima verosimilitud corregido por sesgo .
Este estimador corregido por sesgo es eficiente de segundo orden (al menos dentro de la familia exponencial curva), lo que significa que tiene un error cuadrático medio mínimo entre todos los estimadores corregidos por sesgo de segundo orden, hasta los términos del orden 1 / n 2 . Es posible continuar este proceso, es decir , derivar el término de corrección de sesgo de tercer orden, y así sucesivamente. Sin embargo, el estimador de máxima verosimilitud no es eficiente de tercer orden. [ 22 ]
Relación con la inferencia bayesiana
Un estimador de máxima verosimilitud coincide con el estimador bayesiano más probable dada una distribución a priori uniforme sobre los parámetros . De hecho, la estimación a posteriori máxima es el parámetro θ que maximiza la probabilidad de θ dados los datos, según el teorema de Bayes:
dóndees la distribución previa para el parámetro θ y dondees la probabilidad de los datos promediada sobre todos los parámetros. Dado que el denominador es independiente de θ , el estimador bayesiano se obtiene maximizandocon respecto a θ . Si además asumimos que el anteriores una distribución uniforme, el estimador bayesiano se obtiene maximizando la función de verosimilitudPor lo tanto, el estimador bayesiano coincide con el estimador de máxima verosimilitud para una distribución a priori uniforme..
Aplicación de la estimación de máxima verosimilitud en la teoría de la decisión bayesiana.
En muchas aplicaciones prácticas del aprendizaje automático , la estimación de máxima verosimilitud se utiliza como modelo para la estimación de parámetros.
La teoría de la decisión bayesiana se centra en diseñar un clasificador que minimice el riesgo total esperado, especialmente cuando los costos (la función de pérdida) asociados a las diferentes decisiones son iguales; el clasificador minimiza el error en toda la distribución. [ 23 ]
Por lo tanto, la regla de decisión de Bayes se enuncia como
- "decidirsiDe lo contrario, decide"
dóndeson predicciones de diferentes clases. Desde la perspectiva de minimizar el error, también se puede afirmar como dónde si decidimosysi decidimos
Aplicando el teorema de Bayes y si además asumimos la función de pérdida cero o uno, que es la misma pérdida para todos los errores, la regla de decisión de Bayes se puede reformular como: dóndees la predicción yes la probabilidad previa .
Relación con la minimización de la divergencia de Kullback-Leibler y la entropía cruzada
Descubrimientoque maximiza la probabilidad es asintóticamente equivalente a encontrar laque define una distribución de probabilidad () que tiene una distancia mínima, en términos de divergencia de Kullback-Leibler , a la distribución de probabilidad real a partir de la cual se generaron nuestros datos (es decir, generados por). [ 24 ] En un mundo ideal, P y Q son lo mismo (y lo único desconocido esque define P), pero incluso si no lo son y el modelo que usamos está mal especificado, el MLE aún nos dará la distribución "más cercana" (dentro de la restricción de un modelo Q que depende de) a la distribución real. [ 25 ]
Sesgo de predicción
Las estimaciones de máxima verosimilitud de los parámetros pueden sustituirse en expresiones para la función de densidad de probabilidad , la función de distribución acumulativa o la función cuantil , para generar predicciones de probabilidades o cuantiles de eventos fuera de la muestra. Este método para predecir probabilidades se recomienda en libros de texto de estadística [ 27 ] [ 28 ] [ 29 ] y libros de texto actuariales, [ 30 ] y se utiliza ampliamente en la literatura científica. Sin embargo, la predicción de máxima verosimilitud no propaga la incertidumbre alrededor de las estimaciones de parámetros de máxima verosimilitud en la predicción. [ 31 ] [ 32 ] Como resultado, las probabilidades predichas no están bien calibradas y no se debe esperar que correspondan a las frecuencias de eventos fuera de la muestra. En particular, las probabilidades de excedencia de cola y los cuantiles de excedencia de cola suelen subestimarse, a veces drásticamente. La subestimación es mayor cuando hay pocos datos de entrenamiento, se estiman muchos parámetros y para la cola lejana. En los casos en que este sesgo de predicción sea un problema, las predicciones bayesianas pueden proporcionar una solución si la distribución a priori se elige de manera que se reduzca o elimine el sesgo. [ 33 ] [ 34 ] [ 35 ]
Ejemplos
Distribución uniforme discreta
Consideremos un caso en el que se colocan n boletos numerados del 1 al n en una caja y se selecciona uno al azar ( véase distribución uniforme ); por lo tanto, el tamaño de la muestra es 1. Si n es desconocido, entonces el estimador de máxima verosimilitudde n es el número m en el boleto sorteado. (La probabilidad es 0 para n < m , 1 / n para n ≥ m , y es máxima cuando n = m . Nótese que la estimación de máxima probabilidad de n se produce en el extremo inferior de los valores posibles { m , m + 1, ...}, en lugar de en algún punto intermedio del rango de valores posibles, lo que resultaría en un menor sesgo). El valor esperado del número m en el boleto sorteado y, por lo tanto, el valor esperado de , es ( n + 1)/2. Como resultado, con un tamaño de muestra de 1, el estimador de máxima verosimilitud para n subestimará sistemáticamente n en ( n − 1)/2.
Distribución discreta, espacio de parámetros finito
Supongamos que uno desea determinar cuán sesgada es una moneda injusta . Llamemos p a la probabilidad de lanzar una ' cara ' . El objetivo entonces es determinar p .
Supongamos que se lanza la moneda 80 veces: es decir, la muestra podría ser algo como x 1 = H, x 2 = T, ..., x 80 = T, y se observa el número de caras "H".
La probabilidad de obtener cruz es 1 − p (donde p es θ ). Supongamos que el resultado es 49 caras y 31 cruces , y que la moneda se extrajo de una caja que contiene tres monedas: una que da cara con probabilidad p = 1/3 , otra que da cara con probabilidad p = 1/2 y otra que da cara con probabilidad p = 2/3 . Las monedas han perdido sus etiquetas, por lo que se desconoce cuál era. Mediante la estimación de máxima verosimilitud, se puede encontrar la moneda con la mayor probabilidad, dados los datos observados. Utilizando la función de probabilidad de la distribución binomial con un tamaño de muestra de 80 y un número de éxitos de 49, pero para diferentes valores de p (la "probabilidad de éxito"), la función de verosimilitud (definida a continuación) toma uno de tres valores:
La probabilidad se maximiza cuando p = 2 / 3 , por lo que esta es la estimación de máxima verosimilitud para p .
Distribución discreta, espacio de parámetros continuo
Ahora supongamos que solo hubiera una moneda, pero su valor p podría ser cualquier valor 0 ≤ p ≤ 1. La función de verosimilitud que se debe maximizar es
y la maximización se realiza sobre todos los valores posibles 0 ≤ p ≤ 1 .

Una forma de maximizar esta función es derivando con respecto a p e igualando a cero:
Este es un producto de tres términos. El primer término es 0 cuando p = 0. El segundo es 0 cuando p = 1. El tercero es cero cuando p = 49 / 80. La solución que maximiza la verosimilitud es claramente p = 49 / 80 (ya que p = 0 y p = 1 dan como resultado una verosimilitud de 0). Por lo tanto, el estimador de máxima verosimilitud para p es 49 / 80 .
Este resultado se generaliza fácilmente sustituyendo el número 49 por una letra como la "s" para representar el número observado de "éxitos" en nuestros ensayos de Bernoulli , y el número 80 por una letra como la "n" para representar el número de ensayos de Bernoulli. El mismo cálculo da como resultado s / n, que es el estimador de máxima verosimilitud para cualquier secuencia de n ensayos de Bernoulli que resulten en s "éxitos".
Distribución continua, espacio de parámetros continuo
Para la distribución normalque tiene función de densidad de probabilidad
La función de densidad de probabilidad correspondiente para una muestra de n variables aleatorias normales independientes e idénticamente distribuidas (la verosimilitud) es
Esta familia de distribuciones tiene dos parámetros: θ = ( μ , σ ) ; por lo tanto, maximizamos la verosimilitud,, sobre ambos parámetros simultáneamente o, si es posible, individualmente.
Dado que la función logaritmo es una función continua estrictamente creciente en el rango de la verosimilitud, los valores que maximizan la verosimilitud también maximizarán su logaritmo (la log-verosimilitud en sí misma no es necesariamente estrictamente creciente). La log-verosimilitud se puede escribir de la siguiente manera:
(Nota: la log-verosimilitud está estrechamente relacionada con la entropía de la información y la información de Fisher ).
Ahora calculamos las derivadas de esta log-verosimilitud de la siguiente manera.
dóndees la media muestral . Esto se resuelve mediante
Este es, en efecto, el máximo de la función, ya que es el único punto de inflexión en μ y la segunda derivada es estrictamente menor que cero. Su valor esperado es igual al parámetro μ de la distribución dada.
lo que significa que el estimador de máxima verosimilitudes imparcial.
De forma similar, diferenciamos la log-verosimilitud con respecto a σ y la igualamos a cero:
que se resuelve mediante
Insertar la estimaciónobtenemos
Para calcular su valor esperado, es conveniente reescribir la expresión en términos de variables aleatorias de media cero ( error estadístico ). Al expresar la estimación en estas variables se obtiene
Simplificando la expresión anterior, utilizando los hechos quey, nos permite obtener
Esto significa que el estimadorestá sesgado porTambién se puede demostrar queestá sesgado porpero que ambosyson consistentes.
Formalmente decimos que el estimador de máxima verosimilitud paraes
En este caso, los estimadores de máxima verosimilitud (EMV) podrían obtenerse individualmente. En general, esto no suele ser así, y los EMV tendrían que obtenerse simultáneamente.
La función de verosimilitud logarítmica normal, en su valor máximo, adopta una forma particularmente sencilla:
Se puede demostrar que esta máxima verosimilitud logarítmica es la misma para mínimos cuadrados más generales , incluso para mínimos cuadrados no lineales . Esto se utiliza a menudo para determinar intervalos de confianza y regiones de confianza aproximados basados en la verosimilitud , que generalmente son más precisos que los que utilizan la normalidad asintótica descrita anteriormente.
Variables no independientes
Puede darse el caso de que las variables estén correlacionadas o, más generalmente, no sean independientes. Dos variables aleatoriasyson independientes solo si su función de densidad de probabilidad conjunta es el producto de las funciones de densidad de probabilidad individuales, es decir
Supongamos que se construye un vector gaussiano de orden n a partir de variables aleatorias.donde cada variable tiene medias dadas porAdemás, sea la matriz de covarianza denotada porLa función de densidad de probabilidad conjunta de estas n variables aleatorias sigue entonces una distribución normal multivariada dada por:
En el caso bivariado , la función de densidad de probabilidad conjunta viene dada por:
En este y otros casos donde existe una función de densidad conjunta, la función de verosimilitud se define como se indicó anteriormente, en la sección " principios ", utilizando esta densidad.
Ejemplo
son recuentos en celdas / cajas 1 hasta m; cada caja tiene una probabilidad diferente (piensa en las cajas siendo más grandes o más pequeñas) y fijamos el número de bolas que caen a ser:. La probabilidad de cada caja es, con una restricción:. Este es un caso en el que els no son independientes, la probabilidad conjunta de un vectorSe llama multinomial y tiene la forma:
Cada caja tomada por separado en comparación con todas las demás cajas es un binomio y esto es una extensión del mismo.
La verosimilitud logarítmica de esto es:
Hay que tener en cuenta la restricción y utilizar los multiplicadores de Lagrange:
Al igualar todas las derivadas a cero, se obtiene la estimación más natural.
Maximizar la verosimilitud logarítmica, con y sin restricciones, puede ser un problema irresoluble en forma cerrada, por lo que debemos utilizar procedimientos iterativos.
Procedimientos iterativos
Excepto en casos especiales, las ecuaciones de verosimilitud ;\mathbf {y} )}{\partial \theta }}=0}
no se puede resolver explícitamente para un estimadorEn cambio, deben resolverse iterativamente : comenzando desde una suposición inicial de(decir), se busca obtener una secuencia convergenteExisten muchos métodos para este tipo de problema de optimización , [ 36 ] [ 37 ] pero los más utilizados son algoritmos basados en una fórmula de actualización de la forma
donde el vectorindica la dirección de descenso del r -ésimo "paso" y el escalarcaptura la "longitud del paso", [ 38 ] [ 39 ] también conocida como tasa de aprendizaje . [ 40 ]
método de descenso de gradiente
(Nota: aquí se trata de un problema de maximización, por lo que el signo que precede al gradiente está invertido).
que sea lo suficientemente pequeño para la convergencia y
El método de descenso de gradiente requiere calcular el gradiente en la iteración r , pero no necesita calcular la inversa de la derivada de segundo orden, es decir, la matriz hessiana. Por lo tanto, es computacionalmente más rápido que el método de Newton - Raphson.
y
dóndees la puntuación yes la inversa de la matriz hessiana de la función de log-verosimilitud, ambas evaluadas en la r -ésima iteración. [ 41 ] [ 42 ] Pero debido a que el cálculo de la matriz hessiana es computacionalmente costoso , se han propuesto numerosas alternativas. El popular algoritmo de Berndt-Hall-Hall-Hausman aproxima la hessiana con el producto exterior del gradiente esperado, de tal manera que
;\mathbf {y} )}{\partial \theta }}\left({\frac {\partial \ell (\theta ;\mathbf {y} )}{\partial \theta }}\right)^{\mathsf {T}}\right]^{-1}\mathbf {s} _{r}\left({\widehat {\theta }}\right)}
Otros métodos cuasi-Newton utilizan actualizaciones de secante más elaboradas para dar una aproximación de la matriz hessiana.
La fórmula DFP encuentra una solución que es simétrica, definida positiva y la más cercana al valor aproximado actual de la derivada de segundo orden:
dónde
BFGS también proporciona una solución simétrica y definida positiva:
dónde
El método BFGS no garantiza la convergencia a menos que la función tenga una expansión de Taylor cuadrática cerca de un óptimo. Sin embargo, BFGS puede ofrecer un rendimiento aceptable incluso para instancias de optimización no suaves.
Otro método popular es reemplazar el Hessiano con la matriz de información de Fisher ,, lo que nos da el algoritmo de puntuación de Fisher. Este procedimiento es estándar en la estimación de muchos métodos, como los modelos lineales generalizados .
Aunque populares, los métodos cuasi-Newton pueden converger a un punto estacionario que no necesariamente es un máximo local o global, [ 43 ] sino más bien un mínimo local o un punto de silla . Por lo tanto, es importante evaluar la validez de la solución obtenida para las ecuaciones de verosimilitud, verificando que la matriz hessiana, evaluada en la solución, sea definida negativa y esté bien condicionada . [ 44 ]
Historia
Entre los primeros usuarios del método de máxima verosimilitud se encuentran Carl Friedrich Gauss , Pierre-Simon Laplace , Thorvald N. Thiele y Francis Ysidro Edgeworth . [ 45 ] [ 46 ] Sin embargo, fue Ronald Fisher , entre 1912 y 1922, quien creó por sí solo la versión moderna del método. [ 47 ] [ 48 ]
La estimación de máxima verosimilitud finalmente trascendió la justificación heurística en una demostración publicada por Samuel S. Wilks en 1938, ahora conocida como el teorema de Wilks . [ 49 ] El teorema muestra que el error en el logaritmo de los valores de verosimilitud para estimaciones de múltiples observaciones independientes se distribuye asintóticamente según una distribución χ² , lo que permite determinar convenientemente una región de confianza alrededor de cualquier estimación de los parámetros. La única parte difícil de la demostración de Wilks depende del valor esperado de la matriz de información de Fisher , que viene dado por un teorema demostrado por Fisher. [ 50 ] Wilks continuó mejorando la generalidad del teorema a lo largo de su vida, publicando su demostración más general en 1962. [ 51 ]
Varios autores han realizado revisiones del desarrollo de la estimación de máxima verosimilitud. [ 52 ] [ 53 ] [ 54 ] [ 55 ] [ 56 ] [ 57 ] [ 58 ] [ 59 ]
Véase también
Conceptos relacionados
- Criterio de información de Akaike : un criterio para comparar modelos estadísticos, basado en la estimación de máxima verosimilitud (MLE).
- Estimador extremo : una clase más general de estimadores a la que pertenece el estimador de máxima verosimilitud (MLE).
- Información de Fisher : matriz de información, su relación con la matriz de covarianza de las estimaciones de máxima verosimilitud.
- Error cuadrático medio : una medida de cuán "bueno" es un estimador de un parámetro de distribución (ya sea el estimador de máxima verosimilitud u otro estimador).
- RANSAC : un método para estimar los parámetros de un modelo matemático a partir de datos que contienen valores atípicos.
- Teorema de Rao-Blackwell : proporciona un proceso para encontrar el mejor estimador insesgado posible (en el sentido de tener un error cuadrático medio mínimo ); el estimador de máxima verosimilitud suele ser un buen punto de partida para el proceso.
- Teorema de Wilks : proporciona un medio para estimar el tamaño y la forma de la región de estimaciones aproximadamente igualmente probables para los valores de los parámetros de la población, utilizando la información de una sola muestra, mediante una distribución chi-cuadrado.
Otros métodos de estimación
- Método generalizado de momentos : métodos relacionados con la ecuación de verosimilitud en la estimación de máxima verosimilitud.
- Estimador M : un enfoque utilizado en estadística robusta
- Estimador de máxima probabilidad a posteriori (MAP): para contrastar la forma de calcular los estimadores cuando se postula conocimiento previo.
- Estimación del espaciamiento máximo : un método relacionado que es más robusto en muchas situaciones.
- Estimación de máxima entropía
- Método de los momentos (estadística) : otro método popular para hallar parámetros de distribuciones.
- Método de soporte , una variación de la técnica de máxima verosimilitud.
- Estimación de distancia mínima
- Métodos de máxima verosimilitud parcial para datos de panel
- Estimador de cuasi máxima verosimilitud : un estimador MLE mal especificado, pero aún así consistente.
- Máxima verosimilitud restringida : una variación que utiliza una función de verosimilitud calculada a partir de un conjunto de datos transformados.
Referencias
- ↑ Rossi, Richard J. (2018). Estadística matemática: Una introducción a la inferencia basada en la verosimilitud . Nueva York: John Wiley & Sons. pág. 227. ISBN 978-1-118-77104-4.
- ↑ Hendry, David F. ; Nielsen, Bent (2007). Econometric Modeling: A Likelihood Approach . Princeton: Princeton University Press. ISBN 978-0-691-13128-3.
- ↑ Chambers, Raymond L.; Steel, David G.; Wang, Suojin; Welsh, Alan (2012). Estimación de máxima verosimilitud para encuestas por muestreo . Boca Raton: CRC Press. ISBN 978-1-58488-632-7.
- ↑ Ward, Michael Don ; Ahlquist, John S. (2018). Máxima verosimilitud para las ciencias sociales: estrategias de análisis . Nueva York: Cambridge University Press. ISBN 978-1-107-18582-1.
- ↑ Press, WH; Flannery, BP; Teukolsky, SA; Vetterling, WT (1992). «Mínimos cuadrados como estimador de máxima verosimilitud» . Numerical Recipes in FORTRAN: The Art of Scientific Computing (2.ª ed.). Cambridge: Cambridge University Press. pp. 651–655 . ISBN 0-521-43064-X.
- ↑ Myung, IJ (2003). "Tutorial sobre estimación de máxima verosimilitud". Journal of Mathematical Psychology . 47 (1): 90– 100. doi : 10.1016/S0022-2496(02)00028-7 .
- ↑ Gourieroux, Christian; Monfort, Alain (1995). Statistics and Econometrics Models . Cambridge University Press. p . 161. ISBN 0-521-40551-3.
- ↑ Kane, Edward J. (1968). Estadística económica y econometría . Nueva York, NY: Harper & Row. pág. 179 .
- ↑ Small, Christopher G.; Wang, Jinfang (2003). "Trabajando con raíces" . Métodos numéricos para la estimación de ecuaciones no lineales . Oxford University Press. págs. 74–124 . ISBN 0-19-850688-0.
- ↑ Kass, Robert E.; Vos, Paul W. (1997). Fundamentos geométricos de la inferencia asintótica . Nueva York, NY: John Wiley & Sons. pág. 14. ISBN 0-471-82668-5.
- ↑ Papadopoulos, Alecos (25 de septiembre de 2013). "¿Por qué siempre ponemos log() antes de la pdf conjunta cuando usamos MLE (Estimación de máxima verosimilitud)?" . Stack Exchange .
- 1 2 Silvey, SD (1975). Inferencia estadística . Londres, Reino Unido: Chapman and Hall. pág. 79. ISBN 0-412-13820-4.
- ↑ Olive, David (2004). "¿El MLE maximiza la verosimilitud?" (PDF) . Universidad del Sur de Illinois .
- ↑ Schwallie, Daniel P. (1985). "Estimadores de covarianza de máxima verosimilitud definidos positivos". Economics Letters . 17 ( 1– 2): 115– 117. doi : 10.1016/0165-1765(85)90139-9 .
- ↑ Magnus, Jan R. (2017). Introducción a la teoría de la econometría . Ámsterdam: VU University Press. pp. 64–65 . ISBN 978-90-8659-766-6.
- ↑ Edwards, AWF 1972. Probabilidad. Cambridge University Press, Cambridge (edición ampliada, 1992, Johns Hopkins University Press, Baltimore). ISBN 0-8018-4443-6
- ↑ Pfanzagl (1994 , pág. 206)
- ↑ Según el Teorema 2.5 en Newey, Whitney K.; McFadden, Daniel (1994). «Capítulo 36: Estimación de muestras grandes y prueba de hipótesis». En Engle, Robert; McFadden, Dan (eds.). Manual de Econometría, Vol. 4. Elsevier Science. pp. 2111–2245 . ISBN 978-0-444-88766-5.
- 1 2 Según el Teorema 3.3 en Newey, Whitney K.; McFadden, Daniel (1994). «Capítulo 36: Estimación de muestras grandes y prueba de hipótesis». En Engle, Robert; McFadden, Dan (eds.). Manual de Econometría, Vol. 4. Elsevier Science. págs. 2111–2245 . ISBN 978-0-444-88766-5.
- ↑ Zacks, Shelemyahu (1971). La teoría de la inferencia estadística . Nueva York: John Wiley & Sons. pág. 223. ISBN 0-471-98103-6.
- ↑ Véase la fórmula 20 en Cox, David R.; Snell , E. Joyce (1968). "Una definición general de residuos". Journal of the Royal Statistical Society, Serie B. 30 ( 2): 248–275 . doi : 10.1111/j.2517-6161.1968.tb00724.x . JSTOR 2984505 .
- ↑ Kano, Yutaka (1996). "La eficiencia de tercer orden implica la eficiencia de cuarto orden" . Journal of the Japan Statistical Society . 26 : 101–117 . doi : 10.14490/jjss1995.26.101 .
- ↑ Christensen, Henrikt I. "Reconocimiento de patrones" (PDF) (conferencia). Teoría de la decisión bayesiana - CS 7616. Georgia Tech.
- ↑ cmplx96 ( https://stats.stackexchange.com/users/177679/cmplx96 ), divergencia de Kullback-Leibler, URL (versión: 18-11-2017): https://stats.stackexchange.com/q/314472 (en el vídeo de YouTube, ver de los minutos 13 al 25)
- ↑ Introducción a la inferencia estadística | Stanford (Clase 16 — Estimación de máxima verosimilitud bajo especificación incorrecta del modelo)
- ↑ Sycorax dice Reinstate Monica ( https://stats.stackexchange.com/users/22311/sycorax-says-reinstate-monica ), la relación entre maximizar la probabilidad y minimizar la entropía cruzada, URL (versión: 2019-11-06): https://stats.stackexchange.com/q/364237
- ↑ Coles, Stuart (2001). Introducción al modelado estadístico de valores extremos . Springer Series in Statistics. doi : 10.1007/978-1-4471-3675-0 . ISBN 978-1-84996-874-4ISSN 0172-7397
- ↑ Análisis estadístico de valores extremos . 2007. doi : 10.1007/978-3-7643-7399-3 . ISBN 978-3-7643-7230-9.
- ↑ Embrechts, Paul; Klüppelberg, Claudia; Mikosch, Thomas (1997). Modelado de eventos extremos . doi : 10.1007/978-3-642-33483-2 . ISBN 978-3-642-08242-9.
- ↑ Modelos de pérdida . Serie Wiley en Probabilidad y Estadística. 2013. doi : 10.1002/9781118787106 . ISBN 978-1-118-34356-2.
- ↑ Gerrard, R.; Tsanakas, A. (2011). "Probabilidad de falla bajo incertidumbre de parámetros" . Risk Analysis . 31 (5): 727– 744. Bibcode : 2011RiskA..31..727G . doi : 10.1111/j.1539-6924.2010.01549.x . ISSN 1539-6924 . PMID 21175720 .
- ↑ Jewson, Stephen; Sweeting, Trevor; Jewson, Lynne (2025-02-20). "Reducción del sesgo de fiabilidad en las evaluaciones del riesgo de fenómenos meteorológicos extremos mediante la calibración de priors" . Avances en Climatología Estadística, Meteorología y Oceanografía . 11 (1): 1– 22. Bibcode : 2025ASCMO..11....1J . doi : 10.5194/ascmo-11-1-2025 . ISSN 2364-3579 .
- ↑ Severini, Thomas A.; Mukerjee, Rahul; Ghosh, Malay (2002-12-01). "Sobre una propiedad de coincidencia de probabilidad exacta de priors invariantes a la derecha" . Biometrika . 89 (4): 952– 957. doi : 10.1093/biomet/89.4.952 . ISSN 0006-3444 .
- ↑ Gerrard, R.; Tsanakas, A. (2011). "Probabilidad de falla bajo incertidumbre de parámetros" . Risk Analysis . 31 (5): 727– 744. Bibcode : 2011RiskA..31..727G . doi : 10.1111/j.1539-6924.2010.01549.x . ISSN 1539-6924 . PMID 21175720 .
- ↑ Jewson, Stephen; Sweeting, Trevor; Jewson, Lynne (2025-02-20). "Reducción del sesgo de fiabilidad en las evaluaciones del riesgo de fenómenos meteorológicos extremos mediante la calibración de priors" . Avances en Climatología Estadística, Meteorología y Oceanografía . 11 (1): 1– 22. Bibcode : 2025ASCMO..11....1J . doi : 10.5194/ascmo-11-1-2025 . ISSN 2364-3579 .
- ↑ Fletcher, R. (1987). Métodos prácticos de optimización (Segunda edición). Nueva York, NY: John Wiley & Sons. ISBN 0-471-91547-5.
- ↑ Nocedal, Jorge ; Wright, Stephen J. (2006). Optimización numérica (Segunda edición). Nueva York, NY: Springer. ISBN 0-387-30303-0.
- ↑ Daganzo, Carlos (1979). Probit multinomial: La teoría y su aplicación a la previsión de la demanda . Nueva York: Academic Press. pp. 61–78 . ISBN 0-12-201150-3.
- ↑ Gould, William; Pitblado, Jeffrey; Poi, Brian (2010). Estimación de máxima verosimilitud con Stata (Cuarta ed.). College Station: Stata Press. págs. 13–20 . ISBN 978-1-59718-078-8.
- ↑ Murphy, Kevin P. (2012). Aprendizaje automático: una perspectiva probabilística . Cambridge: MIT Press. pág. 247. ISBN 978-0-262-01802-9.
- ↑ Amemiya, Takeshi (1985). Econometría avanzada . Cambridge: Harvard University Press. págs. 137–138 . ISBN 0-674-00560-0.
- ↑ Sargan, Denis (1988). «Métodos de optimización numérica». Apuntes de clase sobre teoría econométrica avanzada . Oxford: Basil Blackwell. pp. 161–169 . ISBN 0-631-14956-2.
- ↑ Véase el teorema 10.1 en Avriel, Mordecai (1976). Programación no lineal: análisis y métodos . Englewood Cliffs, NJ: Prentice-Hall. págs. 293–294 . ISBN 978-0-486-43227-4.
- ↑ Gill, Philip E.; Murray, Walter; Wright, Margaret H. (1981). Optimización práctica . Londres, Reino Unido: Academic Press. págs. 312-313 . ISBN 0-12-283950-1.
- ↑ Edgeworth, Francis Y. (septiembre de 1908). "Sobre los errores probables de las constantes de frecuencia" . Journal of the Royal Statistical Society . 71 (3): 499– 512. doi : 10.2307/2339293 . JSTOR 2339293 .
- ↑ Edgeworth, Francis Y. (dic. 1908). "Sobre los errores probables de las constantes de frecuencia" . Journal of the Royal Statistical Society . 71 (4): 651– 678. doi : 10.2307/2339378 . JSTOR 2339378 .
- ↑ Pfanzagl, Johann (1994). Teoría estadística paramétrica . Walter de Gruyter . págs. 207– 208. doi : 10.1515/9783110889765 . ISBN 978-3-11-013863-4. MR 1291393 .
- ↑ Hald, Anders (1999). "Sobre la historia de la máxima verosimilitud en relación con la probabilidad inversa y los mínimos cuadrados" . Statistical Science . 14 (2): 214– 222. doi : 10.1214/ss/1009212248 . ISSN 0883-4237 . JSTOR 2676741 .
- ↑ Wilks, SS (1938). "La distribución de muestras grandes de la razón de verosimilitud para probar hipótesis compuestas" . Annals of Mathematical Statistics . 9 : 60–62 . doi : 10.1214/aoms/1177732360 .
- ↑ Owen, Art B. (2001). Probabilidad empírica . Londres, Reino Unido; Boca Ratón, Florida: Chapman & Hall; CRC Press. ISBN 978-1-58488-071-4.
- ↑ Wilks, Samuel S. (1962). Estadística matemática . Nueva York, NY: John Wiley & Sons. ISBN 978-0-471-94650-2.
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - ↑ Savage, Leonard J. (1976). "Sobre la relectura de RA Fisher" . The Annals of Statistics . 4 (3): 441– 500. doi : 10.1214/aos/1176343456 . JSTOR 2958221 .
- ↑ Pratt, John W. (1976). "FY Edgeworth y RA Fisher sobre la eficiencia de la estimación de máxima verosimilitud" . The Annals of Statistics . 4 (3): 501– 514. doi : 10.1214/aos/1176343457 . JSTOR 2958222 .
- ↑ Stigler, Stephen M. (1978). "Francis Ysidro Edgeworth, estadístico". Journal of the Royal Statistical Society, Serie A. 141 ( 3): 287– 322. doi : 10.2307/2344804 . JSTOR 2344804 .
- ↑ Stigler, Stephen M. (1986). Historia de la estadística: la medición de la incertidumbre antes de 1900. Harvard University Press. ISBN 978-0-674-40340-6.
- ↑ Stigler, Stephen M. (1999). Statistics on the table: the history of statistical concepts and methods . Harvard University Press. ISBN 978-0-674-83601-3.
- ↑ Hald, Anders (1998). Historia de la estadística matemática desde 1750 hasta 1930. Nueva York, NY: Wiley. ISBN 978-0-471-17912-2.
- ↑ Hald, Anders (1999). "Sobre la historia de la máxima verosimilitud en relación con la probabilidad inversa y los mínimos cuadrados" . Statistical Science . 14 (2): 214– 222. doi : 10.1214/ss/1009212248 . JSTOR 2676741 .
- ↑ Aldrich, John (1997). "RA Fisher y la creación de la máxima verosimilitud 1912–1922" . Statistical Science . 12 (3): 162– 176. doi : 10.1214/ss/1030037906 . MR 1617519 .
Lecturas adicionales
- Cramer, JS (1986). Aplicaciones econométricas de los métodos de máxima verosimilitud . Nueva York, NY: Cambridge University Press. ISBN 0-521-25317-9.
- Eliason, Scott R. (1993). Estimación de máxima verosimilitud: lógica y práctica . Newbury Park: Sage. ISBN 0-8039-4107-2.
- King, Gary (1989). Metodología política unificadora: la teoría de la verosimilitud de la inferencia estadística . Cambridge University Press. ISBN 0-521-36697-6.
- Le Cam, Lucien (1990). "Máxima verosimilitud: una introducción". ISI Review . 58 (2): 153– 171. doi : 10.2307/1403464 . JSTOR 1403464 .
- Magnus, Jan R. (2017). «Máxima verosimilitud». Introducción a la teoría de la econometría . Ámsterdam, Países Bajos: VU University Press. pp. 53–68 . ISBN 978-90-8659-766-6.
- Millar, Russell B. (2011). Estimación e inferencia de máxima verosimilitud . Hoboken, NJ: Wiley. ISBN 978-0-470-09482-2.
- Pickles, Andrew (1986). Introducción al análisis de verosimilitud . Norwich: WH Hutchins & Sons. ISBN 0-86094-190-6.
- Severini, Thomas A. (2000). Métodos de verosimilitud en estadística . Nueva York, NY: Oxford University Press. ISBN 0-19-850650-3.
- Ward, Michael D.; Ahlquist, John S. (2018). Máxima verosimilitud para las ciencias sociales: estrategias de análisis . Cambridge University Press. ISBN 978-1-316-63682-4.
Enlaces externos
- Tilevik, Andreas (2022). Máxima verosimilitud frente a mínimos cuadrados en regresión lineal (vídeo)
- "Método de máxima verosimilitud" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
- Purcell, S. "Estimación de máxima verosimilitud" . Archivado del original el 27 de octubre de 2019. Consultado el 24 de abril de 2007 .
- Sargent, Thomas ; Stachurski, John. "Estimación de máxima verosimilitud" . Economía cuantitativa con Python .
- Toomet, Ott; Henningsen, Arne (19 de mayo de 2019). "maxLik: un paquete para estimación de máxima verosimilitud en R" .
- Lesser, Lawrence M. (2007) .Letra de la canción 'MLE' . Ciencias Matemáticas / Facultad de Ciencias. Universidad de Texas . El Paso, TX . Consultado el 6 de marzo de 2021 .
- estimación de máxima verosimilitud
- estimadores M
- Ajuste de la distribución de probabilidad