Una función de verosimilitud (a menudo llamada simplemente verosimilitud ) mide qué tan bien un modelo estadístico explica los datos observados calculando la probabilidad de ver esos datos bajo diferentes valores de los parámetros del modelo. Se construye a partir de la distribución de probabilidad conjunta de la variable aleatoria que (presumiblemente) generó las observaciones. [ 1 ] [ 2 ] [ 3 ] Cuando se evalúa sobre los puntos de datos reales, se convierte en una función únicamente de los parámetros del modelo.
En la estimación de máxima verosimilitud , el/los parámetro(s) del modelo o el argumento que maximiza la función de verosimilitud sirve como una estimación puntual para el parámetro desconocido, mientras que la información de Fisher (a menudo aproximada por la matriz hessiana de la verosimilitud en el máximo) da una indicación de la precisión de la estimación .
En contraste, en la estadística bayesiana , la estimación de interés es la inversa de la verosimilitud, la llamada probabilidad posterior del parámetro dados los datos observados, que se calcula mediante la regla de Bayes . [ 4 ]
Definición
La función de verosimilitud, parametrizada por un parámetro (posiblemente multivariado), generalmente se define de manera diferente para distribuciones de probabilidad discretas y continuas (una definición más general se discute más adelante). Dada una función de densidad de probabilidad o función de masa
dóndees una realización de la variable aleatoria, la función de verosimilitud es a menudo escrito
En otras palabras, cuandose considera una función deconfija, es una función de densidad de probabilidad, y cuando se la considera como una función deconfijo, es una función de probabilidad. En el paradigma frecuentista , la notacióna menudo se evita y en su lugarose utilizan para indicar quese considera una cantidad fija desconocida en lugar de una variable aleatoria condicionada.
La función de verosimilitud no especifica la probabilidad de quees la verdad, dada la muestra observadaEsta interpretación es un error común, con consecuencias potencialmente desastrosas (véase la falacia del fiscal ).
Distribución de probabilidad discreta
Dejarsea una variable aleatoria discreta con función de probabilidaddependiendo de un parámetro. Luego la función
considerado como una función de, un posible valor del parámetro determinista pero desconocidoes la función de verosimilitud , dado el resultadode la variable aleatoria. A veces la probabilidad de "el valordepara el valor del parámetro" se escribe como P ( X = x | θ ) o P ( X = x ; θ ) . La probabilidad es la probabilidad de que ocurra un resultado particularse observa cuando el valor verdadero del parámetro es, equivalente a la masa de probabilidad en; no es una densidad de probabilidad sobre el parámetro. La probabilidad,, no debe confundirse con, que es la probabilidad posterior dedados los datos.
Ejemplo


Consideremos un modelo estadístico simple de lanzamiento de moneda: un único parámetroque expresa la "justicia" de la moneda. El parámetro es la probabilidad de que una moneda caiga cara arriba ("H") al ser lanzada.puede tomar cualquier valor dentro del rango de 0,0 a 1,0. Para una moneda perfectamente justa ,.
Imagina lanzar una moneda justa dos veces y observar dos caras en dos lanzamientos ("HH"). Suponiendo que cada lanzamiento sucesivo de la moneda es i.i.d. , entonces la probabilidad de observar HH es
De forma equivalente, la probabilidad de observar "HH" suponiendoes
Esto no es lo mismo que decir que, una conclusión a la que solo se podía llegar mediante el teorema de Bayes dado el conocimiento de las probabilidades marginales.y.
Ahora supongamos que la moneda no es una moneda justa, sino que en cambio...Entonces, la probabilidad de obtener dos caras en dos lanzamientos es
Por eso
De manera más general, para cada valor de, podemos calcular la probabilidad correspondiente. El resultado de dichos cálculos se muestra en la Figura 1. La integral desobre [0, 1] es 1/3; las probabilidades no necesitan integrarse ni sumar uno sobre el espacio de parámetros.
Distribución de probabilidad continua
Dejarsea una variable aleatoria que sigue una distribución de probabilidad absolutamente continua con función de densidad(una función de) que depende de un parámetro. Luego la función
considerado como una función de, es la función de verosimilitud (de, dado el resultado). De nuevo,no es una función de densidad de probabilidad o de masa sobre, a pesar de ser una función dedada la observación.
Relación entre las funciones de verosimilitud y densidad de probabilidad.
El uso de la densidad de probabilidad para especificar la función de verosimilitud anterior se justifica de la siguiente manera. Dada una observación, la probabilidad para el intervalo, dóndees una constante, está dada por. Observe que desdees positivo y constante. Porque
dóndees la función de densidad de probabilidad, por lo tanto se deduce que
El primer teorema fundamental del cálculo establece que
Entonces
Por lo tanto, y así maximizar la densidad de probabilidad enequivale a maximizar la probabilidad de la observación específica..
En general
En la teoría de la probabilidad basada en la teoría de la medida , la función de densidad se define como la derivada de Radon-Nikodym de la distribución de probabilidad con respecto a una medida dominante común. [ 5 ] La función de verosimilitud es esta densidad interpretada como una función del parámetro, en lugar de la variable aleatoria. [ 6 ] Por lo tanto, podemos construir una función de verosimilitud para cualquier distribución, ya sea discreta, continua, mixta o de otro tipo. (Las verosimilitudes son comparables, por ejemplo, para la estimación de parámetros, solo si son derivadas de Radon-Nikodym con respecto a la misma medida dominante).
La discusión anterior sobre la probabilidad para variables aleatorias discretas utiliza la medida de conteo , bajo la cual la densidad de probabilidad en cualquier resultado es igual a la probabilidad de ese resultado.
Probabilidades para distribuciones mixtas continuas y discretas
Lo anterior se puede extender de manera sencilla para permitir la consideración de distribuciones que contienen componentes tanto discretas como continuas. Supongamos que la distribución consta de varias masas de probabilidad discretas.y una densidad, donde la suma de todos losse añade a la integral desiempre es uno. Suponiendo que es posible distinguir una observación correspondiente a una de las masas de probabilidad discretas de una que corresponde al componente de densidad, la función de verosimilitud para una observación del componente continuo se puede tratar de la manera mostrada anteriormente. Para una observación del componente discreto, la función de verosimilitud para una observación del componente discreto es simplemente dóndees el índice de la masa de probabilidad discreta correspondiente a la observación, porque maximizar la masa de probabilidad (o probabilidad) enequivale a maximizar la probabilidad de la observación específica.
El hecho de que la función de verosimilitud pueda definirse de una manera que incluya contribuciones que no son conmensurables (la densidad y la masa de probabilidad) surge de la forma en que la función de verosimilitud se define hasta una constante de proporcionalidad, donde esta "constante" puede cambiar con la observación., pero no con el parámetro.
Condiciones de regularidad
En el contexto de la estimación de parámetros, se suele asumir que la función de verosimilitud cumple ciertas condiciones, conocidas como condiciones de regularidad. Estas condiciones se asumen en diversas demostraciones que involucran funciones de verosimilitud y deben verificarse en cada aplicación particular. Para la estimación de máxima verosimilitud, la existencia de un máximo global de la función de verosimilitud es de suma importancia. Según el teorema del valor extremo , basta con que la función de verosimilitud sea continua en un espacio de parámetros compacto para que exista el estimador de máxima verosimilitud. [ 7 ] Si bien la suposición de continuidad generalmente se cumple, la suposición de compacidad sobre el espacio de parámetros a menudo no se cumple, ya que los límites de los valores reales de los parámetros pueden ser desconocidos. En ese caso, la concavidad de la función de verosimilitud juega un papel clave.
Más específicamente, si la función de verosimilitud es dos veces continuamente diferenciable en el espacio de parámetros k -dimensionalse supone que es un subconjunto abierto y conexo deexiste un máximo únicosi la matriz de segundas parcialeses definido negativo para cadaen el que el gradientese desvanece, y si la función de verosimilitud se aproxima a una constante en el límite del espacio de parámetros,es decir, que pueden incluir los puntos en el infinito sies ilimitado. Mäkeläinen y coautores demuestran este resultado utilizando la teoría de Morse, aunque recurriendo informalmente a una propiedad de paso de montaña. [ 8 ] Mascarenhas reformula su demostración utilizando el teorema del paso de montaña . [ 9 ]
En las pruebas de consistencia y normalidad asintótica del estimador de máxima verosimilitud, se hacen suposiciones adicionales sobre las densidades de probabilidad que forman la base de una función de verosimilitud particular. Estas condiciones fueron establecidas por primera vez por Chanda. [ 10 ] En particular, para casi todosy para todos existen para todospara asegurar la existencia de una expansión de Taylor . Segundo, para casi todosy por cadadebe ser que dóndees tal queEsta acotación de las derivadas es necesaria para permitir la diferenciación bajo el signo integral . Y por último, se supone que la matriz de información , es definido positivo yes finito. Esto garantiza que la puntuación tenga una varianza finita. [ 11 ]
Las condiciones anteriores son suficientes, pero no necesarias. Es decir, un modelo que no cumpla con estas condiciones de regularidad puede o no tener un estimador de máxima verosimilitud con las propiedades mencionadas. Además, en caso de observaciones no independientes o no idénticamente distribuidas, puede ser necesario asumir propiedades adicionales.
En estadística bayesiana, se imponen condiciones de regularidad casi idénticas a la función de verosimilitud para demostrar la normalidad asintótica de la probabilidad posterior , [ 12 ] [ 13 ] y, por lo tanto, para justificar una aproximación de Laplace de la posterior en muestras grandes. [ 14 ]
Razón de verosimilitud y probabilidad relativa
razón de verosimilitud
Una razón de verosimilitud es la razón entre dos probabilidades específicas, que frecuentemente se escribe como:
La razón de verosimilitud es fundamental en la estadística verosímil : la ley de verosimilitud establece que el grado en que los datos (considerados como evidencia) respaldan un valor de parámetro frente a otro se mide mediante la razón de verosimilitud.
En la inferencia frecuentista , la razón de verosimilitud es la base de un estadístico de prueba , la llamada prueba de razón de verosimilitud . Según el lema de Neyman-Pearson , esta es la prueba más potente para comparar dos hipótesis simples a un nivel de significancia dado . Numerosas otras pruebas pueden considerarse pruebas de razón de verosimilitud o aproximaciones de las mismas. [ 15 ] La distribución asintótica de la razón de verosimilitud logarítmica, considerada como un estadístico de prueba, viene dada por el teorema de Wilks .
La razón de verosimilitud también es de vital importancia en la inferencia bayesiana , donde se la conoce como factor de Bayes y se utiliza en la regla de Bayes . Expresada en términos de probabilidades , la regla de Bayes establece que las probabilidades posteriores de dos alternativas ,y , dado un evento , es la probabilidad previa , multiplicada por la razón de verosimilitud. Como ecuación:
La razón de verosimilitud no se utiliza directamente en las estadísticas basadas en el AIC. En su lugar, se utiliza la verosimilitud relativa de los modelos (véase más abajo).
En la medicina basada en la evidencia , los cocientes de probabilidad se utilizan en las pruebas de diagnóstico para evaluar la utilidad de realizar una prueba de diagnóstico .
Función de verosimilitud relativa
Dado que el valor real de la función de verosimilitud depende de la muestra, a menudo resulta conveniente trabajar con una medida estandarizada. Supongamos que la estimación de máxima verosimilitud para el parámetro θ es. Las plausibilidades relativas de otros valores de θ pueden hallarse comparando las probabilidades de esos otros valores con la probabilidad de. La probabilidad relativa de θ se define como [ 16 ] [ 17 ] [ 18 ] [ 19 ] [ 20 ] Por lo tanto, la probabilidad relativa es la razón de verosimilitud (discutida anteriormente) con el denominador fijo.Esto corresponde a estandarizar la probabilidad de tener un máximo de 1.
Región de probabilidad
Una región de probabilidad es el conjunto de todos los valores de θ cuya probabilidad relativa es mayor o igual a un umbral dado. En términos de porcentajes, una región de probabilidad p % para θ se define como [ 16 ] [ 18 ] [ 21 ]
Si θ es un único parámetro real, una región de probabilidad del p % generalmente comprenderá un intervalo de valores reales. Si la región comprende un intervalo, entonces se denomina intervalo de probabilidad . [ 16 ] [ 18 ] [ 22 ]
Los intervalos de verosimilitud, y más generalmente las regiones de verosimilitud, se utilizan para la estimación de intervalos en la estadística verosímil: son similares a los intervalos de confianza en la estadística frecuentista y a los intervalos creíbles en la estadística bayesiana. Los intervalos de verosimilitud se interpretan directamente en términos de verosimilitud relativa, no en términos de probabilidad de cobertura (frecuentismo) ni de probabilidad posterior (bayesianismo).
Dado un modelo, los intervalos de verosimilitud se pueden comparar con los intervalos de confianza. Si θ es un único parámetro real, entonces bajo ciertas condiciones, un intervalo de verosimilitud del 14,65 % (aproximadamente 1:7 de verosimilitud) para θ será el mismo que un intervalo de confianza del 95 % (probabilidad de cobertura de 19/20). [ 16 ] [ 21 ] En una formulación ligeramente diferente adecuada para el uso de log-verosimilitudes (véase el teorema de Wilks ), el estadístico de prueba es el doble de la diferencia en log-verosimilitudes y la distribución de probabilidad del estadístico de prueba es aproximadamente una distribución chi-cuadrado con grados de libertad (gl) iguales a la diferencia en los gl entre los dos modelos (por lo tanto, el intervalo de verosimilitud e − 2 es el mismo que el intervalo de confianza de 0,954; suponiendo que la diferencia en los gl sea 1). [ 21 ] [ 22 ]
Probabilidades que eliminan parámetros molestos
En muchos casos, la verosimilitud es una función de más de un parámetro, pero el interés se centra en la estimación de solo uno, o como máximo unos pocos de ellos, y los demás se consideran parámetros de perturbación . Se han desarrollado varios enfoques alternativos para eliminar dichos parámetros de perturbación, de modo que una verosimilitud pueda escribirse como una función de solo el parámetro (o parámetros) de interés: los enfoques principales son las verosimilitudes de perfil, condicionales y marginales. [ 23 ] [ 24 ] Estos enfoques también son útiles cuando una superficie de verosimilitud de alta dimensión necesita reducirse a uno o dos parámetros de interés para permitir un gráfico .
Probabilidad de perfil
Es posible reducir las dimensiones concentrando la función de verosimilitud para un subconjunto de parámetros, expresando los parámetros de perturbación como funciones de los parámetros de interés y reemplazándolos en la función de verosimilitud. [ 25 ] [ 26 ] En general, para una función de verosimilitud que depende del vector de parámetrosque se pueden dividir eny donde una correspondenciapuede determinarse explícitamente, la concentración reduce la carga computacional del problema de maximización original. [ 27 ]
Por ejemplo, en una regresión lineal con errores distribuidos normalmente,, el vector de coeficientes podría particionarse en(y, en consecuencia, la matriz de diseño)). Maximizar con respecto aproduce una función de valor óptimo. Utilizando este resultado, el estimador de máxima verosimilitud paraentonces se puede derivar como dóndees la matriz de proyección deEste resultado se conoce como el teorema de Frisch-Waugh-Lovell .
Dado que gráficamente el procedimiento de concentración es equivalente a cortar la superficie de probabilidad a lo largo de la cresta de valores del parámetro de perturbación.que maximiza la función de verosimilitud, creando un perfil isométrico de la función de verosimilitud para un valor dadoEl resultado de este procedimiento también se conoce como verosimilitud de perfil . [ 28 ] [ 29 ] Además de ser graficada, la verosimilitud de perfil también puede usarse para calcular intervalos de confianza que a menudo tienen mejores propiedades para muestras pequeñas que aquellos basados en errores estándar asintóticos calculados a partir de la verosimilitud completa. [ 30 ] [ 31 ]
Probabilidad condicional
A veces es posible encontrar una estadística suficiente para los parámetros de perturbación, y condicionar a esta estadística da como resultado una verosimilitud que no depende de los parámetros de perturbación. [ 32 ]
Un ejemplo se da en las tablas de 2×2, donde el condicionamiento sobre los cuatro totales marginales conduce a una verosimilitud condicional basada en la distribución hipergeométrica no central . Esta forma de condicionamiento también es la base de la prueba exacta de Fisher .
Probabilidad marginal
En ocasiones, podemos eliminar los parámetros de confusión considerando una verosimilitud basada únicamente en una parte de la información de los datos, por ejemplo, utilizando el conjunto de rangos en lugar de los valores numéricos. Otro ejemplo se da en los modelos lineales mixtos , donde considerar una verosimilitud para los residuos solo después de ajustar los efectos fijos conduce a la estimación de máxima verosimilitud residual de los componentes de la varianza.
Probabilidad parcial
Una función de verosimilitud parcial es una adaptación de la función de verosimilitud completa, de modo que solo una parte de los parámetros (los parámetros de interés) aparecen en ella. [ 33 ] Es un componente clave del modelo de riesgos proporcionales : al utilizar una restricción en la función de riesgo, la función de verosimilitud no contiene la forma del riesgo a lo largo del tiempo.
Productos de probabilidades
La probabilidad, dados dos o más eventos independientes , es el producto de las probabilidades de cada uno de los eventos individuales: Esto se desprende de la definición de independencia en probabilidad: la probabilidad de que ocurran dos eventos independientes, dado un modelo, es el producto de las probabilidades.
Esto es particularmente importante cuando los eventos provienen de variables aleatorias independientes e idénticamente distribuidas , como observaciones independientes o muestreo con reemplazo . En tal situación, la función de verosimilitud se descompone en un producto de funciones de verosimilitud individuales.
El producto vacío tiene valor 1, que corresponde a la probabilidad, dado que no hay ningún evento, de ser 1: antes de cualquier dato, la probabilidad siempre es 1. Esto es similar a una distribución a priori uniforme en estadística bayesiana, pero en estadística de verosimilitud esto no es una distribución a priori impropia porque las probabilidades no están integradas.
Probabilidad logarítmica
La función de log-verosimilitud es el logaritmo de la función de verosimilitud, a menudo denotada por una l minúscula o , para contrastar con la L mayúscula opara la verosimilitud. Debido a que los logaritmos son funciones estrictamente crecientes , maximizar la verosimilitud es equivalente a maximizar la log-verosimilitud. Pero para fines prácticos es más conveniente trabajar con la función de log-verosimilitud en la estimación de máxima verosimilitud , en particular porque la mayoría de las distribuciones de probabilidad comunes —en particular la familia exponencial— son solo logarítmicamente cóncavas , [ 34 ] [ 35 ] y la concavidad de la función objetivo juega un papel clave en la maximización .
Dada la independencia de cada evento, la log-verosimilitud global de la intersección es igual a la suma de las log-verosimilitudes de los eventos individuales. Esto es análogo al hecho de que la log-probabilidad global es la suma de las log-probabilidades de los eventos individuales. Además de la conveniencia matemática que esto supone, el proceso de suma de la log-verosimilitud tiene una interpretación intuitiva, que a menudo se expresa como "apoyo" de los datos. Cuando los parámetros se estiman utilizando la log-verosimilitud para la estimación de máxima verosimilitud , cada punto de datos se utiliza sumándose a la log-verosimilitud total. Dado que los datos pueden considerarse como evidencia que respalda los parámetros estimados, este proceso puede interpretarse como "el apoyo de la evidencia independiente se suma", y la log-verosimilitud es el "peso de la evidencia". Al interpretar la probabilidad logarítmica negativa como contenido informativo o sorpresa , el respaldo (verosimilitud logarítmica) de un modelo, dado un evento, es el negativo de la sorpresa del evento, dado el modelo: un modelo está respaldado por un evento en la medida en que el evento no es sorprendente, dado el modelo.
El logaritmo de una razón de verosimilitud es igual a la diferencia de los logaritmos de las verosimilitudes:
Así como la probabilidad, dado que no hay ningún evento, es 1, la log-verosimilitud, dado que no hay ningún evento, es 0, lo que corresponde al valor de la suma vacía: sin ningún dato, no hay respaldo para ningún modelo.
Gráfico
La gráfica de la log-verosimilitud se llama curva de soporte (en el caso univariado ). [ 36 ] En el caso multivariado, el concepto se generaliza a una superficie de soporte sobre el espacio de parámetros . Tiene relación con, pero es distinta de, el soporte de una distribución .
El término fue acuñado por AWF Edwards [ 36 ] en el contexto de la prueba de hipótesis estadísticas , es decir, si los datos "apoyan" o no una hipótesis (o valor de parámetro) que se está probando más que cualquier otra.
La función de log-verosimilitud que se representa gráficamente se utiliza en el cálculo de la puntuación (la pendiente de la log-verosimilitud) y la información de Fisher (la curvatura de la log-verosimilitud). Por lo tanto, el gráfico tiene una interpretación directa en el contexto de la estimación de máxima verosimilitud y las pruebas de razón de verosimilitud .
ecuaciones de verosimilitud
Si la función de log-verosimilitud es suave , su gradiente con respecto al parámetro, conocido como puntuación y escrito, existe y permite la aplicación del cálculo diferencial . La forma básica de maximizar una función diferenciable es encontrar los puntos estacionarios (los puntos donde la derivada es cero); dado que la derivada de una suma es simplemente la suma de las derivadas, pero la derivada de un producto requiere la regla del producto , es más fácil calcular los puntos estacionarios de la log-verosimilitud de eventos independientes que para la verosimilitud de eventos independientes.
Las ecuaciones definidas por el punto estacionario de la función de puntuación sirven como ecuaciones de estimación para el estimador de máxima verosimilitud. En ese sentido, el estimador de máxima verosimilitud se define implícitamente por el valor ende la función inversa, dóndees el espacio euclidiano d -dimensional , yes el espacio de parámetros. Usando el teorema de la función inversa , se puede demostrar queestá bien definido en un vecindario abierto sobrecon probabilidad de tender a uno, yes una estimación consistente de. Como consecuencia existe una secuenciade tal manera queasintóticamente casi seguramente y. [ 37 ] Se puede establecer un resultado similar utilizando el teorema de Rolle . [ 38 ] [ 39 ]
La segunda derivada evaluada en, conocida como información de Fisher , determina la curvatura de la superficie de verosimilitud, [ 40 ] y por lo tanto indica la precisión de la estimación. [ 41 ]
Familias exponenciales
La log-verosimilitud también resulta particularmente útil para familias de distribuciones exponenciales, que incluyen muchas de las distribuciones de probabilidad paramétricas comunes . La función de distribución de probabilidad (y, por lo tanto, la función de verosimilitud) para familias exponenciales contiene productos de factores que implican exponenciación . El logaritmo de dicha función es una suma de productos, lo que facilita su diferenciación en comparación con la función original.
Una familia exponencial es aquella cuya función de densidad de probabilidad tiene la forma (para algunas funciones, escribiendopara el producto interno ):
Cada uno de estos términos tiene una interpretación, [ a ] pero simplemente cambiando de probabilidad a verosimilitud y tomando logaritmos se obtiene la suma:
Elycada una corresponde a un cambio de coordenadas , por lo que en estas coordenadas, la log-verosimilitud de una familia exponencial viene dada por la fórmula simple:
En otras palabras, la log-verosimilitud de una familia exponencial es el producto interno del parámetro natural .y el estadístico suficiente , menos el factor de normalización ( función de partición logarítmica ) . Así, por ejemplo ,la estimación de máxima verosimilitud se puede calcular tomando derivadas del estadístico suficiente T y la función de partición logarítmica A.
Ejemplo: la distribución gamma
La distribución gamma es una familia exponencial con dos parámetros,yLa función de verosimilitud es
Encontrar la estimación de máxima verosimilitud depara un único valor observadoParece bastante desalentador. Su logaritmo es mucho más sencillo de usar:
Para maximizar la log-verosimilitud, primero tomamos la derivada parcial con respecto a:
Si hay varias observaciones independientes, entonces la log-verosimilitud conjunta será la suma de las log-verosimilitudes individuales, y la derivada de esta suma será una suma de las derivadas de cada log-verosimilitud individual:
Para completar el procedimiento de maximización para la log-verosimilitud conjunta, la ecuación se iguala a cero y se resuelve para:
Aquídenota la estimación de máxima verosimilitud, yes la media muestral de las observaciones.
Antecedentes e interpretación
Observaciones históricas
El término «verosimilitud» se ha utilizado en inglés al menos desde finales del inglés medio . [ 42 ] Su uso formal para referirse a una función específica en estadística matemática fue propuesto por Ronald Fisher , [ 43 ] en dos artículos de investigación publicados en 1921 [ 44 ] y 1922. [ 45 ] El artículo de 1921 introdujo lo que hoy se denomina «intervalo de verosimilitud»; el artículo de 1922 introdujo el término « método de máxima verosimilitud ». Citando a Fisher:
En 1922, propuse el término «verosimilitud», en vista de que, con respecto al parámetro, no es una probabilidad y no obedece las leyes de la probabilidad, mientras que al mismo tiempo guarda con el problema de la elección racional entre los posibles valores del parámetro una relación similar a la que la probabilidad guarda con el problema de predecir eventos en juegos de azar. . . . Sin embargo, en relación con el juicio psicológico, la verosimilitud tiene cierta semejanza con la probabilidad, pero ambos conceptos son totalmente distintos. . . . [ 46 ]
El concepto de probabilidad no debe confundirse con la probabilidad mencionada por Sir Ronald Fisher.
Hago hincapié en esto porque, a pesar del énfasis que siempre he puesto en la diferencia entre probabilidad y verosimilitud, todavía existe la tendencia a tratar la verosimilitud como si fuera una especie de probabilidad. El primer resultado es, por lo tanto, que existen dos medidas diferentes de creencia racional apropiadas para distintos casos. Conociendo la población, podemos expresar nuestro conocimiento incompleto, o expectativa, de la muestra en términos de probabilidad; conociendo la muestra, podemos expresar nuestro conocimiento incompleto de la población en términos de verosimilitud. [ 47 ]
La invención de Fisher de la probabilidad estadística fue una reacción contra una forma anterior de razonamiento llamada probabilidad inversa . [ 48 ] Su uso del término "probabilidad" fijó el significado del término dentro de la estadística matemática.
AWF Edwards (1972) estableció la base axiomática para el uso de la razón de verosimilitud logarítmica como medida del apoyo relativo a una hipótesis frente a otra. La función de apoyo es entonces el logaritmo natural de la función de verosimilitud. Ambos términos se utilizan en filogenética , pero no se adoptaron en un tratamiento general del tema de la evidencia estadística. [ 49 ]
Interpretaciones bajo diferentes fundamentos
Entre los estadísticos, no existe consenso sobre cuál debería ser el fundamento de la estadística . Se han propuesto cuatro paradigmas principales para dicho fundamento: frecuentismo , bayesianismo , verosimilitud y basado en el criterio de información de Akaike (AIC) . [ 50 ] Para cada uno de los fundamentos propuestos, la interpretación de la verosimilitud es diferente. Las cuatro interpretaciones se describen en las subsecciones siguientes.
Interpretación frecuentista
interpretación bayesiana
En la inferencia bayesiana , aunque se puede hablar de la probabilidad de cualquier proposición o variable aleatoria dada otra variable aleatoria: por ejemplo, la probabilidad de un valor de parámetro o de un modelo estadístico (véase probabilidad marginal ), dados datos específicos u otra evidencia, [ 51 ] [ 52 ] [ 53 ] [ 54 ] la función de probabilidad sigue siendo la misma entidad, con las interpretaciones adicionales de (i) una densidad condicional de los datos dado el parámetro (ya que el parámetro es entonces una variable aleatoria) y (ii) una medida o cantidad de información aportada por los datos sobre el valor del parámetro o incluso el modelo. [ 51 ] [ 52 ] [ 53 ] [ 54 ] [ 55 ] Debido a la introducción de una estructura de probabilidad en el espacio de parámetros o en la colección de modelos, es posible que un valor de parámetro o un modelo estadístico tenga un valor de probabilidad grande para datos dados, y sin embargo tenga una probabilidad baja , o viceversa. [ 53 ] [ 55 ] Este es a menudo el caso en contextos médicos. [ 56 ] Siguiendo la regla de Bayes , la verosimilitud, vista como una densidad condicional, puede multiplicarse por la densidad de probabilidad a priori del parámetro y luego normalizarse para obtener una densidad de probabilidad a posteriori . [ 51 ] [ 52 ] [ 53 ] [ 54 ] [ 55 ] De forma más general, la verosimilitud de una cantidad desconocidadada otra cantidad desconocidaes proporcional a la probabilidad dedado. [ 51 ] [ 52 ] [ 53 ] [ 54 ] [ 55 ]
Interpretación probabilística
En estadística frecuentista , la función de verosimilitud es una estadística que resume una muestra de una población, cuyo valor calculado depende de la elección de varios parámetros θ₁ ... θp , donde p es el número de parámetros en un modelo estadístico preseleccionado . El valor de la verosimilitud sirve como indicador de la idoneidad de los parámetros elegidos, y el conjunto de parámetros con máxima verosimilitud es la mejor opción, dados los datos disponibles.
El cálculo específico de la verosimilitud es la probabilidad de que la muestra observada se asigne, suponiendo que el modelo elegido y los valores de los diversos parámetros θ proporcionan una aproximación precisa de la distribución de frecuencia de la población de la que se extrajo la muestra observada. Heurísticamente, tiene sentido que una buena elección de parámetros sea aquella que haga que la muestra observada tenga la máxima probabilidad post hoc posible de haber ocurrido. El teorema de Wilks cuantifica la regla heurística al mostrar que la diferencia en el logaritmo de la verosimilitud generada por los valores de los parámetros de la estimación y el logaritmo de la verosimilitud generada por los valores de los parámetros "verdaderos" (pero desconocidos) de la población se distribuye asintóticamente según χ² .
La estimación de máxima verosimilitud de cada muestra independiente es una estimación separada del conjunto de parámetros "verdaderos" que describe la población muestreada. Las estimaciones sucesivas de muchas muestras independientes se agruparán, y el conjunto de valores de parámetros "verdaderos" de la población se encontrará oculto en algún lugar entre ellas. La diferencia en los logaritmos de la máxima verosimilitud y las verosimilitudes de los conjuntos de parámetros adyacentes se puede utilizar para dibujar una región de confianza en un gráfico cuyas coordenadas son los parámetros θ 1 ... θ p . La región rodea la estimación de máxima verosimilitud, y todos los puntos (conjuntos de parámetros) dentro de esa región difieren como máximo en la log-verosimilitud por un valor fijo. La distribución χ 2 dada por el teorema de Wilks convierte las diferencias de log-verosimilitud de la región en la "confianza" de que el conjunto de parámetros "verdaderos" de la población se encuentra dentro. El arte de elegir la diferencia fija de log-verosimilitud consiste en hacer que la confianza sea aceptablemente alta, manteniendo la región aceptablemente pequeña (rango estrecho de estimaciones).
A medida que se observan más datos, en lugar de utilizarlos para realizar estimaciones independientes, se pueden combinar con las muestras anteriores para formar una única muestra combinada. Esta muestra, de mayor tamaño, puede utilizarse para una nueva estimación de máxima verosimilitud. Conforme aumenta el tamaño de la muestra combinada, disminuye el tamaño de la región de verosimilitud con el mismo nivel de confianza. Finalmente, o bien el tamaño de la región de confianza se reduce prácticamente a un solo punto, o bien se ha muestreado toda la población; en ambos casos, el conjunto de parámetros estimados es esencialmente el mismo que el conjunto de parámetros de la población.
Interpretación basada en AIC
Bajo el paradigma AIC , la probabilidad se interpreta dentro del contexto de la teoría de la información . [ 57 ] [ 58 ] [ 59 ]
Véase también
Notas
Referencias
- ↑ Casella, George ; Berger, Roger L. (2002). Inferencia estadística (2.ª ed.). Duxbury. pág. 290. ISBN 0-534-24312-6.
- ↑ Wakefield, Jon (2013). Métodos de regresión frecuentista y bayesiana (1.ª ed.). Springer. pág. 36. ISBN 978-1-4419-0925-1.
- ↑ Lehmann, Erich L.; Casella, George (1998). Teoría de la estimación puntual (2.ª ed.). Springer. pág. 444. ISBN 0-387-98502-6.
- ↑ Zellner, Arnold (1971). Introducción a la inferencia bayesiana en econometría . Nueva York: Wiley. págs. 13-14 . ISBN 0-471-98165-6.
- ↑ Billingsley, Patrick (1995). Probabilidad y medida (Tercera ed.). John Wiley & Sons . págs. 422–423 .
- ↑ Shao, Jun (2003). Estadística matemática (2.ª ed.). Springer. §4.4.1.
- ↑ Gouriéroux, Christian ; Monfort, Alain (1995). Statistics and Econometric Models . Nueva York: Cambridge University Press. p. 161. ISBN 0-521-40551-3.
- ↑ Mäkeläinen, Timo; Schmidt, Klaus; Styan, George PH (1981). "Sobre la existencia y unicidad de la estimación de máxima verosimilitud de un parámetro vectorial en muestras de tamaño fijo" . Annals of Statistics . 9 (4): 758– 767. doi : 10.1214/aos/1176345516 . JSTOR 2240844 .
- ↑ Mascarenhas, WF (2011). "Un lema de paso de montaña y sus implicaciones con respecto a la unicidad de los minimizadores restringidos". Optimization . 60 ( 8– 9): 1121– 1159. doi : 10.1080/02331934.2010.527973 . S2CID 15896597 .
- ↑ Chanda, KC (1954). "Una nota sobre la consistencia y los máximos de las raíces de las ecuaciones de verosimilitud". Biometrika . 41 ( 1–2 ): 56–61 . doi : 10.2307/2333005 . JSTOR 2333005 .
- ↑ Greenberg, Edward; Webster, Charles E. Jr. (1983). Econometría avanzada: Un puente hacia la literatura . Nueva York, NY: John Wiley & Sons. págs. 24-25 . ISBN 0-471-09077-8.
- ↑ Heyde, CC; Johnstone, IM (1979). "Sobre la normalidad posterior asintótica para procesos estocásticos". Journal of the Royal Statistical Society . Serie B (Metodológica). 41 (2): 184– 189. doi : 10.1111/j.2517-6161.1979.tb01071.x .
- ↑ Chen, Chan-Fu (1985). "Sobre la normalidad asintótica de las funciones de densidad límite con implicaciones bayesianas". Journal of the Royal Statistical Society . Serie B (Metodológica). 47 (3): 540– 546. doi : 10.1111/j.2517-6161.1985.tb01384.x .
- ↑ Kass, Robert E.; Tierney, Luke; Kadane, Joseph B. (1990). «La validez de las expansiones posteriores basadas en el método de Laplace». En Geisser, S.; Hodges, JS; Press, SJ; Zellner, A. (eds.). Métodos bayesianos y de máxima verosimilitud en estadística y econometría . Elsevier. pp. 473–488 . ISBN 0-444-88376-2.
- ↑ Buse, A. (1982). "Las pruebas de razón de verosimilitud, Wald y multiplicador de Lagrange: una nota explicativa" . The American Statistician . 36 (3a): 153– 157. doi : 10.1080/00031305.1982.10482817 .
- ^ Kalbfleisch , JG ( 1985 ), Probabilidad e inferencia estadística , Springer .(§9.3).
- ↑ Azzalini, A. (1996), Inferencia estadística: basada en la verosimilitud , Chapman & Hall , ISBN 9780412606502(§1.4.2).
- 1 2 3 Sprott, DA (2000), Inferencia estadística en la ciencia , Springer (cap. 2).
- ↑ Davison, AC (2008), Modelos estadísticos , Cambridge University Press (§4.1.2).
- ↑ Held, L.; Sabanés Bové, DS (2014), Inferencia estadística aplicada: verosimilitud y Bayes , Springer(§2.1).
- 1 2 3 Rossi, RJ (2018), Estadística matemática , Wiley , pág. 267 .
- 1 2 Hudson, DJ (1971), "Estimación por intervalos a partir de la función de verosimilitud", Journal of the Royal Statistical Society, Serie B , 33 (2): 256–262 , doi : 10.1111/j.2517-6161.1971.tb00877.x.
- ↑ Pawitan, Yudi (2001). En toda probabilidad: modelado estadístico e inferencia mediante la verosimilitud . Oxford University Press . ISBN 978-0-19-850765-9.
- ↑ Wen Hsiang Wei. "Modelo lineal generalizado - notas del curso" . Taichung, Taiwán: Universidad de Tunghai . págs. Capítulo 5. Consultado el 1 de octubre de 2017 .
- ↑ Amemiya, Takeshi (1985). «Función de verosimilitud concentrada» . Econometría avanzada . Cambridge: Harvard University Press. págs. 125-127 . ISBN 978-0-674-00560-0.
- ↑ Davidson, Russell; MacKinnon, James G. (1993). «Concentrating the Loglikelihood Function». Estimation and Inference in Econometrics . Nueva York: Oxford University Press. pp. 267–269 . ISBN 978-0-19-506011-9.
- ↑ Gourieroux, Christian; Monfort, Alain (1995). «Función de verosimilitud concentrada» . Estadística y modelos econométricos . Nueva York: Cambridge University Press. págs. 170–175 . ISBN 978-0-521-40551-5.
- ↑ Pickles, Andrew (1985). Introducción al análisis de verosimilitud . Norwich: WH Hutchins & Sons. págs. 21–24 . ISBN 0-86094-190-6.
- ↑ Bolker, Benjamin M. (2008). Modelos ecológicos y datos en R. Princeton University Press. pp. 187–189 . ISBN 978-0-691-12522-0.
- ↑ Aitkin, Murray (1982). "Inferencia directa de verosimilitud". GLIM 82: Actas de la Conferencia Internacional sobre Modelos Lineales Generalizados . Springer. págs. 76–86 . ISBN 0-387-90777-7.
- ↑ Venzon, DJ; Moolgavkar, SH (1988). "Un método para calcular intervalos de confianza basados en la verosimilitud de perfiles". Journal of the Royal Statistical Society . Serie C (Estadística Aplicada). 37 (1): 87– 94. doi : 10.2307/2347496 . JSTOR 2347496 .
- ↑ Kalbfleisch, JD; Sprott, DA (1973). "Marginal and Conditional Likelihoods". Sankhyā: The Indian Journal of Statistics . Serie A. 35 (3): 311– 328. JSTOR 25049882 .
- ↑ Cox, DR (1975). "Probabilidad parcial". Biometrika . 62 (2): 269– 276. doi : 10.1093/biomet/62.2.269 . MR 0400509 .
- ↑ Kass, Robert E.; Vos, Paul W. (1997). Fundamentos geométricos de la inferencia asintótica . Nueva York: John Wiley & Sons. pág. 14. ISBN 0-471-82668-5.
- ↑ Papadopoulos, Alecos (25 de septiembre de 2013). "¿Por qué siempre ponemos log() antes de la pdf conjunta cuando usamos MLE (Estimación de máxima verosimilitud)?" . Stack Exchange .
- 1 2 Edwards, AWF (1992) [1972]. Probabilidad . Johns Hopkins University Press . ISBN 0-8018-4443-6.
- ↑ Foutz, Robert V. (1977). "Sobre la solución consistente única a las ecuaciones de verosimilitud" . Journal of the American Statistical Association . 72 (357): 147– 148. doi : 10.1080/01621459.1977.10479926 .
- ↑ Tarone, Robert E.; Gruenhage, Gary (1975). "Una nota sobre la unicidad de las raíces de las ecuaciones de verosimilitud para parámetros vectoriales" . Journal of the American Statistical Association . 70 (352): 903– 904. doi : 10.1080/01621459.1975.10480321 .
- ↑ Rai, Kamta; Van Ryzin, John (1982). "Una nota sobre una versión multivariada del teorema de Rolle y la unicidad de las raíces de máxima verosimilitud". Communications in Statistics . Theory and Methods. 11 (13): 1505– 1510. doi : 10.1080/03610928208828325 .
- ↑ Rao, B. Raja (1960). "Una fórmula para la curvatura de la superficie de verosimilitud de una muestra extraída de una distribución que admite estadísticas suficientes". Biometrika . 47 ( 1–2 ): 203–207 . doi : 10.1093/biomet/47.1-2.203 .
- ↑ Ward, Michael D.; Ahlquist, John S. (2018). Máxima verosimilitud para las ciencias sociales : estrategias para el análisis . Cambridge University Press . págs. 25–27 .
- ↑ "probabilidad", Diccionario Oxford de inglés abreviado (2007).
- ↑ Hald, A. (1999). "Sobre la historia de la máxima verosimilitud en relación con la probabilidad inversa y los mínimos cuadrados" . Statistical Science . 14 (2): 214– 222. doi : 10.1214/ss/1009212248 . JSTOR 2676741 .
- ↑ Fisher, RA (1921). "Sobre el "error probable" de un coeficiente de correlación deducido de una muestra pequeña". Metron . 1 : 3–32 .
- ↑ Fisher, RA (1922). "Sobre los fundamentos matemáticos de la estadística teórica" . Philosophical Transactions of the Royal Society A. 222 ( 594–604 ) : 309–368 . Bibcode : 1922RSPTA.222..309F . doi : 10.1098/rsta.1922.0009 . hdl : 2440/15172 . JFM 48.1280.02 . JSTOR 91208 .
- ↑ Klemens, Ben (2008). Modelado con datos: herramientas y técnicas para la computación científica . Princeton University Press . pág. 329.
- ↑ Fisher, Ronald (1930). "Probabilidad inversa". Actas matemáticas de la Sociedad Filosófica de Cambridge . 26 (4): 528– 535. Bibcode : 1930PCPS...26..528F . doi : 10.1017/S0305004100016297 . hdl : 2440/15206 .
- ↑ Fienberg, Stephen E (1997). "Introducción a RA Fisher sobre probabilidad inversa y verosimilitud". Statistical Science . 12 (3): 161. doi : 10.1214/ss/1030037905 .
- ↑ Royall, R. (1997). Evidencia estadística . Chapman & Hall .
- ↑ Bandyopadhyay, PS; Forster, MR, eds. (2011). Filosofía de la estadística . North-Holland Publishing .
- 1 2 3 4 I. J. Good: Probabilidad y ponderación de la evidencia (Griffin 1950), §6.1
- 1 2 3 4 H. Jeffreys: Teoría de la probabilidad (3.ª ed., Oxford University Press, 1983), §1.22
- 1 2 3 4 5 E. T. Jaynes: Teoría de la probabilidad: La lógica de la ciencia (Cambridge University Press 2003), §4.1
- 1 2 3 4 D. V. Lindley: Introducción a la probabilidad y la estadística desde una perspectiva bayesiana. Parte 1: Probabilidad (Cambridge University Press, 1980), §1.6
- 1 2 3 4 A. Gelman, JB Carlin, HS Stern, DB Dunson, A. Vehtari, DB Rubin: Análisis de datos bayesianos (3.ª ed., Chapman & Hall/CRC 2014), §1.3
- ↑ Sox, HC; Higgins, MC; Owens, DK (2013), Medical Decision Making (2.ª ed.), Wiley, capítulos 3–4, doi : 10.1002/9781118341544 , ISBN 9781118341544
- ↑ Akaike, H. (1985). "Predicción y entropía". En Atkinson, AC; Fienberg, SE (eds.). Una celebración de la estadística . Springer. pp. 1–24 .
- ↑ Sakamoto, Y.; Ishiguro, M.; Kitagawa, G. (1986). Akaike Information Criterion Statistics . D. Reidel . Part I.
- ↑ Burnham, KP; Anderson, DR (2002). Selección de modelos e inferencia multimodelos: un enfoque práctico basado en la teoría de la información (2.ª ed.). Springer-Verlag . cap. 7.
Lecturas adicionales
- Azzalini, Adelchi (1996). «Verosimilitud». Inferencia estadística basada en la verosimilitud . Chapman and Hall. pp. 17–50 . ISBN 0-412-60650-X.
- Boos, Dennis D.; Stefanski, LA (2013). «Construcción y estimación de la verosimilitud». Inferencia estadística esencial : teoría y métodos . Nueva York: Springer. pp. 27–124 . doi : 10.1007/978-1-4614-4818-1_2 . ISBN 978-1-4614-4817-4.
- Edwards, AWF (1992) [1972]. Probabilidad ( Edición ampliada). Johns Hopkins University Press . ISBN 0-8018-4443-6.
- King, Gary (1989). «El modelo de verosimilitud de la inferencia» . Metodología política unificadora : la teoría de la verosimilitud de la inferencia estadística . Cambridge University Press. págs. 59-94 . ISBN 0-521-36697-6.
- Richard, Mark; Vecer, Jan (1 de febrero de 2021). "Prueba de eficiencia de los mercados de predicción: enfoque de martingala, razón de verosimilitud y análisis del factor de Bayes" . Risks . 9 (2): 31. doi : 10.3390/risks9020031 . hdl : 10419/258120 .
- Lindsey, JK (1996). "Verosimilitud" . Inferencia estadística paramétrica . Oxford University Press. págs. 69–139 . ISBN 0-19-852359-9.
- Rohde, Charles A. (2014). Introducción a la inferencia estadística con la función de verosimilitud . Berlín: Springer. ISBN 978-3-319-10460-7.
- Royall, Richard (1997). Evidencia estadística : un paradigma de verosimilitud . Londres: Chapman & Hall. ISBN 0-412-04411-0.
- Ward, Michael D.; Ahlquist, John S. (2018). «La función de verosimilitud: un análisis más profundo» . Máxima verosimilitud para las ciencias sociales : estrategias de análisis . Cambridge University Press . págs. 21-28 . ISBN 978-1-316-63682-4.
Enlaces externos
- Función de verosimilitud en Planetmath
- "Verosimilitud logarítmica" . Sentencia .
- Probabilidad
- estadística bayesiana