En estadística bayesiana , la estimación de máxima probabilidad a posteriori ( MAP ) de una cantidad desconocida es la moda de la densidad posterior . La MAP se puede utilizar para obtener una estimación puntual de una cantidad no observada a partir de datos empíricos. Está estrechamente relacionada con el método de estimación de máxima verosimilitud (ML), pero emplea un objetivo de optimización aumentado que incorpora una densidad previa sobre la cantidad que se desea estimar. Por lo tanto, la estimación MAP es una regularización de la estimación de máxima verosimilitud.
Descripción
Supongamos que queremos estimar un parámetro poblacional no observado.sobre la base de las observaciones. Dejarsea la distribución muestral de, de modo quees la probabilidad decuando el parámetro de población subyacente es. Luego la función:
se conoce como la función de verosimilitud y la estimación:
es la estimación de máxima verosimilitud de.
Ahora supongamos que existe una distribución previa.encimaexiste. Esto nos permite tratarcomo una variable aleatoria como en la estadística bayesiana . Podemos calcular la densidad posterior deUtilizando el teorema de Bayes :
dóndees la función de densidad de,es el dominio de.
El método de estimación de máxima probabilidad a posteriori estima entoncescomo la moda de la densidad posterior de esta variable aleatoria:
El denominador de la densidad posterior (la verosimilitud marginal del modelo) siempre es positivo y no depende dey por lo tanto no juega ningún papel en la optimización. Observe que la estimación MAP decoincide con la estimación ML cuando la distribución a priories uniforme (es decir,es una función constante ), lo que ocurre siempre que la distribución previa se toma como medida de referencia, como es típico en las aplicaciones de espacios de funciones.
En el contexto de los estimadores bayesianos , el MAP se puede recuperar como el minimizador del riesgo bayesiano con función de riesgo
en el límite comova a 0, siempre que la distribución dees cuasicóncava. [ 1 ] Generalmente, sin embargo, un estimador MAP no es un estimador bayesiano a menos quees discreto .
Cálculo
Las estimaciones de MAP se pueden calcular de varias maneras:
- Analíticamente, cuando la(s) moda(s) de la densidad posterior se pueden expresar en forma cerrada . Este es el caso cuando se utilizan distribuciones a priori conjugadas .
- Mediante optimización numérica, como el método del gradiente conjugado o el método de Newton . Esto generalmente requiere derivadas primeras o segundas , las cuales deben evaluarse analítica o numéricamente.
- Mediante una modificación de un algoritmo de maximización de la esperanza . Esto no requiere derivadas de la densidad posterior.
- Mediante un método de Monte Carlo utilizando recocido simulado
Limitaciones
Aunque solo se requieren condiciones leves para que la estimación MAP sea un caso límite de la estimación bayesiana (bajo la función de pérdida 0-1), [ 1 ] no es representativa de los métodos bayesianos en general. Esto se debe a que las estimaciones MAP son estimaciones puntuales y dependen de la elección arbitraria de la medida de referencia, mientras que los métodos bayesianos se caracterizan por el uso de distribuciones para resumir datos y extraer inferencias: por lo tanto, los métodos bayesianos tienden a informar la media o mediana posterior en su lugar, junto con intervalos creíbles . Esto se debe tanto a que estos estimadores son óptimos bajo la pérdida de error cuadrático y error lineal respectivamente —que son más representativos de las funciones de pérdida típicas— como a que para una distribución posterior continua no hay ninguna función de pérdida que sugiera que la MAP sea el estimador puntual óptimo.

En muchos tipos de modelos, como los modelos de mezcla , la distribución posterior puede ser multimodal . En tales casos, la recomendación habitual es elegir la moda más alta; sin embargo, esto no siempre es factible ( la optimización global es un problema complejo), ni siquiera posible en algunos casos (como cuando surgen problemas de identificabilidad ). Además, la moda más alta puede no ser representativa de la mayoría de la distribución posterior, especialmente en múltiples dimensiones.
Finalmente, a diferencia de los estimadores ML, la estimación MAP no es invariante bajo reparametrización. Cambiar de una parametrización a otra implica introducir un jacobiano que afecta la ubicación del máximo. [ 2 ] En contraste, las expectativas posteriores bayesianas son invariantes bajo reparametrización.
Como ejemplo de la diferencia entre los estimadores bayesianos mencionados anteriormente (estimadores de la media y la mediana) y el uso de una estimación MAP, consideremos el caso en el que existe la necesidad de clasificar las entradas.como positivos o negativos (por ejemplo, los préstamos como riesgosos o seguros). Supongamos que solo hay tres hipótesis posibles sobre el método correcto de clasificación.,ycon probabilidades posteriores de 0,4, 0,3 y 0,3 respectivamente. Supongamos que, dado un nuevo caso,,lo clasifica como positivo, mientras que los otros dos lo clasifican como negativo. Usando la estimación MAP para el clasificador correcto,se clasifica como positivo, mientras que los estimadores de Bayes promediarían sobre todas las hipótesis y clasificaríancomo negativo.
Ejemplo
Supongamos que se nos da una secuenciade IIDvariables aleatorias y una distribución previa dees dado por . Deseamos encontrar la estimación MAP deTenga en cuenta que la distribución normal es su propia distribución a priori conjugada , por lo que podremos encontrar una solución analítica en forma cerrada .
La función que se va a maximizar viene dada por [ 3 ].
lo cual es equivalente a minimizar la siguiente función de:
Así, vemos que el estimador MAP para μ viene dado por [ 3 ].
que resulta ser una interpolación lineal entre la media previa y la media muestral ponderada por sus respectivas covarianzas.
El caso dese denomina distribución previa no informativa y conduce a una distribución de probabilidad impropia ; en este caso
Referencias
- 1 2 Bassett, Robert; Deride, Julio (2018-01-30). "Estimadores a posteriori máximos como límite de los estimadores bayesianos". Mathematical Programming . 174 ( 1– 2): 129– 144. arXiv : 1611.05917 . doi : 10.1007/s10107-018-1241-0 . ISSN 0025-5610 .
- ↑ Murphy, Kevin P. (2012). Aprendizaje automático : una perspectiva probabilística . Cambridge, Massachusetts: MIT Press. pp. 151–152 . ISBN 978-0-262-01802-9.
- 1 2 Young, GA; Smith, RL (2005). Fundamentos de inferencia estadística . Serie de Cambridge en matemáticas estadísticas y probabilísticas. Cambridge: Cambridge University Press. ISBN 978-0-521-83971-6.
- DeGroot, M. (1970). Decisiones estadísticas óptimas . McGraw-Hill. ISBN 0-07-016242-5.
- Sorenson, Harold W. (1980). Estimación de parámetros: principios y problemas . Marcel Dekker. ISBN 0-8247-6987-2.
- Hald, Anders (2007). «La derivación de Gauss de la distribución normal y el método de mínimos cuadrados, 1809». Historia de la inferencia estadística paramétrica desde Bernoulli hasta Fisher, 1713-1935 . Nueva York: Springer. pp. 55-61 . ISBN 978-0-387-46409-1.
- Estimación bayesiana
- Lógica y estadística
- A priori