La regresión lineal bayesiana es un tipo de modelado condicional en el que la media de una variable se describe mediante una combinación lineal de otras variables, con el objetivo de obtener la probabilidad posterior de los coeficientes de regresión (así como otros parámetros que describen la distribución del regresond) y, en última instancia, permitir la predicción fuera de la muestra del regresond (a menudo etiquetado como) condicionado a los valores observados de los regresores (generalmente). La versión más simple y más utilizada de este modelo es el modelo lineal normal , en el quedadotiene una distribución gaussiana . En este modelo, y bajo una elección particular de probabilidades a priori para los parámetros —las llamadas probabilidades a priori conjugadas— , la distribución a posteriori puede hallarse analíticamente. Con probabilidades a priori elegidas de forma más arbitraria, las distribuciones a posteriori generalmente deben aproximarse.
Configuración del modelo
Consideremos un problema de regresión lineal estándar, en el que paraespecificamos la media de la distribución condicional dedado unvector predictor:
dóndees unvector y elson variables aleatorias independientes e idénticamente distribuidas normalmente :
Esto corresponde a la siguiente función de verosimilitud :
La solución de mínimos cuadrados ordinarios se utiliza para estimar el vector de coeficientes mediante la pseudoinversa de Moore-Penrose :
dóndees elmatriz de diseño , cada fila de la cual es un vector predictor; yes la columna-vector.
Este es un enfoque frecuentista , y supone que hay suficientes mediciones para decir algo significativo sobreEn el enfoque bayesiano , [ 1 ] los datos se complementan con información adicional en forma de una distribución de probabilidad previa . La creencia previa sobre los parámetros se combina con la función de verosimilitud de los datos según el teorema de Bayes para obtener la creencia posterior sobre los parámetros.y. El prior puede adoptar diferentes formas funcionales dependiendo del dominio y de la información que esté disponible a priori .
Dado que los datos comprenden ambosy, el enfoque únicamente en la distribución decondicionado anecesita justificación. De hecho, un análisis bayesiano "completo" requeriría una probabilidad conjunta.junto con un anterior, dóndesimboliza los parámetros de la distribución para.
Podemos factorizar la verosimilitud conjunta asumiendo una exogeneidad estricta . [ 2 ] La exogeneidad estricta requiere:
- que el vector de parámetros puedese descompondrá en dos componentes, conindexación de la densidad condicional de la variable de respuestayindexación de la densidad marginal de los regresores
- ese punto de datosno transmitir ninguna información adicional sobre el punto de datosmás allá de lo contenido en los regresoresy el vector de parámetros
Formalmente, la primera condición requiere que yy la segunda condición requierea pesar de.
Bajo exogeneidad estricta, la probabilidad conjunta puede entonces ser considerada como factor en. Esta última parte suele ignorarse bajo el supuesto de conjuntos de parámetros disjuntos. Más fuertemente,A menudo se considera elegido (por ejemplo, en un experimento diseñado) y, por lo tanto, tiene una probabilidad conocida sin parámetros. [ 3 ]
Con priors conjugados
Distribución previa conjugada
Para una distribución a priori arbitraria, puede que no exista una solución analítica para la distribución a posteriori . En esta sección, consideraremos una distribución a priori conjugada , cuya distribución a posteriori puede derivarse analíticamente.
Un anteriores conjugada a esta función de verosimilitud si la posterior tiene la misma forma funcional con respecto ayDado que la log-verosimilitud es cuadrática en, la log-verosimilitud se reescribe de tal manera que la verosimilitud se vuelve normal en. Escribir
La probabilidad ahora se reescribe como dónde dóndees el número de coeficientes de regresión.
Esto sugiere una forma para la distribución a priori: dóndees una distribución gamma inversa
En la notación introducida en el artículo sobre la distribución gamma inversa , esta es la densidad de unadistribución conyconycomo los valores previos dey, respectivamente. De forma equivalente, también puede describirse como una distribución chi-cuadrado inversa escalada ,
Además, la densidad previa condicionales una distribución normal ,
En la notación de la distribución normal , la distribución a priori condicional es
Distribución posterior
Ahora que se ha especificado la distribución a priori, la distribución a posteriori se puede expresar como
Con cierta reorganización, [ 4 ] la distribución posterior puede reescribirse de modo que la media posteriordel vector de parámetrospuede expresarse en términos del estimador de mínimos cuadradosy la media previa, con la fuerza de la distribución a priori indicada por la matriz de precisión a priori
Para justificar esoes de hecho la media posterior, los términos cuadráticos en la exponencial se pueden reordenar como una forma cuadrática en. [ 5 ]
Ahora, la distribución posterior se puede expresar como una distribución normal multiplicada por una distribución gamma inversa :
Por lo tanto, la distribución posterior se puede parametrizar de la siguiente manera. donde los dos factores corresponden a las densidades deydistribuciones, cuyos parámetros vienen dados por
lo que ilustra que la inferencia bayesiana es un compromiso entre la información contenida en la distribución a priori y la información contenida en la muestra.
Evidencia del modelo
La evidencia del modeloes la probabilidad de los datos dado el modeloTambién se conoce como verosimilitud marginal y como densidad predictiva previa . Aquí, el modelo se define mediante la función de verosimilitud.y la distribución previa de los parámetros, es decirLa evidencia del modelo captura en un solo número qué tan bien dicho modelo explica las observaciones. La evidencia del modelo de regresión lineal bayesiana presentada en esta sección se puede utilizar para comparar modelos lineales competidores mediante factores de Bayes . Estos modelos pueden diferir en el número y los valores de las variables predictoras, así como en sus priors sobre los parámetros del modelo. La complejidad del modelo ya está tomada en cuenta por la evidencia del modelo, porque marginaliza los parámetros mediante la integración.sobre todos los valores posibles dey. Esta integral se puede calcular analíticamente y la solución se da en la siguiente ecuación. [ 6 ]
Aquídenota la función gamma . Debido a que hemos elegido una distribución a priori conjugada, la verosimilitud marginal también se puede calcular fácilmente evaluando la siguiente igualdad para valores arbitrarios dey. [ 7 ] Cabe destacar que esta ecuación se deriva de una reordenación del teorema de Bayes . Al insertar las fórmulas para la distribución a priori, la verosimilitud y la distribución a posteriori, y simplificar la expresión resultante, se obtiene la expresión analítica mencionada anteriormente.
Otros casos
En general, puede ser imposible o poco práctico derivar la distribución posterior analíticamente. Sin embargo, es posible aproximar la distribución posterior mediante un método de inferencia bayesiana aproximada como el muestreo de Monte Carlo , [ 8 ] INLA o Bayes variacional .
El caso especialse denomina regresión de cresta .
Se puede realizar un análisis similar para el caso general de la regresión multivariante y parte de este proporciona la estimación bayesiana de matrices de covarianza : véase regresión lineal multivariante bayesiana .
Véase también
Notas
- ↑ Huang, Yunfei; Gompper, Gerhard; Sabass, Benedikt (2020). "Un método de microscopía de fuerza de tracción bayesiana con eliminación de ruido automatizada en un paquete de software fácil de usar". Computer Physics Communications . 256 107313. arXiv : 2005.01377 . Bibcode : 2020CoPhC.25607313H . doi : 10.1016/j.cpc.2020.107313 .
- ↑ Véase Jackman (2009), pág. 101.
- ↑ Véase Gelman et al. (2013), pág. 354.
- ↑ Los pasos intermedios de este cálculo se pueden encontrar en O'Hagan (1994) al principio del capítulo sobre modelos lineales.
- ↑ Los pasos intermedios se encuentran en Fahrmeir et al. (2009) en la página 188.
- ↑ Los pasos intermedios de este cálculo se pueden encontrar en O'Hagan (1994) en la página 257.
- ↑ Chib, Siddhartha (1995). "Verosimilitud marginal a partir de la salida de Gibbs". Journal of the American Statistical Association . 90 (432): 1313– 1321. doi : 10.2307/2291521 .
- ↑ Carlin y Louis (2008) y Gelman, et al. (2003) explican cómo utilizar métodos de muestreo para la regresión lineal bayesiana.
Referencias
- Box, GEP ; Tiao, GC (1973). Inferencia bayesiana en el análisis estadístico . Wiley. ISBN 0-471-57428-7.
- Carlin, Bradley P.; Louis, Thomas A. (2008). Métodos bayesianos para el análisis de datos (Tercera ed.). Boca Raton, FL: Chapman and Hall/CRC. ISBN 978-1-58488-697-6.
- Fahrmeir, L.; Kneib, T.; Lang, S. (2009). Regresión. Modelle, Methoden und Anwendungen (Segunda ed.). Heidelberg: Springer. doi : 10.1007/978-3-642-01837-4 . ISBN 978-3-642-01836-7.
- Gelman, Andrew ; et al. (2013). «Introducción a los modelos de regresión». Análisis de datos bayesianos (Tercera ed.). Boca Raton, FL: Chapman and Hall/CRC. pp. 353–380 . ISBN 978-1-4398-4095-5.
- Jackman, Simon (2009). «Modelos de regresión». Análisis bayesiano para las ciencias sociales . Wiley. pp. 99–124 . ISBN 978-0-470-01154-6.
- Rossi, Peter E.; Allenby, Greg M.; McCulloch, Robert (2006). Estadística bayesiana y marketing . John Wiley & Sons. ISBN 0-470-86367-6.
- O'Hagan, Anthony (1994). Inferencia bayesiana . Teoría avanzada de la estadística de Kendall. Vol. 2B (Primera ed.). Halsted. ISBN 0-340-52922-9.
Enlaces externos
- Estimación bayesiana de modelos lineales (wikibook de programación R) . Regresión lineal bayesiana implementada en R.
- Inferencia bayesiana
- Métodos de ecuación única (econometría)