Articulo de referencia

regresión lineal bayesiana

La regresión lineal bayesiana es un tipo de modelado condicional en el que la media de una variable se describe mediante una combinación lineal de otras variables, con el objeti...

La regresión lineal bayesiana es un tipo de modelado condicional en el que la media de una variable se describe mediante una combinación lineal de otras variables, con el objetivo de obtener la probabilidad posterior de los coeficientes de regresión (así como otros parámetros que describen la distribución del regresond) y, en última instancia, permitir la predicción fuera de la muestra del regresond (a menudo etiquetado comoy{\displaystyle y}) condicionado a los valores observados de los regresores (generalmenteincógnita{\displaystyle X}). La versión más simple y más utilizada de este modelo es el modelo lineal normal , en el quey{\displaystyle y}dadoincógnita{\displaystyle X}tiene una distribución gaussiana . En este modelo, y bajo una elección particular de probabilidades a priori para los parámetros —las llamadas probabilidades a priori conjugadas— , la distribución a posteriori puede hallarse analíticamente. Con probabilidades a priori elegidas de forma más arbitraria, las distribuciones a posteriori generalmente deben aproximarse.

Configuración del modelo

Consideremos un problema de regresión lineal estándar, en el que parai=1,,norte{\displaystyle i=1,\ldots ,n}especificamos la media de la distribución condicional deyi{\displaystyle y_{i}}dado unk×1{\displaystyle k\times 1}vector predictorincógnitai{\displaystyle \mathbf {x} _ {i}}: yi=incógnitaiTβ+εi,{\displaystyle y_{i}=\mathbf {x} _{i}^{\mathsf {T}}{\boldsymbol {\beta }}+\varepsilon _{i},}

dóndeβ{\displaystyle {\boldsymbol {\beta }}}es unk×1{\displaystyle k\times 1}vector y elεi{\displaystyle \varepsilon _ {i}}son variables aleatorias independientes e idénticamente distribuidas normalmente :εinorte(0,σ2).{\displaystyle \varepsilon _{i}\sim N(0,\sigma ^{2}).}

Esto corresponde a la siguiente función de verosimilitud :

ρ(yincógnita,β,σ2)(σ2)norte/2exp(12σ2(yincógnitaβ)T(yincógnitaβ)).{\displaystyle \rho (\mathbf {y} \mid \mathbf {X} ,{\boldsymbol {\beta }},\sigma ^{2})\propto (\sigma ^{2})^{-n/2}\exp \left(-{\frac {1}{2\sigma ^{2}}}(\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})\right).}

La solución de mínimos cuadrados ordinarios se utiliza para estimar el vector de coeficientes mediante la pseudoinversa de Moore-Penrose : β^=(incógnitaTincógnita)1incógnitaTy{\displaystyle {\hat {\boldsymbol {\beta }}}=(\mathbf {X} ^{\mathsf {T}}\mathbf {X} )^{-1}\mathbf {X} ^{\mathsf {T}}\mathbf {y} }

dóndeincógnita{\displaystyle \mathbf {X} }es elnorte×k{\displaystyle n\times k}matriz de diseño , cada fila de la cual es un vector predictorincógnitaiT{\displaystyle \mathbf {x} _{i}^{\mathsf {T}}}; yy{\displaystyle \mathbf {y} }es la columnanorte{\displaystyle n}-vector[y1ynorte]T{\displaystyle [y_{1}\;\cdots \;y_{n}]^{\mathsf {T}}}.

Este es un enfoque frecuentista , y supone que hay suficientes mediciones para decir algo significativo sobreβ{\displaystyle {\boldsymbol {\beta }}}En el enfoque bayesiano , [ 1 ] los datos se complementan con información adicional en forma de una distribución de probabilidad previa . La creencia previa sobre los parámetros se combina con la función de verosimilitud de los datos según el teorema de Bayes para obtener la creencia posterior sobre los parámetros.β{\displaystyle {\boldsymbol {\beta }}}yσ{\displaystyle \sigma }. El prior puede adoptar diferentes formas funcionales dependiendo del dominio y de la información que esté disponible a priori .

Dado que los datos comprenden ambosy{\displaystyle \mathbf {y} }yincógnita{\displaystyle \mathbf {X} }, el enfoque únicamente en la distribución dey{\displaystyle \mathbf {y} }condicionado aincógnita{\displaystyle \mathbf {X} }necesita justificación. De hecho, un análisis bayesiano "completo" requeriría una probabilidad conjunta.ρ(y,incógnitaβ,σ2,γ){\displaystyle \rho (\mathbf {y} ,\mathbf {X} \mid {\boldsymbol {\beta }},\sigma ^{2},\gamma )}junto con un anteriorρ(β,σ2,γ){\displaystyle \rho (\beta ,\sigma ^{2},\gamma )}, dóndeγ{\displaystyle \gamma }simboliza los parámetros de la distribución paraincógnita{\displaystyle \mathbf {X} }.

Podemos factorizar la verosimilitud conjunta asumiendo una exogeneidad estricta . [ 2 ] La exogeneidad estricta requiere:

  • que el vector de parámetros puedeθ=(β,γ){\displaystyle {\boldsymbol {\theta }}=({\boldsymbol {\beta }},\gamma )}se descompondrá en dos componentes, conβ{\displaystyle {\boldsymbol {\beta }}}indexación de la densidad condicional de la variable de respuestaρ(yiincógnitai){\displaystyle \rho (y_{i}\mid {\boldsymbol {x}}_{i})}yγ{\displaystyle \gamma }indexación de la densidad marginal de los regresoresρ(incógnitai){\displaystyle \rho ({\boldsymbol {x}}_{i})}
  • ese punto de datosyj{\displaystyle y_{j}}no transmitir ninguna información adicional sobre el punto de datosyi{\displaystyle y_{i}}más allá de lo contenido en los regresoresincógnitai{\displaystyle {\boldsymbol {x}}_{i}}y el vector de parámetrosβ{\displaystyle {\boldsymbol {\beta }}}

Formalmente, la primera condición requiere que ρ(yiincógnitai,θ)=ρ(yiincógnitai,β){\displaystyle \rho (y_{i}\mid {\boldsymbol {x}}_{i},{\boldsymbol {\theta }})=\rho (y_{i}\mid {\boldsymbol {x}}_{i},{\boldsymbol {\beta }})}yρ(incógnitaiθ)=ρ(incógnitaiγ){\displaystyle \rho ({\boldsymbol {x}}_{i}\mid {\boldsymbol {\theta }})=\rho ({\boldsymbol {x}}_{i}\mid \gamma )}y la segunda condición requiereρ(yi|yj,incógnitai,incógnitaj,β)=ρ(yi|incógnitai,β){\displaystyle \rho (y_{i}|y_{j},{\boldsymbol {x}}_{i},{\boldsymbol {x}}_{j},{\boldsymbol {\beta }})=\rho (y_{i}|{\boldsymbol {x}}_{i},{\boldsymbol {\beta }})}a pesar deji{\displaystyle j\neq i}.

Bajo exogeneidad estricta, la probabilidad conjunta puede entonces ser considerada como factor enρ(yincógnita,β,σ2)ρ(incógnitaγ){\displaystyle \rho (\mathbf {y} \mid {\boldsymbol {\mathbf {X} }},\beta ,\sigma ^{2})\rho (\mathbf {X} \mid \gamma )}. Esta última parte suele ignorarse bajo el supuesto de conjuntos de parámetros disjuntos. Más fuertemente,incógnita{\displaystyle \mathbf {X} }A menudo se considera elegido (por ejemplo, en un experimento diseñado) y, por lo tanto, tiene una probabilidad conocida sin parámetros. [ 3 ]

Con priors conjugados

Distribución previa conjugada

Para una distribución a priori arbitraria, puede que no exista una solución analítica para la distribución a posteriori . En esta sección, consideraremos una distribución a priori conjugada , cuya distribución a posteriori puede derivarse analíticamente.

Un anteriorρ(β,σ2){\displaystyle \rho ({\boldsymbol {\beta }},\sigma ^{2})}es conjugada a esta función de verosimilitud si la posterior tiene la misma forma funcional con respecto aβ{\displaystyle {\boldsymbol {\beta }}}yσ{\displaystyle \sigma }Dado que la log-verosimilitud es cuadrática enβ{\displaystyle {\boldsymbol {\beta }}}, la log-verosimilitud se reescribe de tal manera que la verosimilitud se vuelve normal en(ββ^){\displaystyle ({\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}})}. Escribir

(yincógnitaβ)T(yincógnitaβ)=[(yincógnitaβ^)+(incógnitaβ^incógnitaβ)]T[(yincógnitaβ^)+(incógnitaβ^incógnitaβ)]=(yincógnitaβ^)T(yincógnitaβ^)+(ββ^)T(incógnitaTincógnita)(ββ^)+2(incógnitaβ^incógnitaβ)T(yincógnitaβ^)= 0=(yincógnitaβ^)T(yincógnitaβ^)+(ββ^)T(incógnitaTincógnita)(ββ^).{\displaystyle {\begin{aligned}(\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})&=[(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})+(\mathbf {X} {\hat {\boldsymbol {\beta }}}-\mathbf {X} {\boldsymbol {\beta }})]^{\mathsf {T}}[(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})+(\mathbf {X} {\hat {\boldsymbol {\beta }}}-\mathbf {X} {\boldsymbol {\beta }})]\\&=(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})+({\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}})^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} )({\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}})+\underbrace {2(\mathbf {X} {\hat {\boldsymbol {\beta }}}-\mathbf {X} {\boldsymbol {\beta }})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})} _{=\ 0}\\&=(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})+({\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}})^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} )({\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}})\,.\end{aligned}}}

La probabilidad ahora se reescribe como ρ(y|incógnita,β,σ2)(σ2)v2exp(vs22σ2)(σ2)nortev2exp(12σ2(ββ^)T(incógnitaTincógnita)(ββ^)),{\displaystyle \rho (\mathbf {y} |\mathbf {X} ,{\boldsymbol {\beta }},\sigma ^{2})\propto (\sigma ^{2})^{-{\frac {v}{2}}}\exp \left(-{\frac {vs^{2}}{2{\sigma }^{2}}}\right)(\sigma ^{2})^{-{\frac {n-v}{2}}}\exp \left(-{\frac {1}{2{\sigma }^{2}}}({\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}})^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} )({\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}})\right),} dónde vs2=(yincógnitaβ^)T(yincógnitaβ^) y v=nortek,{\displaystyle vs^{2}=(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})\quad {\text{ and }}\quad v=n-k,} dóndek{\displaystyle k}es el número de coeficientes de regresión.

Esto sugiere una forma para la distribución a priori: ρ(β,σ2)=ρ(σ2)ρ(βσ2),{\displaystyle \rho ({\boldsymbol {\beta }},\sigma ^{2})=\rho (\sigma ^{2})\rho ({\boldsymbol {\beta }}\mid \sigma ^{2}),} dóndeρ(σ2){\displaystyle \rho (\sigma ^{2})}es una distribución gamma inversaρ(σ2)(σ2)v021exp(v0s022σ2).{\displaystyle \rho (\sigma ^{2})\propto (\sigma ^{2})^{-{\frac {v_{0}}{2}}-1}\exp \left(-{\frac {v_{0}s_{0}^{2}}{2\sigma ^{2}}}\right).}

En la notación introducida en el artículo sobre la distribución gamma inversa , esta es la densidad de unaInv-Gamma(a0,b0){\displaystyle {\text{Inv-Gamma}}(a_{0},b_{0})}distribución cona0=v02{\displaystyle a_{0}={\tfrac {v_{0}}{2}}}yb0=12v0s02{\displaystyle b_{0}={\tfrac {1}{2}}v_{0}s_{0}^{2}}conv0{\displaystyle v_{0}}ys02{\displaystyle s_{0}^{2}}como los valores previos dev{\displaystyle v}ys2{\displaystyle s^{2}}, respectivamente. De forma equivalente, también puede describirse como una distribución chi-cuadrado inversa escalada ,Escala-inv-χ2(v0,s02).{\displaystyle {\text{Scale-inv-}}\chi ^{2}(v_{0},s_{0}^{2}).}

Además, la densidad previa condicionalρ(β|σ2){\displaystyle \rho ({\boldsymbol {\beta }}|\sigma ^{2})}es una distribución normal ,

ρ(βσ2)(σ2)k/2exp(12σ2(βμ0)TΛ0(βμ0)).{\displaystyle \rho ({\boldsymbol {\beta }}\mid \sigma ^{2})\propto (\sigma ^{2})^{-k/2}\exp \left(-{\frac {1}{2\sigma ^{2}}}({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{0})^{\mathsf {T}}\mathbf {\Lambda } _{0}({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{0})\right).}

En la notación de la distribución normal , la distribución a priori condicional esnorte(μ0,σ2Λ01).{\displaystyle {\mathcal {N}}\left({\boldsymbol {\mu }}_{0},\sigma ^{2}{\boldsymbol {\Lambda }}_{0}^{-1}\right).}

Distribución posterior

Ahora que se ha especificado la distribución a priori, la distribución a posteriori se puede expresar como

ρ(β,σ2y,incógnita)ρ(yincógnita,β,σ2)ρ(βσ2)ρ(σ2)(σ2)norte/2exp(12σ2(yincógnitaβ)T(yincógnitaβ))(σ2)k/2exp(12σ2(βμ0)TΛ0(βμ0))(σ2)(a0+1)exp(b0σ2){\displaystyle {\begin{aligned}\rho ({\boldsymbol {\beta }},\sigma ^{2}\mid \mathbf {y} ,\mathbf {X} )&\propto \rho (\mathbf {y} \mid \mathbf {X} ,{\boldsymbol {\beta }},\sigma ^{2})\rho ({\boldsymbol {\beta }}\mid \sigma ^{2})\rho (\sigma ^{2})\\&\propto (\sigma ^{2})^{-n/2}\exp \left(-{\frac {1}{2{\sigma }^{2}}}(\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})\right)(\sigma ^{2})^{-k/2}\exp \left(-{\frac {1}{2\sigma ^{2}}}({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{0})^{\mathsf {T}}{\boldsymbol {\Lambda }}_{0}({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{0})\right)(\sigma ^{2})^{-(a_{0}+1)}\exp \left(-{\frac {b_{0}}{\sigma ^{2}}}\right)\end{aligned}}}

Con cierta reorganización, [ 4 ] la distribución posterior puede reescribirse de modo que la media posteriorμnorte{\displaystyle {\boldsymbol {\mu }}_{n}}del vector de parámetrosβ{\displaystyle {\boldsymbol {\beta }}}puede expresarse en términos del estimador de mínimos cuadradosβ^{\displaystyle {\hat {\boldsymbol {\beta }}}}y la media previaμ0{\displaystyle {\boldsymbol {\mu }}_{0}}, con la fuerza de la distribución a priori indicada por la matriz de precisión a prioriΛ0{\displaystyle {\boldsymbol {\Lambda }}_{0}}

μnorte=(incógnitaTincógnita+Λ0)1(incógnitaTincógnitaβ^+Λ0μ0).{\displaystyle {\boldsymbol {\mu }}_{n}=(\mathbf {X} ^{\mathsf {T}}\mathbf {X} +{\boldsymbol {\Lambda }}_{0})^{-1}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} {\hat {\boldsymbol {\beta }}}+{\boldsymbol {\Lambda }}_{0}{\boldsymbol {\mu }}_{0}).}

Para justificar esoμnorte{\displaystyle {\boldsymbol {\mu }}_{n}}es de hecho la media posterior, los términos cuadráticos en la exponencial se pueden reordenar como una forma cuadrática enβμnorte{\displaystyle {\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{n}}. [ 5 ]

(yincógnitaβ)T(yincógnitaβ)+(βμ0)TΛ0(βμ0)=(βμnorte)T(incógnitaTincógnita+Λ0)(βμnorte)+yTyμnorteT(incógnitaTincógnita+Λ0)μnorte+μ0TΛ0μ0.{\displaystyle (\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})^{\mathsf {T}}(\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }})+({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{0})^{\mathsf {T}}{\boldsymbol {\Lambda }}_{0}({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{0})=({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{n})^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} +{\boldsymbol {\Lambda }}_{0})({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{n})+\mathbf {y} ^{\mathsf {T}}\mathbf {y} -{\boldsymbol {\mu }}_{n}^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} +{\boldsymbol {\Lambda }}_{0}){\boldsymbol {\mu }}_{n}+{\boldsymbol {\mu }}_{0}^{\mathsf {T}}{\boldsymbol {\Lambda }}_{0}{\boldsymbol {\mu }}_{0}.}

Ahora, la distribución posterior se puede expresar como una distribución normal multiplicada por una distribución gamma inversa :

ρ(β,σ2y,incógnita)(σ2)k/2exp(12σ2(βμnorte)T(incógnitaTincógnita+Λ0)(βμnorte))(σ2)norte+2a021exp(2b0+yTyμnorteT(incógnitaTincógnita+Λ0)μnorte+μ0TΛ0μ02σ2).{\displaystyle \rho ({\boldsymbol {\beta }},\sigma ^{2}\mid \mathbf {y} ,\mathbf {X} )\propto (\sigma ^{2})^{-k/2}\exp \left(-{\frac {1}{2{\sigma }^{2}}}({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{n})^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} +\mathbf {\Lambda } _{0})({\boldsymbol {\beta }}-{\boldsymbol {\mu }}_{n})\right)(\sigma ^{2})^{-{\frac {n+2a_{0}}{2}}-1}\exp \left(-{\frac {2b_{0}+\mathbf {y} ^{\mathsf {T}}\mathbf {y} -{\boldsymbol {\mu }}_{n}^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} +{\boldsymbol {\Lambda }}_{0}){\boldsymbol {\mu }}_{n}+{\boldsymbol {\mu }}_{0}^{\mathsf {T}}{\boldsymbol {\Lambda }}_{0}{\boldsymbol {\mu }}_{0}}{2\sigma ^{2}}}\right).}

Por lo tanto, la distribución posterior se puede parametrizar de la siguiente manera. ρ(β,σ2y,incógnita)ρ(βσ2,y,incógnita)ρ(σ2y,incógnita),{\displaystyle \rho ({\boldsymbol {\beta }},\sigma ^{2}\mid \mathbf {y} ,\mathbf {X} )\propto \rho ({\boldsymbol {\beta }}\mid \sigma ^{2},\mathbf {y} ,\mathbf {X} )\rho (\sigma ^{2}\mid \mathbf {y} ,\mathbf {X} ),} donde los dos factores corresponden a las densidades denorte(μnorte,σ2Λnorte1){\displaystyle {\mathcal {N}}\left({\boldsymbol {\mu }}_{n},\sigma ^{2}{\boldsymbol {\Lambda }}_{n}^{-1}\right)\,}yInv-Gamma(anorte,bnorte){\displaystyle {\text{Inv-Gamma}}\left(a_{n},b_{n}\right)}distribuciones, cuyos parámetros vienen dados por

Λnorte=(incógnitaTincógnita+Λ0),μnorte=(Λnorte)1(incógnitaTincógnitaβ^+Λ0μ0),{\displaystyle {\boldsymbol {\Lambda }}_{n}=(\mathbf {X} ^{\mathsf {T}}\mathbf {X} +\mathbf {\Lambda } _{0}),\quad {\boldsymbol {\mu }}_{n}=({\boldsymbol {\Lambda }}_{n})^{-1}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} {\hat {\boldsymbol {\beta }}}+{\boldsymbol {\Lambda }}_{0}{\boldsymbol {\mu }}_{0}),}anorte=a0+norte2,bnorte=b0+12(yTy+μ0TΛ0μ0μnorteTΛnorteμnorte).{\displaystyle a_{n}=a_{0}+{\frac {n}{2}},\qquad b_{n}=b_{0}+{\frac {1}{2}}(\mathbf {y} ^{\mathsf {T}}\mathbf {y} +{\boldsymbol {\mu }}_{0}^{\mathsf {T}}{\boldsymbol {\Lambda }}_{0}{\boldsymbol {\mu }}_{0}-{\boldsymbol {\mu }}_{n}^{\mathsf {T}}{\boldsymbol {\Lambda }}_{n}{\boldsymbol {\mu }}_{n}).}

lo que ilustra que la inferencia bayesiana es un compromiso entre la información contenida en la distribución a priori y la información contenida en la muestra.

Evidencia del modelo

La evidencia del modelopag(ymetro){\displaystyle p(\mathbf {y} \mid m)}es la probabilidad de los datos dado el modelometro{\displaystyle m}También se conoce como verosimilitud marginal y como densidad predictiva previa . Aquí, el modelo se define mediante la función de verosimilitud.pag(yincógnita,β,σ){\displaystyle p(\mathbf {y} \mid \mathbf {X} ,{\boldsymbol {\beta }},\sigma )}y la distribución previa de los parámetros, es decirpag(β,σ){\displaystyle p({\boldsymbol {\beta }},\sigma )}La evidencia del modelo captura en un solo número qué tan bien dicho modelo explica las observaciones. La evidencia del modelo de regresión lineal bayesiana presentada en esta sección se puede utilizar para comparar modelos lineales competidores mediante factores de Bayes . Estos modelos pueden diferir en el número y los valores de las variables predictoras, así como en sus priors sobre los parámetros del modelo. La complejidad del modelo ya está tomada en cuenta por la evidencia del modelo, porque marginaliza los parámetros mediante la integración.pag(y,β,σincógnita){\displaystyle p(\mathbf {y} ,{\boldsymbol {\beta }},\sigma \mid \mathbf {X} )}sobre todos los valores posibles deβ{\displaystyle {\boldsymbol {\beta }}}yσ{\displaystyle \sigma }. pag(y|metro)=pag(yincógnita,β,σ)pag(β,σ)dβdσ{\displaystyle p(\mathbf {y} |m)=\int p(\mathbf {y} \mid \mathbf {X} ,{\boldsymbol {\beta }},\sigma )\,p({\boldsymbol {\beta }},\sigma )\,d{\boldsymbol {\beta }}\,d\sigma } Esta integral se puede calcular analíticamente y la solución se da en la siguiente ecuación. [ 6 ]pag(ymetro)=1(2π)norte/2det(Λ0)det(Λnorte)b0a0bnorteanorteΓ(anorte)Γ(a0){\displaystyle p(\mathbf {y} \mid m)={\frac {1}{(2\pi )^{n/2}}}{\sqrt {\frac {\det({\boldsymbol {\Lambda }}_{0})}{\det({\boldsymbol {\Lambda }}_{n})}}}\cdot {\frac {b_{0}^{a_{0}}}{b_{n}^{a_{n}}}}\cdot {\frac {\Gamma (a_{n})}{\Gamma (a_{0})}}}

AquíΓ{\displaystyle \Gamma }denota la función gamma . Debido a que hemos elegido una distribución a priori conjugada, la verosimilitud marginal también se puede calcular fácilmente evaluando la siguiente igualdad para valores arbitrarios deβ{\displaystyle {\boldsymbol {\beta }}}yσ{\displaystyle \sigma }. [ 7 ]pag(ymetro)=pag(β,σ|metro)pag(yincógnita,β,σ,metro)pag(β,σy,incógnita,metro){\displaystyle p(\mathbf {y} \mid m)={\frac {p({\boldsymbol {\beta }},\sigma |m)\,p(\mathbf {y} \mid \mathbf {X} ,{\boldsymbol {\beta }},\sigma ,m)}{p({\boldsymbol {\beta }},\sigma \mid \mathbf {y} ,\mathbf {X} ,m)}}} Cabe destacar que esta ecuación se deriva de una reordenación del teorema de Bayes . Al insertar las fórmulas para la distribución a priori, la verosimilitud y la distribución a posteriori, y simplificar la expresión resultante, se obtiene la expresión analítica mencionada anteriormente.

Otros casos

En general, puede ser imposible o poco práctico derivar la distribución posterior analíticamente. Sin embargo, es posible aproximar la distribución posterior mediante un método de inferencia bayesiana aproximada como el muestreo de Monte Carlo , [ 8 ] INLA o Bayes variacional .

El caso especialμ0=0,Λ0=doI{\displaystyle {\boldsymbol {\mu }}_{0}=0,\mathbf {\Lambda } _{0}=c\mathbf {I} }se denomina regresión de cresta .

Se puede realizar un análisis similar para el caso general de la regresión multivariante y parte de este proporciona la estimación bayesiana de matrices de covarianza : véase regresión lineal multivariante bayesiana .

Véase también

Notas

  1. Huang, Yunfei; Gompper, Gerhard; Sabass, Benedikt (2020). "Un método de microscopía de fuerza de tracción bayesiana con eliminación de ruido automatizada en un paquete de software fácil de usar". Computer Physics Communications . 256 107313. arXiv : 2005.01377 . Bibcode : 2020CoPhC.25607313H . doi : 10.1016/j.cpc.2020.107313 .
  2. Véase Jackman (2009), pág. 101.
  3. Véase Gelman et al. (2013), pág. 354.
  4. Los pasos intermedios de este cálculo se pueden encontrar en O'Hagan (1994) al principio del capítulo sobre modelos lineales.
  5. Los pasos intermedios se encuentran en Fahrmeir et al. (2009) en la página 188.
  6. Los pasos intermedios de este cálculo se pueden encontrar en O'Hagan (1994) en la página 257.
  7. Chib, Siddhartha (1995). "Verosimilitud marginal a partir de la salida de Gibbs". Journal of the American Statistical Association . 90 (432): 1313– 1321. doi : 10.2307/2291521 .
  8. Carlin y Louis (2008) y Gelman, et al. (2003) explican cómo utilizar métodos de muestreo para la regresión lineal bayesiana.

Referencias

  • Box, GEP ; Tiao, GC (1973). Inferencia bayesiana en el análisis estadístico . Wiley. ISBN 0-471-57428-7.
  • Carlin, Bradley P.; Louis, Thomas A. (2008). Métodos bayesianos para el análisis de datos (Tercera  ed.). Boca Raton, FL: Chapman and Hall/CRC. ISBN 978-1-58488-697-6.
  • Fahrmeir, L.; Kneib, T.; Lang, S. (2009). Regresión. Modelle, Methoden und Anwendungen (Segunda  ed.). Heidelberg: Springer. doi : 10.1007/978-3-642-01837-4 . ISBN 978-3-642-01836-7.
  • Gelman, Andrew ; et  al. (2013). «Introducción a los modelos de regresión». Análisis de datos bayesianos (Tercera  ed.). Boca Raton, FL: Chapman and Hall/CRC. pp. 353–380 . ISBN  978-1-4398-4095-5.
  • Jackman, Simon (2009). «Modelos de regresión». Análisis bayesiano para las ciencias sociales . Wiley. pp. 99–124 . ISBN  978-0-470-01154-6.
  • Rossi, Peter E.; Allenby, Greg M.; McCulloch, Robert (2006). Estadística bayesiana y marketing . John Wiley & Sons. ISBN 0-470-86367-6.
  • O'Hagan, Anthony (1994). Inferencia bayesiana . Teoría avanzada de la estadística de Kendall. Vol.  2B (Primera  ed.). Halsted. ISBN 0-340-52922-9.
  • Estimación bayesiana de modelos lineales (wikibook de programación R) . Regresión lineal bayesiana implementada en R.