Articulo de referencia

Distribución normal-gamma

\\mu\\, [[location parameter|location]] ([[real number|real]]) \\lambda > 0\\, (real) \\alpha > 0\\, (real) \\beta > 0\\, (real)"},"support":{"wt":" x \\in (-\\infty, \\infty)\\...

En teoría de la probabilidad y estadística , la distribución normal-gamma (o distribución gaussiana-gamma ) es una familia bivariada de cuatro parámetros de distribuciones de probabilidad continuas . Es la distribución a priori conjugada de una distribución normal con media y precisión desconocidas . [ 2 ]

Definición

Para un par de variables aleatorias ( X , T ), supongamos que la distribución condicional de X dado T viene dada por

incógnitaTnorte(μ,1/(λT)),{\displaystyle X\mid T\sim N(\mu ,1/(\lambda T))\,\!,}

lo que significa que la distribución condicional es una distribución normal con mediaμ{\displaystyle \mu }y precisiónλT{\displaystyle \lambda T}— equivalentemente, con varianza1/(λT).{\displaystyle 1/(\lambda T).}

Supongamos también que la distribución marginal de T viene dada por

Tα,βGama(α,β),{\displaystyle T\mid \alpha ,\beta \sim \operatorname {Gamma} (\alpha ,\beta ),}

donde esto significa que T tiene una distribución gamma . Aquí λ , α y β son parámetros de la distribución conjunta.

Entonces ( X , T ) tiene una distribución normal-gamma, y ​​esto se denota por

(incógnita,T)NormalGamma(μ,λ,α,β).{\displaystyle (X,T)\sim \operatorname {NormalGamma} (\mu,\lambda,\alpha,\beta).}

Propiedades

Función de densidad de probabilidad

La función de densidad de probabilidad conjunta de ( X , T ) es

F(incógnita,τμ,λ,α,β)=βαλΓ(α)2πτα12miβτexp(λτ(incógnitaμ)22),{\displaystyle f(x,\tau \mid \mu ,\lambda ,\alpha ,\beta )={\frac {\beta ^{\alpha }{\sqrt {\lambda }}}{\Gamma (\alpha ){\sqrt {2\pi }}}}\,\tau ^{\alpha -{\frac {1}{2}}}\,e^{-\beta \tau }\exp \left(-{\frac {\lambda \tau (x-\mu )^{2}}{2}}\right),}

donde la probabilidad condicional paraF(incógnita,τμ,λ,α,β)=F(incógnitaτ,μ,λ,α,β)F(τμ,λ,α,β){\displaystyle f(x,\tau \mid \mu ,\lambda ,\alpha ,\beta )=f(x\mid \tau ,\mu ,\lambda ,\alpha ,\beta )f(\tau \mid \mu ,\lambda ,\alpha ,\beta )} se utilizó.

Distribuciones marginales

Por construcción, la distribución marginal deτ{\displaystyle \tau }es una distribución gamma y la distribución condicional deincógnita{\displaystyle x}dadoτ{\displaystyle \tau }es una distribución gaussiana . La distribución marginal deincógnita{\displaystyle x}es una distribución t de Student no estandarizada de tres parámetros con parámetros(ν,μ,σ2)=(2α,μ,β/(λα)){\displaystyle (\nu ,\mu ,\sigma ^{2})=(2\alpha ,\mu ,\beta /(\lambda \alpha ))}.

Familia exponencial

La distribución normal-gamma es una familia exponencial de cuatro parámetros con parámetros naturales.α1/2,βλμ2/2,λμ,λ/2{\displaystyle \alpha -1/2,-\beta -\lambda \mu ^{2}/2,\lambda \mu ,-\lambda /2}y estadística naturallnτ,τ,τincógnita,τincógnita2{\displaystyle \ln \tau ,\tau ,\tau x,\tau x^{2}}.

Momentos de la estadística natural

Los siguientes momentos se pueden calcular fácilmente utilizando la función generadora de momentos de la estadística suficiente : [ 3 ]

mi(lnT)=ψ(α)lnβ,{\displaystyle \operatorname {E} (\ln T)=\psi \left(\alpha \right)-\ln \beta ,}

dóndeψ(α){\displaystyle \psi \left(\alpha \right)}es la función digamma ,

mi(T)=αβ,mi(Tincógnita)=μαβ,mi(Tincógnita2)=1λ+μ2αβ.{\displaystyle {\begin{aligned}\operatorname {E} (T)&={\frac {\alpha }{\beta }},\\[5pt]\operatorname {E} (TX)&=\mu {\frac {\alpha }{\beta }},\\[5pt]\operatorname {E} (TX^{2})&={\frac {1}{\lambda }}+\mu ^{2}{\frac {\alpha }{\beta }}.\end{aligned}}}

Escalada

Si(incógnita,T)norteormetroalGRAMOametrometroa(μ,λ,α,β),{\displaystyle (X,T)\sim \mathrm {NormalGamma} (\mu ,\lambda ,\alpha ,\beta ),}entonces para cualquierb>0,(bincógnita,bT){\displaystyle b>0,(bX,bT)}se distribuye comonorteormetroalGRAMOametrometroa(bμ,λ/b3,α,β/b).{\displaystyle {\rm {NormalGamma}}(b\mu ,\lambda /b^{3},\alpha ,\beta /b).}

Distribución posterior de los parámetros

Supongamos que x se distribuye según una distribución normal con media desconocida.μ{\displaystyle \mu }y precisiónτ{\displaystyle \tau }.

incógnitanorte(μ,τ1){\displaystyle x\sim {\mathcal {N}}(\mu ,\tau ^{-1})}

y que la distribución previa enμ{\displaystyle \mu }yτ{\displaystyle \tau }, (μ,τ){\displaystyle (\mu ,\tau )}tiene una distribución normal-gamma

(μ,τ)NormalGamma(μ0,λ0,α0,β0),{\displaystyle (\mu ,\tau )\sim {\text{NormalGamma}}(\mu _{0},\lambda _{0},\alpha _{0},\beta _{0}),}

para la cual la densidad π satisface

π(μ,τ)τα012exp[β0τ]exp[λ0τ(μμ0)22].{\displaystyle \pi (\mu ,\tau )\propto \tau ^{\alpha _{0}-{\frac {1}{2}}}\,\exp[-\beta _{0}\tau ]\,\exp \left[-{\frac {\lambda _{0}\tau (\mu -\mu _{0})^{2}}{2}}\right].}

Suponer

incógnita1,,incógnitanorteμ,τi.i.d.norte(μ,τ1),{\displaystyle x_{1},\ldots ,x_{n}\mid \mu ,\tau \sim \operatorname {{i.}{i.}{d.}} \operatorname {N} \left(\mu ,\tau ^{-1}\right),}

es decir, los componentes deincógnita=(incógnita1,,incógnitanorte){\displaystyle \mathbf {X} =(x_{1},\ldots ,x_{n})}son condicionalmente independientes dadoμ,τ{\displaystyle \mu ,\tau }y la distribución condicional de cada uno de ellos dadoμ,τ{\displaystyle \mu ,\tau }es normal con el valor esperadoμ{\displaystyle \mu }y varianza1/τ.{\displaystyle 1/\tau .}La distribución posterior deμ{\displaystyle \mu }yτ{\displaystyle \tau }dado este conjunto de datosincógnita{\displaystyle \mathbb {X} }puede determinarse analíticamente mediante el teorema de Bayes [ 4 ] explícitamente,

PAG(τ,μincógnita)L(incógnitaτ,μ)π(τ,μ),{\displaystyle \mathbf {P} (\tau ,\mu \mid \mathbf {X} )\propto \mathbf {L} (\mathbf {X} \mid \tau ,\mu )\pi (\tau ,\mu ),}

dóndeL{\displaystyle \mathbf {L} }es la probabilidad de los parámetros dados los datos.

Dado que los datos son i.i.d., la probabilidad del conjunto de datos completo es igual al producto de las probabilidades de las muestras de datos individuales:

L(incógnitaτ,μ)=i=1norteL(incógnitaiτ,μ).{\displaystyle \mathbf {L} (\mathbf {X} \mid \tau ,\mu )=\prod _{i=1}^{n}\mathbf {L} (x_{i}\mid \tau ,\mu ).}

Esta expresión se puede simplificar de la siguiente manera:

L(incógnitaτ,μ)i=1norteτ1/2exp[τ2(incógnitaiμ)2]τnorte/2exp[τ2i=1norte(incógnitaiμ)2]τnorte/2exp[τ2i=1norte(incógnitaiincógnita¯+incógnita¯μ)2]τnorte/2exp[τ2i=1norte((incógnitaiincógnita¯)2+(incógnita¯μ)2)]τnorte/2exp[τ2(nortes+norte(incógnita¯μ)2)],{\displaystyle {\begin{aligned}\mathbf {L} (\mathbf {X} \mid \tau ,\mu )&\propto \prod _{i=1}^{n}\tau ^{1/2}\exp \left[{\frac {-\tau }{2}}(x_{i}-\mu )^{2}\right]\\[5pt]&\propto \tau ^{n/2}\exp \left[{\frac {-\tau }{2}}\sum _{i=1}^{n}(x_{i}-\mu )^{2}\right]\\[5pt]&\propto \tau ^{n/2}\exp \left[{\frac {-\tau }{2}}\sum _{i=1}^{n}(x_{i}-{\bar {x}}+{\bar {x}}-\mu )^{2}\right]\\[5pt]&\propto \tau ^{n/2}\exp \left[{\frac {-\tau }{2}}\sum _{i=1}^{n}\left((x_{i}-{\bar {x}})^{2}+({\bar {x}}-\mu )^{2}\right)\right]\\[5pt]&\propto \tau ^{n/2}\exp \left[{\frac {-\tau }{2}}\left(ns+n({\bar {x}}-\mu )^{2}\right)\right],\end{aligned}}}

dóndeincógnita¯=1nortei=1norteincógnitai{\displaystyle {\bar {x}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}}, la media de las muestras de datos, ys=1nortei=1norte(incógnitaiincógnita¯)2{\displaystyle s={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}, la varianza de la muestra.

La distribución posterior de los parámetros es proporcional a la distribución previa multiplicada por la verosimilitud.

PAG(τ,μincógnita)L(incógnitaτ,μ)π(τ,μ)τnorte/2exp[τ2(nortes+norte(incógnita¯μ)2)]τα012exp[β0τ]exp[λ0τ(μμ0)22]τnorte2+α012exp[τ(12nortes+β0)]exp[τ2(λ0(μμ0)2+norte(incógnita¯μ)2)]{\displaystyle {\begin{aligned}\mathbf {P} (\tau ,\mu \mid \mathbf {X} )&\propto \mathbf {L} (\mathbf {X} \mid \tau ,\mu )\pi (\tau ,\mu )\\&\propto \tau ^{n/2}\exp \left[{\frac {-\tau }{2}}\left(ns+n({\bar {x}}-\mu )^{2}\right)\right]\tau ^{\alpha _{0}-{\frac {1}{2}}}\,\exp[{-\beta _{0}\tau }]\,\exp \left[-{\frac {\lambda _{0}\tau (\mu -\mu _{0})^{2}}{2}}\right]\\&\propto \tau ^{{\frac {n}{2}}+\alpha _{0}-{\frac {1}{2}}}\exp \left[-\tau \left({\frac {1}{2}}ns+\beta _{0}\right)\right]\exp \left[-{\frac {\tau }{2}}\left(\lambda _{0}(\mu -\mu _{0})^{2}+n({\bar {x}}-\mu )^{2}\right)\right]\end{aligned}}}

El último término exponencial se simplifica completando el cuadrado.

λ0(μμ0)2+norte(incógnita¯μ)2=λ0μ22λ0μμ0+λ0μ02+norteμ22norteincógnita¯μ+norteincógnita¯2=(λ0+norte)μ22(λ0μ0+norteincógnita¯)μ+λ0μ02+norteincógnita¯2=(λ0+norte)(μ22λ0μ0+norteincógnita¯λ0+norteμ)+λ0μ02+norteincógnita¯2=(λ0+norte)(μλ0μ0+norteincógnita¯λ0+norte)2+λ0μ02+norteincógnita¯2(λ0μ0+norteincógnita¯)2λ0+norte=(λ0+norte)(μλ0μ0+norteincógnita¯λ0+norte)2+λ0norte(incógnita¯μ0)2λ0+norte{\displaystyle {\begin{aligned}\lambda _{0}(\mu -\mu _{0})^{2}+n({\bar {x}}-\mu )^{2}&=\lambda _{0}\mu ^{2}-2\lambda _{0}\mu \mu _{0}+\lambda _{0}\mu _{0}^{2}+n\mu ^{2}-2n{\bar {x}}\mu +n{\bar {x}}^{2}\\&=(\lambda _{0}+n)\mu ^{2}-2(\lambda _{0}\mu _{0}+n{\bar {x}})\mu +\lambda _{0}\mu _{0}^{2}+n{\bar {x}}^{2}\\&=(\lambda _{0}+n)(\mu ^{2}-2{\frac {\lambda _{0}\mu _{0}+n{\bar {x}}}{\lambda _{0}+n}}\mu )+\lambda _{0}\mu _{0}^{2}+n{\bar {x}}^{2}\\&=(\lambda _{0}+n)\left(\mu -{\frac {\lambda _{0}\mu _{0}+n{\bar {x}}}{\lambda _{0}+n}}\right)^{2}+\lambda _{0}\mu _{0}^{2}+n{\bar {x}}^{2}-{\frac {\left(\lambda _{0}\mu _{0}+n{\bar {x}}\right)^{2}}{\lambda _{0}+n}}\\&=(\lambda _{0}+n)\left(\mu -{\frac {\lambda _{0}\mu _{0}+n{\bar {x}}}{\lambda _{0}+n}}\right)^{2}+{\frac {\lambda _{0}n({\bar {x}}-\mu _{0})^{2}}{\lambda _{0}+n}}\end{aligned}}}

Al insertar esto de nuevo en la expresión anterior,

PAG(τ,μincógnita)τnorte2+α012exp[τ(12nortes+β0)]exp[τ2((λ0+norte)(μλ0μ0+norteincógnita¯λ0+norte)2+λ0norte(incógnita¯μ0)2λ0+norte)]τnorte2+α012exp[τ(12nortes+β0+λ0norte(incógnita¯μ0)22(λ0+norte))]exp[τ2(λ0+norte)(μλ0μ0+norteincógnita¯λ0+norte)2]{\displaystyle {\begin{aligned}\mathbf {P} (\tau ,\mu \mid \mathbf {X} )&\propto \tau ^{{\frac {n}{2}}+\alpha _{0}-{\frac {1}{2}}}\exp \left[-\tau \left({\frac {1}{2}}ns+\beta _{0}\right)\right]\exp \left[-{\frac {\tau }{2}}\left(\left(\lambda _{0}+n\right)\left(\mu -{\frac {\lambda _{0}\mu _{0}+n{\bar {x}}}{\lambda _{0}+n}}\right)^{2}+{\frac {\lambda _{0}n({\bar {x}}-\mu _{0})^{2}}{\lambda _{0}+n}}\right)\right]\\&\propto \tau ^{{\frac {n}{2}}+\alpha _{0}-{\frac {1}{2}}}\exp \left[-\tau \left({\frac {1}{2}}ns+\beta _{0}+{\frac {\lambda _{0}n({\bar {x}}-\mu _{0})^{2}}{2(\lambda _{0}+n)}}\right)\right]\exp \left[-{\frac {\tau }{2}}\left(\lambda _{0}+n\right)\left(\mu -{\frac {\lambda _{0}\mu _{0}+n{\bar {x}}}{\lambda _{0}+n}}\right)^{2}\right]\end{aligned}}}

Esta expresión final tiene exactamente la misma forma que una distribución Normal-Gamma, es decir,

PAG(τ,μincógnita)=NormalGamma(λ0μ0+norteincógnita¯λ0+norte,λ0+norte,α0+norte2,β0+12(nortes+λ0norte(incógnita¯μ0)2λ0+norte)){\displaystyle \mathbf {P} (\tau ,\mu \mid \mathbf {X} )={\text{NormalGamma}}\left({\frac {\lambda _{0}\mu _{0}+n{\bar {x}}}{\lambda _{0}+n}},\lambda _{0}+n,\alpha _{0}+{\frac {n}{2}},\beta _{0}+{\frac {1}{2}}\left(ns+{\frac {\lambda _{0}n({\bar {x}}-\mu _{0})^{2}}{\lambda _{0}+n}}\right)\right)}

Interpretación de parámetros

La interpretación de los parámetros en términos de pseudo-observaciones es la siguiente:

  • La nueva media se obtiene calculando un promedio ponderado de la antigua pseudomedia y la media observada, ponderado por el número de (pseudo)observaciones asociadas.
  • La precisión se estimó a partir de2α{\displaystyle 2\alpha }pseudo-observaciones (es decir, posiblemente un número diferente de pseudo-observaciones, para permitir que la varianza de la media y la precisión se controlen por separado) con media de la muestraμ{\displaystyle \mu }y varianza de la muestraβα{\displaystyle {\frac {\beta }{\alpha }}}(es decir, con la suma de las desviaciones al cuadrado)2β{\displaystyle 2\beta }).
  • La posterior actualiza el número de pseudo-observaciones (λ0{\displaystyle \lambda _{0}}) simplemente añadiendo el número correspondiente de nuevas observaciones (norte{\displaystyle n}).
  • La nueva suma de las desviaciones al cuadrado se calcula sumando las sumas anteriores de las desviaciones al cuadrado. Sin embargo, se necesita un tercer término de interacción porque los dos conjuntos de desviaciones al cuadrado se calcularon con respecto a medias diferentes, por lo que la suma de ambos subestima la desviación al cuadrado total real.

En consecuencia, si se tiene una media previa deμ0{\displaystyle \mu _{0}}denorteμ{\displaystyle n_{\mu }}muestras y una precisión previa deτ0{\displaystyle \tau _{0}}denorteτ{\displaystyle n_{\tau }}muestras, la distribución previa sobreμ{\displaystyle \mu }yτ{\displaystyle \tau }es

PAG(τ,μincógnita)=NormalGamma(μ0,norteμ,norteτ2,norteτ2τ0){\displaystyle \mathbf {P} (\tau ,\mu \mid \mathbf {X} )=\operatorname {NormalGamma} \left(\mu _{0},n_{\mu },{\frac {n_{\tau }}{2}},{\frac {n_{\tau }}{2\tau _{0}}}\right)}

y después de observarnorte{\displaystyle n}muestras con mediaμ{\displaystyle \mu }y varianzas{\displaystyle s}, la probabilidad posterior es

PAG(τ,μincógnita)=NormalGamma(norteμμ0+norteμnorteμ+norte,norteμ+norte,12(norteτ+norte),12(norteττ0+nortes+norteμnorte(μμ0)2norteμ+norte)){\displaystyle \mathbf {P} (\tau ,\mu \mid \mathbf {X} )={\text{NormalGamma}}\left({\frac {n_{\mu }\mu _{0}+n\mu }{n_{\mu }+n}},n_{\mu }+n,{\frac {1}{2}}(n_{\tau }+n),{\frac {1}{2}}\left({\frac {n_{\tau }}{\tau _{0}}}+ns+{\frac {n_{\mu }n(\mu -\mu _{0})^{2}}{n_{\mu }+n}}\right)\right)}

Tenga en cuenta que en algunos lenguajes de programación, como Matlab , la distribución gamma se implementa con la definición inversa deβ{\displaystyle \beta }, por lo tanto, el cuarto argumento de la distribución Normal-Gamma es2τ0/norteτ{\displaystyle 2\tau _{0}/n_{\tau }}.

Generación de variables aleatorias normales-gamma

La generación de variables aleatorias es sencilla:

  1. Muestraτ{\displaystyle \tau }de una distribución gamma con parámetrosα{\displaystyle \alpha }yβ{\displaystyle \beta }
  2. Muestraincógnita{\displaystyle x}de una distribución normal con mediaμ{\displaystyle \mu }y varianza1/(λτ){\displaystyle 1/(\lambda \tau )}

Notas

  1. 1 2 Bernardo y Smith 1993 , pág. 434
  2. Bernardo y Smith 1993 , págs. 136, 268, 434 
  3. Wasserman, Larry (2004). "Inferencia paramétrica". Springer Texts in Statistics . Nueva York, NY: Springer New York. pp. 119–148 . doi : 10.1007/978-0-387-21736-9_9 . ISBN  978-1-4419-2322-6.
  4. "Teorema de Bayes: Introducción" . www.trinity.edu . Archivado del original el 7 de agosto de 2014. Consultado el 5 de agosto de 2014 .

Referencias

  • Bernardo, JM; Smith, AFM (1993). Teoría bayesiana . Wiley. ISBN 0-471-49464-X.
  • Dearden, Richard; Friedman, Nir; Russell, Stuart J. (1998). Aprendizaje Q bayesiano (PDF) . Actas de la Decimoquinta Conferencia Nacional sobre Inteligencia Artificial (AAAI-98), 26-30 de julio de 1998, Madison, Wisconsin, EE. UU.