En teoría de probabilidad y estadística , la distribución normal-inversa-de-Wishart (o distribución gaussiana-inversa-de-Wishart ) es una familia multivariante de cuatro parámetros de distribuciones de probabilidad continuas . Es la distribución conjugada previa de una distribución normal multivariante con media y matriz de covarianza desconocidas (la inversa de la matriz de precisión ). [1]
Definición
Suponer
micras
|
micras
0
,
la
,
Σ
∼
norte
(
micras
|
micras
0
,
1
la
Σ
)
{\displaystyle {\boldsymbol {\mu }}|{\boldsymbol {\mu }}_{0},\lambda ,{\boldsymbol {\Sigma }}\sim {\mathcal {N}}\left({\boldsymbol {\mu }}{\Big |}{\boldsymbol {\mu }}_{0},{\frac {1}{\lambda }}{\boldsymbol {\Sigma }}\right)}
tiene una distribución normal multivariada con media y matriz de covarianza , donde
micras
0
{\displaystyle {\boldsymbol {\mu }}_{0}}
1
la
Σ
{\displaystyle {\tfrac {1}{\lambda }}{\boldsymbol {\Sigma }}}
Σ
|
O
,
no
∼
Yo
−
1
(
Σ
|
O
,
no
)
{\displaystyle {\boldsymbol {\Sigma }}|{\boldsymbol {\Psi }},\nu \sim {\mathcal {W}}^{-1}({\boldsymbol {\Sigma }}|{\boldsymbol {\Psi }},\nu )}
tiene una distribución Wishart inversa . Entonces
tiene una distribución Wishart inversa normal, denotada como
(
micras
,
Σ
)
{\displaystyle ({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})}
(
micras
,
Σ
)
∼
norte
I
Yo
(
micras
0
,
la
,
O
,
no
)
.
{\displaystyle ({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})\sim \mathrm {NIW} ({\boldsymbol {\mu }}_{0},\lambda ,{\boldsymbol {\Psi }},\nu ).}
Caracterización
Función de densidad de probabilidad
F
(
micras
,
Σ
|
micras
0
,
la
,
O
,
no
)
=
norte
(
micras
|
micras
0
,
1
la
Σ
)
Yo
−
1
(
Σ
|
O
,
no
)
{\displaystyle f({\boldsymbol {\mu }},{\boldsymbol {\Sigma }}|{\boldsymbol {\mu }}_{0},\lambda ,{\boldsymbol {\Psi }},\nu )={\mathcal {N}}\left({\boldsymbol {\mu }}{\Big |}{\boldsymbol {\mu }}_{0},{\frac {1}{\lambda }}{\boldsymbol {\Sigma }}\right){\mathcal {W}}^{-1}({\boldsymbol {\Sigma }}|{\boldsymbol {\Psi }},\nu )}
La versión completa del PDF es la siguiente: [2]
F
(
micras
,
Σ
|
micras
0
,
la
,
O
,
no
)
=
la
D
/
2
|
O
|
no
/
2
|
Σ
|
−
no
+
D
+
2
2
(
2
π
)
D
/
2
2
no
D
2
Γ
D
(
no
2
)
exp
{
−
1
2
yo
a
(
O
Σ
−
1
)
−
la
2
(
micras
−
micras
0
)
yo
Σ
−
1
(
micras
−
micras
0
)
}
{\displaystyle f({\boldsymbol {\mu }},{\boldsymbol {\Sigma }}|{\boldsymbol {\mu }}_{0},\lambda ,{\boldsymbol {\Psi }},\nu )={\frac {\lambda ^{D/2}|{\boldsymbol {\Psi }}|^{\nu /2}|{\boldsymbol {\Sigma }}|^{-{\frac {\nu +D+2}{2}}}}{(2\pi )^{D/2}2^{\frac {\nu D}{2}}\Gamma _{D}({\frac {\nu }{2}})}}{\text{exp}}\left\{-{\frac {1}{2}}Tr({\boldsymbol {\Psi \Sigma }}^{-1})-{ \frac {\lambda }{2}}({\boldsymbol {\mu }}-{\boldsymbol {\mu }}_{0})^{T}{\boldsymbol {\Sigma }}^{-1}({\boldsymbol { \mu }}-{\boldsymbol {\mu }}_{0})\derecha\}}
Aquí está la función gamma multivariada y es la traza de la matriz dada.
Γ
D
[
⋅
]
{\displaystyle \Gamma _{D}[\cdot ]}
yo
a
(
O
)
{\displaystyle Tr({\boldsymbol {\Psi }})}
Propiedades
Escalada
Distribuciones marginales
Por construcción, la distribución marginal sobre es una distribución Wishart inversa y la distribución condicional sobre dada es una distribución normal multivariada . La distribución marginal sobre es una distribución t multivariada .
Σ
{\displaystyle {\boldsymbol {\Sigma}}}
micras
{\displaystyle {\boldsymbol {\mu }}}
Σ
{\displaystyle {\boldsymbol {\Sigma}}}
micras
{\displaystyle {\boldsymbol {\mu }}}
Distribución posterior de los parámetros
Supongamos que la densidad de muestreo es una distribución normal multivariada
y
i
|
micras
,
Σ
∼
norte
pag
(
micras
,
Σ
)
{\displaystyle {\boldsymbol {y_{i}}}|{\boldsymbol {\mu }},{\boldsymbol {\Sigma }}\sim {\mathcal {N}}_{p}({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})}
donde es una matriz y (de longitud ) es la fila de la matriz.
y
{\displaystyle {\boldsymbol {y}}}
norte
×
pag
{\displaystyle n\times p}
y
i
{\displaystyle {\boldsymbol {y_{i}}}}
p
{\displaystyle p}
i
{\displaystyle i}
Como la matriz de media y covarianza de la distribución de muestreo es desconocida, podemos colocar una prior Normal-Inversa-Wishart en los parámetros de media y covarianza conjuntamente.
(
μ
,
Σ
)
∼
N
I
W
(
μ
0
,
λ
,
Ψ
,
ν
)
.
{\displaystyle ({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})\sim \mathrm {NIW} ({\boldsymbol {\mu }}_{0},\lambda ,{\boldsymbol {\Psi }},\nu ).}
La distribución posterior resultante para la matriz de media y covarianza también será una distribución Normal-Inversa-Wishart.
(
μ
,
Σ
|
y
)
∼
N
I
W
(
μ
n
,
λ
n
,
Ψ
n
,
ν
n
)
,
{\displaystyle ({\boldsymbol {\mu }},{\boldsymbol {\Sigma }}|y)\sim \mathrm {NIW} ({\boldsymbol {\mu }}_{n},\lambda _{n},{\boldsymbol {\Psi }}_{n},\nu _{n}),}
dónde
μ
n
=
λ
μ
0
+
n
y
¯
λ
+
n
{\displaystyle {\boldsymbol {\mu }}_{n}={\frac {\lambda {\boldsymbol {\mu }}_{0}+n{\bar {\boldsymbol {y}}}}{\lambda +n}}}
λ
n
=
λ
+
n
{\displaystyle \lambda _{n}=\lambda +n}
ν
n
=
ν
+
n
{\displaystyle \nu _{n}=\nu +n}
Ψ
n
=
Ψ
+
S
+
λ
n
λ
+
n
(
y
¯
−
μ
0
)
(
y
¯
−
μ
0
)
T
w
i
t
h
S
=
∑
i
=
1
n
(
y
i
−
y
¯
)
(
y
i
−
y
¯
)
T
{\displaystyle {\boldsymbol {\Psi }}_{n}={\boldsymbol {\Psi +S}}+{\frac {\lambda n}{\lambda +n}}({\boldsymbol {{\bar {y}}-\mu _{0}}})({\boldsymbol {{\bar {y}}-\mu _{0}}})^{T}~~~\mathrm {with} ~~{\boldsymbol {S}}=\sum _{i=1}^{n}({\boldsymbol {y_{i}-{\bar {y}}}})({\boldsymbol {y_{i}-{\bar {y}}}})^{T}}
.
Para tomar muestras de la posterior conjunta de , simplemente se extraen muestras de , luego se extrae . Para tomar muestras de la predictiva posterior de una nueva observación, se extrae , dados los valores ya extraídos de y . [3]
(
μ
,
Σ
)
{\displaystyle ({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})}
Σ
|
y
∼
W
−
1
(
Ψ
n
,
ν
n
)
{\displaystyle {\boldsymbol {\Sigma }}|{\boldsymbol {y}}\sim {\mathcal {W}}^{-1}({\boldsymbol {\Psi }}_{n},\nu _{n})}
μ
|
Σ
,
y
∼
N
p
(
μ
n
,
Σ
/
λ
n
)
{\displaystyle {\boldsymbol {\mu }}|{\boldsymbol {\Sigma ,y}}\sim {\mathcal {N}}_{p}({\boldsymbol {\mu }}_{n},{\boldsymbol {\Sigma }}/\lambda _{n})}
y
~
|
μ
,
Σ
,
y
∼
N
p
(
μ
,
Σ
)
{\displaystyle {\boldsymbol {\tilde {y}}}|{\boldsymbol {\mu ,\Sigma ,y}}\sim {\mathcal {N}}_{p}({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})}
μ
{\displaystyle {\boldsymbol {\mu }}}
Σ
{\displaystyle {\boldsymbol {\Sigma }}}
Generación de variables aleatorias normales-inversas-de Wishart
La generación de variables aleatorias es sencilla:
Muestra de una distribución Wishart inversa con parámetros y
Σ
{\displaystyle {\boldsymbol {\Sigma }}}
Ψ
{\displaystyle {\boldsymbol {\Psi }}}
ν
{\displaystyle \nu }
Muestra de una distribución normal multivariada con media y varianza
μ
{\displaystyle {\boldsymbol {\mu }}}
μ
0
{\displaystyle {\boldsymbol {\mu }}_{0}}
1
λ
Σ
{\displaystyle {\boldsymbol {\tfrac {1}{\lambda }}}{\boldsymbol {\Sigma }}}
La distribución normal-Wishart es esencialmente la misma distribución parametrizada por la precisión en lugar de la varianza. Si entonces .
(
μ
,
Σ
)
∼
N
I
W
(
μ
0
,
λ
,
Ψ
,
ν
)
{\displaystyle ({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})\sim \mathrm {NIW} ({\boldsymbol {\mu }}_{0},\lambda ,{\boldsymbol {\Psi }},\nu )}
(
μ
,
Σ
−
1
)
∼
N
W
(
μ
0
,
λ
,
Ψ
−
1
,
ν
)
{\displaystyle ({\boldsymbol {\mu }},{\boldsymbol {\Sigma }}^{-1})\sim \mathrm {NW} ({\boldsymbol {\mu }}_{0},\lambda ,{\boldsymbol {\Psi }}^{-1},\nu )}
La distribución normal-inversa-gamma es el equivalente unidimensional.
La distribución normal multivariada y la distribución Wishart inversa son las distribuciones componentes a partir de las cuales se compone esta distribución.
Notas
^ Murphy, Kevin P. (2007). "Análisis bayesiano conjugado de la distribución gaussiana". [1]
^ Simon JD Prince (junio de 2012). Visión artificial: modelos, aprendizaje e inferencia. Cambridge University Press. 3.8: "Distribución de Wishart inversa normal".
^ Gelman, Andrew, et al. Análisis de datos bayesianos. Vol. 2, p.73. Boca Raton, FL, EE. UU.: Chapman & Hall/CRC, 2014.
Referencias
Bishop, Christopher M. (2006). Reconocimiento de patrones y aprendizaje automático. Springer Science+Business Media.
Murphy, Kevin P. (2007). “Análisis bayesiano conjugado de la distribución gaussiana”. [2]