Articulo de referencia

Distribución de Dirichlet agrupada

En estadística , la distribución de Dirichlet agrupada (GDD) es una generalización multivariada de la distribución de Dirichlet. Fue descrita por primera vez por Ng et al. en 20...

En estadística , la distribución de Dirichlet agrupada (GDD) es una generalización multivariada de la distribución de Dirichlet. Fue descrita por primera vez por Ng et al. en 2008. [ 1 ] La distribución de Dirichlet agrupada surge en el análisis de datos categóricos donde algunas observaciones podrían caer en cualquiera de un conjunto de otras categorías "nítidas". Por ejemplo, se puede tener un conjunto de datos que consta de casos y controles bajo dos condiciones diferentes. Con datos completos, la clasificación cruzada del estado de la enfermedad forma una tabla 2(caso/control)-x-(condición/sin condición) con probabilidades de celda

Sin embargo, si los datos incluyen, por ejemplo, a personas que no responden pero que se sabe que son controles o casos, entonces la clasificación cruzada del estado de la enfermedad forma una tabla de 2x3. La probabilidad de la última columna es la suma de las probabilidades de las dos primeras columnas en cada fila, por ejemplo

El GDD permite la estimación completa de las probabilidades de las células bajo tales condiciones de agregación. [ 1 ]

Distribución de probabilidad

Consideremos el conjunto simplex cerradoTnorte={(incógnita1,incógnitanorte)|incógnitai0,i=1,,norte,i=1norteincógnitanorte=1}{\displaystyle {\mathcal {T}}_{n}=\left\{\left(x_{1},\ldots x_{n}\right)\left|x_{i}\geq 0,i=1,\cdots ,n,\sum _{i=1}^{n}x_{n}=1\right.\right\}}y incógnitaTnorte{\displaystyle \mathbf {x} \in {\mathcal {T}}_{n}}. Escribiendoincógnitanorte=(incógnita1,,incógnitanorte1){\displaystyle \mathbf {x} _{-n}=\left(x_{1},\ldots ,x_{n-1}\right)}por primera veznorte1{\displaystyle n-1}elementos de un miembro deTnorte{\displaystyle {\mathcal {T}}_{n}}, la distribución deincógnita{\displaystyle \mathbf {x} }para dos particiones tiene una función de densidad dada por

GDnorte,2,s(incógnitanorte|a,b)=(i=1norteincógnitaiai1)(i=1sincógnitai)b1(i=s+1norteincógnitai)b2B(a1,,as)B(as+1,,anorte)B(b1+i=1sai,b2+i=s+1norteai){\displaystyle \operatorname {GD} _{n,2,s}\left(\left.\mathbf {x} _{-n}\right|\mathbf {a} ,\mathbf {b} \right)={\frac {\left(\prod _{i=1}^{n}x_{i}^{a_{i}-1}\right)\cdot \left(\sum _{i=1}^{s}x_{i}\right)^{b_{1}}\cdot \left(\sum _{i=s+1}^{n}x_{i}\right)^{b_{2}}}{\operatorname {\mathrm {B} } \left(a_{1},\ldots ,a_{s}\right)\cdot \operatorname {\mathrm {B} } \left(a_{s+1},\ldots ,a_{n}\right)\cdot \operatorname {\mathrm {B} } \left(b_{1}+\sum _{i=1}^{s}a_{i},b_{2}+\sum _{i=s+1}^{n}a_{i}\right)}}}

dóndeB(a){\displaystyle \operatorname {\mathrm {B} } \left(\mathbf {a} \right)}es la función beta multivariada .

Ng et al. [ 1 ] procedieron a definir una distribución de Dirichlet agrupada con partición m y densidad deincógnitanorte{\displaystyle \mathbf {x} _ {-n}}dado por

GDnorte,metro,s(incógnitanorte|a,b)=dometro1(i=1norteincógnitaiai1)j=1metro(k=sj1+1sjincógnitak)bj{\displaystyle \operatorname {GD} _{n,m,\mathbf {s} }\left(\left.\mathbf {x} _{-n}\right|\mathbf {a} ,\mathbf {b} \right)=c_{m}^{-1}\cdot \left(\prod _{i=1}^{n}x_{i}^{a_{i}-1}\right)\cdot \prod _{j=1}^{m}\left(\sum _{k=s_{j-1}+1}^{s_{j}}x_{k}\right)^{b_{j}}}

dóndes=(s1,,smetro){\displaystyle \mathbf {s} =\left(s_{1},\ldots ,s_{m}\right)}es un vector de enteros con0=s0<s1smetro=norte{\displaystyle 0=s_{0}<s_{1}\leqslant \cdots \leqslant s_{m}=n}. La constante de normalización dada por

dometro={j=1metroB(asj1+1,,asj)}B(b1+k=1s1ak,,bmetro+k=smetro1+1smetroak){\displaystyle c_{m}=\left\{\prod _{j=1}^{m}\operatorname {\mathrm {B} } \left(a_{s_{j-1}+1},\ldots ,a_{s_{j}}\right)\right\}\cdot \operatorname {\mathrm {B} } \left(b_{1}+\sum _{k=1}^{s_{1}}a_{k},\ldots ,b_{m}+\sum _{k=s_{m-1}+1}^{s_{m}}a_{k}\right)}

Los autores procedieron a utilizar estas distribuciones en el contexto de tres aplicaciones diferentes en la ciencia médica.

Referencias

  1. 1 2 3 Ng, Kai Wang (2008). "Distribución de Dirichlet agrupada: una nueva herramienta para el análisis de datos categóricos incompletos". Journal of Multivariate Analysis . 99 : 490–509 .