Articulo de referencia

distribución de Dirichlet

K \\geq 2 number of categories ([[integer]]) \\boldsymbol\\alpha=(\\alpha_1,\\ldots,\\alpha_K) [[concentration parameter]]s, where \\alpha_i > 0 "},"support":{"wt":" x_1, \\ldot...

En probabilidad y estadística , la distribución de Dirichlet (en honor a Peter Gustav Lejeune Dirichlet ), a menudo denotadaDirector(α){\displaystyle \operatorname {Dir} ({\boldsymbol {\alpha }})}, es una familia de distribuciones de probabilidad multivariadas continuas parametrizadas por un vector α de números reales positivos . Es una generalización multivariada de la distribución beta , [ 1 ] de ahí su nombre alternativo de distribución beta multivariada ( MBD ). [ 2 ] Las distribuciones de Dirichlet se utilizan comúnmente como distribuciones a priori en estadística bayesiana y, de hecho, la distribución de Dirichlet es la distribución a priori conjugada de la distribución categórica y la distribución multinomial .

La generalización de dimensión infinita de la distribución de Dirichlet es el proceso de Dirichlet .

Definiciones

Función de densidad de probabilidad

Ilustrando cómo cambia el logaritmo de la función de densidad cuandoK=3{\displaystyle K=3}a medida que cambiamos el vectorα{\displaystyle {\boldsymbol {\alpha }}}deα=(0,3,0,3,0,3){\displaystyle {\boldsymbol {\alpha }}=(0.3,0.3,0.3)}a(2.0,2.0,2.0){\displaystyle (2.0,2.0,2.0)}, manteniendo a todos los individuosαi{\displaystyle \alpha _{i}}son iguales entre sí.

La distribución de Dirichlet de ordenK2{\displaystyle K\geq 2}con parámetrosα1,,αK>0{\displaystyle \alpha _{1},\ldots ,\alpha _{K}>0}tiene una función de densidad de probabilidad dada por

F(incógnita1,,incógnitaK;α1,,αK)=1B(α)i=1Kincógnitaiαi1{\displaystyle f\left(x_{1},\ldots ,x_{K};\alpha _{1},\ldots ,\alpha _{K}\right)={\frac {1}{\mathrm {B} ({\boldsymbol {\alpha }})}}\prod _{i=1}^{K}x_{i}^{\alpha _{i}-1}} dóndeincógnitai[0,1] a pesar de i{1,,K} y i=1Kincógnitai=1.{\displaystyle x_{i}\in \left[0,1\right]{\mbox{ para todo }}i\in \{1,\dots ,K\}{\mbox{ y }}\sum _{i=1}^{K}x_{i}=1\,.} Es decir, la función de densidad de probabilidad se define en el estándarK1{\displaystyle K-1}simplex incrustado enK{\displaystyle K}espacio euclidiano -dimensional ,RK{\displaystyle \mathbb {R} ^{K}}.

La constante de normalización es la función beta multivariada , que puede expresarse en términos de la función gamma :

B(α)=i=1KΓ(αi)Γ(i=1Kαi),α=(α1,,αK).{\displaystyle \mathrm {B} ({\boldsymbol {\alpha }})={\frac {\prod \limits _{i=1}^{K}\Gamma (\alpha _{i})}{\Gamma \left(\sum \limits _{i=1}^{K}\alpha _{i}\right)}},\qquad {\boldsymbol {\alpha }}=(\alpha _{1},\ldots ,\alpha _{K}).}

Apoyo

El soporte de la distribución de Dirichlet es el conjunto de vectores x de dimensión K cuyas entradas son números reales en el intervalo [0,1] tales queincógnita1=1{\displaystyle \|{\boldsymbol {x}}\|_{1}=1}, es decir, la suma de las coordenadas es igual a 1. Estas pueden verse como las probabilidades de un evento categórico de K vías . Otra forma de expresar esto es que el dominio de la distribución de Dirichlet es en sí mismo un conjunto de distribuciones de probabilidad , específicamente el conjunto de distribuciones discretas de K dimensiones . El término técnico para el conjunto de puntos en el soporte de una distribución de Dirichlet de K dimensiones es el estándar abierto ( K -1) -símplex , [ 3 ] que es una generalización de un triángulo , incrustado en la siguiente dimensión superior. Por ejemplo, con K = 3 , el soporte es un triángulo equilátero incrustado de forma de ángulo descendente en el espacio tridimensional, con vértices en (1,0,0), (0,1,0) y (0,0,1), es decir, tocando cada uno de los ejes de coordenadas en un punto a 1 unidad del origen.

Casos simétricos

Un caso especial común es la distribución de Dirichlet simétrica , donde todos los elementos que componen el vector de parámetros α tienen el mismo valor. El caso simétrico puede ser útil, por ejemplo, cuando se requiere una distribución a priori de Dirichlet sobre los componentes, pero no hay conocimiento previo que favorezca un componente sobre otro. Dado que todos los elementos del vector de parámetros tienen el mismo valor, la distribución de Dirichlet simétrica puede parametrizarse mediante un único valor escalar α , llamado parámetro de concentración . En términos de α , la función de densidad tiene la forma

F(incógnita1,,incógnitaK;α)=Γ(αK)Γ(α)Ki=1Kincógnitaiα1.{\displaystyle f(x_{1},\dots ,x_{K};\alpha )={\frac {\Gamma (\alpha K)}{\Gamma (\alpha )^{K}}}\prod _{i=1}^{K}x_{i}^{\alpha -1}.}

Cuando α = 1 ,La distribución de Dirichlet simétrica es equivalente a una distribución uniforme sobre el ( K -1) -símplex estándar abierto , es decir, es uniforme sobre todos los puntos de su soporte . Esta distribución en particular se conoce como distribución de Dirichlet plana . Los valores del parámetro de concentración superiores a 1 favorecen las variables que son distribuciones densas y uniformemente distribuidas, es decir, todos los valores dentro de una misma muestra son similares entre sí. Los valores del parámetro de concentración inferiores a 1 favorecen las distribuciones dispersas, es decir, la mayoría de los valores dentro de una misma muestra estarán cerca de 0, y la gran mayoría de la masa se concentrará en unos pocos valores.

Cuando α = 1/2 , la distribución es la misma que se obtendría al elegir un punto uniformemente al azar de la hiperesfera unitaria ( K -1) -dimensional , que es la superficie de una hiperbola unitaria K -dimensional , y elevar al cuadrado cada coordenada. La distribución α = 1/2 es la distribución a priori de Jeffreys para la distribución de Dirichlet.

Con expectativas específicas

En lugar de especificar el vector de parámetros de concentraciónα{\displaystyle {\boldsymbol {\alpha }}}, uno podría desear especificar la distribución de probabilidad esperada mii=αiα0 dónde α0=j=1Kαj{\displaystyle \operatorname {E} _{i}={\frac {\alpha _{i}}{\alpha _{0}}}\;\;{\mbox{ where }}\;\;\alpha _{0}=\sum _{j=1}^{K}\alpha _{j}}de tal manera que los parámetros de concentración se escriben como el productoα=Wmi{\displaystyle \,{\boldsymbol {\alpha }}=W\,{\boldsymbol {\operatorname {E} }}\,}del peso de concentración ( escalar )W{\displaystyle W}y la distribución de probabilidad esperadami{\displaystyle {\boldsymbol {\operatorname {E} }}}cuyos componentes son no negativos y suman 1. En este caso, el peso de concentración es mayor por un factor K que el parámetro de concentración para una distribución de Dirichlet simétrica descrita anteriormente. Esta construcción se relaciona con el concepto de medida base al analizar procesos de Dirichlet y se utiliza frecuentemente en la literatura sobre modelado de procesos.

Gráfico de curva 3D del peso previo no informativo, con la constante de convergencia.doW=2{\displaystyle C_{W}=2}

Cuando la dimensión de la distribución de Dirichlet es grande, la distribución a priori de Jeffreys produce un peso de concentración a priori correspondientemente alto. Por ejemplo , cuandoK=100{\displaystyle K=100} , el peso de concentración previo se convierte enW=K/2=50{\displaystyle W=K/2=50} , lo que crea una distribución de probabilidad previa relativamente rígidami{\displaystyle {\boldsymbol {\operatorname {E} }}^{\ast }}donde inicialmente la distribución de probabilidad posteriormi{\displaystyle {\boldsymbol {\operatorname {E} }}}apenas cambia en presencia de datos observados, incluso en el caso de, por ejemplo, 10 observaciones donde todas las observaciones indican la misma categoría.incógnitai{\displaystyle X_{i}}, lo cual, de forma natural e intuitiva, debería producir una probabilidad esperada.mii{\displaystyle \operatorname {E} _{i}}cerca de 1. Una forma de evitar el mal comportamiento de la distribución a priori rígida es usar el peso a priori no informativo.W{\displaystyle W}desde la lógica subjetiva , donde los parámetros de concentraciónαi{\displaystyle \alpha _{i}}se expresan como una función de las observacionesri{\displaystyle r_{i}}de acuerdo aαi=ri+Wmii{\displaystyle \alpha _{i}=r_{i}+W\operatorname {E} _{i}^{\ast }}. [ 4 ] El peso de concentración previa no informativo W{\displaystyle W}es una función del número de observacionesr0=ri{\displaystyle r_{0}=\sum r_{i}}, expresado como W=K(1+doWr0)1+Kr0{\displaystyle W={\frac {K(1+C_{W}r_{0})}{1+Kr_{0}}}} dondedoW{\displaystyle C_{W}}es una constante de convergencia, normalmente elegida igual a 2. La elección dedoW=2{\displaystyle C_{W}=2}garantiza que la distribución de Dirichlet de cualquier dimensión tenga la misma sensibilidad a nuevas observaciones que la distribución Beta con parámetros de concentración previos.α+β=2{\displaystyle \alpha +\beta =2}(o el uniforme)α=β=1{\displaystyle \alpha =\beta =1}). En el caso de una distribución de probabilidad previa uniformemi{\displaystyle {\boldsymbol {\operatorname {E} }}^{\ast }}, el peso previo no informativoW{\displaystyle W}También garantiza una distribución de Dirichlet previa uniforme para cualquier dimensión.K{\displaystyle K}. Un gráfico 3D deW{\displaystyle W}Esto se ilustra en la figura.

Propiedades

Momentos

Dejarincógnita=(incógnita1,,incógnitaK)Director(α){\displaystyle X=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} ({\boldsymbol {\alpha }})}.

Dejar

α0=i=1Kαi.{\displaystyle \alpha _{0}=\sum _{i=1}^{K}\alpha _{i}.}

Entonces [ 5 ] [ 6 ]

mi[incógnitai]=αiα0,{\displaystyle \operatorname {E} [X_{i}]={\frac {\alpha _{i}}{\alpha _{0}}},}Var[incógnitai]=αi(α0αi)α02(α0+1).{\displaystyle \operatorname {Var} [X_{i}]={\frac {\alpha _{i}(\alpha _{0}-\alpha _{i})}{\alpha _{0}^{2}(\alpha _{0}+1)}}.}

Además, siij{\displaystyle i\neq j}

Cov[incógnitai,incógnitaj]=αiαjα02(α0+1).{\displaystyle \operatorname {Cov} [X_{i},X_{j}]={\frac {-\alpha _{i}\alpha _{j}}{\alpha _{0}^{2}(\alpha _{0}+1)}}.}

La matriz de covarianza es singular .

De forma más general, los momentos de variables aleatorias con distribución de Dirichlet pueden expresarse de la siguiente manera. Parat=(t1,,tK)RK{\displaystyle {\boldsymbol {t}}=(t_{1},\dotsc ,t_{K})\in \mathbb {R} ^{K}}, denotemos porti=(t1i,,tKi){\displaystyle {\boldsymbol {t}}^{\circ i}=(t_{1}^{i},\dotsc ,t_{K}^{i})}su i -ésimo poder de Hadamard . Entonces, [ 7 ]

mi[(tincógnita)norte]=norte¡Γ(α0)Γ(α0+norte)t1k1tKkKk1¡kK¡i=1KΓ(αi+ki)Γ(αi)=norte¡Γ(α0)Γ(α0+norte)Znorte(t1α,,tnorteα),{\displaystyle \operatorname {E} \left[({\boldsymbol {t}}\cdot {\boldsymbol {X}})^{n}\right]={\frac {n!\,\Gamma (\alpha _{0})}{\Gamma (\alpha _{0}+n)}}\sum {\frac {{t_{1}}^{k_{1}}\cdots {t_{K}}^{k_{K}}}{k_{1}!\cdots k_{K}!}}\prod _{i=1}^{K}{\frac {\Gamma (\alpha _{i}+k_{i})}{\Gamma (\alpha _{i})}}={\frac {n!\,\Gamma (\alpha _{0})}{\Gamma (\alpha _{0}+n)}}Z_{n}({\boldsymbol {t}}^{\circ 1}\cdot {\boldsymbol {\alpha }},\cdots ,{\boldsymbol {t}}^{\circ n}\cdot {\boldsymbol {\alpha }}),}

donde la suma se realiza sobre números enteros no negativosk1,,kK{\displaystyle k_{1},\ldots ,k_{K}}connorte=k1++kK{\displaystyle n=k_{1}+\cdots +k_{K}}, yZnorte{\displaystyle Z_{n}}es el polinomio índice de ciclo del grupo simétrico de grado n .

Tenemos un caso especialmi[tincógnita]=tαα0.{\displaystyle \operatorname {E} \left[{\boldsymbol {t}}\cdot {\boldsymbol {X}}\right]={\frac {{\boldsymbol {t}}\cdot {\boldsymbol {\alpha }}}{\alpha _{0}}}.}

El análogo multivariadomi[(t1incógnita)norte1(tqincógnita)norteq]{\textstyle \operatorname {E} \left[({\boldsymbol {t}}_{1}\cdot {\boldsymbol {X}})^{n_{1}}\cdots ({\boldsymbol {t}}_{q}\cdot {\boldsymbol {X}})^{n_{q}}\right]}para vectorest1,,tqRK{\displaystyle {\boldsymbol {t}}_{1},\dotsc ,{\boldsymbol {t}}_{q}\in \mathbb {R} ^{K}}puede expresarse [ 8 ] en términos de un patrón de color de los exponentesnorte1,,norteq{\displaystyle n_{1},\dotsc ,n_{q}}en el sentido del teorema de enumeración de Pólya .

Los casos particulares incluyen el cálculo simple [ 9 ]

mi[i=1Kincógnitaiβi]=B(α+β)B(α)=Γ(i=1Kαi)Γ[i=1K(αi+βi)]×i=1KΓ(αi+βi)Γ(αi).{\displaystyle \operatorname {E} \left[\prod _{i=1}^{K}X_{i}^{\beta _{i}}\right]={\frac {B\left({\boldsymbol {\alpha }}+{\boldsymbol {\beta }}\right)}{B\left({\boldsymbol {\alpha }}\right)}}={\frac {\Gamma \left(\sum \limits _{i=1}^{K}\alpha _{i}\right)}{\Gamma \left[\sum \limits _{i=1}^{K}(\alpha _{i}+\beta _{i})\right]}}\times \prod _{i=1}^{K}{\frac {\Gamma (\alpha _{i}+\beta _{i})}{\Gamma (\alpha _{i})}}.}

Modo

La moda de la distribución es [ 10 ] el vector ( x 1 , ..., x K ) con

incógnitai=αi1α0K,αi>1.{\displaystyle x_{i}={\frac {\alpha _{i}-1}{\alpha _{0}-K}},\qquad \alpha _{i}>1.}

Distribuciones marginales

Las distribuciones marginales son distribuciones beta : [ 11 ]

incógnitaiBeta(αi,α0αi).{\displaystyle X_{i}\sim \operatorname {Beta} (\alpha _{i},\alpha _{0}-\alpha _{i}).}

Véase también la sección §  Distribuciones relacionadas a continuación.

Conjugar a categórico o multinomial

La distribución de Dirichlet es la distribución a priori conjugada de la distribución categórica (una distribución de probabilidad discreta genérica con un número determinado de resultados posibles) y la distribución multinomial (la distribución sobre los recuentos observados de cada categoría posible en un conjunto de observaciones con distribución categórica). Esto significa que si un dato tiene una distribución categórica o multinomial, y la distribución a priori del parámetro de la distribución (el vector de probabilidades que genera el dato) se distribuye como una distribución de Dirichlet, entonces la distribución a posteriori del parámetro también es de Dirichlet. Intuitivamente, en tal caso, partiendo de lo que sabemos sobre el parámetro antes de observar el dato, podemos actualizar nuestro conocimiento basándonos en dicho dato y obtener una nueva distribución de la misma forma que la anterior. Esto significa que podemos actualizar sucesivamente nuestro conocimiento de un parámetro incorporando nuevas observaciones una a una, sin encontrar dificultades matemáticas.

Formalmente, esto se puede expresar de la siguiente manera. Dado un modelo

α=(α1,,αK)=hiperparámetro de concentraciónpagα=(pag1,,pagK)Director(K,α)incógnitapag=(incógnita1,,incógnitaK)Gato(K,pag){\displaystyle {\begin{array}{rcccl}{\boldsymbol {\alpha }}&=&\left(\alpha _{1},\ldots ,\alpha _{K}\right)&=&{\text{concentration hyperparameter}}\\\mathbf {p} \mid {\boldsymbol {\alpha }}&=&\left(p_{1},\ldots ,p_{K}\right)&\sim &\operatorname {Dir} (K,{\boldsymbol {\alpha }})\\\mathbb {X} \mid \mathbf {p} &=&\left(\mathbf {x} _{1},\ldots ,\mathbf {x} _{K}\right)&\sim &\operatorname {Cat} (K,\mathbf {p} )\end{array}}}

Entonces se cumple lo siguiente:

do=(do1,,doK)=número de ocurrencias de la categoría ipagincógnita,αDirector(K,do+α)=Director(K,do1+α1,,doK+αK){\displaystyle {\begin{array}{rcccl}\mathbf {c} &=&\left(c_{1},\ldots ,c_{K}\right)&=&{\text{number of occurrences of category }}i\\\mathbf {p} \mid \mathbb {X} ,{\boldsymbol {\alpha }}&\sim &\operatorname {Dir} (K,\mathbf {c} +{\boldsymbol {\alpha }})&=&\operatorname {Dir} \left(K,c_{1}+\alpha _{1},\ldots ,c_{K}+\alpha _{K}\right)\end{array}}}

Esta relación se utiliza en estadística bayesiana para estimar el parámetro subyacente p de una distribución categórica a partir de un conjunto de N muestras. Intuitivamente, podemos considerar el vector hiperprior α como pseudocuentas , es decir, como la representación del número de observaciones en cada categoría que ya hemos visto. Luego, simplemente sumamos las conteos de todas las nuevas observaciones (el vector c ) para obtener la distribución posterior.

En los modelos de mezcla bayesianos y otros modelos bayesianos jerárquicos con componentes de mezcla, las distribuciones de Dirichlet se utilizan comúnmente como distribuciones a priori para las variables categóricas que aparecen en los modelos. Consulte la sección sobre aplicaciones a continuación para obtener más información.

Relación con la distribución multinomial de Dirichlet

En un modelo donde se aplica una distribución a priori de Dirichlet a un conjunto de observaciones categóricas , la distribución conjunta marginal de las observaciones (es decir, la distribución conjunta de las observaciones, con el parámetro a priori marginalizado ) es una distribución multinomial de Dirichlet . Esta distribución desempeña un papel importante en los modelos bayesianos jerárquicos , ya que al realizar inferencias sobre dichos modelos mediante métodos como el muestreo de Gibbs o el método bayesiano variacional , las distribuciones a priori de Dirichlet suelen marginalizarse. Consulte el artículo sobre esta distribución para obtener más detalles.

Entropía

Si X es unDirector(α){\displaystyle \operatorname {Dir} ({\boldsymbol {\alpha }})}variable aleatoria, la entropía diferencial de X (en unidades nat ) es [ 12 ]

h(incógnita)=mi[lnF(incógnita)]=lnB(α)+(α0K)ψ(α0)j=1K(αj1)ψ(αj){\displaystyle h({\boldsymbol {X}})=\operatorname {E} [-\ln f({\boldsymbol {X}})]=\ln \operatorname {B} ({\boldsymbol {\alpha }})+(\alpha _{0}-K)\psi (\alpha _{0})-\sum _{j=1}^{K}(\alpha _{j}-1)\psi (\alpha _{j})}

dóndeψ{\displaystyle \psi }es la función digamma .

La siguiente fórmula parami[ln(incógnitai)]{\displaystyle \operatorname {E} [\ln(X_{i})]}se puede utilizar para derivar la entropía diferencial anterior. Dado que las funcionesln(incógnitai){\displaystyle \ln(X_{i})}son las estadísticas suficientes de la distribución de Dirichlet, las identidades diferenciales de la familia exponencial se pueden usar para obtener una expresión analítica para la esperanza deln(incógnitai){\displaystyle \ln(X_{i})}(véase la ecuación (2.62) en [ 13 ] ) y su matriz de covarianza asociada:

mi[ln(incógnitai)]=ψ(αi)ψ(α0){\displaystyle \operatorname {E} [\ln(X_{i})]=\psi (\alpha _{i})-\psi (\alpha _{0})}

y

Cov[ln(incógnitai),ln(incógnitaj)]=ψ(αi)δijψ(α0){\displaystyle \operatorname {Cov} [\ln(X_{i}),\ln(X_{j})]=\psi '(\alpha _{i})\delta _{ij}-\psi '(\alpha _{0})}

dóndeψ{\displaystyle \psi }es la función digamma ,ψ{\displaystyle \psi '}es la función trigonométrica yδij{\displaystyle \delta _{ij}}es el delta de Kronecker .

El espectro de información de Rényi para valores distintos deλ=1{\displaystyle \lambda =1}está dado por [ 14 ]

FR(λ)=(1λ)1(λregistroB(α)+i=1KregistroΓ(λ(αi1)+1)registroΓ(λ(α0K)+K)){\displaystyle F_{R}(\lambda )=(1-\lambda )^{-1}\left(-\lambda \log \mathrm {B} ({\boldsymbol {\alpha }})+\sum _{i=1}^{K}\log \Gamma (\lambda (\alpha _{i}-1)+1)-\log \Gamma (\lambda (\alpha _{0}-K)+K)\right)}

y la entropía de la información es el límite comoλ{\displaystyle \lambda }va a 1.

Otra medida interesante relacionada es la entropía de un vector categórico discreto (binario uno de K) Z con distribución de masa de probabilidad X , es decir, PAG(Zi=1,Zji=0|incógnita)=incógnitai{\displaystyle P(Z_{i}=1,Z_{j\neq i}=0|{\boldsymbol {X}})=X_{i}}La entropía de información condicional de Z , dado X, es

S(incógnita)=H(Z|incógnita)=miZ[registroPAG(Z|incógnita)]=i=1Kincógnitairegistroincógnitai{\displaystyle S({\boldsymbol {X}})=H({\boldsymbol {Z}}|{\boldsymbol {X}})=\operatorname {E} _{\boldsymbol {Z}}[-\log P({\boldsymbol {Z}}|{\boldsymbol {X}})]=\sum _{i=1}^{K}-X_{i}\log X_{i}}

Esta función de X es una variable aleatoria escalar. Si X tiene una distribución de Dirichlet simétrica con todosαi=α{\displaystyle \alpha _{i}=\alpha }, el valor esperado de la entropía (en unidades nat ) es [ 15 ]

mi[S(incógnita)]=i=1Kmi[incógnitailnincógnitai]=ψ(Kα+1)ψ(α+1){\displaystyle \operatorname {E} [S({\boldsymbol {X}})]=\sum _{i=1}^{K}\operatorname {E} [-X_{i}\ln X_{i}]=\psi (K\alpha +1)-\psi (\alpha +1)}

Divergencia de Kullback-Leibler

La divergencia de Kullback-Leibler (KL) entre dos distribuciones de Dirichlet,Director(α){\displaystyle {\text{Dir}}({\boldsymbol {\alpha }})}yDirector(β){\displaystyle {\text{Dir}}({\boldsymbol {\beta }})}, sobre el mismo simplex es: [ 16 ]

DKL(Dir(α)Dir(β))=registroΓ(i=1Kαi)Γ(i=1Kβi)+i=1K[registroΓ(βi)Γ(αi)+(αiβi)(ψ(αi)ψ(j=1Kαj))]{\displaystyle {\begin{aligned}D_{\mathrm {KL} }{\big (}\mathrm {Dir} ({\boldsymbol {\alpha }})\,\|\,\mathrm {Dir} ({\boldsymbol {\beta }}){\big )}&=\log {\frac {\Gamma \left(\sum _{i=1}^{K}\alpha _{i}\right)}{\Gamma \left(\sum _{i=1}^{K}\beta _{i}\right)}}+\sum _{i=1}^{K}\left[\log {\frac {\Gamma (\beta _{i})}{\Gamma (\alpha _{i})}}+(\alpha _{i}-\beta _{i})\left(\psi (\alpha _{i})-\psi \left(\sum _{j=1}^{K}\alpha _{j}\right)\right)\right]\end{aligned}}}

Agregación

Si

incógnita=(incógnita1,,incógnitaK)Director(α1,,αK){\displaystyle X=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} (\alpha _{1},\ldots ,\alpha _{K})}

entonces, si las variables aleatorias con subíndices i y j se eliminan del vector y se reemplazan por su suma,

incógnita=(incógnita1,,incógnitai+incógnitaj,,incógnitaK)Director(α1,,αi+αj,,αK).{\displaystyle X'=(X_{1},\ldots ,X_{i}+X_{j},\ldots ,X_{K})\sim \operatorname {Dir} (\alpha _{1},\ldots ,\alpha _{i}+\alpha _{j},\ldots ,\alpha _{K}).}

Esta propiedad de agregación puede utilizarse para derivar la distribución marginal deincógnitai{\displaystyle X_{i}}mencionado anteriormente.

Neutralidad

Siincógnita=(incógnita1,,incógnitaK)Director(α){\displaystyle X=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} ({\boldsymbol {\alpha }})}, entonces se dice que el vector X es neutro [ 17 ] en el sentido de que X K es independiente de incógnita(K){\displaystyle X^{(-K)}}[ 3 ] donde

incógnita(K)=(incógnita11incógnitaK,incógnita21incógnitaK,,incógnitaK11incógnitaK),{\displaystyle X^{(-K)}=\left({\frac {X_{1}}{1-X_{K}}},{\frac {X_{2}}{1-X_{K}}},\ldots ,{\frac {X_{K-1}}{1-X_{K}}}\right),}

y de manera similar para eliminar cualquiera deincógnita2,,incógnitaK1{\displaystyle X_{2},\ldots ,X_{K-1}}Obsérvese que cualquier permutación de X también es neutral (una propiedad que no poseen las muestras extraídas de una distribución de Dirichlet generalizada ). [ 18 ]

Combinando esto con la propiedad de agregación, se deduce que X j + ... + X K es independiente de(incógnita1incógnita1++incógnitaj1,incógnita2incógnita1++incógnitaj1,,incógnitaj1incógnita1++incógnitaj1){\displaystyle \left({\frac {X_{1}}{X_{1}+\cdots +X_{j-1}}},{\frac {X_{2}}{X_{1}+\cdots +X_{j-1}}},\ldots ,{\frac {X_{j-1}}{X_{1}+\cdots +X_{j-1}}}\right)}. De hecho, es cierto, además, para la distribución de Dirichlet, que para3jK1{\displaystyle 3\leq j\leq K-1}, la pareja(incógnita1++incógnitaj1,incógnitaj++incógnitaK){\displaystyle \left(X_{1}+\cdots +X_{j-1},X_{j}+\cdots +X_{K}\right)}y los dos vectores(incógnita1incógnita1++incógnitaj1,incógnita2incógnita1++incógnitaj1,,incógnitaj1incógnita1++incógnitaj1){\displaystyle \left({\frac {X_{1}}{X_{1}+\cdots +X_{j-1}}},{\frac {X_{2}}{X_{1}+\cdots +X_{j-1}}},\ldots ,{\frac {X_{j-1}}{X_{1}+\cdots +X_{j-1}}}\right)}y(incógnitajincógnitaj++incógnitaK,incógnitaj+1incógnitaj++incógnitaK,,incógnitaKincógnitaj++incógnitaK){\displaystyle \left({\frac {X_{j}}{X_{j}+\cdots +X_{K}}},{\frac {X_{j+1}}{X_{j}+\cdots +X_{K}}},\ldots ,{\frac {X_{K}}{X_{j}+\cdots +X_{K}}}\right)}, vistos como una tripleta de vectores aleatorios normalizados, son mutuamente independientes . El resultado análogo es cierto para la partición de los índices {1, 2, ..., K } en cualquier otro par de subconjuntos no unitarios.

Función característica

La función característica de la distribución de Dirichlet es una forma confluente de la serie hipergeométrica de Lauricella . Phillips la da como [ 19 ].

doF(s1,,sK1)=mi(mii(s1incógnita1++sK1incógnitaK1))=Ψ[K1](α1,,αK1;α0;is1,,isK1){\displaystyle CF\left(s_{1},\ldots ,s_{K-1}\right)=\operatorname {E} \left(e^{i\left(s_{1}X_{1}+\cdots +s_{K-1}X_{K-1}\right)}\right)=\Psi ^{\left[K-1\right]}(\alpha _{1},\ldots ,\alpha _{K-1};\alpha _{0};is_{1},\ldots ,is_{K-1})}

dónde

Ψ[metro](a1,,ametro;do;z1,zmetro)=(a1)k1(ametro)kmetroz1k1zmetrokmetro(do)kk1¡kmetro¡.{\displaystyle \Psi ^{[m]}(a_{1},\ldots ,a_{m};c;z_{1},\ldots z_{m})=\sum {\frac {(a_{1})_{k_{1}}\cdots (a_{m})_{k_{m}}\,z_{1}^{k_{1}}\cdots z_{m}^{k_{m}}}{(c)_{k}\,k_{1}!\cdots k_{m}!}}.}

La suma se realiza sobre números enteros no negativos.k1,,kmetro{\displaystyle k_{1},\ldots ,k_{m}}yk=k1++kmetro{\displaystyle k=k_{1}+\cdots +k_{m}}Phillips continúa afirmando que esta forma es "inconveniente para el cálculo numérico" y ofrece una alternativa en términos de una integral de trayectoria compleja :

Ψ[metro]=Γ(do)2πiLmitta1++ametrodoj=1metro(tzj)ajdt{\displaystyle \Psi ^{[m]}={\frac {\Gamma (c)}{2\pi i}}\int _{L}e^{t}\,t^{a_{1}+\cdots +a_{m}-c}\,\prod _{j=1}^{m}(t-z_{j})^{-a_{j}}\,dt}

donde L denota cualquier trayectoria en el plano complejo que se origina en{\displaystyle -\infty }, rodeando en la dirección positiva todas las singularidades del integrando y volviendo a{\displaystyle -\infty }.

Desigualdad

Función de densidad de probabilidadF(incógnita1,,incógnitaK1;α1,,αK){\displaystyle f\left(x_{1},\ldots ,x_{K-1};\alpha _{1},\ldots ,\alpha _{K}\right)}juega un papel clave en una desigualdad multifuncional que implica varios límites para la distribución de Dirichlet. [ 20 ]

Otra desigualdad relaciona la función generadora de momentos de la distribución de Dirichlet con el conjugado convexo de la divergencia de Kullback-Leibler inversa escalada: [ 21 ]

registromi(expi=1Ksiincógnitai)sorberpagi=1K(pagisiαiregistro(αiα0pagi)),{\displaystyle \log \operatorname {E} \left(\exp {\sum _{i=1}^{K}s_{i}X_{i}}\right)\leq \sup _{p}\sum _{i=1}^{K}\left(p_{i}s_{i}-\alpha _{i}\log \left({\frac {\alpha _{i}}{\alpha _{0}p_{i}}}\right)\right),} donde el supremo se toma sobre p que abarca el ( K − 1) -símplex.

Cuandoincógnita=(incógnita1,,incógnitaK)Director(α1,,αK){\displaystyle {\boldsymbol {X}}=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} \left(\alpha _{1},\ldots ,\alpha _{K}\right)}, la distribución marginal de cada componenteincógnitaiBeta(αi,α0αi){\displaystyle X_{i}\sim \operatorname {Beta} (\alpha _{i},\alpha _{0}-\alpha _{i})}, una distribución Beta . En particular, si K = 2 entoncesincógnita1Beta(α1,α2){\displaystyle X_{1}\sim \operatorname {Beta} (\alpha _{1},\alpha _{2})}es equivalente aincógnita=(incógnita1,1incógnita1)Director(α1,α2){\displaystyle {\boldsymbol {X}}=(X_{1},1-X_{1})\sim \operatorname {Dir} \left(\alpha _{1},\alpha _{2}\right)}.

Para K distribuciones Gamma distribuidas independientemente :

Y1Gama(α1,1),,YKGama(αK,1){\displaystyle Y_{1}\sim \operatorname {Gamma} (\alpha _{1},1),\ldots ,Y_{K}\sim \operatorname {Gamma} (\alpha _{K},1)}

tenemos escrituraα0:=i=1Kαi{\displaystyle \alpha _{0}:=\sum _{i=1}^{K}\limits \alpha _{i}}: [ 22 ] : 402

V=i=1KYiGama(α0,1),{\displaystyle V=\sum _{i=1}^{K}Y_{i}\sim \operatorname {Gamma} \left(\alpha _{0},1\right),}incógnita=(incógnita1,,incógnitaK)=(Y1V,,YKV)Director(α1,,αK).{\displaystyle X=(X_{1},\ldots ,X_{K})=\left({\frac {Y_{1}}{V}},\ldots ,{\frac {Y_{K}}{V}}\right)\sim \operatorname {Dir} \left(\alpha _{1},\ldots ,\alpha _{K}\right).}

Aunque las X i no son independientes entre sí, se puede observar que se generan a partir de un conjunto de K variables aleatorias gamma independientes . [ 22 ] : 594 Desafortunadamente, dado que la suma V se pierde al formar X (de hecho, se puede demostrar que V es estocásticamente independiente de X ), no es posible recuperar las variables aleatorias gamma originales a partir de estos valores únicamente. Sin embargo, debido a que las variables aleatorias independientes son más sencillas de manejar, esta reparametrización aún puede ser útil para demostraciones sobre propiedades de la distribución de Dirichlet.

Prior conjugado de la distribución de Dirichlet

Debido a que la distribución de Dirichlet es una distribución de la familia exponencial, tiene una distribución a priori conjugada. La distribución a priori conjugada tiene la forma: [ 23 ]

CD(αv,η)(1B(α))ηexp(kvkαk).{\displaystyle \operatorname {CD} ({\boldsymbol {\alpha }}\mid {\boldsymbol {v}},\eta )\propto \left({\frac {1}{\operatorname {B} ({\boldsymbol {\alpha }})}}\right)^{\eta }\exp \left(-\sum _{k}v_{k}\alpha _{k}\right).}

Aquív{\displaystyle {\boldsymbol {v}}}es un vector real de K dimensiones yη{\displaystyle \eta }es un parámetro escalar. El dominio de(v,η){\displaystyle ({\boldsymbol {v}},\eta )}está restringido al conjunto de parámetros para los cuales la función de densidad no normalizada anterior puede normalizarse. La condición (necesaria y suficiente) es: [ 24 ]

kvk>0 y η>1 y (η0 o kexpvkη<1){\displaystyle \forall k\;\;v_{k}>0\;\;\;\;{\text{ and }}\;\;\;\;\eta >-1\;\;\;\;{\text{ and }}\;\;\;\;(\eta \leq 0\;\;\;\;{\text{ or }}\;\;\;\;\sum _{k}\exp -{\frac {v_{k}}{\eta }}<1)}

La propiedad de conjugación se puede expresar como

si [ anterior :αCD(v,η){\displaystyle {\boldsymbol {\alpha }}\sim \operatorname {CD} (\cdot \mid {\boldsymbol {v}},\eta )}] y [ observación :incógnitaαDirichlet(α){\displaystyle {\boldsymbol {x}}\mid {\boldsymbol {\alpha }}\sim \operatorname {Dirichlet} (\cdot \mid {\boldsymbol {\alpha }})}] entonces [ posterior :αincógnitaCD(vregistroincógnita,η+1){\displaystyle {\boldsymbol {\alpha }}\mid {\boldsymbol {x}}\sim \operatorname {CD} (\cdot \mid {\boldsymbol {v}}-\log {\boldsymbol {x}},\eta +1)}].

En la literatura publicada no existe ningún algoritmo práctico para generar muestras de manera eficiente.CD(αv,η){\displaystyle \operatorname {CD} ({\boldsymbol {\alpha }}\mid {\boldsymbol {v}},\eta )}.

Generalización mediante escalado y traslación de probabilidades logarítmicas.

Como se indicó anteriormente, las variables de Dirichlet se pueden generar normalizando variables gamma independientes . Si en cambio se normalizan variables gamma generalizadas , se obtienen variables de la distribución beta generalizada simplicial (SGB). [ 25 ] Por otro lado, las variables SGB también se pueden obtener aplicando la función softmax a los logaritmos escalados y trasladados de las variables de Dirichlet. Específicamente, seaincógnita=(incógnita1,,incógnitaK)Director(α){\displaystyle \mathbf {x} =(x_{1},\ldots ,x_{K})\sim \operatorname {Dir} ({\boldsymbol {\alpha }})}y dejary=(y1,,yK){\displaystyle \mathbf {y} =(y_{1},\ldots ,y_{K})}donde se aplica el logaritmo elemento a elemento: y=softmax(a1registroincógnita+registrob)incógnita=softmax(aregistroyaregistrob){\displaystyle \mathbf {y} =\operatorname {softmax} (a^{-1}\log \mathbf {x} +\log \mathbf {b} )\;\iff \;\mathbf {x} =\operatorname {softmax} (a\log \mathbf {y} -a\log \mathbf {b} )} o yk=bkincógnitak1/ai=1Kbiincógnitai1/aincógnitak=(yk/bk)ai=1K(yi/bi)a{\displaystyle y_{k}={\frac {b_{k}x_{k}^{1/a}}{\sum _{i=1}^{K}b_{i}x_{i}^{1/a}}}\;\iff \;x_{k}={\frac {(y_{k}/b_{k})^{a}}{\sum _{i=1}^{K}(y_{i}/b_{i})^{a}}}} dóndea>0{\displaystyle a>0}yb=(b1,,bK){\displaystyle \mathbf {b} =(b_{1},\ldots ,b_{K})}, con todobk>0{\displaystyle b_{k}>0}, entoncesySGB(a,b,α){\displaystyle \mathbf {y} \sim \operatorname {SGB} (a,\mathbf {b} ,{\boldsymbol {\alpha }})}. La función de densidad SGB se puede derivar observando que la transformaciónincógnitay{\displaystyle \mathbf {x} \mapsto \mathbf {y} }, que es una biyección del simplex a sí mismo, induce un factor de cambio de volumen diferencial [ 26 ] de: R(y,a,b)=a1Kk=1Kykincógnitak{\displaystyle R(\mathbf {y} ,a,\mathbf {b} )=a^{1-K}\prod _{k=1}^{K}{\frac {y_{k}}{x_{k}}}} donde se entiende queincógnita{\displaystyle \mathbf {x} }se recupera en función dey{\displaystyle \mathbf {y} }, como se muestra arriba. Esto facilita escribir la densidad SGB en términos de la densidad de Dirichlet, como: FSGB(ya,b,α)=FDirector(incógnitaα)R(y,a,b){\displaystyle f_{\text{SGB}}(\mathbf {y} \mid a,\mathbf {b} ,{\boldsymbol {\alpha }})={\frac {f_{\text{Dir}}(\mathbf {x} \mid {\boldsymbol {\alpha }})}{R(\mathbf {y} ,a,\mathbf {b} )}}} Esta generalización de la densidad de Dirichlet, mediante un cambio de variables , está estrechamente relacionada con un flujo normalizador , mientras que el cambio de volumen diferencial no viene dado por el determinante jacobiano deincógnitay:RKRK{\displaystyle \mathbf {x} \mapsto \mathbf {y} :\mathbb {R} ^{K}\to \mathbb {R} ^{K}} que es cero, pero por el determinante jacobiano de(incógnita1,,incógnitaK1)(y1,,yK1){\displaystyle (x_{1},\ldots ,x_{K-1})\mapsto \mathbf {(} y_{1},\ldots ,y_{K-1})}, como se explica con más detalle en Flujo normalizador § Flujo simplex .

Para comprender mejor la interacción entre los parámetros de forma de Dirichletα{\displaystyle {\boldsymbol {\alpha }}}y los parámetros de transformacióna,b{\displaystyle a,\mathbf {b} }, puede ser útil considerar las marginales logarítmicas,registroincógnitak1incógnitak{\displaystyle \log {\frac {x_{k}}{1-x_{k}}}}, que siguen la distribución logística beta ,Bσ(αk,ikαi){\displaystyle B_{\sigma }(\alpha _{k},\sum _{i\neq k}\alpha _{i})}. Véanse en particular las secciones sobre el comportamiento de la cola y la generalización con parámetros de ubicación y escala .

Solicitud

Cuandob1=b2==bK{\displaystyle b_{1}=b_{2}=\cdots =b_{K}}, entonces la transformación se simplifica aincógnitasoftmax(a1registroincógnita){\displaystyle \mathbf {x} \mapsto \operatorname {softmax} (a^{-1}\log \mathbf {x} )}, que se conoce como escalado de temperatura en aprendizaje automático , donde se utiliza como una transformación de calibración para clasificadores probabilísticos multiclase. [ 27 ] Tradicionalmente, el parámetro de temperatura (a{\displaystyle a}Aquí, se aprende de forma discriminativa minimizando la entropía cruzada multiclase sobre un conjunto de datos de calibración supervisado con etiquetas de clase conocidas. Pero el mecanismo de transformación de la función de densidad de probabilidad (PDF) descrito anteriormente también puede utilizarse para facilitar el diseño de modelos de calibración entrenados generativamente con un componente de escalado de temperatura.

Ocurrencia y aplicaciones

modelos bayesianos

Las distribuciones de Dirichlet se utilizan comúnmente como distribución a priori de variables categóricas o multinomiales en modelos de mezcla bayesianos y otros modelos bayesianos jerárquicos . (En muchos campos, como el procesamiento del lenguaje natural , las variables categóricas a menudo se denominan imprecisamente "variables multinomiales". Es poco probable que este uso cause confusión, al igual que ocurre cuando se suelen confundir las distribuciones de Bernoulli y las binomiales ).

La inferencia sobre modelos bayesianos jerárquicos se realiza a menudo mediante el muestreo de Gibbs , y en tal caso, las instancias de la distribución de Dirichlet se marginalizan fuera del modelo integrando la variable aleatoria de Dirichlet . Esto provoca que las distintas variables categóricas derivadas de la misma variable aleatoria de Dirichlet se correlacionen, y la distribución conjunta sobre ellas asume una distribución multinomial de Dirichlet , condicionada a los hiperparámetros de la distribución de Dirichlet (los parámetros de concentración ). Una de las razones para hacer esto es que el muestreo de Gibbs de la distribución multinomial de Dirichlet es extremadamente sencillo; consulte ese artículo para obtener más información.

Interpretaciones intuitivas de los parámetros

El parámetro de concentración

Las distribuciones de Dirichlet se utilizan con frecuencia como distribuciones a priori en la inferencia bayesiana . El tipo más simple y quizás más común de distribución a priori de Dirichlet es la distribución de Dirichlet simétrica, donde todos los parámetros son iguales. Esto corresponde al caso en el que no se dispone de información previa para favorecer un componente sobre otro. Como se describió anteriormente, el único valor α al que se fijan todos los parámetros se denomina parámetro de concentración . Si el espacio muestral de la distribución de Dirichlet se interpreta como una distribución de probabilidad discreta , entonces intuitivamente el parámetro de concentración puede considerarse como el que determina cuán "concentrada" está la masa de probabilidad de la distribución de Dirichlet en su centro, lo que da lugar a muestras con una masa dispersa casi por igual entre todos los componentes; es decir, con un valor mucho menor que 1, la masa estará altamente concentrada en unos pocos componentes, y el resto tendrá una masa casi nula; y con un valor mucho mayor que 1, la masa estará dispersa casi por igual entre todos los componentes. Consulte el artículo sobre el parámetro de concentración para obtener más información.

Corte de cuerda

Un ejemplo de uso de la distribución de Dirichlet es si se quisiera cortar cuerdas (cada una de longitud inicial 1.0) en K piezas de diferentes longitudes, donde cada pieza tuviera una longitud promedio designada, pero permitiendo cierta variación en los tamaños relativos de las piezas. Recordemos queα0=i=1Kαi.{\displaystyle \alpha _{0}=\sum _{i=1}^{K}\alpha _{i}.}Elαi/α0{\displaystyle \alpha _{i}/\alpha _{0}}Los valores especifican las longitudes medias de los trozos de cuerda cortados resultantes de la distribución. La varianza alrededor de esta media varía inversamente conα0{\displaystyle \alpha _{0}}.

Ejemplo de distribución de Dirichlet(1/2,1/3,1/6)
Ejemplo de distribución de Dirichlet(1/2,1/3,1/6)

Consideremos una urna que contiene bolas de K colores diferentes. Inicialmente, la urna contiene α 1 bolas del color 1, α 2 bolas del color 2, y así sucesivamente. Ahora, realicemos N extracciones de la urna, donde después de cada extracción, la bola se vuelve a colocar en la urna junto con una bola adicional del mismo color. En el límite cuando N tiende a infinito, las proporciones de bolas de diferentes colores en la urna se distribuirán como Dir( α 1 , ..., α K ) . [ 28 ]

Para una demostración formal, observe que las proporciones de las bolas de diferentes colores forman una martingala acotada [0,1] con valores en K ; por lo tanto, según el teorema de convergencia de martingalas , estas proporciones convergen casi con seguridad y en media a un vector aleatorio límite. Para comprobar que este vector límite tiene la distribución de Dirichlet mencionada, verifique que todos los momentos mixtos coinciden.

Cada extracción de la urna modifica la probabilidad de extraer una bola de un color determinado en el futuro. Esta modificación disminuye con el número de extracciones, ya que el efecto relativo de añadir una nueva bola a la urna disminuye a medida que esta acumula más bolas.

generación de variables aleatorias

A partir de la distribución gamma

Con una fuente de variables aleatorias con distribución Gamma, se puede muestrear fácilmente un vector aleatorio.incógnita=(incógnita1,,incógnitaK){\displaystyle x=(x_{1},\ldots ,x_{K})}de la distribución de Dirichlet K -dimensional con parámetros(α1,,αK){\displaystyle (\alpha _{1},\ldots ,\alpha _{K})}Primero, extraiga K muestras aleatorias independientes .y1,,yK{\displaystyle y_{1},\ldots ,y_{K}}de distribuciones Gamma cada una con densidad

Gama(αi,1)=yiαi1miyiΓ(αi),{\displaystyle \operatorname {Gamma} (\alpha _{i},1)={\frac {y_{i}^{\alpha _{i}-1}\;e^{-y_{i}}}{\Gamma (\alpha _{i})}},\!}

y luego configurar

incógnitai=yij=1Kyj.{\displaystyle x_{i}={\frac {y_{i}}{\sum _{j=1}^{K}y_{j}}}.}

[Prueba]

La distribución conjunta de las variables gamma muestreadas independientemente,{yi}{\displaystyle \{y_{i}\}}, viene dado por el producto:

miiyii=1Kyiαi1Γ(αi){\displaystyle e^{-\sum _{i}y_{i}}\prod _{i=1}^{K}{\frac {y_{i}^{\alpha _{i}-1}}{\Gamma (\alpha _{i})}}}

A continuación, se utiliza un cambio de variables, parametrizando{yi}{\displaystyle \{y_{i}\}}en términos dey1,y2,,yK1{\displaystyle y_{1},y_{2},\ldots ,y_{K-1}}yi=1Kyi{\displaystyle \sum _{i=1}^{K}y_{i}}y realiza un cambio de variables desde yincógnita{\displaystyle y\to x}de tal manera queincógnita¯=i=1Kyi,incógnita1=y1incógnita¯,incógnita2=y2incógnita¯,,incógnitaK1=yK1incógnita¯{\displaystyle {\bar {x}}=\textstyle \sum _{i=1}^{K}y_{i},x_{1}={\frac {y_{1}}{\bar {x}}},x_{2}={\frac {y_{2}}{\bar {x}}},\ldots ,x_{K-1}={\frac {y_{K-1}}{\bar {x}}}}Cada una de las variables0incógnita1,incógnita2,,incógnitak11{\displaystyle 0\leq x_{1},x_{2},\ldots ,x_{k-1}\leq 1}y asimismo0i=1K1incógnitai1{\displaystyle 0\leq \textstyle \sum _{i=1}^{K-1}x_{i}\leq 1}. Entonces hay que utilizar la fórmula de cambio de variables,PAG(incógnita)=PAG(y(incógnita))|yincógnita|{\displaystyle P(x)=P(y(x)){\bigg |}{\frac {\partial y}{\partial x}}{\bigg |}}en el cual|yincógnita|{\displaystyle {\bigg |}{\frac {\partial y}{\partial x}}{\bigg |}}es el jacobiano de transformación. Escribiendo y explícitamente como una función de x, se obtiene y1=incógnita¯incógnita1,y2=incógnita¯incógnita2yK1=incógnita¯incógnitaK1,yK=incógnita¯(1i=1K1incógnitai){\displaystyle y_{1}={\bar {x}}x_{1},y_{2}={\bar {x}}x_{2}\ldots y_{K-1}={\bar {x}}x_{K-1},y_{K}={\bar {x}}(1-\textstyle \sum _{i=1}^{K-1}x_{i})} El Jacobiano ahora se ve así |incógnita¯0incógnita10incógnita¯incógnita2incógnita¯incógnita¯1i=1K1incógnitai|{\displaystyle {\begin{vmatrix}{\bar {x}}&0&\ldots &x_{1}\\0&{\bar {x}}&\ldots &x_{2}\\\vdots &\vdots &\ddots &\vdots \\-{\bar {x}}&-{\bar {x}}&\ldots &1-\sum _{i=1}^{K-1}x_{i}\end{vmatrix}}}

El determinante se puede evaluar observando que permanece sin cambios si se suman múltiplos de una fila a otra fila, y sumando cada una de las primeras K-1 filas a la última fila para obtener

|incógnita¯0incógnita10incógnita¯incógnita2001|{\displaystyle {\begin{vmatrix}{\bar {x}}&0&\ldots &x_{1}\\0&{\bar {x}}&\ldots &x_{2}\\\vdots &\vdots &\ddots &\vdots \\0&0&\ldots &1\end{vmatrix}}}

que se puede expandir en la fila inferior para obtener el valor del determinante.incógnita¯K1{\displaystyle {\bar {x}}^{K-1}}Sustituyendo x en la función de densidad de probabilidad conjunta e incluyendo el determinante jacobiano, se obtiene:

[i=1K1(incógnita¯incógnitai)αi1][incógnita¯(1i=1K1incógnitai)]αK1i=1KΓ(αi)incógnita¯K1miincógnita¯=Γ(α¯)[i=1K1(incógnitai)αi1][1i=1K1incógnitai]αK1i=1KΓ(αi)×incógnita¯α¯1miincógnita¯Γ(α¯){\displaystyle {\begin{aligned}&{\frac {\left[\prod _{i=1}^{K-1}({\bar {x}}x_{i})^{\alpha _{i}-1}\right]\left[{\bar {x}}(1-\sum _{i=1}^{K-1}x_{i})\right]^{\alpha _{K}-1}}{\prod _{i=1}^{K}\Gamma (\alpha _{i})}}{\bar {x}}^{K-1}e^{-{\bar {x}}}\\=&{\frac {\Gamma ({\bar {\alpha }})\left[\prod _{i=1}^{K-1}(x_{i})^{\alpha _{i}-1}\right]\left[1-\sum _{i=1}^{K-1}x_{i}\right]^{\alpha _{K}-1}}{\prod _{i=1}^{K}\Gamma (\alpha _{i})}}\times {\frac {{\bar {x}}^{{\bar {\alpha }}-1}e^{-{\bar {x}}}}{\Gamma ({\bar {\alpha }})}}\end{aligned}}} dóndeα¯=i=1Kαi{\displaystyle {\bar {\alpha }}=\textstyle \sum _{i=1}^{K}\alpha _{i}}. El lado derecho puede reconocerse como el producto de una función de densidad de probabilidad de Dirichlet para laincógnitai{\displaystyle x_{i}}y una función de densidad de probabilidad gamma paraincógnita¯{\displaystyle {\bar {x}}}La forma del producto muestra que las variables de Dirichlet y gamma son independientes, por lo que esta última puede integrarse simplemente omitándola, para obtener: incógnita1,incógnita2,,incógnitaK1(1i=1K1incógnitai)αK1i=1K1incógnitaiαi1B(α){\displaystyle x_{1},x_{2},\ldots ,x_{K-1}\sim {\frac {(1-\sum _{i=1}^{K-1}x_{i})^{\alpha _{K}-1}\prod _{i=1}^{K-1}x_{i}^{\alpha _{i}-1}}{B({\boldsymbol {\alpha }})}}}

Lo cual es equivalente a

i=1Kincógnitaiαi1B(α){\displaystyle {\frac {\prod _{i=1}^{K}x_{i}^{\alpha _{i}-1}}{B({\boldsymbol {\alpha }})}}}con apoyoi=1Kincógnitai=1{\displaystyle \sum _{i=1}^{K}x_{i}=1}

A continuación se muestra un ejemplo de código Python para dibujar la muestra:

params = [ a1 , a2 , ... , ak ] muestra = [ random . gammavariate ( a , 1 ) para a en params ] muestra = [ v / sum ( muestra ) para v en muestra ]

Esta formulación es correcta independientemente de cómo se parametricen las distribuciones Gamma (forma/escala frente a forma/tasa), porque son equivalentes cuando la escala y la tasa son iguales a 1,0.

A partir de las distribuciones beta marginales

Un algoritmo menos eficiente [ 29 ] se basa en que las distribuciones marginales y condicionales univariadas sean beta y procede de la siguiente manera. Simularincógnita1{\displaystyle x_{1}}de

Beta(α1,i=2Kαi){\displaystyle {\textrm {Beta}}\left(\alpha _{1},\sum _{i=2}^{K}\alpha _{i}\right)}

Luego simulaincógnita2,,incógnitaK1{\displaystyle x_{2},\ldots ,x_{K-1}}en orden, como sigue. Paraj=2,,K1{\displaystyle j=2,\ldots ,K-1}simularϕj{\displaystyle \phi _{j}}de

Beta(αj,i=j+1Kαi),{\displaystyle {\textrm {Beta}}\left(\alpha _{j},\sum _{i=j+1}^{K}\alpha _{i}\right),}

y dejar

incógnitaj=(1i=1j1incógnitai)ϕj.{\displaystyle x_{j}=\left(1-\sum _{i=1}^{j-1}x_{i}\right)\phi _{j}.}

Finalmente, configure

incógnitaK=1i=1K1incógnitai.{\displaystyle x_{K}=1-\sum _{i=1}^{K-1}x_{i}.}

Este procedimiento iterativo se corresponde estrechamente con la intuición de "corte de cuerdas" descrita anteriormente.

A continuación se muestra un ejemplo de código Python para dibujar la muestra:

params = [ a1 , a2 , ... , ak ] xs = [ random . betavariate ( params [ 0 ], sum ( params [ 1 :]))] for j in range ( 1 , len ( params ) - 1 ): phi = random . betavariate ( params [ j ], sum ( params [ j + 1 :])) xs . append (( 1 - sum ( xs )) * phi ) xs . append ( 1 - sum ( xs ))

Cuando cada alfa es 1

Cuando α 1 = ... = α K = 1 , se puede encontrar una muestra de la distribución extrayendo aleatoriamente un conjunto de K − 1 valores de forma independiente y uniforme del intervalo [0, 1] , agregando los valores 0 y 1 al conjunto para que tenga K + 1 valores, ordenando el conjunto y calculando la diferencia entre cada par de valores adyacentes en orden, para obtener x 1 , ..., x K .

Cuando cada alfa es 1/2 y relación con la hiperesfera

Cuando α 1 = ... = α K = 1/2 , se puede encontrar una muestra de la distribución extrayendo aleatoriamente K valores independientemente de la distribución normal estándar, elevando al cuadrado estos valores y normalizándolos dividiéndolos por su suma, para obtener x 1 , ..., x K .

Se puede extraer un punto ( x₁ , ..., xₖ ) de forma uniforme y aleatoria de la hiperesfera unitaria de dimensión ( K -1 ) (que es la superficie de una hiperbola de dimensión K ) mediante un procedimiento similar. Se extraen aleatoriamente K valores de forma independiente de la distribución normal estándar y se normalizan estos valores de coordenadas dividiendo cada uno por la constante que es la raíz cuadrada de la suma de sus cuadrados.

Véase también

Referencias

  1. S. Kotz; N. Balakrishnan; NL Johnson (2000). Distribuciones multivariadas continuas. Volumen 1: Modelos y aplicaciones . Nueva York: Wiley. ISBN 978-0-471-18387-7.(Capítulo 49: Distribuciones de Dirichlet y Dirichlet invertida)
  2. Olkin, Ingram; Rubin, Herman (1964). "Distribuciones beta multivariadas y propiedades de independencia de la distribución de Wishart" . The Annals of Mathematical Statistics . 35 (1): 261– 269. doi : 10.1214/aoms/1177703748 . JSTOR 2238036 . 
  3. 1 2 Bela A. Frigyik; Amol Kapila; Maya R. Gupta (2010). "Introducción a la distribución de Dirichlet y procesos relacionados" (PDF) . Departamento de Ingeniería Eléctrica de la Universidad de Washington. Archivado del original (Informe técnico UWEETR-2010-006) el 19 de febrero de 2015.
  4. A. Jøsang, JH Cho y F. Chen. Pesos previos no informativos para PDF de Dirichlet. Actas de la Conferencia Internacional IEEE de Fusión e Integración Multisensorial de 2022 (MFI 2022) , Cranfield, Reino Unido, septiembre de 2022. PDF
  5. Ecuación (49.9) en la página 488 de Kotz, Balakrishnan y Johnson (2000). Distribuciones multivariadas continuas. Volumen 1: Modelos y aplicaciones. Nueva York: Wiley.
  6. BalakrishV. B. (2005). ""Capítulo 27. Distribución de Dirichlet"" . Introducción a las distribuciones estadísticas . Hoboken, NJ: John Wiley & Sons, Inc. pág . 274. ISBN  978-0-471-42798-8.
  7. Dello Schiavo, Lorenzo (2019). "Funcionales característicos de medidas de Dirichlet" . Electron. J. Probab . 24 : 1–38 . arXiv : 1810.09790 . doi : 10.1214/19-EJP371 .
  8. Dello Schiavo, Lorenzo; Quattrocchi, Filippo (2023). "Momentos de Dirichlet multivariados y una fórmula de muestreo policromática de Ewens". arXiv : 2309.11292 [ matemáticas.PR ].
  9. Hoffmann, Till. "Momentos de la distribución de Dirichlet" . Archivado del original el 14 de febrero de 2016. Consultado el 14 de febrero de 2016 .
  10. Christopher M. Bishop (17 de agosto de 2006). Reconocimiento de patrones y aprendizaje automático . Springer. ISBN 978-0-387-31073-2.
  11. Farrow, Malcolm. "MAS3301 Bayesian Statistics" (PDF) . Universidad de Newcastle . Consultado el 10 de abril de 2013 .
  12. Lin, Jiayu (2016). Sobre la distribución de Dirichlet (PDF) . Kingston, Canadá: Queen's University. págs. § 2.4.9. 
  13. Nguyen, Duy (15 de agosto de 2023). "UNA INTRODUCCIÓN PROFUNDA A LA NOTA DE BAYES VARIACIONAL" . SSRN 4541076. Recuperado el 15 de agosto de 2023 . 
  14. Song, Kai-Sheng (2001). "Información de Rényi, log-verosimilitud y una medida de distribución intrínseca". Journal of Statistical Planning and Inference . 93 (325). Elsevier: 51– 69. doi : 10.1016/S0378-3758(00)00169-5 .
  15. Nemenman, Ilya; Shafee, Fariel; Bialek, William (2002). Entropía e inferencia, una revisión (PDF) . NIPS 14., ecuación 8
  16. Joram Soch (10 de mayo de 2020). "Divergencia de Kullback-Leibler para la distribución de Dirichlet" . El libro de pruebas estadísticas . StatProofBook . Consultado el 23 de junio de 2025 .
  17. Connor, Robert J.; Mosimann, James E (1969). "Conceptos de independencia para proporciones con una generalización de la distribución de Dirichlet". Journal of the American Statistical Association . 64 (325). American Statistical Association: 194– 206. doi : 10.2307/2283728 . JSTOR 2283728 . 
  18. Véase Kotz, Balakrishnan y Johnson (2000), Sección 8.5, "Generalización de Connor y Mosimann", págs. 519–521.
  19. Phillips, PCB (1988). "La función característica de la distribución de Dirichlet y la distribución F multivariada" (PDF) . Cowles Foundation Discussion Paper 865 .
  20. Grinshpan, AZ (2017). "Una desigualdad para convoluciones múltiples con respecto a la medida de probabilidad de Dirichlet" . Advances in Applied Mathematics . 82 (1): 102– 119. doi : 10.1016/j.aam.2016.08.001 .
  21. Perrault, P. (2024). "Una nueva cota para la función generadora de cumulantes de los procesos de Dirichlet". arXiv : 2409.18621 [ math.PR ].Teorema 3.3
  22. 1 2 Devroye, Luc (1986). Generación de variables aleatorias no uniformes . Springer-Verlag. ISBN 0-387-96305-7.
  23. Lefkimmiatis, Stamatios; Maragos, Petros; Papandreou, George (2009). "Inferencia bayesiana en modelos multiescala para la estimación de intensidad de Poisson: aplicaciones a la eliminación de ruido de imágenes limitada por fotones" . IEEE Transactions on Image Processing . 18 (8): 1724– 1741. Bibcode : 2009ITIP...18.1724L . doi : 10.1109/TIP.2009.2022008 . PMID 19414285. S2CID 859561 .  
  24. Andreoli, Jean-Marc (2018). "Una distribución a priori conjugada para la distribución de Dirichlet". arXiv : 1811.05266 [ cs.LG ].
  25. Graf, Monique (2019). "La distribución Beta generalizada simplicial: paquete R SGB y aplicaciones" . Libra . Recuperado el 26 de mayo de 2025 .{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace )
  26. Sorrenson, Peter; et al. (2024) (2023). "Learning Distributions on Manifolds with Free-Form Flows". arXiv : 2312.09852 [ cs.LG ].{{cite arXiv}}: CS1 maint: nombres numéricos: lista de autores ( enlace )
  27. Ferrer, Luciana; Ramos, Daniel (2025). "Evaluación de probabilidades posteriores: teoría de la decisión, reglas de puntuación adecuadas y calibración" . Transactions on Machine Learning Research .
  28. Blackwell, David; MacQueen, James B. (1973). "Distribuciones de Ferguson mediante esquemas de urnas de Polya" . Ann. Stat . 1 (2): 353– 355. doi : 10.1214/aos/1176342372 .
  29. ↑ A. Gelman ; JB Carlin; HS Stern; DB Rubin (2003). Análisis de datos bayesianos (2.ª ed.). Chapman & Hall/CRC. pp. 582. ISBN   1-58488-388-X.
  • "Distribución de Dirichlet" , Enciclopedia de Matemáticas , EMS Press, 2001 [1994]
  • Distribución de Dirichlet
  • Cómo estimar los parámetros de la distribución de Dirichlet compuesta (distribución de Pólya) utilizando el algoritmo de expectativa-maximización (EM).
  • Luc Devroye. "Generación de variables aleatorias no uniformes" . Consultado el 19 de octubre de 2019 .
  • Medidas aleatorias de Dirichlet, método de construcción mediante variables aleatorias de Poisson compuestas y propiedades de intercambiabilidad de la distribución gamma resultante.
  • SciencesPo : Paquete de R que contiene funciones para simular parámetros de la distribución de Dirichlet.