Articulo de referencia

Distribución categórica

k > 0 number of categories ([[integer]]) p_1, \\ldots, p_k event probabilities (p_i \\geq 0,\\,\\Sigma p_i = 1) "},"support":{"wt":" x \\in \\{1,\\dots,k\\} "},"pdf":{"wt":"(1) ...

En teoría de la probabilidad y estadística , una distribución categórica (también llamada distribución de Bernoulli generalizada , distribución multinoulli [ 1 ] ) es una distribución de probabilidad discreta que describe los posibles resultados de una variable aleatoria que puede tomar una de K categorías posibles, con la probabilidad de cada categoría especificada por separado. No existe un orden subyacente innato de estos resultados, pero a menudo se les asignan etiquetas numéricas para facilitar la descripción de la distribución (por ejemplo, del 1 al K ). La distribución categórica K -dimensional es la distribución más general sobre un evento K -dimensional; cualquier otra distribución discreta sobre un espacio muestral de tamaño K es un caso especial. Los parámetros que especifican las probabilidades de cada posible resultado están restringidos únicamente por el hecho de que cada uno debe estar en el rango de 0 a 1, y todos deben sumar 1.

La distribución categórica es la generalización de la distribución de Bernoulli para una variable aleatoria categórica , es decir, para una variable discreta con más de dos resultados posibles, como el lanzamiento de un dado . Por otro lado, la distribución categórica es un caso especial de la distribución multinomial , ya que proporciona las probabilidades de los resultados potenciales de una sola tirada, en lugar de múltiples tiradas.

Terminología

En ocasiones, la distribución categórica se denomina "distribución discreta". Sin embargo, esto se refiere propiamente no a una familia particular de distribuciones, sino a una clase general de distribuciones .

En algunos campos, como el aprendizaje automático y el procesamiento del lenguaje natural , las distribuciones categóricas y multinomiales se confunden, y es común hablar de una "distribución multinomial" cuando una "distribución categórica" ​​sería más precisa. [ 2 ] Este uso impreciso se debe a que a veces es conveniente expresar el resultado de una distribución categórica como un vector "1 de K " (un vector con un elemento que contiene un 1 y todos los demás elementos que contienen un 0) en lugar de como un entero en el rango de 1 a K ; de esta forma, una distribución categórica es equivalente a una distribución multinomial para una sola observación (véase más adelante).

Sin embargo, confundir las distribuciones categóricas y multinomiales puede generar problemas. Por ejemplo, en una distribución multinomial de Dirichlet , que surge comúnmente en modelos de procesamiento del lenguaje natural (aunque no suele denominarse así) como resultado del muestreo de Gibbs colapsado, donde las distribuciones de Dirichlet se colapsan a partir de un modelo bayesiano jerárquico , es muy importante distinguir entre distribuciones categóricas y multinomiales. La distribución conjunta de las mismas variables con la misma distribución multinomial de Dirichlet tiene dos formas diferentes, dependiendo de si se caracteriza como una distribución cuyo dominio abarca nodos categóricos individuales o recuentos de nodos de estilo multinomial en cada categoría particular (similar a la distinción entre un conjunto de nodos con distribución de Bernoulli y un único nodo con distribución binomial ). Ambas formas tienen funciones de masa de probabilidad (FMP) muy similares , que hacen referencia a recuentos de nodos de estilo multinomial en una categoría. Sin embargo, la función de masa de probabilidad (FMP) de estilo multinomial tiene un factor adicional, un coeficiente multinomial , que es una constante igual a 1 en la FMP de estilo categórico. Confundir ambas funciones puede fácilmente llevar a resultados incorrectos en situaciones donde este factor adicional no es constante con respecto a las distribuciones de interés. El factor suele ser constante en las condicionales completas utilizadas en el muestreo de Gibbs y en las distribuciones óptimas de los métodos variacionales .

Formulación de distribuciones

Una distribución categórica es una distribución de probabilidad discreta cuyo espacio muestral es el conjunto de k elementos identificados individualmente. Es la generalización de la distribución de Bernoulli para una variable aleatoria categórica .

En una formulación de la distribución, el espacio muestral se considera una secuencia finita de enteros. Los enteros exactos utilizados como etiquetas no son importantes; podrían ser {0, 1, ..., k  1} o {1, 2, ..., k } o cualquier otro conjunto arbitrario de valores. En las siguientes descripciones, utilizamos {1, 2, ..., k } por conveniencia, aunque esto difiere de la convención para la distribución de Bernoulli , que utiliza {0, 1}. En este caso, la función de probabilidad f es:

F(incógnita=ipag)=pagi,{\displaystyle f(x=i\mid {\boldsymbol {p}})=p_{i},}

dóndepag=(pag1,,pagk){\displaystyle {\boldsymbol {p}}=(p_{1},\ldots ,p_{k})},pagi{\displaystyle p_{i}}representa la probabilidad de ver el elemento i yi=1kpagi=1{\displaystyle \textstyle {\sum _ {i=1}^{k}p_ {i}=1}}.

Otra formulación que parece más compleja pero facilita las manipulaciones matemáticas es la siguiente, utilizando el corchete de Iverson : [ 3 ]

F(incógnitapag)=i=1kpagi[incógnita=i],{\displaystyle f(x\mid {\boldsymbol {p}})=\prod _{i=1}^{k}p_{i}^{[x=i]},}

dónde[incógnita=i]{\displaystyle [x=i]}se evalúa a 1 siincógnita=i{\displaystyle x=i}, 0 en caso contrario. Esta formulación presenta varias ventajas, por ejemplo:

Otra formulación explicita la conexión entre las distribuciones categórica y multinomial al tratar la distribución categórica como un caso especial de la distribución multinomial en la que el parámetro n de la distribución multinomial (el número de elementos muestreados) se fija en 1. En esta formulación, el espacio muestral puede considerarse como el conjunto de vectores aleatorios x de dimensión k codificados como 1 de K [ 4 ], que tienen la propiedad de que exactamente un elemento tiene el valor 1 y los demás tienen el valor 0. El elemento particular con valor 1 indica qué categoría se ha elegido. La función de probabilidad f en esta formulación es:

F(incógnitapag)=i=1kpagiincógnitai,{\displaystyle f(\mathbf {x} \mid {\boldsymbol {p}})=\prod _{i=1}^{k}p_{i}^{x_{i}},}

dóndepagi{\displaystyle p_{i}}representa la probabilidad de ver el elemento i yipagi=1{\displaystyle \textstyle {\sum _ {i}p_ {i}=1}}Esta es la formulación adoptada por Bishop . [ 4 ] [ nota 1 ]

Propiedades

Las posibles probabilidades para la distribución categórica conk=3{\displaystyle k=3}son los 2-simplexpag1+pag2+pag3=1{\displaystyle p_{1}+p_{2}+p_{3}=1}, incrustado en el espacio tridimensional.
  • La distribución viene dada completamente por las probabilidades asociadas a cada número i :pagi=PAG(incógnita=i){\displaystyle p_{i}=P(X=i)}, i = 1,..., k , dondeipagi=1{\displaystyle \textstyle {\sum _ {i}p_ {i}=1}}Los conjuntos posibles de probabilidades son exactamente los mismos que en el estándar .(k1){\displaystyle (k-1)}simplex -dimensional ; para k = 2 esto se reduce a las posibles probabilidades de que la distribución de Bernoulli sea el 1-símplex,pag1+pag2=1,0pag1,pag21.{\displaystyle p_{1}+p_{2}=1,0\leq p_{1},p_{2}\leq 1.}
  • La distribución es un caso especial de una "distribución de Bernoulli multivariada" [ 5 ] en la que exactamente una de las k variables 0-1 toma el valor uno.
  • mi[incógnita]=pag{\displaystyle \operatorname {E} \left[\mathbf {x} \right]={\boldsymbol {p}}}
  • Dejarincógnita{\displaystyle {\boldsymbol {X}}}Sea la realización de una distribución categórica. Defina el vector aleatorio Y como compuesto por los elementos:
Yi=I(incógnita=i),{\displaystyle Y_{i}=I({\boldsymbol {X}}=i),}
donde I es la función indicadora . Entonces Y tiene una distribución que es un caso especial de la distribución multinomial con parámetronorte=1{\displaystyle n=1}. La suma denorte{\displaystyle n}variables aleatorias Y independientes e idénticamente distribuidas construidas a partir de una distribución categórica con parámetropag{\displaystyle {\boldsymbol {p}}}es distribuida multinomialmente con parámetrosnorte{\displaystyle n}ypag.{\displaystyle {\boldsymbol {p}}.}

Inferencia bayesiana mediante distribución a priori conjugada

En estadística bayesiana , la distribución de Dirichlet es la distribución a priori conjugada de la distribución categórica (y también de la distribución multinomial ). Esto significa que en un modelo que consta de un punto de datos con una distribución categórica con un vector de parámetros desconocido p , y (al estilo bayesiano estándar) elegimos tratar este parámetro como una variable aleatoria y asignarle una distribución a priori definida mediante una distribución de Dirichlet , entonces la distribución a posteriori del parámetro, después de incorporar el conocimiento obtenido de los datos observados, también es de Dirichlet. Intuitivamente, en tal caso, partiendo de lo que se sabe sobre el parámetro antes de observar el punto de datos, el conocimiento puede actualizarse en función de dicho punto, obteniendo una nueva distribución de la misma forma que la anterior. De esta manera, el conocimiento de un parámetro puede actualizarse sucesivamente incorporando nuevas observaciones una a una, sin incurrir en dificultades matemáticas.

Formalmente, esto se puede expresar de la siguiente manera. Dado un modelo

α=(α1,,αK)=hiperparámetro de concentraciónpagα=(pag1,,pagK)Director(K,α)incógnitapag=(incógnita1,,incógnitanorte)Gato(K,pag){\displaystyle {\begin{array}{lclcl}{\boldsymbol {\alpha }}&=&(\alpha _{1},\ldots ,\alpha _{K})&=&{\text{hiperparámetro de concentración}}\\\mathbf {p} \mid {\boldsymbol {\alpha }}&=&(p_{1},\ldots ,p_{K})&\sim &\operatorname {Dir} (K,{\boldsymbol {\alpha }})\\\mathbb {X} \mid \mathbf {p} &=&(x_{1},\ldots ,x_{N})&\sim &\operatorname {Cat} (K,\mathbf {p} )\end{array}}}

Entonces se cumple lo siguiente: [ 2 ]

do=(do1,,doK)=número de ocurrencias de la categoría i, de modo que doi=j=1norte[incógnitaj=i]pagincógnita,αDirector(K,do+α)=Director(K,do1+α1,,doK+αK){\displaystyle {\begin{array}{lclcl}\mathbf {c} &=&(c_{1},\ldots ,c_{K})&=&{\text{número de ocurrencias de la categoría }}i,{\text{ de modo que }}c_{i}=\sum _{j=1}^{N}[x_{j}=i]\\\mathbf {p} \mid \mathbb {X} ,{\boldsymbol {\alpha }}&\sim &\operatorname {Dir} (K,\mathbf {c} +{\boldsymbol {\alpha }})&=&\operatorname {Dir} (K,c_{1}+\alpha _{1},\ldots ,c_{K}+\alpha _{K})\end{array}}}

Esta relación se utiliza en estadística bayesiana para estimar el parámetro subyacente p de una distribución categórica a partir de un conjunto de N muestras. Intuitivamente, podemos considerar el vector hiperprior α como pseudocuentas , es decir, como la representación del número de observaciones en cada categoría que ya hemos visto. Luego, simplemente sumamos las conteos de todas las nuevas observaciones (el vector c ) para obtener la distribución posterior.

Otra intuición proviene del valor esperado de la distribución posterior (véase el artículo sobre la distribución de Dirichlet ):

mi[pagiincógnita,α]=doi+αinorte+kαk{\displaystyle \operatorname {E} [p_{i}\mid \mathbb {X} ,{\boldsymbol {\alpha }}]={\frac {c_{i}+\alpha _{i}}{N+\sum _{k}\alpha _{k}}}}

Esto significa que la probabilidad esperada de ver una categoría i entre las distintas distribuciones discretas generadas por la distribución posterior es simplemente igual a la proporción de ocurrencias de esa categoría observadas en los datos, incluyendo los pseudocuentas en la distribución previa. Esto tiene mucho sentido intuitivo: si, por ejemplo, hay tres categorías posibles y la categoría 1 aparece en los datos observados el 40% de las veces, cabría esperar, en promedio, que la categoría 1 también aparezca el 40% de las veces en la distribución posterior.

(Esta intuición ignora el efecto de la distribución previa. Además, la distribución posterior es una distribución sobre distribuciones . La distribución posterior generalmente describe el parámetro en cuestión, y en este caso el parámetro en sí es una distribución de probabilidad discreta , es decir, la distribución categórica real que generó los datos. Por ejemplo, si hay 3 categorías en la proporción 40:5:55 en los datos observados, entonces, ignorando el efecto de la distribución previa, se esperaría que el parámetro verdadero  —es decir, la distribución subyacente real que generó nuestros datos observados—  tuviera el valor promedio de (0.40, 0.05, 0.55), que es precisamente lo que revela la distribución posterior. Sin embargo, la distribución verdadera podría ser (0.35, 0.07, 0.58) o (0.42, 0.04, 0.54) o varias otras posibilidades cercanas. La cantidad de incertidumbre involucrada aquí viene especificada por la varianza de la distribución posterior, que está controlada por el número total de observaciones  : cuantos más datos se observen, menor será la incertidumbre sobre el parámetro verdadero).

(Técnicamente, el parámetro anteriorαi{\displaystyle \alpha _{i}}En realidad debería verse como una representaciónαi1{\displaystyle \alpha _{i}-1}observaciones previas de categoríai{\displaystyle i}. Luego, el parámetro posterior actualizadodoi+αi{\displaystyle c_{i}+\alpha _{i}}representadoi+αi1{\displaystyle c_{i}+\alpha _{i}-1}observaciones posteriores. Esto refleja el hecho de que una distribución de Dirichlet conα=(1,1,){\displaystyle {\boldsymbol {\alpha }}=(1,1,\ldots )}tiene una forma completamente plana, esencialmente, una distribución uniforme sobre el simplex de posibles valores de p . Lógicamente, una distribución plana de este tipo representa una ignorancia total, que corresponde a ninguna observación de ningún tipo. Sin embargo, la actualización matemática de la posterior funciona bien si ignoramos la1{\displaystyle \cdots -1}término y simplemente pensar en el vector α como si representara directamente un conjunto de pseudocuentas. Además, hacer esto evita el problema de interpretarαi{\displaystyle \alpha _{i}}valores menores que 1.)

Estimación de MAP

La estimación de máxima probabilidad a posteriori del parámetro p en el modelo anterior es simplemente la moda de la distribución posterior de Dirichlet , es decir, [ 2 ]

argramometroaincógnitapagpag(pagincógnita)=αi+doi1i(αi+doi1),iαi+doi>1{\displaystyle \operatorname {arg\,max} \limits _{\mathbf {p} }p(\mathbf {p} \mid \mathbb {X} )={\frac {\alpha _{i}+c_{i}-1}{\sum _{i}(\alpha _{i}+c_{i}-1)}},\qquad \forall i\;\alpha _{i}+c_{i}>1}

En muchas aplicaciones prácticas, la única forma de garantizar la condición de queiαi+doi>1{\displaystyle \forall i\;\alpha _{i}+c_{i}>1}es establecerαi>1{\displaystyle \alpha _{i}>1}para todos yo .

Probabilidad marginal

En el modelo anterior, la probabilidad marginal de las observaciones (es decir, la distribución conjunta de las observaciones, con el parámetro a priori marginalizado ) es una distribución multinomial de Dirichlet : [ 2 ]

pag(incógnitaα)=pagpag(incógnitapag)pag(pagα)dpag=Γ(kαk)Γ(norte+kαk)k=1KΓ(dok+αk)Γ(αk){\displaystyle {\begin{aligned}p(\mathbb {X} \mid {\boldsymbol {\alpha }})&=\int _{\mathbf {p} }p(\mathbb {X} \mid \mathbf {p} )p(\mathbf {p} \mid {\boldsymbol {\alpha }}){\textrm {d}}\mathbf {p} \\&={\frac {\Gamma \left(\sum _{k}\alpha _{k}\right)}{\Gamma \left(N+\sum _{k}\alpha _{k}\right)}}\prod _{k=1}^{K}{\frac {\Gamma (c_{k}+\alpha _{k})}{\Gamma (\alpha _{k})}}\end{aligned}}}

Esta distribución desempeña un papel importante en los modelos bayesianos jerárquicos , ya que al realizar inferencias sobre dichos modelos mediante métodos como el muestreo de Gibbs o el análisis bayesiano variacional , las distribuciones a priori de Dirichlet suelen quedar marginalizadas. Consulte el artículo sobre esta distribución para obtener más detalles.

Distribución predictiva posterior

La distribución predictiva posterior de una nueva observación en el modelo anterior es la distribución que una nueva observaciónincógnita~{\displaystyle {\tilde {x}}}tomaría dado el conjuntoincógnita{\displaystyle \mathbb {X} }de N observaciones categóricas. Como se muestra en el artículo sobre la distribución multinomial de Dirichlet , tiene una forma muy simple: [ 2 ]

pag(incógnita~=iincógnita,α)=pagpag(incógnita~=ipag)pag(pagincógnita,α)dpag=doi+αinorte+kαk=mi[pagiincógnita,α]doi+αi.{\displaystyle {\begin{aligned}p({\tilde {x}}=i\mid \mathbb {X} ,{\boldsymbol {\alpha }})&=\int _{\mathbf {p} }p({\tilde {x}}=i\mid \mathbf {p} )\,p(\mathbf {p} \mid \mathbb {X} ,{\boldsymbol {\alpha }})\,{\textrm {d}}\mathbf {p} \\&=\,{\frac {c_{i}+\alpha _{i}}{N+\sum _{k}\alpha _{k}}}\\&=\,\mathbb {E} [p_{i}\mid \mathbb {X} ,{\boldsymbol {\alpha }}]\\&\propto \,c_{i}+\alpha _{i}.\\\end{aligned}}}

Existen diversas relaciones entre esta fórmula y las anteriores:

  • La probabilidad predictiva posterior de observar una categoría en particular es igual a la proporción relativa de observaciones previas en esa categoría (incluidas las pseudoobservaciones de la distribución a priori). Esto tiene sentido lógico: intuitivamente, esperaríamos observar una categoría en particular según la frecuencia con la que ya se ha observado.
  • La probabilidad predictiva posterior es igual al valor esperado de la distribución posterior. Esto se explica con más detalle a continuación.
  • Como resultado, esta fórmula se puede expresar simplemente como "la probabilidad predictiva posterior de ver una categoría es proporcional al recuento total observado de esa categoría", o como "el recuento esperado de una categoría es el mismo que el recuento total observado de la categoría", donde "recuento observado" se entiende que incluye las pseudo-observaciones de la distribución a priori.

La razón de la equivalencia entre la probabilidad predictiva posterior y el valor esperado de la distribución posterior de p se hace evidente al reexaminar la fórmula anterior. Como se explica en el artículo sobre la distribución predictiva posterior , la fórmula para la probabilidad predictiva posterior tiene la forma de un valor esperado tomado con respecto a la distribución posterior:

pag(incógnita~=iincógnita,α)=pagpag(incógnita~=ipag)pag(pagincógnita,α)dpag=mipagincógnita,α[pag(incógnita~=ipag)]=mipagincógnita,α[pagi]=mi[pagiincógnita,α].{\displaystyle {\begin{aligned}p({\tilde {x}}=i\mid \mathbb {X} ,{\boldsymbol {\alpha }})&=\int _{\mathbf {p} }p({\tilde {x}}=i\mid \mathbf {p} )\,p(\mathbf {p} \mid \mathbb {X} ,{\boldsymbol {\alpha }})\,{\textrm {d}}\mathbf {p} \\&=\,\operatorname {E} _{\mathbf {p} \mid \mathbb {X} ,{\boldsymbol {\alpha }}}\left[p({\tilde {x}}=i\mid \mathbf {p} )\right]\\&=\,\operatorname {E} _{\mathbf {p} \mid \mathbb {X} ,{\boldsymbol {\alpha }}}\left[p_{i}\right]\\&=\,\operatorname {E} [p_{i}\mid \mathbb {X} ,{\boldsymbol {\alpha }}].\end{aligned}}}

La línea crucial es la tercera. La segunda se deduce directamente de la definición de valor esperado. La tercera línea es particular de la distribución categórica y se deriva del hecho de que, específicamente en la distribución categórica, el valor esperado de observar un valor particular i viene directamente especificado por el parámetro asociado p i . La cuarta línea es simplemente una reescritura de la tercera con una notación diferente, utilizando la notación anterior para una esperanza calculada con respecto a la distribución posterior de los parámetros.

Observe los puntos de datos uno por uno y considere su probabilidad predictiva antes de observarlos y actualizar la probabilidad posterior. Para cualquier punto de datos, la probabilidad de que pertenezca a una categoría determinada depende del número de puntos de datos que ya se encuentran en esa categoría. En este caso, si una categoría tiene una alta frecuencia de aparición, es más probable que nuevos puntos de datos se unan a ella, enriqueciéndola aún más. Este tipo de escenario se conoce como modelo de apego preferencial (o «los ricos se hacen más ricos»). Este modelo describe muchos procesos del mundo real, y en tales casos, las decisiones tomadas por los primeros puntos de datos tienen una influencia desproporcionada en el resto.

Distribución condicional posterior

En el muestreo de Gibbs , normalmente se necesita extraer datos de distribuciones condicionales en redes bayesianas multivariables donde cada variable está condicionada a todas las demás. En redes que incluyen variables categóricas con distribuciones a priori de Dirichlet (por ejemplo, modelos de mezcla y modelos que incluyen componentes de mezcla), las distribuciones de Dirichlet a menudo se "colapsan" ( marginalizan ) de la red, lo que introduce dependencias entre los distintos nodos categóricos que dependen de una distribución a priori dada (específicamente, su distribución conjunta es una distribución multinomial de Dirichlet ). Una de las razones para hacer esto es que, en tal caso, la distribución de un nodo categórico dados los demás es exactamente la distribución predictiva posterior de los nodos restantes.

Es decir, para un conjunto de nodosincógnita{\displaystyle \mathbb {X} }, si el nodo en cuestión se denota comoincógnitanorte{\displaystyle x_{n}}y el resto comoincógnita(norte){\displaystyle \mathbb {X} ^{(-n)}}, entonces

pag(incógnitanorte=iincógnita(norte),α)=doi(norte)+αinorte1+iαidoi(norte)+αi{\displaystyle {\begin{aligned}p(x_{n}=i\mid \mathbb {X} ^{(-n)},{\boldsymbol {\alpha }})&=\,{\frac {c_{i}^{(-n)}+\alpha _{i}}{N-1+\sum _{i}\alpha _{i}}}&\propto \,c_{i}^{(-n)}+\alpha _{i}\end{aligned}}}

dóndedoi(norte){\displaystyle c_{i}^{(-n)}}es el número de nodos que tienen la categoría i entre los nodos distintos del nodo n .

Muestreo

Existen varios métodos , pero la forma más común de muestrear a partir de una distribución categórica utiliza un tipo de muestreo de transformación inversa :

Supongamos que una distribución se expresa como "proporcional a" alguna expresión, con una constante de normalización desconocida . Antes de tomar cualquier muestra, se preparan algunos valores de la siguiente manera:

  1. Calcula el valor no normalizado de la distribución para cada categoría.
  2. Súmalos y divide cada valor por esa suma para normalizarlos .
  3. Imponga algún tipo de orden a las categorías (por ejemplo, mediante un índice que vaya de 1 a k , donde k es el número de categorías).
  4. Convierta los valores a una función de distribución acumulativa (FDA) reemplazando cada valor por la suma de todos los valores anteriores. Esto se puede realizar en tiempo O(k) . El valor resultante para la primera categoría será 0.

Entonces, cada vez que sea necesario muestrear un valor:

  1. Elige un número distribuido uniformemente entre 0 y 1.
  2. Localiza el mayor número en la función de distribución acumulada (CDF) cuyo valor sea menor o igual al número recién elegido. Esto se puede hacer en tiempo O(log(k)) mediante búsqueda binaria .
  3. Devuelve la categoría correspondiente a este valor de la función de distribución acumulativa (CDF).

Si es necesario extraer muchos valores de la misma distribución categórica, el siguiente enfoque es más eficiente. Extrae n muestras en un tiempo O(n) (suponiendo que se utiliza una aproximación O(1) para extraer valores de la distribución binomial [ 6 ] ).

función draw_categorical(n) // donde n es el número de muestras a extraer de la distribución categórica r = 1 s = 0 para i desde 1 hasta k // donde k es el número de categorías v = extracción de una distribución binomial(n, p[i] / r) // donde p[i] es la probabilidad de la categoría i para j de 1 a v z[s++] = i // donde z es un array en el que se almacenan los resultados n = n - v r = r - p[i] barajar (reordenar aleatoriamente) los elementos en z devolver z 

Muestreo mediante la distribución de Gumbel

En el aprendizaje automático es típico parametrizar la distribución categórica,pag1,,pagk{\displaystyle p_{1},\ldots ,p_{k}}mediante una representación sin restricciones enRk{\displaystyle \mathbb {R} ^{k}}cuyos componentes vienen dados por:

γi=registropagi+α{\displaystyle \gamma _{i}=\log p_{i}+\alpha }

dóndeα{\displaystyle \alpha }es cualquier constante real. Dada esta representación,pag1,,pagk{\displaystyle p_{1},\ldots ,p_{k}}se puede recuperar utilizando la función softmax , que luego se puede muestrear utilizando las técnicas descritas anteriormente. Sin embargo, existe un método de muestreo más directo que utiliza muestras de la distribución de Gumbel . [ 7 ] Seagramo1,,gramok{\displaystyle g_{1},\ldots ,g_{k}}sean k extracciones independientes de la distribución estándar de Gumbel, entonces

do=argramometroaincógnitai(γi+gramoi){\displaystyle c=\operatorname {arg\,max} \limits _{i}\left(\gamma _{i}+g_{i}\right)}

será una muestra de la distribución categórica deseada. (Sii{\displaystyle u_{i}}es una muestra de la distribución uniforme estándar , entoncesgramoi=registro(registroi){\displaystyle g_{i}=-\log(-\log u_{i})}(es una muestra de la distribución estándar de Gumbel.)

Muestreo reparametrizable mediante modelos de difusión generativos

En el aprendizaje automático, a menudo es necesario utilizar un esquema de muestreo reparametrizable para la distribución categórica. Dada una distribución categórica con categorías{incógnita1,incógnita2,,incógnitanorte}{\displaystyle \lbrace x_{1},x_{2},\ldots ,x_{n}\rbrace }y probabilidades asociadas{w1,w2,,wnorte}{\displaystyle \lbrace w_{1},w_{2},\ldots ,w_{n}\rbrace }Es posible aprovechar un modelo de difusión de eliminación de ruido (tiempo inverso).

dU(t)=F(U(t),t)dt+2dW(t),U(T)pagTnorte,{\displaystyle dU(t)=f(U(t),t)dt+{\sqrt {2}}dW(t),\quad U(T)\sim p_{T}^{n},}

de tal manera queU(0){\displaystyle U(0)}sigue la distribución categórica objetivo, lo que significapag(U(0)=incógnitai)=wi{\displaystyle p(U(0)=x_{i})=w_{i}}parai=1,2,,norte{\displaystyle i=1,2,\ldots ,n}. Por lo tanto, el muestreo de la distribución categórica se reparametriza simulando la ecuación diferencial estocástica.

Para construir este modelo de difusión, se puede definir un proceso de ruido (tiempo hacia adelante) correspondiente como [ 8 ] :

dincógnita(t)=registroπrmiF(incógnita(t))dt+2dW(t),pag(incógnita(0)=incógnitai)=wi,{\displaystyle dX(t)=\nabla \log \pi _{\mathrm {ref} }(X(t))dt+{\sqrt {2}}dW(t),\quad p(X(0)=x_{i})=w_{i},}

dóndeπrmiF{\displaystyle \pi _{\mathrm {ref} }}es una distribución de referencia. Esta formulación es útil cuando la distribución categórica es una aproximación de Monte Carlo de una distribución continua subyacente para la cualπrmiF{\displaystyle \pi _{\mathrm {ref} }}es una estimación precisa. Bajo esta construcción, la función de deriva de eliminación de ruido es

F(,t)=registroπrmiF()2registroh(,t),h(,t)=i=1nortewipagt|0(incógnitai),{\displaystyle {\begin{aligned}f(u,t)&=\nabla \log \pi _{\mathrm {ref} }(u)-2\,\nabla \log h(u,t),\\h(u,t)&=\sum _{i=1}^{n}w_{i}\,p_{t|0}(u\mid x_{i}),\end{aligned}}}

reflejando una h-transformación de Doob para una EDE condicionada a una mezcla de condiciones terminales. Aquípagt|0{\displaystyle p_{t|0}}denota la distribución de transición ruidosa ypagTnorte()=h(,T)πrmiF{\displaystyle p_{T}^{n}(\cdot )=h(\cdot ,T)\approx \pi _{\mathrm {ref} }}.

Véase también

Notas

  1. Sin embargo, Bishop no utiliza explícitamente el término distribución categórica.

Referencias

  1. Murphy, KP (2012). Aprendizaje automático: una perspectiva probabilística , pág. 35. MIT Press. ISBN 0262018020.
  2. 1 2 3 4 5 6 Minka, T. (2003) Inferencia bayesiana, entropía y distribución multinomial . Informe técnico de Microsoft Research.
  3. Minka, T. (2003), op. cit. Minka utiliza la función delta de Kronecker , similar pero menos general que el corchete de Iverson .
  4. 1 2 Bishop, C. (2006) Reconocimiento de patrones y aprendizaje automático , Springer. ISBN 0-387-31073-8.
  5. Johnson, NL, Kotz, S., Balakrishnan, N. (1997) Distribuciones multivariadas discretas , Wiley. ISBN 0-471-12844-9(pág.  105)
  6. Agresti, A., Introducción al análisis de datos categóricos, Wiley-Interscience, 2007, ISBN 978-0-471-22618-5, págs. 25
  7. Adams, Ryan. "El truco de Gumbel-Max para distribuciones discretas" .
  8. Andersson, Jennifer R.; Zhao, Zheng (2026). "Remuestreo diferenciable por difusión". Actas de la 43.ª Conferencia Internacional sobre Aprendizaje Automático (ICML) .