Articulo de referencia

Modelo de mezcla

En estadística , un modelo de mezcla es un modelo probabilístico para representar la presencia de subpoblaciones dentro de una población general, sin requerir que un conjunto de...

En estadística , un modelo de mezcla es un modelo probabilístico para representar la presencia de subpoblaciones dentro de una población general, sin requerir que un conjunto de datos observados identifique la subpoblación a la que pertenece una observación individual. Formalmente, un modelo de mezcla corresponde a la distribución de mezcla que representa la distribución de probabilidad de las observaciones en la población general. Sin embargo, mientras que los problemas asociados con las "distribuciones de mezcla" se relacionan con la derivación de las propiedades de la población general a partir de las de las subpoblaciones, los "modelos de mezcla" se utilizan para realizar inferencias estadísticas sobre las propiedades de las subpoblaciones a partir únicamente de observaciones de la población agrupada, sin información sobre la identidad de las subpoblaciones. Los modelos de mezcla se utilizan para la agrupación, bajo el nombre de agrupación basada en modelos , y también para la estimación de densidad .

Los modelos de mezcla no deben confundirse con los modelos para datos composicionales , es decir, datos cuyos componentes están restringidos a sumar un valor constante (1, 100 %, etc.). Sin embargo, los modelos composicionales pueden considerarse modelos de mezcla, donde los miembros de la población se muestrean aleatoriamente. A la inversa, los modelos de mezcla pueden considerarse modelos composicionales, donde la población total de lecturas de tamaño se ha normalizado a 1.

Estructura

modelo de mezcla general

Un modelo de mezcla típico de dimensión finita es un modelo jerárquico que consta de los siguientes componentes:

  • N variables latentes aleatorias que especifican la identidad del componente de mezcla de cada observación, cada una distribuida según una distribución categórica K -dimensional.
  • Un conjunto de K ponderaciones de mezcla, que son probabilidades que suman 1.
  • Un conjunto de K parámetros, cada uno de los cuales especifica el parámetro del componente de mezcla correspondiente. En muchos casos, cada "parámetro" es en realidad un conjunto de parámetros. Por ejemplo, si los componentes de la mezcla son distribuciones gaussianas , habrá una media y una varianza para cada componente. Si los componentes de la mezcla son distribuciones categóricas (por ejemplo, cuando cada observación es una ficha de un alfabeto finito de tamaño V ), habrá un vector de V probabilidades cuya suma es 1.

Además, en un contexto bayesiano , los pesos y parámetros de la mezcla serán variables aleatorias, y se les asignarán distribuciones a priori . En tal caso, los pesos se suelen considerar como un vector aleatorio K -dimensional extraído de una distribución de Dirichlet (la distribución a priori conjugada de la distribución categórica), y los parámetros se distribuirán según sus respectivas distribuciones a priori conjugadas.

Matemáticamente, un modelo básico de mezcla paramétrica se puede describir de la siguiente manera:

K=número de componentes de la mezclanorte=número de observacionesθi=1K=parámetro de distribución de la observación asociada con el componente iϕi=1K=peso de la mezcla, es decir, probabilidad previa de un componente en particular iϕ=Kvector de dimensión compuesto por todos los individuos ϕ1K; debe sumar 1zi=1norte=componente de observación iincógnitai=1norte=observación iF(incógnita|θ)=distribución de probabilidad de una observación, parametrizada en θzi=1norteCategórico(ϕ)incógnitai=1norte|zi=1norteF(θzi){\displaystyle {\begin{array}{lcl}K&=&{\text{number of mixture components}}\\N&=&{\text{number of observations}}\\\theta _{i=1\dots K}&=&{\text{parameter of distribution of observation associated with component }}i\\\phi _{i=1\dots K}&=&{\text{mixture weight, i.e., prior probability of a particular component }}i\\{\boldsymbol {\phi }}&=&K{\text{-dimensional vector composed of all the individual }}\phi _{1\dots K}{\text{; must sum to 1}}\\z_{i=1\dots N}&=&{\text{component of observation }}i\\x_{i=1\dots N}&=&{\text{observation }}i\\F(x|\theta )&=&{\text{probability distribution of an observation, parametrized on }}\theta \\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}|z_{i=1\dots N}&\sim &F(\theta _{z_{i}})\end{array}}}

En un entorno bayesiano, todos los parámetros están asociados con variables aleatorias, como sigue:

K,norte=como se indica arribaθi=1K,ϕi=1K,ϕ=como se indica arribazi=1norte,incógnitai=1norte,F(incógnita|θ)=como se indica arribaα=hiperparámetro compartido para parámetros de componentesβ=Hiperparámetro compartido para ponderaciones de mezclaH(θ|α)=distribución de probabilidad previa de los parámetros de los componentes, parametrizada en αθi=1KH(θ|α)ϕSymetrometromitrido-DiridohlmitK(β)zi=1norte|ϕCategórico(ϕ)incógnitai=1norte|zi=1norte,θi=1KF(θzi){\displaystyle {\begin{array}{lcl}K,N&=&{\text{as above}}\\\theta _{i=1\dots K},\phi _{i=1\dots K},{\boldsymbol {\phi }}&=&{\text{as above}}\\z_{i=1\dots N},x_{i=1\dots N},F(x|\theta )&=&{\text{as above}}\\\alpha &=&{\text{shared hyperparameter for component parameters}}\\\beta &=&{\text{shared hyperparameter for mixture weights}}\\H(\theta |\alpha )&=&{\text{prior probability distribution of component parameters, parametrized on }}\alpha \\\theta _{i=1\dots K}&\sim &H(\theta |\alpha )\\{\boldsymbol {\phi }}&\sim &\operatorname {Symmetric-Dirichlet} _{K}(\beta )\\z_{i=1\dots N}|{\boldsymbol {\phi }}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}|z_{i=1\dots N},\theta _{i=1\dots K}&\sim &F(\theta _{z_{i}})\end{array}}}

Esta caracterización utiliza F y H para describir distribuciones arbitrarias sobre observaciones y parámetros, respectivamente. Típicamente, H será la distribución a priori conjugada de F. Las dos opciones más comunes para F son la gaussiana , también conocida como " normal " (para observaciones de valor real), y la categórica (para observaciones discretas). Otras posibilidades comunes para la distribución de los componentes de la mezcla son:

  • Distribución binomial , para el número de "ocurrencias positivas" (por ejemplo, éxitos, votos afirmativos, etc.) dado un número fijo de ocurrencias totales.
  • Distribución multinomial , similar a la distribución binomial, pero para recuentos de ocurrencias múltiples (por ejemplo, sí/no/tal vez en una encuesta).
  • Distribución binomial negativa , para observaciones de tipo binomial pero donde la cantidad de interés es el número de fallos antes de que ocurra un número determinado de éxitos.
  • Distribución de Poisson , para el número de ocurrencias de un evento en un período de tiempo determinado, para un evento que se caracteriza por una tasa de ocurrencia fija.
  • Distribución exponencial , para el tiempo antes de que ocurra el siguiente evento, para un evento que se caracteriza por una tasa de ocurrencia fija.
  • Distribución log-normal , para números reales positivos que se supone que crecen exponencialmente, como los ingresos o los precios.
  • Distribución normal multivariada (también conocida como distribución gaussiana multivariada), para vectores de resultados correlacionados que tienen una distribución gaussiana individual.
  • Distribución t de Student multivariada , para vectores de resultados correlacionados de cola pesada [ 2 ]
  • Un vector de valores con distribución de Bernoulli , que corresponde, por ejemplo, a una imagen en blanco y negro, donde cada valor representa un píxel; véase el ejemplo de reconocimiento de escritura a mano a continuación.

Ejemplos específicos

modelo de mezcla gaussiana

Modelo de mezcla gaussiana no bayesiano usando notación de placa . Los cuadrados más pequeños indican parámetros fijos; los círculos más grandes indican variables aleatorias. Las figuras rellenas indican valores conocidos. La indicación [K] significa un vector de tamaño K.

Un modelo típico de mezcla gaussiana no bayesiana tiene este aspecto:

K,norte=como se indica arribaϕi=1K,ϕ=como se indica arribazi=1norte,incógnitai=1norte=como se indica arribaθi=1K={μi=1K,σi=1K2}μi=1K=media del componente iσi=1K2=varianza del componente izi=1norteCategórico(ϕ)incógnitai=1nortenorte(μzi,σzi2){\displaystyle {\begin{array}{lcl}K,N&=&{\text{as above}}\\\phi _{i=1\dots K},{\boldsymbol {\phi }}&=&{\text{as above}}\\z_{i=1\dots N},x_{i=1\dots N}&=&{\text{as above}}\\\theta _{i=1\dots K}&=&\{\mu _{i=1\dots K},\sigma _{i=1\dots K}^{2}\}\\\mu _{i=1\dots K}&=&{\text{mean of component }}i\\\sigma _{i=1\dots K}^{2}&=&{\text{variance of component }}i\\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\mathcal {N}}(\mu _{z_{i}},\sigma _{z_{i}}^{2})\end{array}}}
Modelo de mezcla gaussiana bayesiana con notación de placa . Los cuadrados más pequeños indican parámetros fijos; los círculos más grandes indican variables aleatorias. Las figuras rellenas indican valores conocidos. La indicación [K] significa un vector de tamaño K.

Una versión bayesiana de un modelo de mezcla gaussiana es la siguiente:

K,norte=como se indica arribaϕi=1K,ϕ=como se indica arribazi=1norte,incógnitai=1norte=como se indica arribaθi=1K={μi=1K,σi=1K2}μi=1K=media del componente iσi=1K2=varianza del componente iμ0,λ,ν,σ02=hiperparámetros compartidosμi=1Knorte(μ0,λσi2)σi=1K2Inortevmirsmi-GRAMOametrometroa(ν,σ02)ϕSymetrometromitrido-DiridohlmitK(β)zi=1norteCategórico(ϕ)incógnitai=1nortenorte(μzi,σzi2){\displaystyle {\begin{array}{lcl}K,N&=&{\text{as above}}\\\phi _{i=1\dots K},{\boldsymbol {\phi }}&=&{\text{as above}}\\z_{i=1\dots N},x_{i=1\dots N}&=&{\text{as above}}\\\theta _{i=1\dots K}&=&\{\mu _{i=1\dots K},\sigma _{i=1\dots K}^{2}\}\\\mu _{i=1\dots K}&=&{\text{mean of component }}i\\\sigma _{i=1\dots K}^{2}&=&{\text{variance of component }}i\\\mu _{0},\lambda ,\nu ,\sigma _{0}^{2}&=&{\text{shared hyperparameters}}\\\mu _{i=1\dots K}&\sim &{\mathcal {N}}(\mu _{0},\lambda \sigma _{i}^{2})\\\sigma _{i=1\dots K}^{2}&\sim &\operatorname {Inverse-Gamma} (\nu ,\sigma _{0}^{2})\\{\boldsymbol {\phi }}&\sim &\operatorname {Symmetric-Dirichlet} _{K}(\beta )\\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\mathcal {N}}(\mu _{z_{i}},\sigma _{z_{i}}^{2})\end{array}}}{\displaystyle }
Animación del proceso de agrupamiento para datos unidimensionales mediante un modelo de mezcla gaussiana bayesiana, donde las distribuciones normales se extraen de un proceso de Dirichlet . Los histogramas de los clústeres se muestran en diferentes colores. Durante el proceso de estimación de parámetros, se crean nuevos clústeres que crecen a partir de los datos. La leyenda muestra los colores de los clústeres y el número de puntos de datos asignados a cada uno.

Modelo de mezcla gaussiana multivariante

Un modelo de mezcla gaussiana bayesiana se extiende comúnmente para ajustar un vector de parámetros desconocidos (denotados en negrita) o distribuciones normales multivariadas. En una distribución multivariada (es decir, una que modela un vector)incógnita{\displaystyle {\boldsymbol {x}}}con N variables aleatorias) se puede modelar un vector de parámetros (como varias observaciones de una señal o parches dentro de una imagen) utilizando una distribución a priori de modelo de mezcla gaussiana sobre el vector de estimaciones dado por pag(θ)=i=1Kϕinorte(μi,Σi){\displaystyle p({\boldsymbol {\theta }})=\sum _{i=1}^{K}\phi _{i}{\mathcal {N}}({\boldsymbol {\mu }}_{i},{\boldsymbol {\Sigma }}_{i})} donde el i -ésimo componente del vector se caracteriza por distribuciones normales con pesosϕi{\displaystyle \phi _{i}}, medioμi{\displaystyle {\boldsymbol {\mu }}_{i}}y matrices de covarianzaΣi{\displaystyle {\boldsymbol {\Sigma }}_{i}}Para incorporar esta distribución a priori en una estimación bayesiana, la distribución a priori se multiplica por la distribución conocida.pag(incógnita|θ){\displaystyle p({\boldsymbol {x|\theta }})}de los datosincógnita{\displaystyle {\boldsymbol {x}}}condicionado a los parámetrosθ{\displaystyle {\boldsymbol {\theta }}}que debe estimarse. Con esta formulación, la distribución posteriorpag(θ|incógnita){\displaystyle p({\boldsymbol {\theta |x}})}También es un modelo de mezcla gaussiana de la forma pag(θ|incógnita)=i=1Kϕ~inorte(μ~i,Σ~i){\displaystyle p({\boldsymbol {\theta |x}})=\sum _{i=1}^{K}{\tilde {\phi }}_{i}{\mathcal {N}}({\boldsymbol {{\tilde {\mu }}_{i}}},{\boldsymbol {\tilde {\Sigma }}}_{i})} con nuevos parámetrosϕ~i,μ~i{\displaystyle {\tilde {\phi }}_{i},{\boldsymbol {\tilde {\mu }}}_{i}}yΣ~i{\displaystyle {\boldsymbol {\tilde {\Sigma }}}_{i}}que se actualizan utilizando el algoritmo EM . [ 3 ] Aunque las actualizaciones de parámetros basadas en EM están bien establecidas, proporcionar las estimaciones iniciales para estos parámetros es actualmente un área de investigación activa. Nótese que esta formulación produce una solución de forma cerrada para la distribución posterior completa. Estimaciones de la variable aleatoriaθ{\displaystyle {\boldsymbol {\theta }}}puede obtenerse mediante uno de varios estimadores, como la media o el máximo de la distribución posterior.

Estas distribuciones son útiles para asumir formas de parches en imágenes y clústeres, por ejemplo. En el caso de la representación de imágenes, cada gaussiana puede inclinarse, expandirse y deformarse según las matrices de covarianza.Σi{\displaystyle {\boldsymbol {\Sigma }}_{i}}Se ajusta una distribución gaussiana del conjunto a cada parche (generalmente de 8×8 píxeles) de la imagen. Cabe destacar que cualquier distribución de puntos alrededor de un clúster (véase k -medias ) puede modelarse con precisión mediante suficientes componentes gaussianas, pero apenas se necesitan más de K = 20 componentes para modelar con precisión una distribución de imagen o un clúster de datos determinado.

Modelo de mezcla categórica

Modelo de mezcla categórica no bayesiana con notación de placa . Los cuadrados más pequeños indican parámetros fijos; los círculos más grandes indican variables aleatorias. Las figuras rellenas indican valores conocidos. La indicación [K] significa un vector de tamaño K ; lo mismo ocurre con [V].

Un modelo de mezcla no bayesiano típico con observaciones categóricas tiene este aspecto:

  • K,norte:{\displaystyle K,N:}como se indica arriba
  • ϕi=1K,ϕ:{\displaystyle \phi _{i=1\dots K},{\boldsymbol {\phi }}:}como se indica arriba
  • zi=1norte,incógnitai=1norte:{\displaystyle z_{i=1\dots N},x_{i=1\dots N}:}como se indica arriba
  • V:{\displaystyle V:}dimensión de las observaciones categóricas, por ejemplo, tamaño del vocabulario de palabras
  • θi=1K,j=1V:{\displaystyle \theta _{i=1\dots K,j=1\dots V}:}probabilidad para el componentei{\displaystyle i}de observar el elementoj{\displaystyle j}
  • θi=1K:{\displaystyle {\boldsymbol {\theta }}_{i=1\dots K}:}vector de dimensiónV,{\displaystyle V,}compuesto deθi,1V;{\displaystyle \theta _{i,1\dots V};}debe sumar 1

Las variables aleatorias:

zi=1norteCategórico(ϕ)incógnitai=1norteCategórico(θzi){\displaystyle {\begin{array}{lcl}z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\text{Categorical}}({\boldsymbol {\theta }}_{z_{i}})\end{array}}}

Modelo de mezcla categórica bayesiana con notación de placa . Los cuadrados más pequeños indican parámetros fijos; los círculos más grandes indican variables aleatorias. Las figuras rellenas indican valores conocidos. La indicación [K] significa un vector de tamaño K ; lo mismo ocurre con [V].

Un modelo de mezcla bayesiano típico con observaciones categóricas tiene este aspecto:

  • K,norte:{\displaystyle K,N:}como se indica arriba
  • ϕi=1K,ϕ:{\displaystyle \phi _{i=1\dots K},{\boldsymbol {\phi }}:}como se indica arriba
  • zi=1norte,incógnitai=1norte:{\displaystyle z_{i=1\dots N},x_{i=1\dots N}:}como se indica arriba
  • V:{\displaystyle V:}dimensión de las observaciones categóricas, por ejemplo, tamaño del vocabulario de palabras
  • θi=1K,j=1V:{\displaystyle \theta _{i=1\dots K,j=1\dots V}:}probabilidad para el componentei{\displaystyle i}de observar el elementoj{\displaystyle j}
  • θi=1K:{\displaystyle {\boldsymbol {\theta }}_{i=1\dots K}:}vector de dimensiónV,{\displaystyle V,}compuesto deθi,1V;{\displaystyle \theta _{i,1\dots V};}debe sumar 1
  • α:{\displaystyle \alpha :} hiperparámetro de concentración compartida deθ{\displaystyle {\boldsymbol {\theta }}}para cada componente
  • β:{\displaystyle \beta :} hiperparámetro de concentración deϕ{\displaystyle {\boldsymbol {\phi }}}

Las variables aleatorias:

ϕSymetrometromitrido-DiridohlmitK(β)θi=1KDirichlet simétricoV(α)zi=1norteCategórico(ϕ)incógnitai=1norteCategórico(θzi){\displaystyle {\begin{array}{lcl}{\boldsymbol {\phi }}&\sim &\operatorname {Symmetric-Dirichlet} _{K}(\beta )\\{\boldsymbol {\theta }}_{i=1\dots K}&\sim &{\text{Symmetric-Dirichlet}}_{V}(\alpha )\\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\text{Categorical}}({\boldsymbol {\theta }}_{z_{i}})\end{array}}}

Ejemplos

Un modelo financiero

La distribución normal representada gráficamente con diferentes medias y varianzas.

Los rendimientos financieros suelen comportarse de forma diferente en situaciones normales y durante las crisis. Un modelo de mezcla [ 4 ] para los datos de rendimiento parece razonable. A veces se utiliza un modelo de difusión con saltos o una mezcla de dos distribuciones normales. Consulte Economía financiera §  Desafíos y críticas y Gestión del riesgo financiero §  Banca para obtener más información.

Precios de las viviendas

Supongamos que observamos los precios de N casas diferentes. Los distintos tipos de casas en diferentes barrios tendrán precios muy diferentes, pero el precio de un tipo de casa en un barrio específico (por ejemplo, una casa de tres habitaciones en un barrio de clase media-alta) tenderá a agruparse bastante cerca de la media. Un posible modelo para estos precios sería suponer que se describen con precisión mediante un modelo de mezcla con K componentes diferentes, cada uno distribuido como una distribución normal con media y varianza desconocidas, donde cada componente especifica una combinación particular de tipo de casa y barrio. Ajustar este modelo a los precios observados, por ejemplo, utilizando el algoritmo de maximización de la esperanza , tendería a agrupar los precios según el tipo de casa y el barrio, y revelaría la dispersión de precios en cada tipo y barrio. (Cabe señalar que para valores como precios o ingresos que se garantiza que son positivos y que tienden a crecer exponencialmente , una distribución log-normal podría ser un modelo mejor que una distribución normal).

Temas en un documento

Supongamos que un documento se compone de N palabras diferentes de un vocabulario total de tamaño V , donde cada palabra corresponde a uno de K temas posibles. La distribución de dichas palabras podría modelarse como una mezcla de K distribuciones categóricas V -dimensionales diferentes . Un modelo de este tipo se denomina comúnmente modelo de temas . Cabe señalar que la maximización de la esperanza aplicada a dicho modelo generalmente no produce resultados realistas, debido (entre otras cosas) al número excesivo de parámetros . Por lo general, se requieren ciertos supuestos adicionales para obtener buenos resultados. Normalmente, se añaden dos tipos de componentes adicionales al modelo:

  1. Se aplica una distribución previa a los parámetros que describen las distribuciones temáticas, utilizando una distribución de Dirichlet con un parámetro de concentración significativamente inferior a 1, para fomentar distribuciones dispersas (donde solo un pequeño número de palabras tienen probabilidades significativamente distintas de cero).
  2. Se impone algún tipo de restricción adicional sobre la identidad temática de las palabras, para aprovechar la agrupación natural.
    • Por ejemplo, se podría aplicar una cadena de Markov a las identidades de los temas (es decir, las variables latentes que especifican el componente de mezcla de cada observación), dado que las palabras cercanas pertenecen a temas similares. (Esto da como resultado un modelo oculto de Markov , específicamente uno en el que se aplica una distribución a priori a las transiciones de estado que favorece las transiciones que permanecen en el mismo estado).
    • Otra posibilidad es el modelo de asignación latente de Dirichlet , que divide las palabras en D documentos diferentes y supone que en cada documento solo aparece con cierta frecuencia un pequeño número de temas.

Reconocimiento de escritura a mano

El siguiente ejemplo se basa en un ejemplo de Christopher M. Bishop , Pattern Recognition and Machine Learning . [ 5 ]

Imaginemos que se nos da una imagen en blanco y negro de N × N que se sabe que es un escaneo de un dígito escrito a mano entre 0 y 9, pero no sabemos qué dígito está escrito. Podemos crear un modelo de mezcla conK=10{\displaystyle K=10}diferentes componentes, donde cada componente es un vector de tamañonorte2{\displaystyle N^{2}}de distribuciones de Bernoulli (una por píxel). Este modelo se puede entrenar con el algoritmo de maximización de la esperanza en un conjunto de dígitos escritos a mano sin etiquetar, y agrupará las imágenes según el dígito escrito. El mismo modelo podría utilizarse para reconocer el dígito de otra imagen simplemente manteniendo los parámetros constantes, calculando la probabilidad de la nueva imagen para cada dígito posible (un cálculo sencillo) y devolviendo el dígito que generó la mayor probabilidad.

Evaluación de la precisión del proyectil (también conocida como error circular probable, CEP)

Los modelos de mezcla se aplican al problema de dirigir múltiples proyectiles hacia un objetivo (como en aplicaciones de defensa aérea, terrestre o marítima), donde las características físicas y/o estadísticas de los proyectiles difieren entre sí. Un ejemplo podría ser disparos de múltiples tipos de munición o disparos desde múltiples ubicaciones dirigidos a un mismo objetivo. La combinación de tipos de proyectiles puede caracterizarse como un modelo de mezcla gaussiana. [ 6 ] Además, una medida de precisión bien conocida para un grupo de proyectiles es el error circular probable (ECP), que es el número R tal que, en promedio, la mitad del grupo de proyectiles cae dentro del círculo de radio R alrededor del punto objetivo. El modelo de mezcla puede utilizarse para determinar (o estimar) el valor de R. El modelo de mezcla captura adecuadamente los diferentes tipos de proyectiles.

Aplicaciones directas e indirectas

El ejemplo financiero anterior es una aplicación directa del modelo de mezcla, una situación en la que asumimos un mecanismo subyacente de modo que cada observación pertenece a una de varias fuentes o categorías diferentes. Sin embargo, este mecanismo subyacente puede ser observable o no. En esta forma de mezcla, cada una de las fuentes se describe mediante una función de densidad de probabilidad de componente, y su peso de mezcla es la probabilidad de que una observación provenga de dicho componente.

En una aplicación indirecta del modelo de mezcla, no asumimos tal mecanismo. El modelo de mezcla se utiliza simplemente por su flexibilidad matemática. Por ejemplo, una mezcla de dos distribuciones normales con medias diferentes puede dar como resultado una densidad con dos modas , lo cual no se modela con las distribuciones paramétricas estándar. Otro ejemplo lo proporciona la posibilidad de que las distribuciones de mezcla modelen colas más pesadas que las distribuciones gaussianas básicas, lo que las convierte en candidatas para modelar eventos más extremos.

Mantenimiento predictivo

El agrupamiento basado en modelos de mezcla también se utiliza predominantemente para identificar el estado de la máquina en el mantenimiento predictivo . Los gráficos de densidad se utilizan para analizar la densidad de características de alta dimensión. Si se observan densidades de múltiples modelos, se supone que un conjunto finito de densidades se forma mediante un conjunto finito de mezclas normales. Se utiliza un modelo de mezcla gaussiana multivariante para agrupar los datos de características en k grupos, donde k representa cada estado de la máquina. El estado de la máquina puede ser normal, apagado o con fallas. [ 7 ] Cada grupo formado se puede diagnosticar utilizando técnicas como el análisis espectral. En los últimos años, esto también se ha utilizado ampliamente en otras áreas, como la detección temprana de fallas. [ 8 ]

segmentación de imágenes difusas

Un ejemplo de mezcla gaussiana en la segmentación de imágenes con histograma de grises.

En el procesamiento de imágenes y la visión por computadora , los modelos tradicionales de segmentación de imágenes suelen asignar a cada píxel un único patrón exclusivo. En la segmentación difusa o suave, cualquier patrón puede tener cierta "propiedad" sobre cualquier píxel individual. Si los patrones son gaussianos, la segmentación difusa da como resultado mezclas gaussianas. Combinados con otras herramientas analíticas o geométricas (por ejemplo, transiciones de fase sobre límites difusos), estos modelos de mezcla espacialmente regularizados podrían conducir a métodos de segmentación más realistas y computacionalmente eficientes. [ 9 ]

Registro del conjunto de puntos

Los modelos de mezcla probabilísticos, como los modelos de mezcla gaussiana (GMM), se utilizan para resolver problemas de registro de conjuntos de puntos en los campos del procesamiento de imágenes y la visión por computadora. Para el registro de pares de conjuntos de puntos , un conjunto de puntos se considera como los centroides de los modelos de mezcla, y el otro conjunto de puntos se considera como puntos de datos (observaciones). Los métodos de vanguardia son, por ejemplo, la deriva coherente de puntos (CPD) [ 10 ] y los modelos de mezcla de distribución t de Student (TMM) [ 11 ] . Los resultados de investigaciones recientes demuestran la superioridad de los modelos de mezcla híbridos [ 12 ] (por ejemplo, la combinación de la distribución t de Student y la distribución de Watson/ distribución de Bingham para modelar posiciones espaciales y orientaciones de ejes por separado) en comparación con CPD y TMM, en términos de robustez inherente, precisión y capacidad discriminativa.

Agrupación en datos de ciencias sociales

Los modelos de mezcla se utilizan ampliamente en las ciencias sociales para agrupar datos observacionales e identificar estructuras grupales latentes en poblaciones complejas y heterogéneas. En estudios sobre conflictos armados [ 13 ] , se ha aplicado la agrupación no supervisada basada en modelos de mezcla a datos de eventos de conflicto para agrupar observaciones en tipos de conflicto derivados empíricamente, sin depender de categorías predefinidas. Estos análisis revelan diferencias sistemáticas entre los grupos en características geográficas, demográficas, económicas y de infraestructura, que corresponden a arquetipos de conflicto distintos asociados con diferentes perfiles de población y desarrollo. Este es uno de los numerosos ejemplos de cómo los modelos de mezcla pueden respaldar la clasificación basada en datos en la investigación en ciencias sociales.

Identificabilidad

La identificabilidad se refiere a la existencia de una caracterización única para cualquiera de los modelos de la clase (familia) que se esté considerando. Los procedimientos de estimación pueden no estar bien definidos y la teoría asintótica puede no ser válida si un modelo no es identificable.

Ejemplo

Sea J la clase de todas las distribuciones binomiales con n = 2. Entonces, una mezcla de dos miembros de J tendría

pag0=π(1θ1)2+(1π)(1θ2)2pag1=2πθ1(1θ1)+2(1π)θ2(1θ2){\displaystyle {\begin{aligned}p_{0}&=\pi {\left(1-\theta _{1}\right)}^{2}+\left(1-\pi \right){\left(1-\theta _{2}\right)}^{2}\\[1ex]p_{1}&=2\pi \theta _{1}\left(1-\theta _{1}\right)+2\left(1-\pi \right)\theta _{2}\left(1-\theta _{2}\right)\end{aligned}}}

y p 2 = 1 − p 0p 1 . Claramente, dados p 0 y p 1 , no es posible determinar el modelo de mezcla anterior de forma única, ya que hay tres parámetros ( π , θ 1 , θ 2 ) que deben determinarse.

Definición

Consideremos una mezcla de distribuciones paramétricas de la misma clase. Sea

J={F(;θ):θΩ}{\displaystyle J=\{f(\cdot ;\theta ):\theta \in \Omega \}}

Sea J la clase de todas las distribuciones componentes. Entonces, la envoltura convexa K de J define la clase de todas las mezclas finitas de distribuciones en J :

K={pag():pag()=i=1norteaiFi(;θi),ai>0,i=1norteai=1,Fi(;θi)J i,norte}{\displaystyle K=\left\{p(\cdot ):p(\cdot )=\sum _{i=1}^{n}a_{i}f_{i}(\cdot ;\theta _{i}),a_{i}>0,\sum _{i=1}^{n}a_{i}=1,f_{i}(\cdot  ;\theta _{i})\in J\ \forall i,n\right\}}

Se dice que K es identificable si todos sus miembros son únicos, es decir, dados dos miembros p y p en K , que son mezclas de distribuciones k ydistribuciones k ′ respectivamente en J , tenemos p = p si y solo si, en primer lugar, k = k y en segundo lugar podemos reordenar las sumas de tal manera que a i = a i y f i = f i para todo i .

Estimación de parámetros e identificación de sistemas

Los modelos de mezcla paramétricos se utilizan a menudo cuando conocemos la distribución Y y podemos muestrear de X , pero queremos determinar los valores a i y θ i . Estas situaciones pueden surgir en estudios donde se muestrea de una población compuesta por varias subpoblaciones distintas.

Es común considerar el modelado de mezclas de probabilidad como un problema de datos faltantes . Una forma de entenderlo es asumir que los puntos de datos en consideración pertenecen a una de las distribuciones que utilizamos para modelar los datos. Al principio, esta pertenencia es desconocida o falta. La tarea de la estimación consiste en diseñar parámetros apropiados para las funciones del modelo que elegimos, y la conexión con los puntos de datos se representa mediante su pertenencia a las distribuciones individuales del modelo.

Se han propuesto diversos enfoques para el problema de la descomposición de mezclas, muchos de los cuales se centran en métodos de máxima verosimilitud, como la maximización de la esperanza (EM) o la estimación de máxima probabilidad a posteriori (MAP). Generalmente, estos métodos consideran por separado las cuestiones de identificación del sistema y estimación de parámetros; se distinguen los métodos para determinar el número y la forma funcional de los componentes dentro de una mezcla de los métodos para estimar los valores de los parámetros correspondientes. Algunas diferencias notables son los métodos gráficos, como los descritos en Tarter y Lock [ 14 ] , y más recientemente las técnicas de longitud mínima de mensaje (MML), como las de Figueiredo y Jain [ 15 ] , y en cierta medida las rutinas de análisis de patrones de coincidencia de momentos sugeridas por McWilliam y Loh (2009). [ 16 ]

Maximización de la expectativa (ME)

La maximización de la esperanza (ME) es aparentemente la técnica más popular para determinar los parámetros de una mezcla con un número de componentes dado a priori . Esta es una forma particular de implementar la estimación de máxima verosimilitud para este problema. La ME resulta particularmente atractiva para mezclas normales finitas donde son posibles expresiones de forma cerrada, como en el siguiente algoritmo iterativo de Dempster et al. (1977) [ 17 ] .

ws(j+1)=1nortet=1nortehs(j)(t){\displaystyle w_{s}^{(j+1)}={\frac {1}{N}}\sum _{t=1}^{N}h_{s}^{(j)}(t)}
μs(j+1)=t=1nortehs(j)(t)incógnita(t)t=1nortehs(j)(t){\displaystyle \mu _{s}^{(j+1)}={\frac {\sum _{t=1}^{N}h_{s}^{(j)}(t)x^{(t)}}{\sum _{t=1}^{N}h_{s}^{(j)}(t)}}}
Σs(j+1)=t=1nortehs(j)(t)[incógnita(t)μs(j+1)][incógnita(t)μs(j+1)]t=1nortehs(j)(t){\displaystyle \Sigma _{s}^{(j+1)}={\frac {\sum _{t=1}^{N}h_{s}^{(j)}(t)[x^{(t)}-\mu _{s}^{(j+1)}][x^{(t)}-\mu _{s}^{(j+1)}]^{\top }}{\sum _{t=1}^{N}h_{s}^{(j)}(t)}}}

con las probabilidades posteriores

hs(j)(t)=ws(j)pags(incógnita(t);μs(j),Σs(j))i=1nortewi(j)pagi(incógnita(t);μi(j),Σi(j)).{\displaystyle h_{s}^{(j)}(t)={\frac {w_{s}^{(j)}p_{s}(x^{(t)};\mu _{s}^{(j)},\Sigma _{s}^{(j)})}{\sum _{i=1}^{n}w_{i}^{(j)}p_{i}(x^{(t)};\mu _{i}^{(j)},\Sigma _{i}^{(j)})}}.}

Así, basándose en la estimación actual de los parámetros, se determina la probabilidad condicional de que una observación dada x ( t ) se genere a partir del estado s para cada t = 1, …, N  ; donde N es el tamaño de la muestra. A continuación, se actualizan los parámetros de manera que los nuevos pesos de los componentes correspondan a la probabilidad condicional promedio, y la media y la covarianza de cada componente sean el promedio ponderado específico del componente de la media y la covarianza de toda la muestra.

Dempster [ 17 ] también demostró que cada iteración sucesiva de EM no disminuye la verosimilitud, una propiedad que no comparten otras técnicas de maximización basadas en gradientes. Además, EM incorpora de forma natural restricciones en el vector de probabilidad y, para tamaños de muestra suficientemente grandes, la positividad definida de la covarianza itera. Esta es una ventaja clave, ya que los métodos con restricciones explícitas implican costes computacionales adicionales para comprobar y mantener valores apropiados. Teóricamente, EM es un algoritmo de primer orden y, como tal, converge lentamente a una solución de punto fijo. Redner y Walker (1984) hacen hincapié en este punto, argumentando a favor de los métodos superlineales y de Newton y cuasi-Newton de segundo orden, e informando de una convergencia lenta en EM basándose en sus pruebas empíricas. Admiten que la convergencia en la verosimilitud fue rápida, aunque la convergencia en los valores de los parámetros no lo fue. Las ventajas relativas de EM y otros algoritmos con respecto a la convergencia se han discutido en otras publicaciones. [ 18 ]

Otras objeciones comunes al uso de EM son que tiene una propensión a identificar espuriamente máximos locales, así como mostrar sensibilidad a los valores iniciales. [ 19 ] [ 20 ] Se pueden abordar estos problemas evaluando EM en varios puntos iniciales en el espacio de parámetros, pero esto es computacionalmente costoso y otros enfoques, como el método EM de recocido de Udea y Nakano (1998) (en el que los componentes iniciales se fuerzan esencialmente a superponerse, proporcionando una base menos heterogénea para las estimaciones iniciales), pueden ser preferibles.

Figueiredo y Jain [ 15 ] señalan que la convergencia a valores de parámetros "sin sentido" obtenidos en el límite (donde se rompen las condiciones de regularidad, por ejemplo, Ghosh y Sen (1985)) se observa con frecuencia cuando el número de componentes del modelo excede el óptimo/verdadero. Sobre esta base, sugieren un enfoque unificado para la estimación e identificación en el que el n inicial se elige de manera que supere ampliamente el valor óptimo esperado. Su rutina de optimización se construye mediante un criterio de longitud mínima de mensaje (MML) que elimina eficazmente un componente candidato si no hay suficiente información para respaldarlo. De esta manera, es posible sistematizar las reducciones en n y considerar la estimación y la identificación conjuntamente.

El paso de expectativa

Con estimaciones iniciales para los parámetros de nuestro modelo de mezcla, la "pertenencia parcial" de cada punto de datos a cada distribución constituyente se calcula mediante el cálculo de los valores esperados para las variables de pertenencia de cada punto de datos. Es decir, para cada punto de datos x j y distribución Y i , el valor de pertenencia y i , j es:

yi,j=aiFY(incógnitaj;θi)Fincógnita(incógnitaj).{\displaystyle y_{i,j}={\frac {a_{i}f_{Y}(x_{j};\theta _{i})}{f_{X}(x_{j})}}.}

El paso de maximización

Conociendo los valores esperados para la pertenencia a grupos, se vuelven a calcular las estimaciones sustitutivas para los parámetros de distribución.

Los coeficientes de mezcla a i son las medias de los valores de pertenencia sobre los N puntos de datos.

ai=1nortej=1norteyi,j{\displaystyle a_{i}={\frac {1}{N}}\sum _{j=1}^{N}y_{i,j}}

Los parámetros del modelo de componentes θ i también se calculan mediante maximización de la esperanza utilizando puntos de datos x j que han sido ponderados utilizando los valores de pertenencia. Por ejemplo, si θ es una media μ

μi=jyi,jincógnitajjyi,j.{\displaystyle \mu _{i}={\frac {\sum _{j}y_{i,j}x_{j}}{\sum _{j}y_{i,j}}}.}

Con las nuevas estimaciones para a i y los θ i ' s, se repite el paso de expectativa para recalcular los nuevos valores de pertenencia. Todo el procedimiento se repite hasta que los parámetros del modelo convergen.

Cadena de Markov Monte Carlo

Como alternativa al algoritmo EM, los parámetros del modelo de mezcla pueden deducirse mediante muestreo posterior, según lo indica el teorema de Bayes . Esto sigue considerándose un problema de datos incompletos, donde la pertenencia a un grupo constituye el dato faltante. Se puede utilizar un procedimiento iterativo de dos pasos conocido como muestreo de Gibbs .

El ejemplo anterior de una mezcla de dos distribuciones gaussianas puede ilustrar el funcionamiento del método. Como antes, se realizan estimaciones iniciales de los parámetros del modelo de mezcla. En lugar de calcular la pertenencia parcial a cada distribución elemental, se extrae un valor de pertenencia para cada punto de datos de una distribución de Bernoulli (es decir, se asignará a la primera o a la segunda gaussiana). El parámetro de Bernoulli θ se determina para cada punto de datos en función de una de las distribuciones constituyentes. Las extracciones de la distribución generan asociaciones de pertenencia para cada punto de datos. A continuación, se pueden utilizar estimadores de sustitución, como en el paso M del EM, para generar un nuevo conjunto de parámetros del modelo de mezcla, y se repite el paso de extracción binomial.

Sincronización de momentos

El método de igualación de momentos es una de las técnicas más antiguas para determinar los parámetros de la mezcla, que se remonta al trabajo fundamental de Karl Pearson de 1894. En este enfoque, los parámetros de la mezcla se determinan de manera que la distribución compuesta tenga momentos que coincidan con un valor dado. En muchos casos, la extracción de soluciones a las ecuaciones de momentos puede presentar problemas algebraicos o computacionales no triviales. Además, el análisis numérico de Day [ 21 ] ha indicado que estos métodos pueden ser ineficientes en comparación con el método EM. No obstante, ha habido un renovado interés en este método, por ejemplo, Craigmile y Titterington (1998) y Wang [ 22 ] .

McWilliam y Loh (2009) analizan la caracterización de una cópula de mezcla normal hipercuboide en sistemas de gran dimensión para los que el método EM resultaría computacionalmente prohibitivo. En este trabajo, se utiliza una rutina de análisis de patrones para generar dependencias de cola multivariadas consistentes con un conjunto de momentos univariados y (en cierto sentido) bivariados. El rendimiento de este método se evalúa posteriormente utilizando datos de rentabilidad logarítmica de acciones, con estadísticos de prueba de Kolmogorov-Smirnov que sugieren un buen ajuste descriptivo.

Método espectral

Algunos problemas en la estimación de modelos de mezcla se pueden resolver utilizando métodos espectrales . En particular, resulta útil si los puntos de datos x i son puntos en un espacio real de alta dimensión y se sabe que las distribuciones ocultas son logarítmicamente cóncavas (como la distribución gaussiana o la distribución exponencial ).

Los métodos espectrales para el aprendizaje de modelos de mezcla se basan en la descomposición en valores singulares de una matriz que contiene datos. La idea consiste en considerar los k vectores singulares principales, donde k es el número de distribuciones que se van a aprender. La proyección de cada dato sobre un subespacio lineal generado por estos vectores agrupa los puntos que provienen de la misma distribución muy cerca unos de otros, mientras que los puntos de distribuciones diferentes permanecen alejados.

Una característica distintiva del método espectral es que nos permite demostrar que si las distribuciones satisfacen cierta condición de separación (por ejemplo, no están demasiado cerca), entonces la mezcla estimada estará muy cerca de la verdadera con alta probabilidad.

Métodos gráficos

Tarter y Lock [ 14 ] describen un método gráfico para la identificación de mezclas en el que se aplica una función kernel a un gráfico de frecuencia empírica para reducir la varianza intracomponente. De esta forma, se pueden identificar más fácilmente los componentes con medias diferentes. Si bien este método λ no requiere conocimiento previo del número o la forma funcional de los componentes, su éxito depende de la elección de los parámetros del kernel, que en cierta medida incorporan implícitamente supuestos sobre la estructura de los componentes.

Otros métodos

Algunos de ellos incluso pueden aprender mezclas de distribuciones de cola pesada, incluidas aquellas con varianza infinita (véanse los enlaces a los artículos a continuación). En este contexto, los métodos basados ​​en EM no funcionarían, ya que el paso de Expectativa divergiría debido a la presencia de valores atípicos .

Una simulación

Para simular una muestra de tamaño N que proviene de una mezcla de distribuciones F i , i =1 a n , con probabilidades p i (suma= p i = 1):   

  1. Genera N números aleatorios a partir de una distribución categórica de tamaño n y probabilidades p i para i =  1  a n . Estas te indican de cuál de las F i provendrá cada uno de los N valores. Denota por m i la cantidad de números aleatorios asignados a la i- ésima categoría. 
  2. Para cada i , genere m i números aleatorios de la distribución F i .

Extensiones

En un contexto bayesiano , se pueden agregar niveles adicionales al modelo gráfico que define el modelo de mezcla. Por ejemplo, en el modelo de asignación de temas de Dirichlet latente común , las observaciones son conjuntos de palabras extraídas de D documentos diferentes y los K componentes de la mezcla representan temas que se comparten entre los documentos. Cada documento tiene un conjunto diferente de ponderaciones de mezcla, que especifican los temas predominantes en ese documento. Todos los conjuntos de ponderaciones de mezcla comparten hiperparámetros comunes .

Una extensión muy común consiste en conectar las variables latentes que definen las identidades de los componentes de la mezcla en una cadena de Markov , en lugar de asumir que son variables aleatorias independientes e idénticamente distribuidas . El modelo resultante se denomina modelo oculto de Markov y es uno de los modelos jerárquicos secuenciales más comunes. Se han desarrollado numerosas extensiones de los modelos ocultos de Markov; consulte el artículo correspondiente para obtener más información.

Historia

Las distribuciones de mezclas y el problema de la descomposición de mezclas, es decir, la identificación de sus componentes constituyentes y sus parámetros, se han citado en la literatura desde 1846 (Quetelet en McLachlan, [ 19 ] 2000) aunque se suele hacer referencia al trabajo de Karl Pearson (1894) [ 23 ] como el primer autor en abordar explícitamente el problema de la descomposición en la caracterización de atributos no normales de las proporciones de longitud de frente a longitud corporal en poblaciones de cangrejos de orilla hembra. La motivación para este trabajo fue proporcionada por el zoólogo Walter Frank Raphael Weldon, quien había especulado en 1893 (en Tarter y Lock [ 14 ] ) que la asimetría en el histograma de estas proporciones podría señalar divergencia evolutiva. El enfoque de Pearson fue ajustar una mezcla univariada de dos normales a los datos eligiendo los cinco parámetros de la mezcla de manera que los momentos empíricos coincidieran con los del modelo.

Si bien su trabajo logró identificar dos subpoblaciones potencialmente distintas y demostrar la flexibilidad de las mezclas como herramienta de ajuste de momentos, la formulación requería la solución de un polinomio de noveno grado (nónico), lo que en aquel momento suponía un importante desafío computacional.

Los trabajos posteriores se centraron en abordar estos problemas, pero no fue hasta la llegada de la computadora moderna y la popularización de las técnicas de parametrización de máxima verosimilitud (MLE) que la investigación realmente despegó. [ 24 ] Desde entonces, ha habido un vasto cuerpo de investigación sobre el tema que abarca áreas como la investigación pesquera , la agricultura , la botánica , la economía , la medicina , la genética , la psicología , la paleontología , la electroforesis , las finanzas , la geología y la zoología . [ 25 ]

Véase también

Mezcla

Modelos jerárquicos

detección de valores atípicos

Referencias

  1. Pal, Samyajoy; Heumann, Christian (2024). "Modelos de mezcla multivariante flexibles: un enfoque integral para modelar mezclas de distribuciones no idénticas". International Statistical Review insr.12593. doi : 10.1111/insr.12593 .
  2. Chatzis, Sotirios P.; Kosmopoulos, Dimitrios I.; Varvarigou, Theodora A. (2008). "Modelado y clasificación de señales mediante un modelo de espacio latente robusto basado en distribuciones t". IEEE Transactions on Signal Processing . 56 (3): 949– 963. Bibcode : 2008ITSP...56..949C . doi : 10.1109/TSP.2007.907912 . S2CID 15583243 . 
  3. Yu, Guoshen (2012). "Resolución de problemas inversos con estimadores lineales por partes: de modelos de mezcla gaussiana a escasez estructurada". IEEE Transactions on Image Processing . 21 (5): 2481– 2499. arXiv : 1006.3056 . Bibcode : 2012ITIP...21.2481G . doi : 10.1109/tip.2011.2176743 . PMID 22180506. S2CID 479845 .  
  4. Dinov, ID. " Tutorial sobre maximización de expectativas y modelado de mezclas ". Biblioteca Digital de California , Recurso Computacional en Línea de Estadística, Documento EM_MM, http://repositories.cdlib.org/socr/EM_MM , 9 de diciembre de 2008.
  5. Bishop, Christopher (2006). Reconocimiento de patrones y aprendizaje automático . Nueva York: Springer. ISBN 978-0-387-31073-2.
  6. Spall, JC y Maryak, JL (1992). «Un estimador bayesiano factible de cuantiles para la precisión de proyectiles a partir de datos no i.i.d.». Journal of the American Statistical Association , vol. 87 (419), pp. 676–681. JSTOR 2290205 
  7. Amruthnath, Nagdev; Gupta, Tarun (2018-02-02). Predicción de la clase de falla en el aprendizaje no supervisado mediante un enfoque de agrupamiento basado en modelos . Inédito. doi : 10.13140/rg.2.2.22085.14563 .
  8. Amruthnath, Nagdev; Gupta, Tarun (2018-02-01). Un estudio de investigación sobre algoritmos de aprendizaje automático no supervisado para la detección de fallas en el mantenimiento predictivo . Inédito. doi : 10.13140/rg.2.2.28822.24648 .
  9. Shen, Jianhong (Jackie) (2006). "Un modelo estocástico-variacional para la segmentación suave de Mumford-Shah" . International Journal of Biomedical Imaging . 2006 092329: 2–16 . Bibcode : 2006IJBI.200649515H . doi : 10.1155/IJBI/2006/92329 . PMC 2324060. PMID 23165059 .  
  10. Myronenko, Andriy; Song, Xubo (2010). "Registro de conjuntos de puntos: deriva coherente de puntos". IEEE Trans. Pattern Anal. Mach. Intell . 32 (12): 2262– 2275. arXiv : 0905.2635 . Bibcode : 2010ITPAM..32.2262M . doi : 10.1109 / TPAMI.2010.46 . PMID 20975122. S2CID 10809031 .  
  11. Ravikumar, Nishant; Gooya, Ali; Cimen, Serkan; Frangi, Alexjandro; Taylor, Zeike (2018). "Registro de similitud grupal de conjuntos de puntos utilizando el modelo de mezcla t de Student para modelos estadísticos de forma" . Med. Image Anal . 44 : 156–176 . doi : 10.1016/j.media.2017.11.012 . PMID 29248842 . 
  12. Bayer, Siming; Ravikumar, Nishant; Strumia, Maddalena; Tong, Xiaoguang; Gao, Ying; Ostermeier, Martin; Fahrig, Rebecca; Maier, Andreas (2018). "Compensación del desplazamiento cerebral intraoperatorio mediante un modelo de mezcla híbrido" . Medical Image Computing and Computer Assisted Intervention – MICCAI 2018. Granada, España: Springer, Cham. pp. 116–124 . doi : 10.1007/978-3-030-00937-3_14 . 
  13. Kushwaha, Niraj; Oh, Woi Sok; Shah, Shlok; Lee, Edward D. (1 de diciembre de 2025). "La clasificación de conflictos basada en datos expone indicadores predictivos débiles" . Royal Society Open Science . 12 (12) 250897. doi : 10.1098/rsos.250897 . ISSN 2054-5703 . 
  14. 1 2 3 Tarter, Michael E. (1993), Estimación de curvas sin modelo , Chapman and Hall
  15. 1 2 Figueiredo, MAT; Jain, AK (marzo de 2002). "Aprendizaje no supervisado de modelos de mezcla finita". IEEE Transactions on Pattern Analysis and Machine Intelligence . 24 (3): 381– 396. Bibcode : 2002ITPAM..24..381F . CiteSeerX 10.1.1.362.9811 . doi : 10.1109/34.990138 . 
  16. McWilliam, N.; Loh, K. (2008), Incorporating Multidimensional Tail-Dependencies in the Valuation of Credit Derivatives (Working Paper)
  17. 1 2 Dempster, AP; Laird, NM; Rubin, DB (1977). "Máxima verosimilitud a partir de datos incompletos mediante el algoritmo EM". Journal of the Royal Statistical Society, Serie B. 39 ( 1): 1– 38. CiteSeerX 10.1.1.163.7580 . doi : 10.1111/j.2517-6161.1977.tb01600.x . JSTOR 2984875 .  
  18. Xu, L.; Jordan, MI (enero de 1996). "Sobre las propiedades de convergencia del algoritmo EM para mezclas gaussianas". Neural Computation . 8 (1): 129– 151. doi : 10.1162/neco.1996.8.1.129 . hdl : 10338.dmlcz/135225 . S2CID 207714252 . 
  19. 1 2 McLachlan, GJ (2000), Modelos de mezcla finita , Wiley
  20. Botev, ZI; Kroese, DP (2004). "Optimización de la verosimilitud global mediante el método de entropía cruzada, con una aplicación a modelos de mezcla". Actas de la Conferencia de Simulación de Invierno de 2004, 2004. Vol. 1. pp. 517–523 . CiteSeerX 10.1.1.331.2319 . doi : 10.1109/WSC.2004.1371358 . ISBN    978-0-7803-8786-7. S2CID 6880171 . 
  21. Day, NE (1969). "Estimación de los componentes de una mezcla de distribuciones normales". Biometrika . 56 (3): 463– 474. doi : 10.2307/2334652 . JSTOR 2334652 . 
  22. Wang, J. ( 2001), "Generación de cambios diarios en variables de mercado mediante una mezcla multivariada de distribuciones normales", Actas de la 33.ª Conferencia de Invierno sobre Simulación : 283–289
  23. Améndola, Carlos; et al. (2015). "Variedades de momentos de mezclas gaussianas". Journal of Algebraic Statistics . 7 . arXiv : 1510.04654 . Bibcode : 2015arXiv151004654A . doi : 10.18409/jas.v7i1.42 . S2CID 88515304 .  
  24. McLachlan, GJ; Basford, KE (1988), "Modelos de mezcla: inferencia y aplicaciones al agrupamiento", Estadística: Libros de texto y monografías , Bibcode : 1988mmia.book.....M
  25. ^ Titterington, Smith y Makov 1985

Lecturas adicionales

Libros sobre modelos de mezcla

  • Everitt, BS; Hand, DJ (1981). Distribuciones de mezcla finita . Chapman & Hall. ISBN 978-0-412-22420-1.
  • Lindsay, BG (1995). Modelos de mezcla: teoría, geometría y aplicaciones . Serie de conferencias regionales NSF-CBMS sobre probabilidad y estadística. Vol.  5. Hayward: Instituto de Estadística Matemática.
  • Marin, JM; Mengersen, K .; Robert, CP (2011). «Modelado bayesiano e inferencia sobre mezclas de distribuciones» (PDF) . En Dey, D.; Rao, CR (eds.). Modelos bayesianos esenciales . Manual de estadística: pensamiento bayesiano: modelado y computación. Vol.  25. Elsevier. ISBN 9780444537324.
  • McLachlan, GJ; Peel, D. (2000). Modelos de mezcla finita . Wiley. ISBN 978-0-471-00626-8.
  • Press, WH ; Teukolsky, SA ; Vetterling, WT; Flannery, BP (2007). «Sección 16.1. Modelos de mezcla gaussiana y agrupamiento k-medias» . Numerical Recipes : The Art of Scientific Computing (3.ª  ed.). Nueva York: Cambridge University Press. ISBN 978-0-521-88068-8.
  • Titterington, M.; Smith, A.; Makov, U. (1985). Análisis estadístico de distribuciones de mezclas finitas . Wiley. ISBN 978-0-471-90763-3.
  • Yao, W.; Xiang, S. (2024). Modelos de mezcla: paramétricos, semiparamétricos y nuevas direcciones . Chapman & Hall/CRC Press. ISBN 978-0367481827.

Aplicación de modelos de mezcla gaussiana

  1. Reynolds, DA; Rose, RC (enero de 1995). "Identificación robusta de locutores independiente del texto mediante modelos de locutores de mezcla gaussiana". IEEE Transactions on Speech and Audio Processing . 3 (1): 72– 83. Bibcode : 1995ITSAP...3...72R . doi : 10.1109/89.365379 . S2CID 7319345 . 
  2. Permuter, H.; Francos, J.; Jermyn, IH (2003). Modelos de mezcla gaussiana de textura y color para la recuperación de bases de datos de imágenes . Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales , 2003. Actas (ICASSP '03). doi : 10.1109/ICASSP.2003.1199538 .
    • Permuter, Haim; Francos, Joseph; Jermyn, Ian (2006). "Un estudio de modelos de mezcla gaussiana de características de color y textura para la clasificación y segmentación de imágenes" (PDF) . Pattern Recognition . 39 (4): 695– 706. Bibcode : 2006PatRe..39..695P . doi : 10.1016/j.patcog.2005.10.028 . S2CID 8530776 . 
  3. Lemke, Wolfgang (2005). Modelado y estimación de la estructura temporal en un marco de espacio de estados . Springer Verlag. ISBN 978-3-540-28342-3.
  4. Brigo, Damiano ; Mercurio, Fabio (2001). Difusiones desplazadas y de mezcla para modelos de sonrisa analíticamente tratables . Finanzas Matemáticas – Congreso Bachelier 2000. Actas. Springer Verlag.
  5. Brigo, Damiano; Mercurio, Fabio (junio de 2002). "Dinámica de mezcla lognormal y calibración a las sonrisas de volatilidad del mercado". International Journal of Theoretical and Applied Finance . 5 (4): 427. CiteSeerX 10.1.1.210.4165 . doi : 10.1142/S0219024902001511 . 
  6. Spall, JC; Maryak, JL (1992). "Un estimador bayesiano factible de cuantiles para la precisión de proyectiles a partir de datos no i.i.d." Journal of the American Statistical Association . 87 (419): 676– 681. doi : 10.1080/01621459.1992.10475269 . JSTOR 2290205 . 
  7. Alexander, Carol (diciembre de 2004). "Difusión de mezcla normal con volatilidad incierta: modelado de efectos de sonrisa a corto y largo plazo" (PDF) . Journal of Banking & Finance . 28 (12): 2957–80 . doi : 10.1016/j.jbankfin.2003.10.017 .
  8. Stylianou, Yannis; Pantazis, Yannis; Calderero, Felipe; Larroy, Pedro; Severin, Francois; Schimke, Sascha; Bonal, Rolando; Matta, Federico; Valsamakis, Atanasio (2005). Verificación biométrica multimodal basada en GMM (PDF) .
  9. Chen, J.; Adebomi, O.E.; Olusayo, O.S.; Kulesza, W. (2010). Evaluación del enfoque de densidad de hipótesis de probabilidad de mezcla gaussiana para el seguimiento de múltiples objetivos . Conferencia Internacional IEEE sobre Sistemas y Técnicas de Imagen , 2010. doi : 10.1109/IST.2010.5548541 .{{cite conference}}: CS1 maint: nombres numéricos: lista de autores ( enlace )
  • Nielsen, Frank (23 de marzo de 2012). «K-MLE: Un algoritmo rápido para el aprendizaje de modelos de mezcla estadística». 2012 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) . pp. 869–872 . arXiv : 1203.5181 . Bibcode : 2012arXiv1203.5181N . doi : 10.1109/ICASSP.2012.6288022 . ISBN  978-1-4673-0046-9. S2CID 935615 . 
  • Las demostraciones de SOCR sobre EM y modelado de mezclas
  • Página sobre modelado de mezclas (y el programa Snob para la longitud mínima del mensaje ( MML ) aplicada a modelos de mezcla finita), mantenida por DL ​​Dowe.
  • PyMix : paquete de Python para la creación de mezclas, algoritmos y estructuras de datos para una amplia variedad de aplicaciones de minería de datos basadas en modelos de mezcla en Python.
  • sklearn.mixture : un módulo de la biblioteca de Python scikit-learn para aprender modelos de mezcla gaussiana (y muestrear a partir de ellos), anteriormente empaquetado con SciPy y ahora empaquetado como un SciKit
  • Código Matlab GMM.m para la implementación de GMM
  • Implementación en C++ de modelos de mezcla bayesianos mediante EM y MCMC con aceleración de velocidad 100 veces mayor utilizando GPGPU.
  • Código Matlab para la implementación de GMM utilizando el algoritmo EM.
  • jMEF: Una biblioteca Java de código abierto para el aprendizaje y procesamiento de mezclas de familias exponenciales (utilizando la dualidad con divergencias de Bregman). Incluye una interfaz para Matlab.
  • Implementación en C muy rápida y limpia del algoritmo de Expectation Maximization (EM) para la estimación de modelos de mezcla gaussiana (GMM).
  • mclust es un paquete de R para el modelado de mezclas.
  • dpgmm Implementación en Python puro del modelo de mezcla gaussiana de proceso de Dirichlet (variacional).
  • Entrada de blog sobre modelos de mezcla gaussiana: Modelos de mezcla gaussiana entrenados mediante el algoritmo de maximización de la expectativa, con una implementación en Python.