Articulo de referencia

modelo oculto de Markov

En teoría de la probabilidad , un modelo oculto de Markov ( HMM ) es un modelo de Markov en el que las observaciones dependen de un proceso de Markov latente (u oculto ) (conoci...

Este es un buen artículo. Haz clic aquí para obtener más información.

En teoría de la probabilidad , un modelo oculto de Markov ( HMM ) es un modelo de Markov en el que las observaciones dependen de un proceso de Markov latente (u oculto ) (conocido comoincógnita{\displaystyle X}). Un HMM requiere que exista un proceso observableY{\displaystyle Y}cuyos resultados dependen de los resultados deincógnita{\displaystyle X}de una manera conocida. Desdeincógnita{\displaystyle X}no se puede observar directamente, el objetivo es aprender sobre el estado deincógnita{\displaystyle X}observandoY{\displaystyle Y}. Por definición de ser un modelo de Markov, un HMM tiene un requisito adicional de que el resultado deY{\displaystyle Y}en ese momentot=t0{\displaystyle t=t_{0}}debe estar "influenciado" exclusivamente por el resultado deincógnita{\displaystyle X}ent=t0{\displaystyle t=t_{0}}y que los resultados deincógnita{\displaystyle X}yY{\displaystyle Y}ent<t0{\displaystyle t<t_{0}}debe ser condicionalmente independiente deY{\displaystyle Y}ent=t0{\displaystyle t=t_{0}}dadoincógnita{\displaystyle X}en ese momentot=t0{\displaystyle t=t_{0}}La estimación de los parámetros en un HMM se puede realizar mediante la estimación de máxima verosimilitud . Para los HMM de cadena lineal, se puede utilizar el algoritmo de Baum-Welch para estimar los parámetros.

Los modelos ocultos de Markov son conocidos por sus aplicaciones en termodinámica , mecánica estadística , física , química , economía , finanzas , procesamiento de señales , teoría de la información , reconocimiento de patrones —como el reconocimiento de voz , [ 1 ] reconocimiento de escritura a mano , reconocimiento de gestos , [ 2 ] etiquetado de partes del habla , seguimiento de partituras musicales, [ 3 ] descargas parciales [ 4 ] y bioinformática . [ 5 ] [ 6 ]

Definición

Dejarincógnitanorte{\displaystyle X_{n}}yYnorte{\displaystyle Y_{n}}sean procesos estocásticos de tiempo discreto ynorte1{\displaystyle n\geq 1}La pareja(incógnitanorte,Ynorte){\displaystyle (X_{n},Y_{n})}es un modelo oculto de Markov si

  • incógnitanorte{\displaystyle X_{n}}es un proceso de Markov cuyo comportamiento no es directamente observable ("oculto");
  • PAG(YnorteA | incógnita1=incógnita1,,incógnitanorte=incógnitanorte)=PAG(YnorteA | incógnitanorte=incógnitanorte){\displaystyle \operatorname {\mathbf {P} } {\bigl (}Y_{n}\in A\ {\bigl |}\ X_{1}=x_{1},\ldots ,X_{n}=x_{n}{\bigr )}=\operatorname {\mathbf {P} } {\bigl (}Y_{n}\in A\ {\bigl |}\ X_ {n} = x_ {n} {\ bigr )}},
por cadanorte1{\displaystyle n\geq 1},incógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}y cada conjunto de BorelA{\displaystyle A}.

Dejarincógnitat{\displaystyle X_{t}}yYt{\displaystyle Y_{t}}ser procesos estocásticos de tiempo continuo. El par(incógnitat,Yt){\displaystyle (X_{t},Y_{t})}es un modelo oculto de Markov si

  • incógnitat{\displaystyle X_{t}}es un proceso de Markov cuyo comportamiento no es directamente observable ("oculto");
  • PAG(Yt0A{incógnitatBt}tt0)=PAG(Yt0Aincógnitat0Bt0){\displaystyle \operatorname {\mathbf {P} } (Y_{t_{0}}\in A\mid \{X_{t}\in B_{t}\}_{t\leq t_{0}})=\operatorname {\mathbf {P} } (Y_{t_{0}}\in A\mid X_{t_{0}}\in B_{t_{0}})},
por cadat0{\displaystyle t_{0}}, cada conjunto de BorelA{\displaystyle A}y cada familia de conjuntos Borel{Bt}tt0{\displaystyle \{B_{t}\}_{t\leq t_{0}}}.

Terminología

Los estados del procesoincógnitanorte{\displaystyle X_{n}}(resp.incógnitat){\displaystyle X_{t})}se denominan estados ocultos yPAG(YnorteAincógnitanorte=incógnitanorte){\displaystyle \operatorname {\mathbf {P} } {\bigl (}Y_{n}\in A\mid X_{n}=x_{n}{\bigr )}}(resp.PAG(YtAincógnitatBt)){\displaystyle \operatorname {\mathbf {P} } {\bigl (}Y_{t}\in A\mid X_{t}\in B_{t}{\bigr )})}se denomina probabilidad de emisión o probabilidad de salida .

Ejemplos

Extraer bolas de urnas ocultas

Figura 1. Parámetros probabilísticos de un modelo oculto de Markov (ejemplo) X — estados y — posibles observaciones a — probabilidades de transición de estado b — probabilidades de salida

En su forma discreta, un proceso oculto de Markov puede visualizarse como una generalización del problema de la urna con reemplazo (donde cada elemento de la urna se devuelve a la urna original antes del siguiente paso). [ 7 ]

Consideremos este ejemplo

En una habitación oculta a la vista del observador, se encuentra un genio. La habitación contiene urnas X1, X2, X3, ..., cada una con una mezcla conocida de bolas, identificadas individualmente como y1, y2, y3, ... El genio elige una urna y extrae una bola al azar. Luego, coloca la bola en una cinta transportadora, donde el observador puede ver la secuencia de las bolas, pero no la secuencia de las urnas de las que fueron extraídas.

El genio tiene un procedimiento para elegir las urnas:

  • La elección de la urna para la n -ésima bola depende únicamente de un número aleatorio y de la elección de la urna para la ( n -1)-ésima bola.
  • La elección de la urna no depende directamente de las urnas elegidas con anterioridad.

Por lo tanto, esto se denomina un proceso de Markov . Se puede describir mediante la parte superior de la Figura 1.

proceso de Markov

El proceso de Markov no se puede observar directamente, solo la secuencia de bolas etiquetadas; por lo tanto, esta disposición se denomina proceso oculto de Markov . Esto se ilustra en la parte inferior del diagrama de la Figura 1, donde se puede ver que las bolas y1, y2, y3 e y4 se pueden extraer en cada estado. Incluso si el observador conoce la composición de las urnas y acaba de observar una secuencia de tres bolas, por ejemplo , y1, y2 e y3 en la cinta transportadora, aún no puede estar seguro de qué urna ( es decir , en qué estado) el genio ha extraído la tercera bola. Sin embargo, el observador puede deducir otra información, como la probabilidad de que la tercera bola provenga de cada una de las urnas.

Juego de adivinar el tiempo

Imaginemos a dos amigos, Alice y Bob, que viven lejos el uno del otro y hablan a diario por teléfono sobre lo que hicieron ese día. Bob solo está interesado en tres actividades: pasear por el parque, ir de compras y limpiar su apartamento. La elección de qué hacer depende exclusivamente del tiempo que haga ese día. Alice no tiene información precisa sobre el tiempo, pero conoce las tendencias generales. Basándose en lo que Bob le cuenta que hizo cada día, Alice intenta adivinar cómo habrá estado el tiempo.

Alice cree que el clima funciona como una cadena de Markov discreta . Hay dos estados, "lluvioso" y "soleado", pero no puede observarlos directamente, es decir, están ocultos para ella. Cada día, existe una cierta probabilidad de que Bob realice una de las siguientes actividades, dependiendo del clima: "caminar", "ir de compras" o "limpiar". Dado que Bob le informa a Alice sobre sus actividades, estas constituyen las observaciones . Todo el sistema es un modelo oculto de Markov (HMM).

Alice conoce las tendencias climáticas generales de la zona y lo que Bob suele hacer. En otras palabras, se conocen los parámetros del HMM. Se pueden representar de la siguiente manera en Python :

estados = ( "Lluvioso" , "Soleado" )observaciones = ( "caminar" , "comprar" , "limpiar" )probabilidad_inicial = { "Lluvioso" : 0.6 , "Soleado" : 0.4 }probabilidad_de_transición = { "Lluvioso" : { "Lluvioso" : 0.7 , "Soleado" : 0.3 }, "Soleado" : { "Lluvioso" : 0.4 , "Soleado" : 0.6 }, }probabilidad_de_emisión = { "Lluvioso" : { "caminar" : 0.1 , "comprar" : 0.4 , "limpiar" : 0.5 }, "Soleado" : { "caminar" : 0.6 , "comprar" : 0.3 , "limpiar" : 0.1 }, }

En este fragmento de código, start_probabilityrepresenta la creencia de Alice acerca del estado en el que se encuentra el HMM cuando Bob la llama por primera vez (todo lo que sabe es que tiende a llover en promedio). La distribución de probabilidad particular utilizada aquí no es la de equilibrio, que es (dadas las probabilidades de transición) aproximadamente {'Rainy': 0.57, 'Sunny': 0.43}. El transition_probabilityrepresenta el cambio del clima en la cadena de Markov subyacente. En este ejemplo, hay solo un 30% de probabilidad de que mañana haga sol si hoy llueve. El emission_probabilityrepresenta la probabilidad de que Bob realice una determinada actividad cada día. Si llueve, hay un 50% de probabilidad de que esté limpiando su apartamento; si hace sol, hay un 60% de probabilidad de que esté afuera dando un paseo.

Representación gráfica del HMM dado
Representación gráfica del HMM dado

Un ejemplo similar se explica con más detalle en la página del algoritmo de Viterbi .

Arquitectura estructural

El diagrama a continuación muestra la arquitectura general de un HMM instanciado. Cada óvalo representa una variable aleatoria que puede adoptar cualquiera de varios valores. La variable aleatoria x ( t ) es el estado oculto en el instante t (con el modelo del diagrama anterior, x ( t ) ∈ { x₁ , x₂ , x₃ } ) . La variable aleatoria y ( t ) es la observación en el instante t (con y ( t ) ∈ { y₁ , y₂ , y₃ , y₄ } ) . Las flechas en el diagrama (a menudo llamado diagrama de enrejado ) denotan dependencias condicionales.

Del diagrama se desprende que la distribución de probabilidad condicional de la variable oculta x ( t ) en el instante t , dados los valores de la variable oculta x en todos los instantes, depende únicamente del valor de la variable oculta x ( t -1) ; los valores en el instante t -2 y anteriores no tienen ninguna influencia. Esto se conoce como la propiedad de Markov . De forma similar, el valor de la variable observada y ( t ) depende únicamente del valor de la variable oculta x ( t ) (ambos en el instante t ).

En el tipo estándar de modelo oculto de Markov considerado aquí, el espacio de estados de las variables ocultas es discreto, mientras que las observaciones mismas pueden ser discretas (generalmente generadas a partir de una distribución categórica ) o continuas (generalmente a partir de una distribución gaussiana ). Los parámetros de un modelo oculto de Markov son de dos tipos: probabilidades de transición y probabilidades de emisión (también conocidas como probabilidades de salida ). Las probabilidades de transición controlan la forma en que se elige el estado oculto en el tiempo t dado el estado oculto en el tiempo t − 1 .

Se supone que el espacio de estados ocultos consta de uno de N valores posibles, modelado como una distribución categórica. (Véase la sección siguiente sobre extensiones para otras posibilidades). Esto significa que para cada uno de los N estados posibles en los que puede estar una variable oculta en el tiempo t , existe una probabilidad de transición de este estado a cada uno de los N estados posibles de la variable oculta en el tiempo t + 1 , para un total denorte2{\displaystyle N^{2}}Probabilidades de transición. El conjunto de probabilidades de transición para transiciones desde cualquier estado dado debe sumar 1. Por lo tanto, la matriz N × N de probabilidades de transición es una matriz de Markov . Dado que cualquier probabilidad de transición puede determinarse una vez que se conocen las demás, hay un total de N ( N − 1) parámetros de transición.

Además, para cada uno de los N estados posibles, existe un conjunto de probabilidades de emisión que rigen la distribución de la variable observada en un momento determinado, dado el estado de la variable oculta en ese momento. El tamaño de este conjunto depende de la naturaleza de la variable observada. Por ejemplo, si la variable observada es discreta con M valores posibles, regida por una distribución categórica , habrá M − 1 parámetros separados, para un total de N ( M − 1) parámetros de emisión en todos los estados ocultos. Por otro lado, si la variable observada es un vector M -dimensional distribuido según una distribución gaussiana multivariada arbitraria , habrá M parámetros que controlan las medias yMETRO(METRO+1)/2{\displaystyle {M(M+1)}/2}parámetros que controlan la matriz de covarianza , para un total denorte(METRO+METRO(METRO+1)/2)=norteMETRO(METRO+3)/2=O(norteMETRO2){\displaystyle N\left(M+{M(M+1)}/{2}\right)={NM(M+3)}/2=O(NM^{2})}parámetros de emisión. (En tal caso, a menos que el valor de M sea pequeño, puede ser más práctico restringir la naturaleza de las covarianzas entre los elementos individuales del vector de observación, por ejemplo, asumiendo que los elementos son independientes entre sí o, de forma menos restrictiva, que son independientes de todos excepto de un número fijo de elementos adyacentes).

Evolución temporal de un modelo oculto de Markov
Evolución temporal de un modelo oculto de Markov

Inferencia

Las probabilidades de transición de estado y de salida de un HMM se indican mediante la opacidad de la línea en la parte superior del diagrama. Dado que la secuencia de salida se observa en la parte inferior del diagrama, el interés reside en la secuencia de estados más probable que podría haberla producido. Basándonos en las flechas presentes en el diagrama, las siguientes secuencias de estados son candidatas: 5 3 2 5 3 2 4 3 2 5 3 2 3 1 2 5 3 2 La secuencia más probable se puede encontrar evaluando la probabilidad conjunta tanto de la secuencia de estados como de las observaciones para cada caso (simplemente multiplicando los valores de probabilidad, que aquí corresponden a las opacidades de las flechas involucradas). En general, este tipo de problema (es decir, encontrar la explicación más probable para una secuencia de observación) se puede resolver eficientemente utilizando el algoritmo de Viterbi .

Los modelos ocultos de Markov presentan varios problemas de inferencia , como se detalla a continuación.

Probabilidad de una secuencia observada

La tarea consiste en calcular de la mejor manera posible, dados los parámetros del modelo, la probabilidad de una secuencia de salida particular. Esto requiere la suma sobre todas las secuencias de estados posibles:

La probabilidad de observar una secuencia

Y=y(0),y(1),,y(L1),{\displaystyle Y=y(0),y(1),\dots,y(L-1),}

de longitud L viene dada por

PAG(Y)=incógnitaPAG(Yincógnita)PAG(incógnita),{\displaystyle P(Y)=\sum _{X}P(Y\mid X)P(X),}

donde la suma recorre todas las posibles secuencias de nodos ocultos

incógnita=incógnita(0),incógnita(1),,incógnita(L1).{\displaystyle X=x(0),x(1),\dots ,x(L-1).}

Aplicando el principio de programación dinámica , este problema también puede manejarse de manera eficiente utilizando el algoritmo hacia adelante .

Probabilidad de las variables latentes

Varias tareas relacionadas preguntan sobre la probabilidad de una o más de las variables latentes, dados los parámetros del modelo y una secuencia de observaciones.y(1),,y(t){\displaystyle y(1),\puntos,y(t)}.

Filtración

La tarea consiste en calcular, dados los parámetros del modelo y una secuencia de observaciones, la distribución sobre los estados ocultos de la última variable latente al final de la secuencia, es decir, calcularPAG(incógnita(t)y(1),,y(t)){\displaystyle P(x(t)\mid y(1),\dots ,y(t))}Esta tarea se utiliza cuando se considera que la secuencia de variables latentes representa los estados subyacentes por los que transita un proceso en una sucesión de momentos, con observaciones correspondientes en cada momento. En ese caso, resulta natural preguntarse por el estado del proceso al final.

Este problema se puede manejar de manera eficiente utilizando el algoritmo hacia adelante . Un ejemplo es cuando el algoritmo se aplica a una red oculta de Markov para determinarPAG(htv1:t){\displaystyle \mathrm {P} {\big (}h_{t}\mid v_{1:t}{\big )}}.

Suavizado

Esto es similar al filtrado, pero pregunta sobre la distribución de una variable latente en algún punto intermedio de una secuencia, es decir, calcularPAG(incógnita(k)y(1),,y(t)){\displaystyle P(x(k)\mid y(1),\dots ,y(t))}para algunosk<t{\displaystyle k<t}Desde la perspectiva descrita anteriormente, esto puede pensarse como la distribución de probabilidad sobre estados ocultos para un punto en el tiempo k en el pasado, en relación con el tiempo t .

El algoritmo de avance-retroceso es un buen método para calcular los valores suavizados de todas las variables de estado ocultas.

Explicación más probable

Esta tarea, a diferencia de las dos anteriores, pregunta sobre la probabilidad conjunta de toda la secuencia de estados ocultos que generó una secuencia particular de observaciones (véase la ilustración de la derecha). Esta tarea es aplicable en general cuando los HMM se aplican a distintos tipos de problemas que no son aplicables a las tareas de filtrado y suavizado. Un ejemplo es el etiquetado de partes de la oración , donde los estados ocultos representan las partes de la oración subyacentes correspondientes a una secuencia de palabras observada. En este caso, lo que interesa es la secuencia completa de partes de la oración, en lugar de simplemente la parte de la oración de una sola palabra, como lo calcularían el filtrado o el suavizado.

Esta tarea requiere encontrar un máximo sobre todas las secuencias de estados posibles, y puede resolverse de manera eficiente mediante el algoritmo de Viterbi .

Significancia estadística

Para algunos de los problemas anteriores, también puede ser interesante preguntarse sobre la significancia estadística . ¿Cuál es la probabilidad de que una secuencia extraída de alguna distribución nula tenga una probabilidad HMM (en el caso del algoritmo hacia adelante) o una probabilidad de secuencia de estado máximo (en el caso del algoritmo de Viterbi) al menos tan grande como la de una secuencia de salida particular? [ 8 ] Cuando se utiliza un HMM para evaluar la relevancia de una hipótesis para una secuencia de salida particular, la significancia estadística indica la tasa de falsos positivos asociada con no rechazar la hipótesis para la secuencia de salida.

Aprendiendo

La tarea de aprendizaje de parámetros en los HMM consiste en encontrar, dada una secuencia de salida o un conjunto de dichas secuencias, el mejor conjunto de probabilidades de transición de estado y emisión. La tarea generalmente consiste en derivar la estimación de máxima verosimilitud de los parámetros del HMM dado el conjunto de secuencias de salida. No se conoce ningún algoritmo manejable para resolver este problema de forma exacta, pero se puede derivar una máxima verosimilitud local de manera eficiente utilizando el algoritmo de Baum-Welch o el algoritmo de Baldi-Chauvin. El algoritmo de Baum-Welch es un caso especial del algoritmo de expectativa-maximización .

Si los HMM se utilizan para la predicción de series temporales, se ha demostrado que los métodos de inferencia bayesiana más sofisticados, como el muestreo de Monte Carlo de cadena de Markov (MCMC), son más favorables que encontrar un único modelo de máxima verosimilitud tanto en términos de precisión como de estabilidad. [ 9 ] Dado que MCMC impone una carga computacional significativa, en los casos en que la escalabilidad computacional también es de interés, se puede recurrir alternativamente a aproximaciones variacionales a la inferencia bayesiana, por ejemplo [ 10 ] De hecho, la inferencia variacional aproximada ofrece una eficiencia computacional comparable a la maximización de la expectativa, al tiempo que produce un perfil de precisión solo ligeramente inferior a la inferencia bayesiana exacta de tipo MCMC.

Aplicaciones

Un modelo HMM de perfil que modela una alineación de secuencias múltiples de proteínas en Pfam

Los HMM se pueden aplicar en muchos campos donde el objetivo es recuperar una secuencia de datos que no es inmediatamente observable (pero sí lo son otros datos que dependen de dicha secuencia). Las aplicaciones incluyen:

Historia

Los modelos ocultos de Markov fueron descritos en una serie de artículos estadísticos por Leonard E. Baum y otros autores en la segunda mitad de la década de 1960. [ 29 ] [ 30 ] [ 31 ] [ 32 ] [ 33 ] Una de las primeras aplicaciones de los HMM fue el reconocimiento de voz , a partir de mediados de la década de 1970. [ 34 ] [ 35 ] [ 36 ] [ 37 ] Desde el punto de vista lingüístico, los modelos ocultos de Markov son equivalentes a la gramática regular estocástica. [ 38 ]

En la segunda mitad de la década de 1980, los HMM comenzaron a aplicarse al análisis de secuencias biológicas, [ 39 ] en particular ADN . Desde entonces, se han vuelto omnipresentes en el campo de la bioinformática . [ 40 ]

Extensiones

Espacios de estado general

En los modelos ocultos de Markov considerados anteriormente, el espacio de estados de las variables ocultas es discreto, mientras que las observaciones mismas pueden ser discretas (generalmente generadas a partir de una distribución categórica ) o continuas (generalmente a partir de una distribución gaussiana ). Los modelos ocultos de Markov también pueden generalizarse para permitir espacios de estados continuos. Ejemplos de tales modelos son aquellos donde el proceso de Markov sobre las variables ocultas es un sistema dinámico lineal , con una relación lineal entre variables relacionadas y donde todas las variables ocultas y observadas siguen una distribución gaussiana . En casos simples, como el sistema dinámico lineal mencionado anteriormente, la inferencia exacta es factible (en este caso, utilizando el filtro de Kalman ); sin embargo, en general, la inferencia exacta en HMM con variables latentes continuas es inviable, y deben utilizarse métodos aproximados, como el filtro de Kalman extendido o el filtro de partículas .

Actualmente, la inferencia en modelos ocultos de Markov se realiza en entornos no paramétricos , donde la estructura de dependencia permite la identificabilidad del modelo [ 41 ] y los límites de aprendizaje aún están en exploración. [ 42 ]

Modelado bayesiano de las probabilidades de transición

Los modelos ocultos de Markov son modelos generativos en los que se modela la distribución conjunta de observaciones y estados ocultos, o equivalentemente, tanto la distribución a priori de los estados ocultos (las probabilidades de transición ) como la distribución condicional de las observaciones dados los estados (las probabilidades de emisión ). Los algoritmos anteriores asumen implícitamente una distribución a priori uniforme sobre las probabilidades de transición. Sin embargo, también es posible crear modelos ocultos de Markov con otros tipos de distribuciones a priori. Una candidata obvia, dada la distribución categórica de las probabilidades de transición, es la distribución de Dirichlet , que es la distribución a priori conjugada de la distribución categórica. Normalmente, se elige una distribución de Dirichlet simétrica, lo que refleja la ignorancia sobre qué estados son inherentemente más probables que otros. El único parámetro de esta distribución (denominado parámetro de concentración ) controla la densidad relativa o la dispersión de la matriz de transición resultante. Una elección de 1 produce una distribución uniforme. Los valores mayores que 1 producen una matriz densa, en la que es probable que las probabilidades de transición entre pares de estados sean casi iguales. Los valores menores que 1 dan como resultado una matriz dispersa en la que, para cada estado de origen dado, solo un pequeño número de estados de destino tienen probabilidades de transición no despreciables. También es posible utilizar una distribución de Dirichlet a priori de dos niveles, en la que una distribución de Dirichlet (la distribución superior) rige los parámetros de otra distribución de Dirichlet (la distribución inferior), que a su vez rige las probabilidades de transición. La distribución superior rige la distribución general de los estados, determinando cuán probable es que ocurra cada estado; su parámetro de concentración determina la densidad o dispersión de los estados. Dicha distribución a priori de dos niveles, donde ambos parámetros de concentración se establecen para producir distribuciones dispersas, podría ser útil por ejemplo en el etiquetado de partes del habla no supervisado , donde algunas partes del habla ocurren mucho más comúnmente que otras; los algoritmos de aprendizaje que asumen una distribución a priori uniforme generalmente tienen un rendimiento deficiente en esta tarea. Los parámetros de los modelos de este tipo, con distribuciones a priori no uniformes, se pueden aprender utilizando el muestreo de Gibbs o versiones extendidas del algoritmo de expectativa-maximización .

Una extensión de los modelos ocultos de Markov con distribuciones a priori de Dirichlet descritos anteriormente utiliza un proceso de Dirichlet en lugar de una distribución de Dirichlet. Este tipo de modelo permite un número desconocido y potencialmente infinito de estados. Es común utilizar un proceso de Dirichlet de dos niveles, similar al modelo descrito anteriormente con dos niveles de distribuciones de Dirichlet. Dicho modelo se denomina modelo oculto de Markov con proceso de Dirichlet jerárquico , o HDP-HMM por sus siglas en inglés. Originalmente se describió con el nombre de "Modelo oculto de Markov infinito" [ 43 ] y se formalizó posteriormente en "Procesos de Dirichlet jerárquicos" [ 44 ] .

Enfoque discriminatorio

Otro tipo de extensión utiliza un modelo discriminativo en lugar del modelo generativo de los HMM estándar. Este tipo de modelo modela directamente la distribución condicional de los estados ocultos dadas las observaciones, en lugar de modelar la distribución conjunta. Un ejemplo de este modelo es el llamado modelo de Markov de máxima entropía (MEMM), que modela la distribución condicional de los estados mediante regresión logística (también conocido como " modelo de máxima entropía "). La ventaja de este tipo de modelo es que se pueden modelar características arbitrarias (es decir, funciones) de las observaciones, lo que permite incorporar al modelo el conocimiento específico del problema en cuestión. Los modelos de este tipo no se limitan a modelar dependencias directas entre un estado oculto y su observación asociada; más bien, se pueden incluir características de observaciones cercanas, de combinaciones de la observación asociada y observaciones cercanas, o incluso de observaciones arbitrarias a cualquier distancia de un estado oculto dado, en el proceso utilizado para determinar el valor de un estado oculto. Además, no es necesario que estas características sean estadísticamente independientes entre sí, como ocurriría si se utilizaran en un modelo generativo. Finalmente, se pueden usar características arbitrarias sobre pares de estados ocultos adyacentes en lugar de simples probabilidades de transición. Las desventajas de estos modelos son: (1) Los tipos de distribuciones a priori que se pueden asignar a los estados ocultos son muy limitados; (2) No es posible predecir la probabilidad de ver una observación arbitraria. Esta segunda limitación no suele ser un problema en la práctica, ya que muchos usos comunes de los HMM no requieren dichas probabilidades predictivas.

Una variante del modelo discriminativo descrito anteriormente es el campo aleatorio condicional de cadena lineal . Este utiliza un modelo gráfico no dirigido (también conocido como campo aleatorio de Markov ) en lugar de los modelos gráficos dirigidos de MEMM y modelos similares. La ventaja de este tipo de modelo es que no sufre el problema del sesgo de etiquetas de MEMM y, por lo tanto, puede realizar predicciones más precisas. La desventaja es que el entrenamiento puede ser más lento que para MEMM.

Otras extensiones

Otra variante es el modelo oculto de Markov factorial , que permite que una sola observación esté condicionada a las variables ocultas correspondientes de un conjunto deK{\displaystyle K}cadenas de Markov independientes, en lugar de una única cadena de Markov. Es equivalente a un único HMM, connorteK{\displaystyle N^{K}}estados (suponiendo que hayanorte{\displaystyle N}estados para cada cadena), y por lo tanto, el aprendizaje en dicho modelo es difícil: para una secuencia de longitudT{\displaystyle T}, un algoritmo de Viterbi sencillo tiene complejidadO(norte2KT){\displaystyle O(N^{2K}\,T)}Para encontrar una solución exacta, se podría utilizar un algoritmo de árbol de unión, pero esto da como resultado unO(norteK+1KT){\displaystyle O(N^{K+1}\,K\,T)}complejidad. En la práctica, se podrían utilizar técnicas aproximadas, como los enfoques variacionales. [ 45 ]

Todos los modelos anteriores pueden extenderse para permitir dependencias más distantes entre estados ocultos, por ejemplo, permitiendo que un estado dado dependa de los dos o tres estados anteriores en lugar de un solo estado anterior; es decir, las probabilidades de transición se extienden para abarcar conjuntos de tres o cuatro estados adyacentes (o en generalK{\displaystyle K}estados adyacentes). La desventaja de tales modelos es que los algoritmos de programación dinámica para entrenarlos tienen unaO(norteKT){\displaystyle O(N^{K}\,T)}tiempo de ejecución, paraK{\displaystyle K}estados adyacentes yT{\displaystyle T}observaciones totales (es decir, una longitud-T{\displaystyle T}cadena de Markov). Esta extensión se ha utilizado ampliamente en bioinformática , en el modelado de secuencias de ADN .

Otra extensión reciente es el modelo de Markov triplete , [ 46 ] en el que se agrega un proceso subyacente auxiliar para modelar algunas especificidades de los datos. Se han propuesto muchas variantes de este modelo. También cabe mencionar el interesante vínculo que se ha establecido entre la teoría de la evidencia y los modelos de Markov triplete [ 47 ] y que permite fusionar datos en un contexto markoviano [ 48 ] y modelar datos no estacionarios. [ 49 ] [ 50 ] También se han propuesto estrategias alternativas de fusión de datos de múltiples flujos en la literatura reciente, por ejemplo, [ 51 ]

Finalmente, en 2012 se propuso una justificación diferente para abordar el problema del modelado de datos no estacionarios mediante modelos ocultos de Markov. [ 52 ] Consiste en emplear una pequeña red neuronal recurrente (RNN), específicamente una red de reservorio, [ 53 ] para capturar la evolución de la dinámica temporal en los datos observados. Esta información, codificada en forma de un vector de alta dimensión, se utiliza como variable de condicionamiento de las probabilidades de transición de estado del HMM. Bajo esta configuración, se obtiene un HMM no estacionario, cuyas probabilidades de transición evolucionan con el tiempo de una manera que se infiere de los datos, en contraste con algún modelo ad hoc irreal de evolución temporal.

En 2023, se introdujeron dos algoritmos innovadores para el Modelo Oculto de Markov. Estos algoritmos permiten el cálculo de la distribución posterior del HMM sin necesidad de modelar explícitamente la distribución conjunta, utilizando solo las distribuciones condicionales. [ 54 ] [ 55 ] A diferencia de los métodos tradicionales como los algoritmos de avance-retroceso y Viterbi, que requieren conocimiento de la ley conjunta del HMM y pueden ser computacionalmente intensivos para aprender, los algoritmos discriminativos de avance-retroceso y Viterbi discriminativo evitan la necesidad de la ley de observación. [ 56 ] [ 57 ] Este avance permite que el HMM se aplique como un modelo discriminativo, ofreciendo un enfoque más eficiente y versátil para aprovechar los Modelos Ocultos de Markov en diversas aplicaciones.

El modelo adecuado en el contexto de datos longitudinales se denomina modelo de Markov latente. [ 58 ] La versión básica de este modelo se ha ampliado para incluir covariables individuales, efectos aleatorios y para modelar estructuras de datos más complejas, como datos multinivel. En [ 59 ] se ofrece una descripción general completa de los modelos de Markov latentes, con especial atención a los supuestos del modelo y a su uso práctico.

teoría de la medida

La parte oculta de un modelo oculto de Markov, cuyos estados observables no son markovianos.

Dada una matriz de transición de Markov y una distribución invariante en los estados, se puede imponer una medida de probabilidad en el conjunto de subdesplazamientos. Por ejemplo, considérese la cadena de Markov dada a la derecha en los estados.A,B1,B2{\displaystyle A,B_{1},B_{2}}, con distribución invarianteπ=(2/7,4/7,1/7){\displaystyle \pi =(2/7,4/7,1/7)}. Al ignorar la distinción entreB1,B2{\displaystyle B_{1},B_{2}}, este espacio de subdesplazamientos se proyecta sobreA,B1,B2{\displaystyle A,B_{1},B_{2}}en otro espacio de subdesplazamientos enA,B{\displaystyle A,B}y esta proyección también proyecta la medida de probabilidad hacia abajo a una medida de probabilidad en los subdesplazamientos enA,B{\displaystyle A,B}.

Lo curioso es que la medida de probabilidad en los subdesplazamientos enA,B{\displaystyle A,B}no es creado por una cadena de Markov enA,B{\displaystyle A,B}, ni siquiera múltiples órdenes. Intuitivamente, esto se debe a que si uno observa una larga secuencia deBnorte{\displaystyle B^{n}}, entonces uno se volvería cada vez más seguro de que elPr(ABnorte)23{\displaystyle \Pr(A\mid B^{n})\to {\frac {2}{3}}}, lo que significa que la parte observable del sistema puede verse afectada por algo que ocurrió infinitamente en el pasado. [ 60 ] [ 61 ]

Por el contrario, existe un espacio de subdesplazamientos en 6 símbolos, proyectado a subdesplazamientos en 2 símbolos, de tal manera que cualquier medida de Markov en el subdesplazamiento más pequeño tiene una medida de preimagen que no es de Markov de ningún orden (ejemplo 2.6 [ 61 ] ).

Véase también

Referencias

  1. "Google Académico" .
  2. Thad Starner, Alex Pentland. Reconocimiento visual en tiempo real del lenguaje de señas americano a partir de vídeo mediante modelos ocultos de Markov . Tesis de maestría, MIT, febrero de 1995, Programa de Artes Mediáticas.
  3. Pardo, B.; Birmingham, W. (julio de 2005). Modelado de formularios para el seguimiento en línea de actuaciones musicales (PDF) . Actas de AAAI-05. Archivado del original (PDF) el 6 de febrero de 2012.
  4. Satish L, Gururaj BI (abril de 2003). " Uso de modelos ocultos de Markov para la clasificación de patrones de descarga parcial ". IEEE Transactions on Dielectrics and Electrical Insulation .
  5. Li, N; Stephens, M (diciembre de 2003). "Modelado del desequilibrio de ligamiento e identificación de puntos calientes de recombinación utilizando datos de polimorfismos de un solo nucleótido" . Genetics . 165 ( 4): 2213–33 . doi : 10.1093/genetics/165.4.2213 . PMC 1462870. PMID 14704198 .  
  6. Ernst, Jason; Kellis, Manolis (marzo de 2012). "ChromHMM: automatización del descubrimiento y caracterización del estado de la cromatina" . Nature Methods . 9 (3): 215–216 . doi : 10.1038/nmeth.1906 . PMC 3577932. PMID 22373907 .  
  7. Lawrence R. Rabiner (febrero de 1989). "Un tutorial sobre modelos ocultos de Markov y aplicaciones seleccionadas en el reconocimiento de voz" (PDF) . Actas del IEEE . 77 (2): 257–286 . CiteSeerX 10.1.1.381.3454 . doi : 10.1109/5.18626 . S2CID 13618539 .  
  8. Newberg, Lee A. (2009). " Estadísticas de error de los resultados del modelo oculto de Markov y del modelo oculto de Boltzmann" . BMC Bioinformatics . 10 212. doi : 10.1186/1471-2105-10-212 . PMC 2722652. PMID 19589158 .  Icono de acceso abierto
  9. Sipos, I. Róbert. Muestreo MCMC estratificado paralelo de AR-HMM para la predicción de series temporales estocásticas . En: Actas de la 4.ª Conferencia Internacional sobre Técnicas de Modelado Estocástico y Análisis de Datos con Taller de Demografía (SMTDA2016), pp. 295-306. Valletta, 2016. PDF
  10. Chatzis, Sotirios P.; Kosmopoulos, Dimitrios I. (2011). "Una metodología bayesiana variacional para modelos ocultos de Markov que utilizan mezclas t de Student" (PDF) . Pattern Recognition . 44 (2): 295– 306. Bibcode : 2011PatRe..44..295C . CiteSeerX 10.1.1.629.6275 . doi : 10.1016/j.patcog.2010.09.001 . Archivado del original (PDF) el 1 de abril de 2011. Recuperado el 11 de marzo de 2018 . 
  11. Sipos, I. Róbert; Ceffer, Atila; Levendovszky, János (2016). "Optimización paralela de carteras dispersas con AR-HMM". Economía Computacional . 49 (4): 563– 578. doi : 10.1007/s10614-016-9579-y . S2CID 61882456 . 
  12. Petropoulos, Anastasios; Chatzis, Sotirios P.; Xanthopoulos, Stylianos (2016). "Un novedoso sistema de calificación crediticia corporativa basado en modelos ocultos de Markov t de Student". Expert Systems with Applications . 53 : 87–105 . doi : 10.1016/j.eswa.2016.01.015 .
  13. Nicolai, Christopher (2013). "Resolución de la cinética de los canales iónicos con el software QuB". Biophysical Reviews and Letters . 8 (3n04): 191– 211. doi : 10.1142/S1793048013300053 .
  14. Higgins, Cameron; Vidaurre, Diego; Kolling, Nils; Liu, Yunzhe; Behrens, Tim; Woolrich, Mark (2022). "Análisis de patrones multivariados con resolución espaciotemporal para M/EEG" . Human Brain Mapping . 43 (10): 3062– 3085. doi : 10.1002/hbm.25835 . PMC 9188977. PMID 35302683 .  
  15. Diomedi, S.; Vaccari, FE; Galletti, C.; Hadjidimitrakis, K.; Fattori, P. (2021-10-01). "Dinámica neuronal similar a la motora en dos áreas parietales durante el alcance del brazo" . Progress in Neurobiology . 205 102116. doi : 10.1016/j.pneurobio.2021.102116 . hdl : 11585/834094 . ISSN 0301-0082 . PMID 34217822. S2CID 235703641 .   
  16. Domingos, Pedro (2015). El algoritmo maestro: Cómo la búsqueda de la máquina de aprendizaje definitiva transformará nuestro mundo . Basic Books. pág . 37. ISBN  978-0-465-06192-1.
  17. ^ Kundu, Amlan, Yang He y Paramvir Bahl. " Reconocimiento de palabras escritas a mano: enfoque basado en el modelo oculto de Markov de primer y segundo orden." Reconocimiento de patrones 22.3 (1989): 283-297.
  18. Stigler, J.; Ziegler, F.; Gieseke, A.; Gebhardt, JCM; Rief, M. (2011). "La compleja red de plegamiento de moléculas individuales de calmodulina" . Science . 334 ( 6055): 512– 516. Bibcode : 2011Sci...334..512S . doi : 10.1126/science.1207598 . PMID 22034433. S2CID 5502662 .  
  19. Blasiak, S.; Rangwala, H. (2011). "Una variante del modelo oculto de Markov para la clasificación de secuencias". Actas de la IJCAI - Conferencia Internacional Conjunta sobre Inteligencia Artificial . 22 : 1192.
  20. Wong, W.; Stamp, M. (2006). "En busca de motores metamórficos". Journal in Computer Virology . 2 (3): 211– 229. doi : 10.1007/s11416-006-0028-7 . S2CID 8116065 . 
  21. Wong, K. -C.; Chan, T. -M.; Peng, C.; Li, Y.; Zhang, Z. (2013). " Elucidación de motivos de ADN mediante propagación de creencias" . Nucleic Acids Research . 41 (16): e153. doi : 10.1093/nar/gkt574 . PMC 3763557. PMID 23814189 .  
  22. Shah, Shalin; Dubey, Abhishek K.; Reif, John (2019-05-17). "Multiplexación óptica mejorada con códigos de barras de ADN temporales". ACS Synthetic Biology . 8 (5): 1100– 1111. doi : 10.1021/acssynbio.9b00010 . PMID 30951289 . S2CID 96448257 .  
  23. Shah, Shalin; Dubey, Abhishek K.; Reif, John (10 de abril de 2019). "Programación de códigos de barras de ADN temporales para la identificación molecular única". Nano Letters . 19 (4): 2668– 2673. Bibcode : 2019NanoL..19.2668S . doi : 10.1021/acs.nanolett.9b00590 . ISSN 1530-6984 . PMID 30896178. S2CID 84841635 .   
  24. "ChromHMM: Descubrimiento y caracterización del estado de la cromatina" . compbio.mit.edu . Consultado el 1 de agosto de 2018 .
  25. El Zarwi, Feraz (mayo de 2011). "Modelado y pronóstico de la evolución de las preferencias a lo largo del tiempo: un modelo oculto de Markov del comportamiento de viaje". arXiv : 1707.09133 [ stat.AP ].
  26. Morf, H. (febrero de 1998). "El modelo estocástico de irradiancia solar de dos estados (STSIM)". Solar Energy . 62 (2): 101– 112. Bibcode : 1998SoEn...62..101M . doi : 10.1016/S0038-092X(98)00004-8 .
  27. Munkhammar, J.; Widén, J. (agosto de 2018). "Un enfoque de mezcla de distribución de probabilidad de cadena de Markov para el índice de cielo despejado". Solar Energy . 170 : 174–183 . Bibcode : 2018SoEn..170..174M . doi : 10.1016/j.solener.2018.05.055 . S2CID 125867684 . 
  28. Munkhammar, J.; Widén, J. (octubre de 2018). "Un modelo de distribución de mezcla de cadena de Markov de N estados del índice de cielo despejado". Solar Energy . 173 : 487–495 . Bibcode : 2018SoEn..173..487M . doi : 10.1016/j.solener.2018.07.056 . S2CID 125538244 . 
  29. Baum, LE; Petrie, T. (1966). "Inferencia estadística para funciones probabilísticas de cadenas de Markov de estados finitos" . The Annals of Mathematical Statistics . 37 (6): 1554– 1563. doi : 10.1214/aoms/1177699147 .
  30. Baum, LE; Eagon, JA (1967). "Una desigualdad con aplicaciones a la estimación estadística para funciones probabilísticas de procesos de Markov y a un modelo para la ecología" . Boletín de la Sociedad Matemática Americana . 73 (3): 360. doi : 10.1090/S0002-9904-1967-11751-8 . Zbl 0157.11101 . 
  31. Baum, LE; Sell, GR (1968). "Transformaciones de crecimiento para funciones en variedades" . Pacific Journal of Mathematics . 27 (2): 211– 227. doi : 10.2140/pjm.1968.27.211 .
  32. Baum, LE ; Petrie, T.; Soules, G.; Weiss, N. (1970). "Una técnica de maximización que aparece en el análisis estadístico de funciones probabilísticas de cadenas de Markov" . The Annals of Mathematical Statistics . 41 (1): 164– 171. doi : 10.1214/ aoms /1177697196 . JSTOR 2239727. MR 0287613. Zbl 0188.49603 .   
  33. Baum, LE (1972). "Una desigualdad y una técnica de maximización asociada en la estimación estadística de funciones probabilísticas de un proceso de Markov". Desigualdades . 3 : 1–8 .
  34. Baker, J. (1975). "El sistema DRAGON: una visión general". IEEE Transactions on Acoustics, Speech, and Signal Processing . 23 : 24–29 . doi : 10.1109/TASSP.1975.1162650 .
  35. Jelinek, F.; Bahl, L.; Mercer, R. (1975). "Diseño de un decodificador estadístico lingüístico para el reconocimiento del habla continua". IEEE Transactions on Information Theory . 21 (3): 250. doi : 10.1109/TIT.1975.1055384 .
  36. Xuedong Huang ; M. Jack; Y. Ariki (1990). Modelos ocultos de Markov para el reconocimiento de voz . Edinburgh University Press. ISBN 978-0-7486-0162-2.
  37. Xuedong Huang ; Alex Acero; Hsiao-Wuen Hon (2001). Procesamiento del lenguaje hablado . Prentice Hall. ISBN 978-0-13-022616-7.
  38. Carrasco, Rafael C.; Oncina, Jose (1994). "Aprendizaje de gramáticas regulares estocásticas mediante un método de fusión de estados" . En Carrasco, Rafael C.; Oncina, Jose (eds.). Inferencia gramatical y aplicaciones . Lecture Notes in Computer Science. Vol. 862. Berlín, Heidelberg: Springer. pp. 139–152 . doi : 10.1007/3-540-58473-0_144 . ISBN   978-3-540-48985-6.
  39. M. Bishop y E. Thompson (1986). "Alineación de máxima verosimilitud de secuencias de ADN" . Journal of Molecular Biology . 190 (2): 159– 165. doi : 10.1016/0022-2836(86)90289-5 . PMID 3641921 . (Se requiere suscripción)Icono de acceso cerrado
  40. Durbin, Richard M .; Eddy, Sean R .; Krogh, Anders ; Mitchison, Graeme (1998), Análisis de secuencias biológicas: modelos probabilísticos de proteínas y ácidos nucleicos (1.ª ed.), Cambridge, Nueva York: Cambridge University Press , ISBN  0-521-62971-3, OCLC 593254083 
  41. Gassiat, E.; Cleynen, A.; Robin, S. (2016-01-01). "Inferencia en modelos ocultos de Markov no paramétricos de espacio de estados finito y aplicaciones". Statistics and Computing . 26 (1): 61– 71. doi : 10.1007/s11222-014-9523-8 . ISSN 1573-1375 . 
  42. Abraham, Kweku; Gassiat, Elisabeth; Naulet, Zacharie (marzo de 2023). "Límites fundamentales para el aprendizaje de parámetros de modelos ocultos de Markov". IEEE Transactions on Information Theory . 69 (3): 1777– 1794. arXiv : 2106.12936 . Bibcode : 2023ITIT...69.1777A . doi : 10.1109/TIT.2022.3213429 . ISSN 0018-9448 . 
  43. Beal, Matthew J., Zoubin Ghahramani y Carl Edward Rasmussen. "El modelo oculto de Markov infinito". Advances in neural information processing systems 14 (2002): 577-584.
  44. Teh, Yee Whye, et al. "Procesos jerárquicos de Dirichlet." Journal of the American Statistical Association 101.476 (2006).
  45. Ghahramani, Zoubin ; Jordan, Michael I. (1997). "Modelos ocultos de Markov factoriales" . Machine Learning . 29 (2/3): 245–273 . doi : 10.1023/A:1007425814087 .
  46. Pieczynski, Wojciech (2002). "Triplete Chaı̂nes de Markov" (PDF) . Cuentas Rendus Mathématique . 335 (3): 275– 278. doi : 10.1016/S1631-073X(02)02462-7 .
  47. Pieczynski, Wojciech (2007). "Cadenas de Markov de tripletes multisensoriales y teoría de la evidencia" . International Journal of Approximate Reasoning . 45 : 1–16 . doi : 10.1016/j.ijar.2006.05.001 .
  48. Boudaren, MY; Monfrini, E.; Pieczynski, W.; Aissani, A. (2012). "Fusión de señales multisensor de Dempster-Shafer en un contexto markoviano no estacionario" (PDF) . EURASIP Journal on Advances in Signal Processing (134). Archivado del original (PDF) el 11 de marzo de 2014.
  49. Lanchantin et al. , P. Lanchantin y W. Pieczynski, Restauración no supervisada de cadenas de Markov ocultas no estacionarias utilizando priors evidenciales, IEEE Transactions on Signal Processing, Vol. 53, No. 8, pp. 3091-3098, 2005.
  50. Boudaren, MY; Monfrini, E.; Pieczynski, W. (octubre de 2012). "Segmentación no supervisada de datos discretos aleatorios ocultos con distribuciones de ruido conmutadas" . IEEE Signal Processing Letters . 19 (10): 619– 622. doi : 10.1109/LSP.2012.2209639 .
  51. Sotirios P. Chatzis, Dimitrios Kosmopoulos, "Reconocimiento de flujo de trabajo visual mediante un tratamiento bayesiano variacional de modelos ocultos de Markov fusionados de múltiples flujos", IEEE Transactions on Circuits and Systems for Video Technology, vol. 22, n.º 7, págs. 1076-1086, julio de 2012.
  52. Chatzis, Sotirios P.; Demiris, Yiannis (2012). "Un modelo oculto de Markov no estacionario impulsado por reservorio". Pattern Recognition . 45 (11): 3985– 3996. Bibcode : 2012PatRe..45.3985C . doi : 10.1016/j.patcog.2012.04.018 . hdl : 10044/1/12611 .
  53. M. Lukosevicius, H. Jaeger (2009) Enfoques de computación de reservorio para el entrenamiento de redes neuronales recurrentes, Computer Science Review 3 : 127–149.
  54. Azeraf, E., Monfrini, E., & Pieczynski, W. (2023). Equivalencia entre LC-CRF y HMM, y computación discriminativa de MPM y MAP basados ​​en HMM. Algorithms, 16(3), 173.
  55. Azeraf, E., Monfrini, E., Vignon, E., & Pieczynski, W. (2020). Cadenas ocultas de Markov, entropía hacia adelante y hacia atrás, y etiquetado de partes del discurso. Preimpresión de arXiv arXiv:2005.10629.
  56. Azeraf, E., Monfrini, E., & Pieczynski, W. (2022). Derivación de clasificadores discriminativos a partir de modelos generativos. Preimpresión de arXiv arXiv:2201.00844.
  57. Ng, A., & Jordan, M. (2001). Sobre clasificadores discriminativos vs. generativos: una comparación de regresión logística y bayesianos ingenuos. Avances en sistemas de procesamiento de información neuronal, 14.
  58. Wiggins, LM (1973). Análisis de panel: modelos de probabilidad latente para procesos de actitud y comportamiento . Ámsterdam: Elsevier.
  59. Bartolucci, F.; Farcomeni, A.; Pennoni, F. (2013). Modelos latentes de Markov para datos longitudinales . Boca Raton: Chapman and Hall/CRC. ISBN 978-14-3981-708-7.
  60. Medidas sofic: Caracterizaciones de cadenas ocultas de Markov mediante álgebra lineal, lenguajes formales y dinámica simbólica - Karl Petersen, Matemáticas 210, primavera de 2006, Universidad de Carolina del Norte en Chapel Hill
  61. 1 2 Boyle, Mike; Petersen, Karl (2010-01-13), Procesos ocultos de Markov en el contexto de la dinámica simbólica , arXiv : 0907.1858

Conceptos

  • Teif, VB; Rippe, K. (2010). "Modelos de red estadístico-mecánicos para la unión proteína-ADN en la cromatina". J. Phys.: Condens. Matter . 22 (41) 414105. arXiv : 1004.5514 . Bibcode : 2010JPCM...22O4105T . doi : 10.1088/0953-8984/22/41/414105 . PMID 21386588 . S2CID 103345 .  
  • Una introducción reveladora a los modelos ocultos de Markov, por Mark Stamp, Universidad Estatal de San José.
  • Ajuste de HMM con maximización de expectativas: derivación completa
  • Tutorial paso a paso sobre HMM (Modelos Ocultos de Matemáticas) Archivado el 13 de agosto de 2017 en Wayback Machine (Universidad de Leeds)
  • Modelos ocultos de Markov (una exposición que utiliza matemáticas básicas)
  • Modelos ocultos de Markov (por Narada Warakagoda)
  • Modelos ocultos de Markov: Fundamentos y aplicaciones, Parte 1 y Parte 2 (por V. Petrushin)
  • Clase sobre hojas de cálculo impartida por Jason Eisner, vídeo y hoja de cálculo interactiva.