Articulo de referencia

Análisis semántico latente probabilístico

El análisis semántico latente probabilístico ( PLSA ), también conocido como indexación semántica latente probabilística ( PLSI , especialmente en el ámbito de la recuperación d...

El análisis semántico latente probabilístico ( PLSA ), también conocido como indexación semántica latente probabilística ( PLSI , especialmente en el ámbito de la recuperación de información), es una técnica estadística para el análisis de datos bimodales y de coocurrencia. En efecto, permite obtener una representación de baja dimensionalidad de las variables observadas en función de su afinidad con ciertas variables ocultas, al igual que en el análisis semántico latente , del cual evolucionó el PLSA.

En comparación con el análisis semántico latente estándar , que se basa en el álgebra lineal y reduce el tamaño de las tablas de ocurrencia (generalmente mediante una descomposición en valores singulares ), el análisis semántico latente probabilístico se basa en una descomposición de mezcla derivada de un modelo de clase latente .

Modelo

Notación de placa que representa el modelo PLSA (formulación "asimétrica"). d{\displaystyle d}es la variable de índice del documento, do{\displaystyle c}es el tema de una palabra extraído de la distribución de temas del documento,PAG(do|d){\displaystyle P(c|d)}, yw{\displaystyle w}es una palabra extraída de la distribución de palabras del tema de esta palabra,PAG(w|do){\displaystyle P(w|c)}. Eld{\displaystyle d}yw{\displaystyle w}son variables observables , el temado{\displaystyle c}es una variable latente .

Considerando las observaciones en forma de coocurrencias(w,d){\displaystyle (w,d)}En el caso de palabras y documentos, PLSA modela la probabilidad de cada coocurrencia como una mezcla de distribuciones multinomiales condicionalmente independientes :

PAG(w,d)=doPAG(d)PAG(do|d)PAG(w|do)=PAG(d)doPAG(do|d)PAG(w|do){\displaystyle P(w,d)=\sum _{c}P(d)P(c|d)P(w|c)=P(d)\sum _{c}P(c|d)P(w|c)}

condo{\displaystyle c}siendo el tema de las palabras. Tenga en cuenta que el número de temas es un hiperparámetro que debe elegirse de antemano y no se estima a partir de los datos. La primera formulación es la formulación simétrica , dondew{\displaystyle w}yd{\displaystyle d}ambos se generan a partir de la clase latentedo{\displaystyle c}de forma similar (utilizando las probabilidades condicionales)PAG(d|do){\displaystyle P(d|c)}yPAG(w|do){\displaystyle P(w|c)}), mientras que la segunda formulación es la formulación asimétrica , donde, para cada documentod{\displaystyle d}, se elige una clase latente condicionalmente al documento segúnPAG(do|d){\displaystyle P(c|d)}y luego se genera una palabra a partir de esa clase segúnPAG(w|do){\displaystyle P(w|c)}Aunque en este ejemplo hemos utilizado palabras y documentos, la coocurrencia de cualquier par de variables discretas puede modelarse exactamente de la misma manera.

Entonces, el número de parámetros es igual adod+wdo{\displaystyle cd+wc}El número de parámetros crece linealmente con el número de documentos. Además, si bien PLSA es un modelo generativo de los documentos de la colección sobre la que se estima, no es un modelo generativo de documentos nuevos.

Sus parámetros se aprenden utilizando el algoritmo EM .

Solicitud

PLSA puede utilizarse en un entorno discriminativo, mediante núcleos de Fisher . [ 1 ]

PLSA tiene aplicaciones en recuperación y filtrado de información , procesamiento del lenguaje natural , aprendizaje automático a partir de texto, bioinformática , [ 2 ] y áreas relacionadas.

Se informa que el modelo de aspecto utilizado en el análisis semántico latente probabilístico tiene graves problemas de sobreajuste . [ 3 ]

Extensiones

  • Extensiones jerárquicas:
    • Asimétrico: MASHA ("Análisis jerárquico asimétrico multinomial") [ 4 ]
    • Simétrico: HPLSA ("Análisis semántico latente probabilístico jerárquico") [ 5 ]
  • Modelos generativos: Los siguientes modelos se han desarrollado para abordar una deficiencia frecuentemente criticada de PLSA, a saber, que no es un modelo generativo adecuado para documentos nuevos.
  • Datos de orden superior: Si bien rara vez se aborda en la literatura científica, PLSA se extiende naturalmente a datos de orden superior (tres modos o más), es decir, puede modelar coocurrencias de tres o más variables. En la formulación simétrica anterior, esto se logra simplemente agregando distribuciones de probabilidad condicionales para estas variables adicionales. Este es el análogo probabilístico de la factorización tensorial no negativa.

Historia

Este es un ejemplo de un modelo de clases latentes (véanse las referencias allí citadas), y está relacionado [ 6 ] [ 7 ] con la factorización de matrices no negativas . La terminología actual fue acuñada en 1999 por Thomas Hofmann. [ 8 ]

Véase también

Referencias y notas

  1. Thomas Hofmann, Aprendizaje de la similitud de documentos  : un enfoque geométrico de la información para la recuperación y categorización de documentos , Advances in Neural Information Processing Systems 12, pp. 914-920, MIT Press , 2000
  2. Pinoli, Pietro; et al. (2013). "Análisis semántico latente probabilístico mejorado con esquemas de ponderación para predecir anotaciones genómicas". Actas de IEEE BIBE 2013. XIII Conferencia Internacional IEEE sobre Bioinformática y Bioingeniería. IEEE. págs. 1–4 . doi : 10.1109/BIBE.2013.6701702 . ISBN  978-147993163-7.
  3. Blei, David M.; Andrew Y. Ng; Michael I. Jordan (2003). "Asignación latente de Dirichlet" (PDF) . Journal of Machine Learning Research . 3 : 993–1022 . doi : 10.1162/jmlr.2003.3.4-5.993 .
  4. Alexei Vinokourov y Mark Girolami, Un marco probabilístico para la organización jerárquica y la clasificación de colecciones de documentos , en Procesamiento y gestión de la información , 2002
  5. Eric Gaussier, Cyril Goutte, Kris Popat y Francine Chen, Un modelo jerárquico para agrupar y categorizar documentos Archivado el 4 de marzo de 2016 en Wayback Machine , en "Avances en la recuperación de información: Actas del 24.º Coloquio Europeo BCS-IRSG sobre Investigación en Recuperación de Información (ECIR-02)", 2002
  6. Chris Ding, Tao Li, Wei Peng (2006). " Factorización de matrices no negativas e indexación semántica latente probabilística: estadística chi-cuadrado de equivalencia y un método híbrido. AAAI 2006"
  7. Chris Ding, Tao Li, Wei Peng (2008). " Sobre la equivalencia entre la factorización de matrices no negativas y la indexación semántica latente probabilística"
  8. Thomas Hofmann, Indexación semántica latente probabilística , Actas de la Vigésimo Segunda Conferencia Internacional Anual SIGIR sobre Investigación y Desarrollo en Recuperación de Información (SIGIR-99), 1999
  • Análisis semántico latente probabilístico
  • Demo completa de PLSA en C#