El análisis semántico latente probabilístico ( PLSA ), también conocido como indexación semántica latente probabilística ( PLSI , especialmente en el ámbito de la recuperación de información), es una técnica estadística para el análisis de datos bimodales y de coocurrencia. En efecto, permite obtener una representación de baja dimensionalidad de las variables observadas en función de su afinidad con ciertas variables ocultas, al igual que en el análisis semántico latente , del cual evolucionó el PLSA.
En comparación con el análisis semántico latente estándar , que se basa en el álgebra lineal y reduce el tamaño de las tablas de ocurrencia (generalmente mediante una descomposición en valores singulares ), el análisis semántico latente probabilístico se basa en una descomposición de mezcla derivada de un modelo de clase latente .
Modelo

Considerando las observaciones en forma de coocurrenciasEn el caso de palabras y documentos, PLSA modela la probabilidad de cada coocurrencia como una mezcla de distribuciones multinomiales condicionalmente independientes :
consiendo el tema de las palabras. Tenga en cuenta que el número de temas es un hiperparámetro que debe elegirse de antemano y no se estima a partir de los datos. La primera formulación es la formulación simétrica , dondeyambos se generan a partir de la clase latentede forma similar (utilizando las probabilidades condicionales)y), mientras que la segunda formulación es la formulación asimétrica , donde, para cada documento, se elige una clase latente condicionalmente al documento segúny luego se genera una palabra a partir de esa clase segúnAunque en este ejemplo hemos utilizado palabras y documentos, la coocurrencia de cualquier par de variables discretas puede modelarse exactamente de la misma manera.
Entonces, el número de parámetros es igual aEl número de parámetros crece linealmente con el número de documentos. Además, si bien PLSA es un modelo generativo de los documentos de la colección sobre la que se estima, no es un modelo generativo de documentos nuevos.
Sus parámetros se aprenden utilizando el algoritmo EM .
Solicitud
PLSA puede utilizarse en un entorno discriminativo, mediante núcleos de Fisher . [ 1 ]
PLSA tiene aplicaciones en recuperación y filtrado de información , procesamiento del lenguaje natural , aprendizaje automático a partir de texto, bioinformática , [ 2 ] y áreas relacionadas.
Se informa que el modelo de aspecto utilizado en el análisis semántico latente probabilístico tiene graves problemas de sobreajuste . [ 3 ]
Extensiones
- Extensiones jerárquicas:
- Modelos generativos: Los siguientes modelos se han desarrollado para abordar una deficiencia frecuentemente criticada de PLSA, a saber, que no es un modelo generativo adecuado para documentos nuevos.
- Asignación de Dirichlet latente : agrega una distribución a priori de Dirichlet a la distribución de temas por documento.
- Datos de orden superior: Si bien rara vez se aborda en la literatura científica, PLSA se extiende naturalmente a datos de orden superior (tres modos o más), es decir, puede modelar coocurrencias de tres o más variables. En la formulación simétrica anterior, esto se logra simplemente agregando distribuciones de probabilidad condicionales para estas variables adicionales. Este es el análogo probabilístico de la factorización tensorial no negativa.
Historia
Este es un ejemplo de un modelo de clases latentes (véanse las referencias allí citadas), y está relacionado [ 6 ] [ 7 ] con la factorización de matrices no negativas . La terminología actual fue acuñada en 1999 por Thomas Hofmann. [ 8 ]
Véase también
Referencias y notas
- ↑ Thomas Hofmann, Aprendizaje de la similitud de documentos : un enfoque geométrico de la información para la recuperación y categorización de documentos , Advances in Neural Information Processing Systems 12, pp. 914-920, MIT Press , 2000
- ↑ Pinoli, Pietro; et al. (2013). "Análisis semántico latente probabilístico mejorado con esquemas de ponderación para predecir anotaciones genómicas". Actas de IEEE BIBE 2013. XIII Conferencia Internacional IEEE sobre Bioinformática y Bioingeniería. IEEE. págs. 1–4 . doi : 10.1109/BIBE.2013.6701702 . ISBN 978-147993163-7.
- ↑ Blei, David M.; Andrew Y. Ng; Michael I. Jordan (2003). "Asignación latente de Dirichlet" (PDF) . Journal of Machine Learning Research . 3 : 993–1022 . doi : 10.1162/jmlr.2003.3.4-5.993 .
- ↑ Alexei Vinokourov y Mark Girolami, Un marco probabilístico para la organización jerárquica y la clasificación de colecciones de documentos , en Procesamiento y gestión de la información , 2002
- ↑ Eric Gaussier, Cyril Goutte, Kris Popat y Francine Chen, Un modelo jerárquico para agrupar y categorizar documentos Archivado el 4 de marzo de 2016 en Wayback Machine , en "Avances en la recuperación de información: Actas del 24.º Coloquio Europeo BCS-IRSG sobre Investigación en Recuperación de Información (ECIR-02)", 2002
- ↑ Chris Ding, Tao Li, Wei Peng (2006). " Factorización de matrices no negativas e indexación semántica latente probabilística: estadística chi-cuadrado de equivalencia y un método híbrido. AAAI 2006"
- ↑ Chris Ding, Tao Li, Wei Peng (2008). " Sobre la equivalencia entre la factorización de matrices no negativas y la indexación semántica latente probabilística"
- ↑ Thomas Hofmann, Indexación semántica latente probabilística , Actas de la Vigésimo Segunda Conferencia Internacional Anual SIGIR sobre Investigación y Desarrollo en Recuperación de Información (SIGIR-99), 1999
Enlaces externos
- Análisis semántico latente probabilístico
- Demo completa de PLSA en C#
- Procesamiento estadístico del lenguaje natural
- Algoritmos de clasificación
- modelos de variables latentes
- Modelado del lenguaje