Una matriz documento-término es una matriz matemática que describe la frecuencia de los términos que aparecen en cada documento de una colección. En una matriz documento-término, las filas corresponden a los documentos de la colección y las columnas a los términos. Esta matriz es un caso particular de una matriz documento-característica, donde las "características" pueden referirse a otras propiedades de un documento además de los términos. [ 1 ] También es común encontrar la matriz transpuesta, o matriz término-documento, donde los documentos son las columnas y los términos las filas. Son útiles en el campo del procesamiento del lenguaje natural y el análisis computacional de textos . [ 2 ]
Si bien el valor de las celdas suele ser el recuento bruto de un término dado, existen varios esquemas para ponderar los recuentos brutos, como la normalización de filas (es decir, frecuencia relativa/proporciones) y tf-idf .
Los términos suelen ser palabras individuales separadas por espacios en blanco o signos de puntuación (también conocidos como unigramas). En este caso, se denomina representación de " bolsa de palabras " porque se conserva el número de palabras individuales, pero no su orden en el documento.
Concepto general
Al crear un conjunto de datos de términos que aparecen en un corpus de documentos , la matriz documento-término contiene filas que corresponden a los documentos y columnas que corresponden a los términos. Cada celda ij , entonces, es la cantidad de veces que la palabra j aparece en el documento i . Por lo tanto, cada fila es un vector de recuentos de términos que representa el contenido del documento correspondiente a esa fila. Por ejemplo, si se tienen los siguientes dos documentos (cortos):
- D1 = "Me gustan las bases de datos"
- D2 = "No me gustan las bases de datos",
Entonces la matriz documento-término sería:
Esto muestra qué documentos contienen qué términos y cuántas veces aparecen. Cabe destacar que, a diferencia de representar un documento simplemente como una lista de recuentos de tokens, la matriz documento-término incluye todos los términos del corpus (es decir, el vocabulario del corpus), por lo que los términos del corpus que no aparecen en un documento específico tienen un recuento de cero. Por este motivo, las matrices documento-término suelen almacenarse en formato de matriz dispersa.
Como resultado de la distribución de ley de potencias de los tokens en casi todos los corpus (véase la ley de Zipf ), es común ponderar los recuentos. Esto puede ser tan simple como dividir los recuentos por el número total de tokens en un documento (llamado frecuencia relativa o proporciones), dividir por la frecuencia máxima en cada documento (llamado prop max) o tomar el logaritmo de las frecuencias (llamado log count). Si se desea ponderar las palabras más únicas de un documento individual en comparación con el corpus en su conjunto, es común usar tf-idf , que divide la frecuencia del término por la frecuencia del término en el documento.
Historia del concepto
La matriz documento-término surgió en los primeros años de la informatización del texto. La creciente capacidad de almacenamiento de documentos generó el problema de recuperar un documento determinado de manera eficiente. Si bien anteriormente el trabajo de clasificación e indexación se realizaba manualmente, los investigadores exploraron la posibilidad de hacerlo automáticamente utilizando información sobre la frecuencia de las palabras.
Una de las primeras matrices documento-término publicadas fue en el artículo de Harold Borko de 1962, "La construcción de un sistema de clasificación derivado matemáticamente y basado en datos empíricos" (página 282; véase también su artículo de 1965 [ 3 ] ). Borko hace referencia a dos programas informáticos: "FEAT", que significaba "Frecuencia de cada término permitido", escrito por John C. Olney de System Development Corporation, y el Programa de Índice de Palabras Descriptoras, escrito por Eileen Stone, también de System Development Corporation.
Tras seleccionar los documentos que conformarían la biblioteca experimental, el siguiente paso consistió en introducir el texto completo mediante perforación para su posterior procesamiento informático. El programa utilizado para este análisis fue FEAT (Frequency of Every Allowable Term), escrito por John C. Olney de System Development Corporation, y diseñado para realizar recuentos de frecuencia y resúmenes de palabras individuales y pares de palabras. El resultado de este programa es una lista alfabética, por frecuencia de aparición, de todos los tipos de palabras presentes en el texto. Ciertas palabras funcionales, como «y», «el», «en», «un», etc., se incluyeron en una tabla de «palabras prohibidas», y su frecuencia se registró en una lista aparte. Se desarrolló un programa informático especial, denominado Descriptor Word Index Program, para proporcionar esta información y preparar una matriz documento-término en un formato adecuado para su introducción en el Factor Analysis Program. El programa Descriptor Word Index fue desarrollado por Eileen Stone de System Development Corporation. [ 4 ]
Poco después, Gerard Salton publicó en 1963 «Algunos modelos jerárquicos para la recuperación automática de documentos», que también incluía una representación visual de una matriz documento-término. [ 5 ] Salton se encontraba en la Universidad de Harvard en ese momento y su trabajo fue financiado por los Laboratorios de Investigación de la Fuerza Aérea de Cambridge y Sylvania Electric Products, Inc. En este artículo, Salton introduce la matriz documento-término comparándola con un tipo de matriz término-contexto utilizada para medir similitudes entre palabras:
Si se desea generar asociaciones de documentos o clústeres de documentos en lugar de asociaciones de palabras, se pueden utilizar los mismos procedimientos con ligeras modificaciones. En lugar de comenzar con una matriz palabra-oración C , ahora es conveniente construir una matriz palabra-documento F, que liste la frecuencia de aparición de la palabra W i en el documento D j . Las similitudes entre documentos se pueden calcular como antes comparando pares de filas y obteniendo coeficientes de similitud basados en la frecuencia de coocurrencias de las palabras de contenido incluidas en el documento dado. Este procedimiento produce una matriz de similitud documento-documento que a su vez se puede utilizar para la generación de clústeres de documentos. [ 5 ]
Además de Borko y Salton, en 1964, FW Lancaster publicó una revisión exhaustiva de la indexación y recuperación automatizadas. Si bien el trabajo se publicó mientras trabajaba en Herner and Company en Washington D.C., el artículo fue escrito mientras estaba "empleado en trabajos de investigación en Aslib, en el Proyecto Cranfield de Aslib". [ 6 ] Lancaster le atribuye a Borko la matriz documento-término:
Harold Borko, de System Development Corporation, ha llevado esta operación un paso más allá. Se selecciona un grupo significativo de palabras clave del vocabulario de una colección experimental. Estas se organizan en una matriz documento/término para mostrar la frecuencia de aparición de cada término en cada documento. A continuación, se calcula un coeficiente de correlación para cada par de palabras, basándose en su coocurrencia en el conjunto de documentos. La matriz término/término resultante se somete a un análisis factorial y se aísla una serie de factores. Estos factores, una vez interpretados y nombrados según los términos con altas cargas factoriales que aparecen en cada uno de ellos, se convierten en las clases de una clasificación empírica. Los términos con altas cargas factoriales en cada factor son las palabras clave o predictores de las categorías.
Elección de términos
Una perspectiva sobre la matriz es que cada fila representa un documento. En el modelo semántico vectorial , que es el que normalmente se utiliza para calcular una matriz documento-término, el objetivo es representar el tema de un documento mediante la frecuencia de términos semánticamente significativos. Los términos son unidades semánticas de los documentos. Para las lenguas indoeuropeas , se suele asumir que los sustantivos, verbos y adjetivos son las categorías más significativas , y que las palabras de esas categorías deben conservarse como términos. Añadir colocaciones como términos mejora la calidad de los vectores, especialmente al calcular similitudes entre documentos.
Aplicaciones
Mejorar los resultados de búsqueda
El análisis semántico latente (LSA, que realiza una descomposición en valores singulares de la matriz documento-término) puede mejorar los resultados de búsqueda al desambiguar palabras polisémicas y buscar sinónimos de la consulta. Sin embargo, la búsqueda en el espacio continuo de alta dimensión es mucho más lenta que la búsqueda en la estructura de datos trie estándar de los motores de búsqueda.
Encontrar temas
El análisis multivariado de la matriz documento-término puede revelar los temas principales del corpus. En concreto, se pueden utilizar el análisis semántico latente y la agrupación de datos , y, más recientemente, se ha comprobado que el análisis semántico latente probabilístico , con su generalización de asignación de Dirichlet latente , y la factorización de matrices no negativas , funcionan bien para esta tarea.
Véase también
Implementaciones
Referencias
- ↑ "Matriz de características del documento :: Tutoriales para quanteda" . tutorials.quanteda.io . Consultado el 2 de enero de 2021 .
- ↑ "15 maneras de crear una matriz documento-término en R" . Dustin S. Stoltz . Consultado el 2 de enero de 2021 .
- ↑ Borko, Harold (1965). "Un sistema de clasificación derivado del análisis factorial para informes psicológicos" . Perceptual and Motor Skills . 20 (2): 393– 406. doi : 10.2466/pms.1965.20.2.393 . ISSN 0031-5125 . PMID 14279310. S2CID 34230652 .
- ↑ Borko, Harold (1962). «La construcción de un sistema de clasificación derivado matemáticamente y basado en datos empíricos». Actas de la conferencia conjunta de informática de primavera del 1 al 3 de mayo de 1962 - AIEE-IRE '62 (Primavera) . Nueva York, Nueva York, EE. UU.: ACM Press. págs. 279–289 . doi : 10.1145/1460833.1460865 . ISBN 9781450378758. S2CID 6483337 .
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - 1 2 Salton, Gerard (julio de 1963). "Algunos modelos jerárquicos para la recuperación automática de documentos" . American Documentation . 14 (3): 213– 222. doi : 10.1002/asi.5090140307 . ISSN 0096-946X .
- ↑ LANCASTER, FW (1964-01-01). "CONTROL MECANIZADO DE DOCUMENTOS: Una revisión de algunas investigaciones recientes" . Actas de ASLIB . 16 (4): 132– 152. doi : 10.1108/eb049960 . ISSN 0001-253X .
- Procesamiento del lenguaje natural