La discriminación de términos es una forma de clasificar las palabras clave en función de su utilidad para la recuperación de información .
Descripción general
Este es un método similar a tf-idf pero se ocupa de encontrar palabras clave adecuadas para la recuperación de información y aquellas que no lo son. Consulte primero el Modelo de espacio vectorial .
Este método utiliza el concepto de densidad de espacio vectorial : cuanto menos densa sea una matriz de ocurrencia , mejor será la consulta de recuperación de información.
Un término de índice óptimo es aquel que puede distinguir dos documentos diferentes entre sí y relacionar dos documentos similares. Por otro lado, un término de índice subóptimo no puede distinguir dos documentos diferentes de dos documentos similares.
El valor de discriminación es la diferencia entre la densidad del espacio vectorial de la matriz de ocurrencia y el espacio vectorial de la misma matriz sin la densidad del término índice.
Sea: la matriz de ocurrencia , la matriz de ocurrencia sin el término índice y la densidad de . Entonces: El valor de discriminación del término índice es:
Cómo calcular
Dada una matriz de ocurrencia y una palabra clave:
- Encuentre el centroide global del documento : (este es solo el vector promedio del documento)
- Encuentra la distancia euclidiana promedio desde cada vector del documento hasta
- Encuentra la distancia euclidiana promedio desde cada vector del documento, para IGNORAR
- La diferencia entre los dos valores en el paso anterior es el valor de discriminación para la palabra clave.
Un valor más alto es mejor porque incluir la palabra clave dará como resultado una mejor recuperación de la información.
Observaciones cualitativas
Las palabras clave que son escasas deberían ser malos discriminadores porque tienen poca capacidad de recuperación , mientras que las palabras clave que son frecuentes deberían ser malos discriminadores porque tienen poca precisión .
Referencias
- G. Salton , A. Wong y CS Yang (1975), "A Vector Space Model for Automatic Indexing", Communications of the ACM , vol. 18, n.° 11, páginas 613–620. (El artículo en el que se presentó por primera vez el modelo de espacio vectorial)
- Can, F., Ozkarahan, E. A (1987), "Cálculo de valores de discriminación término/documento mediante el uso del concepto de coeficiente de cobertura". Journal of the American Society for Information Science , vol. 38, nr. 3, páginas 171-183.