Las técnicas de recuperación difusa se basan en el modelo booleano extendido y la teoría de conjuntos difusos . Existen dos modelos clásicos de recuperación difusa: el modelo mixto mínimo y máximo (MMM) y el modelo de Paice. Ninguno de estos modelos permite evaluar los pesos de las consultas, si bien el algoritmo de normas P sí lo contempla .
Modelo mixto mínimo y máximo (MMM)
En la teoría de conjuntos difusos, un elemento tiene un grado variable de pertenencia, digamos d A , a un conjunto A dado, en lugar de la elección de pertenencia tradicional (es un elemento/no es un elemento). En MMM [ 1 ] , cada término de índice tiene un conjunto difuso asociado. El peso de un documento con respecto a un término de índice A se considera el grado de pertenencia del documento al conjunto difuso asociado con A. El grado de pertenencia para la unión y la intersección se define de la siguiente manera en la teoría de conjuntos difusos:
Según esto, los documentos que deben recuperarse para una consulta de la forma A o B deben estar en el conjunto difuso asociado con la unión de los dos conjuntos A y B. De manera similar, los documentos que deben recuperarse para una consulta de la forma A y B deben estar en el conjunto difuso asociado con la intersección de los dos conjuntos. Por lo tanto, es posible definir la similitud de un documento con la consulta A o B como max(d A , d B ) y la similitud del documento con la consulta B y B como min(d A , d B ) . El modelo MMM intenta suavizar los operadores booleanos al considerar la similitud entre la consulta y el documento como una combinación lineal de los pesos mínimo y máximo del documento.
Dado un documento D con pesos de términos de índice d A1 , d A2 , ..., d An para los términos A 1 , A 2 , ..., An , y las consultas:
Q o = (A 1 o A 2 o ... o A n ) Q y = (A 1 y A 2 y ... y A n )
La similitud entre la consulta y el documento en el modelo MMM se calcula de la siguiente manera:
SlM(Q o , D) = C or1 * max(d A1 , d A2 , ..., d An ) + C or2 * min(d A1 , d A2 , ..., d An ) SlM(Q y , D) = C and1 * min(d A1 , d A2 , ..., d An ) + C and2 * max(d A1 , d A2 ..., d An )
donde C or1 y C or2 son coeficientes de "suavidad" para el operador or , y C and1 y C and2 son coeficientes de suavidad para el operador and . Dado que deseamos dar mayor importancia al peso máximo del documento al considerar una consulta or y mayor importancia al mínimo al considerar una consulta and , generalmente tenemos C or1 > C or2 y C and1 > C and2 . Para simplificar, generalmente se asume que C or1 = 1 - C or2 y C and1 = 1 - C and2 .
Los experimentos de Lee y Fox [ 2 ] indican que el mejor rendimiento suele ocurrir con C y 1 en el rango [0,5, 0,8] y con C o 1 > 0,2. En general, el coste computacional de MMM es bajo y la eficacia de recuperación es mucho mejor que con el modelo booleano estándar .
modelo de paz
El modelo de Paice [ 3 ] es una extensión general del modelo MMM. En comparación con el modelo MMM, que considera solo los pesos mínimo y máximo para los términos del índice, el modelo de Paice incorpora todos los pesos de los términos al calcular la similitud:
donde r es un coeficiente constante y w di se ordena en orden ascendente para las consultas " y " y en orden descendente para las consultas "o" . Cuando n = 2, el modelo de Paice muestra el mismo comportamiento que el modelo MMM.
Los experimentos de Lee y Fox [ 2 ] han demostrado que establecer r en 1.0 para consultas AND y 0.7 para consultas OR proporciona una buena efectividad de recuperación. El costo computacional para este modelo es mayor que el del modelo MMM. Esto se debe a que el modelo MMM solo requiere la determinación del mínimo o máximo de un conjunto de pesos de términos cada vez que se considera una cláusula AND u OR , lo que se puede hacer en O(n) . El modelo Paice requiere que los pesos de los términos se ordenen en orden ascendente o descendente, dependiendo de si se está considerando una cláusula AND o una cláusula OR . Esto requiere al menos un algoritmo de ordenación O(n log n) . También se necesita una buena cantidad de cálculos de punto flotante.
Mejoras respecto al modelo booleano estándar.
Lee y Fox [ 2 ] compararon el modelo booleano estándar con los modelos MMM y Paice con tres conjuntos de datos de prueba: CISI, CACM e INSPEC . Estos son los resultados reportados para la mejora promedio de la precisión media:
Estas son mejoras muy significativas con respecto al modelo estándar. El método MMM se acerca mucho a los resultados de Paice y la norma P, lo que indica que puede ser una técnica muy buena y la más eficiente de las tres.
Trabajos recientes
En 2005, Kang et al. [ 4 ] idearon un sistema de recuperación difusa indexado por identificación de conceptos.
Si analizamos los documentos con un enfoque Tf-idf puro , incluso eliminando las palabras vacías, habrá palabras más relevantes para el tema del documento que otras, y tendrán el mismo peso debido a su frecuencia de aparición similar. Si consideramos la intención del usuario en una consulta, podemos ponderar mejor los términos de un documento. Cada término puede identificarse como un concepto dentro de una cadena léxica específica que refleja su importancia para dicho documento. Se reportan mejoras con respecto a Paice y P-norm en la precisión y exhaustividad promedio para los 5 documentos recuperados principales.
Zadrozny [ 5 ] revisó el modelo de recuperación de información difusa. Además, extiende el modelo booleano extendido difuso mediante:
- asumiendo términos lingüísticos como ponderaciones de importancia de las palabras clave también en los documentos
- teniendo en cuenta la incertidumbre relativa a la representación de documentos y consultas
- interpretar los términos lingüísticos en la representación de documentos y consultas, así como su correspondencia en términos de la lógica difusa de Zadeh (cálculo de enunciados lingüísticos)
- abordar algunos aspectos pragmáticos del modelo propuesto, en particular las técnicas de indexación de documentos y consultas.
El modelo propuesto permite comprender tanto la imprecisión como la incertidumbre en lo que respecta a la representación y recuperación de la información textual.
Véase también
Lecturas adicionales
- Fox, E.; S. Betrabet; M. Koushik; W. Lee (1992), Recuperación de información: algoritmos y estructuras de datos; modelo booleano extendido , Prentice-Hall, Inc., archivado del original el 28-09-2013 , recuperado el 09-09-2017.
Referencias
- ↑ Fox, EA; S. Sharat (1986), Comparación de dos métodos para la interpretación booleana flexible en la recuperación de información , Informe técnico TR-86-1, Virginia Tech, Departamento de Ciencias de la Computación
- 1 2 3 Lee, WC; EA Fox (1988), Comparación experimental de esquemas para interpretar consultas booleanas
- ↑ Paice, CD (1984), Evaluación suave de consultas de búsqueda booleana en sistemas de recuperación de información , Information Technology, Res. Dev. Applications, 3(1), 33-42
- ↑ Kang, Bo-Yeong; Dae-Won Kim; Hae-Jung Kim (2005), "Recuperación de información difusa indexada por identificación de conceptos", Texto, habla y diálogo , Lecture Notes in Computer Science, vol. 3658, Springer Berlin / Heidelberg, pp. 179–186 , doi : 10.1007/11551874_23 , ISBN 978-3-540-28789-6
- ↑ Zadrozny, Sławomir; Nowacka, Katarzyna (2009), "Revisión del modelo de recuperación de información difusa", Fuzzy Sets and Systems , 160 (15), Elsevier North-Holland, Inc.: 2173–2191 , doi : 10.1016/j.fss.2009.02.012
- Técnicas de recuperación de información