Articulo de referencia

Modelo booleano extendido

El modelo booleano extendido fue descrito en un artículo de Communications of the ACM publicado en 1983 por Gerard Salton, Edward A. Fox y Harry Wu. El objetivo del modelo boole...

El modelo booleano extendido fue descrito en un artículo de Communications of the ACM publicado en 1983 por Gerard Salton, Edward A. Fox y Harry Wu. El objetivo del modelo booleano extendido es superar las limitaciones del modelo booleano utilizado en la recuperación de información . El modelo booleano no considera la ponderación de los términos en las consultas, y el conjunto de resultados de una consulta booleana suele ser demasiado pequeño o demasiado grande. La idea del modelo extendido es utilizar la coincidencia parcial y la ponderación de los términos, como en el modelo de espacio vectorial. Combina las características del modelo de espacio vectorial con las propiedades del álgebra booleana y clasifica la similitud entre consultas y documentos. De esta forma, un documento puede ser relevante si coincide con algunos de los términos consultados y se devolverá como resultado, mientras que en el modelo booleano estándar no lo era. [ 1 ]

Por lo tanto, el modelo booleano extendido puede considerarse una generalización tanto del modelo booleano como del modelo de espacio vectorial; estos dos últimos son casos especiales si se emplean configuraciones y definiciones adecuadas. Además, la investigación ha demostrado que su eficacia mejora en comparación con el procesamiento de consultas booleanas. Otras investigaciones han demostrado que la retroalimentación de relevancia y la expansión de consultas pueden integrarse con el procesamiento de consultas booleanas extendidas.

Definiciones

En el modelo booleano extendido , un documento se representa como un vector (de forma similar al modelo vectorial). Cada dimensión i corresponde a un término distinto asociado al documento.

El peso del término K x asociado con el documento d j se mide por su frecuencia de término normalizada y se puede definir como:

wincógnita,j=Fincógnita,jIdFincógnitametroaincógnitaiIdFi{\displaystyle w_{x,j}=f_{x,j}*{\frac {Idf_{x}}{max_{i}Idf_{i}}}}

donde Idf x es la frecuencia inversa del documento y f x,j la frecuencia del término para el término x en el documento j.

El vector de pesos asociado al documento d j se puede representar como:

vdj=[w1,j,w2,j,,wi,j]{\displaystyle \mathbf {v} _{d_{j}}=[w_{1,j},w_{2,j},\ldots ,w_{i,j}]}

El ejemplo de las 2 dimensiones

Figura 1
Figura 1: Las similitudes de q = ( K xK y ) con los documentos d j y d j +1 .
Figura 2
Figura 2: Las similitudes de q = ( K xK y ) con los documentos d j y d j +1 .

Considerando el espacio compuesto únicamente por dos términos K x y K y , los pesos correspondientes de los términos son w 1 y w 2 . [ 2 ] Por lo tanto, para la consulta q o = ( K xK y ) , podemos calcular la similitud con la siguiente fórmula:

simetro(qor,d)=w12+w222{\displaystyle sim(q_{or},d)={\sqrt {\frac {w_{1}^{2}+w_{2}^{2}}{2}}}}

Para la consulta q y = ( K xK y ) , podemos usar:

simetro(qanorted,d)=1(1w1)2+(1w2)22{\displaystyle sim(q_{and},d)=1-{\sqrt {\frac {(1-w_{1})^{2}+(1-w_{2})^{2}}{2}}}}

Generalización de la idea y las normas P

Podemos generalizar el ejemplo anterior del modelo booleano extendido en 2D a un espacio de t dimensiones superior utilizando distancias euclidianas.

Esto se puede hacer utilizando normas P que extienden la noción de distancia para incluir distancias p, donde 1 p es un nuevo parámetro. [ 3 ]

  • Una consulta conjuntiva generalizada viene dada por:
qor=k1pagk2pag....pagkt{\displaystyle q_{or}=k_{1}\lor ^{p}k_{2}\lor ^{p}....\lor ^{p}k_{t}}
  • La similitud deqor{\displaystyle q_{o}}ydj{\displaystyle d_{j}}se puede definir como:

:simetro(qor,dj)=w1pag+w2pag+....+wtpagtpag{\displaystyle sim(q_{or},d_{j})={\sqrt[{p}]{\frac {w_{1}^{p}+w_{2}^{p}+....+w_{t}^{p}}{t}}}}

  • Una consulta disyuntiva generalizada viene dada por:
qanorted=k1pagk2pag....pagkt{\displaystyle q_{and}=k_{1}\land ^{p}k_{2}\land ^{p}....\land ^{p}k_{t}}
  • La similitud deqanorted{\displaystyle q_{y}}ydj{\displaystyle d_{j}}se puede definir como:
simetro(qanorted,dj)=1(1w1)pag+(1w2)pag+....+(1wt)pagtpag{\displaystyle sim(q_{and},d_{j})=1-{\sqrt[{p}]{\frac {(1-w_{1})^{p}+(1-w_{2})^{p}+....+(1-w_{t})^{p}}{t}}}}

Ejemplos

Consideremos la consulta q = ( K 1 K 2 ) K 3 . La similitud entre la consulta q y el documento d se puede calcular utilizando la fórmula:

simetro(q,d)=(1((1w1)pag+(1w2)pag2pag))pag+w3pag2pag{\displaystyle sim(q,d)={\sqrt[{p}]{\frac {(1-{\sqrt[{p}]{({\frac {(1-w_{1})^{p}+(1-w_{2})^{p}}{2}}}}))^{p}+w_{3}^{p}}{2}}}}

Mejoras respecto al modelo booleano estándar.

Lee y Fox [ 4 ] compararon los modelos booleanos estándar y extendido con tres colecciones de prueba: CISI, CACM e INSPEC . Utilizando normas P, obtuvieron una mejora promedio en la precisión del 79%, 106% y 210% con respecto al modelo estándar para las colecciones CISI, CACM e INSPEC, respectivamente. El modelo de norma P es computacionalmente costoso debido a la cantidad de operaciones de exponenciación que requiere, pero logra resultados mucho mejores que el modelo estándar e incluso que las técnicas de recuperación difusa . El modelo booleano estándar sigue siendo el más eficiente.

Lecturas adicionales

  • Choi, Jongpill; Kim, Minkoo; Raghavan, Vijay V. (marzo de 2006), "Método de retroalimentación de relevancia adaptativa de un modelo booleano extendido utilizando técnicas de agrupamiento jerárquico" , Information Processing & Management , 42 (2): 331–349 , doi : 10.1016/j.ipm.2005.05.009
  • Zanger, Daniel Z. (noviembre de 2002), "Interpolación del modelo de recuperación booleana extendido" , Information Processing & Management , 38 (6): 743–748 , doi : 10.1016/S0306-4573(02)00023-7
  • Fox, E.; Betrabet, S.; Koushik, M.; Lee, W. (1992), Recuperación de información: algoritmos y estructuras de datos; modelo booleano extendido , Prentice-Hall, Inc., archivado del original el 28 de septiembre de 2013 , consultado el 9 de septiembre de 2017.
  • Skorkovská, Lucie; Ircing, Pavel (2009), "Experimentos con la formulación automática de consultas en el modelo booleano extendido", Texto, habla y diálogo , Lecture Notes in Computer Science, vol.  5729, Springer Berlin / Heidelberg, pp. 371–378 , doi : 10.1007/978-3-642-04208-9_51 , hdl : 11025/16985 , ISBN  978-3-642-04207-2

Véase también

Referencias

  1. Salton, Gerard; Fox, Edward A.; Wu, Harry (1983), "Recuperación de información booleana extendida", Communications of the ACM , 26 (11), Communications of the ACM, Volumen 26, Número 11: 1022– 1036, doi : 10.1145/182.358466 , hdl : 1813/6351 , S2CID 207180535 
  2. "Lusheng Wang" . Archivado del original el 27 de septiembre de 2011. Consultado el 1 de diciembre de 2009 .
  3. Garcia, Dr. E., El modelo booleano extendido: consultas ponderadas: pesos de términos, consultas de norma p y tipos multiconceptuales. ¿Booleano o extendido? Y esa es la consulta.
  4. Lee, WC; Fox, EA (1988), Comparación experimental de esquemas para interpretar consultas booleanas (PDF)