Articulo de referencia

Retroalimentación sobre la relevancia

La retroalimentación de relevancia es una característica de algunos sistemas de recuperación de información y de recomendación . La idea detrás de la retroalimentación de releva...

La retroalimentación de relevancia es una característica de algunos sistemas de recuperación de información y de recomendación . La idea detrás de la retroalimentación de relevancia es tomar los resultados iniciales de una consulta, recopilar la opinión del usuario y usar la información sobre si esos resultados son relevantes o no para realizar una nueva consulta. Podemos distinguir tres tipos de retroalimentación: explícita, implícita y ciega o "pseudo".

Retroalimentación explícita

La retroalimentación explícita se obtiene de los evaluadores de relevancia, quienes indican la pertinencia de un documento recuperado para una consulta. Este tipo de retroalimentación se define como explícita solo cuando los evaluadores (u otros usuarios del sistema) saben que la retroalimentación proporcionada se interpreta como juicios de relevancia .

Los usuarios pueden indicar la relevancia explícitamente mediante un sistema de relevancia binaria o gradual . La retroalimentación de relevancia binaria indica si un documento es relevante o irrelevante para una consulta determinada. La retroalimentación de relevancia gradual indica la relevancia de un documento para una consulta en una escala que utiliza números, letras o descripciones (como "no relevante", "algo relevante", "relevante" o "muy relevante"). La relevancia gradual también puede adoptar la forma de una ordenación cardinal de documentos creada por un evaluador; es decir, el evaluador coloca los documentos de un conjunto de resultados en orden de relevancia (generalmente descendente). Un ejemplo de esto sería la función SearchWiki implementada por Google en su sitio web de búsqueda.

La información de retroalimentación sobre la relevancia debe interpolarse con la consulta original para mejorar el rendimiento de la recuperación, como por ejemplo el conocido algoritmo de Rocchio .

Una métrica de rendimiento que se popularizó alrededor de 2005 para medir la utilidad de un algoritmo de clasificación basado en la retroalimentación explícita de relevancia es la ganancia acumulativa descontada normalizada . Otras medidas incluyen la precisión en k y la precisión media promedio .

Retroalimentación implícita

La retroalimentación implícita se infiere del comportamiento del usuario, como observar qué documentos selecciona y cuáles no para visualizar, el tiempo que dedica a ver un documento o las acciones de navegación o desplazamiento de páginas. [ 1 ] [ 2 ] Existen muchas señales durante el proceso de búsqueda que se pueden utilizar para la retroalimentación implícita y los tipos de información que se deben proporcionar en respuesta. [ 3 ] [ 4 ]

Las diferencias clave entre la retroalimentación de relevancia implícita y la explícita incluyen: [ 5 ]

  1. El usuario no está evaluando la relevancia para el beneficio del sistema IR, sino que solo está satisfaciendo sus propias necesidades y
  2. El usuario no necesariamente es informado de que su comportamiento (documentos seleccionados) se utilizará como retroalimentación de relevancia.

Un ejemplo de esto es el tiempo de permanencia , que mide cuánto tiempo pasa un usuario viendo la página enlazada en un resultado de búsqueda. Es un indicador de hasta qué punto el resultado de búsqueda satisfizo la intención de consulta del usuario y se utiliza como mecanismo de retroalimentación para mejorar los resultados de búsqueda.

Retroalimentación de pseudo relevancia

La retroalimentación de relevancia pseudo, también conocida como retroalimentación de relevancia ciega, proporciona un método para el análisis local automático. Automatiza la parte manual de la retroalimentación de relevancia, de modo que el usuario obtiene un mejor rendimiento de recuperación sin una interacción prolongada. El método consiste en realizar una recuperación normal para encontrar un conjunto inicial de los documentos más relevantes, luego asumir que los "k" documentos mejor clasificados son relevantes y, finalmente, realizar la retroalimentación de relevancia como antes bajo esta suposición. El procedimiento es:

  1. Considere como resultados relevantes los resultados devueltos por la consulta inicial (solo los k mejores, donde k está entre 10 y 50 en la mayoría de los experimentos).
  2. Seleccione los 20-30 términos principales (número indicativo) de estos documentos utilizando, por ejemplo, ponderaciones tf-idf .
  3. Realizar la expansión de la consulta , agregar estos términos a la consulta y luego comparar los documentos devueltos con esta consulta y, finalmente, devolver los documentos más relevantes.

Algunos experimentos, como los resultados del sistema SMART de Cornell publicados en (Buckley et al., 1995), muestran una mejora en el rendimiento de los sistemas de recuperación utilizando retroalimentación de pseudorrelevancia en el contexto de los experimentos TREC 4.

Esta técnica automática funciona en la mayoría de los casos. La evidencia sugiere que tiende a funcionar mejor que el análisis global. [ 6 ] Mediante una expansión de la consulta, se pueden recuperar algunos documentos relevantes que se omitieron en la ronda inicial para mejorar el rendimiento general. Claramente, el efecto de este método depende en gran medida de la calidad de los términos de expansión seleccionados. Se ha encontrado que mejora el rendimiento en la tarea ad hoc TREC . Pero no está exenta de los peligros de un proceso automático. Por ejemplo, si la consulta es sobre minas de cobre y los primeros documentos son todos sobre minas en Chile, entonces puede haber una desviación de la consulta hacia documentos sobre Chile. Además, si las palabras agregadas a la consulta original no están relacionadas con el tema de la consulta, es probable que la calidad de la recuperación se degrade, especialmente en la búsqueda web, donde los documentos web a menudo cubren múltiples temas diferentes. Para mejorar la calidad de las palabras de expansión en la retroalimentación de pseudorrelevancia, se ha propuesto una retroalimentación de relevancia posicional para seleccionar de los documentos de retroalimentación aquellas palabras que se centran en el tema de la consulta según las posiciones de las palabras en los documentos de retroalimentación. [ 7 ] Específicamente, el modelo de relevancia posicional asigna más peso a las palabras que aparecen más cerca de las palabras de consulta basándose en la intuición de que las palabras más cercanas a las palabras de consulta tienen más probabilidades de estar relacionadas con el tema de la consulta.

La retroalimentación anónima automatiza la parte manual de la retroalimentación sobre la relevancia y tiene la ventaja de que no se requieren evaluadores.

Utilizando información relevante

La información de relevancia se utiliza empleando el contenido de los documentos pertinentes para ajustar la ponderación de los términos en la consulta original o para añadir palabras a la misma. La retroalimentación de relevancia se suele implementar mediante el algoritmo de Rocchio .

Referencias

  1. Jannach, Dietmar; Lerche, Lukas; Zanker, Markus (2018), "Recomendaciones basadas en retroalimentación implícita" , en Brusilovsky, Peter; He, Daqing (eds.), Acceso a la información social: sistemas y tecnologías , Cham: Springer International Publishing, pp. 510–569 , doi : 10.1007/978-3-319-90092-6_14 , ISBN  978-3-319-90092-6, consultado el 20 de mayo de 2025
  2. "Copia archivada" (PDF) . www.scils.rutgers.edu . Archivado del original (PDF) el 16 de marzo de 2004. Consultado el 12 de enero de 2022 .{{cite web}}: CS1 mantenimiento: copia archivada como título ( enlace )
  3. Jansen, BJ y McNeese, MD 2005. Evaluación de la efectividad y los patrones de interacción con la asistencia automatizada en sistemas de recuperación de información . Journal of the American Society for Information Science and Technology. 56(14), 1480-1503
  4. Kelly, Diane y Jaime Teevan. « Retroalimentación implícita para inferir las preferencias del usuario: una bibliografía ». ACM SIGIR Forum. Vol. 37. Núm. 2. ACM, 2003.
  5. "Copia archivada" (PDF) . haystack.lcs.mit.edu . Archivado del original (PDF) el 11 de junio de 2007 . Recuperado el 12 de enero de 2022 .{{cite web}}: CS1 mantenimiento: copia archivada como título ( enlace )
  6. Jinxi Xu y W. Bruce Croft, Expansión de consultas mediante análisis de documentos locales y globales , en Actas de la 19.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información (SIGIR), 1996.
  7. Yuanhua Lv y ChengXiang Zhai, Modelo de relevancia posicional para retroalimentación de pseudorrelevancia , en Actas de la 33.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información (SIGIR), 2010.

Lecturas adicionales

  • Notas de clase sobre retroalimentación de relevancia - Notas de clase de Jimmy Lin, adaptadas de las de Doug Oard.
  • Archivado el 16 de julio de 2007 en Wayback Machine - capítulo de Recuperación moderna de información
  • Stefan Büttcher, Charles LA Clarke y Gordon V. Cormack. Recuperación de información: implementación y evaluación de motores de búsqueda . Archivado el 5 de octubre de 2020 en Wayback Machine . MIT Press, Cambridge, Massachusetts, 2010.