En la ciencia de la información y la recuperación de información , la relevancia indica hasta qué punto un documento o conjunto de documentos recuperados satisface la necesidad de información del usuario. La relevancia puede incluir aspectos como la actualidad, la autoridad o la novedad del resultado.
Historia
La preocupación por el problema de encontrar información relevante se remonta al menos a la primera publicación de revistas científicas en el siglo XVII.
El estudio formal de la relevancia comenzó en el siglo XX con el estudio de lo que más tarde se denominaría bibliometría . En las décadas de 1930 y 1940, S. C. Bradford utilizó el término «relevante» para caracterizar los artículos relevantes para un tema (véase la ley de Bradford ). En la década de 1950, surgieron los primeros sistemas de recuperación de información, y los investigadores señalaron la recuperación de artículos irrelevantes como una preocupación importante. En 1958, B. C. Vickery explicitó el concepto de relevancia en un discurso pronunciado en la Conferencia Internacional sobre Información Científica. [ 1 ]
Desde 1958, los científicos de la información han explorado y debatido definiciones de relevancia. Un enfoque particular del debate fue la distinción entre "relevancia para un tema" o "relevancia temática" y "relevancia para el usuario". [ 1 ]
Evaluación
La comunidad de recuperación de información ha enfatizado el uso de colecciones de prueba y tareas de referencia para medir la relevancia temática, comenzando con los Experimentos de Cranfield de principios de la década de 1960 y culminando en las evaluaciones TREC que continúan hasta el día de hoy como el principal marco de evaluación para la investigación en recuperación de información. [ 2 ]
Para evaluar la eficacia de un sistema de recuperación de información al obtener resultados temáticamente relevantes, es necesario cuantificar la relevancia de dichos resultados. En las evaluaciones al estilo Cranfield , esto generalmente implica asignar un nivel de relevancia a cada resultado recuperado, un proceso conocido como evaluación de relevancia . Los niveles de relevancia pueden ser binarios (indicando si un resultado es relevante o no) o graduales (indicando que los resultados presentan distintos grados de coincidencia entre el tema del resultado y la necesidad de información). Una vez asignados los niveles de relevancia a los resultados recuperados, se pueden utilizar medidas de rendimiento de la recuperación de información para evaluar la calidad de la salida del sistema.
En contraste con este enfoque exclusivamente en la relevancia temática, la comunidad de la ciencia de la información ha enfatizado los estudios de usuarios que consideran la relevancia del usuario. [ 3 ] Estos estudios a menudo se centran en aspectos de la interacción humano-computadora (véase también recuperación de información humano-computadora ).
Agrupación y relevancia
La hipótesis del clúster , propuesta por C.J. van Rijsbergen en 1979, afirma que dos documentos similares entre sí tienen una alta probabilidad de ser relevantes para la misma necesidad de información. Con respecto al espacio de similitud de incrustación, la hipótesis del clúster puede interpretarse de forma global o local. [ 4 ] La interpretación global supone que existe un conjunto fijo de temas subyacentes derivados de la similitud entre documentos. Estos clústeres globales o sus representantes pueden utilizarse para relacionar la relevancia de dos documentos (por ejemplo, dos documentos del mismo clúster deberían ser relevantes para la misma solicitud). Los métodos en este sentido incluyen:
- recuperación de información basada en clústeres [ 5 ] [ 6 ]
- expansión de documentos basada en clústeres como el análisis semántico latente o sus equivalentes de modelado de lenguaje . [ 7 ] Es importante asegurar que los clústeres, ya sea de forma aislada o combinada, modelen con éxito el conjunto de posibles documentos relevantes.
Una segunda interpretación, propuesta principalmente por Ellen Voorhees [ 8 ] , se centra en las relaciones locales entre documentos. Esta interpretación local evita tener que modelar el número o el tamaño de los grupos en la colección y permite la relevancia a múltiples escalas. Entre los métodos que siguen este enfoque se incluyen:
- recuperación de clústeres múltiples [ 6 ] [ 8 ]
- métodos de activación propagada [ 9 ] y propagación de relevancia [ 10 ]
- expansión de documentos locales [ 11 ]
- regularización de puntuación [ 12 ]
Los métodos locales requieren una medida de similitud de documentos precisa y adecuada .
Problemas y alternativas
Los documentos más relevantes no son necesariamente los más útiles para mostrar en la primera página de los resultados de búsqueda. Por ejemplo, dos documentos duplicados podrían considerarse individualmente bastante relevantes, pero solo sería útil mostrar uno de ellos. Para abordar esta deficiencia, se ha propuesto una medida denominada "relevancia marginal máxima" (MMR, por sus siglas en inglés). Esta considera la relevancia de cada documento únicamente en función de la cantidad de información nueva que aporta con respecto a los resultados anteriores. [ 13 ]
En algunos casos, una consulta puede tener una interpretación ambigua o una variedad de respuestas potenciales. Ofrecer una diversidad de resultados puede ser un factor a considerar al evaluar la utilidad de un conjunto de resultados . [ 14 ]
Véase también
Referencias
- 1 2 Mizzaro, Stefano (1997). "Relevancia: toda la historia" (PDF) . Journal of the American Society for Information Science . 48 (9): 810– 832. doi : 10.1002/(SICI)1097-4571(199709)48:9 < 810::AID-ASI6 > 3.0.CO ; 2-U .
- ↑ Sanderson, P. Clough, M. (2013-06-15). "Evaluación del rendimiento de los sistemas de recuperación de información mediante colecciones de prueba" . informationr.net . Recuperado el 28 de mayo de 2020 .
{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Yunjie, Xu (2006). "Juicio de relevancia: ¿Qué consideran los usuarios de la información más allá de la actualidad?" . Journal of the American Society for Information Science and Technology . 57 (7): 961– 973. doi : 10.1002/asi.20361 .
- ↑ F. Diaz, Autocorrelación y regularización de puntuaciones de recuperación basadas en consultas . Tesis doctoral, Universidad de Massachusetts Amherst, Amherst, MA, febrero de 2008, Capítulo 3.
- ↑ Croft, W. Bruce (1980). "Un modelo de búsqueda de clústeres basado en la clasificación". Information Systems . 5 (3): 189– 195. doi : 10.1016/0306-4379(80)90010-1 .
- 1 2 Griffiths, Alan; Luckhurst, H. Claire; Willett, Peter (1986). "Uso de información de similitud entre documentos en sistemas de recuperación de documentos" (PDF) . Journal of the American Society for Information Science . 37 : 3–11 . doi : 10.1002/(SICI)1097-4571(198601)37:1 < 3::AID-ASI1 > 3.0.CO ; 2-O .
- ↑ X. Liu y WB Croft, “ Recuperación basada en clústeres utilizando modelos de lenguaje ”, en SIGIR '04: Actas de la 27.ª conferencia internacional anual sobre investigación y desarrollo en recuperación de información, (Nueva York, NY, EE. UU.), págs. 186–193, ACM Press, 2004.
- 1 2 E. M. Voorhees , “La hipótesis del clúster revisitada”, en SIGIR '85: Actas de la octava conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información, (Nueva York, NY, EE. UU.), págs. 188–196, ACM Press, 1985.
- ↑ S. Preece, Un modelo de red de activación propagada para la recuperación de información. Tesis doctoral, Universidad de Illinois, Urbana-Champaign, 1981.
- ↑ T. Qin, T.-Y. Liu, X.-D. Zhang, Z. Chen y W.-Y. Ma, “ Un estudio de la propagación de relevancia para la búsqueda web ”, en SIGIR '05: Actas de la 28.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información, (Nueva York, NY, EE. UU.), págs. 408–415, ACM Press, 2005.
- ↑ A. Singhal y F. Pereira, “ Expansión de documentos para recuperación de voz ”, en SIGIR '99: Actas de la 22.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información, (Nueva York, NY, EE. UU.), págs. 34–41, ACM Press, 1999.
- ↑ Qin, Tao; Liu, Tie-Yan; Zhang, Xu-Dong; Chen, Zheng; Ma, Wei-Ying (2005). "Un estudio de la propagación de la relevancia para la búsqueda web" (PDF) . Actas de la 28.ª Conferencia Internacional Anual ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . pág. 408. doi : 10.1145/1076034.1076105 . ISBN 1595930345. S2CID 15310025 .
- ↑ Carbonell, Jaime; Goldstein, Jade (1998). «El uso de MMR, reclasificación basada en la diversidad para reordenar documentos y producir resúmenes». Actas de la 21.ª Conferencia Internacional Anual ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . págs. 335–336 . CiteSeerX 10.1.1.50.2490 . doi : 10.1145/290941.291025 . ISBN 978-1581130157. S2CID 6334682 .
- ↑ "Diversidad en la recuperación de documentos (DDR) 2012" .
Lecturas adicionales
- Hjørland, Birger (2010). "Los fundamentos del concepto de relevancia" (PDF) . Revista de la Sociedad Estadounidense de Ciencia y Tecnología de la Información . 61 (2): 217– 237. doi : 10.1002/asi.21261 .
- Relevancia : comunicación y cognición. Por Dan Sperber; Deirdre Wilson. 2.ª ed. Oxford; Cambridge, MA: Blackwell Publishers, 2001. ISBN 978-0-631-19878-9
- Saracevic, Tefko (1975). "RELEVANCIA: Una revisión y un marco para el pensamiento sobre la noción en la ciencia de la información" (PDF) . Journal of the American Society for Information Science . 26 (6): 321– 343. doi : 10.1002/asi.4630260604 .
- Saracevic, Tefko (2007). «Relevancia: Una revisión de la literatura y un marco para reflexionar sobre el concepto en la ciencia de la información. Parte II: Naturaleza y manifestaciones de la relevancia» (PDF) . Journal of the American Society for Information Science and Technology . 58 (13): 1915–1933 . doi : 10.1002/asi.20682 . Archivado del original (PDF) el 21 de febrero de 2008.
- Saracevic, Tefko (2007). «Relevancia: Una revisión de la literatura y un marco para reflexionar sobre el concepto en la ciencia de la información. Parte III: Comportamiento y efectos de la relevancia» (PDF) . Journal of the American Society for Information Science and Technology . 58 (13): 2126– 2144. doi : 10.1002/asi.20681 . Archivado del original (PDF) el 21 de febrero de 2008.
- Saracevic, T. (2007). Relevancia en la ciencia de la información. Conferencia anual en memoria de Lazerow de Thomson Scientific, impartida por invitación en la Escuela de Ciencias de la Información de la Universidad de Tennessee. 19 de septiembre de 2007. ( Vídeo archivado el 17 de febrero de 2010 en Wayback Machine ).
- Introducción a la recuperación de información: evaluación. Stanford. ( Presentación en PDF )
- evaluación de la recuperación de información