Articulo de referencia

Medidas de evaluación (recuperación de información)

Las medidas de evaluación de un sistema de recuperación de información (RI) miden la eficacia con la que un índice, motor de búsqueda o base de datos devuelve resultados de un c...

Las medidas de evaluación de un sistema de recuperación de información (RI) miden la eficacia con la que un índice, motor de búsqueda o base de datos devuelve resultados de un conjunto de recursos que satisfacen la consulta del usuario. Por lo tanto, son fundamentales para el éxito de los sistemas de información y las plataformas digitales.

El factor más importante para determinar la efectividad de un sistema para los usuarios es la relevancia general de los resultados recuperados en respuesta a una consulta. [ 1 ] El éxito de un sistema de recuperación de información puede juzgarse mediante una variedad de criterios que incluyen relevancia, velocidad, satisfacción del usuario, usabilidad, eficiencia y confiabilidad. [ 2 ] Las medidas de evaluación pueden categorizarse de varias maneras, incluyendo fuera de línea o en línea, basadas en el usuario o en el sistema, e incluyen métodos como el comportamiento observado del usuario, colecciones de prueba, precisión y exhaustividad, y puntuaciones de conjuntos de prueba de referencia preparados.

La evaluación de un sistema de recuperación de información también debe incluir una validación de las medidas utilizadas, es decir, una evaluación de qué tan bien miden lo que se pretende medir y qué tan bien se ajusta el sistema a su caso de uso previsto. [ 3 ] Las medidas se utilizan generalmente en dos entornos: experimentación en línea, que evalúa las interacciones de los usuarios con el sistema de búsqueda, y evaluación fuera de línea, que mide la efectividad de un sistema de recuperación de información en una colección estática fuera de línea.

Fondo

Los métodos de indexación y clasificación para facilitar la recuperación de información tienen una larga historia que se remonta a las primeras bibliotecas y colecciones. La evaluación sistemática de su eficacia comenzó en serio en la década de 1950 con la rápida expansión de la producción de investigación en los ámbitos militar, gubernamental y educativo, y la introducción de catálogos informatizados. En ese momento, existían varios sistemas de indexación, clasificación y catalogación en funcionamiento, cuya producción era costosa, y no estaba claro cuál era el más eficaz. [ 4 ]

Cyril Cleverdon , bibliotecario del Colegio de Aeronáutica de Cranfield, Inglaterra, inició una serie de experimentos sobre métodos de indexación y recuperación de documentos impresos, conocidos como el paradigma de Cranfield o pruebas de Cranfield, que establecieron el estándar para las medidas de evaluación de los sistemas de recuperación de información durante muchos años. [ 4 ] Cleverdon desarrolló una prueba denominada «búsqueda de elementos conocidos» para comprobar si un sistema de recuperación de información devolvía los documentos que se sabía que eran relevantes o correctos para una búsqueda determinada. Los experimentos de Cleverdon establecieron una serie de aspectos clave necesarios para la evaluación de los sistemas de recuperación de información: una colección de prueba, un conjunto de consultas y un conjunto de elementos relevantes predeterminados que, combinados, determinarían la precisión y la exhaustividad.

El enfoque de Cleverdon sentó las bases para la exitosa serie de conferencias sobre recuperación de texto que comenzó en 1992.

Aplicaciones

La evaluación de los sistemas de recuperación de información (RI) es fundamental para el éxito de cualquier motor de búsqueda, incluyendo la búsqueda en internet, la búsqueda en sitios web, las bases de datos y los catálogos de bibliotecas. Las medidas de evaluación se utilizan en estudios sobre el comportamiento de la información , pruebas de usabilidad , costos empresariales y evaluaciones de eficiencia. Medir la efectividad de los sistemas de RI ha sido el enfoque principal de la investigación en RI, basándose en colecciones de prueba combinadas con medidas de evaluación. [ 5 ] Se han establecido varias conferencias académicas que se centran específicamente en medidas de evaluación, incluyendo la Conferencia de Recuperación de Texto (TREC), la Conferencia y Laboratorios del Foro de Evaluación (CLEF) y NTCIR.

Medidas en línea

Las métricas online generalmente se crean a partir de los registros de búsqueda. Estas métricas se utilizan a menudo para determinar el éxito de una prueba A/B .

Tasa de abandono de sesión

La tasa de abandono de sesión es la proporción de sesiones de búsqueda que no resultan en un clic.

Tasa de clics

La tasa de clics (CTR) es la proporción de usuarios que hacen clic en un enlace específico con respecto al número total de usuarios que ven una página, correo electrónico o anuncio. Se utiliza comúnmente para medir el éxito de una campaña publicitaria en línea para un sitio web en particular, así como la efectividad de las campañas de correo electrónico. [ 6 ]

Tasa de éxito de la sesión

La tasa de éxito de sesión mide la proporción de sesiones de usuario que resultan en un éxito. La definición de "éxito" suele depender del contexto, pero en el caso de las búsquedas, un resultado exitoso se suele medir utilizando el tiempo de permanencia como factor principal, junto con la interacción secundaria del usuario. Por ejemplo, se considera un resultado exitoso que el usuario copie la URL del resultado, al igual que copiar y pegar desde el fragmento.

Tasa de resultados cero

La tasa de resultados cero ( ZRR , por sus siglas en inglés) es la proporción de páginas de resultados de búsqueda (SERP, por sus siglas en inglés) que no arrojan ningún resultado. Esta métrica indica un problema de recuperación de información o que la información buscada no se encuentra en el índice.

Métricas fuera de línea

Las métricas offline generalmente se crean a partir de sesiones de evaluación de relevancia donde los jueces califican la calidad de los resultados de búsqueda. Se pueden usar escalas binarias (relevante/no relevante) y multinivel (por ejemplo, relevancia de 0 a 5) para calificar cada documento devuelto en respuesta a una consulta. En la práctica, las consultas pueden estar mal planteadas y puede haber diferentes matices de relevancia. Por ejemplo, existe ambigüedad en la consulta "mars": el juez no sabe si el usuario está buscando el planeta Marte , la barra de chocolate Mars , el cantante Bruno Mars o la deidad romana Marte .

Precisión

La precisión es la fracción de los documentos recuperados que son relevantes para la necesidad de información del usuario.

precisión=|{documentos pertinentes}{documentos recuperados}||{documentos recuperados}|{\displaystyle {\mbox{precisión}}={\frac {|\{{\mbox{documentos relevantes}}\}\cap \{{\mbox{documentos recuperados}}\}|}{|\{{\mbox{documentos recuperados}}\}|}}}

En la clasificación binaria , la precisión es análoga al valor predictivo positivo . La precisión tiene en cuenta todos los documentos recuperados. También se puede evaluar considerando solo los mejores resultados devueltos por el sistema usando Precision@k .

Cabe señalar que el significado y el uso de "precisión" en el campo de la recuperación de información difieren de la definición de exactitud y precisión en otras ramas de la ciencia y la estadística .

Recordar

La tasa de recuperación es la fracción de documentos relevantes para la consulta que se recuperan correctamente.

recordar=|{documentos pertinentes}{documentos recuperados}||{documentos pertinentes}|{\displaystyle {\mbox{recall}}={\frac {|\{{\mbox{documentos relevantes}}\}\cap \{{\mbox{documentos recuperados}}\}|}{|\{{\mbox{documentos relevantes}}\}|}}}

En la clasificación binaria, la exhaustividad se suele denominar sensibilidad . Por lo tanto, puede considerarse como la probabilidad de que la consulta recupere un documento relevante .

Es muy sencillo lograr una exhaustividad del 100% devolviendo todos los documentos en respuesta a cualquier consulta. Por lo tanto, la exhaustividad por sí sola no es suficiente, sino que también es necesario medir la cantidad de documentos irrelevantes, por ejemplo, calculando la precisión.

Polvillo radiactivo

La proporción de documentos irrelevantes que se recuperan, respecto del total de documentos irrelevantes disponibles:

polvillo radiactivo=|{documentos no relevantes}{documentos recuperados}||{documentos no relevantes}|{\displaystyle {\mbox{fall-out}}={\frac {|\{{\mbox{documentos no relevantes}}\}\cap \{{\mbox{documentos recuperados}}\}|}{|\{{\mbox{documentos no relevantes}}\}|}}}

En la clasificación binaria, la caída es lo opuesto a la especificidad y es igual a(1especificidad){\displaystyle (1-{\mbox{especificidad}})}. Puede considerarse como la probabilidad de que la consulta recupere un documento irrelevante .

Es trivial lograr una tasa de abandono del 0% devolviendo cero documentos en respuesta a cualquier consulta.

Puntuación F / Medida F

La media armónica ponderada de precisión y exhaustividad, la medida F tradicional o puntuación F equilibrada, es:

F=2pagrmidoisionortermidoall(pagrmidoisionorte+rmidoall){\displaystyle F={\frac {2\cdot \mathrm {precisión} \cdot \mathrm {recall} }{(\mathrm {precisión} +\mathrm {recall} )}}}

Esto también se conoce como elF1{\displaystyle F_{1}}medida, porque la exhaustividad y la precisión tienen el mismo peso.

La fórmula general para números reales no negativosβ{\displaystyle \beta }es:

Fβ=(1+β2)(pagrmidoisionortermidoall)(β2pagrmidoisionorte+rmidoall){\displaystyle F_{\beta }={\frac {(1+\beta ^{2})\cdot (\mathrm {precision} \cdot \mathrm {recall} )}{(\beta ^{2}\cdot \mathrm {precision} +\mathrm {recall} )}}\,}

Otras dos medidas F de uso común son laF2{\displaystyle F_{2}}medida, que pondera el recuerdo el doble que la precisión, y laF0,5{\displaystyle F_{0.5}}medida que otorga a la precisión el doble de peso que a la exhaustividad.

La medida F fue derivada por van Rijsbergen (1979) de modo queFβ{\displaystyle F_{\beta }}"mide la efectividad de la recuperación con respecto a un usuario que adjuntaβ{\displaystyle \beta }"Tanta importancia para recordar como para la precisión". Se basa en la medida de efectividad de van Rijsbergen.mi=11αPAG+1αR{\displaystyle E=1-{\frac {1}{{\frac {\alpha }{P}}+{\frac {1-\alpha }{R}}}}}Su relación es:

Fβ=1mi{\displaystyle F_{\beta }=1-E}dóndeα=11+β2{\displaystyle \alpha ={\frac {1}{1+\beta ^{2}}}}

Dado que la medida F combina información tanto de la precisión como de la exhaustividad, es una forma de representar el rendimiento general sin presentar dos números.

Precisión media

La precisión y la exhaustividad son métricas de valor único basadas en la lista completa de documentos devueltos por el sistema. Para sistemas que devuelven una secuencia clasificada de documentos, es deseable considerar también el orden en que se presentan los documentos devueltos. Al calcular la precisión y la exhaustividad en cada posición de la secuencia clasificada de documentos, se puede trazar una curva de precisión-exhaustividad, trazando la precisiónpag(r){\displaystyle p(r)}en función de la capacidad de recordarr{\displaystyle r}. La precisión promedio calcula el valor promedio depag(r){\displaystyle p(r)}durante el intervalo desder=0{\displaystyle r=0}ar=1{\displaystyle r=1}: [ 7 ]

PromedioP=01pag(r)dr{\displaystyle \operatorname {AveP} =\int _{0}^{1}p(r)dr}

Esa es el área bajo la curva de precisión-exhaustividad. En la práctica, esta integral se reemplaza por una suma finita sobre cada posición en la secuencia clasificada de documentos:

PromedioP=k=1nortePAG(k)Δr(k){\displaystyle \operatorname {AveP} =\sum _{k=1}^{n}P(k)\Delta r(k)}

dóndek{\displaystyle k}es el rango en la secuencia de documentos recuperados,norte{\displaystyle n}es el número de documentos recuperados,PAG(k){\displaystyle P(k)}es la precisión en el punto de cortek{\displaystyle k}en la lista, yΔr(k){\displaystyle \Delta r(k)}es el cambio en el recuerdo de los elementosk1{\displaystyle k-1}ak{\displaystyle k}. [ 7 ]

Esta suma finita es equivalente a:

PromedioP=k=1nortePAG(k)×rel(k)número total de documentos relevantes{\displaystyle \operatorname {AveP} ={\frac {\sum _{k=1}^{n}P(k)\times \operatorname {rel} (k)}{\mbox{total number of relevant documents}}}\!}

dónderel(k){\displaystyle \operatorname {rel} (k)}es una función indicadora que es igual a 1 si el elemento en el rangok{\displaystyle k}es un documento relevante, cero en caso contrario. [ 8 ] Tenga en cuenta que el promedio se calcula sobre los documentos relevantes en los k documentos recuperados principales y los documentos relevantes no recuperados obtienen una puntuación de precisión de cero.

Algunos autores optan por interpolar elpag(r){\displaystyle p(r)}función para reducir el impacto de las "oscilaciones" en la curva. [ 9 ] [ 10 ] Por ejemplo, el desafío PASCAL Visual Object Classes (un punto de referencia para la detección de objetos en visión artificial) hasta 2010 [ 11 ] calculaba la precisión promedio promediando la precisión sobre un conjunto de niveles de recuperación espaciados uniformemente {0, 0.1, 0.2, ... 1.0}: [ 9 ] [ 10 ]

PromedioP=111r{0,0.1,,1.0}paginterpretación(r){\displaystyle \operatorname {AveP} ={\frac {1}{11}}\sum _{r\in \{0,0.1,\ldots ,1.0\}}p_{\operatorname {interp} }(r)}

dóndepaginterpretación(r){\displaystyle p_{\operatorname {interp} }(r)}es una precisión interpolada que toma la precisión máxima sobre todos los valores de recuperación mayores quer{\displaystyle r}:

paginterpretación(r)=máximor~:r~rpag(r~){\displaystyle p_{\operatorname {interp} }(r)=\operatorname {max} _{{\tilde {r}}:{\tilde {r}}\geq r}p({\tilde {r}})}.

Una alternativa es derivar una analíticapag(r){\displaystyle p(r)}La función se obtiene asumiendo una distribución paramétrica particular para los valores de decisión subyacentes. Por ejemplo, una curva de precisión-exhaustividad binormal se puede obtener asumiendo que los valores de decisión en ambas clases siguen una distribución gaussiana. [ 12 ]

El valor mínimo de Promedio de Promedio (AveP) alcanzable para una tarea de clasificación determinada viene dado por:

1nortepagosk=1nortepagoskk+nortenortemigramo{\displaystyle {\frac {1}{n_{pos}}}\sum _{k=1}^{n_{pos}}{\frac {k}{k+n_{neg}}}}[ 13 ]

Precisión en k

For modern (web-scale) information retrieval, recall is no longer a meaningful metric, as many queries have thousands of relevant documents, and few users will be interested in reading all of them. Precision at k documents (P@k) is still a useful metric (e.g., P@10 or "Precision at 10" corresponds to the number of relevant results among the top 10 retrieved documents), but fails to take into account the positions of the relevant documents among the top k.[14] Another shortcoming is that on a query with fewer relevant results than k, even a perfect system will have a score less than 1.[15] It is easier to score manually since only the top k results need to be examined to determine if they are relevant or not.

R-precision

R-precision requires knowing all documents that are relevant to a query. The number of relevant documents, R{\displaystyle R}, is used as the cutoff for calculation, and this varies from query to query. For example, if there are 15 documents relevant to "red" in a corpus (R=15), R-precision for "red" looks at the top 15 documents returned, counts the number that are relevant, r{\displaystyle r}, and turns that into a relevance fraction: r/R=r/15{\displaystyle r/R=r/15}.[16]

Note that the R-Precision is equivalent to both the precision at the R{\displaystyle R}-th position (P@R{\displaystyle R}) and the recall at the R{\displaystyle R}-th position.[15]

Empirically, this measure is often highly correlated to mean average precision.[15]

Mean average precision

Mean average precision (MAP) for a set of queries is the mean of the average precision scores for each query.

MAP=q=1QAveP(q)Q{\displaystyle \operatorname {MAP} ={\frac {\sum _{q=1}^{Q}\operatorname {AveP(q)} }{Q}}\!}

where Q is the number of queries.

Discounted cumulative gain

DCG uses a graded relevance scale of documents from the result set to evaluate the usefulness, or gain, of a document based on its position in the result list. The premise of DCG is that highly relevant documents appearing lower in a search result list should be penalized as the graded relevance value is reduced logarithmically proportional to the position of the result.[17]

The DCG accumulated at a particular rank position p{\displaystyle p} is defined as:

DCGp=i=1prelilog2(i+1).{\displaystyle \mathrm {DCG_{p}} =\sum _{i=1}^{p}{\frac {rel_{i}}{\log _{2}(i+1)}}.}

Since result set may vary in size among different queries or systems, to compare performances the normalised version of DCG uses an ideal DCG. To this end, it sorts documents of a result list by relevance, producing an ideal DCG at position p (IDCGp{\displaystyle IDCG_{p}}), which normalizes the score:

nDCGp=DCGpIDCGp.{\displaystyle \mathrm {nDCG_{p}} ={\frac {DCG_{p}}{IDCG{p}}}.}

The nDCG values for all queries can be averaged to obtain a measure of the average performance of a ranking algorithm. Note that in a perfect ranking algorithm, the DCGp{\displaystyle DCG_{p}} will be the same as the IDCGp{\displaystyle IDCG_{p}}produciendo un nDCG de 1,0. Todos los cálculos de nDCG son entonces valores relativos en el intervalo de 0,0 a 1,0 y, por lo tanto, son comparables entre consultas. [ 18 ]

Otras medidas

Visualización

Las visualizaciones del rendimiento de la recuperación de información incluyen:

Medidas de no relevancia

Consultas por tiempo

Medir la cantidad de consultas realizadas en el sistema de búsqueda por (mes/día/hora/minuto/segundo) permite monitorizar su utilización. Puede usarse para diagnósticos, para detectar picos inesperados en las consultas, o simplemente como referencia para comparar con otras métricas, como la latencia de las consultas. Por ejemplo, un pico en el tráfico de consultas puede explicar un pico en la latencia de las mismas.

Véase también

Referencias

  1. Carterette, Ben; Voorhees, Ellen M. (2011), "Overview of Information Retrieval Evaluation" , en Lupu, Mihai; Mayer, Katja; Tait, John; Trippe, Anthony J. (eds.), Current Challenges in Patent Information Retrieval , Berlín, Heidelberg: Springer, pp. 69–85 , doi : 10.1007/978-3-642-19231-9_3 , ISBN  978-3-642-19231-9, consultado el 9 de diciembre de 2022
  2. Clough, P.; Sanderson, M. (15 de junio de 2013). "Evaluación del rendimiento de los sistemas de recuperación de información mediante colecciones de prueba" . Information Research . Recuperado el 9 de diciembre de 2022 .
  3. Karlgren, Jussi (2019). "Adopción de puntos de referencia de evaluación sistemática en entornos operativos" (PDF) . Recuperación de información en un mundo cambiante . Recuperado el 27 de junio de 2022 .
  4. 1 2 Harman, Donna (2011). Evaluación de la recuperación de información . Conferencias de síntesis sobre conceptos, recuperación y servicios de información. Cham, Suiza: Springer. doi : 10.1007/978-3-031-02276-0 . ISBN 978-3-031-02276-0. S2CID 207318946 . 
  5. Sanderson, Mark (2010). "Evaluación de sistemas de recuperación de información basada en la recopilación de pruebas" . Foundations and Trends in Information Retrieval . 4 (4): 247– 375. doi : 10.1561/1500000009 . ISSN 1554-0669 . 
  6. Diccionario de la Asociación Americana de Marketing .Recuperado el 2 de noviembre de 2012. El Consejo de Normas de Responsabilidad de Marketing (MASB) respalda esta definición como parte de su proyecto continuo de Lenguaje Común en Marketing. Archivado el 5 de abril de 2019 en Wayback Machine .
  7. 1 2 Zhu, Mu (2004). "Recall, Precision and Average Precision" (PDF) . Archivado del original (PDF) el 4 de mayo de 2011.{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  8. Turpin, Andrew; Scholer, Falk (2006). "Rendimiento del usuario frente a medidas de precisión para tareas de búsqueda simples" . Actas de la 29.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información . Nueva York, NY: ACM. págs. 11-18 . CiteSeerX 10.1.1.533.4100 . doi : 10.1145/1148170.1148176 . ISBN   978-1-59593-369-0. S2CID 9810253 . 
  9. 1 2 Everingham, Mark; Van Gool, Luc; Williams, Christopher KI; Winn, John; Zisserman, Andrew (junio de 2010). "El desafío PASCAL Visual Object Classes (VOC)" (PDF) . International Journal of Computer Vision . 88 (2): 303–338 . doi : 10.1007/s11263-009-0275-4 . hdl : 20.500.11820/88a29de3-6220-442b-ab2d-284210cf72d6 . S2CID 4246903. Archivado del original (PDF) el 20 de noviembre de 2011. Recuperado el 29 de agosto de 2011 . 
  10. ^ Manning , Christopher D.; Raghavan, Prabhakar; Schütze, Hinrich (2008). Introducción a la recuperación de información . Prensa de la Universidad de Cambridge.
  11. "Kit de desarrollo del desafío PASCAL Visual Object Classes 2012 (VOC2012)" . host.robots.ox.ac.uk . Consultado el 23 de marzo de 2019 .
  12. KH Brodersen, CS Ong, KE Stephan, JM Buhmann (2010). La suposición binormal en las curvas de precisión-exhaustividad. Archivado el 8 de diciembre de 2012 en Wayback Machine . Actas de la 20.ª Conferencia Internacional sobre Reconocimiento de Patrones , 4263-4266.
  13. Boyd, K., Davis, J., Page, D., & Costa, VS (2012). Región inalcanzable en el espacio precisión-exhaustividad y su efecto en la evaluación empírica. Actas de la ... Conferencia Internacional sobre Aprendizaje Automático. Conferencia Internacional sobre Aprendizaje Automático, 2012, 349.
  14. Kalervo, Järvelin (2017). "Métodos de evaluación de IR para recuperar documentos altamente relevantes" (PDF) . ACM SIGIR Forum . 51, 2 : 243–250 .
  15. ^ Christopher D. Manning ; Prabhakar Raghavan y Hinrich Schütze (2009). «Capítulo 8: Evaluación en la recuperación de información» (PDF) . Consultado el 14 de junio de 2015 . Parte de la Introducción a la Recuperación de Información
  16. 1 2 3 4 5 "Medidas de evaluación comunes" (PDF) . Archivado del original (PDF) el 16 de septiembre de 2008.
  17. Järvelin, Kalervo; Kekäläinen, Jaana (2000). "Métodos de evaluación de IR para la recuperación de documentos de gran relevancia" . SIGIR . ACM: 41– 48. doi : 10.1145/345508.345545 . ISBN 978-1-58113-226-7.
  18. Järvelin, Kalervo; Kekäläinen, Jaana (2002). "Evaluación de técnicas de IR basada en ganancia acumulada" . Transacciones ACM sobre sistemas de información . 20 (4): 422– 446. doi : 10.1145/582415.582418 . ISSN 1046-8188 . 
  19. C. Lioma; JG Simonsen; B. Larsen (2017). "Medidas de evaluación de relevancia y credibilidad en listas clasificadas" (PDF) . Archivado del original (PDF) el 13 de marzo de 2018. Consultado el 12 de marzo de 2018 .Actas de la Conferencia Internacional ACM SIGIR sobre Teoría de la Recuperación de Información , 91-98.