En la recuperación de información , Okapi BM25 ( BM es la abreviatura de "best matching ", coincidencia óptima ) es una función de clasificación que utilizan los motores de búsqueda para estimar la relevancia de los documentos para una consulta de búsqueda determinada. Se basa en el marco de recuperación probabilística desarrollado en las décadas de 1970 y 1980 por Stephen E. Robertson , Karen Spärck Jones y otros.
El nombre de la función de clasificación propiamente dicha es BM25 . El nombre completo, Okapi BM25 , incluye el nombre del primer sistema que la utilizó, que fue el sistema de recuperación de información Okapi, implementado en la City University de Londres [ 1 ] en las décadas de 1980 y 1990. BM25 y sus variantes más recientes, por ejemplo, BM25F (una versión de BM25 que puede tener en cuenta la estructura del documento y el texto de anclaje ), representan funciones de recuperación similares a TF-IDF utilizadas en la recuperación de documentos . [ 2 ]
La función de clasificación
BM25 es una función de recuperación de bolsa de palabras que clasifica un conjunto de documentos según los términos de consulta que aparecen en cada documento, independientemente de su proximidad dentro del mismo. Es una familia de funciones de puntuación con componentes y parámetros ligeramente diferentes. Una de las implementaciones más destacadas de la función es la siguiente.
Dada una consulta Q que contiene palabras clave, la puntuación BM25 de un documento D es:
dóndees el número de veces que la palabra claveaparece en el documento D ,es la longitud del documento D en palabras, y avgdl es la longitud promedio de los documentos en la colección de texto de la que se extraen los documentos.y b son parámetros libres, generalmente elegidos, en ausencia de una optimización avanzada, comoy. [ 3 ]es el peso IDF ( frecuencia inversa de documento ) del término de consultaGeneralmente se calcula de la siguiente manera:
donde N es el número total de documentos en la colección, yes el número de documentos que contienen.
Existen varias interpretaciones para IDF y ligeras variaciones en su fórmula. En la derivación original de BM25, el componente IDF se deriva del Modelo de Independencia Binaria .
Interpretación teórica de la información de las FDI
Aquí hay una interpretación desde la teoría de la información . Supongamos un término de consulta.aparece endocumentos. Luego, un documento elegido al azar.contendrá el término con probabilidad(dóndees nuevamente la cardinalidad del conjunto de documentos en la colección). Por lo tanto, el contenido informativo del mensaje "contiene" es:
Ahora supongamos que tenemos dos términos de consulta.y. Si los dos términos aparecen en documentos de forma totalmente independiente entre sí, entonces la probabilidad de ver ambosyen un documento elegido al azares:
y el contenido informativo de dicho evento es:
Con una pequeña variación, esto es exactamente lo que expresa el componente IDF de BM25.
Modificaciones
- En los valores extremos del coeficiente b, BM25 se convierte en funciones de clasificación conocidas como BM11 (para) y BM15 (para). [ 4 ]
- BM25F [ 5 ] [ 2 ] (o el modelo BM25 con extensión a múltiples campos ponderados [ 6 ] ) es una modificación de BM25 en la que el documento se considera compuesto por varios campos (como titulares, texto principal, texto de anclaje) con posibles diferentes grados de importancia, saturación de relevancia de términos y normalización de longitud. BM25F define cada tipo de campo como un flujo , aplicando una ponderación por flujo para escalar cada flujo con respecto a la puntuación calculada.
- BM25+ [ 7 ] es una extensión de BM25. BM25+ se desarrolló para abordar una deficiencia del BM25 estándar, en la que el componente de normalización de la frecuencia de términos por longitud del documento no está correctamente limitado inferiormente; como resultado de esta deficiencia, los documentos largos que sí coinciden con el término de consulta a menudo pueden ser puntuados injustamente por BM25 como si tuvieran una relevancia similar a la de documentos más cortos que no contienen el término de consulta en absoluto. La fórmula de puntuación de BM25+ solo tiene un parámetro libre adicional.(el valor predeterminado es 1,0 en ausencia de datos de entrenamiento) en comparación con BM25:
Referencias
- ↑ "OKAPI" . smcse.city.ac.uk . Archivado del original el 7 de diciembre de 2023. Consultado el 16 de octubre de 2023 .
- 1 2 Stephen Robertson y Hugo Zaragoza (2009). "El marco de relevancia probabilística: BM25 y más allá" . Fundamentos y tendencias en la recuperación de información . 3 (4): 333– 389. CiteSeerX 10.1.1.156.5282 . doi : 10.1561/1500000019 . S2CID 207178704 .
- ^ Christopher D. Manning, Prabhakar Raghavan, Hinrich Schütze. Introducción a la recuperación de información , Cambridge University Press, 2009, p. 233.
- ↑ "El esquema de ponderación BM25" .
- ↑ Hugo Zaragoza, Nick Craswell, Michael Taylor, Suchi Saria y Stephen Robertson. Microsoft Cambridge en TREC-13: Pistas web y de hardware. En Actas de TREC-2004.
- ↑ Robertson, Stephen; Zaragoza, Hugo; Taylor, Michael (13 de noviembre de 2004). «Extensión simple de BM25 a múltiples campos ponderados» . Actas de la decimotercera conferencia internacional de la ACM sobre gestión de la información y el conocimiento . CIKM '04. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 42–49 . doi : 10.1145/1031171.1031181 . ISBN 978-1-58113-874-0. S2CID 16628332 .
- ↑ Yuanhua Lv y ChengXiang Zhai. Normalización de la frecuencia de términos con límite inferior. En Actas de CIKM'2011, páginas 7-16.
Referencias generales
- Stephen E. Robertson; Steve Walker; Susan Jones; Micheline Hancock-Beaulieu y Mike Gatford (noviembre de 1994). Okapi en TREC-3 . Actas de la Tercera Conferencia de Recuperación de Texto (TREC 1994) . Gaithersburg, EE. UU.
- Stephen E. Robertson; Steve Walker y Micheline Hancock-Beaulieu (noviembre de 1998). Okapi en TREC-7 . Actas de la Séptima Conferencia de Recuperación de Texto . Gaithersburg, EE. UU.
- Spärck Jones, K. ; Walker, S.; Robertson, SE (2000). "Un modelo probabilístico de recuperación de información: Desarrollo y experimentos comparativos: Parte 1". Information Processing & Management . 36 (6): 779– 808. CiteSeerX 10.1.1.134.6108 . doi : 10.1016/S0306-4573(00)00015-7 .
- Spärck Jones, K. ; Walker, S.; Robertson, SE (2000). "Un modelo probabilístico de recuperación de información: Desarrollo y experimentos comparativos: Parte 2". Information Processing & Management . 36 (6): 809– 840. doi : 10.1016/S0306-4573(00)00016-9 .
- Stephen Robertson y Hugo Zaragoza (2009). "El marco de relevancia probabilística: BM25 y más allá" . Fundamentos y tendencias en la recuperación de información . 3 (4): 333– 389. CiteSeerX 10.1.1.156.5282 . doi : 10.1561/1500000019 . S2CID 207178704 .
Enlaces externos
- Robertson, Stephen ; Zaragoza, Hugo (2009). El marco de relevancia probabilística: BM25 y más allá (PDF) . NOW Publishers, Inc. ISBN 978-1-60198-308-4.
- Funciones de clasificación