Articulo de referencia

Modelo de independencia binaria

En informática y ciencias de la información , el modelo de independencia binaria ( BIM ) [ 1 ] [ 2 ] es una técnica probabilística de recuperación de información . El modelo se ...

En informática y ciencias de la información , el modelo de independencia binaria ( BIM ) [ 1 ] [ 2 ] es una técnica probabilística de recuperación de información . El modelo se basa en supuestos sencillos para que la estimación de la similitud entre documentos y consultas sea probable y factible.

Definiciones

La suposición de independencia binaria establece que los documentos son vectores binarios ; es decir, solo se registra la presencia o ausencia de términos en los documentos. Los términos se distribuyen independientemente en el conjunto de documentos relevantes y también en el conjunto de documentos irrelevantes. La representación es un conjunto ordenado de variables booleanas . Es decir, la representación de un documento o consulta es un vector con un elemento booleano por cada término considerado. Más específicamente, un documento se representa mediante un vector d = ( x 1 , ..., x m ) donde x t =1 si el término t está presente en el documento d y x t =0 si no lo está. Muchos documentos pueden tener la misma representación vectorial con esta simplificación. Las consultas se representan de manera similar. "Independencia" significa que los términos en el documento se consideran independientemente unos de otros y no se modela ninguna asociación entre ellos. Esta suposición es muy restrictiva, pero se ha demostrado que proporciona resultados suficientemente buenos para muchas situaciones. Esta independencia es la suposición "ingenua" de un clasificador Naive Bayes , donde las propiedades que se implican entre sí se tratan como independientes por simplicidad. Esta suposición permite tratar la representación como una instancia de un modelo de espacio vectorial, considerando cada término como un valor de 0 o 1 en una dimensión ortogonal a las dimensiones utilizadas para los demás términos.

La probabilidadPAG(R|d,q){\displaystyle P(R|d,q)}Que un documento sea relevante se deriva de la probabilidad de relevancia del vector de términos de ese documento.PAG(R|incógnita,q){\displaystyle P(R|x,q)}Aplicando la regla de Bayes obtenemos:

PAG(R|incógnita,q)=PAG(incógnita|R,q)PAG(R|q)PAG(incógnita|q){\displaystyle P(R|x,q)={\frac {P(x|R,q)*P(R|q)}{P(x|q)}}}

dóndePAG(incógnita|R=1,q){\displaystyle P(x|R=1,q)}yPAG(incógnita|R=0,q){\displaystyle P(x|R=0,q)}son las probabilidades de recuperar un documento relevante o irrelevante, respectivamente. Si es así, entonces la representación de ese documento es x . Las probabilidades exactas no se pueden conocer de antemano, por lo que deben usarse estimaciones basadas en estadísticas sobre la colección de documentos.

PAG(R=1|q){\displaystyle P(R=1|q)}yPAG(R=0|q){\displaystyle P(R=0|q)}Indican la probabilidad previa de recuperar un documento relevante o no relevante, respectivamente, para una consulta q . Si, por ejemplo, conociéramos el porcentaje de documentos relevantes en la colección, podríamos usarlo para estimar estas probabilidades. Dado que un documento es relevante o no relevante para una consulta, tenemos que:

PAG(R=1|incógnita,q)+PAG(R=0|incógnita,q)=1{\displaystyle P(R=1|x,q)+P(R=0|x,q)=1}

Ponderación de los términos de la consulta

Dada una consulta binaria y el producto escalar como función de similitud entre un documento y una consulta, el problema consiste en asignar ponderaciones a los términos de la consulta de manera que la efectividad de la recuperación sea alta.pagi{\displaystyle p_{i}}yqi{\displaystyle q_{i}}sea ​​la probabilidad de que un documento relevante y un documento irrelevante tengan el i -ésimo término respectivamente. Yu y Salton , [ 1 ] quienes introdujeron BIM por primera vez, proponen que el peso del i- ésimo término es una función creciente deYi=pagi(1qi)(1pagi)qi{\displaystyle Y_{i}={\frac {p_{i}*(1-q_{i})}{(1-p_{i})*q_{i}}}}. Por lo tanto, siYi{\displaystyle Y_{i}}es más alto queYj{\displaystyle Y_{j}}, el peso del término i será mayor que el del término j . Yu y Salton [ 1 ] demostraron que tal asignación de peso a los términos de la consulta produce una mejor efectividad de recuperación que si los términos de la consulta tienen el mismo peso. Robertson y Spärck Jones [ 2 ] demostraron más tarde que si al término i se le asigna el peso deregistroYi{\displaystyle \log Y_{i}}, entonces la efectividad de recuperación óptima se obtiene bajo el supuesto de independencia binaria.

El modelo de independencia binaria fue introducido por Yu y Salton. [ 1 ] El término modelo de independencia binaria fue acuñado por Robertson y Spärck Jones [ 2 ] quienes utilizaron la probabilidad logarítmica del modelo de relevancia probabilística para derivarregistroYi{\displaystyle \log Y_{i}}donde se demuestra que la probabilidad de log-odds es equivalente en rango a la probabilidad de relevancia (es decir,PAG(R|d,q){\displaystyle P(R|d,q)}) por Luk, [ 3 ] obedeciendo el principio de clasificación de probabilidad. [ 4 ]

Véase también

Lecturas adicionales

  • Christopher D. Manning; Prabhakar Raghavan; Hinrich Schütze (2008), Introducción a la recuperación de información , Cambridge University Press
  • Stefan Büttcher; Charles LA Clarke; Gordon V. Cormack (2010), Recuperación de información: Implementación y evaluación de motores de búsqueda , MIT Press

Referencias

  1. 1 2 3 4 Yu, CT; Salton, G. (1976). "Precision Weighting – An Effective Automatic Indexing Method" (PDF) . Journal of the ACM . 23 : 76–88 . doi : 10.1145/321921.321930 . hdl : 1813/7313 .
  2. 1 2 3 Robertson, SE ; Spärck Jones, K. (1976). "Ponderación de relevancia de los términos de búsqueda". Journal of the American Society for Information Science . 27 (3): 129. doi : 10.1002/asi.4630270302 .
  3. Luk, RWP (2022). "¿Por qué la recuperación de información es una disciplina científica?". Foundations of Science . 27 (2): 427– 453. doi : 10.1007/s10699-020-09685-x . hdl : 10397/94873 .
  4. Robertson, SE (1977). "El principio de clasificación de probabilidad en IR". Journal of Documentation . 33 (4): 294– 304. doi : 10.1108/eb026647 .