Articulo de referencia

Modelo de divergencia de la aleatoriedad

En el campo de la recuperación de información , la divergencia de la aleatoriedad ( DFR ) es una generalización de uno de los primeros modelos, el modelo de indexación 2-Poisson...

En el campo de la recuperación de información , la divergencia de la aleatoriedad ( DFR ) es una generalización de uno de los primeros modelos, el modelo de indexación 2-Poisson de Harter. [1] Es un tipo de modelo probabilístico . Se utiliza para probar la cantidad de información contenida en los documentos . El modelo 2-Poisson se basa en la hipótesis de que el nivel de los documentos está relacionado con un conjunto de documentos que contiene palabras que aparecen en una medida relativamente mayor que en el resto de los documentos. No es un "modelo", sino un marco para ponderar términos utilizando métodos probabilísticos , y tiene una relación especial para la ponderación de términos basada en la noción de élite.

Los pesos de los términos se consideran el estándar para determinar si una palabra específica se encuentra en ese conjunto o no. Los pesos de los términos se calculan midiendo la divergencia entre una distribución de términos producida por un proceso aleatorio y la distribución de términos real .

Divergencia de los modelos de aleatoriedad establecidos mediante la instanciación de los tres componentes principales del marco: primero, seleccionar un modelo de aleatoriedad básico, luego aplicar la primera normalización y, por último, normalizar las frecuencias de los términos . Los modelos básicos se obtienen de las siguientes tablas.

Definición

La divergencia de la aleatoriedad se basa en esta idea: "Cuanto mayor sea la divergencia de la frecuencia de términos dentro del documento respecto de su frecuencia dentro de la colección, mayor será la información que contenga la palabra t en el documento d. En otras palabras, el peso del término está inversamente relacionado con la probabilidad de frecuencia de términos dentro del documento d obtenida por un modelo M de aleatoriedad". [1]

peso ( a | d ) = a Prob METRO ( a d | Recopilación ) {\displaystyle {\text{peso}}(t|d)=k{\text{Prob}}_{M}(t\in d|{\text{Colección}})} (Fórmula 1)

  1. M representa el tipo de modelo de aleatoriedad que se emplea para calcular la probabilidad.
  2. d es el número total de palabras en los documentos.
  3. t es el número de una palabra específica en d.
  4. k se define por M.

Es posible que utilicemos diferentes modelos URN para elegir el modelo M de aleatoriedad adecuado. En la recuperación de información, hay documentos en lugar de URN y términos en lugar de colores. Hay varias formas de elegir M, cada una de ellas tiene una divergencia básica con respecto al modelo de aleatoriedad que la sustenta. [1]

Modelo

Modelos básicos

D       Aproximación de divergencia de la distribución binomial
 P Aproximación de la         distribución
       binomial
 BE de Bose-Einstein G   Aproximación geométrica de Bose-Einstein 
 I(n)    Modelo de frecuencia inversa de documentos
 I(F)    Modelo de frecuencia inversa de términos
 I(ne) Modelo de frecuencia inversa esperada de documentos

Modelos DFR

Modelo BB2     de Bernoulli-Einstein con efecto posterior de Bernoulli y normalización 2.
 Modelo IFB2     de frecuencia de término inversa con efecto posterior de Bernoulli y normalización 2.
 Modelo In-expB2 de frecuencia esperada de documentos inversa con efecto posterior de Bernoulli y normalización 2. Los logaritmos son de base 2. Este modelo se puede utilizar para tareas ad-hoc clásicas.
 Modelo In-expC2   de frecuencia esperada de documentos inversa con efecto posterior de Bernoulli y normalización 2. Los logaritmos son de base e. Este modelo se puede utilizar para tareas ad-hoc clásicas.
 Modelo InL2     de frecuencia de documentos inversa con efecto posterior de Laplace y normalización 2. Este modelo se puede utilizar para tareas que requieren precisión temprana.
 Modelo PL2     de Poisson con efecto posterior de Laplace y normalización 2. Este modelo se puede utilizar para tareas que requieren precisión temprana[7,8].

Primera normalización

Cuando no se puede encontrar un término raro específico en un documento, entonces en ese documento el término tiene aproximadamente cero probabilidad de ser informativo. Por otro lado, si un término raro ocurre con frecuencia en un documento, por lo tanto puede tener una probabilidad muy alta, cercana al 100%, de ser informativo para el tema mencionado por el documento. La aplicación al modelo de lenguaje de Ponte y Croft también puede proporcionar más datos. Se considera un componente de riesgo en el DFR. Lógicamente hablando, si la frecuencia del término en el documento es relativamente alta, entonces inversamente, el riesgo de que el término no sea informativo es relativamente pequeño. Si la Fórmula 1 da un valor alto, entonces existe un riesgo mínimo de que tenga el efecto negativo de mostrar una pequeña ganancia de información. Como resultado, el peso de la Fórmula 1 está organizado para considerar solo la parte de la cual es la cantidad de información obtenida con el término. Cuanto más ocurre el término en el conjunto de élite, menos frecuencia del término se debe a la aleatoriedad y, por lo tanto, menor es el riesgo asociado. Utilizamos dos modelos para calcular la ganancia de información con un término dentro de un documento: el modelo L de Laplace y la relación de dos procesos de Bernoulli B. [2]

Normalización de frecuencia de términos

Antes de utilizar la frecuencia intradocumental tf de un término, la longitud del documento dl se normaliza a una longitud estándar sl. Por lo tanto, las frecuencias de los términos tf se recalculan con respecto a la longitud estándar del documento, es decir:

tf n = tf * log(1+ sl/dl) (normalización 1)

tfn representa la frecuencia del término normalizado. Otra versión de la fórmula de normalización es la siguiente:

tf n = tf * log(1 + c*(sl/dl)) (normalización 2)

Generalmente se considera que la normalización 2 es más flexible, ya que no existe un valor fijo para c.

  1. tf es la frecuencia del término t en el documento d
  2. dl es la longitud del documento.
  3. sl es la longitud estándar.

Herramientas matemáticas y estadísticas

El espacio de probabilidad

Espacio de muestreo V

La indexación teórica de utilidad desarrollada por Cooper y Maron es una teoría de indexación basada en la teoría de utilidad. Para reflejar el valor que los usuarios esperan de los documentos, se asignan términos de índice a los documentos. Además, la indexación teórica de utilidad está relacionada con un "espacio de eventos" en el mundo estadístico. Existen varios espacios básicos Ω en la recuperación de información. Un espacio básico realmente simple Ω puede ser el conjunto V de términos t, que se denomina vocabulario de la colección de documentos. Debido a que Ω=V es el conjunto de todos los eventos mutuamente excluyentes, Ω también puede ser el evento cierto con probabilidad: [3]

   
  
    
      
        PAG
        (
        V
        )
        =
        
          
          
            a
            
              
            
            
            V
          
        
        PAG
        (
        a
        )
        =
        1
      
    
    {\displaystyle P(V)=\sum _{t\mathop {\in } V}P(t)=1}
  

Por lo tanto, P, la distribución de probabilidad , asigna probabilidades a todos los conjuntos de términos del vocabulario. Observe que el problema básico de la recuperación de información es encontrar una estimación para P(t). Las estimaciones se calculan sobre la base del muestreo y la colección de textos experimentales proporciona las muestras necesarias para la estimación. Ahora nos topamos con la principal preocupación, que es cómo tratamos adecuadamente dos fragmentos de texto arbitrarios pero heterogéneos . Ejemplos como un capítulo de una revista científica y un artículo de un periódico deportivo como el otro. Pueden considerarse como dos muestras diferentes, ya que apuntan a poblaciones diferentes.

Muestreo con un documento

La relación del documento con los experimentos se establece mediante la forma en que se elige el espacio muestral. En las RI, el término experimento o ensayo se utiliza aquí con un significado técnico más que de sentido común. Por ejemplo, un documento podría ser un experimento, lo que significa que el documento es una secuencia de resultados t∈V, o simplemente una muestra de una población. Hablaremos sobre el evento de observar un número Xt = tf de ocurrencias de una palabra dada t en una secuencia de experimentos. Para introducir este espacio de eventos, deberíamos introducir el producto de los espacios de probabilidad asociados con los experimentos de la secuencia. Podríamos introducir nuestro espacio muestral para asociar un punto con posibles configuraciones de los resultados. La correspondencia uno a uno para el espacio muestral se puede definir como:

  
  
    
      
        
          Ohmio
        
        =
        
          V
          
            
              yo
              
                d
              
            
          
        
      
    
    {\displaystyle \mathop {\Omega } =V^{l_{d}}}
  

Donde ld es el número de ensayos del experimento o, en este ejemplo, la longitud de un documento. Podemos suponer que cada resultado puede o no depender de los resultados de los experimentos anteriores. Si los experimentos están diseñados de modo que un resultado influya en los resultados siguientes, entonces la distribución de probabilidad en V es diferente en cada ensayo. Pero, más comúnmente, para establecer el caso más simple cuando el espacio de probabilidad es invariante en IR, a menudo se hace el supuesto de independencia de términos. Por lo tanto, todas las configuraciones posibles de Ω=Vld se consideran equiprobables. Considerando este supuesto, podemos considerar cada documento como un proceso de Bernoulli . Los espacios de probabilidad del producto son invariantes y la probabilidad de una secuencia dada es el producto de las probabilidades en cada ensayo. En consecuencia, si p=P(t) es la probabilidad previa de que el resultado sea t y el número de experimentos es ld, obtenemos que la probabilidad de es igual a: incógnita a = a F Estilo de visualización X_{t}=tf

  
  
    
      
        PAG
        (
        
          incógnita
          
            a
          
        
        =
        a
        F
        
          |
        
        pag
        )
        =
        
          
            
              (
            
            
              
                yo
                
                  d
                
              
              
                a
                F
              
            
            
              )
            
          
        
        
          pag
          
            a
            F
          
        
        
          q
          
            
              
                yo
                
                  d
                
              
            
            
            a
            F
          
        
      
    
    {\displaystyle P(X_{t}=tf|p)={\binom {l_{d}}{tf}}p^{tf}q^{{l_{d}}-tf}}
  

¿Cuál es la suma de la probabilidad de que todas las configuraciones posibles tengan tf resultados de ld? P(Xt=tf|p) es una distribución de probabilidad porque

 
  
    
      
        
          
          
            a
            
              
            
            
            V
          
        
        PAG
        (
        
          incógnita
          
            a
          
        
        =
        a
        F
        
          |
        
        pag
        )
        =
        (
        pag
        +
        q
        
          )
          
            
              yo
              
                d
              
            
          
        
        =
        1
      
    
    {\displaystyle \sum_{t\mathop {\in} V}P(X_{t}=tf|p)=(p+q)^{l_{d}}=1}
  

  1. yo d Estilo de visualización l_ {d}} La longitud del documento d.
  2. tf El término frecuencia de t en el documento d.
  3. incógnita a Estilo de visualización X_{t}} El número de ocurrencias de una palabra específica en una lista.

Muestreos múltiples

Considerando ya la hipótesis de tener una única muestra, es necesario considerar que tenemos varias muestras, por ejemplo, una colección D de documentos. La situación de tener una colección de N documentos es abstractamente equivalente al esquema de colocar una cierta cantidad Tot de V tipos de bolas de colores en una colección de N celdas. Para cada término t∈V una posible configuración de colocación de bolas satisface las ecuaciones:

tf 1 +...+tf N = Ft

Y la condición

F 1 +...+F V =Total

Donde Ft es el número de bolas del mismo color t que se distribuirán en las N celdas. Por lo tanto, hemos modificado el espacio básico. El resultado de nuestro experimento serán los documentos d en los que se colocará la bola. Además, tendremos muchas configuraciones posibles en función del número de bolas de colores.

  1. Ft El número total de tokens de t en la colección.
  2. Tot El número total de fichas en la colección D

Distribuciones

Conclusión

El modelo de divergencia de la aleatoriedad se basa en el modelo de Bernoulli y sus formas límite, la distribución hipergeométrica, las estadísticas de Bose-Einstein y sus formas límite, la distribución binomial compuesta con la distribución beta y la distribución de cola gruesa. El modelo de divergencia de la aleatoriedad muestra un marco unificador que tiene el potencial de construir muchos modelos diferentes y efectivos de RI.

Aplicaciones

Aplicaciones y características

  1. El modelo de divergencia de la aleatoriedad se puede aplicar en la indexación automática en la recuperación de información . Estos se pueden explicar como la élite de la disertación, la noción de un contenido informativo de un término dentro de un documento.
  2. La eficacia de los modelos basados ​​en la divergencia de la aleatoriedad es muy alta en comparación con el BM25 y el modelo de lenguaje. Para consultas cortas, el rendimiento de los modelos de divergencia de la aleatoriedad es definitivamente mejor que el modelo BM25, que desde 1994 se ha utilizado como base estándar para la comparación de los modelos.
  3. El modelo de divergencia de aleatoriedad puede mostrar el mejor rendimiento con solo unos pocos documentos en comparación con otras habilidades de expansión de consultas .
  4. El marco del modelo de divergencia de la aleatoriedad es muy general y flexible. Con la expansión de consultas proporcionada para cada componente, podemos aplicar diferentes tecnologías para obtener el mejor rendimiento.

Proximidad

La proximidad se puede manejar dentro de la divergencia de la aleatoriedad para considerar la cantidad de ocurrencias de un par de términos de consulta dentro de una ventana de tamaño predefinido. Para especificar, el modificador de puntaje de dependencia DFR DSM implementa los modelos pBiL y pBiL2, que calculan la aleatoriedad dividida por la longitud del documento, en lugar de las estadísticas del par en el corpus.

Ejemplos de divergencia de la aleatoriedad

Sea t un término y c una colección. Sea el término el que aparece en tfc=nL(t,c)=200 ubicaciones y en df(t,c)=nL(t,c)=100 documentos. La frecuencia media esperada del término es avgtf(t,c)=200/100=2; este es el promedio de los documentos en los que aparece el término. Sea ND(c)=1000 la cantidad total de documentos. La aparición del término es del 10% en los documentos: PD(t|c)=100/1000. La frecuencia media esperada del término es 200/1000=1/5, y este es el promedio de todos los documentos. La frecuencia del término se muestra como Kt =0,...,6.

La siguiente tabla muestra que la columna nD es el número de documentos que contienen kt ocurrencias de t, que se muestran como nD(t,c,kt). Otra columna nL es el número de ubicaciones en las que aparece el término, que se deduce de esta ecuación: nL=kt*nD. Las columnas de la derecha muestran las probabilidades observadas y de Poisson. P obs,elite(Kt) es la probabilidad observada sobre todos los documentos. P Poisson,all,lambda(Kt) es la probabilidad de Poisson, donde lambda(t,c)=nL(t,c)/ND(c)=0,20 es el parámetro de Poisson. La tabla ilustra cómo la probabilidad observada es diferente de la probabilidad de Poisson. P Poisson(1) es mayor que P obs(1), mientras que para kt>1, las probabilidades observadas son mayores que las probabilidades de Poisson. Hay más masa en la cola de la distribución observada de lo que supone la distribución de Poisson. Además, las columnas de la derecha ilustran el uso de los documentos de élite en lugar de todos los documentos. Aquí, la probabilidad de un solo evento se basa únicamente en las ubicaciones de los documentos de élite.

Más interés de los ejemplos

  1. Ajuste de la longitud del documento.
  2. Aplicación de DFR en documentos XML de solo contenido
  3. Introducción a los modelos DFR

Referencias

  1. ^ abc "Marco de divergencia de la aleatoriedad (DFR)". terrier.org . Facultad de Ciencias de la Computación de la Universidad de Glasgow . Consultado el 14 de septiembre de 2024 .
  2. ^ He, Ben (27 de abril de 2005). "DivergenceFromRandomness". ir.dcs.gla.ac.uk . Archivado desde el original el 11 de septiembre de 2019.
  3. ^ Amati, Giambattista (sin fecha) (9 de junio de 2003). Modelos probabilísticos de recuperación de información basados ​​en la medición de la divergencia de la aleatoriedad (PDF) (tesis doctoral en ciencias de la computación). Universidad de Glasgow . Consultado el 14 de septiembre de 2024 , a través de Fondazione Ugo Bordoni y CORNELIS JOOST VAN RIJSBERGEN, Theses.gla.ac.uk.
  • Página web del DFR de Terrier
  • Página wiki del DFR del grupo IR de Glasgow
  • Marco de divergencia de la aleatoriedad (DFR)
Obtenido de "https://es.wikipedia.org/w/index.php?title=Modelo_de_divergencia-de-aleatoriedad&oldid=1249338667"