Articulo de referencia

Información mutua puntual

En estadística , teoría de la probabilidad y teoría de la información , la información mutua puntual ( PMI ), [ 1 ] o información mutua de punto , es una medida de asociación . ...

En estadística , teoría de la probabilidad y teoría de la información , la información mutua puntual ( PMI ), [ 1 ] o información mutua de punto , es una medida de asociación . Compara la probabilidad de que dos eventos ocurran juntos con la probabilidad que tendrían si los eventos fueran independientes . [ 2 ]

PMI (especialmente en su variante de información mutua puntual positiva ) se ha descrito como "uno de los conceptos más importantes en PLN ", donde "se basa en la intuición de que la mejor manera de sopesar la asociación entre dos palabras es preguntarse con qué frecuencia coocurren las dos palabras en un corpus de lo que hubiéramos esperado que aparecieran por casualidad". [ 2 ]

El concepto fue introducido en 1961 por Robert Fano bajo el nombre de "información mutua", pero hoy en día ese término se utiliza en cambio para una medida relacionada de dependencia entre variables aleatorias: [ 2 ] La información mutua (IM) de dos variables aleatorias discretas se refiere al promedio de la IPM de todos los eventos posibles.

Definición

El PMI de un par de resultados x e y pertenecientes a variables aleatorias discretas X e Y cuantifica la discrepancia entre la probabilidad de su coincidencia dada su distribución conjunta y sus distribuciones individuales, asumiendo independencia . Matemáticamente: [ 2 ]

PMI(incógnita;y)registro2pag(incógnita,y)pag(incógnita)pag(y)=registro2pag(incógnita|y)pag(incógnita)=registro2pag(y|incógnita)pag(y){\displaystyle \operatorname {pmi} (x;y)\equiv \log _{2}{\frac {p(x,y)}{p(x)p(y)}}=\log _{2}{\frac {p(x|y)}{p(x)}}=\log _{2}{\frac {p(y|x)}{p(y)}}}

(donde las dos últimas expresiones son iguales a la primera según el teorema de Bayes ). La información mutua (IM) de las variables aleatorias X e Y es el valor esperado de la IPM (sobre todos los resultados posibles).

La medida es simétrica (PMI(incógnita;y)=PMI(y;incógnita){\displaystyle \operatorname {pmi} (x;y)=\operatorname {pmi} (y;x)}). Puede tomar valores positivos o negativos, pero es cero si X e Y son independientes . Tenga en cuenta que, aunque el PMI puede ser negativo o positivo, su resultado esperado sobre todos los eventos conjuntos (MI) no es negativo. El PMI se maximiza cuando X e Y están perfectamente asociados (es decir,pag(incógnita|y){\displaystyle p(x|y)}opag(y|incógnita)=1{\displaystyle p(y|x)=1}), lo que da como resultado los siguientes límites:

PMI(incógnita;y)min[registropag(incógnita),registropag(y)].{\displaystyle -\infty \leq \operatorname {pmi} (x;y)\leq \min \left[-\log p(x),-\log p(y)\right].}

Finalmente,PMI(incógnita;y){\displaystyle \operatorname {pmi} (x;y)}aumentará sipag(incógnita|y){\displaystyle p(x|y)}está arreglado peropag(incógnita){\displaystyle p(x)}disminuye.

Aquí hay un ejemplo para ilustrarlo:

Utilizando esta tabla podemos marginalizar para obtener la siguiente tabla adicional para las distribuciones individuales:

Con este ejemplo, podemos calcular cuatro valores paraPMI(incógnita;y){\displaystyle \operatorname {pmi} (x;y)}. Usando logaritmos en base 2:

(Para referencia, la información mutua)I(incógnita;Y){\displaystyle \operatorname {I} (X;Y)}sería entonces 0,2141709.)

Similitudes con la información mutua

La información mutua puntual tiene muchas de las mismas relaciones que la información mutua. En particular,

PMI(incógnita;y)=h(incógnita)+h(y)h(incógnita,y)=h(incógnita)h(incógnitay)=h(y)h(yincógnita){\displaystyle {\begin{aligned}\operatorname {pmi} (x;y)&=&h(x)+h(y)-h(x,y)\\&=&h(x)-h(x\mid y)\\&=&h(y)-h(y\mid x)\end{aligned}}}

Dóndeh(incógnita){\displaystyle h(x)}es la autoinformación , oregistro2pag(incógnita){\displaystyle -\log _{2}p(x)}.

Variantes

Se han propuesto varias variaciones del PMI, en particular para abordar lo que se ha descrito como sus "dos limitaciones principales": [ 3 ]

  1. El PMI puede tomar valores tanto positivos como negativos y no tiene límites fijos, lo que dificulta su interpretación. [ 3 ]
  2. PMI tiene "una tendencia bien conocida a dar puntuaciones más altas a eventos de baja frecuencia", pero en aplicaciones como la medición de la similitud de palabras, es preferible tener "una puntuación más alta para pares de palabras cuya relación está respaldada por más evidencia". [ 3 ]

PMI positivo

La medida de información mutua puntual positiva (PPMI) se define estableciendo los valores negativos de PMI en cero: [ 2 ]

ppmi(incógnita;y)máximo(registro2pag(incógnita,y)pag(incógnita)pag(y),0){\displaystyle \operatorname {ppmi} (x;y)\equiv \max \left(\log _{2}{\frac {p(x,y)}{p(x)p(y)}},0\right)}

Esta definición está motivada por la observación de que "los valores PMI negativos (que implican que las cosas coocurren con menos frecuencia de lo que esperaríamos por azar) tienden a ser poco fiables a menos que nuestros corpus sean enormes" y también por la preocupación de que "no está claro si es siquiera posible evaluar tales puntuaciones de 'no relación' con el juicio humano". [ 2 ] También evita tener que lidiar con{\displaystyle -\infty }valores para eventos que nunca ocurren juntos (pag(incógnita,y)=0{\displaystyle p(x,y)=0}), estableciendo PPMI para estos en 0. [ 2 ]

Información mutua puntual normalizada (npmi)

La información mutua puntual se puede normalizar entre [-1,+1], lo que resulta en -1 (en el límite) para que nunca ocurran juntas, 0 para la independencia y +1 para la coocurrencia completa . [ 4 ]

npmi(incógnita;y)=PMI(incógnita;y)h(incógnita,y){\displaystyle \operatorname {npmi} (x;y)={\frac {\operatorname {pmi} (x;y)}{h(x,y)}}}

Dóndeh(incógnita,y){\displaystyle h(x,y)}es la autoinformación conjuntaregistro2pag(incógnita,y){\displaystyle -\log _{2}p(x,y)}.

Familia K de PMI

La medida PMI k (para k=2, 3, etc.), que fue introducida por Béatrice Daille alrededor de 1994, y que en 2011 se describió como "una de las variantes más utilizadas", se define como [ 5 ] [ 3 ]

PMIk(incógnita;y)registro2pag(incógnita,y)kpag(incógnita)pag(y)=PMI(incógnita;y)((k1)registro2pag(incógnita,y)){\displaystyle \operatorname {pmi} ^{k}(x;y)\equiv \log _{2}{\frac {p(x,y)^{k}}{p(x)p(y)}}=\operatorname {pmi} (x;y)-(-(k-1)\log _{2}p(x,y))}

En particular,pagmetroi1(incógnita;y)=pagmetroi(incógnita;y){\displaystyle pmi^{1}(x;y)=pmi(x;y)}. Los factores adicionales depag(incógnita,y){\displaystyle p(x,y)}Dentro del logaritmo , se pretende corregir el sesgo de PMI hacia eventos de baja frecuencia, aumentando las puntuaciones de pares frecuentes. [ 3 ] Un estudio de caso de 2011 demostró el éxito de PMI 3 en la corrección de este sesgo en un corpus extraído de la Wikipedia en inglés. Tomando x como la palabra "fútbol", sus palabras más fuertemente asociadas y según la medida PMI (es decir, aquellas que maximizanpagmetroi(incógnita;y){\displaystyle pmi(x;y)}) eran específicos de dominio ("mediocampista", "esquineros", "porteros") mientras que los términos mejor clasificados por PMI 3 eran mucho más generales ("liga", "clubes", "Inglaterra"). [ 3 ]

Correlación específica

La correlación total es una extensión de la información mutua a múltiples variables. De forma análoga a la definición de correlación total, la extensión de PMI a múltiples variables es la "correlación específica". [ 6 ] El SI de los resultados de variables aleatoriasincógnita=(incógnita1,incógnita2,,incógnitanorte){\displaystyle {\boldsymbol {x}}=(x_{1},x_{2},\ldots {},x_{n})}se expresa de la siguiente manera:

SI(incógnita1,incógnita2,,incógnitanorte)registropag(incógnita1,incógnita2,,incógnitanorte)i=1nortepag(incógnitai)=registropag(incógnita)registroi=1nortepag(incógnitai){\displaystyle \mathrm {SI} (x_{1},x_{2},\ldots ,x_{n})\equiv \log {\frac {p(x_{1},x_{2},\ldots ,x_{n})}{\prod _{i=1}^{n}p(x_{i})}}=\log p({\boldsymbol {x}})-\log \prod _{i=1}^{n}p\left(x_{i}\right)}

Regla de la cadena

Al igual que la información mutua , [ 7 ] la información mutua puntual sigue la regla de la cadena , es decir,

PMI(incógnita;yz)=PMI(incógnita;y)+PMI(incógnita;z|y){\displaystyle \operatorname {pmi} (x;yz)=\operatorname {pmi} (x;y)+\operatorname {pmi} (x;z|y)}

Esto se demuestra mediante la aplicación del teorema de Bayes :

PMI(incógnita;y)+PMI(incógnita;z|y)=registropag(incógnita,y)pag(incógnita)pag(y)+registropag(incógnita,z|y)pag(incógnita|y)pag(z|y)=registro[pag(incógnita,y)pag(incógnita)pag(y)pag(incógnita,z|y)pag(incógnita|y)pag(z|y)]=registropag(incógnita|y)pag(y)pag(incógnita,z|y)pag(incógnita)pag(y)pag(incógnita|y)pag(z|y)=registropag(incógnita,yz)pag(incógnita)pag(yz)=PMI(incógnita;yz){\displaystyle {\begin{aligned}\operatorname {pmi} (x;y)+\operatorname {pmi} (x;z|y)&{}=\log {\frac {p(x,y)}{p(x)p(y)}}+\log {\frac {p(x,z|y)}{p(x|y)p(z|y)}}\\&{}=\log \left[{\frac {p(x,y)}{p(x)p(y)}}{\frac {p(x,z|y)}{p(x|y)p(z|y)}}\right]\\&{}=\log {\frac {p(x|y)p(y)p(x,z|y)}{p(x)p(y)p(x|y)p(z|y)}}\\&{}=\log {\frac {p(x,yz)}{p(x)p(yz)}}\\&{}=\operatorname {pmi} (x;yz)\end{aligned}}}

Aplicaciones

PMI podría utilizarse en diversas disciplinas, por ejemplo, en teoría de la información, lingüística o química (en la elaboración de perfiles y análisis de compuestos químicos). [ 8 ] En lingüística computacional , PMI se ha utilizado para encontrar colocaciones y asociaciones entre palabras. Por ejemplo, los recuentos de ocurrencias y coocurrencias de palabras en un corpus de texto pueden utilizarse para aproximar las probabilidades.pag(incógnita){\displaystyle p(x)}ypag(incógnita,y){\displaystyle p(x,y)}respectivamente. La siguiente tabla muestra el número de pares de palabras con las puntuaciones PMI más altas y más bajas en los primeros 50 millones de palabras de Wikipedia (datos de octubre de 2015), filtrando por 1000 o más coocurrencias. La frecuencia de cada recuento se obtiene dividiendo su valor entre 50 000 952. (Nota: en este ejemplo se utiliza el logaritmo natural para calcular los valores PMI, en lugar del logaritmo en base 2).

Los pares de palabras bien colocadas tienen un PMI alto porque la probabilidad de coocurrencia es solo ligeramente inferior a la probabilidad de ocurrencia de cada palabra por separado. Por el contrario, un par de palabras cuyas probabilidades de ocurrencia son considerablemente mayores que su probabilidad de coocurrencia obtiene un PMI bajo.

Referencias

  1. Kenneth Ward Church y Patrick Hanks (marzo de 1990). "Normas de asociación de palabras, información mutua y lexicografía" . Lingüística Computacional . 16 (1): 22–29 .
  2. 1 2 3 4 5 6 7 Dan Jurafsky y James H. Martin: Procesamiento del habla y del lenguaje (borrador de la 3.ª ed.), 29 de diciembre de 2021, capítulo 6
  3. 1 2 3 4 5 6 Francois Role, Moahmed Nadif. Manejo del impacto de eventos de baja frecuencia en medidas de similitud de palabras basadas en la coocurrencia: un estudio de caso de información mutua puntual. Actas de KDIR 2011 : KDIR - Conferencia Internacional sobre Descubrimiento de Conocimiento y Recuperación de Información, París, 26-29 de octubre de 2011.
  4. Bouma, Gerlof (2009). "Información mutua normalizada (puntual) en la extracción de colocaciones" (PDF) . Actas de la Conferencia Bienal GSCL.
  5. B. Daille. Enfoque mixto para la extracción automática de terminología  : estadísticas léxicas y filtros lingüísticos . Tesis de Doctorado en Informática Fundamental. Universidad París 7. 1994. p.139
  6. Tim Van de Cruys. 2011. Dos generalizaciones multivariadas de la información mutua puntual. En Actas del Taller sobre Semántica Distribucional y Composicionalidad, páginas 16-20, Portland, Oregón, EE. UU. Asociación de Lingüística Computacional.
  7. Paul L. Williams. DINÁMICA DE LA INFORMACIÓN: SU TEORÍA Y APLICACIÓN A LOS SISTEMAS COGNITIVOS CORPORALES .
  8. Čmelo, I.; Voršilák, M.; Svozil, D. (2021-01-10). "Perfilado y análisis de compuestos químicos mediante información mutua puntual" . Journal of Cheminformatics . 13 (1): 3. doi : 10.1186/s13321-020-00483-y . ISSN 1758-2946 . PMC 7798221. PMID 33423694 .   
  • Fano, RM (1961). «Capítulo 2». Transmisión de información: Una teoría estadística de las comunicaciones . MIT Press, Cambridge, MA. ISBN 978-0262561693.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )

Véase también

  • Demostración en el servidor MSR de Rensselaer (valores PMI normalizados entre 0 y 1).