Articulo de referencia

Mutual information

Venn diagram showing additive and subtractive relationships of various information measures associated with correlated variables X {\displaystyle X} and Y {\displaystyle Y} . [ ...

Venn diagram showing additive and subtractive relationships of various information measures associated with correlated variables X{\displaystyle X} and Y{\displaystyle Y}.[1] The area contained by either circle is the joint entropyH(X,Y){\displaystyle \mathrm {H} (X,Y)}. The circle on the left (red and violet) is the individual entropyH(X){\displaystyle \mathrm {H} (X)}, with the red being the conditional entropyH(XY){\displaystyle \mathrm {H} (X\mid Y)}. The circle on the right (blue and violet) is H(Y){\displaystyle \mathrm {H} (Y)}, with the blue being H(YX){\displaystyle \mathrm {H} (Y\mid X)}. The violet is the mutual information I(X;Y){\displaystyle \operatorname {I} (X;Y)}.

In probability theory and information theory, the mutual information (MI) of two random variables is a measure of the mutual dependence between the two variables. More specifically, it quantifies the "amount of information" (in units such as shannons (bits), nats or hartleys) obtained about one random variable by observing the other random variable. The concept of mutual information is intimately linked to that of entropy of a random variable, a fundamental notion in information theory that quantifies the expected "amount of information" held in a random variable.

Not limited to real-valued random variables and linear dependence like the correlation coefficient, MI is more general and determines how different the joint distribution of the pair (X,Y){\displaystyle (X,Y)} is from the product of the marginal distributions of X{\displaystyle X} and Y{\displaystyle Y}. MI is the expected value of the pointwise mutual information (PMI).

The quantity was defined and analyzed by Claude Shannon in his landmark paper "A Mathematical Theory of Communication", although he did not call it "mutual information". This term was coined later by Robert Fano.[2] Mutual Information is also known as information gain.

Definition

Let (X,Y){\displaystyle (X,Y)} be a pair of random variables with values over the space X×Y{\displaystyle {\mathcal {X}}\times {\mathcal {Y}}}. If their joint distribution is P(X,Y){\displaystyle P_{(X,Y)}} and the marginal distributions are PX{\displaystyle P_{X}} and PY{\displaystyle P_{Y}}, the mutual information is defined as

I(X;Y)=DKL(P(X,Y)PXPY){\displaystyle I(X;Y)=D_{\mathrm {KL} }(P_{(X,Y)}\parallel P_{X}\otimes P_{Y})}

where DKL{\displaystyle D_{\mathrm {KL} }} is the Kullback–Leibler divergence, and PXPY{\displaystyle P_{X}\otimes P_{Y}} is the outer product distribution which assigns probability PX(x)PY(y){\displaystyle P_{X}(x)\cdot P_{Y}(y)} to each (x,y){\displaystyle (x,y)}.

Expressed in terms of the entropyH(){\displaystyle H(\cdot )} and the conditional entropyH(|){\displaystyle H(\cdot |\cdot )} of the random variables X{\displaystyle X} and Y{\displaystyle Y}, one also has (see relation to conditional and joint entropy):

I(X;Y)=H(X)H(X|Y)=H(Y)H(Y|X){\displaystyle I(X;Y)=H(X)-H(X|Y)=H(Y)-H(Y|X)}

Obsérvese, según la propiedad de la divergencia de Kullback-Leibler , queI(incógnita;Y){\displaystyle I(X;Y)}es igual a cero precisamente cuando la distribución conjunta coincide con el producto de las marginales, es decir cuandoincógnita{\displaystyle X}yY{\displaystyle Y}son independientes (y por lo tanto observanY{\displaystyle Y}no te dice nada sobreincógnita{\displaystyle X}).I(incógnita;Y){\displaystyle I(X;Y)}es no negativo. Es una medida del precio de la codificación.(incógnita,Y){\displaystyle (X,Y)}como un par de variables aleatorias independientes cuando en realidad no lo son.

Si se utiliza el logaritmo natural , la unidad de información mutua es el nat . Si se utiliza el logaritmo en base 2, la unidad de información mutua es el shannon , también conocido como bit. Si se utiliza el logaritmo en base 10, la unidad de información mutua es el hartley , también conocido como ban o dit.

En términos de funciones de masa de probabilidad para distribuciones discretas

La información mutua de dos variables aleatorias discretas conjuntasincógnita{\displaystyle X}yY{\displaystyle Y}se calcula como una suma doble: [ 3 ] : 20

I(incógnita;Y)=yYincógnitaincógnitaPAG(incógnita,Y)(incógnita,y)registro(PAG(incógnita,Y)(incógnita,y)PAGincógnita(incógnita)PAGY(y)){\displaystyle \operatorname {I} (X;Y)=\sum _{y\in {\mathcal {Y}}}\sum _{x\in {\mathcal {X}}}{P_{(X,Y)}(x,y)\log \left({\frac {P_{(X,Y)}(x,y)}{P_{X}(x)\,P_{Y}(y)}}\right)}},

dóndePAG(incógnita,Y){\displaystyle P_{(X,Y)}}es la función de masa de probabilidad conjunta deincógnita{\displaystyle X}yY{\displaystyle Y}, yPAGincógnita{\displaystyle P_{X}}yPAGY{\displaystyle P_{Y}}son las funciones de masa de probabilidad marginal deincógnita{\displaystyle X}yY{\displaystyle Y}respectivamente.

En términos de PDF para distribuciones continuas

En el caso de variables aleatorias continuas conjuntas, la suma doble se reemplaza por una integral doble : [ 3 ] : 251

I(incógnita;Y)=YincógnitaPAG(incógnita,Y)(incógnita,y)registro(PAG(incógnita,Y)(incógnita,y)PAGincógnita(incógnita)PAGY(y))dincógnitady{\displaystyle \operatorname {I} (X;Y)=\int _{\mathcal {Y}}\int _{\mathcal {X}}{P_{(X,Y)}(x,y)\log {\left({\frac {P_{(X,Y)}(x,y)}{P_{X}(x)\,P_{Y}(y)}}\right)}}\;dx\,dy},

dóndePAG(incógnita,Y){\displaystyle P_{(X,Y)}}ahora es la función de densidad de probabilidad conjunta deincógnita{\displaystyle X}yY{\displaystyle Y}, yPAGincógnita{\displaystyle P_{X}}yPAGY{\displaystyle P_{Y}}son las funciones de densidad de probabilidad marginal deincógnita{\displaystyle X}yY{\displaystyle Y}respectivamente.

Motivación

Intuitivamente, la información mutua mide la información queincógnita{\displaystyle X}yY{\displaystyle Y}compartir: Mide cuánto reduce la incertidumbre sobre la otra el conocimiento de una de estas variables. Por ejemplo, siincógnita{\displaystyle X}yY{\displaystyle Y}son independientes, entonces saberincógnita{\displaystyle X}no proporciona ninguna información sobreY{\displaystyle Y}y viceversa, por lo que su información mutua es cero. En el otro extremo, siincógnita{\displaystyle X}es una función determinista deY{\displaystyle Y}yY{\displaystyle Y}es una función determinista deincógnita{\displaystyle X}entonces toda la información transmitida porincógnita{\displaystyle X}se comparte conY{\displaystyle Y}: saberincógnita{\displaystyle X}determina el valor deY{\displaystyle Y}y viceversa. Como resultado, la información mutua es la misma que la incertidumbre contenida enY{\displaystyle Y}(oincógnita{\displaystyle X}) por sí sola, es decir, la entropía deY{\displaystyle Y}(oincógnita{\displaystyle X}). Un caso muy especial de esto es cuandoincógnita{\displaystyle X}yY{\displaystyle Y}son la misma variable aleatoria.

La información mutua es una medida de la dependencia inherente expresada en la distribución conjunta deincógnita{\displaystyle X}yY{\displaystyle Y}en relación con la distribución marginal deincógnita{\displaystyle X}yY{\displaystyle Y}bajo el supuesto de independencia. Por lo tanto, la información mutua mide la dependencia en el siguiente sentido:I(incógnita;Y)=0{\displaystyle \operatorname {I} (X;Y)=0}si y solo siincógnita{\displaystyle X}yY{\displaystyle Y}son variables aleatorias independientes. Esto es fácil de ver en una dirección: siincógnita{\displaystyle X}yY{\displaystyle Y}son independientes, entoncespag(incógnita,Y)(incógnita,y)=pagincógnita(incógnita)pagY(y){\displaystyle p_{(X,Y)}(x,y)=p_{X}(x)\cdot p_{Y}(y)}y por lo tanto:

registro(pag(incógnita,Y)(incógnita,y)pagincógnita(incógnita)pagY(y))=registro1=0{\displaystyle \log {\left({\frac {p_{(X,Y)}(x,y)}{p_{X}(x)\,p_{Y}(y)}}\right)}=\log 1=0}.

Además, la información mutua es no negativa (es decir,I(incógnita;Y)0{\displaystyle \operatorname {I} (X;Y)\geq 0}ver más abajo) y simétrico (es decirI(incógnita;Y)=I(Y;incógnita){\displaystyle \operatorname {I} (X;Y)=\operatorname {I} (Y;X)}vea abajo).

Propiedades

No negatividad

Utilizando la desigualdad de Jensen sobre la definición de información mutua podemos demostrar queI(incógnita;Y){\displaystyle \operatorname {I} (X;Y)}es no negativo, es decir [ 3 ] : 28

I(incógnita;Y)0{\displaystyle \operatorname {I} (X;Y)\geq 0}

Simetría

I(incógnita;Y)=I(Y;incógnita){\displaystyle \operatorname {I} (X;Y)=\operatorname {I} (Y;X)}

La demostración se presenta considerando la relación con la entropía, como se muestra a continuación.

Supermodularidad bajo independencia

Sido{\displaystyle C}es independiente de(A,B){\displaystyle (A,B)}, entonces

I(Y;A,B,do)I(Y;A,B)I(Y;A,do)I(Y;A){\displaystyle \operatorname {I} (Y;A,B,C)-\operatorname {I} (Y;A,B)\geq \operatorname {I} (Y;A,C)-\operatorname {I} (Y;A)}. [ 4 ]

Relación con la entropía condicional y conjunta

La información mutua puede expresarse de forma equivalente como:

I(incógnita;Y)H(incógnita)H(incógnitaY)H(Y)H(Yincógnita)H(incógnita)+H(Y)H(incógnita,Y)H(incógnita,Y)H(incógnitaY)H(Yincógnita){\displaystyle {\begin{aligned}\operatorname {I} (X;Y)&{}\equiv \mathrm {H} (X)-\mathrm {H} (X\mid Y)\\&{}\equiv \mathrm {H} (Y)-\mathrm {H} (Y\mid X)\\&{}\equiv \mathrm {H} (X)+\mathrm {H} (Y)-\mathrm {H} (X,Y)\\&{}\equiv \mathrm {H} (X,Y)-\mathrm {H} (X\mid Y)-\mathrm {H} (Y\mid X)\end{aligned}}}

dóndeH(incógnita){\displaystyle \mathrm {H} (X)}yH(Y){\displaystyle \mathrm {H} (Y)}son las entropías marginales ,H(incógnitaY){\displaystyle \mathrm {H} (X\mid Y)}yH(Yincógnita){\displaystyle \mathrm {H} (Y\mid X)}son las entropías condicionales yH(incógnita,Y){\displaystyle \mathrm {H} (X,Y)}es la entropía conjunta deincógnita{\displaystyle X}yY{\displaystyle Y}.

Nótese la analogía con la unión, la diferencia y la intersección de dos conjuntos: en este sentido, todas las fórmulas dadas anteriormente se desprenden del diagrama de Venn que se muestra al principio del artículo.

En términos de un canal de comunicación en el que la salidaY{\displaystyle Y}es una versión ruidosa de la entradaincógnita{\displaystyle X}Estas relaciones se resumen en la figura:

Las relaciones entre cantidades de la teoría de la información

PorqueI(incógnita;Y){\displaystyle \operatorname {I} (X;Y)}es no negativo, por consiguiente,H(incógnita)H(incógnitaY){\displaystyle \mathrm {H} (X)\geq \mathrm {H} (X\mid Y)}Aquí presentamos la deducción detallada deI(incógnita;Y)=H(Y)H(Yincógnita){\displaystyle \operatorname {I} (X;Y)=\mathrm {H} (Y)-\mathrm {H} (Y\mid X)}para el caso de variables aleatorias discretas conjuntas:

I(incógnita;Y)=incógnitaincógnita,yYpag(incógnita,Y)(incógnita,y)registropag(incógnita,Y)(incógnita,y)pagincógnita(incógnita)pagY(y)=incógnitaincógnita,yYpag(incógnita,Y)(incógnita,y)registropag(incógnita,Y)(incógnita,y)pagincógnita(incógnita)incógnitaincógnita,yYpag(incógnita,Y)(incógnita,y)registropagY(y)=incógnitaincógnita,yYpagincógnita(incógnita)pagYincógnita=incógnita(y)registropagYincógnita=incógnita(y)incógnitaincógnita,yYpag(incógnita,Y)(incógnita,y)registropagY(y)=incógnitaincógnitapagincógnita(incógnita)(yYpagYincógnita=incógnita(y)registropagYincógnita=incógnita(y))yY(incógnitaincógnitapag(incógnita,Y)(incógnita,y))registropagY(y)=incógnitaincógnitapagincógnita(incógnita)H(Yincógnita=incógnita)yYpagY(y)registropagY(y)=H(Yincógnita)+H(Y)=H(Y)H(Yincógnita).{\displaystyle {\begin{aligned}\operatorname {I} (X;Y)&{}=\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p_{(X,Y)}(x,y)\log {\frac {p_{(X,Y)}(x,y)}{p_{X}(x)p_{Y}(y)}}\\&{}=\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p_{(X,Y)}(x,y)\log {\frac {p_{(X,Y)}(x,y)}{p_{X}(x)}}-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p_{(X,Y)}(x,y)\log p_{Y}(y)\\&{}=\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p_{X}(x)p_{Y\mid X=x}(y)\log p_{Y\mid X=x}(y)-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p_{(X,Y)}(x,y)\log p_{Y}(y)\\&{}=\sum _{x\in {\mathcal {X}}}p_{X}(x)\left(\sum _{y\in {\mathcal {Y}}}p_{Y\mid X=x}(y)\log p_{Y\mid X=x}(y)\right)-\sum _{y\in {\mathcal {Y}}}\left(\sum _{x\in {\mathcal {X}}}p_{(X,Y)}(x,y)\right)\log p_{Y}(y)\\&{}=-\sum _{x\in {\mathcal {X}}}p_{X}(x)\mathrm {H} (Y\mid X=x)-\sum _{y\in {\mathcal {Y}}}p_{Y}(y)\log p_{Y}(y)\\&{}=-\mathrm {H} (Y\mid X)+\mathrm {H} (Y)\\&{}=\mathrm {H} (Y)-\mathrm {H} (Y\mid X).\\\end{aligned}}}

Las demostraciones de las demás identidades mencionadas anteriormente son similares. La demostración del caso general (no solo el discreto) también es similar, sustituyendo las sumas por integrales.

Intuitivamente, si la entropíaH(Y){\displaystyle \mathrm {H} (Y)}se considera una medida de incertidumbre sobre una variable aleatoria, entoncesH(Yincógnita){\displaystyle \mathrm {H} (Y\mid X)}es una medida de quéincógnita{\displaystyle X}no dice nada sobreY{\displaystyle Y}. Esta es "la cantidad de incertidumbre que queda sobreY{\displaystyle Y}despuésincógnita{\displaystyle X}se conoce", y por lo tanto el lado derecho de la segunda de estas igualdades puede leerse como "la cantidad de incertidumbre enY{\displaystyle Y}, menos la cantidad de incertidumbre enY{\displaystyle Y}que queda despuésincógnita{\displaystyle X}se conoce", lo cual es equivalente a "la cantidad de incertidumbre enY{\displaystyle Y}que se elimina al saberincógnita{\displaystyle X}"Esto corrobora el significado intuitivo de la información mutua como la cantidad de información (es decir, la reducción de la incertidumbre) que el conocimiento de cualquiera de las variables proporciona sobre la otra."

Tenga en cuenta que en el caso discretoH(YY)=0{\displaystyle \mathrm {H} (Y\mid Y)=0}y por lo tantoH(Y)=I(Y;Y){\displaystyle \mathrm {H} (Y)=\operatorname {I} (Y;Y)}. De este modoI(Y;Y)I(incógnita;Y){\displaystyle \operatorname {I} (Y;Y)\geq \operatorname {I} (X;Y)}y se puede formular el principio básico de que una variable contiene al menos tanta información sobre sí misma como cualquier otra variable.

Relación con la divergencia de Kullback-Leibler

Para pares conjuntamente discretos o conjuntamente continuos(incógnita,Y){\displaystyle (X,Y)}, la información mutua es la divergencia de Kullback-Leibler del producto de las distribuciones marginales ,pagincógnitapagY{\displaystyle p_{X}\cdot p_{Y}}, de la distribución conjuntapag(incógnita,Y){\displaystyle p_{(X,Y)}}, eso es,

I(incógnita;Y)=DKL(pag(incógnita,Y)pagincógnitapagY){\displaystyle \operatorname {I} (X;Y)=D_{\text{KL}}\left(p_{(X,Y)}\parallel p_{X}p_{Y}\right)}

Además, dejemospag(incógnita,Y)(incógnita,y)=pagincógnitaY=y(incógnita)pagY(y){\displaystyle p_{(X,Y)}(x,y)=p_{X\mid Y=y}(x)*p_{Y}(y)}Sea la función de masa o densidad condicional. Entonces, tenemos la identidad

I(incógnita;Y)=miY[DKL(pagincógnitaYpagincógnita)]{\displaystyle \operatorname {I} (X;Y)=\mathbb {E} _{Y}\left[D_{\text{KL}}\!\left(p_{X\mid Y}\parallel p_{X}\right)\right]}

La demostración para variables aleatorias discretas conjuntas es la siguiente:

I(incógnita;Y)=yYincógnitaincógnitapag(incógnita,Y)(incógnita,y)registro(pag(incógnita,Y)(incógnita,y)pagincógnita(incógnita)pagY(y))=yYincógnitaincógnitapagincógnitaY=y(incógnita)pagY(y)registropagincógnitaY=y(incógnita)pagY(y)pagincógnita(incógnita)pagY(y)=yYpagY(y)incógnitaincógnitapagincógnitaY=y(incógnita)registropagincógnitaY=y(incógnita)pagincógnita(incógnita)=yYpagY(y)DKL(pagincógnitaY=ypagincógnita)=miY[DKL(pagincógnitaYpagincógnita)].{\displaystyle {\begin{aligned}\operatorname {I} (X;Y)&=\sum _{y\in {\mathcal {Y}}}\sum _{x\in {\mathcal {X}}}{p_{(X,Y)}(x,y)\log \left({\frac {p_{(X,Y)}(x,y)}{p_{X}(x)\,p_{Y}(y)}}\right)}\\&=\sum _{y\in {\mathcal {Y}}}\sum _{x\in {\mathcal {X}}}p_{X\mid Y=y}(x)p_{Y}(y)\log {\frac {p_{X\mid Y=y}(x)p_{Y}(y)}{p_{X}(x)p_{Y}(y)}}\\&=\sum _{y\in {\mathcal {Y}}}p_{Y}(y)\sum _{x\in {\mathcal {X}}}p_{X\mid Y=y}(x)\log {\frac {p_{X\mid Y=y}(x)}{p_{X}(x)}}\\&=\sum _{y\in {\mathcal {Y}}}p_{Y}(y)\;D_{\text{KL}}\!\left(p_{X\mid Y=y}\parallel p_{X}\right)\\&=\mathbb {E} _{Y}\left[D_{\text{KL}}\!\left(p_{X\mid Y}\parallel p_{X}\right)\right].\end{aligned}}}

De manera similar, esta identidad puede establecerse para variables aleatorias continuas conjuntas.

Nótese que aquí la divergencia de Kullback-Leibler implica la integración sobre los valores de la variable aleatoria.incógnita{\displaystyle X}solamente, y la expresiónDKL(pagincógnitaYpagincógnita){\displaystyle D_{\text{KL}}(p_{X\mid Y}\parallel p_{X})}sigue denotando una variable aleatoria porqueY{\displaystyle Y}es aleatorio. Por lo tanto, la información mutua también puede entenderse como la expectativa sobreY{\displaystyle Y}de la divergencia de Kullback-Leibler de la distribución condicionalpagincógnitaY{\displaystyle p_{X\mid Y}}deincógnita{\displaystyle X}dadoY{\displaystyle Y}de la distribución univariadapagincógnita{\displaystyle p_{X}}deincógnita{\displaystyle X}: cuanto más diferentes sean las distribucionespagincógnitaY{\displaystyle p_{X\mid Y}}ypagincógnita{\displaystyle p_{X}}son en promedio, mayor es la ganancia de información .

Estimación bayesiana de la información mutua

Si se dispone de muestras de una distribución conjunta, se puede utilizar un enfoque bayesiano para estimar la información mutua de dicha distribución. El primer trabajo que hizo esto, que también mostró cómo realizar la estimación bayesiana de muchas otras propiedades de la teoría de la información además de la información mutua, fue [ 5 ] . Investigadores posteriores han vuelto a derivar [ 6 ] y extendido [ 7 ] este análisis. Véase [ 8 ] para un artículo reciente basado en una distribución a priori específicamente adaptada a la estimación de la información mutua en sí misma. Además, recientemente se ha desarrollado un método de estimación que tiene en cuenta salidas continuas y multivariadas. Y{\displaystyle Y}, fue propuesto en . [ 9 ]

supuestos de independencia

La formulación de la divergencia de Kullback-Leibler de la información mutua se basa en que uno está interesado en compararpag(incógnita,y){\displaystyle p(x,y)}al producto exterior totalmente factorizadopag(incógnita)pag(y){\displaystyle p(x)\cdot p(y)}En muchos problemas, como la factorización de matrices no negativas , uno está interesado en factorizaciones menos extremas; específicamente, uno desea compararpag(incógnita,y){\displaystyle p(x,y)}a una aproximación matricial de bajo rango en alguna variable desconocidaw{\displaystyle w}; es decir, en qué grado uno podría tener

pag(incógnita,y)wpag(incógnita,w)pag(w,y){\displaystyle p(x,y)\approx \sum _{w}p^{\prime }(x,w)p^{\prime \prime }(w,y)}

Alternativamente, uno podría estar interesado en saber cuánta más informaciónpag(incógnita,y){\displaystyle p(x,y)}lleva consigo su factorización. En tal caso, la información sobrante que la distribución completapag(incógnita,y){\displaystyle p(x,y)}La factorización de la matriz se obtiene mediante la divergencia de Kullback-Leibler.

ILRMETROA=yYincógnitaincógnitapag(incógnita,y)registro(pag(incógnita,y)wpag(incógnita,w)pag(w,y)),{\displaystyle \operatorname {I} _{LRMA}=\sum _{y\in {\mathcal {Y}}}\sum _{x\in {\mathcal {X}}}{p(x,y)\log {\left({\frac {p(x,y)}{\sum _{w}p^{\prime }(x,w)p^{\prime \prime }(w,y)}}\right)}},}

La definición convencional de la información mutua se recupera en el caso extremo de que el procesoW{\displaystyle W}tiene solo un valor paraw{\displaystyle w}.

Variaciones

Se han propuesto diversas variantes de la información mutua para adaptarse a diferentes necesidades. Entre ellas se encuentran variantes normalizadas y generalizaciones a más de dos variables.

Métrico

Muchas aplicaciones requieren una métrica , es decir, una medida de distancia entre pares de puntos. La cantidad

d(incógnita,Y)=H(incógnita,Y)I(incógnita;Y)=H(incógnita)+H(Y)2I(incógnita;Y)=H(incógnitaY)+H(Yincógnita)=2H(incógnita,Y)H(incógnita)H(Y){\displaystyle {\begin{aligned}d(X,Y)&=\mathrm {H} (X,Y)-\operatorname {I} (X;Y)\\&=\mathrm {H} (X)+\mathrm {H} (Y)-2\operatorname {I} (X;Y)\\&=\mathrm {H} (X\mid Y)+\mathrm {H} (Y\mid X)\\&=2\mathrm {H} (X,Y)-\mathrm {H} (X)-\mathrm {H} (Y)\end{aligned}}}

Satisface las propiedades de una métrica ( desigualdad triangular , no negatividad , indiscernibilidad y simetría) para variables aleatorias discretas.incógnita{\displaystyle X}yY{\displaystyle Y}donde la igualdadincógnita=Y{\displaystyle X=Y}se entiende que significa queincógnita{\displaystyle X}puede determinarse completamente a partir deY{\displaystyle Y}. [ 10 ]

Esta métrica de distancia también se conoce como variación de información .

Siincógnita,Y{\displaystyle X,Y}Si son variables aleatorias discretas, entonces todos los términos de entropía son no negativos, por lo tanto0d(incógnita,Y)H(incógnita,Y){\displaystyle 0\leq d(X,Y)\leq \mathrm {H} (X,Y)}y se puede definir una distancia normalizada

D(incógnita,Y)=d(incógnita,Y)H(incógnita,Y)1.{\displaystyle D(X,Y)={\frac {d(X,Y)}{\mathrm {H} (X,Y)}}\leq 1.}

Al introducir las definiciones se observa que

D(incógnita,Y)=1I(incógnita;Y)H(incógnita,Y).{\displaystyle D(X,Y)=1-{\frac {\operatorname {I} (X;Y)}{\mathrm {H} (X,Y)}}.}

Esto se conoce como la distancia de Rajski. [ 11 ] En una interpretación de la información basada en la teoría de conjuntos (véase la figura para la entropía condicional ), esto es efectivamente la distancia de Jaccard entreincógnita{\displaystyle X}yY{\displaystyle Y}.

Finalmente,

D(incógnita,Y)=1I(incógnita;Y)máximo{H(incógnita),H(Y)}{\displaystyle D^{\prime }(X,Y)=1-{\frac {\operatorname {I} (X;Y)}{\max \left\{\mathrm {H} (X),\mathrm {H} (Y)\right\}}}}

También es una métrica.

Información mutua condicional

A veces resulta útil expresar la información mutua de dos variables aleatorias condicionada a una tercera.

I(incógnita;Y|Z)=miZ[DKL(PAG(incógnita,Y)|ZPAGincógnita|ZPAGY|Z)]{\displaystyle \operatorname {I} (X;Y|Z)=\mathbb {E} _{Z}[D_{\mathrm {KL} }(P_{(X,Y)|Z}\|P_{X|Z}\otimes P_{Y|Z})]}

Para variables aleatorias discretas conjuntas , esto toma la forma

I(incógnita;Y|Z)=zZyYincógnitaincógnitapagZ(z)pagincógnita,Y|Z(incógnita,y|z)registro[pagincógnita,Y|Z(incógnita,y|z)pagincógnita|Z(incógnita|z)pagY|Z(y|z)],{\displaystyle \operatorname {I} (X;Y|Z)=\sum _{z\in {\mathcal {Z}}}\sum _{y\in {\mathcal {Y}}}\sum _{x\in {\mathcal {X}}}{p_{Z}(z)\,p_{X,Y|Z}(x,y|z)\log \left[{\frac {p_{X,Y|Z}(x,y|z)}{p_{X|Z}\,(x|z)p_{Y|Z}(y|z)}}\right]},}

que se puede simplificar como

I(incógnita;Y|Z)=zZyYincógnitaincógnitapagincógnita,Y,Z(incógnita,y,z)registropagincógnita,Y,Z(incógnita,y,z)pagZ(z)pagincógnita,Z(incógnita,z)pagY,Z(y,z).{\displaystyle \operatorname {I} (X;Y|Z)=\sum _{z\in {\mathcal {Z}}}\sum _{y\in {\mathcal {Y}}}\sum _{x\in {\mathcal {X}}}p_{X,Y,Z}(x,y,z)\log {\frac {p_{X,Y,Z}(x,y,z)p_{Z}(z)}{p_{X,Z}(x,z)p_{Y,Z}(y,z)}}.}

Para variables aleatorias continuas conjuntas , esto toma la forma

I(incógnita;Y|Z)=ZYincógnitapagZ(z)pagincógnita,Y|Z(incógnita,y|z)registro[pagincógnita,Y|Z(incógnita,y|z)pagincógnita|Z(incógnita|z)pagY|Z(y|z)]dincógnitadydz,{\displaystyle \operatorname {I} (X;Y|Z)=\int _{\mathcal {Z}}\int _{\mathcal {Y}}\int _{\mathcal {X}}{p_{Z}(z)\,p_{X,Y|Z}(x,y|z)\log \left[{\frac {p_{X,Y|Z}(x,y|z)}{p_{X|Z}\,(x|z)p_{Y|Z}(y|z)}}\right]}dxdydz,}

que se puede simplificar como

I(incógnita;Y|Z)=ZYincógnitapagincógnita,Y,Z(incógnita,y,z)registropagincógnita,Y,Z(incógnita,y,z)pagZ(z)pagincógnita,Z(incógnita,z)pagY,Z(y,z)dincógnitadydz.{\displaystyle \operatorname {I} (X;Y|Z)=\int _{\mathcal {Z}}\int _{\mathcal {Y}}\int _{\mathcal {X}}p_{X,Y,Z}(x,y,z)\log {\frac {p_{X,Y,Z}(x,y,z)p_{Z}(z)}{p_{X,Z}(x,z)p_{Y,Z}(y,z)}}dxdydz.}

Condicionar a una tercera variable aleatoria puede aumentar o disminuir la información mutua, pero siempre es cierto que

I(incógnita;Y|Z)0{\displaystyle \operatorname {I} (X;Y|Z)\geq 0}

para variables aleatorias discretas y distribuidas conjuntamenteincógnita,Y,Z{\displaystyle X,Y,Z}Este resultado se ha utilizado como un elemento básico para demostrar otras desigualdades en la teoría de la información .

Información de interacción

Se han propuesto varias generalizaciones de la información mutua a más de dos variables aleatorias, como la correlación total (o multiinformación) y la correlación total dual . La expresión y el estudio de la información mutua multivariada de grado superior se lograron en dos trabajos aparentemente independientes: McGill (1954) [ 12 ] , quien denominó a estas funciones " información de interacción ", y Hu Kuo Ting (1962). [ 13 ] La información de interacción se define para una variable de la siguiente manera:

I(incógnita1)=H(incógnita1){\displaystyle \operatorname {I} (X_{1})=\mathrm {H} (X_{1})}

y paranorte>1,{\displaystyle n>1,}

I(incógnita1;...;incógnitanorte)=I(incógnita1;...;incógnitanorte1)I(incógnita1;...;incógnitanorte1incógnitanorte),{\displaystyle \operatorname {I} (X_{1};\,...\,;X_{n})=\operatorname {I} (X_{1};\,...\,;X_{n-1})-\operatorname {I} (X_{1};\,...\,;X_{n-1}\mid X_{n}),}

donde (como se indicó anteriormente) definimos

I(incógnita1;...;incógnitanorte1|incógnitanorte)=miincógnitanorte[I(incógnita1;...;incógnitanorte1)|incógnitanorte].{\displaystyle \operatorname {I} (X_{1};\,...\,;X_{n-1}|X_{n})=\mathbb {E} _{X_{n}}{\bigl [}\operatorname {I} (X_{1};\,...\,;X_{n-1})|X_{n}{\bigr ]}.}

Algunos autores invierten el orden de los términos del lado derecho de la ecuación anterior, lo que cambia el signo cuando el número de variables aleatorias es impar. (En este caso, la expresión de una sola variable se convierte en el negativo de la entropía).

La información de interacción puede ser positiva, negativa o cero. [ 13 ] La positividad corresponde a relaciones que generalizan las correlaciones por pares, la nulidad corresponde a una noción refinada de independencia y la negatividad detecta relaciones "emergentes" de alta dimensión y puntos de datos agrupados [ 14 ] ).

Independencia estadística multivariante

Las funciones de información mutua multivariadas generalizan el caso de independencia por pares que establece queincógnita1,incógnita2{\displaystyle X_{1},X_{2}}si y solo siI(incógnita1;incógnita2)=0{\displaystyle I(X_{1};X_{2})=0}, a un número arbitrario de variables. n variables son mutuamente independientes si y solo si la2nortenorte1{\displaystyle 2^{n}-n-1}Las funciones de información mutua desaparecenI(incógnita1;;incógnitak)=0{\displaystyle I(X_{1};\ldots ;X_{k})=0}connortek2{\displaystyle n\geq k\geq 2}(teorema 2 [ 15 ] ). En este sentido, elI(incógnita1;;incógnitak)=0{\displaystyle I(X_{1};\ldots ;X_{k})=0}puede utilizarse como un criterio de independencia estadística refinado.

Aplicaciones

Para 3 variables, Brenner et al. aplicaron información mutua multivariada a la codificación neuronal y denominaron a su negatividad "sinergia" [ 16 ] y Watkinson et al. la aplicaron a la expresión genética. [ 17 ] Para k variables arbitrarias, Tapia et al. aplicaron información mutua multivariada a la expresión génica . [ 14 ] [ 15 ]

Se ha encontrado que un esquema de generalización de alta dimensión que maximiza la información mutua entre la distribución conjunta y otras variables objetivo es útil en la selección de características . [ 18 ]

La información mutua también se utiliza en el área del procesamiento de señales como una medida de similitud entre dos señales. Por ejemplo, la métrica FMI [ 19 ] es una medida de rendimiento de fusión de imágenes que utiliza la información mutua para medir la cantidad de información que la imagen fusionada contiene sobre las imágenes de origen. El código Matlab para esta métrica se puede encontrar en [ 20 ] . Existe un paquete de Python para calcular todas las información mutuas multivariadas, la información mutua condicional , las entropías conjuntas, las correlaciones totales y la distancia de información en un conjunto de datos de n variables [ 21 ] .

Información dirigida

Información dirigida ,I(incógnitanorteYnorte){\displaystyle \operatorname {I} \left(X^{n}\to Y^{n}\right)}mide la cantidad de información que fluye del procesoincógnitanorte{\displaystyle X^{n}}aYnorte{\displaystyle Y^{n}}, dóndeincógnitanorte{\displaystyle X^{n}}denota el vectorincógnita1,incógnita2,...,incógnitanorte{\displaystyle X_{1},X_{2},...,X_{n}}yYnorte{\displaystyle Y^{n}}denotaY1,Y2,...,Ynorte{\displaystyle Y_{1},Y_{2},...,Y_{n}}El término información dirigida fue acuñado por James Massey y se define como

I(incógnitanorteYnorte)=i=1norteI(incógnitai;YiYi1){\displaystyle \operatorname {I} \left(X^{n}\to Y^{n}\right)=\sum _{i=1}^{n}\operatorname {I} \left(X^{i};Y_{i}\mid Y^{i-1}\right)}.

Tenga en cuenta que sinorte=1{\displaystyle n=1}La información dirigida se convierte en información mutua. La información dirigida tiene muchas aplicaciones en problemas donde la causalidad juega un papel importante, como la capacidad de un canal con retroalimentación. [ 22 ] [ 23 ]

Variantes normalizadas

Las variantes normalizadas de la información mutua se proporcionan mediante los coeficientes de restricción , [ 24 ] coeficiente de incertidumbre [ 25 ] o competencia: [ 26 ]

doincógnitaY=I(incógnita;Y)H(Y)    y    doYincógnita=I(incógnita;Y)H(incógnita).{\displaystyle C_{XY}={\frac {\operatorname {I} (X;Y)}{\mathrm {H} (Y)}}~~~~{\mbox{and}}~~~~C_{YX}={\frac {\operatorname {I} (X;Y)}{\mathrm {H} (X)}}.}

Los dos coeficientes tienen un valor comprendido entre [0, 1], pero no son necesariamente iguales. Esta medida no es simétrica. Si se desea una medida simétrica, se puede considerar la siguiente medida de redundancia :

R=I(incógnita;Y)H(incógnita)+H(Y){\displaystyle R={\frac {\operatorname {I} (X;Y)}{\mathrm {H} (X)+\mathrm {H} (Y)}}}

que alcanza un mínimo de cero cuando las variables son independientes y un valor máximo de

Rmáximo=min{H(incógnita),H(Y)}H(incógnita)+H(Y){\displaystyle R_{\max }={\frac {\min \left\{\mathrm {H} (X),\mathrm {H} (Y)\right\}}{\mathrm {H} (X)+\mathrm {H} (Y)}}}

Cuando una variable se vuelve completamente redundante con el conocimiento de la otra. Véase también Redundancia (teoría de la información) .

Otra medida simétrica es la incertidumbre simétrica ( Witten y Frank 2005 ) , dada por

U(incógnita,Y)=2R=2I(incógnita;Y)H(incógnita)+H(Y){\displaystyle U(X,Y)=2R=2{\frac {\operatorname {I} (X;Y)}{\mathrm {H} (X)+\mathrm {H} (Y)}}}

que representa la media armónica de los dos coeficientes de incertidumbredoincógnitaY,doYincógnita{\displaystyle C_{XY},C_{YX}}. [ 25 ]

Si consideramos la información mutua como un caso especial de la correlación total o correlación total dual , las versiones normalizadas son respectivamente,

I(incógnita;Y)min[H(incógnita),H(Y)]{\displaystyle {\frac {\operatorname {I} (X;Y)}{\min \left[\mathrm {H} (X),\mathrm {H} (Y)\right]}}}yI(incógnita;Y)H(incógnita,Y).{\displaystyle {\frac {\operatorname {I} (X;Y)}{\mathrm {H} (X,Y)}}\;.}

Esta versión normalizada también se conoce como Índice de Calidad de la Información (IQR) y cuantifica la cantidad de información de una variable basada en otra variable frente a la incertidumbre total: [ 27 ]

IQR(incógnita,Y)=mi[I(incógnita;Y)]=I(incógnita;Y)H(incógnita,Y)=incógnitaincógnitayYpag(incógnita,y)registropag(incógnita)pag(y)incógnitaincógnitayYpag(incógnita,y)registropag(incógnita,y)1{\displaystyle IQR(X,Y)=\operatorname {E} [\operatorname {I} (X;Y)]={\frac {\operatorname {I} (X;Y)}{\mathrm {H} (X,Y)}}={\frac {\sum _{x\in X}\sum _{y\in Y}p(x,y)\log {p(x)p(y)}}{\sum _{x\in X}\sum _{y\in Y}p(x,y)\log {p(x,y)}}}-1}

Existe una normalización [ 28 ] que se deriva de pensar primero en la información mutua como un análogo de la covarianza (por lo tanto, la entropía de Shannon es análoga a la varianza ). Luego, la información mutua normalizada se calcula de manera similar al coeficiente de correlación de Pearson .

I(incógnita;Y)H(incógnita)H(Y).{\displaystyle {\frac {\operatorname {I} (X;Y)}{\sqrt {\mathrm {H} (X)\mathrm {H} (Y)}}}\;.}

Una normalización ingenua puede conducir a una interpretación sesgada e introducir dependencias espurias. [ 29 ]

Variantes ponderadas

En la formulación tradicional de la información mutua,

I(incógnita;Y)=yYincógnitaincógnitapag(incógnita,y)registropag(incógnita,y)pag(incógnita)pag(y),{\displaystyle \operatorname {I} (X;Y)=\sum _{y\in Y}\sum _{x\in X}p(x,y)\log {\frac {p(x,y)}{p(x)\,p(y)}},}

cada evento u objeto especificado por(incógnita,y){\displaystyle (x,y)}está ponderado por la probabilidad correspondientepag(incógnita,y){\displaystyle p(x,y)}Esto presupone que todos los objetos o eventos son equivalentes, salvo por su probabilidad de ocurrencia. Sin embargo, en algunas aplicaciones, ciertos objetos o eventos pueden ser más significativos que otros, o ciertos patrones de asociación pueden tener mayor importancia semántica que otros.

Por ejemplo, el mapeo determinista{(1,1),(2,2),(3,3)}{\displaystyle \{(1,1),(2,2),(3,3)\}}puede considerarse más fuerte que el mapeo determinista{(1,3),(2,1),(3,2)}{\displaystyle \{(1,3),(2,1),(3,2)\}}, aunque estas relaciones producirían la misma información mutua. Esto se debe a que la información mutua no es sensible en absoluto a ningún orden inherente en los valores de las variables ( Cronbach 1954 , Coombs, Dawes y Tversky 1970 , Lockhead 1970 ), y por lo tanto no es sensible en absoluto a la forma del mapeo relacional entre las variables asociadas. Si se desea que la primera relación —que muestra acuerdo en todos los valores de las variables— se juzgue más fuerte que la segunda relación, entonces es posible utilizar la siguiente información mutua ponderada ( Guiasu 1977 ) .

I(incógnita;Y)=yYincógnitaincógnitaw(incógnita,y)pag(incógnita,y)registropag(incógnita,y)pag(incógnita)pag(y),{\displaystyle \operatorname {I} (X;Y)=\sum _{y\in Y}\sum _{x\in X}w(x,y)p(x,y)\log {\frac {p(x,y)}{p(x)\,p(y)}},}

lo que pone pesow(incógnita,y){\displaystyle w(x,y)}sobre la probabilidad de coocurrencia de cada valor de variable,pag(incógnita,y){\displaystyle p(x,y)}Esto permite que ciertas probabilidades tengan mayor o menor importancia que otras, lo que permite cuantificar factores holísticos o de Prägnanz relevantes . En el ejemplo anterior, se utilizan pesos relativos mayores paraw(1,1){\displaystyle w(1,1)},w(2,2){\displaystyle w(2,2)}, yw(3,3){\displaystyle w(3,3)}tendría el efecto de evaluar una mayor capacidad informativa para la relación {(1,1),(2,2),(3,3)}{\displaystyle \{(1,1),(2,2),(3,3)\}}que para la relación{(1,3),(2,1),(3,2)}{\displaystyle \{(1,3),(2,1),(3,2)\}}, lo cual puede ser deseable en algunos casos de reconocimiento de patrones y similares. Esta información mutua ponderada es una forma de divergencia KL ponderada, que se sabe que toma valores negativos para algunas entradas, [ 30 ] y hay ejemplos donde la información mutua ponderada también toma valores negativos. [ 31 ]

Información mutua ajustada

Una distribución de probabilidad puede considerarse como una partición de un conjunto . Cabe preguntarse entonces: si un conjunto se particionara aleatoriamente, ¿cuál sería la distribución de probabilidades? ¿Cuál sería el valor esperado de la información mutua? La información mutua ajustada (IMA) resta el valor esperado de la información mutua (IM), de modo que la IMA es cero cuando dos distribuciones diferentes son aleatorias y uno cuando dos distribuciones son idénticas. La IMA se define por analogía con el índice de Rand ajustado de dos particiones diferentes de un conjunto.

Información mutua absoluta

Utilizando las ideas de la complejidad de Kolmogorov , se puede considerar la información mutua de dos secuencias independientemente de cualquier distribución de probabilidad:

IK(incógnita;Y)=K(incógnita)K(incógnitaY).{\displaystyle \operatorname {I} _{K}(X;Y)=K(X)-K(X\mid Y).}

Para establecer que esta cantidad es simétrica salvo un término logarítmico aditivo (IK(incógnita;Y)IK(Y;incógnita){\displaystyle \operatorname {I} _{K}(X;Y)\approx \operatorname {I} _{K}(Y;X)}), se requiere la regla de la cadena para la complejidad de Kolmogorov ( Li y Vitányi 1997 ) . Las aproximaciones de esta cantidad a través de la compresión se pueden usar para definir una medida de distancia para realizar una agrupación jerárquica de secuencias sin tener ningún conocimiento del dominio de las secuencias ( Cilibrasi y Vitányi 2005 ) .

Correlación lineal

A diferencia de los coeficientes de correlación, como el coeficiente de correlación del momento del producto , la información mutua contiene información sobre toda la dependencia (lineal y no lineal) y no solo la dependencia lineal como lo mide el coeficiente de correlación. Sin embargo, en el caso restringido de que la distribución conjunta paraincógnita{\displaystyle X}yY{\displaystyle Y}es una distribución normal bivariada (lo que implica en particular que ambas distribuciones marginales están distribuidas normalmente), existe una relación exacta entreI{\displaystyle \operatorname {I} }y el coeficiente de correlaciónρ{\displaystyle \rho }( Gel'fand y Yaglom 1957 ) .

I=12registro(1ρ2){\displaystyle \operatorname {I} =-{\frac {1}{2}}\log \left(1-\rho ^{2}\right)}

La ecuación anterior se puede derivar de la siguiente manera para una gaussiana bivariada:

(incógnita1incógnita2)norte((μ1μ2),Σ),Σ=(σ12ρσ1σ2ρσ1σ2σ22)H(incógnitai)=12registro(2πmiσi2)=12+12registro(2π)+registro(σi),i{1,2}H(incógnita1,incógnita2)=12registro[(2πmi)2|Σ|]=1+registro(2π)+registro(σ1σ2)+12registro(1ρ2){\displaystyle {\begin{aligned}{\begin{pmatrix}X_{1}\\X_{2}\end{pmatrix}}&\sim {\mathcal {N}}\left({\begin{pmatrix}\mu _{1}\\\mu _{2}\end{pmatrix}},\Sigma \right),\qquad \Sigma ={\begin{pmatrix}\sigma _{1}^{2}&\rho \sigma _{1}\sigma _{2}\\\rho \sigma _{1}\sigma _{2}&\sigma _{2}^{2}\end{pmatrix}}\\\mathrm {H} (X_{i})&={\frac {1}{2}}\log \left(2\pi e\sigma _{i}^{2}\right)={\frac {1}{2}}+{\frac {1}{2}}\log(2\pi )+\log \left(\sigma _{i}\right),\quad i\in \{1,2\}\\\mathrm {H} (X_{1},X_{2})&={\frac {1}{2}}\log \left[(2\pi e)^{2}|\Sigma |\right]=1+\log(2\pi )+\log \left(\sigma _{1}\sigma _{2}\right)+{\frac {1}{2}}\log \left(1-\rho ^{2}\right)\\\end{aligned}}}

Por lo tanto,

I(incógnita1;incógnita2)=H(incógnita1)+H(incógnita2)H(incógnita1,incógnita2)=12registro(1ρ2){\displaystyle \operatorname {I} \left(X_{1};X_{2}\right)=\mathrm {H} \left(X_{1}\right)+\mathrm {H} \left(X_{2}\right)-\mathrm {H} \left(X_{1},X_{2}\right)=-{\frac {1}{2}}\log \left(1-\rho ^{2}\right)}

Para datos discretos

Cuandoincógnita{\displaystyle X}yY{\displaystyle Y} están limitados a estar en un número discreto de estados, los datos de observación se resumen en una tabla de contingencia , con variable de filaincógnita{\displaystyle X}(oi{\displaystyle i}) y variable de columnaY{\displaystyle Y}(oj{\displaystyle j}La información mutua es una de las medidas de asociación o correlación entre las variables de fila y columna.

Otras medidas de asociación incluyen las estadísticas de la prueba chi-cuadrado de Pearson , las estadísticas de la prueba G , etc. De hecho, con la misma base logarítmica, la información mutua será igual a la estadística de verosimilitud logarítmica de la prueba G dividida por2norte{\displaystyle 2N}, dóndenorte{\displaystyle N}es el tamaño de la muestra.

Aplicaciones

En muchas aplicaciones, se busca maximizar la información mutua (aumentando así las dependencias), lo cual suele ser equivalente a minimizar la entropía condicional . Algunos ejemplos son:

METROI(incógnita,y)=registroPAGincógnita,Y(incógnita,y)PAGincógnita(incógnita)PAGY(y)registroFincógnitaYBFincógnitaUFYU{\displaystyle MI(x,y)=\log {\frac {P_{X,Y}(x,y)}{P_{X}(x)P_{Y}(y)}}\approx \log {\frac {\frac {f_{XY}}{B}}{{\frac {f_{X}}{U}}{\frac {f_{Y}}{U}}}}}
dóndeFincógnitaY{\displaystyle f_{XY}}es el número de veces que aparece el bigrama xy en el corpus,Fincógnita{\displaystyle f_{X}}es el número de veces que aparece el unigrama x en el corpus, B es el número total de bigramas y U es el número total de unigramas. [ 32 ]

Véase también

Notas

  1. Cover, Thomas M.; Thomas, Joy A. (2005). Elementos de la teoría de la información (PDF) . John Wiley & Sons, Ltd. págs. 13–55 . ISBN  978-0-471-74882-3.
  2. Kreer, JG (1957). "Una cuestión de terminología". IRE Transactions on Information Theory . 3 (3): 208. doi : 10.1109/TIT.1957.1057418 .
  3. 1 2 3 Portada, TM; Thomas, JA (1991). Elementos de la teoría de la información ( ed. Wiley ). John Wiley & Sons. ISBN  978-0-471-24195-9.
  4. Janssen, Joseph; Guan, Vincent; Robeva, Elina (2023). "Importancia de características ultramarginales: aprendizaje a partir de datos con garantías causales" . Conferencia Internacional sobre Inteligencia Artificial y Estadística : 10782–10814 . arXiv : 2204.09938 .
  5. Wolpert, DH; Wolf, DR (1995). "Estimación de funciones de distribuciones de probabilidad a partir de un conjunto finito de muestras". Physical Review E . 52 (6): 6841– 6854. Bibcode : 1995PhRvE..52.6841W . CiteSeerX 10.1.1.55.7122 . doi : 10.1103/PhysRevE.52.6841 . PMID 9964199 . S2CID 9795679 .   
  6. Hutter, M. (2001). "Distribución de información mutua". Avances en sistemas de procesamiento de información neuronal .
  7. Archer, E.; Park, IM; Pillow, J. (2013). "Estimadores bayesianos y cuasi-bayesianos para información mutua a partir de datos discretos" . Entropy . 15 (12): 1738– 1755. Bibcode : 2013Entrp..15.1738A . CiteSeerX 10.1.1.294.4690 . doi : 10.3390/e15051738 . 
  8. Wolpert, DH; DeDeo, S. (2013). "Estimating Functions of Distributions Defined over Spaces of Unknown Size" . Entropy . 15 (12): 4668– 4699. arXiv : 1311.4548 . Bibcode : 2013Entrp..15.4668W . doi : 10.3390/e15114668 . S2CID 2737117 . 
  9. Tomasz Jetka; Karol Nienaltowski; Tomasz Winarski; Slawomir Blonski; Michal Komorowski (2019). "Análisis teórico de la información de las respuestas de señalización de células individuales multivariadas". PLOS Computational Biology . 15 (7) e1007132. arXiv : 1808.05581 . Bibcode : 2019PLSCB..15E7132J . doi : 10.1371/journal.pcbi.1007132 . PMC 6655862 . PMID 31299056 .  
  10. Rajski, C. (1961). "Un espacio métrico de distribuciones de probabilidad discretas". Information and Control . 4 (4): 371– 377. doi : 10.1016/S0019-9958(61)80055-7 .
  11. Rajski, C. (1961). "Un espacio métrico de distribuciones de probabilidad discretas". Information and Control . 4 (4): 371– 377. doi : 10.1016/S0019-9958(61)80055-7 .
  12. McGill, W. (1954). "Transmisión de información multivariada". Psychometrika . 19 (1): 97– 116. doi : 10.1007/BF02289159 . S2CID 126431489 . 
  13. 1 2 Hu, KT (1962). "Sobre la cantidad de información". Theory Probab. Appl . 7 (4): 439– 447. doi : 10.1137/1107041 .
  14. 1 2 Tapia, M.; Baudot, P.; Formizano-Treziny, C.; Dufour, M.; Goaillard, JM (2018). "La identidad del neurotransmisor y el fenotipo electrofisiológico están genéticamente acoplados en las neuronas dopaminérgicas del mesencéfalo" . Sci. Rep . 8 (1): 13637. Bibcode : 2018NatSR...813637T . doi : 10.1038/s41598-018-31765- z . PMC 6134142. PMID 30206240 .  
  15. 1 2 Baudot, P.; Tapia, M.; Bennequin, D.; Goaillard, JM (2019). "Análisis de datos de información topológica" . Entropía . 21 (9). 869. arXiv : 1907.04242 . Bibcode : 2019Entrp..21..869B . doi : 10.3390/e21090869 . PMC 7515398. S2CID 195848308 .  
  16. Brenner, N.; Strong, S.; Koberle, R.; Bialek , W. (2000). "Sinergia en un código neuronal". Neural Comput . 12 (7): 1531– 1552. doi : 10.1162/089976600300015259 . PMID 10935917. S2CID 600528 .  
  17. Watkinson, J.; Liang, K.; Wang, X.; Zheng, T.; Anastassiou, D. (2009). "Inferencia de interacciones de genes reguladores a partir de datos de expresión utilizando información mutua de tres vías". Chall. Syst. Biol. Ann. NY Acad. Sci . 1158 (1): 302– 313. Bibcode : 2009NYASA1158..302W . doi : 10.1111 / j.1749-6632.2008.03757.x . PMID 19348651. S2CID 8846229 .  
  18. ^ Christopher D. Manning; Prabhakar Raghavan; Hinrich Schütze (2008). Introducción a la recuperación de información . Prensa de la Universidad de Cambridge . ISBN 978-0-521-86571-5.
  19. Haghighat, MBA; Aghagolzadeh, A.; Seyedarabi, H. (2011). "Una métrica de fusión de imágenes sin referencia basada en la información mutua de las características de la imagen". Computers & Electrical Engineering . 37 (5): 744– 756. doi : 10.1016/j.compeleceng.2011.07.012 . S2CID 7738541 . 
  20. "Métrica de información mutua de características (FMI) para fusión de imágenes sin referencia - Intercambio de archivos - MATLAB Central" . www.mathworks.com . Consultado el 4 de abril de 2018 .
  21. "InfoTopo: Análisis de datos de información topológica. Aprendizaje profundo estadístico no supervisado y supervisado - Intercambio de archivos - Github" . github.com/pierrebaudot/infotopopy/ . Consultado el 26 de septiembre de 2020 .
  22. Massey, James (1990). "Causalidad, retroalimentación e información dirigida" . Actas del Simposio Internacional de Teoría de la Información y sus Aplicaciones de 1990, Waikiki, Hawái, 27-30 de noviembre de 1990. CiteSeerX 10.1.1.36.5688 . Archivado del original el 7 de abril de 2018. Consultado el 16 de diciembre de 2018 . 
  23. Permuter, Haim Henry; Weissman, Tsachy; Goldsmith, Andrea J. (febrero de 2009). "Canales de estado finito con retroalimentación determinista invariante en el tiempo". IEEE Transactions on Information Theory . 55 (2): 644– 662. arXiv : cs/0608070 . doi : 10.1109/TIT.2008.2009849 . S2CID 13178 . 
  24. Coombs, Dawes y Tversky 1970 .
  25. 1 2 Press, WH; Teukolsky, SA; Vetterling, WT; Flannery, BP (2007). «Sección 14.7.3. Entropía condicional e información mutua» . Numerical Recipes: The Art of Scientific Computing (3.ª ed.). Nueva York: Cambridge University Press. ISBN  978-0-521-88068-8Archivado del original el 11 de agosto de 2011. Consultado el 13 de agosto de 2011 .
  26. White, Jim; Steingold, Sam; Fournelle, Connie. Métricas de rendimiento para algoritmos de detección de grupos (PDF) . Interface 2004. Archivado del original el 5 de julio de 2016. Consultado el 19 de febrero de 2014 .
  27. ^ Wijaya, Dedy Rahman; Sarno, Riyanarto; Zulaika, Enny (2017). "Relación de calidad de la información como una métrica novedosa para la selección de ondas madre". Quimiometría y Sistemas Inteligentes de Laboratorio . 160 : 59– 71. doi : 10.1016/j.chemolab.2016.11.012 .
  28. Strehl, Alexander; Ghosh, Joydeep (2003). "Cluster Ensembles – A Knowledge Reuse Framework for Combining Multiple Partitions" (PDF) . The Journal of Machine Learning Research . 3 : 583–617 . doi : 10.1162/153244303321897735 .
  29. Jerdee, M., Kirkley, A. y Newman, M. La información mutua normalizada es una medida sesgada para la clasificación y la detección de comunidades. Nat Commun (2025). https://doi.org/10.1038/s41467-025-66150-8
  30. Kvålseth, TO (1991). "La medida de información útil relativa: algunos comentarios". Information Sciences . 56 (1): 35– 38. doi : 10.1016/0020-0255(91)90022-m .
  31. Pocock, A. (2012). Selección de características mediante verosimilitud conjunta (PDF) (Tesis). Archivado del original (PDF) el 5 de noviembre de 2018.
  32. 1 2 "Análisis sintáctico de un lenguaje natural mediante estadísticas de información mutua" . Archivado del original el 25 de febrero de 2014.Por David M. Magerman y Mitchell P. Marcus
  33. Hugh Everett, Teoría de la función de onda universal , Tesis, Universidad de Princeton, (1956, 1973), pp. 1–140 (página 30)
  34. Everett, Hugh (1957). "Formulación de estado relativo de la mecánica cuántica" . Reviews of Modern Physics . 29 (3): 454– 462. Bibcode : 1957RvMP...29..454E . doi : 10.1103/revmodphys.29.454 . Archivado del original el 27 de octubre de 2011. Consultado el 16 de julio de 2012 .
  35. Nicoletti, Giorgio; Busiello, Daniel Maria (22-11-2021). "La información mutua desenreda las interacciones de entornos cambiantes" . Physical Review Letters . 127 (22) 228301. arXiv : 2107.08985 . Bibcode : 2021PhRvL.127v8301N . doi : 10.1103/ PhysRevLett.127.228301 . PMID 34889638. S2CID 236087228 .  
  36. Nicoletti, Giorgio; Busiello, Daniel Maria (2022-07-29). "Información mutua en entornos cambiantes: interacciones no lineales, sistemas fuera de equilibrio y difusividades que varían continuamente" . Physical Review E. 106 ( 1) 014153. arXiv : 2204.01644 . Bibcode : 2022PhRvE.106a4153N . doi : 10.1103/PhysRevE.106.014153 . PMID 35974654 . 
  37. GlobalMIT en Google Code
  38. Lee, Se Yoon (2021). "Inferencia variacional mediante muestreador de Gibbs y ascenso de coordenadas: una revisión basada en la teoría de conjuntos". Communications in Statistics - Theory and Methods . 51 (6): 1549– 1568. arXiv : 2008.01006 . doi : 10.1080/03610926.2021.1921214 . S2CID 220935477 . 
  39. Keys, Dustin; Kholikov, Shukur; Pevtsov, Alexei A. (febrero de 2015). "Aplicación de métodos de información mutua en heliosismología de tiempo-distancia". Física solar . 290 (3): 659– 671. arXiv : 1501.05597 . Bibcode : 2015SoPh..290..659K . doi : 10.1007/s11207-015-0650-y . S2CID 118472242 . 
  40. Agrupamiento de información invariante para la clasificación y segmentación de imágenes no supervisadas por Xu Ji, Joao Henriques y Andrea Vedaldi
  41. Nicoletti, Giorgio; Busiello, Daniel Maria (2024-04-08). "Propagación de información en sistemas multicapa con interacciones de orden superior a través de escalas de tiempo" . Physical Review X. 14 ( 2) 021007. arXiv : 2312.06246 . Bibcode : 2024PhRvX..14b1007N . doi : 10.1103/PhysRevX.14.021007 .

Referencias

  • Baudot, P.; Tapia, M.; Bennequin, D.; Goaillard, JM (2019). "Análisis de datos de información topológica" . Entropía . 21 ( 9). 869. arXiv : 1907.04242 . Bibcode : 2019Entrp..21..869B . doi : 10.3390/e21090869 . PMC 7515398. S2CID 195848308 .  
  • Cilibrasi, R.; Vitányi, Paul (2005). "Clustering by compression" (PDF) . IEEE Transactions on Information Theory . 51 (4): 1523– 1545. arXiv : cs/0312044 . doi : 10.1109/TIT.2005.844059 . S2CID 911 . 
  • Cronbach, LJ (1954). "Sobre la aplicación no racional de las medidas de información en psicología". En Quastler, Henry (ed.). Teoría de la información en psicología: problemas y métodos . Glencoe, Illinois: Free Press. pp. 14-30 . 
  • Coombs, CH; Dawes, RM; Tversky, A. (1970). Psicología matemática: una introducción elemental . Englewood Cliffs, Nueva Jersey: Prentice-Hall.
  • Church, Kenneth Ward; Hanks, Patrick (1989). "Normas de asociación de palabras, información mutua y lexicografía" . Actas de la 27.ª Reunión Anual de la Asociación de Lingüística Computacional . 16 (1): 76– 83. doi : 10.3115/981623.981633 .
  • Gel'fand, IM; Yaglom, AM (1957). «Cálculo de la cantidad de información sobre una función aleatoria contenida en otra función similar». American Mathematical Society Translations . Serie 2. 12 : 199–246 . doi : 10.1090/trans2/012/09 . ISBN 978-0-8218-1712-4.{{cite journal}}: ISBN / Incompatibilidad de fechas ( ayuda ) Traducción al inglés del original en Uspekhi Matematicheskikh Nauk 12  (1):  3-52.
  • Guiasu, Silviu (1977). Teoría de la información con aplicaciones . McGraw-Hill, Nueva York. ISBN 978-0-07-025109-0.
  • Li, Ming; Vitányi, Paul (febrero de 1997). Una introducción a la complejidad de Kolmogorov y sus aplicaciones . Nueva York: Springer-Verlag . ISBN 978-0-387-94868-3.
  • Lockhead, GR (1970). "Identificación y la forma del espacio de discriminación multidimensional". Journal of Experimental Psychology . 85 (1): 1– 10. doi : 10.1037/h0029508 . PMID 5458322 . 
  • David JC MacKay. Teoría de la información, inferencia y algoritmos de aprendizaje. Cambridge: Cambridge University Press, 2003. ISBN 0-521-64298-1(Disponible gratuitamente en línea)
  • Haghighat, MBA; Aghagolzadeh, A.; Seyedarabi, H. (2011). "Una métrica de fusión de imágenes sin referencia basada en la información mutua de las características de la imagen". Computers & Electrical Engineering . 37 (5): 744– 756. doi : 10.1016/j.compeleceng.2011.07.012 . S2CID 7738541 . 
  • Athanasios Papoulis . Probabilidad, variables aleatorias y procesos estocásticos , segunda edición. Nueva York: McGraw-Hill, 1984. (Véase el capítulo 15).
  • Witten, Ian H. y Frank, Eibe (2005). Minería de datos: herramientas y técnicas prácticas de aprendizaje automático . Morgan Kaufmann, Ámsterdam. ISBN 978-0-12-374856-0Archivado del original el 27/11/2020 . Consultado el 28/06/2016 .
  • Peng, HC; Long, F. y Ding, C. (2005). "Selección de características basada en información mutua: criterios de dependencia máxima, relevancia máxima y redundancia mínima" . IEEE Transactions on Pattern Analysis and Machine Intelligence . 27 (8): 1226– 1238. CiteSeerX 10.1.1.63.5765 . doi : 10.1109/tpami.2005.159 . PMID 16119262. S2CID 206764015. Archivado del original el 22 de mayo de 2009. Recuperado el 28 de junio de 2016 .   
  • Andre S. Ribeiro; Stuart A. Kauffman; Jason Lloyd-Price; Bjorn Samuelsson y Joshua Socolar (2008). "Información mutua en modelos booleanos aleatorios de redes reguladoras". Physical Review E. 77 ( 1) 011901. arXiv : 0707.3642 . Bibcode : 2008PhRvE..77a1901R . doi : 10.1103/physreve.77.011901 . PMID 18351870. S2CID 15232112 .  
  • Wells, WM III; Viola, P.; Atsumi, H.; Nakajima, S.; Kikinis, R. (1996). "Registro de volumen multimodal mediante maximización de la información mutua" (PDF) . Medical Image Analysis . 1 (1): 35– 51. doi : 10.1016/S1361-8415(01)80004-9 . PMID 9873920. Archivado del original (PDF) el 6 de septiembre de 2008. Recuperado el 5 de agosto de 2010 . 
  • Pandey, Biswajit; Sarkar, Suman (2017). "¿Cuánto sabe una galaxia sobre su entorno a gran escala?: Una perspectiva de la teoría de la información" . Monthly Notices of the Royal Astronomical Society Letters . 467 (1): L6. arXiv : 1611.00283 . Bibcode : 2017MNRAS.467L...6P . doi : 10.1093/mnrasl/slw250 . S2CID 119095496 . 
  • Janssen, Joseph; Guan, Vincent; Robeva, Elina (2023). "Importancia de características ultramarginales: aprendizaje a partir de datos con garantías causales" . Conferencia Internacional sobre Inteligencia Artificial y Estadística : 10782–10814 . arXiv : 2204.09938 .