En estadística matemática , la divergencia de Kullback-Leibler ( KL ) (también llamada entropía relativa y divergencia I ), [ 1 ] denotada, es un tipo de distancia estadística : una medida de cuánto difiere una distribución de probabilidad aproximada Q de una distribución de probabilidad verdadera P. [ 2 ] [ 3 ] Matemáticamente, se define como
Una interpretación simple de la divergencia KL de P respecto de Q es la sorpresa excesiva esperada al usar la aproximación Q en lugar de P cuando la distribución real es P. Si bien es una medida de cuán diferentes son dos distribuciones y, por lo tanto, es una distancia en cierto sentido, en realidad no es una métrica , que es el tipo de distancia más familiar y formal. En particular, no es simétrica en las dos distribuciones (a diferencia de la variación de la información ) y no satisface la desigualdad triangular . En cambio, en términos de geometría de la información , es un tipo de divergencia , [ 4 ] una generalización de la distancia al cuadrado y, para ciertas clases de distribuciones (en particular una familia exponencial ), satisface un teorema de Pitágoras generalizado (que se aplica a las distancias al cuadrado). [ 5 ]
La divergencia KL es siempre un número real no negativo , con valor 0 si y solo si las dos distribuciones en cuestión son idénticas. Tiene diversas aplicaciones, tanto teóricas, como la caracterización de la entropía relativa (de Shannon) en sistemas de información, la aleatoriedad en series temporales continuas y la ganancia de información al comparar modelos estadísticos de inferencia ; como prácticas, como la estadística aplicada, la mecánica de fluidos , la neurociencia , la bioinformática y el aprendizaje automático .
Introducción y contexto
Consider two probability distributions, a true P and an approximating Q. Often, P represents the data, the observations, or a measured probability distribution and distribution Q represents instead a theory, a model, a description, or another approximation of P. However, sometimes the true distribution P represents a model and the approximating distribution Q represents (simulated) data that are intended to match the true distribution. The Kullback–Leibler divergence is then interpreted as the average difference of the number of bits required for encoding samples of P using a code optimized for Q rather than one optimized for P.
Note that the roles of P and Q can be reversed in some situations where that is easier to compute and the goal is to minimize , such as with the expectation–maximization algorithm (EM) and evidence lower bound (ELBO) computations. This role-reversal approach exploits that if and only if and that, in many cases, reducing one has the effect of reducing the other.
Etymology
The relative entropy was introduced by Solomon Kullback and Richard Leibler in Kullback & Leibler (1951) as "the mean information for discrimination between and per observation from ",[6] where one is comparing two probability measures , and are the hypotheses that one is selecting from measure (respectively). They denoted this by , and defined the "'divergence' between and " as the symmetrized quantity , que ya había sido definida y utilizada por Harold Jeffreys en 1948. [ 7 ] En Kullback (1959) , la forma simetrizada se denomina nuevamente "divergencia", y las entropías relativas en cada dirección se denominan "divergencias dirigidas" entre dos distribuciones; [ 8 ] Kullback prefería el término información de discriminación . [ 9 ] El término "divergencia" contrasta con una distancia (métrica), ya que la divergencia simetrizada no satisface la desigualdad triangular. [ 10 ] En Kullback (1959) se dan numerosas referencias a usos anteriores de la divergencia simetrizada y a otras distancias estadísticas . [ 11 ] La "divergencia dirigida" asimétrica ha llegado a conocerse como la divergencia de Kullback-Leibler, mientras que la "divergencia" simetrizada se denomina ahora divergencia de Jeffreys .
Definición
Para distribuciones de probabilidad discretas P y Q definidas en el mismo espacio muestral ,, la entropía relativa de Q a P se define [ 12 ] como
lo cual es equivalente a
En otras palabras, es la esperanza de la diferencia logarítmica entre las probabilidades P y Q , donde la esperanza se toma utilizando las probabilidades P.
La entropía relativa solo se define de esta manera si, para todo x ,implica( continuidad absoluta ). De lo contrario, a menudo se define como, [ 1 ] pero el valores posible incluso sien todas partes, [ 13 ] [ 14 ] siempre quees de extensión infinita. Comentarios análogos se aplican a los casos de medida continua y general que se definen a continuación.
Cuando seaes cero la contribución del término correspondiente se interpreta como cero porque
Para las distribuciones P y Q de una variable aleatoria continua , la entropía relativa se define como la integral [ 15 ].
donde p y q denotan las funciones de densidad de probabilidad de P y Q.
De manera más general, si P y Q son medidas de probabilidad en un espacio medibley P es absolutamente continua con respecto a Q , entonces la entropía relativa de Q a P se define como
dóndees la derivada de Radon-Nikodym de P con respecto a Q , es decir, la única función Q definida casi en todas partes r ende tal manera queque existe porque P es absolutamente continua con respecto a Q. También suponemos que la expresión del lado derecho existe. De forma equivalente (por la regla de la cadena ), esto se puede escribir como
que es la entropía de P en relación con Q. Continuando en este caso, si¿Hay alguna medida sobrepara las cuales densidades p y q conyexisten (lo que significa que P y Q son ambos absolutamente continuos con respecto a), entonces la entropía relativa de Q a P viene dada por
Tenga en cuenta que tal medidapara las cuales se pueden definir densidades siempre existe, ya que se puede tomarAunque en la práctica se suele utilizar una medida que se aplica en el contexto, como la medida de conteo para distribuciones discretas, o la medida de Lebesgue o una variante conveniente como la medida gaussiana o la medida uniforme en la esfera , la medida de Haar en un grupo de Lie, etc., para distribuciones continuas. Los logaritmos en estas fórmulas se suelen tomar en base 2 si la información se mide en bits , o en base e si se mide en nats . La mayoría de las fórmulas que involucran entropía relativa son válidas independientemente de la base del logaritmo.
Existen diversas convenciones para referirse aen palabras. A menudo se la denomina divergencia entre P y Q , pero esto no logra transmitir la asimetría fundamental en la relación. A veces, como en este artículo, se puede describir como la divergencia de P de Q o como la divergencia de Q a P. Esto refleja la asimetría en la inferencia bayesiana , que parte de una distribución previa Q y se actualiza a la posterior P. Otra forma común de referirse aes como la entropía relativa de P con respecto a Q o la ganancia de información de P sobre Q.
Ejemplo básico
Kullback [ 3 ] proporciona el siguiente ejemplo (Tabla 2.1, Ejemplo 2.1). Sean P y Q las distribuciones que se muestran en la tabla y la figura. P es la distribución del lado izquierdo de la figura, una distribución binomial cony. Q es la distribución del lado derecho de la figura, una distribución uniforme discreta con los tres resultados posibles x =0 ,1 ,2 (es decir,), cada uno con probabilidad.

entropías relativasyse calculan de la siguiente manera. Este ejemplo utiliza el logaritmo natural con base e , denominado ln para obtener resultados en nats (ver unidades de información ):
Interpretaciones
Estadística
En el campo de la estadística, el lema de Neyman-Pearson establece que la forma más poderosa de distinguir entre las dos distribuciones P y Q basándose en una observación Y (extraída de una de ellas) es a través del logaritmo de la razón de sus verosimilitudes:La divergencia KL es el valor esperado de este estadístico si Y se extrae realmente de P. Kullback motivó el estadístico como una razón de verosimilitud logarítmica esperada. [ 16 ]
Codificación
En el contexto de la teoría de la codificación ,se puede construir midiendo el número esperado de bits adicionales necesarios para codificar muestras de P usando un código optimizado para Q en lugar del código optimizado para P.
Inferencia
En el contexto del aprendizaje automático ,A menudo se denomina ganancia de información que se lograría si se utilizara P en lugar de Q , que es la que se utiliza actualmente. Por analogía con la teoría de la información, se denomina entropía relativa de P con respecto a Q.
Expresado en el lenguaje de la inferencia bayesiana ,es una medida de la información obtenida al revisar las creencias de uno desde la distribución de probabilidad previa Q a la distribución de probabilidad posterior P. En otras palabras, es la cantidad de información perdida cuando se usa Q para aproximar P. [ 17 ]
Geometría de la información
En las aplicaciones, P suele representar la distribución "verdadera" de los datos, las observaciones o una distribución teórica calculada con precisión, mientras que Q suele representar una teoría, un modelo, una descripción o una aproximación de P. Para encontrar una distribución Q que sea la más cercana a P , podemos minimizar la divergencia KL y calcular una proyección de información .
Si bien es una distancia estadística , no es una métrica , el tipo de distancia más familiar, sino una divergencia . [ 4 ] Mientras que las métricas son simétricas y generalizan la distancia lineal , satisfaciendo la desigualdad triangular , las divergencias son asimétricas y generalizan la distancia al cuadrado , en algunos casos satisfaciendo un teorema de Pitágoras generalizado . En generalno es igual, y la asimetría es una parte importante de la geometría. [ 4 ] La forma infinitesimal de la entropía relativa, específicamente su hessiano , da un tensor métrico que es igual a la métrica de información de Fisher ; véase § Métrica de información de Fisher . La métrica de información de Fisher en la distribución de probabilidad determinada permite determinar el gradiente natural para los algoritmos de optimización geométrica de la información. [ 18 ] Su versión cuántica es la métrica de Fubini-study. [ 19 ] La entropía relativa satisface un teorema de Pitágoras generalizado para familias exponenciales (interpretado geométricamente como variedades dualmente planas ), y esto permite minimizar la entropía relativa por medios geométricos, por ejemplo, mediante proyección de información y en la estimación de máxima verosimilitud . [ 5 ]
La entropía relativa es la divergencia de Bregman generada por la entropía negativa, pero también tiene la forma de una f -divergencia . Para probabilidades sobre un alfabeto finito , es única por pertenecer a ambas clases de divergencias estadísticas . La aplicación de la divergencia de Bregman se encuentra en el descenso espejo . [ 20 ]
Finanzas (teoría de juegos)
Consideremos a un inversor que busca optimizar el crecimiento en un juego justo con resultados mutuamente excluyentes (por ejemplo, una "carrera de caballos" en la que las probabilidades oficiales suman uno). La tasa de rendimiento esperada por dicho inversor es igual a la entropía relativa entre las probabilidades que cree el inversor y las probabilidades oficiales. [ 21 ] Este es un caso especial de una relación mucho más general entre los rendimientos financieros y las medidas de divergencia. [ 22 ]
Los riesgos financieros están relacionados conmediante geometría de la información. [ 23 ] Las perspectivas de los inversores, la visión predominante del mercado y los escenarios de riesgo forman triángulos en la variedad relevante de distribuciones de probabilidad. La forma de los triángulos determina los riesgos financieros clave (tanto cualitativa como cuantitativamente). Por ejemplo, los triángulos obtusos en los que las perspectivas de los inversores y los escenarios de riesgo aparecen en "lados opuestos" con respecto al mercado describen riesgos negativos, los triángulos agudos describen una exposición positiva y la situación de ángulo recto en el medio corresponde a riesgo cero. Extendiendo este concepto, la entropía relativa puede utilizarse hipotéticamente para identificar el comportamiento de los inversores informados, si se considera que esto está representado por la magnitud y las desviaciones con respecto a las expectativas previas de los flujos de fondos, por ejemplo. [ 24 ]
Motivación

En teoría de la información, el teorema de Kraft-McMillan establece que cualquier esquema de codificación directamente decodificable para codificar un mensaje para identificar un valorDe un conjunto de posibilidades, X puede considerarse como la representación de una distribución de probabilidad implícita.sobre X , dondees la longitud del código paraen bits. Por lo tanto, la entropía relativa puede interpretarse como la longitud de mensaje adicional esperada por dato que debe comunicarse si se utiliza un código que es óptimo para una distribución (incorrecta) dada Q , en comparación con el uso de un código basado en la distribución verdadera P : es la entropía en exceso .
dóndees la entropía cruzada de Q en relación con P yes la entropía de P (que es lo mismo que la entropía cruzada de P consigo mismo).
La entropía relativapuede pensarse geométricamente como una distancia estadística , una medida de cuán lejos está la distribución Q de la distribución P. Geométricamente es una divergencia : una forma asimétrica y generalizada de distancia al cuadrado. La entropía cruzadaes en sí misma una medida de este tipo (formalmente una función de pérdida ), pero no puede pensarse como una distancia, ya queno es cero. Esto se puede solucionar restandohacerConcuerda mejor con nuestra noción de distancia, como pérdida adicional . La función resultante es asimétrica, y aunque puede simetrizarse (véase § Divergencia simetrizada ), la forma asimétrica resulta más útil. Véase § Interpretaciones para más información sobre la interpretación geométrica.
La entropía relativa se relaciona con la " función de tasa " en la teoría de grandes desviaciones . [ 25 ] [ 26 ]
Arthur Hobson demostró que la entropía relativa es la única medida de diferencia entre distribuciones de probabilidad que satisface algunas propiedades deseadas, que son la extensión canónica de las que aparecen en una caracterización comúnmente utilizada de la entropía . [ 27 ] En consecuencia, la información mutua es la única medida de dependencia mutua que obedece ciertas condiciones relacionadas, ya que puede definirse en términos de la divergencia de Kullback-Leibler .
Propiedades
- La entropía relativa siempre es no negativa ,un resultado conocido como desigualdad de Gibbs , cones igual a cero si y solo sicomo medidas.
En particular, siy, entonces- casi en todas partes . La entropíade esta forma se establece un valor mínimo para la entropía cruzada., el número esperado de bits necesarios cuando se utiliza un código basado en Q en lugar de P ; y la divergencia de Kullback-Leibler representa, por lo tanto, el número esperado de bits adicionales que deben transmitirse para identificar un valor x extraído de X , si se utiliza un código que corresponde a la distribución de probabilidad Q , en lugar de la distribución "verdadera" P.
- No existe un límite superior para el caso general. Sin embargo, se demuestra que si P y Q son dos distribuciones de probabilidad discretas construidas distribuyendo la misma cantidad discreta, entonces el valor máximo dese puede calcular. [ 28 ]
- La entropía relativa permanece bien definida para distribuciones continuas y, además, es invariante bajo transformaciones de parámetros . Por ejemplo, si se realiza una transformación de la variable x a la variable, entonces, ya queydóndees el valor absoluto de la derivada o, más generalmente, del jacobiano , la entropía relativa puede reescribirse:dóndeyAunque se asumió que la transformación era continua, esto no tiene por qué ser así. Esto también demuestra que la entropía relativa produce una cantidad dimensionalmente consistente , ya que si x es una variable dimensional,yTambién se dimensionan, ya que, por ejemplo,es adimensional. El argumento del término logarítmico es y sigue siendo adimensional, como debe ser. Por lo tanto, puede considerarse, en cierto modo, una magnitud más fundamental que otras propiedades de la teoría de la información [ 29 ] (como la autoinformación o la entropía de Shannon ), que pueden volverse indefinidas o negativas para probabilidades no discretas.
- La entropía relativa es aditiva para distribuciones independientes de forma muy similar a la entropía de Shannon. Sison distribuciones independientes yy asimismopara distribuciones independientesentonces
- Entropía relativaes convexa en el par de medidas de probabilidad, es decir siyson dos pares de medidas de probabilidad entonces
- Puede que Taylor haya ampliado su mínimo (es decir,) comoque converge si y solo sicasi con seguridad con respecto a.
Denotary tenga en cuenta que. La primera derivada depuede derivarse y evaluarse de la siguiente manera Se pueden obtener y evaluar otros derivados de la siguiente manera: Por lo tanto, resolviendo paraa través de la expansión de Taylor deacerca deevaluado enrendimientos como condición suficiente para la convergencia de la serie según el siguiente argumento de convergencia absoluta como también es una condición necesaria para la convergencia de la serie por la siguiente demostración por contradicción. Supongamos quecon medida estrictamente mayor queDe ello se deduce que deben existir algunos valores,, yde tal manera queycon medida. La prueba de suficiencia anterior demostró que la medidacomponente de la serie dondeestá acotado, por lo que solo necesitamos preocuparnos por el comportamiento de la medida.componente de la serie donde. El valor absoluto delEl término n de este componente de la serie está entonces acotado inferiormente por, que no tiene límites como, por lo que la serie diverge.
Fórmula de dualidad para la inferencia variacional
El siguiente resultado, debido a Donsker y Varadhan, [ 30 ] se conoce como la fórmula variacional de Donsker y Varadhan .
Teorema [Fórmula de dualidad para inferencia variacional] — Seaser un conjunto dotado de una característica apropiada-campoy dos medidas de probabilidad P y Q , que formulan dos espacios de probabilidady, con. (indica que Q es absolutamente continua con respecto a P. ) Sea h una variable aleatoria integrable de valor real enEntonces se cumple la siguiente igualdad.
Además, el supremo del lado derecho se alcanza si y solo si se cumple
casi con seguridad con respecto a la medida de probabilidad P , dondedenota la derivada de Radon-Nikodym de Q con respecto a P.
Para una demostración breve asumiendo la integrabilidad decon respecto a P , seatienen densidad P, es decirEntonces
Por lo tanto,
donde la última desigualdad se deduce de, para la cual la igualdad se produce si y solo siLa conclusión es la siguiente.
Ejemplos
Distribuciones normales multivariadas
Supongamos que tenemos dos distribuciones normales multivariadas , con mediasy con matrices de covarianza (no singulares)Si las dos distribuciones tienen la misma dimensión, k , entonces la entropía relativa entre las distribuciones es la siguiente: [ 31 ]
El logaritmo del último término debe tomarse en base e, ya que todos los términos, excepto el último, son logaritmos en base e de expresiones que son factores de la función de densidad o que surgen de forma natural. Por lo tanto, la ecuación da un resultado medido en nats . Dividiendo toda la expresión anterior porproduce la divergencia en bits .
En una implementación numérica, es útil expresar el resultado en términos de las descomposiciones de Cholesky.de tal manera queyLuego, con M e y soluciones a los sistemas lineales triangulares, y,
Un caso especial, y una magnitud común en la inferencia variacional , es la entropía relativa entre una distribución normal multivariada diagonal y una distribución normal estándar (con media cero y varianza unitaria):
Para dos distribuciones normales univariadas p y q, lo anterior se simplifica a [ 32 ].
En el caso de distribuciones normales co-centradas con, esto se simplifica [ 33 ] a:
Distribuciones uniformes
Consideremos dos distribuciones uniformes, con soporte deencerrado dentro(). Entonces, la ganancia de información es:
Intuitivamente, [ 33 ] la ganancia de información a una distribución uniforme k veces más estrecha contienebits. Esto se relaciona con el uso de bits en la informática, dondeSe necesitarían bits para identificar un elemento de una secuencia de k bits de longitud.
Familia exponencial
La familia exponencial de distribuciones viene dada por
dóndees medida de referencia,es estadística suficiente ,son parámetros naturales canónicos yes la función log-partition.
La divergencia KL entre dos distribucionesyestá dado por [ 34 ]
dóndees el parámetro medio de.
Por ejemplo, para la distribución de Poisson con media, las estadísticas suficientes, el parámetro naturaly función de partición de registro. Por lo tanto, la divergencia entre dos distribuciones de Poisson con mediasyes
Como otro ejemplo, para una distribución normal con varianza unitaria, las estadísticas suficientes, el parámetro naturaly función de partición de registro. Por lo tanto, la divergencia entre dos distribuciones normalesyes
Como ejemplo final, la divergencia entre una distribución normal con varianza unitariay una distribución de Poisson con mediaes
Relación con las métricas
Si bien la entropía relativa es una distancia estadística , no es una métrica en el espacio de distribuciones de probabilidad, sino una divergencia . [ 4 ] Mientras que las métricas son simétricas y generalizan la distancia lineal , satisfaciendo la desigualdad triangular , las divergencias son asimétricas en general y generalizan la distancia al cuadrado , en algunos casos satisfaciendo un teorema de Pitágoras generalizado . En generalno es igualy si bien esto puede simetrizarse (véase § Divergencia simetrizada ), la asimetría es una parte importante de la geometría. [ 4 ]
Genera una topología en el espacio de distribuciones de probabilidad . Más concretamente, sies una secuencia de distribuciones tal que
entonces se dice que
La desigualdad de Pinsker implica que
donde este último representa la convergencia habitual en la variación total .
Métrica de información de Fisher
La entropía relativa está directamente relacionada con la métrica de información de Fisher . Esto se puede explicitar de la siguiente manera. Supongamos que las distribuciones de probabilidad P y Q están parametrizadas por algún parámetro (posiblemente multidimensional).Consideremos entonces dos valores cercanos deyde modo que el parámetrodifiere solo en una pequeña cantidad del valor del parámetro.. Específicamente, hasta primer orden se tiene (usando la convención de suma de Einstein )
conun pequeño cambio deen la dirección j , yla tasa de cambio correspondiente en la distribución de probabilidad. Dado que la entropía relativa tiene un mínimo absoluto 0 para, es decir, cambia solo a segundo orden en los parámetros pequeños. Más formalmente, como para cualquier mínimo, las primeras derivadas de la divergencia se anulan
y mediante la expansión de Taylor se tiene hasta segundo orden
donde la matriz hessiana de la divergencia
debe ser semidefinido positivo . Dejandovariar (y eliminando el subíndice 0) el Hessianodefine una métrica riemanniana (posiblemente degenerada) en el espacio de parámetros θ , llamada métrica de información de Fisher.
Teorema de la métrica de información de Fisher
Existe un teorema asociado. [ 3 ] CuandoSatisface las siguientes condiciones de regularidad:
existir,
donde ξ es independiente de ρ
entonces:
Variación de la información
Otra métrica de la teoría de la información es la variación de la información , que es aproximadamente una simetrización de la entropía condicional . Es una métrica en el conjunto de particiones de un espacio de probabilidad discreto .
MALVA Métrico
MAUVE es una medida de la brecha estadística entre dos distribuciones de texto, como la diferencia entre el texto generado por un modelo y el texto escrito por un humano. Esta medida se calcula utilizando las divergencias de Kullback-Leibler entre las dos distribuciones en un espacio de incrustación cuantificado de un modelo base .
Relación con otras cantidades de la teoría de la información
Muchas de las demás magnitudes de la teoría de la información pueden interpretarse como aplicaciones de la entropía relativa a casos específicos.
Autoinformación
La autoinformación , también conocida como el contenido informativo de una señal, variable aleatoria o evento, se define como el logaritmo negativo de la probabilidad de que ocurra el resultado dado.
Cuando se aplica a una variable aleatoria discreta , la autoinformación se puede representar como
es la entropía relativa de la distribución de probabilidadde un delta de Kronecker que representa la certeza de que— es decir, el número de bits adicionales que deben transmitirse para identificar i si solo la distribución de probabilidadestá disponible para el receptor, no el hecho de que.
Información mutua
La información mutua ,
es la entropía relativa de la distribución de probabilidad conjuntadel productode las dos distribuciones de probabilidad marginales , es decir, el número esperado de bits adicionales que deben transmitirse para identificar X e Y si se codifican utilizando solo sus distribuciones marginales en lugar de la distribución conjunta.
entropía de Shannon
La entropía de Shannon ,
es el número de bits que habría que transmitir para identificar X entre N posibilidades igualmente probables, menos la entropía relativa de la distribución uniforme en las variables aleatorias de X ,, de la distribución verdadera— es decir, menos el número esperado de bits ahorrados, que habrían tenido que enviarse si el valor de X se codificara según la distribución uniforme.en lugar de la distribución verdaderaEsta definición de entropía de Shannon constituye la base de la generalización alternativa de ET Jaynes a las distribuciones continuas, la densidad límite de puntos discretos (a diferencia de la entropía diferencial usual ), que define la entropía continua como lo cual es equivalente a:
Entropía condicional
La entropía condicional [ 35 ] ,
es el número de bits que habría que transmitir para identificar X entre N posibilidades igualmente probables, menos la entropía relativa de la distribución conjunta verdadera.de la distribución del productodesde — es decir, menos el número esperado de bits ahorrados que se habrían tenido que enviar si el valor de X se codificara según la distribución uniformeen lugar de la distribución condicionalde X dado Y.
entropía cruzada
Cuando tenemos un conjunto de eventos posibles, provenientes de la distribución p , podemos codificarlos (con una compresión de datos sin pérdidas ) utilizando la codificación de entropía . Esto comprime los datos reemplazando cada símbolo de entrada de longitud fija con un código único, de longitud variable y sin prefijo correspondiente (por ejemplo, los eventos (A, B, C) con probabilidades p = (1/2, 1/4, 1/4) se pueden codificar como los bits (0, 10, 11)). Si conocemos la distribución p de antemano, podemos diseñar una codificación que sería óptima (por ejemplo, utilizando la codificación de Huffman ). Esto significa que los mensajes que codificamos tendrán la longitud más corta en promedio (suponiendo que los eventos codificados se muestrean de p ), que será igual a la entropía de Shannon de p (denotada comoSin embargo, si utilizamos una distribución de probabilidad diferente ( q ) al crear el esquema de codificación de entropía, entonces se utilizará un mayor número de bits (en promedio) para identificar un evento de un conjunto de posibilidades. Este nuevo número (mayor) se mide mediante la entropía cruzada entre p y q .
La entropía cruzada entre dos distribuciones de probabilidad ( p y q ) mide el número promedio de bits necesarios para identificar un evento de un conjunto de posibilidades, si se utiliza un esquema de codificación basado en una distribución de probabilidad q dada , en lugar de la distribución "verdadera" p . La entropía cruzada para dos distribuciones p y q sobre el mismo espacio de probabilidad se define de la siguiente manera.
Para una derivación explícita de esto, consulte la sección de Motivación anterior.
En este escenario, las entropías relativas (divergencia kl) pueden interpretarse como el número adicional de bits, en promedio, que se necesitan (más allá de) para codificar los eventos debido al uso de q para construir el esquema de codificación en lugar de p .
Actualización bayesiana
En estadística bayesiana , la entropía relativa puede utilizarse como medida de la ganancia de información al pasar de una distribución previa a una distribución posterior :Si algún hecho nuevouna vez descubierto, puede utilizarse para actualizar la distribución posterior de X a partir dea una nueva distribución posteriorUtilizando el teorema de Bayes :
Esta distribución tiene una nueva entropía :
que puede ser menor o mayor que la entropía originalSin embargo, desde el punto de vista de la nueva distribución de probabilidad se puede estimar que para haber utilizado el código original basado enen lugar de un nuevo código basado enhabría añadido un número esperado de bits:
a la longitud del mensaje. Por lo tanto, esto representa la cantidad de información útil, o ganancia de información, sobre X , que se ha aprendido al descubrir.
Si se dispone de un dato adicional,Posteriormente, entra en juego la distribución de probabilidad para x , que puede actualizarse aún más para dar una nueva mejor estimación.. Si uno vuelve a investigar la ganancia de información para usaren vez deResulta que puede ser mayor o menor de lo estimado previamente:
puede ser ≤ o > que
y por lo tanto, la ganancia de información combinada no obedece la desigualdad triangular:
puede ser <, = o > que
Todo lo que se puede decir es que, en promedio , promediando usando, ambos lados se compensarán.
diseño experimental bayesiano
Un objetivo común en el diseño experimental bayesiano es maximizar la entropía relativa esperada entre la distribución a priori y la distribución a posteriori. [ 36 ] Cuando las distribuciones a posteriori se aproximan a distribuciones gaussianas, un diseño que maximiza la entropía relativa esperada se denomina óptimo bayesiano d .
Información sobre discriminación
Entropía relativaTambién puede interpretarse como la información de discriminación esperada paraencima: la información media por muestra para discriminar a favor de una hipótesiscontra una hipótesis, cuando la hipótesises cierto. [ 37 ] Otro nombre para esta cantidad, dado por IJ Good , es el peso esperado de la evidencia paraencimalo que se espera de cada muestra.
El peso esperado de la evidencia paraencimano es lo mismo que la ganancia de información esperada por muestra sobre la distribución de probabilidadde las hipótesis,
Cualquiera de las dos cantidades puede utilizarse como función de utilidad en el diseño experimental bayesiano para elegir la siguiente pregunta óptima a investigar; sin embargo, en general, darán lugar a estrategias experimentales bastante diferentes.
En la escala de entropía de ganancia de información , la diferencia entre la certeza casi absoluta y la absoluta es mínima: codificar con certeza casi absoluta requiere apenas más bits que codificar con certeza absoluta. Por otro lado, en la escala logit , implícita en el peso de la evidencia, la diferencia entre ambas es enorme, quizás infinita; esto podría reflejar la diferencia entre estar casi seguro (a nivel probabilístico) de que, por ejemplo, la hipótesis de Riemann es correcta, en comparación con estar seguro de que es correcta porque se tiene una prueba matemática . Estas dos escalas diferentes de función de pérdida para la incertidumbre son útiles , según la medida en que cada una refleje las circunstancias particulares del problema en cuestión.
Principio de información mínima discriminatoria
La idea de la entropía relativa como información de discriminación llevó a Kullback a proponer el Principio deInformación mínima de discriminación (MDI): dados los nuevos hechos,se debe elegirflo más pequeño posible; de modo que los nuevos datos produzcan la menor ganancia de información posible.en la medida de lo posible.
Por ejemplo, si se tuviera una distribución previasobre x y a , y posteriormente aprendió que la verdadera distribución de a era, entonces la entropía relativa entre la nueva distribución conjunta para x y a ,y la distribución previa anterior sería:
es decir, la suma de la entropía relativa dela distribución previa para a de la distribución actualizada, más el valor esperado (utilizando la distribución de probabilidad)) de la entropía relativa de la distribución condicional previade la nueva distribución condicional. (Tenga en cuenta que a menudo el valor esperado posterior se denomina entropía relativa condicional (o divergencia de Kullback-Leibler condicional ) y se denota por[ 3 ] [ 35 ] ) Esto se minimiza sisobre todo el apoyo de; y observamos que este resultado incorpora el teorema de Bayes, si la nueva distribuciónes de hecho una función δ que representa la certeza de que a tiene un valor particular.
El MDI puede considerarse una extensión del Principio de Razón Insuficiente de Laplace y del Principio de Máxima Entropía de E.T. Jaynes . En particular, es la extensión natural del principio de máxima entropía de distribuciones discretas a continuas, para las cuales la entropía de Shannon deja de ser tan útil (véase entropía diferencial ), pero la entropía relativa sigue siendo igual de relevante.
En la literatura de ingeniería, el MDI a veces se denomina Principio de Entropía Cruzada Mínima (MCE) o Minxent para abreviar. Minimizar la entropía relativa de m a p con respecto a m es equivalente a minimizar la entropía cruzada de p y m , ya que
lo cual es apropiado si se intenta elegir una aproximación adecuada a p . Sin embargo, con la misma frecuencia, esta no es la tarea que se intenta lograr. En cambio, con la misma frecuencia, es m la que es alguna medida de referencia previa fija, y p la que se intenta optimizar minimizandosujeto a alguna restricción. Esto ha llevado a cierta ambigüedad en la literatura, y algunos autores intentan resolver la inconsistencia redefiniendo la entropía cruzada para que sea, en vez de.
Relación con el trabajo disponible

Las sorpresas [ 38 ] se suman donde se multiplican las probabilidades. La sorpresa para un evento de probabilidad p se define como. Si k esentonces la sorpresa está ennats, bits ode modo que, por ejemplo, hay N bits de sorpresa al obtener todas "cara" en un lanzamiento de N monedas.
Los estados de mejor estimación (por ejemplo, para átomos en un gas) se infieren maximizando la sorpresa promedio S ( entropía ) para un conjunto dado de parámetros de control (como la presión P o el volumen V ). Esta maximización de la entropía restringida , tanto clásica [ 39 ] como cuánticamente [ 40 ] , minimiza la disponibilidad de Gibbs en unidades de entropía [ 41 ].donde Z es una función de multiplicidad o partición restringida .
Cuando la temperatura T es fija, la energía libre () también se minimiza. Por lo tanto, siy el número de moléculas N son constantes, la energía libre de Helmholtz(donde U es energía y S es entropía) se minimiza a medida que un sistema "se equilibra". Si T y P se mantienen constantes (por ejemplo, durante los procesos en su cuerpo), la energía libre de Gibbsen cambio se minimiza. El cambio en la energía libre bajo estas condiciones es una medida del trabajo disponible que podría realizarse en el proceso. Por lo tanto, el trabajo disponible para un gas ideal a temperatura constantey presiónesdóndey(véase también la desigualdad de Gibbs ).
De forma más general [ 42 ] el trabajo disponible en relación con algún ambiente se obtiene multiplicando la temperatura ambiente.por entropía relativa o sorpresa netadefinido como el valor promedio dedóndees la probabilidad de un estado dado en condiciones ambientales. Por ejemplo, el trabajo disponible para equilibrar un gas ideal monoatómico a valores ambientales deyes asídonde la entropía relativa
Los contornos resultantes de entropía relativa constante, mostrados a la derecha para un mol de argón a temperatura y presión estándar , por ejemplo, establecen límites a la conversión de caliente a frío, como en el aire acondicionado alimentado por llama o en el dispositivo sin energía para convertir agua hirviendo en agua helada que se analiza aquí. [ 43 ] Por lo tanto, la entropía relativa mide la disponibilidad termodinámica en bits.
Teoría de la información cuántica
Para matrices de densidad P y Q en un espacio de Hilbert , la entropía relativa cuántica de Q a P se define como
En la ciencia de la información cuántica el mínimo deEn todos los estados separables, Q también puede utilizarse como una medida de entrelazamiento en el estado P.
Relación entre modelos y realidad
Así como la entropía relativa de "lo real con respecto al ambiente" mide la disponibilidad termodinámica, la entropía relativa de "la realidad con respecto a un modelo" también es útil incluso si las únicas pistas que tenemos sobre la realidad son algunas mediciones experimentales. En el primer caso, la entropía relativa describe la distancia al equilibrio o (cuando se multiplica por la temperatura ambiente) la cantidad de trabajo disponible , mientras que en el segundo caso nos informa sobre las sorpresas que la realidad nos depara o, en otras palabras, cuánto le falta aprender al modelo .
Aunque esta herramienta para evaluar modelos frente a sistemas accesibles experimentalmente puede aplicarse en cualquier campo, su aplicación para seleccionar un modelo estadístico mediante el criterio de información de Akaike se describe particularmente bien en los artículos [ 44 ] y en el libro [ 45 ] de Burnham y Anderson. En resumen, la entropía relativa de la realidad de un modelo puede estimarse, con una precisión de un término aditivo constante, mediante una función de las desviaciones observadas entre los datos y las predicciones del modelo (como la desviación cuadrática media ). Las estimaciones de dicha divergencia para modelos que comparten el mismo término aditivo pueden utilizarse, a su vez, para seleccionar entre modelos.
Al intentar ajustar modelos parametrizados a los datos, existen varios estimadores que intentan minimizar la entropía relativa, como los estimadores de máxima verosimilitud y de espaciamiento máximo .
Divergencia simetrizada
Kullback y Leibler (1951) también consideraron la función simetrizada: [ 6 ]
a la que se referían como la "divergencia", aunque hoy en día la "divergencia KL" se refiere a la función asimétrica (véase § Etimología para la evolución del término). Esta función es simétrica y no negativa, y ya había sido definida y utilizada por Harold Jeffreys en 1948; [ 7 ] por consiguiente se la denomina divergencia de Jeffreys .
Esta magnitud se ha utilizado en ocasiones para la selección de características en problemas de clasificación , donde P y Q son las funciones de densidad de probabilidad condicional de una característica bajo dos clases diferentes. En los sectores bancario y financiero, esta magnitud se conoce como Índice de Estabilidad de la Población ( PSI , por sus siglas en inglés) y se utiliza para evaluar los cambios en la distribución de las características del modelo a lo largo del tiempo.
Se ofrece una alternativa a través de la-divergencia,
lo cual puede interpretarse como la ganancia de información esperada sobre X al descubrir de qué distribución de probabilidad se extrae X , P o Q , si actualmente tienen probabilidadesyrespectivamente.
El valorda la divergencia de Jensen-Shannon , definida por
donde M es el promedio de las dos distribuciones,
También podemos interpretarcomo la capacidad de un canal de información ruidoso con dos entradas que dan las distribuciones de salida P y Q. La divergencia de Jensen-Shannon, como todas las f -divergencias, es localmente proporcional a la métrica de información de Fisher . Es similar a la métrica de Hellinger (en el sentido de que induce la misma conexión afín en una variedad estadística ).
Además, la divergencia de Jensen-Shannon puede generalizarse utilizando mezclas estadísticas abstractas M que se basan en una media abstracta M. [ 46 ] [ 47 ]
Relación con otras medidas de distancia de probabilidad
Existen muchas otras medidas importantes de distancia de probabilidad . Algunas de ellas están particularmente relacionadas con la entropía relativa. Por ejemplo:
- La distancia de variación total ,Esto está relacionado con la divergencia a través de la desigualdad de Pinsker :La desigualdad de Pinsker es vacía para cualquier distribución donde, ya que la distancia de variación total es como máximo 1. Para tales distribuciones, se puede utilizar una cota alternativa, debido a Bretagnolle y Huber [ 48 ] (véase también Tsybakov [ 49 ] ):
- La familia de divergencias de Rényi generaliza la entropía relativa. Dependiendo del valor de un determinado parámetro,De ello se pueden deducir diversas desigualdades.
Otras medidas de distancia notables incluyen la distancia de Hellinger , la intersección de histogramas , la estadística chi-cuadrado , la distancia de forma cuadrática , la distancia de coincidencia , la distancia de Kolmogorov-Smirnov y la distancia del transportador de tierra . [ 50 ]
Diferenciación de datos
Así como la entropía absoluta sirve como base teórica para la compresión de datos , la entropía relativa sirve como base teórica para la diferenciación de datos : la entropía absoluta de un conjunto de datos en este sentido es la cantidad de datos necesarios para reconstruirlo (tamaño mínimo comprimido), mientras que la entropía relativa de un conjunto de datos objetivo, dado un conjunto de datos fuente, es la cantidad de datos necesarios para reconstruir el objetivo dado el origen (tamaño mínimo de un parche ).
Véase también
- criterio de información de Akaike
- Criterio de información bayesiano
- divergencia de Bregman
- entropía cruzada
- criterio de información de desviación
- Valor entrópico en riesgo
- Desigualdad de poder de entropía
- distancia de Hellinger
- Ganancia de información en árboles de decisión
- índice de ganancia de información
- teoría de la información y teoría de la medida
- divergencia de Jensen-Shannon
- entropía relativa cuántica
- Solomon Kullback y Richard Leibler
- Distancia de Bhattacharyya
Referencias
- 1 2 Csiszar, I (febrero de 1975). "Geometría de la divergencia I de las distribuciones de probabilidad y problemas de minimización" . Ann. Probab . 3 (1): 146– 158. doi : 10.1214/aop/1176996454 .
- ↑ Kullback, S. ; Leibler, RA (1951). "Sobre la información y la suficiencia" . Annals of Mathematical Statistics . 22 (1): 79– 86. doi : 10.1214/aoms/1177729694 . JSTOR 2236703 . MR 0039968 .
- 1 2 3 4 Kullback 1959 .
- 1 2 3 4 5 Amari 2016 , pág. 11.
- 1 2 Amari 2016 , pág. 28.
- 1 2 Kullback y Leibler 1951 , pág. 80.
- 1 2 Jeffreys 1948 , pág. 158.
- ↑ Kullback 1959 , pág. 7.
- ↑ Kullback, S. (1987). "Carta al editor: La distancia de Kullback-Leibler" . The American Statistician . 41 (4): 340– 341. doi : 10.1080/00031305.1987.10475510 . JSTOR 2684769 .
- ↑ Kullback 1959 , pág. 6.
- ↑ Kullback 1959 , pp. 6–7, §1.3 Divergencia.
- ↑ MacKay, David JC (2003). Teoría de la información, inferencia y algoritmos de aprendizaje (1.ª ed.). Cambridge University Press. pág . 34. ISBN 978-0-521-64298-9– vía Google Libros.
- ↑ "¿Cuál es el valor máximo de la divergencia de Kullback-Leibler (KL)?" . Aprendizaje automático. Statistics Stack Exchange (stats.stackexchange.com) . Validado cruzadamente.
- ↑ "¿En qué situaciones la integral es igual a infinito?" . Integración. Mathematics Stack Exchange (math.stackexchange.com) .
- ↑ Bishop, Christopher M. Reconocimiento de patrones y aprendizaje automático . pág. 55. OCLC 1334664824 .
- ↑ Kullback 1959 , pág. 5.
- ↑ Burnham, KP; Anderson, DR (2002). Selección de modelos e inferencia multimodelos (2.ª ed.). Springer. pág . 51. ISBN 978-0-387-95364-9.
- ↑ Abdulkadirov, Ruslan; Lyakhov, Pavel; Nagornov, Nikolay (enero de 2023). "Revisión de algoritmos de optimización en redes neuronales modernas" . Matemáticas . 11 (11): 2466. doi : 10.3390/math11112466 . ISSN 2227-7390 .
- ↑ Matassa, Marco (diciembre de 2021). "Métricas de Fubini-Study y conexiones de Levi-Civita en espacios proyectivos cuánticos" . Advances in Mathematics . 393 108101. arXiv : 2010.03291 . doi : 10.1016/j.aim.2021.108101 . ISSN 0001-8708 .
- ↑ Lan, Guanghui (marzo de 2023). "Descenso de espejo de política para aprendizaje por refuerzo: convergencia lineal, nueva complejidad de muestreo y clases de problemas generalizadas" . Mathematical Programming . 198 (1): 1059–1106 . arXiv : 2102.00135 . doi : 10.1007/s10107-022-01816-5 . ISSN 1436-4646 . Archivado del original el 3 de noviembre de 2025. Recuperado el 18 de noviembre de 2024 .
- ↑ Kelly, JL Jr. (1956). "Una nueva interpretación de la tasa de información". Bell Syst. Tech. J . 2 (4): 917– 926. doi : 10.1002/j.1538-7305.1956.tb03809.x .
- ↑ Soklakov, AN (2020). "Economía del desacuerdo: intuición financiera para la divergencia de Rényi" . Entropy . 22 ( 8): 860. arXiv : 1811.08308 . Bibcode : 2020Entrp..22..860S . doi : 10.3390/e22080860 . PMC 7517462. PMID 33286632 .
- ↑ Soklakov, AN (2023). "Geometría de la información de riesgos y rendimientos". Risk . Junio . SSRN 4134885 .
- ↑ Henide, Karim (30 de septiembre de 2024). "Flow Rider: la entropía relativa de los flujos de los ecosistemas comercializables como determinante del valor relativo". The Journal of Investing . 33 (6): 34– 58. doi : 10.3905/joi.2024.1.321 .
- ↑ Sanov, IN (1957). "Sobre la probabilidad de grandes desviaciones de magnitudes aleatorias". Mat. Sbornik . 42 (84): 11– 44.
- ↑ Novak SY (2011), Métodos de valores extremos con aplicaciones a las finanzas, cap. 14.5 ( Chapman & Hall ). ISBN 978-1-4398-3574-6.
- ↑ Hobson, Arthur (1971). Conceptos de mecánica estadística . Nueva York: Gordon and Breach. ISBN 978-0-677-03240-5.
- ↑ Bonnici, V. (2020). "Divergencia de Kullback-Leibler entre distribuciones cuánticas y su límite superior". arXiv : 2008.05932 [ cs.LG ].
- ↑ Véase la sección "entropía diferencial – 4" en Entropía relativa. Archivado el 25/12/2018 en la videoconferencia de Sergio Verdú en Wayback Machine , NIPS 2009.
- ↑ Donsker, Monroe D.; Varadhan, SR Srinivasa (1983). "Evaluación asintótica de ciertas expectativas de procesos de Markov para tiempos largos. IV". Communications on Pure and Applied Mathematics . 36 (2): 183– 212. doi : 10.1002/cpa.3160360204 .
- ↑ Duchi J. "Derivaciones para álgebra lineal y optimización" (PDF) . pág. 13. Archivado del original (PDF) el 17 de abril de 2018.
- ↑ Belov, Dmitry I.; Armstrong, Ronald D. (15 de abril de 2011). "Distribuciones de la divergencia de Kullback-Leibler con aplicaciones". British Journal of Mathematical and Statistical Psychology . 64 (2): 291– 309. doi : 10.1348/000711010x522227 . ISSN 0007-1102 . PMID 21492134 .
- 1 2 Buchner, Johannes (2022-04-29). Una intuición para físicos: ganancia de información a partir de experimentos . OCLC 1363563215 .
- ↑ Nielsen, Frank; Garcia, Vincent (2011). "Familias exponenciales estadísticas: Un resumen con tarjetas didácticas". arXiv : 0911.4863 [ cs.LG ].
- 1 2 Cover, Thomas M.; Thomas, Joy A. (1991), Elementos de la teoría de la información , John Wiley & Sons , pág. 22
- ↑ Chaloner, K.; Verdinelli, I. (1995). "Diseño experimental bayesiano: una revisión" . Statistical Science . 10 (3): 273– 304. doi : 10.1214/ss/1177009939 . hdl : 11299/199630 .
- ↑ Press, WH; Teukolsky, SA; Vetterling, WT; Flannery, BP (2007). «Sección 14.7.2. Distancia de Kullback-Leibler». Numerical Recipes: The Art of Scientific Computing (3.ª ed.). Cambridge University Press. ISBN 978-0-521-88068-8.
- ↑ Tribus, Myron (1959). Termostática y termodinámica: una introducción a la energía, la información y los estados de la materia, con aplicaciones de ingeniería . Van Nostrand.
- ↑ Jaynes, ET (1957). " Teoría de la información y mecánica estadística" (PDF) . Physical Review . 106 (4): 620– 630. Bibcode : 1957PhRv..106..620J . doi : 10.1103/physrev.106.620 . S2CID 17870175. Archivado (PDF) del original el 14-12-2024 . Recuperado el 18-02-2008 .
- ↑ Jaynes, ET (1957). "Teoría de la información y mecánica estadística II" (PDF) . Physical Review . 108 (2): 171– 190. Bibcode : 1957PhRv..108..171J . doi : 10.1103/physrev.108.171 . Archivado (PDF) del original el 14 de mayo de 2011. Recuperado el 18 de febrero de 2008 .
- ↑ Gibbs, Josiah Willard (1871). Un método de representación geométrica de las propiedades termodinámicas de las sustancias mediante superficies . The Academy.nota al pie página 52.
- ↑ Tribus, M.; McIrvine, EC (1971). "Energía e información". Scientific American . 224 (3): 179– 186. Bibcode : 1971SciAm.225c.179T . doi : 10.1038/scientificamerican0971-179 .
- ↑ Fraundorf, P. (2007). "Raíces térmicas de la complejidad basada en la correlación" . Complexity . 13 (3): 18– 26. arXiv : 1103.2481 . Bibcode : 2008Cmplx..13c..18F . doi : 10.1002/cplx.20195 . S2CID 20794688 .
{{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Burnham, KP; Anderson, DR (2001). "La información de Kullback-Leibler como base para una inferencia sólida en estudios ecológicos" . Wildlife Research . 28 (2): 111– 119. doi : 10.1071/WR99107 .
- ↑ Burnham, Kenneth P. (diciembre de 2010). Selección de modelos e inferencia multimodelos: un enfoque práctico basado en la teoría de la información . Springer. ISBN 978-1-4419-2973-0OCLC 878132909
- ↑ Nielsen, Frank (2019). "Sobre la simetrización de distancias de Jensen-Shannon basada en medias abstractas" . Entropy . 21 (5): 485. arXiv : 1904.04017 . Bibcode : 2019Entrp..21..485N . doi : 10.3390 / e21050485 . PMC 7514974. PMID 33267199 .
- ↑ Nielsen, Frank (2020). "Sobre una generalización de la divergencia de Jensen-Shannon y el centroide de Jensen-Shannon" . Entropy . 22 ( 2): 221. arXiv : 1912.00610 . Bibcode : 2020Entrp..22..221N . doi : 10.3390/e22020221 . PMC 7516653. PMID 33285995 .
- ^ Bretagnolle, J.; Huber, C. (1978), "Estimation des densités : Risque minimax", Séminaire de Probabilités XII , Lecture Notes in Mathematics (en francés), vol. 649, Berlín, Heidelberg: Springer Berlin Heidelberg, págs. 342–363 , doi : 10.1007/bfb0064610 , ISBN 978-3-540-08761-8, S2CID 122597694 Lema 2.1
- ↑ B.), Tsybakov, AB (Alexandre (2010). Introducción a la estimación no paramétrica . Springer. ISBN 978-1-4419-2709-5OCLC 757859245
{{cite book}}: CS1 maint: nombres múltiples: lista de autores ( enlace ) Ecuación 2.25. - ↑ Rubner, Y.; Tomasi, C.; Guibas, LJ (2000). "La distancia del transportador de tierra como métrica para la recuperación de imágenes". International Journal of Computer Vision . 40 (2): 99– 121. doi : 10.1023/A:1026543900054 . S2CID 14106275 .
- Amari, Shun-ichi (2016). Geometría de la información y sus aplicaciones . Ciencias matemáticas aplicadas. Vol. 194. Springer Japan. pp. XIII, 374. doi : 10.1007/978-4-431-55978-8 . ISBN 978-4-431-55977-1.
- Kullback, Solomon (1959), Teoría de la información y estadística , John Wiley & SonsRepublicado por Dover Publications en 1968; reimpreso en 1978: ISBN 0-8446-5625-9.
- Jeffreys, Harold (1948). Teoría de la probabilidad (Segunda edición). Oxford University Press.
Enlaces externos
- Caja de herramientas de estimadores de la teoría de la información
- Gema de Ruby para calcular la divergencia de Kullback-Leibler.
- Tutorial de Jon Shlens sobre la divergencia de Kullback-Leibler y la teoría de la verosimilitud.
- Código Matlab para calcular la divergencia de Kullback-Leibler para distribuciones discretas. Archivado el 29/09/2007 en Wayback Machine.
- Sergio Verdú , Entropía relativa , NIPS 2009. Videoconferencia de una hora.
- Un resumen moderno de las medidas de divergencia basadas en la teoría de la información.
- Entropía e información
- Divergencias F
- Geometría de la información
- Termodinámica