En teoría de la información , la entropía de una variable aleatoria cuantifica el nivel promedio de incertidumbre o información asociada con los estados potenciales o resultados posibles de la variable. Esto mide la cantidad esperada de información necesaria para describir el estado de la variable, considerando la distribución de probabilidades en todos los estados potenciales. Dada una variable aleatoria discreta, que puede ser cualquier miembrodentro del conjuntoy se distribuye según, la entropía es dóndedenota la suma sobre los posibles valores de la variable. [ Nota 1 ] La elección de la base paraEl logaritmo varía según la aplicación. La base 2 da la unidad de bits (o " shannons "), mientras que la base e da las "unidades naturales" nat , y la base 10 da las unidades de "dits", "bans" o " hartleys ". Una definición equivalente de entropía es el valor esperado de la autoinformación de una variable. [ 1 ]
El concepto de entropía de la información fue introducido por Claude Shannon en su artículo de 1948 " Una teoría matemática de la comunicación " [ 2 ] [ 3 ] y también se le conoce como entropía de Shannon . La teoría de Shannon define un sistema de comunicación de datos compuesto por tres elementos: una fuente de datos, un canal de comunicación y un receptor. El "problema fundamental de la comunicación" —como lo expresó Shannon— es que el receptor pueda identificar qué datos fueron generados por la fuente, basándose en la señal que recibe a través del canal. [ 2 ] [ 3 ] Shannon consideró varias formas de codificar, comprimir y transmitir mensajes desde una fuente de datos, y demostró en su teorema de codificación de fuente que la entropía representa un límite matemático absoluto sobre qué tan bien los datos de la fuente pueden ser comprimidos sin pérdidas en un canal perfectamente libre de ruido. Shannon reforzó considerablemente este resultado para canales ruidosos en su teorema de codificación de canal ruidoso .
La entropía en la teoría de la información es directamente análoga a la entropía en la termodinámica estadística . La analogía surge cuando los valores de la variable aleatoria designan energías de microestados, por lo que la fórmula de Gibbs para la entropía es formalmente idéntica a la fórmula de Shannon. La entropía tiene relevancia en otras áreas de las matemáticas, como la combinatoria y el aprendizaje automático . La definición se puede derivar de un conjunto de axiomas que establecen que la entropía debe ser una medida de cuán informativo es el resultado promedio de una variable. Para una variable aleatoria continua, la entropía diferencial es análoga a la entropía. La definicióngeneraliza lo anterior.
Introducción
La idea central de la teoría de la información es que el "valor informativo" de un mensaje comunicado depende del grado de sorpresa que genere su contenido. Si ocurre un evento muy probable, el mensaje aporta muy poca información. Por otro lado, si ocurre un evento muy improbable, el mensaje es mucho más informativo. Por ejemplo, saber que un número determinado no será el ganador de la lotería aporta muy poca información, ya que cualquier número elegido casi con seguridad no ganará. Sin embargo, saber que un número determinado ganará la lotería tiene un alto valor informativo porque comunica la ocurrencia de un evento de muy baja probabilidad.
El contenido informativo , también llamado sorpresa o autoinformación, de un evento.es una función que aumenta a medida que aumenta la probabilidadde un evento disminuye. Cuandoestá cerca de 1, la sorpresa del evento es baja, pero siSi es cercano a 0, la sorpresa del evento es alta. Esta relación se describe mediante la función dóndees el logaritmo , que da 0 sorpresa cuando la probabilidad del evento es 1. [ 4 ] De hecho, log es la única función que satisface un conjunto específico de condiciones definidas en la sección § Caracterización .
Por lo tanto, podemos definir la información, o sorpresa, de un evento.por
o equivalentemente,
La entropía mide la cantidad esperada (es decir, promedio) de información transmitida al identificar el resultado de un ensayo aleatorio. [ 5 ] : 67 Esto implica que lanzar un dado tiene mayor entropía que lanzar una moneda porque cada resultado de un solo lanzamiento de dado tiene menor probabilidad () que cada resultado de un lanzamiento de moneda ().
Consideremos una moneda con probabilidad p de caer cara y probabilidad 1 − p de caer cruz. La máxima sorpresa se produce cuando p = 1/2 , para lo cual un resultado no se espera sobre el otro. En este caso, un lanzamiento de moneda tiene una entropía de un bit (de manera similar, un trit con valores equiprobables contiene(aproximadamente 1,58496) bits de información porque puede tener uno de tres valores). La sorpresa mínima se produce cuando p = 0 (imposibilidad) o p = 1 (certeza) y la entropía es cero bits. Cuando la entropía es cero, no hay incertidumbre alguna, no hay libertad de elección, no hay información . [ 6 ] Otros valores de p dan entropías entre cero y un bit.
Ejemplo
La teoría de la información es útil para calcular la cantidad mínima de información necesaria para transmitir un mensaje, como en la compresión de datos . Por ejemplo, consideremos la transmisión de secuencias compuestas por los cuatro caracteres 'A', 'B', 'C' y 'D' a través de un canal binario. Si la probabilidad de que aparezcan las cuatro letras es la misma (25%), no se puede obtener mejor resultado que utilizando dos bits para codificar cada letra. 'A' podría codificarse como '00', 'B' como '01', 'C' como '10' y 'D' como '11'. Sin embargo, si las probabilidades de cada letra son diferentes, por ejemplo, 'A' aparece con un 70% de probabilidad, 'B' con un 26%, y 'C' y 'D' con un 2% cada una, se podrían asignar códigos de longitud variable. En este caso, 'A' se codificaría como '0', 'B' como '10', 'C' como '110' y 'D' como '111'. Con esta representación, en el 70% de los casos solo se necesita enviar un bit, en el 26% dos bits y en el 4% tres bits. En promedio, se requieren menos de dos bits, ya que la entropía es menor (debido a la alta frecuencia de la secuencia 'A' seguida de 'B', que en conjunto representan el 96% de los caracteres). El cálculo de la suma de las probabilidades logarítmicas ponderadas por probabilidad mide y refleja este efecto.
El texto en inglés, tratado como una cadena de caracteres, tiene una entropía bastante baja; es decir, es bastante predecible. Podemos estar bastante seguros de que, por ejemplo, la 'e' será mucho más común que la 'z', que la combinación 'qu' será mucho más común que cualquier otra combinación que contenga una 'q', y que la combinación 'th' será más común que 'z', 'q' o 'qu'. Después de las primeras letras, a menudo se puede adivinar el resto de la palabra. El texto en inglés tiene entre 0,6 y 1,3 bits de entropía por carácter del mensaje. [ 7 ] : 234
Definición
Nombrada en honor al teorema H de Boltzmann , Shannon definió la entropía H (letra mayúscula griega eta ) de una variable aleatoria discreta., que toma valores en el conjuntoy se distribuye segúnde tal manera que:
Aquíes el operador de valor esperado , e I es el contenido de información de X. [ 8 ] : 11 [ 9 ] : 19–20es en sí misma una variable aleatoria.
La entropía se puede escribir explícitamente como: donde b es la base del logaritmo utilizado. Los valores comunes de b son 2, el número de Euler e y 10, y las unidades de entropía correspondientes son los bits para b = 2 , los nats para b = e y los bans para b = 10 .
En el caso depara algunos, el valor del sumando correspondiente 0 log b (0) se toma como 0 , lo cual es consistente con el límite : [ 10 ] : 13
También se puede definir la entropía condicional de dos variables.ytomando valores de conjuntosyrespectivamente, como: [ 10 ] : 16 dóndeyEsta cantidad debe entenderse como la aleatoriedad restante en la variable aleatoria.dada la variable aleatoria.
teoría de la medida
La entropía puede definirse formalmente en el lenguaje de la teoría de la medida de la siguiente manera: [ 11 ] SeaSea un espacio de probabilidad .ser un evento . La sorpresa dees
La sorpresa esperada dees
A-casi partición es una familia de conjuntosde tal manera queypara todos los distintos. (Esto es una relajación de las condiciones habituales para una partición.) La entropía dees
Dejarser un álgebra sigma en. La entropía dees Finalmente, la entropía del espacio de probabilidad es, es decir, la entropía con respecto adel álgebra sigma de todos los subconjuntos medibles de.
Ejemplo

Consideremos el lanzamiento de una moneda con probabilidades conocidas, no necesariamente justas, de que salga cara o cruz; esto se puede modelar como un proceso de Bernoulli .
La entropía del resultado desconocido del siguiente lanzamiento de la moneda se maximiza si la moneda es justa (es decir, si cara y cruz tienen la misma probabilidad de 1/2). Esta es la situación de máxima incertidumbre, ya que es más difícil predecir el resultado del siguiente lanzamiento; el resultado de cada lanzamiento de la moneda proporciona un bit completo de información. Esto se debe a que
Sin embargo, si sabemos que la moneda no es justa, pero cae cara o cruz con probabilidades p y q , donde p ≠ q , entonces hay menos incertidumbre. Cada vez que se lanza, es más probable que salga un lado que el otro. La incertidumbre reducida se cuantifica en una entropía menor: en promedio, cada lanzamiento de la moneda proporciona menos de un bit completo de información. Por ejemplo, si p = 0,7, entonces
La probabilidad uniforme produce la máxima incertidumbre y, por lo tanto, la máxima entropía. La entropía, entonces, solo puede disminuir a partir del valor asociado con la probabilidad uniforme. El caso extremo es el de una moneda de dos caras que nunca cae cruz, o una moneda de dos caras que nunca cae cara. En ese caso, no hay incertidumbre. La entropía es cero: cada lanzamiento de la moneda no proporciona información nueva, ya que el resultado de cada lanzamiento siempre es seguro. [ 10 ] : 14–15
Caracterización
Para entender el significado de −Σ p i log( p i ) , primero definimos una función de información I en términos de un evento i con probabilidad p i . La cantidad de información adquirida debido a la observación del evento i se obtiene de la solución de Shannon de las propiedades fundamentales de la información : [ 12 ]
- I( p ) es monótonamente decreciente en p : un aumento en la probabilidad de un evento disminuye la información de un evento observado, y viceversa.
- I(1) = 0 : los eventos que siempre ocurren no comunican información.
- I( p 1 · p 2 ) = I( p 1 ) + I( p 2 ) : la información aprendida de eventos independientes es la suma de la información aprendida de cada evento.
- I( p ) es una función dos veces continuamente diferenciable de p.
Dados dos eventos independientes, si el primer evento puede producir uno de n resultados equiprobables y el segundo uno de m resultados equiprobables , entonces existen mn resultados equiprobables del evento conjunto. Esto significa que si se necesitan log₂ ( n ) bits para codificar el primer valor y log₂ ( m ) para codificar el segundo, se necesita log₂ ( mn ) = log₂ ( m ) + log₂ ( n ) para codificar ambos.
Shannon descubrió que una elección adecuada deestá dado por: [ 13 ]
De hecho, los únicos valores posibles desonpara. Además, elegir un valor para k es equivalente a elegir un valorpara, de modo que x corresponde a la base del logaritmo . Por lo tanto, la entropía se caracteriza por las cuatro propiedades anteriores.
Las distintas unidades de información ( bits para el logaritmo binario log₂ , nats para el logaritmo natural ln , bans para el logaritmo decimal log₁₀ , etc.) son múltiplos constantes entre sí. Por ejemplo, en el caso de un lanzamiento de moneda justo, cara proporciona log₂ ( 2 ) = 1 bit de información, que es aproximadamente 0,693 nats o 0,301 dígitos decimales. Debido a la aditividad, n lanzamientos proporcionan n bits de información, que es aproximadamente 0,693 n nats o 0,301 n dígitos decimales.
El significado de los eventos observados (el significado de los mensajes ) no importa en la definición de entropía. La entropía solo tiene en cuenta la probabilidad de observar un evento específico, por lo que la información que engloba es información sobre la distribución de probabilidad subyacente , no el significado de los eventos en sí.
Caracterización alternativa
Otra caracterización de la entropía utiliza las siguientes propiedades. Denotamos p i = Pr( X = x i ) y Η n ( p 1 , ..., p n ) = Η( X ) .
- Continuidad: H debe ser continua , de modo que cambiar los valores de las probabilidades en una cantidad muy pequeña solo debería cambiar la entropía en una cantidad pequeña.
- Simetría: H debería permanecer sin cambios si los resultados x i se reordenan. Es decir,para cualquier permutaciónde.
- Máximo:debería ser máximo si todos los resultados son igualmente probables, es decir.
- Número creciente de resultados: para eventos equiprobables, la entropía debería aumentar con el número de resultados, es decir
- Aditividad: dado un conjunto de n elementos distribuidos uniformemente que se dividen en k cajas (subsistemas) con b 1 , ..., b k elementos cada una, la entropía de todo el conjunto debe ser igual a la suma de la entropía del sistema de cajas y las entropías individuales de las cajas, cada una ponderada con la probabilidad de estar en esa caja en particular.
Discusión
La regla de aditividad tiene las siguientes consecuencias: para enteros positivos b i donde b 1 + ... + b k = n ,
Si elegimos k = n , b 1 = ... = b n = 1, esto implica que la entropía de un resultado determinado es cero: H 1 (1) = 0. Esto implica que la eficiencia de un conjunto fuente con n símbolos puede definirse simplemente como igual a su entropía n -aria. Véase también Redundancia (teoría de la información) .
La caracterización aquí impone una propiedad aditiva con respecto a una partición de un conjunto . Mientras tanto, la probabilidad condicional se define en términos de una propiedad multiplicativa,Obsérvese que un logaritmo media entre estas dos operaciones. La entropía condicional y las cantidades relacionadas heredan, a su vez, una relación simple. La definición teórica de la medida en la sección anterior definió la entropía como una suma sobre las sorpresas esperadas.para una partición extremal. Aquí el logaritmo es ad hoc y la entropía no es una medida en sí misma. Al menos en la teoría de la información de una cadena binaria,Se presta a interpretaciones prácticas.
Motivados por tales relaciones, se ha definido una plétora de cantidades relacionadas y en competencia. Por ejemplo, el análisis de David Ellerman de una "lógica de particiones" define una medida en competencia en estructuras duales a la de subconjuntos de un conjunto universal. [ 14 ] La información se cuantifica como "dits" (distinciones), una medida en particiones. Los "dits" se pueden convertir en bits de Shannon para obtener las fórmulas de la entropía condicional, y así sucesivamente.
Caracterización alternativa mediante aditividad y subaditividad.
Otra caracterización axiomática concisa de la entropía de Shannon fue dada por Aczél , Forte y Ng, [ 15 ] a través de las siguientes propiedades:
- Subaditividad: para variables aleatorias distribuidas conjuntamente.
- Aditividad: cuando las variables aleatoriasson independientes.
- Expansibilidad: , es decir, agregar un resultado con probabilidad cero no cambia la entropía.
- Simetría:es invariante bajo permutación de.
- Pequeño para probabilidades pequeñas: .
Discusión
Se demostró que cualquier funciónque satisface las propiedades anteriores debe ser un múltiplo constante de la entropía de Shannon, con una constante no negativa. [ 15 ] En comparación con las caracterizaciones de entropía mencionadas anteriormente, esta caracterización se centra en las propiedades de la entropía como función de variables aleatorias (subaditividad y aditividad), en lugar de las propiedades de la entropía como función del vector de probabilidad..
Vale la pena señalar que si eliminamos la propiedad "pequeño para probabilidades pequeñas", entoncesdebe ser una combinación lineal no negativa de la entropía de Shannon y la entropía de Hartley . [ 15 ]
Otras propiedades
La entropía de Shannon satisface las siguientes propiedades, para algunas de las cuales es útil interpretar la entropía como la cantidad esperada de información aprendida (o incertidumbre eliminada) al revelar el valor de una variable aleatoria X :
- Agregar o eliminar un evento con probabilidad cero no contribuye a la entropía:
- La entropía máxima de un evento con n resultados diferentes es log b ( n ) : se alcanza mediante la distribución de probabilidad uniforme. Es decir, la incertidumbre es máxima cuando todos los eventos posibles son equiprobables: [ 10 ] : 29
- La entropía o la cantidad de información revelada al evaluar ( X , Y ) (es decir, evaluar X e Y simultáneamente) es igual a la información revelada al realizar dos experimentos consecutivos: primero evaluar el valor de Y , luego revelar el valor de X dado que se conoce el valor de Y. Esto se puede escribir como: [ 10 ] : 16
- Sidóndees una función, entonces. Aplicando la fórmula anterior arendimientosentoncesLa entropía de una variable solo puede disminuir cuando esta pasa a través de una función.
- Si X e Y son dos variables aleatorias independientes, entonces conocer el valor de Y no influye en nuestro conocimiento del valor de X (ya que las dos no se influyen mutuamente por independencia):
- De forma más general, para cualesquiera variables aleatorias X e Y , tenemos [ 10 ] : 29
- La entropía de dos eventos simultáneos no es más que la suma de las entropías de cada evento individual, es decir,, con igualdad si y solo si los dos eventos son independientes. [ 10 ] : 28
- La entropíaes cóncava en la función de masa de probabilidad, es decir [ 10 ] : 30para todas las funciones de masa de probabilidady. [ 10 ] : 32
- En consecuencia, la función de entropía negativa (negentropía) es convexa, y su conjugada convexa es LogSumExp .
Aspectos
Relación con la entropía termodinámica
La inspiración para adoptar la palabra entropía en la teoría de la información provino del gran parecido entre la fórmula de Shannon y fórmulas muy similares conocidas de la mecánica estadística .
En termodinámica estadística, la fórmula más general para la entropía termodinámica S de un sistema termodinámico es la entropía de Gibbs. donde k B es la constante de Boltzmann y p i es la probabilidad de un microestado . La entropía de Gibbs fue definida por J. Willard Gibbs en 1878 después de un trabajo anterior de Ludwig Boltzmann (1872). [ 16 ]
La entropía de Gibbs se traslada casi sin cambios al mundo de la física cuántica para dar lugar a la entropía de von Neumann introducida por John von Neumann en 1927: donde ρ es la matriz de densidad del sistema mecánico cuántico y Tr es la traza . [ 17 ]
En la práctica cotidiana, la relación entre la entropía de la información y la entropía termodinámica no es evidente. Los físicos y químicos suelen estar más interesados en los cambios de entropía a medida que un sistema evoluciona espontáneamente a partir de sus condiciones iniciales, de acuerdo con la segunda ley de la termodinámica , que en una distribución de probabilidad inmutable. Como indica la pequeñez de la constante de Boltzmann k B , los cambios en S / k B , incluso para cantidades ínfimas de sustancias en procesos químicos y físicos, representan cantidades de entropía extremadamente grandes en comparación con cualquier cosa en la compresión de datos o el procesamiento de señales . En la termodinámica clásica, la entropía se define en términos de mediciones macroscópicas y no hace referencia a ninguna distribución de probabilidad, que es fundamental para la definición de la entropía de la información.
La conexión entre la termodinámica y lo que ahora se conoce como teoría de la información fue establecida por primera vez por Boltzmann y expresada mediante su ecuación :
dóndees la entropía termodinámica de un macroestado particular (definido por parámetros termodinámicos como temperatura, volumen, energía, etc.), W es el número de microestados (diversas combinaciones de partículas en diversos estados de energía) que pueden producir el macroestado dado, y k B es la constante de Boltzmann. [ 18 ] Se supone que cada microestado es igualmente probable, de modo que la probabilidad de un microestado dado es p i = 1/ W . Cuando estas probabilidades se sustituyen en la expresión anterior para la entropía de Gibbs (o equivalentemente k B por la entropía de Shannon), resulta la ecuación de Boltzmann. En términos de teoría de la información, la entropía de la información de un sistema es la cantidad de información "faltante" necesaria para determinar un microestado, dado el macroestado.
En la opinión de Jaynes (1957), [ 19 ] la entropía termodinámica, tal como la explica la mecánica estadística , debe verse como una aplicación de la teoría de la información de Shannon: la entropía termodinámica se interpreta como proporcional a la cantidad de información de Shannon adicional necesaria para definir el estado microscópico detallado del sistema, que permanece sin comunicar por una descripción únicamente en términos de las variables macroscópicas de la termodinámica clásica, siendo la constante de proporcionalidad simplemente la constante de Boltzmann. Agregar calor a un sistema aumenta su entropía termodinámica porque aumenta el número de posibles estados microscópicos del sistema que son consistentes con los valores medibles de sus variables macroscópicas, haciendo que cualquier descripción completa del estado sea más larga. (Véase el artículo: termodinámica de entropía máxima ). El demonio de Maxwell puede (hipotéticamente) reducir la entropía termodinámica de un sistema utilizando información sobre los estados de las moléculas individuales; Pero, como demostraron Landauer (desde 1961) y sus colaboradores [ 20 ] , para funcionar, el propio demonio debe aumentar la entropía termodinámica en el proceso, al menos en la cantidad de información de Shannon que propone adquirir y almacenar inicialmente; por lo tanto, la entropía termodinámica total no disminuye (lo que resuelve la paradoja). El principio de Landauer impone un límite inferior a la cantidad de calor que una computadora debe generar para procesar una cantidad determinada de información, aunque las computadoras modernas son mucho menos eficientes.
Compresión de datos
La definición de entropía de Shannon, cuando se aplica a una fuente de información, puede determinar la capacidad mínima del canal requerida para transmitir de forma fiable la fuente como dígitos binarios codificados. La entropía de Shannon mide la información contenida en un mensaje en contraposición a la porción del mensaje que es determinada (o predecible). Ejemplos de esto último incluyen la redundancia en la estructura del lenguaje o las propiedades estadísticas relacionadas con las frecuencias de aparición de pares de letras o palabras, tríos, etc. La capacidad mínima del canal se puede lograr en teoría utilizando el conjunto típico o en la práctica utilizando Huffman , Lempel-Ziv o codificación aritmética . (Véase también complejidad de Kolmogorov ). En la práctica, los algoritmos de compresión incluyen deliberadamente cierta redundancia juiciosa en forma de sumas de verificación para protegerse contra errores. La tasa de entropía de una fuente de datos es el número promedio de bits por símbolo necesarios para codificarlo. Los experimentos de Shannon con predictores humanos muestran una tasa de información entre 0,6 y 1,3 bits por carácter en inglés; [ 21 ] El algoritmo de compresión PPM puede lograr una relación de compresión de 1,5 bits por carácter en texto en inglés.
Si un esquema de compresión es sin pérdidas —uno en el que siempre se puede recuperar el mensaje original completo mediante la descompresión— entonces un mensaje comprimido tiene la misma cantidad de información que el original, pero se comunica en menos caracteres. Tiene más información (mayor entropía) por carácter. Un mensaje comprimido tiene menos redundancia . El teorema de codificación de fuente de Shannon establece que un esquema de compresión sin pérdidas no puede comprimir mensajes, en promedio, para que tengan más de un bit de información por bit de mensaje, pero que cualquier valor menor a un bit de información por bit de mensaje se puede lograr empleando un esquema de codificación adecuado. La entropía de un mensaje por bit multiplicada por la longitud de ese mensaje es una medida de cuánta información total contiene el mensaje. El teorema de Shannon también implica que ningún esquema de compresión sin pérdidas puede acortar todos los mensajes. Si algunos mensajes resultan más cortos, al menos uno debe resultar más largo debido al principio del palomar . En la práctica, esto generalmente no supone un problema, ya que normalmente solo interesa comprimir ciertos tipos de mensajes, como un documento en inglés, en lugar de texto sin sentido, o fotografías digitales en vez de ruido, y no importa si un algoritmo de compresión aumenta el tamaño de algunas secuencias improbables o poco interesantes.
Un estudio de 2011 publicado en Science estima la capacidad tecnológica mundial para almacenar y comunicar información comprimida de forma óptima, normalizada según los algoritmos de compresión más eficaces disponibles en el año 2007, estimando así la entropía de las fuentes tecnológicamente disponibles. [ 22 ] : 60–65
Los autores estiman la capacidad tecnológica de la humanidad para almacenar información (completamente comprimida entrópicamente) en 1986 y nuevamente en 2007. Dividen la información en tres categorías: almacenar información en un soporte, recibir información a través de redes de difusión unidireccionales o intercambiar información a través de redes de telecomunicaciones bidireccionales . [ 22 ]
La entropía como medida de diversidad
La entropía es una de las diversas formas de medir la biodiversidad y se aplica en forma del índice de Shannon . [ 23 ] Un índice de diversidad es una medida estadística cuantitativa de cuántos tipos diferentes existen en un conjunto de datos, como las especies en una comunidad, teniendo en cuenta la riqueza ecológica , la uniformidad y la dominancia . Específicamente, la entropía de Shannon es el logaritmo de 1 D , el verdadero índice de diversidad con parámetro igual a 1. El índice de Shannon está relacionado con las abundancias proporcionales de los tipos.
Entropía de una secuencia
Existen varios conceptos relacionados con la entropía que cuantifican matemáticamente el contenido informativo de una secuencia o mensaje:
- la autoinformación de un mensaje o símbolo individual tomada de una distribución de probabilidad dada (mensaje o secuencia vista como un evento individual),
- la entropía conjunta de los símbolos que forman el mensaje o secuencia (visto como un conjunto de eventos),
- la tasa de entropía de un proceso estocástico (el mensaje o secuencia se considera una sucesión de eventos).
(La "tasa de autoinformación" también puede definirse para una secuencia particular de mensajes o símbolos generados por un proceso estocástico dado: esta siempre será igual a la tasa de entropía en el caso de un proceso estacionario ). Otras cantidades de información también se utilizan para comparar o relacionar diferentes fuentes de información.
Es importante no confundir los conceptos anteriores. A menudo, solo el contexto aclara a cuál se refiere. Por ejemplo, cuando alguien dice que la "entropía" del idioma inglés es de aproximadamente 1 bit por carácter, en realidad está modelando el idioma inglés como un proceso estocástico y hablando de su tasa de entropía . El propio Shannon utilizó el término de esta manera.
Si se utilizan bloques muy grandes, la estimación de la tasa de entropía por carácter puede resultar artificialmente baja, ya que la distribución de probabilidad de la secuencia no se conoce con exactitud; es solo una estimación. Si se considera el texto de todos los libros publicados como una secuencia, donde cada símbolo representa el texto de un libro completo, y si existen N libros publicados y cada libro se publica solo una vez, la estimación de la probabilidad de cada libro es 1/ N , y la entropía ( en bits) es −log₂ (1/ N ) = log₂ ( N ) . En la práctica, esto equivale a asignar a cada libro un identificador único y usarlo en lugar del texto del libro cuando se quiera hacer referencia a él. Esto resulta enormemente útil para hablar de libros, pero no tanto para caracterizar el contenido informativo de un libro individual o del lenguaje en general: no es posible reconstruir el libro a partir de su identificador sin conocer la distribución de probabilidad, es decir, el texto completo de todos los libros. La clave reside en considerar la complejidad del modelo probabilístico. La complejidad de Kolmogorov es una generalización teórica de esta idea que permite considerar el contenido informativo de una secuencia independientemente de cualquier modelo de probabilidad particular; considera el programa más corto para una computadora universal que genere la secuencia. Un código que alcanza la tasa de entropía de una secuencia para un modelo dado, más el diccionario de códigos (es decir, el modelo probabilístico), es uno de esos programas, pero puede que no sea el más corto.
La secuencia de Fibonacci es 1, 1, 2, 3, 5, 8, 13, .... Si tratamos la secuencia como un mensaje y cada número como un símbolo, hay casi tantos símbolos como caracteres en el mensaje, lo que da una entropía de aproximadamente log 2 ( n ) . Los primeros 128 símbolos de la secuencia de Fibonacci tienen una entropía de aproximadamente 7 bits/símbolo, pero la secuencia se puede expresar usando una fórmula [ F( n ) = F( n −1) + F( n −2) para n = 3, 4, 5, ... , F(1) =1 , F(2) = 1 ] y esta fórmula tiene una entropía mucho menor y se aplica a cualquier longitud de la secuencia de Fibonacci.
Limitaciones de la entropía en criptografía
En criptoanálisis , la entropía se usa a menudo de forma aproximada como una medida de la imprevisibilidad de una clave criptográfica, aunque su incertidumbre real es inmensurable. Por ejemplo, una clave de 128 bits que se genera de forma uniforme y aleatoria tiene 128 bits de entropía. También requiere (en promedio)intentos de romper por fuerza bruta. La entropía no logra capturar el número de intentos necesarios si las claves posibles no se eligen de manera uniforme. [ 24 ] [ 25 ] En cambio, se puede usar una medida llamada adivinación para medir el esfuerzo requerido para un ataque de fuerza bruta. [ 26 ]
Pueden surgir otros problemas debido a las distribuciones no uniformes utilizadas en criptografía. Por ejemplo, una clave binaria de un solo uso de 1.000.000 de dígitos que utiliza la operación OR exclusiva. Si la clave tiene 1.000.000 de bits de entropía, es perfecta. Si tiene 999.999 bits de entropía, distribuidos uniformemente (cada bit individual tiene 0,999999 bits de entropía), puede proporcionar una buena seguridad. Pero si la clave tiene 999.999 bits de entropía, donde el primer bit es fijo y los 999.999 restantes son completamente aleatorios, el primer bit del texto cifrado no se cifrará en absoluto.
Los datos como un proceso de Markov
Una forma común de definir la entropía para el texto se basa en el modelo de Markov del texto. Para una fuente de orden 0 (cada carácter se selecciona independientemente de los caracteres anteriores), la entropía binaria es:
donde p i es la probabilidad de i . Para una fuente de Markov de primer orden (una en la que la probabilidad de seleccionar un carácter depende solo del carácter inmediatamente anterior), la tasa de entropía es: [ 27 ]
donde i es un estado (ciertos caracteres precedentes) yes la probabilidad de j dado i como carácter anterior.
Para una fuente de Markov de segundo orden, la tasa de entropía es
Eficiencia (entropía normalizada)
Un conjunto de fuentescon una distribución no uniforme tendrá menos entropía que el mismo conjunto con una distribución uniforme (es decir, el "alfabeto optimizado"). Esta deficiencia de entropía puede expresarse como una razón llamada eficiencia: [ 28 ]
Aplicando las propiedades básicas del logaritmo, esta cantidad también puede expresarse como:
La eficiencia es útil para cuantificar el uso efectivo de un canal de comunicación . Esta formulación también se conoce como entropía normalizada, ya que la entropía se divide por la entropía máxima.Además, la eficiencia es indiferente a la elección de la base (positiva) b , como lo indica la insensibilidad a la misma dentro del logaritmo final anterior.
Entropía para variables aleatorias continuas
entropía diferencial
La entropía de Shannon se restringe a variables aleatorias que toman valores discretos. La fórmula correspondiente para una variable aleatoria continua con función de densidad de probabilidad f ( x ) con soporte finito o infinitoen la recta real se define por analogía, utilizando la forma anterior de la entropía como expectativa: [ 10 ] : 224
Esta es la entropía diferencial (o entropía continua). Un precursor de la entropía continua h [ f ] es la expresión para el funcional H en el teorema H de Boltzmann.
Aunque la analogía entre ambas funciones es sugerente, cabe plantearse la siguiente pregunta: ¿es la entropía diferencial una extensión válida de la entropía discreta de Shannon? La entropía diferencial carece de varias propiedades que sí posee la entropía discreta de Shannon —incluso puede ser negativa— y se han sugerido correcciones, en particular la limitación de la densidad de puntos discretos .
Para responder a esta pregunta, debe establecerse una conexión entre las dos funciones:
Para obtener una medida generalmente finita a medida que el tamaño del intervalo tiende a cero. En el caso discreto, el tamaño del intervalo es el ancho (implícito) de cada uno de los n intervalos (finitos o infinitos) cuyas probabilidades se denotan por p n . A medida que se generaliza el dominio continuo, el ancho debe hacerse explícito.
Para ello, comencemos con una función continua f discretizada en intervalos de tamaño. Por el teorema del valor medio existe un valor x i en cada intervalo tal que La integral de la función f puede aproximarse (en el sentido riemanniano) mediante donde este límite y "el tamaño del contenedor llega a cero" son equivalentes.
Lo denominaremos y expandiendo el logaritmo, tenemos
Cuando Δ → 0 , tenemos
Nota: log(Δ) → −∞ cuando Δ → 0 , requiere una definición especial de la entropía diferencial o continua:
que, como se mencionó anteriormente, se denomina entropía diferencial. Esto significa que la entropía diferencial no es un límite de la entropía de Shannon para n → ∞ . Más bien, difiere del límite de la entropía de Shannon por un desplazamiento infinito (véase también el artículo sobre la dimensión de la información ).
Densidad límite de puntos discretos
Resulta que, a diferencia de la entropía de Shannon, la entropía diferencial no es , en general, una buena medida de incertidumbre o información. Por ejemplo, la entropía diferencial puede ser negativa; además, no es invariante bajo transformaciones de coordenadas continuas. Este problema puede ilustrarse con un cambio de unidades cuando x es una variable adimensional. f ( x ) tendrá entonces unidades de 1/ x . El argumento del logaritmo debe ser adimensional; de lo contrario, es impropio, por lo que la entropía diferencial dada anteriormente será impropia. Si Δ es algún valor "estándar" de x (es decir, "tamaño del intervalo") y, por lo tanto, tiene las mismas unidades, entonces una entropía diferencial modificada puede escribirse en la forma adecuada como: y el resultado será el mismo para cualquier elección de unidades para x . De hecho, el límite de entropía discreta comotambién incluiría un término de, que en general sería infinito. Esto es previsible: las variables continuas suelen tener entropía infinita al discretizarse. La densidad límite de puntos discretos es, en realidad, una medida de cuán más fácil es describir una distribución que una distribución uniforme en su esquema de cuantización.
Entropía relativa
Otra medida útil de entropía que funciona igualmente bien en el caso discreto y continuo es la entropía relativa de una distribución. Se define como la divergencia de Kullback-Leibler de la distribución a una medida de referencia m de la siguiente manera. Supongamos que una distribución de probabilidad p es absolutamente continua con respecto a una medida m , es decir, tiene la forma p ( dx ) = f ( x ) m ( dx ) para alguna función f m -integrable no negativa con m- integral 1, entonces la entropía relativa se puede definir como
En esta forma, la entropía relativa generaliza (salvo cambio de signo) tanto la entropía discreta, donde la medida m es la medida de conteo , como la entropía diferencial, donde la medida m es la medida de Lebesgue . Si la medida m es en sí misma una distribución de probabilidad, la entropía relativa es no negativa, y cero si p = m como medidas. Está definida para cualquier espacio de medidas, por lo tanto, independiente de coordenadas e invariante bajo reparametrizaciones de coordenadas si se tiene en cuenta adecuadamente la transformación de la medida m . La entropía relativa, y (implícitamente) la entropía y la entropía diferencial, dependen de la medida de "referencia" m .
Uso en teoría de números
Terence Tao utilizó la entropía para establecer una conexión útil al intentar resolver el problema de la discrepancia de Erdős . [ 29 ] [ 30 ]
Intuitivamente, la idea detrás de la demostración era que si hay poca información en términos de la entropía de Shannon entre variables aleatorias consecutivas (aquí la variable aleatoria se define usando la función de Liouville (que es una función matemática útil para estudiar la distribución de primos) X H =). Y en un intervalo [n, n+H] la suma sobre ese intervalo podría volverse arbitrariamente grande. Por ejemplo, una secuencia de +1 (que son valores que X H podría tomar) tiene una entropía trivialmente baja y su suma se volvería grande. Pero la idea clave fue mostrar una reducción en la entropía en cantidades no despreciables a medida que se expande H, lo que a su vez conduce a un crecimiento ilimitado de un objeto matemático sobre esta variable aleatoria es equivalente a mostrar el crecimiento ilimitado según el problema de la discrepancia de Erdős .
La demostración es bastante compleja y reunió avances no solo en el uso novedoso de la entropía de Shannon, sino que también empleó la función de Liouville junto con promedios de funciones multiplicativas moduladas [ 31 ] en intervalos cortos. Demostrarlo también rompió la "barrera de paridad" [ 32 ] para este problema específico.
Si bien el uso de la entropía de Shannon en la demostración es novedoso, es probable que abra nuevas líneas de investigación en esta dirección.
Uso en combinatoria
La entropía se ha convertido en una magnitud útil en combinatoria .
Desigualdad de Loomis-Whitney
Un ejemplo sencillo de esto es una demostración alternativa de la desigualdad de Loomis-Whitney : para cada subconjunto A ⊆ Z d , tenemos donde P i es la proyección ortogonal en la i- ésima coordenada:
La demostración se deduce como un corolario simple de la desigualdad de Shearer : si X 1 , ..., X d son variables aleatorias y S 1 , ..., S n son subconjuntos de {1, ..., d } tales que cada entero entre 1 y d se encuentra exactamente en r de estos subconjuntos, entonces dóndees el producto cartesiano de variables aleatorias X j con índices j en S i (por lo que la dimensión de este vector es igual al tamaño de S i ).
Esbozamos cómo se deduce Loomis-Whitney de esto: En efecto, sea X una variable aleatoria uniformemente distribuida con valores en A y de modo que cada punto en A ocurre con igual probabilidad. Entonces (por las propiedades adicionales de la entropía mencionadas anteriormente) H( X ) = log | A | , donde | A | denota la cardinalidad de A . Sea S i = {1, 2, ..., i −1, i +1, ..., d }. El rango deestá contenido en P i ( A ) y por lo tanto. Ahora usa esto para acotar el lado derecho de la desigualdad de Shearer y eleva a la potencia los lados opuestos de la desigualdad resultante que obtengas.
Aproximación al coeficiente binomial
Para enteros 0 < k < n, sea q = k / n . Entonces donde [ 33 ] : 43
Una buena interpretación de esto es que el número de cadenas binarias de longitud n con exactamente k unos es aproximadamente. [ 34 ]
Uso en aprendizaje automático
Las técnicas de aprendizaje automático se derivan en gran medida de la estadística y la teoría de la información. En general, la entropía es una medida de incertidumbre, y el objetivo del aprendizaje automático es minimizarla.
Los algoritmos de aprendizaje de árboles de decisión utilizan la entropía relativa para determinar las reglas de decisión que rigen los datos en cada nodo. [ 35 ] La ganancia de información en los árboles de decisión, que es igual a la diferencia entre la entropía dey la entropía condicional dedadocuantifica la información esperada, o la reducción de la entropía, al conocer adicionalmente el valor de un atributo.La ganancia de información se utiliza para identificar qué atributos del conjunto de datos proporcionan la mayor cantidad de información y deben usarse para dividir los nodos del árbol de manera óptima.
Los modelos de inferencia bayesiana suelen aplicar el principio de máxima entropía para obtener distribuciones de probabilidad previas . [ 36 ] La idea es que la distribución que mejor representa el estado actual del conocimiento de un sistema es la que tiene la mayor entropía y, por lo tanto, es adecuada para ser la distribución previa.
La clasificación en el aprendizaje automático realizada mediante regresión logística o redes neuronales artificiales suele emplear una función de pérdida estándar, denominada pérdida de entropía cruzada , que minimiza la entropía cruzada promedio entre las distribuciones reales y predichas. [ 37 ] En general, la entropía cruzada es una medida de las diferencias entre dos conjuntos de datos similar a la divergencia KL (también conocida como entropía relativa).
Véase también
- Entropía aproximada (ApEn)
- Entropía (termodinámica)
- Entropía cruzada : es una medida del número promedio de bits necesarios para identificar un evento a partir de un conjunto de posibilidades entre dos distribuciones de probabilidad.
- Entropía (flecha del tiempo)
- Codificación entrópica : un esquema de codificación que asigna códigos a los símbolos de manera que la longitud de los códigos coincida con las probabilidades de los símbolos.
- Estimación de la entropía
- Desigualdad de poder de entropía
- Información de Fisher
- entropía de grafos
- distancia de Hamming
- Historia de la entropía
- Historia de la teoría de la información
- Complejidad de la fluctuación de la información
- Geometría de la información
- Entropía de Kolmogorov-Sinai en sistemas dinámicos
- distancia de Levenshtein
- Información mutua
- Perplejidad
- Variación cualitativa : otras medidas de dispersión estadística para distribuciones nominales.
- Entropía relativa cuántica : una medida de la capacidad de distinguir entre dos estados cuánticos.
- La entropía de Rényi es una generalización de la entropía de Shannon; pertenece a una familia de funcionales que se utilizan para cuantificar la diversidad, la incertidumbre o la aleatoriedad de un sistema.
- Aleatoriedad
- Entropía de muestra (SampEn)
- Índice de Shannon
- Índice de Theil
- Tipoglucemia
Notas
- ↑ Esta definición permite eventos con probabilidad 0, lo que resulta en lo indefinido.Sí, lo vemosy se puede suponer quees igual a 0 en este contexto. Alternativamente se puede definir, no permitiendo eventos con probabilidad igual exactamente a 0.
Referencias
- ↑ Pathria, RK; Beale, Paul (2011). Mecánica estadística (Tercera ed.). Academic Press. pág. 51. ISBN 978-0123821881.
- 1 2 Shannon, Claude E. (julio de 1948). "Una teoría matemática de la comunicación" . Bell System Technical Journal . 27 (3): 379– 423. Bibcode : 1948BSTJ...27..379S . doi : 10.1002/j.1538-7305.1948.tb01338.x . hdl : 10338.dmlcz/101429 .( PDF , archivado desde aquí. Archivado el 20 de junio de 2014 en Wayback Machine )
- 1 2 Shannon, Claude E. (octubre de 1948). "Una teoría matemática de la comunicación" . Bell System Technical Journal . 27 (4): 623– 656. Bibcode : 1948BSTJ...27..623S . doi : 10.1002/j.1538-7305.1948.tb00917.x . hdl : 11858/00-001M-0000-002C-4317-B .( PDF , archivado desde aquí. Archivado el 10 de mayo de 2013 en Wayback Machine )
- ↑ "¡Entropía (para ciencia de datos) explicada claramente!" . 24 de agosto de 2021. Archivado del original el 5 de octubre de 2021. Recuperado el 5 de octubre de 2021 – vía YouTube .
- ↑ MacKay, David JC (2003). Teoría de la información, inferencia y algoritmos de aprendizaje . Cambridge University Press. ISBN 0-521-64298-1Archivado del original el 17 de febrero de 2016. Consultado el 9 de junio de 2014 .
- ↑ Shannon, Claude Elwood; Weaver, Warren (1998). La teoría matemática de la comunicación . Urbana: Univ. of Illinois Press. pág. 15. ISBN 978-0-252-72548-7.
- ↑ Schneier, B: Criptografía aplicada , Segunda edición, John Wiley and Sons.
- ↑ Borda, Monica (2011). Fundamentos de la teoría de la información y la codificación . Springer. ISBN 978-3-642-20346-6.
- ↑ Han, Te Sun; Kobayashi, Kingo (2002). Matemáticas de la información y la codificación . Sociedad Matemática Americana. ISBN 978-0-8218-4256-0.
- 1 2 3 4 5 6 7 8 9 10 11 Thomas M. Cover; Joy A. Thomas (1991). Elementos de la teoría de la información . Hoboken, Nueva Jersey: Wiley. ISBN 978-0-471-24195-9.
- ↑ Entropía en el laboratorio n
- ↑ Carter, Tom (marzo de 2014). Una introducción a la teoría de la información y la entropía (PDF) . Santa Fe. Archivado (PDF) del original el 4 de junio de 2016. Recuperado el 4 de agosto de 2017 .
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - ↑ Chakrabarti, CG, e Indranil Chakrabarty. "Entropía de Shannon: caracterización axiomática y aplicación". Revista Internacional de Matemáticas y Ciencias Matemáticas 2005. 17 (2005): 2847-2854 url Archivado el 5 de octubre de 2021 en Wayback Machine
- ↑ Ellerman, David (octubre de 2017). "Teoría de la información lógica: nuevos fundamentos lógicos para la teoría de la información" (PDF) . Logic Journal of the IGPL . 25 (5): 806–835 . doi : 10.1093/jigpal/jzx022 . Archivado (PDF) del original el 25 de diciembre de 2022. Recuperado el 2 de noviembre de 2022 .
- 1 2 3 Aczél, J.; Forte, B.; Ng, CT (1974). "Por qué las entropías de Shannon y Hartley son 'naturales'"". Avances en Probabilidad Aplicada . 6 (1): 131– 146. doi : 10.2307/1426210 . JSTOR 1426210 . S2CID 204177762 .
- ↑ Comparar: Boltzmann, Ludwig (1896, 1898). Vorlesungen über Gastheorie : 2 volúmenes - Leipzig 1895/98 UB: O 5262-6. Versión en inglés: Conferencias sobre teoría de los gases. Traducido por Stephen G. Brush (1964) Berkeley: University of California Press; (1995) Nueva York: Dover ISBN 0-486-68455-5
- ↑ Życzkowski, Karol (2006). Geometría de los estados cuánticos: una introducción al entrelazamiento cuántico . Cambridge University Press. pág. 301.
- ↑ Sharp, Kim; Matschinsky, Franz (2015). "Traducción del artículo de Ludwig Boltzmann "Sobre la relación entre el segundo teorema fundamental de la teoría mecánica del calor y los cálculos de probabilidad relativos a las condiciones de equilibrio térmico"" . Entropía . 17 : 1971– 2009. doi : 10.3390/e17041971 .
- ↑ Jaynes, ET (15 de mayo de 1957). "Teoría de la información y mecánica estadística" . Physical Review . 106 (4): 620– 630. Bibcode : 1957PhRv..106..620J . doi : 10.1103/PhysRev.106.620 . S2CID 17870175 .
- ↑ Landauer, R. (julio de 1961). "Irreversibilidad y generación de calor en el proceso de computación" . IBM Journal of Research and Development . 5 (3): 183– 191. doi : 10.1147/rd.53.0183 . ISSN 0018-8646 . Archivado del original el 15 de diciembre de 2021. Recuperado el 15 de diciembre de 2021 .
- ↑ Mark Nelson (24 de agosto de 2006). "El Premio Hutter" . Archivado del original el 1 de marzo de 2018. Recuperado el 27 de noviembre de 2008 .
- 1 2 "La capacidad tecnológica mundial para almacenar, comunicar y procesar información" Archivado el 27 de julio de 2013 en Wayback Machine , Martin Hilbert y Priscila López (2011), Science , 332(6025); acceso gratuito al artículo aquí: martinhilbert.net/WorldInfoCapacity.html
- ↑ Spellerberg, Ian F.; Fedor, Peter J. (2003). "Un homenaje a Claude Shannon (1916–2001) y una súplica por un uso más riguroso de la riqueza de especies, la diversidad de especies y el índice 'Shannon–Wiener'" . Ecología y biogeografía global . 12 (3): 177– 179. Bibcode : 2003GloEB..12..177S . doi : 10.1046/j.1466-822X.2003.00015.x . ISSN 1466-8238 . S2CID 85935463 .
- ↑ Massey, James (1994). "Guessing and Entropy" (PDF) . Proc. IEEE International Symposium on Information Theory . Archivado (PDF) del original el 1 de enero de 2014. Recuperado el 31 de diciembre de 2013 .
- ↑ Malone, David; Sullivan, Wayne (2005). "La adivinación no sustituye a la entropía" (PDF) . Actas de la Conferencia de Tecnologías de la Información y las Telecomunicaciones . Archivado (PDF) del original el 15 de abril de 2016. Recuperado el 31 de diciembre de 2013 .
- ↑ Pliam, John (1999). «Áreas selectas en criptografía». Taller internacional sobre áreas selectas en criptografía . Lecture Notes in Computer Science. Vol. 1758. pp. 62–77 . doi : 10.1007/3-540-46513-8_5 . ISBN 978-3-540-67185-5.
- ↑ "Lección 6: Tasa de entropía" (PDF) . Universidad de Duke . Consultado el 13 de junio de 2026 .
- ↑ Índices de variación cualitativa. AR Wilcox - 1967 https://www.osti.gov/servlets/purl/4167340
- ↑ Klarreich, Erica (1 de octubre de 2015). "Una respuesta mágica a un enigma de 80 años" . Quanta Magazine . Consultado el 18 de agosto de 2014 .
- ↑ Tao, Terence (28 de febrero de 2016). " El problema de la discrepancia de Erdős" . Análisis discreto . arXiv : 1509.05363v6 . doi : 10.19086/da.609 . S2CID 59361755. Archivado del original el 25 de septiembre de 2023. Recuperado el 20 de septiembre de 2023 .
- ↑ https://arxiv.org/pdf/1502.02374.pdf Archivado el 28 de octubre de 2023 en Wayback Machine
- ↑ "Cuestión abierta: El problema de la paridad en la teoría de cribas" . 5 de junio de 2007. Archivado del original el 7 de agosto de 2023.
- ↑ Aoki, Nuevos enfoques para la modelización macroeconómica.
- ↑ Probabilidad y computación, M. Mitzenmacher y E. Upfal, Cambridge University Press
- ↑ Batra, Mridula; Agrawal, Rashmi (2018). "Análisis comparativo de algoritmos de árboles de decisión" . En Panigrahi, Bijaya Ketan; Hoda, MN; Sharma, Vinod; Goel, Shivendra (eds.). Computación inspirada en la naturaleza . Avances en sistemas inteligentes y computación. Vol. 652. Singapur: Springer. pp. 31–36 . doi : 10.1007/978-981-10-6747-1_4 . ISBN 978-981-10-6747-1Archivado del original el 19 de diciembre de 2022. Consultado el 16 de diciembre de 2021 .
- ↑ Jaynes, Edwin T. (septiembre de 1968). "Probabilidades a priori". IEEE Transactions on Systems Science and Cybernetics . 4 (3): 227– 241. Bibcode : 1968IJSSC...4..227J . doi : 10.1109/TSSC.1968.300117 . ISSN 2168-2887 .
- ↑ Rubinstein, Reuven Y.; Kroese, Dirk P. (9 de marzo de 2013). El método de entropía cruzada: un enfoque unificado para la optimización combinatoria, la simulación de Montecarlo y el aprendizaje automático . Springer Science & Business Media. ISBN 978-1-4757-4321-0.
Este artículo incorpora material de la entropía de Shannon en PlanetMath , que está bajo la licencia Creative Commons Attribution/Share-Alike License .
Lecturas adicionales
Libros de texto sobre teoría de la información
- Cover, TM , Thomas, JA (2006), Elementos de la teoría de la información – 2.ª ed. , Wiley-Interscience, ISBN 978-0-471-24195-9
- MacKay, DJC (2003), Teoría de la información, inferencia y algoritmos de aprendizaje , Cambridge University Press, ISBN 978-0-521-64298-9
- Arndt, C. (2004), Medidas de información: La información y su descripción en ciencia e ingeniería , Springer, ISBN 978-3-540-40855-0
- Gray, RM (2011), Entropía y teoría de la información , Springer.
- Martin, Nathaniel FG; England, James W. (2011). Teoría matemática de la entropía . Cambridge University Press. ISBN 978-0-521-17738-2.
- Shannon, CE , Weaver, W. (1949) La teoría matemática de la comunicación , Univ of Illinois Press. ISBN 0-252-72548-4
- Stone, JV (2014), Capítulo 1 de Teoría de la Información: Una Introducción Tutorial. Archivado el 3 de junio de 2016 en Wayback Machine , Universidad de Sheffield, Inglaterra. ISBN 978-0956372857.
- Tribus, Myron (1961). Termodinámica y termostática: una introducción a la energía, la información y los estados de la materia, con aplicaciones de ingeniería . Serie universitaria en ingeniería básica, vol. 1. Princeton: D. Van Nostrand. OCLC 1036889774 .
Enlaces externos
- "Entropía" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
- "Entropía" Archivado el 4 de junio de 2016 en Wayback Machine en Rosetta Code , repositorio de implementaciones de la entropía de Shannon en diferentes lenguajes de programación.
- Entropía. Archivado el 31 de mayo de 2016 en Wayback Machine, una revista interdisciplinaria sobre todos los aspectos del concepto de entropía. Acceso abierto.
- Entropía e información
- teoría de la información
- Aleatoriedad estadística
- teoría de sistemas complejos
- Compresión de datos