En teoría de la información , la redundancia (redundación) mide la diferencia fraccional entre la entropía H(X) de un conjunto X y su valor máximo posible.. [ 1 ] [ 2 ] De manera informal, es la cantidad de "espacio" desperdiciado utilizado para transmitir ciertos datos. La compresión de datos es una forma de reducir o eliminar la redundancia no deseada, mientras que la corrección de errores hacia adelante es una forma de agregar la redundancia deseada para fines de detección y corrección de errores cuando se comunica a través de un canal ruidoso de capacidad limitada .
Definición cuantitativa
Al describir la redundancia de datos brutos, la tasa de una fuente de información es la entropía promedio por símbolo. Para fuentes sin memoria, esto es simplemente la entropía de cada símbolo, mientras que, en el caso más general de un proceso estocástico , es
en el límite, cuando n tiende a infinito, de la entropía conjunta de los primeros n símbolos dividida por n . Es común en la teoría de la información hablar de la "tasa" o " entropía " de un lenguaje. Esto es apropiado, por ejemplo, cuando la fuente de información es prosa inglesa. La tasa de una fuente sin memoria es simplemente, puesto que por definición no existe interdependencia entre los mensajes sucesivos de una fuente sin memoria.
La tasa absoluta de un idioma o fuente es simplemente
el logaritmo de la cardinalidad del espacio de mensajes o alfabeto. (Esta fórmula a veces se denomina función de Hartley ). Esta es la tasa máxima posible de información que se puede transmitir con ese alfabeto. (El logaritmo debe tomarse en una base apropiada para la unidad de medida en uso). La tasa absoluta es igual a la tasa real si la fuente no tiene memoria y tiene una distribución uniforme .
La redundancia absoluta puede definirse entonces como
la diferencia entre la tasa absoluta y la tasa.
La cantidadse denomina redundancia relativa y proporciona la máxima relación de compresión de datos posible , cuando se expresa como el porcentaje en el que se puede reducir el tamaño de un archivo. (Cuando se expresa como una relación entre el tamaño del archivo original y el tamaño del archivo comprimido, la cantidadproporciona la relación de compresión máxima que se puede lograr.) Complementario al concepto de redundancia relativa es la eficiencia , definida comode modo queUna fuente sin memoria con una distribución uniforme no tiene redundancia (y por lo tanto, tiene una eficiencia del 100%) y no se puede comprimir.
Otras ideas
Una medida de redundancia entre dos variables es la información mutua o una variante normalizada. Una medida de redundancia entre muchas variables viene dada por la correlación total .
La redundancia de datos comprimidos se refiere a la diferencia entre la longitud esperada de los datos comprimidos.mensajes(o velocidad de datos esperada)) y la entropía(o tasa de entropía)). (Aquí asumimos que los datos son ergódicos y estacionarios , por ejemplo, una fuente sin memoria). Aunque la diferencia de tasaspuede ser arbitrariamente pequeño comoaumentó, la diferencia real, no puede, aunque teóricamente puede estar limitado superiormente por 1 en el caso de fuentes sin memoria de entropía finita.
La redundancia en contextos de teoría de la información también puede referirse a la información que es redundante entre dos informaciones mutuas. Por ejemplo, dadas tres variables,, ySe sabe que la información mutua conjunta puede ser menor que la suma de las información mutua marginal:En este caso, al menos parte de la información sobrerevelado poroes lo mismo. Esta formulación de redundancia es complementaria a la noción de sinergia, que se produce cuando la información mutua conjunta es mayor que la suma de las marginales, lo que indica la presencia de información que solo se revela mediante el estado conjunto y no mediante ninguna colección más simple de fuentes. [ 3 ] [ 4 ]
Despido colectivo
La medida de redundancia por pares descrita anteriormente se puede generalizar a un conjunto de n variables.
. [ 5 ] Como en la medida por pares anterior, si este valor es negativo, se dice que el conjunto de variables es redundante.
Véase también
Referencias
- ↑ Aquí se asumeson los conjuntos sobre los que se definen las distribuciones de probabilidad.
- ↑ MacKay, David JC (2003). "2.4 Definición de entropía y funciones relacionadas". Teoría de la información, inferencia y algoritmos de aprendizaje . Cambridge University Press . pág. 33. ISBN 0-521-64298-1.
La redundancia mide la diferencia fraccionaria entre H(X) y su valor máximo posible,
- ↑ Williams, Paul L.; Beer, Randall D. (2010). "Descomposición no negativa de información multivariada". arXiv : 1004.2515 [ cs.IT ].
- ↑ Gutknecht, AJ; Wibral, M.; Makkeh, A. (2021). "Bits and pieces: Understanding information decomposition from part-whole relationships and formal logic" . Proceedings of the Royal Society A: Mathematical, Physical and Engineering Sciences . 477 (2251 ) 20210110. arXiv : 2008.09535 . Bibcode : 2021RSPSA.47710110G . doi : 10.1098/ rspa.2021.0110 . PMC 8261229. PMID 35197799. S2CID 221246282 .
- ↑ Chechik, Gal; Globerson, Amir; Anderson, M.; Young, E.; Nelken, Israel; Tishby, Naftali (2001). "Las medidas de redundancia grupal revelan una reducción de la redundancia en la vía auditiva" . Advances in Neural Information Processing Systems . 14. MIT Press.
- Reza, Fazlollah M. (1994) [1961]. Introducción a la teoría de la información . Nueva York: Dover [McGraw-Hill]. ISBN 0-486-68210-2.
- Schneier, Bruce (1996). Criptografía aplicada: protocolos, algoritmos y código fuente en C. Nueva York: John Wiley & Sons, Inc. ISBN 0-471-12845-7.
- Auffarth, B; Lopez-Sanchez, M.; Cerquides, J. (2010). "Comparación de medidas de redundancia y relevancia para la selección de características en la clasificación de tejidos en imágenes de TC". Avances en minería de datos. Aplicaciones y aspectos teóricos . Springer. pp. 248–262 . CiteSeerX 10.1.1.170.1528 .
- teoría de la información
- Compresión de datos