Articulo de referencia

Compresión con pérdidas

Imagen compuesta que muestra la compresión de imágenes JPG y PNG. El lado izquierdo de la imagen corresponde a una imagen JPEG de baja calidad, que muestra artefactos de pérdida...

Imagen compuesta que muestra la compresión de imágenes JPG y PNG. El lado izquierdo de la imagen corresponde a una imagen JPEG de baja calidad, que muestra artefactos de pérdida; el lado derecho corresponde a una imagen PNG.

En tecnología de la información , la compresión con pérdida , o compresión irreversible , es un tipo de método de compresión de datos que utiliza aproximaciones inexactas y el descarte parcial de datos para representar el contenido. Estas técnicas se emplean para reducir el tamaño de los datos al almacenar, gestionar y transmitir contenido. Un mayor grado de aproximación genera imágenes de menor calidad, ya que se eliminan más detalles. Esto contrasta con la compresión de datos sin pérdida (compresión de datos reversible), que no degrada los datos. La cantidad de reducción de datos posible mediante la compresión con pérdida es mucho mayor que con las técnicas sin pérdida.

Una tecnología de compresión con pérdida bien diseñada suele reducir significativamente el tamaño de los archivos antes de que el usuario final note la degradación. Incluso cuando esta es perceptible, puede ser conveniente una mayor reducción de datos (por ejemplo, para la comunicación en tiempo real o para reducir los tiempos de transmisión o las necesidades de almacenamiento). El algoritmo de compresión con pérdida más utilizado es la transformada discreta del coseno (DCT), publicada por primera vez por Nasir Ahmed , T. Natarajan y KR Rao en 1974.

La compresión con pérdida se utiliza con mayor frecuencia para comprimir datos multimedia ( audio , vídeo e imágenes ), especialmente en aplicaciones como la transmisión de contenido multimedia y la telefonía por internet . Por el contrario, la compresión sin pérdida suele ser necesaria para archivos de texto y datos, como registros bancarios y artículos. Puede resultar ventajoso crear un archivo maestro sin pérdida que luego se utilice para generar copias adicionales. Esto permite evitar basar las nuevas copias comprimidas en un archivo fuente con pérdida, lo que produciría artefactos adicionales y una mayor pérdida de información innecesaria .

Tipos

Es posible comprimir muchos tipos de datos digitales de forma que se reduzca el tamaño del archivo informático necesario para almacenarlos o el ancho de banda necesario para transmitirlos, sin perder la información completa del archivo original. Por ejemplo, una imagen se convierte en un archivo digital tratándola como una matriz de puntos y especificando el color y el brillo de cada uno. Si la imagen contiene un área del mismo color, se puede comprimir sin pérdida de información indicando "200 puntos rojos" en lugar de "punto rojo, punto rojo, ...(197 veces más)..., punto rojo".

Los datos originales contienen una cantidad determinada de información, y existe un límite inferior para el tamaño de un archivo que aún puede almacenar toda la información. La teoría básica de la información establece que existe un límite absoluto para la reducción del tamaño de estos datos. Al comprimir los datos, su entropía aumenta, y este aumento no puede ser indefinido. Por ejemplo, un archivo ZIP comprimido es más pequeño que el original, pero comprimir repetidamente el mismo archivo no reducirá su tamaño a cero. La mayoría de los algoritmos de compresión pueden reconocer cuándo una mayor compresión sería innecesaria e incluso aumentaría el tamaño de los datos.

En muchos casos, los archivos o flujos de datos contienen más información de la necesaria. Por ejemplo, una imagen puede tener más detalles de los que el ojo humano puede distinguir al reproducirla al tamaño máximo previsto; del mismo modo, un archivo de audio no necesita muchos detalles finos durante un pasaje muy fuerte. Desarrollar técnicas de compresión con pérdida que se ajusten lo más posible a la percepción humana es una tarea compleja. A veces, lo ideal es un archivo que proporcione exactamente la misma percepción que el original, eliminando la mayor cantidad de información digital posible; otras veces, una pérdida perceptible de calidad se considera una compensación válida.

Los términos «irreversible» y «reversible» se prefieren a «con pérdida» y «sin pérdida», respectivamente, para ciertas aplicaciones, como la compresión de imágenes médicas, con el fin de evitar las implicaciones negativas de la «pérdida». El tipo y la cantidad de pérdida pueden afectar la utilidad de las imágenes. Los artefactos o efectos indeseables de la compresión pueden ser claramente discernibles, pero el resultado sigue siendo útil para el propósito previsto. O bien, las imágenes comprimidas con pérdida pueden ser « visualmente sin pérdida », o en el caso de imágenes médicas, puede haberse aplicado la denominada compresión irreversible diagnósticamente aceptable (DAIC) [ 1 ] .

Codificación de transformación

Algunas formas de compresión con pérdida pueden considerarse una aplicación de la codificación por transformación , un tipo de compresión de datos utilizada para imágenes digitales , señales de audio digitales y vídeo digital . La transformación se utiliza normalmente para lograr una cuantificación más precisa . El conocimiento de la aplicación se emplea para seleccionar la información que se debe descartar, reduciendo así su ancho de banda . La información restante se puede comprimir mediante diversos métodos. Al decodificar la salida, el resultado puede no ser idéntico a la entrada original, pero se espera que sea lo suficientemente similar para el propósito de la aplicación.

La forma más común de compresión con pérdida es un método de codificación de transformación, la transformada discreta del coseno (DCT), [ 2 ] que fue publicada por primera vez por Nasir Ahmed , T. Natarajan y KR Rao en 1974. [ 3 ] La DCT es la forma más utilizada de compresión con pérdida, para formatos populares de compresión de imágenes (como JPEG ), [ 4 ] estándares de codificación de vídeo (como MPEG y H.264/AVC ) y formatos de compresión de audio (como MP3 y AAC ).

En el caso de los datos de audio, una forma popular de codificación de transformación es la codificación perceptual , que transforma los datos brutos a un dominio que refleja con mayor precisión el contenido informativo. Por ejemplo, en lugar de expresar un archivo de sonido como los niveles de amplitud a lo largo del tiempo, se puede expresar como el espectro de frecuencia a lo largo del tiempo, lo que se corresponde con mayor precisión con la percepción auditiva humana. Si bien la reducción de datos (compresión, ya sea con o sin pérdida) es un objetivo principal de la codificación de transformación, también permite otros objetivos: se pueden representar los datos con mayor precisión para la cantidad de espacio original [ 5 ] – por ejemplo, en principio, si se parte de un máster analógico o digital de alta resolución , un archivo MP3 de un tamaño dado debería proporcionar una mejor representación que un archivo de audio sin comprimir en formato WAV o AIFF del mismo tamaño. Esto se debe a que el audio sin comprimir solo puede reducir el tamaño del archivo disminuyendo la tasa de bits o la profundidad, mientras que la compresión de audio puede reducir el tamaño manteniendo la tasa de bits y la profundidad. Esta compresión se convierte en una pérdida selectiva de los datos menos significativos, en lugar de perder datos de forma generalizada. Además, una codificación de transformación puede proporcionar un dominio mejor para manipular o editar los datos; por ejemplo, la ecualización del audio se expresa de forma más natural en el dominio de la frecuencia (aumentar los graves, por ejemplo) en lugar de en el dominio del tiempo sin procesar.

Desde este punto de vista, la codificación perceptual no se trata esencialmente de descartar datos, sino más bien de una mejor representación de los mismos. Otro uso es la retrocompatibilidad y la degradación gradual : en la televisión en color, codificar el color mediante un dominio de transformación de luminancia - crominancia (como YUV ) significa que los televisores en blanco y negro muestran la luminancia, ignorando la información de color. Otro ejemplo es el submuestreo de croma : el uso de espacios de color como YIQ , utilizado en NTSC , permite reducir la resolución de los componentes para que se ajuste a la percepción humana: los humanos tienen la mayor resolución para el blanco y negro (luminancia), menor resolución para los colores del espectro medio como el amarillo y el verde, y la más baja para el rojo y el azul; por lo tanto, NTSC muestra aproximadamente 350 píxeles de luminancia por línea de exploración , 150 píxeles de amarillo frente a verde, y 50 píxeles de azul frente a rojo, que son proporcionales a la sensibilidad humana a cada componente.

pérdida de información

Los formatos de compresión con pérdida sufren de pérdida generacional : la compresión y descompresión repetidas del archivo provocan una pérdida progresiva de calidad. Esto contrasta con la compresión de datos sin pérdida , donde no se produce pérdida de datos durante este proceso. La teoría de la tasa-distorsión proporciona los fundamentos teóricos de la información para la compresión de datos con pérdida . Al igual que el uso de la probabilidad en la teoría de la codificación óptima , la teoría de la tasa-distorsión se basa en gran medida en la estimación bayesiana y la teoría de la decisión para modelar la distorsión perceptiva e incluso el juicio estético .

Existen dos esquemas básicos de compresión con pérdida:

  • En los códecs de transformación con pérdida , se toman muestras de imagen o sonido, se dividen en pequeños segmentos, se transforman a un nuevo espacio base y se cuantifican . Los valores cuantificados resultantes se codifican mediante entropía .
  • En los códecs predictivos con pérdida , los datos decodificados previamente o posteriormente se utilizan para predecir la muestra de sonido o el fotograma de imagen actual. El error entre los datos predichos y los datos reales, junto con cualquier información adicional necesaria para reproducir la predicción, se cuantifica y codifica.

En algunos sistemas se combinan ambas técnicas, utilizándose códecs de transformación para comprimir las señales de error generadas por la etapa predictiva.

Comparación

La ventaja de los métodos con pérdida sobre los métodos sin pérdida es que, en algunos casos, un método con pérdida puede producir un archivo comprimido mucho más pequeño que cualquier método sin pérdida, cumpliendo aún con los requisitos de la aplicación. Los métodos con pérdida se utilizan con mayor frecuencia para comprimir sonido, imágenes o vídeos. Esto se debe a que este tipo de datos están destinados a la interpretación humana, donde la mente puede fácilmente "completar los huecos" o pasar por alto errores o inconsistencias muy pequeñas; idealmente, la compresión con pérdida es transparente (imperceptible), lo que se puede verificar mediante una prueba ABX . Los archivos de datos que utilizan compresión con pérdida son más pequeños y, por lo tanto, cuestan menos de almacenar y transmitir por Internet, una consideración crucial para servicios de transmisión de vídeo como Netflix y servicios de transmisión de audio como Spotify .

Transparencia

Cuando un usuario adquiere un archivo comprimido con pérdida (por ejemplo, para reducir el tiempo de descarga), el archivo recuperado puede ser bastante diferente del original a nivel de bits , aunque para la mayoría de los fines prácticos resulte indistinguible para el oído o la vista humanos. Muchos métodos de compresión se centran en las peculiaridades de la fisiología humana , teniendo en cuenta, por ejemplo, que el ojo humano solo puede ver ciertas longitudes de onda de luz. El modelo psicoacústico describe cómo se puede comprimir el sonido en gran medida sin degradar la calidad percibida. Los defectos causados ​​por la compresión con pérdida que son perceptibles para el ojo o el oído humanos se conocen como artefactos de compresión .

Relación de compresión

La relación de compresión (es decir, el tamaño del archivo comprimido en comparación con el del archivo sin comprimir) de los códecs de vídeo con pérdida es casi siempre muy superior a la de sus equivalentes de audio e imagen fija.

  • El vídeo se puede comprimir enormemente (por ejemplo, 100:1) con poca pérdida de calidad visible.
  • El audio a menudo se puede comprimir a 10:1 con una pérdida de calidad casi imperceptible.
  • Las imágenes fijas suelen comprimirse con pérdida a una relación de 10:1, al igual que el audio, pero la pérdida de calidad es más notoria, especialmente al examinarlas con detenimiento.

Transcodificación y edición

Una advertencia importante sobre la compresión con pérdida (formalmente transcodificación) es que la edición de archivos comprimidos con pérdida provoca una pérdida de generación digital debido a la recodificación. Esto se puede evitar generando archivos con pérdida únicamente a partir de originales (sin pérdida) y editando solo copias de los archivos originales, como imágenes en formato RAW en lugar de JPEG . Si los datos comprimidos con pérdida se decodifican y se comprimen sin pérdida, el tamaño del resultado puede ser comparable al tamaño de los datos antes de la compresión con pérdida, pero los datos ya perdidos no se pueden recuperar. Al decidir utilizar la conversión con pérdida sin conservar el original, puede ser necesario convertir el formato en el futuro para lograr compatibilidad con software o dispositivos ( cambio de formato ) o para evitar el pago de regalías de patentes por la decodificación o distribución de archivos comprimidos.

Edición de archivos con pérdida

Al modificar directamente los datos comprimidos sin decodificarlos ni recodificarlos, es posible editar archivos comprimidos con pérdida sin que se degrade la calidad. En ocasiones, también es posible editar el archivo para que reduzca su tamaño como si se hubiera comprimido aún más, pero sin una pérdida adicional.

JPEG

Los programas principales para la edición sin pérdida de JPEG son jpegtran, y su derivado exiftran(que también conserva la información Exif ), y Jpegcrop (que proporciona una interfaz para Windows).

Estas herramientas permiten recortar , rotar, voltear e invertir la imagen , o incluso convertirla a escala de grises (eliminando el canal de crominancia ). Si bien se elimina la información no deseada, la calidad de la parte restante permanece inalterada.

Otras transformaciones son posibles hasta cierto punto, como unir imágenes con la misma codificación (componiéndolas una al lado de la otra, como en una cuadrícula) o pegar imágenes como logotipos sobre imágenes existentes (ambas mediante Jpegjoin ), o escalar. [ 6 ]

Se pueden realizar algunos cambios en la compresión sin necesidad de recodificar:

  • Optimización de la compresión (para reducir el tamaño sin modificar la imagen decodificada).
  • Conversión entre codificación progresiva y no progresiva.

El programa gratuito IrfanView , exclusivo para Windows, incluye algunas operaciones JPEG sin pérdida de calidad en su JPG_TRANSFORMcomplemento .

Metadatos

Los metadatos, como las etiquetas ID3 , los comentarios Vorbis o la información Exif , generalmente se pueden modificar o eliminar sin modificar los datos subyacentes.

Escalabilidad de la representación comprimida/submuestreo

Es posible que se desee reducir la resolución de la señal de origen representada y la cantidad de datos utilizados para su representación comprimida sin recodificar, como en el caso del bitrate peeling , pero esta funcionalidad no está disponible en todos los diseños, ya que no todos los códecs codifican los datos de forma que permitan descartar los detalles menos importantes. Algunos diseños conocidos que cuentan con esta capacidad incluyen JPEG 2000 para imágenes fijas y H.264/MPEG-4 AVC ( Scalable Video Coding) para vídeo. Estos esquemas también se han estandarizado para diseños más antiguos, como las imágenes JPEG con codificación progresiva y el vídeo MPEG-2 y MPEG-4 Parte 2 , aunque su adopción en el uso común en el mundo real fue limitada. Sin esta capacidad, que suele ser el caso en la práctica, de producir una representación con menor resolución o menor fidelidad que una dada, es necesario partir de la señal fuente original y codificarla, o partir de una representación comprimida y luego descomprimirla y volver a codificarla ( transcodificación ), aunque esto último tiende a causar pérdida de generación digital .

Otro enfoque consiste en codificar la señal original a diferentes tasas de bits y, a continuación, elegir cuál utilizar (como al transmitir por internet —como en " SureStream " de RealNetworks— o al ofrecer distintas descargas, como en la iTunes Store de Apple ), o bien transmitir varias, utilizando la mejor que se reciba correctamente, como en diversas implementaciones de modulación jerárquica . Se utilizan técnicas similares en mipmaps , representaciones piramidales y métodos de espacio de escala más sofisticados . Algunos formatos de audio combinan un formato con pérdida y una corrección sin pérdida que, al combinarse, reproducen la señal original; la corrección se puede eliminar, dejando un archivo más pequeño y comprimido con pérdida. Entre estos formatos se incluyen MPEG-4 SLS (Scalable to Lossless), WavPack , OptimFROG DualStream y DTS-HD Master Audio en modo sin pérdida (XLL) .

Métodos

Gráficos

Imagen

Gráficos por computadora en 3D

Video

Audio

General

Discurso

Otros datos

Los investigadores han realizado compresión con pérdida en texto ya sea utilizando un tesauro para sustituir palabras cortas por palabras largas, o técnicas de texto generativo , [ 14 ] aunque estas a veces caen en la categoría relacionada de conversión de datos con pérdida .

Disminuir la resolución

Un tipo general de compresión con pérdida consiste en reducir la resolución de una imagen, como en el escalado de imágenes , particularmente en la decimación . También se pueden eliminar partes de la imagen con menor "información", por ejemplo, mediante el recorte de costuras . Muchas transformaciones de medios, como el desenfoque gaussiano , son, al igual que la compresión con pérdida, irreversibles: la señal original no se puede reconstruir a partir de la señal transformada. Sin embargo, en general, estas tendrán el mismo tamaño que la original y no constituyen una forma de compresión. Reducir la resolución tiene aplicaciones prácticas, como cuando la sonda New Horizons de la NASA transmitió miniaturas de su encuentro con Plutón-Caronte antes de enviar las imágenes de mayor resolución. Otra solución para conexiones lentas es el uso del entrelazado de imágenes , que define la imagen progresivamente. De este modo, una transmisión parcial es suficiente para previsualizar la imagen final, en una versión de menor resolución, sin necesidad de crear una versión escalada y otra completa.

Véase también

Notas

  1. Sociedad Europea de Radiología (2011). "Utilidad de la compresión irreversible de imágenes en imágenes radiológicas. Un documento de posición de la Sociedad Europea de Radiología (ESR)" . Insights Imaging . 2 (2): 103– 115. doi : 10.1007/s13244-011-0071-x . PMC 3259360. PMID 22347940 .  
  2. "Compresión de datos" . Enciclopedia Británica . Consultado el 13 de agosto de 2019 .
  3. Ahmed, Nasir ; Natarajan, T.; Rao, KR (enero de 1974), "Transformada discreta del coseno", IEEE Transactions on Computers , C-23 (1): 90–93 , doi : 10.1109/TC.1974.223784 , S2CID 149806273 
  4. "T.81 – COMPRESIÓN DIGITAL Y CODIFICACIÓN DE IMÁGENES FIJAS DE TONO CONTINUO – REQUISITOS Y DIRECTRICES" (PDF) . CCITT. Septiembre de 1992. Consultado el 12 de julio de 2019 .
  5. “Si bien uno de los objetivos principales de los codificadores perceptuales de audio digital es la reducción de datos, esta no es una característica necesaria. Como veremos, la codificación perceptual puede utilizarse para mejorar la representación del audio digital mediante una asignación de bits avanzada.” Enmascaramiento y codificación perceptual , Victor Lombardi, noisebetweenstations.com
  6. "Nuevas características de jpegtran" . sylvana.net . Consultado el 20 de septiembre de 2019 .
  7. 1 2 3 4 5 6 Stanković, Radomir S.; Astola, Jaakko T. (2012). "Reminiscencias de los primeros trabajos en DCT: Entrevista con KR Rao" (PDF) . Reimpresiones de los primeros días de las ciencias de la información . 60. Recuperado el 13 de octubre de 2019 .
  8. 1 2 K. R. Rao y JJ Hwang, Técnicas y estándares para la codificación de imágenes, vídeo y audio , Prentice Hall, 1996; JPEG: Capítulo 8; H.261: Capítulo 9; MPEG-1: Capítulo 10; MPEG-2: Capítulo 11.
  9. Guckert, John (Primavera de 2012). "El uso de FFT y MDCT en la compresión de audio MP3" (PDF) . Universidad de Utah . Recuperado el 14 de julio de 2019 .
  10. Brandenburg, Karlheinz (1999). "MP3 y CAA explicados" (PDF) . Archivado (PDF) del original el 13 de febrero de 2017.
  11. Darko, John H. (29 de marzo de 2017). "La incómoda verdad sobre el audio Bluetooth" . DAR__KO . Archivado del original el 14 de enero de 2018. Recuperado el 13 de enero de 2018 .
  12. Ford, Jez (24 de agosto de 2015). "¿Qué es Sony LDAC y cómo funciona?" . AVHub . Consultado el 13 de enero de 2018 .
  13. Ford, Jez (22 de noviembre de 2016). "aptX HD: ¿sin pérdidas o con pérdidas?" . AVHub . Consultado el 13 de enero de 2018 .
  14. IH WITTEN; et al. "Modelos semánticos y generativos para la compresión de texto con pérdida" (PDF) . The Computer Journal . Consultado el 13 de octubre de 2007 . 
  • Formatos de audio con pérdida : comparación de la velocidad y la capacidad de compresión de cinco formatos de audio con pérdida.
  • Conceptos básicos de compresión de datos , incluyendo capítulos sobre compresión con pérdida de imágenes, audio y vídeo.
  • Compresión de imágenes PNG con pérdida en Wayback Machine (archivado el 3 de octubre de 2005)
  • Uso de compresión GIF/PNG con pérdida para la web (artículo)
  • JPG para archivado : comparación de la idoneidad de JPG y la compresión sin pérdidas para archivos de imágenes.