
Un formato de codificación de audio [ 1 ] o formato de compresión de audio es un formato codificado de audio digital , como el que se usa en la televisión digital , la radio digital y en archivos de audio y video. Algunos ejemplos de formatos de codificación de audio son MP3 , AAC , Vorbis , FLAC y Opus . Una implementación específica de software o hardware capaz de comprimir y descomprimir audio hacia/desde un formato de codificación de audio específico se llama códec de audio ; un ejemplo de códec de audio es LAME , que es uno de los varios códecs que implementan la codificación y decodificación de audio en el formato de codificación de audio MP3 mediante software.
Algunos formatos de codificación de audio están documentados en un documento de especificación técnica detallado , conocido como especificación de codificación de audio . Algunas de estas especificaciones son redactadas y aprobadas por organizaciones de estandarización como normas técnicas , y por lo tanto se conocen como normas de codificación de audio . El término «norma» también se utiliza a veces para referirse tanto a normas de facto como a normas formales.
El contenido de audio codificado en un formato de codificación de audio particular normalmente se encapsula dentro de un formato contenedor . Por lo tanto, el usuario normalmente no tiene un archivo AAC sin procesar , sino un archivo de audio .m4a , que es un contenedor MPEG-4 Parte 14 que contiene audio codificado en AAC. El contenedor también contiene metadatos como título y otras etiquetas, y tal vez un índice para una búsqueda rápida. [ 2 ] Una excepción notable son los archivos MP3 , que son codificación de audio sin procesar sin un formato contenedor. Los estándares de facto para agregar etiquetas de metadatos como título y artista a los MP3, como ID3 , son soluciones alternativas que funcionan agregando las etiquetas al MP3 y luego confiando en que el reproductor de MP3 reconozca el fragmento como codificación de audio mal formada y por lo tanto lo omita. En archivos de video con audio, el contenido de audio codificado se agrupa con el video (en un formato de codificación de video ) dentro de un formato contenedor multimedia .
Un formato de codificación de audio no determina todos los algoritmos que utiliza un códec que implementa dicho formato. Una parte importante del funcionamiento de la compresión de audio con pérdida consiste en eliminar datos de forma imperceptible para el oído humano, según un modelo psicoacústico ; el desarrollador de un codificador tiene cierta libertad para elegir qué datos eliminar (de acuerdo con su modelo psicoacústico).
Formatos de codificación de audio sin pérdidas, con pérdidas y sin comprimir

Un formato de codificación de audio sin pérdidas reduce la cantidad total de datos necesarios para representar un sonido, pero permite decodificarlo a su forma original sin comprimir. Un formato de codificación de audio con pérdidas , además de comprimir, reduce la resolución de bits del sonido, lo que resulta en una cantidad de datos mucho menor, pero a costa de una pérdida irrecuperable de información.
El audio transmitido (en streaming) se comprime con mayor frecuencia mediante códecs de audio con pérdida, ya que un tamaño menor facilita enormemente su distribución. Los formatos de codificación de audio más utilizados son MP3 y Advanced Audio Coding (AAC), ambos formatos con pérdida basados en la transformada discreta del coseno modificada (MDCT) y algoritmos de codificación perceptual .
En ocasiones, están disponibles formatos de codificación de audio sin pérdida, como FLAC y Apple Lossless , aunque a costa de obtener archivos de mayor tamaño.
También se utilizan a veces formatos de audio sin comprimir , como la modulación por impulsos codificados (PCM o .wav). PCM era el formato estándar para el audio digital en discos compactos (CDDA).
Historia

En 1950, Bell Labs presentó la patente de la modulación diferencial por codificación de pulsos (DPCM). [ 3 ] La DPCM adaptativa (ADPCM) fue introducida por P. Cummiskey, Nikil S. Jayant y James L. Flanagan en Bell Labs en 1973. [ 4 ] [ 5 ]
La codificación perceptual se utilizó por primera vez para la compresión de codificación de voz , con codificación predictiva lineal (LPC). [ 6 ] Los conceptos iniciales para LPC se remontan al trabajo de Fumitada Itakura ( Universidad de Nagoya ) y Shuzo Saito ( Nippon Telegraph and Telephone ) en 1966. [ 7 ] Durante la década de 1970, Bishnu S. Atal y Manfred R. Schroeder en Bell Labs desarrollaron una forma de LPC llamada codificación predictiva adaptativa (APC), un algoritmo de codificación perceptual que explotaba las propiedades de enmascaramiento del oído humano, seguido a principios de la década de 1980 por el algoritmo de predicción lineal excitada por código (CELP) que logró una relación de compresión significativa para su tiempo. [ 6 ] La codificación perceptual es utilizada por formatos modernos de compresión de audio como MP3 [ 6 ] y AAC .
La transformada discreta del coseno (DCT), desarrollada por Nasir Ahmed , T. Natarajan y KR Rao en 1974, [ 8 ] proporcionó la base para la transformada discreta del coseno modificada (MDCT) utilizada por formatos modernos de compresión de audio como MP3 [ 9 ] y AAC. La MDCT fue propuesta por JP Princen, AW Johnson y AB Bradley en 1987, [ 10 ] siguiendo el trabajo previo de Princen y Bradley en 1986. [ 11 ] La MDCT es utilizada por formatos modernos de compresión de audio como Dolby Digital , [ 12 ] [ 13 ] MP3 , [ 9 ] y Advanced Audio Coding (AAC). [ 14 ]
Lista de formatos con pérdida
General
Discurso
- Codificación predictiva lineal (LPC)
- Codificación predictiva adaptativa (APC)
- Predicción lineal excitada por código (CELP)
- Predicción lineal excitada por código algebraico (ACELP)
- Predicción lineal excitada por código relajado (RCELP)
- CELP de baja latencia (LD-CELP)
- Multivelocidad adaptativa (utilizada en GSM y 3GPP )
- Códec 2 (conocido por su falta de restricciones de patentes)
- Speex (conocida por su falta de restricciones de patentes)
- Transformada discreta del coseno modificada (MDCT)
- AAC-LD
- Transformada superpuesta de energía restringida (CELT)
- Opus (principalmente para aplicaciones en tiempo real)
Lista de formatos sin pérdida
- Apple Lossless (ALAC – Códec de audio sin pérdidas de Apple)
- Codificación acústica de transformación adaptativa (ATRAC)
- Codificación de audio sin pérdidas (también conocida como MPEG-4 ALS)
- Transferencia Directa de Flujo (DST)
- Dolby TrueHD
- Audio maestro DTS-HD
- Códec de audio sin pérdidas gratuito (FLAC)
- Transformada discreta del coseno sin pérdidas (LDCT)
- Empaquetado sin pérdidas Meridian (MLP)
- Audio de mono (Monkey's Audio APE)
- MPEG-4 SLS (también conocido como HD-AAC)
- OptimFROG
- Calidad de sonido original (OSQ)
- RealPlayer (RealAudio sin pérdidas)
- Acortar (SHN)
- TTA (Audio sin pérdidas real)
- WavPack (WavPack sin pérdidas)
- WMA sin pérdidas (Windows Media Lossless)
Véase también
Notas
Referencias
- ↑ El término "codificación de audio" se puede ver, por ejemplo, en el nombre Codificación de audio avanzada , y es análogo al término codificación de vídeo.
- ↑ "Vídeo: ¿Dónde se almacena la información de sincronización en los formatos contenedores?" .
- ↑ Patente estadounidense 2605361 , C. Chapin Cutler, "Cuantización diferencial de señales de comunicación", emitida el 29 de julio de 1952.
- ↑ Cummiskey, P.; Jayant, NS; Flanagan, JL (1973). "Cuantización adaptativa en la codificación PCM diferencial del habla" . Bell System Technical Journal . 52 (7): 1105– 1118. doi : 10.1002/j.1538-7305.1973.tb02007.x .
- ↑ Cummiskey, P.; Jayant, Nikil S.; Flanagan, JL (1973). "Cuantización adaptativa en la codificación diferencial PCM del habla". The Bell System Technical Journal . 52 (7): 1105– 1118. doi : 10.1002/j.1538-7305.1973.tb02007.x . ISSN 0005-8580 .
- 1 2 3 Schroeder, Manfred R. (2014). «Bell Laboratories» . Acústica, información y comunicación: Volumen conmemorativo en honor a Manfred R. Schroeder . Springer. pág. 388. ISBN 9783319056609.
- ↑ Gray, Robert M. (2010). "Una historia del habla digital en tiempo real en redes de paquetes: Parte II de la codificación predictiva lineal y el protocolo de Internet" (PDF) . Found. Trends Signal Process . 3 (4): 203– 303. doi : 10.1561/2000000036 . ISSN 1932-8346 .
- ↑ Nasir Ahmed ; T. Natarajan; Kamisetty Ramamohan Rao (enero de 1974). "Transformada discreta del coseno" (PDF) . IEEE Transactions on Computers . C-23 (1): 90–93 . doi : 10.1109/TC.1974.223784 . S2CID 149806273. Archivado del original (PDF) el 8 de diciembre de 2016. Recuperado el 20 de octubre de 2019 .
- 1 2 3 Guckert, John (Primavera de 2012). "El uso de FFT y MDCT en la compresión de audio MP3" (PDF) . Universidad de Utah . Recuperado el 14 de julio de 2019 .
- ↑ Princen, J.; Johnson, A.; Bradley, A. (1987). "Codificación de subbanda/transformación utilizando diseños de bancos de filtros basados en la cancelación de aliasing en el dominio del tiempo". ICASSP '87. Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales . Vol. 12. pp. 2161– 2164. doi : 10.1109/ICASSP.1987.1169405 . S2CID 58446992 .
- ↑ Princen, J.; Bradley, A. (1986). "Diseño de banco de filtros de análisis/síntesis basado en la cancelación de aliasing en el dominio del tiempo". IEEE Transactions on Acoustics, Speech, and Signal Processing . 34 (5): 1153– 1161. doi : 10.1109/TASSP.1986.1164954 .
- 1 2 3 4 5 6 Luo, Fa-Long (2008). Estándares de radiodifusión multimedia móvil: tecnología y práctica . Springer Science & Business Media . pág. 590. ISBN 9780387782638.
- ↑ Britanak, V. (2011). "Sobre las propiedades, relaciones e implementación simplificada de bancos de filtros en los estándares de codificación de audio Dolby Digital (Plus) AC-3". IEEE Transactions on Audio, Speech, and Language Processing . 19 (5): 1231– 1241. Bibcode : 2011ITASL..19.1231B . doi : 10.1109/TASL.2010.2087755 . S2CID 897622 .
- 1 2 Brandenburg, Karlheinz (1999). "MP3 y CAA explicados" (PDF) . Archivado (PDF) del original el 13 de febrero de 2017.
- ↑ "Informe de desarrolladores de vídeo 2019" (PDF) . Bitmovin . 2019. Consultado el 5 de noviembre de 2019 .
- ↑ "¿Dolby AC-4 es compatible con Dolby Atmos?" . Soporte profesional de Dolby . 23/05/2023 . Consultado el 08/11/2024 .
- ↑ "Espera a escuchar la música Dolby Atmos sin pérdidas" . Digital Trends . 3 de mayo de 2023. Consultado el 8 de noviembre de 2024 .
- ↑ Britanak, V. (2011). "Sobre las propiedades, relaciones e implementación simplificada de bancos de filtros en los estándares de codificación de audio Dolby Digital (Plus) AC-3". IEEE Transactions on Audio, Speech, and Language Processing . 19 (5): 1231– 1241. Bibcode : 2011ITASL..19.1231B . doi : 10.1109/TASL.2010.2087755 . S2CID 897622 .
- ↑ Andersen, Robert Loring; Crockett, B.; Davidson, G.; Davis, Mark; Fielder, L.; Turner, Stephen C.; Vinton, M.; Williams, P. (1 de octubre de 2004). «Introducción a Dolby Digital Plus, una mejora del sistema de codificación Dolby Digital» (PDF) . Revista de la Sociedad de Ingeniería de Audio . Archivado del original (PDF) el 19 de noviembre de 2016.
- ↑ Estándar de compresión de audio digital (AC-3, AC-3 mejorado) (PDF) , Instituto Europeo de Normas de Telecomunicaciones, 20 de septiembre de 2017, ETSI TS 102 366 V1.4.1 (2017-09 , consultado el 21 de septiembre de 2023)
- ↑ Stanković, Radomir S.; Astola, Jaakko T. (2012). "Reminiscencias de los primeros trabajos en DCT: Entrevista con KR Rao" (PDF) . Reimpresiones de los primeros días de las ciencias de la información . 60. Recuperado el 13 de octubre de 2019 .
- ↑ Fundación Xiph.Org (2 de junio de 2009). "Especificación Vorbis I - Clasificación 1.1.2" . Fundación Xiph.Org . Consultado el 22 de septiembre de 2009 .
- ↑ Terriberry, Timothy B. Presentación del códec CELT . Archivado del original el 7 de agosto de 2011. Presentación (PDF) . Consultado el 10 de noviembre de 2019 .
- ↑ Valin, Jean-Marc; Maxwell, Gregory; Terriberry, Timothy B.; Vos, Koen (octubre de 2013). Codificación musical de alta calidad y baja latencia en el códec Opus . 135.ª Convención de la AES. Audio Engineering Society . arXiv : 1602.04845 .
- ↑ "Dolby AC-4: Entrega de audio para servicios de entretenimiento de próxima generación" (PDF) . Dolby Laboratories . 1 de junio de 2015. Archivado del original (PDF) el 4 de diciembre de 2015. Consultado el 26 de abril de 2016 .
- ↑ Darko, John H. (29 de marzo de 2017). "La incómoda verdad sobre el audio Bluetooth" . DAR__KO . Archivado del original el 14 de enero de 2018. Recuperado el 13 de enero de 2018 .
- ↑ Ford, Jez (24 de agosto de 2015). "¿Qué es Sony LDAC y cómo funciona?" . AVHub . Consultado el 13 de enero de 2018 .
- ↑ Ford, Jez (22 de noviembre de 2016). "aptX HD: ¿sin pérdidas o con pérdidas?" . AVHub . Consultado el 13 de enero de 2018 .
- ↑ "Formatos de audio para sistemas de teatro digital" . Biblioteca del Congreso . 27 de diciembre de 2011. Consultado el 10 de noviembre de 2019 .
- ↑ Spanias, Andreas; Painter, Ted; Atti, Venkatraman (2006). Procesamiento y codificación de señales de audio . John Wiley & Sons . pág. 338. ISBN 9780470041963.
- ↑ "ISO/IEC 11172-3:1993 – Tecnología de la información — Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s — Parte 3: Audio" . ISO. 1993. Consultado el 14 de julio de 2010 .
- ↑ Bluetooth SIG, Especificación del sistema Bluetooth, Perfiles, Perfil de distribución de audio avanzado versión 1.3. https://www.bluetooth.org/docman/handlers/DownloadDoc.ashx?doc_id=260859&vId=290074
- formatos de archivos de audio