En ingeniería de audio , la codificación conjunta consiste en unir varios canales con información similar durante la codificación para obtener una mayor calidad, un tamaño de archivo menor o ambas cosas.
Estéreo conjunto
El término estéreo conjunto cobró relevancia cuando los inicios de Internet permitieron la transferencia de audio de calidad aceptable con una tasa de bits relativamente baja y velocidades de acceso a Internet modestas. El estéreo conjunto se refiere a diversas técnicas de codificación utilizadas para este fin. Aquí se describen dos formas, ambas implementadas de distintas maneras con diferentes códecs , como MP3 , AAC y Ogg Vorbis .
Codificación estéreo de intensidad
Esta forma de estéreo conjunto utiliza una técnica conocida como codificación de frecuencia conjunta , que se basa en el principio de localización del sonido . El oído humano es predominantemente menos agudo para percibir la dirección de ciertas frecuencias de audio. Aprovechando esta característica, la codificación estéreo de intensidad puede reducir la tasa de datos de una transmisión de audio con poca o ninguna alteración perceptible en la calidad aparente.
Más específicamente, el predominio de las diferencias de tiempo interaurales para la localización del sonido en humanos solo se presenta para frecuencias bajas. Esto deja las diferencias de amplitud interaurales como el indicador de localización dominante para frecuencias altas (el límite de corte es de aproximadamente 2 kHz). La idea de la codificación estéreo de intensidad es fusionar el espectro inferior en un solo canal (reduciendo así las diferencias generales entre canales) y transmitir información adicional sobre cómo panoramizar ciertas regiones de frecuencia para recuperar las señales de diferencia de amplitud. Sin embargo, la diferencia de tiempo interaural (ITD) no se pierde por completo en este esquema; la forma del oído hace que la ITD se pueda recuperar a partir de la diferencia de amplitud interaural (IAD) si el sonido proviene del espacio libre, es decir, se reproduce a través de altavoces, no de auriculares. [ 1 ]
Este tipo de codificación no reconstruye perfectamente el audio original debido a la pérdida de información, lo que resulta en la simplificación de la imagen estéreo y puede producir artefactos de compresión perceptibles . Sin embargo, para tasas de bits muy bajas, este tipo de codificación generalmente produce una mejora en la calidad percibida del audio. Es compatible con muchos formatos de compresión de audio (incluidos MP3 , AAC , Vorbis y Opus [ 2 ] ), pero no siempre con todos los codificadores.
Codificación estéreo M/S
La codificación estéreo M/S transforma los canales izquierdo y derecho en un canal central y un canal lateral. El canal central es la suma de los canales izquierdo y derecho, o. El canal lateral es la diferencia entre los canales izquierdo y derecho, oA diferencia de la codificación estéreo de intensidad, la codificación M/S es un caso especial de codificación de transformación y conserva el audio a la perfección sin introducir artefactos. Los códecs sin pérdida , como FLAC o Monkey's Audio, utilizan la codificación estéreo M/S debido a esta característica.
Para reconstruir la señal original, los canales se sumano restado.
Esta forma de codificación también se conoce a veces como estéreo matricial [ a ] y se utiliza en muchos tipos diferentes de equipos de procesamiento y grabación de audio . No se limita a los sistemas digitales e incluso puede crearse con transformadores de audio pasivos o amplificadores analógicos . Un ejemplo del uso del estéreo M/S es en la radiodifusión estéreo FM , dondemodula la onda portadora ymodula una subportadora . Esto permite la retrocompatibilidad con equipos mono, que solo requerirán el canal central. [ 3 ] Otro ejemplo de estéreo M/S es el disco de microsurco estereofónico . Los movimientos laterales de una aguja representan la suma de dos canales y el movimiento vertical representa la diferencia entre los canales; dos bobinas perpendiculares decodifican mecánicamente los canales. [ 4 ]
La técnica M/S también es común para la producción de grabaciones estéreo. Véase Práctica de micrófono § Técnica M/S .
La codificación M/S no requiere estrictamente que los canales izquierdo y derecho utilicen el mismo peso. En Opus CELT, la codificación M/S se combina con un parámetro de ángulo, de modo que se pueden utilizar diferentes pesos para maximizar la descorrelación. [ 5 ] : 4.5.1
Una forma similar de combinar múltiples canales se observa en la implementación ambisónica de Opus 1.3. Se puede utilizar una matriz para mezclar los canales de armónicos esféricos, reduciendo la redundancia. [ 6 ]
Estéreo paramétrico
El estéreo paramétrico es similar al estéreo de intensidad, excepto que se utilizan parámetros más allá de la diferencia de intensidad. En la versión MPEG-4 ( HE-AAC ), se utilizan la diferencia de intensidad y la diferencia de retardo temporal, lo que permite utilizar todas las bandas sin perjudicar la localización. HE-AAC también añade información de "correlación", que reproduce el ambiente sintetizando alguna diferencia entre canales. [ 7 ]
La codificación de señales binaurales (BCC) es la técnica HE-AAC PS extendida para múltiples canales de entrada, que se mezclan todos en uno. Se utilizaron los mismos parámetros ILD, ITD e IC. MPEG Surround es similar a BCC, pero permite la mezcla a múltiples canales y no parece utilizar ITD. [ 8 ]
Implementaciones
Cuando se utiliza en el proceso de compresión MP3, el estéreo conjunto normalmente emplea múltiples técnicas y puede alternar entre ellas para cada fotograma MPEG. Por lo general, el modo estéreo conjunto de un codificador moderno utiliza estéreo M/S para algunos fotogramas y estéreo L/R para otros, según el método que produzca el mejor resultado. Los codificadores utilizan diferentes algoritmos para determinar cuándo cambiar y cuánto espacio asignar a cada canal; la calidad puede verse afectada si el cambio es demasiado frecuente o si el canal lateral no recibe suficientes bits. Con algunos programas de codificación, es posible forzar el uso de estéreo M/S para todos los fotogramas, imitando el modo estéreo conjunto de algunos codificadores antiguos como Xing . En el codificador LAME , esto se conoce como estéreo conjunto forzado. [ 9 ]
Al igual que con MP3, los archivos estéreo Ogg Vorbis pueden emplear estéreo L/R o estéreo conjunto. Al usar estéreo conjunto, se pueden utilizar tanto el método estéreo M/S como el estéreo de intensidad. A diferencia de MP3, donde el estéreo M/S (cuando se usa) se aplica antes de la cuantización, un codificador Ogg Vorbis aplica el estéreo M/S a las muestras en el dominio de la frecuencia después de la cuantización, lo que hace que la aplicación del estéreo M/S sea un paso sin pérdidas. Después de este paso, cualquier área de frecuencia se puede convertir a estéreo de intensidad eliminando la parte correspondiente del canal lateral de la señal M/S. La función floor de Ogg Vorbis se encargará del paneo izquierda-derecha necesario. Opus también admite las tres opciones en la capa CELT; la capa SILK solo admite M/S. [ 10 ]
Notas
Referencias
- ↑ F. Baumgarte y C. Faller, “Diseño y evaluación de la codificación de señales binaurales”, en AES 113th Conv., Los Ángeles, CA, octubre de 2002.
- ^ Valin, Jean-Marc; Vos, Koen; Terriberry, Timothy B. (septiembre de 2012). «RFC 6716 - Definición del códec Opus» .
- ↑ "Radiodifusión estereofónica: detalles técnicos del sistema de tono piloto", Hoja informativa 1604(4) , Servicio de información de ingeniería de la BBC , junio de 1970
- ↑ "Grabación en disco estéreo" . Archivado del original el 25 de septiembre de 2006. Consultado el 4 de octubre de 2006 .
- ↑ Jean-Marc Valin; Gregory Maxwell; Timothy B. Terriberry; Koen Vos (17–20 de octubre de 2013). "Codificación musical de alta calidad y baja latencia en el códec Opus" (PDF) . www.xiph.org . Nueva York, NY: Fundación Xiph.Org. pág. 2. Archivado del original (PDF) el 14 de julio de 2018. Recuperado el 19 de agosto de 2014.
La anticipación de CELT es de 2,5 ms, mientras que la anticipación de SILK es de 5 ms, más 1,5 ms para el remuestreo (incluido el remuestreo del codificador y del decodificador). Por esta razón, la ruta CELT en el codificador agrega una latencia de 4 ms. Sin embargo, una aplicación puede restringir el codificador a CELT y omitir esa latencia. Esto reduce la anticipación total a 2,5 ms.
- ↑ "Opus 1.3 lanzado" . jmvalin.ca .
Para todos los sistemas ambisónicos de orden superior, el mapeo de canales 3 proporciona una representación más eficiente al transformar primero las señales ambisónicas con una matriz de mezcla específica antes de la codificación. Esta versión 1.3 proporciona matrices para el primer, segundo y tercer orden.
- ↑ Purnhagen, Heiko (5–8 de octubre de 2004). "CODIFICACIÓN ESTÉREO PARAMÉTRICA DE BAJA COMPLEJIDAD EN MPEG-4" (PDF) . 7.ª Conferencia Internacional sobre Efectos de Audio Digital : 163–168 .
- ↑ HAN, Chih-Kang. Aceleración e implementación del códec MPEG Surround en la plataforma DSP de TI (PDF) (MSc).
- ↑ "Interruptores de línea de comandos detallados" . Documentación de LAME . Recuperado el 13/12/2013 .
JOINT STEREO [...] significa que el codificador puede usar (fotograma por fotograma) estéreo L/R o estéreo mid/side. En estéreo mid/side, [...] se asignan más bits al canal central que al canal lateral. Cuando no hay mucha separación estéreo, esto aumenta efectivamente el ancho de banda, por lo que se obtiene una mayor calidad con la misma cantidad de bits. Usar estéreo mid/side de forma inapropiada puede resultar en artefactos de compresión audibles. Cambiar demasiado entre mid/side y estéreo normal también puede sonar mal. Para determinar cuándo cambiar a estéreo mid/side, LAME utiliza un algoritmo mucho más sofisticado que el descrito en la documentación ISO. FORCED MID/SIDE STEREO fuerza a que todos los fotogramas se codifiquen con estéreo mid/side. Solo debe usarse si está seguro de que cada fotograma del archivo de entrada tiene muy poca separación estéreo.
- ↑ RFC 6716 , §§ 4.2.1, 4.3
Enlaces externos
- Jürgen Herre, Fraunhofer IIS. De la codificación estéreo conjunta a la codificación de audio espacial: avances recientes y estandarización . Octubre de 2004, artículo 157, DAFx'04, 7.ª Conferencia Internacional de Efectos de Audio Digital.
- Ingeniería de audio