MPEG-1 es un estándar para la compresión con pérdida de vídeo y audio . Está diseñado para comprimir vídeo digital sin comprimir con calidad VHS y audio de CD hasta aproximadamente 1,5 Mbit/s (relaciones de compresión de 26:1 y 6:1 respectivamente) [ 2 ] sin una pérdida de calidad excesiva, lo que hace prácticos los CD de vídeo , la televisión digital por cable / satélite y la radiodifusión de audio digital (DAB). [ 3 ] [ 4 ]
Hoy en día, MPEG-1 se ha convertido en el formato de audio/vídeo con pérdida más compatible del mundo y se utiliza en una gran cantidad de productos y tecnologías. Quizás la parte más conocida del estándar MPEG-1 sea la primera versión del formato de audio MP3 que introdujo.
El estándar MPEG-1 se publica como ISO / IEC 11172 , titulado Tecnología de la información: codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s .
La norma consta de las siguientes cinco partes : [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ]
- Sistemas (que definen un formato para el almacenamiento y la sincronización de vídeo, audio y otros datos juntos en un solo archivo, posteriormente denominado flujo de programa MPEG para distinguirlo del formato de flujo de transporte MPEG introducido como alternativa en MPEG-2 ).
- Vídeo (contenido de vídeo comprimido)
- Audio (contenido de audio comprimido), incluyendo MP3 y MP2.
- Pruebas de conformidad (pruebas de la corrección de las implementaciones del estándar)
- Software de referencia (ejemplo de software que muestra cómo codificar y decodificar según el estándar)
Historia
El predecesor de MPEG-1 para la codificación de vídeo fue el estándar H.261 producido por el CCITT (ahora conocido como ITU-T ). La arquitectura básica establecida en H.261 fue la estructura de codificación de vídeo híbrida DCT con compensación de movimiento . [ 10 ] [ 11 ] Utiliza macrobloques de tamaño 16×16 con estimación de movimiento basada en bloques en el codificador y compensación de movimiento utilizando vectores de movimiento seleccionados por el codificador en el decodificador, con codificación de diferencia residual utilizando una transformada discreta del coseno (DCT) de tamaño 8×8, cuantificación escalar y códigos de longitud variable (como los códigos Huffman ) para la codificación de entropía . [ 12 ] H.261 fue el primer estándar práctico de codificación de vídeo, y todos sus elementos de diseño descritos también se utilizaron en MPEG-1. [ 13 ]
Inspirándose en el exitoso enfoque colaborativo y las tecnologías de compresión desarrolladas por el Joint Photographic Experts Group y el CCITT 's Experts Group on Telephony (creadores del estándar de compresión de imágenes JPEG y del estándar H.261 para videoconferencias, respectivamente), el grupo de trabajo Moving Picture Experts Group (MPEG) se estableció en enero de 1988, por iniciativa de Hiroshi Yasuda ( Nippon Telegraph and Telephone ) y Leonardo Chiariglione ( CSELT ). [ 14 ] MPEG se formó para abordar la necesidad de formatos estándar de vídeo y audio, y para desarrollar H.261 con el fin de obtener una mejor calidad mediante el uso de métodos de codificación algo más complejos (por ejemplo, admitir una mayor precisión para los vectores de movimiento). [ 3 ] [ 15 ] [ 16 ]
El desarrollo del estándar MPEG-1 comenzó en mayo de 1988. Catorce empresas e instituciones presentaron propuestas de códecs de vídeo y catorce de audio para su evaluación. Los códecs se sometieron a pruebas exhaustivas de complejidad computacional y calidad subjetiva (percibida por el usuario) a velocidades de datos de 1,5 Mbit/s. Esta velocidad de bits específica se eligió para la transmisión a través de líneas T-1 / E-1 y como la velocidad de datos aproximada de los CD de audio . [ 17 ] Los códecs que destacaron en estas pruebas se utilizaron como base para el estándar y se perfeccionaron aún más, incorporando características adicionales y otras mejoras durante el proceso. [ 18 ]
Después de 20 reuniones del grupo completo en varias ciudades alrededor del mundo, y 4 años y medio de desarrollo y pruebas, el estándar final (para las partes 1 a 3) fue aprobado a principios de noviembre de 1992 y publicado unos meses después. [ 19 ] La fecha de finalización reportada del estándar MPEG-1 varía mucho: se produjo un borrador de estándar casi completo en septiembre de 1990, y a partir de ese momento, solo se introdujeron cambios menores. [ 3 ] El borrador del estándar estuvo disponible públicamente para su compra. [ 20 ] El estándar se finalizó con la reunión del 6 de noviembre de 1992. [ 21 ] El Berkeley Plateau Multimedia Research Group desarrolló un decodificador MPEG-1 en noviembre de 1992. [ 22 ] En julio de 1990, antes incluso de que se hubiera escrito el primer borrador del estándar MPEG-1, se comenzó a trabajar en un segundo estándar, MPEG-2 , [ 23 ] destinado a extender la tecnología MPEG-1 para proporcionar vídeo con calidad de transmisión completa (según CCIR 601 ) a altas tasas de bits (3–15 Mbit/s) y soporte para vídeo entrelazado . [ 24 ] Debido en parte a la similitud entre los dos códecs, el estándar MPEG-2 incluye compatibilidad retroactiva completa con el vídeo MPEG-1, por lo que cualquier decodificador MPEG-2 puede reproducir vídeos MPEG-1. [ 25 ]
Cabe destacar que el estándar MPEG-1 define de forma muy estricta el flujo de bits y la función del decodificador, pero no define cómo debe realizarse la codificación MPEG-1, aunque se proporciona una implementación de referencia en ISO/IEC-11172-5. [ 2 ] Esto significa que la eficiencia de codificación MPEG-1 puede variar drásticamente según el codificador utilizado, y generalmente significa que los codificadores más nuevos tienen un rendimiento significativamente mejor que sus predecesores. [ 26 ] Las tres primeras partes (Sistemas, Vídeo y Audio) de ISO/IEC 11172 se publicaron en agosto de 1993. [ 27 ]
Patentes
Debido a su antigüedad, MPEG-1 ya no está cubierto por ninguna patente esencial y, por lo tanto, puede utilizarse sin obtener una licencia ni pagar ninguna tasa. [ 34 ] [ 35 ] [ 36 ] [ 37 ] [ 38 ] La base de datos de patentes ISO enumera una patente para ISO 11172, US 4,472,747, que expiró en 2003. [ 39 ] El borrador casi completo del estándar MPEG-1 estuvo disponible públicamente como ISO CD 11172 [ 20 ] el 6 de diciembre de 1991. [ 1 ] Ni el artículo de Kuro5hin de julio de 2008 "Estado de las patentes de MPEG-1, H.261 y MPEG-2", [ 40 ] ni un hilo de agosto de 2008 en la lista de correo gstreamer-devel [ 41 ] pudieron enumerar una sola patente no expirada de MPEG-1 Video y MPEG-1 Audio Layer I/II. En una discusión de mayo de 2009 en la lista de correo whatwg se mencionó la patente estadounidense 5,214,678 como posiblemente aplicable a la capa de audio MPEG-1 II. [ 42 ] Presentada en 1990 y publicada en 1993, esta patente ya ha expirado. [ 43 ]
No era posible implementar un decodificador y codificador MPEG-1 completo, con audio de "capa III", sin pagar regalías, ya que algunas empresas exigían el pago de derechos de patente para las implementaciones de audio MPEG-1 de capa III, como se menciona en el artículo sobre MP3 . Todas las patentes relacionadas con MP3 en el mundo expiraron el 30 de diciembre de 2017, lo que convierte a este formato en totalmente gratuito. [ 44 ] El 23 de abril de 2017, Fraunhofer IIS dejó de cobrar por el programa de licencias MP3 de Technicolor para ciertas patentes y software relacionados con MP3. [ 45 ]
Antiguos titulares de patentes
Las siguientes corporaciones presentaron declaraciones ante la ISO afirmando que poseían patentes para el formato de vídeo MPEG-1 (ISO/IEC-11172-2), aunque todas esas patentes ya han expirado. [ 46 ]
Aplicaciones
- La mayoría de los programas más populares para la reproducción de vídeo incluyen la decodificación MPEG-1, además de cualquier otro formato compatible.
- La popularidad del audio MP3 ha generado una enorme base instalada de hardware capaz de reproducir audio MPEG-1 (las tres capas).
- "Prácticamente todos los dispositivos de audio digital " pueden reproducir audio MPEG-1. [ 47 ] Se han vendido muchos millones hasta la fecha.
- Antes de que MPEG-2 se generalizara, muchos servicios de televisión digital por satélite/cable utilizaban exclusivamente MPEG-1. [ 16 ] [ 26 ]
- La gran popularidad de MPEG-2 entre las emisoras significa que MPEG-1 puede reproducirse en la mayoría de los decodificadores digitales de cable y satélite , así como en los reproductores digitales de discos y cintas, gracias a la retrocompatibilidad.
- El formato MPEG-1 se utilizó para vídeo a pantalla completa en el CD-i de Green Book y en el Video CD (VCD).
- El estándar Super Video CD , basado en VCD, utiliza exclusivamente audio MPEG-1, así como vídeo MPEG-2.
- El formato DVD-Video utiliza principalmente vídeo MPEG-2, pero la compatibilidad con MPEG-1 está definida explícitamente en el estándar.
- El estándar DVD-Video originalmente requería MPEG-1 Audio Layer II para los países con sistema PAL, pero se modificó para permitir discos solo con AC-3/ Dolby Digital . MPEG-1 Audio Layer II todavía está permitido en los DVD, aunque las extensiones más recientes del formato, como MPEG Multichannel , rara vez son compatibles.
- La mayoría de los reproductores de DVD también son compatibles con la reproducción de Video CD y MP3 CD , que utilizan el estándar MPEG-1.
- El estándar internacional de radiodifusión de vídeo digital (DVB) utiliza principalmente audio MPEG-1 (capa II) y vídeo MPEG-2.
- El estándar internacional de radiodifusión de audio digital (DAB) utiliza exclusivamente MPEG-1 Audio Layer II, debido a su calidad especialmente alta, sus modestos requisitos de rendimiento del decodificador y su tolerancia a los errores.
- El casete digital compacto utiliza PASC (Codificación de subbanda adaptativa de precisión) para codificar su audio. PASC es una versión temprana de MPEG-1 Audio Layer I con una tasa de bits fija de 384 kilobits por segundo.
Parte 1: Sistemas
La parte 1 del estándar MPEG-1 cubre los sistemas y está definida en ISO/IEC-11172-1.
El estándar MPEG-1 especifica la estructura lógica y los métodos utilizados para almacenar el audio, el vídeo y otros datos codificados en un flujo de bits estándar, y para mantener la sincronización entre los distintos contenidos. Este formato de archivo está diseñado específicamente para su almacenamiento en soportes y su transmisión a través de canales de comunicación considerados relativamente fiables. El estándar solo ofrece una protección limitada contra errores, y pequeños errores en el flujo de bits pueden provocar defectos perceptibles.
Esta estructura fue posteriormente denominada flujo de programa MPEG : "El diseño de sistemas MPEG-1 es esencialmente idéntico a la estructura de flujo de programa MPEG-2". [ 48 ] Esta terminología es más popular, precisa (la diferencia de un flujo de transporte MPEG ) y será la que se utilice aquí.
Flujos elementales, paquetes y referencias de reloj
- Los flujos elementales (ES) son los flujos de bits sin procesar de los datos de audio y vídeo codificados en MPEG-1 (salida de un codificador). Estos archivos se pueden distribuir de forma independiente, como ocurre con los archivos MP3.
- Los flujos elementales empaquetados (PES) son flujos elementales empaquetados en paquetes de longitud variable, es decir, ES divididos en fragmentos independientes donde se agregó una suma de verificación de redundancia cíclica (CRC) a cada paquete para la detección de errores.
- La referencia del reloj del sistema (SCR) es un valor de temporización almacenado en una cabecera de 33 bits de cada PES, con una frecuencia/precisión de 90 kHz, y una extensión adicional de 9 bits que almacena datos de temporización adicionales con una precisión de 27 MHz. [ 49 ] [ 50 ] Estos valores son insertados por el codificador, derivados del reloj del sistema (STC). Sin embargo, las secuencias de audio y vídeo codificadas simultáneamente no tendrán valores SCR idénticos debido al almacenamiento en búfer, la codificación, la fluctuación y otros retrasos.
Programas
Los flujos de programa (PS) se encargan de combinar múltiples flujos elementales empaquetados (normalmente un solo flujo de audio y vídeo) en un único flujo, garantizando la entrega simultánea y manteniendo la sincronización. La estructura del PS se conoce como multiplex o formato de contenedor .
Las marcas de tiempo de presentación (PTS) existen en PS para corregir la inevitable disparidad entre los valores SCR de audio y video (corrección de base de tiempo). Los valores PTS de 90 kHz en el encabezado PS le indican al decodificador qué valores SCR de video coinciden con qué valores SCR de audio. [ 49 ] PTS determina cuándo mostrar una parte de un programa MPEG, y también es utilizado por el decodificador para determinar cuándo se pueden descartar datos del búfer . [ 51 ] El decodificador retrasará el video o el audio hasta que llegue el segmento correspondiente del otro y pueda decodificarse.
El manejo de PTS puede ser problemático. Los decodificadores deben aceptar múltiples flujos de programa concatenados (unidos secuencialmente). Esto provoca que los valores de PTS en la parte central del video se restablezcan a cero y luego comiencen a incrementarse nuevamente. Estas discrepancias en el desbordamiento de PTS pueden causar problemas de sincronización que el decodificador debe manejar de manera especial.
Además, se requieren marcas de tiempo de decodificación (DTS) debido a los fotogramas B. Con fotogramas B en el flujo de video, los fotogramas adyacentes deben codificarse y decodificarse fuera de orden (fotogramas reordenados). DTS es bastante similar a PTS, pero en lugar de solo manejar fotogramas secuenciales, contiene las marcas de tiempo adecuadas para indicarle al decodificador cuándo decodificar y mostrar el siguiente fotograma B (los tipos de fotogramas se explican más adelante), antes de su fotograma de anclaje (P o I). Sin fotogramas B en el video, los valores de PTS y DTS son idénticos. [ 52 ]
Multiplexación
Para generar el PS, el multiplexor intercalará los flujos elementales empaquetados (dos o más). Esto se hace para que los paquetes de los flujos simultáneos se puedan transmitir por el mismo canal y se garantice que ambos lleguen al decodificador exactamente al mismo tiempo. Este es un caso de multiplexación por división de tiempo .
Determinar cuántos datos de cada flujo deben estar en cada segmento entrelazado (el tamaño del entrelazado) es complejo, pero un requisito importante. Un entrelazado incorrecto dará lugar a desbordamientos o subdesbordamientos del búfer, ya que el receptor recibe más de un flujo del que puede almacenar (por ejemplo, audio), antes de obtener suficientes datos para decodificar el otro flujo simultáneo (por ejemplo, vídeo). El verificador de almacenamiento en búfer de vídeo MPEG (VBV) ayuda a determinar si un PS multiplexado puede ser decodificado por un dispositivo con una tasa de transferencia de datos y un tamaño de búfer especificados. [ 53 ] Esto proporciona información al multiplexor y al codificador, para que puedan cambiar el tamaño del multiplexado o ajustar las tasas de bits según sea necesario para el cumplimiento.
Parte 2: Vídeo
La parte 2 del estándar MPEG-1 abarca el vídeo y está definida en ISO/IEC-11172-2. El diseño estuvo fuertemente influenciado por H.261 .
El formato de vídeo MPEG-1 utiliza métodos de compresión perceptiva para reducir significativamente la tasa de datos requerida por una transmisión de vídeo. Reduce o descarta por completo la información en ciertas frecuencias y áreas de la imagen que el ojo humano tiene una capacidad limitada para percibir por completo. También aprovecha la redundancia temporal (a lo largo del tiempo) y espacial (a lo largo de la imagen) común en el vídeo para lograr una mejor compresión de datos de la que sería posible de otro modo. (Véase: Compresión de vídeo )
Espacio de color

Antes de codificar el vídeo a MPEG-1, el espacio de color se transforma a Y′CbCr (Y′=Luma, Cb=Azul cromático, Cr=Rojo cromático). La luminancia (brillo, resolución) se almacena por separado de la crominancia (color, tono, fase) y se divide aún más en componentes rojo y azul.
La croma también se submuestrea a 4:2:0 , lo que significa que se reduce a la mitad de la resolución vertical y a la mitad de la resolución horizontal, es decir, a solo una cuarta parte del número de muestras utilizadas para el componente de luminancia del vídeo. [ 2 ] Este uso de mayor resolución para algunos componentes de color es similar en concepto al filtro de patrón Bayer que se utiliza comúnmente para el sensor de captura de imagen en las cámaras digitales en color. Debido a que el ojo humano es mucho más sensible a pequeños cambios en el brillo (el componente Y) que en el color (los componentes Cr y Cb), el submuestreo de croma es una forma muy eficaz de reducir la cantidad de datos de vídeo que necesitan comprimirse. Sin embargo, en vídeos con detalles finos (alta complejidad espacial ) esto puede manifestarse como artefactos de aliasing de croma. En comparación con otros artefactos de compresión digital , este problema parece ser muy raramente una fuente de molestia. Debido al submuestreo, el vídeo Y′CbCr 4:2:0 se almacena normalmente utilizando dimensiones pares ( divisibles por 2 horizontal y verticalmente).
El color Y′CbCr se suele denominar informalmente YUV para simplificar la notación, aunque este término se aplica más propiamente a un formato de color algo diferente. Del mismo modo, los términos luminancia y crominancia se utilizan a menudo en lugar de los términos (más precisos) luma y croma.
Resolución/velocidad de bits
MPEG-1 admite resoluciones de hasta 4095×4095 (12 bits) y velocidades de bits de hasta 100 Mbit/s. [ 16 ]
Los vídeos MPEG-1 suelen utilizar resoluciones SIF ( Source Input Format ) de 352×240, 352×288 o 320×240. Estas resoluciones relativamente bajas, junto con una tasa de bits inferior a 1,5 Mbit/s, conforman lo que se conoce como flujo de bits de parámetros restringidos (CPB), posteriormente denominado perfil de "bajo nivel" (LL) en MPEG-2. Estas son las especificaciones mínimas de vídeo que cualquier decodificador debe poder manejar para ser considerado compatible con MPEG-1 . Esta configuración se seleccionó para lograr un buen equilibrio entre calidad y rendimiento, permitiendo el uso de hardware relativamente económico de la época. [ 3 ] [ 16 ]
Tipos de marco/imagen/bloque
MPEG-1 tiene varios tipos de fotogramas/imágenes que cumplen diferentes propósitos. El más importante, aunque el más simple, es el fotograma I.
Marcos I
«I-frame» es una abreviatura de « Intra-frame », llamados así porque pueden decodificarse independientemente de cualquier otro fotograma. También se les conoce como imágenes I o fotogramas clave debido a su función similar a la de los fotogramas clave utilizados en animación. Los fotogramas I pueden considerarse prácticamente idénticos a las imágenes JPEG básicas . [ 16 ]
La búsqueda a alta velocidad en un vídeo MPEG-1 solo es posible hasta el fotograma I más cercano. Al editar un vídeo, no es posible iniciar la reproducción de un segmento antes del primer fotograma I del mismo (al menos no sin una recodificación computacionalmente intensiva). Por este motivo, en las aplicaciones de edición se utilizan vídeos MPEG que solo contienen fotogramas I.
La compresión solo de fotogramas I es muy rápida, pero produce archivos de gran tamaño: un factor de 3 × (o más) mayor que el vídeo MPEG-1 codificado normalmente, dependiendo de la complejidad temporal del vídeo. [ 3 ] El vídeo MPEG-1 solo de fotogramas I es muy similar al vídeo MJPEG . Tanto es así que se puede realizar una conversión de alta velocidad y teóricamente sin pérdidas (en realidad, hay errores de redondeo) de un formato a otro, siempre que se cumplan algunas restricciones (espacio de color y matriz de cuantificación) en la creación del flujo de bits. [ 54 ]
La longitud entre fotogramas I se conoce como tamaño de grupo de imágenes (GOP). MPEG-1 suele utilizar un tamaño de GOP de 15 a 18, es decir, 1 fotograma I por cada 14 a 17 fotogramas que no son I (alguna combinación de fotogramas P y B). Con codificadores más avanzados, el tamaño del GOP se elige dinámicamente, hasta un límite máximo preseleccionado. [ 16 ]
Se imponen límites al número máximo de tramas entre tramas I debido a la complejidad de la decodificación, el tamaño del búfer del decodificador, el tiempo de recuperación después de errores de datos, la capacidad de búsqueda y la acumulación de errores IDCT en implementaciones de baja precisión, más comunes en decodificadores de hardware (véase: IEEE -1180).
Marcos P
"Fotograma P" es la abreviatura de "fotograma predicho". También se les puede llamar fotogramas de predicción hacia adelante o fotogramas intermedios (los fotogramas B también son fotogramas intermedios).
Los fotogramas P existen para mejorar la compresión aprovechando la redundancia temporal (a lo largo del tiempo) en un vídeo. Los fotogramas P almacenan únicamente la diferencia de imagen con respecto al fotograma (ya sea un fotograma I o un fotograma P) inmediatamente anterior (este fotograma de referencia también se denomina fotograma de anclaje ).
La diferencia entre un fotograma P y su fotograma de referencia se calcula utilizando vectores de movimiento en cada macrobloque del fotograma (véase más abajo). Estos datos de vectores de movimiento se integrarán en el fotograma P para que los utilice el decodificador.
Un fotograma P puede contener cualquier número de bloques codificados intra (DCT y cuantizados), además de cualquier bloque predicho hacia adelante (vectores de movimiento). [ 55 ]
Si un vídeo cambia drásticamente de un fotograma a otro (como en un corte ), es más eficiente codificarlo como un fotograma I.
Fotogramas B
El término "fotograma B" se refiere a un "fotograma bidireccional" o "fotograma bipredictivo". También se les conoce como fotogramas de predicción inversa o imágenes B. Los fotogramas B son bastante similares a los fotogramas P, con la diferencia de que pueden realizar predicciones utilizando tanto el fotograma anterior como el futuro (es decir, dos fotogramas de referencia).
Por lo tanto, es necesario que el reproductor decodifique primero el siguiente fotograma de anclaje I o P secuencialmente después del fotograma B, antes de que este último pueda decodificarse y mostrarse. Esto implica que la decodificación de fotogramas B requiere búferes de datos más grandes y provoca un mayor retraso tanto en la decodificación como en la codificación. Esto también hace necesaria la función de marcas de tiempo de decodificación (DTS) en el flujo del contenedor/sistema (véase más arriba). Por consiguiente, los fotogramas B han sido objeto de mucha controversia durante mucho tiempo, a menudo se evitan en los vídeos y, en ocasiones, no son totalmente compatibles con los decodificadores de hardware.
No se predicen otros fotogramas a partir de un fotograma B. Por ello, se puede insertar un fotograma B con una tasa de bits muy baja, cuando sea necesario, para ayudar a controlar la tasa de bits. Si esto se hiciera con un fotograma P, los fotogramas P futuros se predecirían a partir de él y se reduciría la calidad de toda la secuencia. Sin embargo, de forma similar, el fotograma P futuro debe codificar todos los cambios entre él y el fotograma de anclaje I o P anterior. Los fotogramas B también pueden ser beneficiosos en vídeos donde el fondo detrás de un objeto se revela a lo largo de varios fotogramas, o en transiciones de desvanecimiento, como los cambios de escena. [ 3 ] [ 16 ]
Un fotograma B puede contener cualquier número de bloques codificados intra y bloques predichos hacia adelante, además de bloques predichos hacia atrás o bidireccionalmente. [ 16 ] [ 55 ]
marcos D
MPEG-1 posee un tipo de fotograma único que no se encuentra en estándares de vídeo posteriores. Los "fotogramas D" o imágenes DC son imágenes codificadas de forma independiente (fotogramas internos) que se han codificado utilizando únicamente coeficientes de la transformada DC (los coeficientes AC se eliminan al codificar los fotogramas D ; véase DCT más adelante) y, por lo tanto, tienen una calidad muy baja. Los fotogramas I, P o B nunca hacen referencia a los fotogramas D. Estos fotogramas solo se utilizan para previsualizaciones rápidas de vídeo, por ejemplo, al desplazarse por un vídeo a alta velocidad. [ 3 ]
Con equipos de decodificación de rendimiento moderadamente superior, se puede lograr una previsualización rápida decodificando fotogramas I en lugar de fotogramas D. Esto proporciona previsualizaciones de mayor calidad, ya que los fotogramas I contienen coeficientes de CA además de los de CC. Si el codificador puede asumir que los decodificadores disponen de capacidad de decodificación rápida de fotogramas I, puede ahorrar bits al no enviar fotogramas D (mejorando así la compresión del contenido de vídeo). Por este motivo, los fotogramas D rara vez se utilizan en la codificación de vídeo MPEG-1, y esta función no se ha incluido en ningún estándar de codificación de vídeo posterior.
Macrobloques
MPEG-1 opera el vídeo en una serie de bloques de 8×8 para la cuantificación. Sin embargo, para reducir la tasa de bits necesaria para los vectores de movimiento y debido a que la croma (color) se submuestrea por un factor de 4, cada par de bloques de croma (rojo y azul) corresponde a 4 bloques de luminancia diferentes. Es decir, para 4 bloques de luminancia de tamaño 8x8, hay un bloque Cb de 8x8 y un bloque Cr de 8x8. Este conjunto de 6 bloques, con una resolución de imagen de 16×16, se procesa conjuntamente y se denomina macrobloque .
Todos estos bloques de 8x8 se someten de forma independiente a la transformada discreta del coseno (DCT) y a la cuantización.
Un macrobloque es la unidad independiente más pequeña de vídeo (en color). Los vectores de movimiento (véase más abajo) operan exclusivamente a nivel de macrobloque.
Si la altura o el ancho del vídeo no son múltiplos exactos de 16, es necesario codificar y decodificar filas y columnas completas de macrobloques para rellenar la imagen (aunque los píxeles decodificados adicionales no se muestran).
Vectores de movimiento
Para reducir la redundancia temporal en un vídeo, solo se actualizan los bloques que cambian (hasta el tamaño máximo del GOP). Esto se conoce como reposición condicional. Sin embargo, por sí solo no es muy eficaz. El movimiento de los objetos o de la cámara puede provocar que se actualicen grandes porciones del fotograma, aunque solo haya cambiado la posición de los objetos previamente codificados. Mediante la estimación de movimiento, el codificador puede compensar este movimiento y eliminar una gran cantidad de información redundante.
El codificador compara el fotograma actual con las partes adyacentes del vídeo del fotograma de referencia (fotograma I o P anterior) en un patrón de diamante, hasta un límite de radio predefinido (específico del codificador) desde el área del macrobloque actual. Si se encuentra una coincidencia, solo es necesario codificar la dirección y la distancia (es decir, el vector de movimiento ) desde el área de vídeo anterior hasta el macrobloque actual en el fotograma intermedio (fotograma P o B). El proceso inverso, realizado por el decodificador para reconstruir la imagen, se denomina compensación de movimiento .
Sin embargo, un macrobloque predicho rara vez coincide perfectamente con la imagen actual. La diferencia entre el área de coincidencia estimada y el fotograma/macrobloque real se denomina error de predicción. Cuanto mayor sea el error de predicción, más datos adicionales deberán codificarse en el fotograma. Para una compresión de vídeo eficiente, es fundamental que el codificador sea capaz de realizar una estimación de movimiento eficaz y precisa.
Los vectores de movimiento registran la distancia entre dos áreas en pantalla según el número de píxeles (también llamados pels). El vídeo MPEG-1 utiliza una precisión de vector de movimiento (MV) de medio píxel, o half-pel. Cuanto mayor sea la precisión de los MV, mayor será la exactitud de la coincidencia y más eficiente la compresión. Sin embargo, una mayor precisión conlleva ciertas desventajas. Una mayor precisión de los MV implica el uso de una mayor cantidad de datos para representarlos, ya que se deben almacenar números más grandes en el fotograma para cada MV; una mayor complejidad de codificación, dado que se requieren niveles crecientes de interpolación en el macrobloque tanto para el codificador como para el decodificador; y rendimientos decrecientes (ganancias mínimas) con MV de mayor precisión. La precisión half-pel se eligió como la solución ideal en ese momento. (Véase: qpel )
Dado que es probable que los macrobloques vecinos tengan vectores de movimiento muy similares, esta información redundante se puede comprimir de forma bastante eficaz almacenándola codificada en DPCM . Solo es necesario almacenar en el flujo de bits final la (menor) diferencia entre los vectores de movimiento de cada macrobloque.
Los fotogramas P tienen un vector de movimiento por macrobloque, en relación con el fotograma de anclaje anterior. Los fotogramas B, sin embargo, pueden usar dos vectores de movimiento; uno del fotograma de anclaje anterior y otro del fotograma de anclaje futuro. [ 55 ]
Los macrobloques parciales y los bordes/barras negras codificados en el vídeo que no coinciden exactamente con el límite de un macrobloque causan problemas en la predicción del movimiento. La información de relleno/borde del bloque impide que el macrobloque se ajuste con precisión a cualquier otra área del vídeo, por lo que se debe codificar información de error de predicción significativamente mayor para cada uno de los numerosos macrobloques parciales a lo largo del borde de la pantalla. La codificación DCT y la cuantización (véase más abajo) tampoco son tan eficaces cuando existe un alto contraste de imagen en un bloque.
Un problema aún más grave se presenta con los macrobloques que contienen ruido de borde aleatorio y significativo , donde la imagen transiciona a negro (generalmente). Todos los problemas mencionados anteriormente también se aplican al ruido de borde. Además, la aleatoriedad añadida resulta prácticamente imposible de comprimir de forma significativa. Todos estos efectos reducen sustancialmente la calidad (o aumentan la tasa de bits) del vídeo.
DCT
Cada bloque de 8×8 se codifica aplicando primero una transformada discreta del coseno directa (FDCT) y luego un proceso de cuantificación. El proceso FDCT (en sí mismo) es teóricamente sin pérdidas y puede revertirse aplicando una transformada discreta del coseno inversa ( IDCT ) para reproducir los valores originales (en ausencia de errores de cuantificación y redondeo). En la práctica, se introducen algunos errores de redondeo (a veces considerables) tanto por la cuantificación en el codificador (como se describe en la siguiente sección) como por el error de aproximación de la IDCT en el decodificador. La precisión mínima permitida para la aproximación de la IDCT del decodificador está definida por la norma ISO/IEC 23002-1. (Antes de 2006, estaba especificada por la norma IEEE 1180-1990 ).
El proceso FDCT convierte el bloque de 8×8 píxeles sin comprimir (valores de brillo o diferencia de color) en una matriz indexada de 8×8 con coeficientes de frecuencia . Uno de estos coeficientes es el "coeficiente de CC" (con una varianza estadísticamente alta), que representa el valor promedio de todo el bloque de 8×8. Los otros 63 coeficientes son los "coeficientes de CA", estadísticamente menores, cuyos valores positivos o negativos representan desviaciones sinusoidales respecto al valor del bloque plano representado por el coeficiente de CC.
Ejemplo de un bloque FDCT codificado de 8×8:
Dado que el valor del coeficiente de CC está estadísticamente correlacionado entre bloques, se comprime mediante codificación DPCM . Solo la pequeña diferencia entre cada valor de CC y el valor del coeficiente de CC del bloque a su izquierda debe representarse en el flujo de bits final.
Además, la conversión de frecuencia que se realiza al aplicar la DCT proporciona una función de decorrelación estadística para concentrar eficientemente la señal en un menor número de valores de alta amplitud antes de aplicar la cuantización (véase más abajo).
Cuantización
La cuantización es, esencialmente, el proceso de reducir la precisión de una señal, dividiéndola por un tamaño de paso mayor y redondeándola a un valor entero (es decir, encontrar el múltiplo más cercano y descartar el resto).
El cuantificador a nivel de fotograma es un número entre 0 y 31 (aunque los codificadores suelen omitir o deshabilitar algunos de los valores extremos) que determina cuánta información se eliminará de un fotograma determinado. El cuantificador a nivel de fotograma suele ser seleccionado dinámicamente por el codificador para mantener una tasa de bits específica definida por el usuario, o (con mucha menos frecuencia) especificado directamente por el usuario.
Una "matriz de cuantificación" es una secuencia de 64 números (del 0 al 255) que indica al codificador la importancia relativa de cada elemento de información visual. Cada número de la matriz corresponde a un componente de frecuencia específico de la imagen de vídeo.
Ejemplo de matriz de cuantización:
La cuantización se realiza tomando cada uno de los 64 valores de frecuencia del bloque DCT, dividiéndolos por el cuantizador a nivel de fotograma y luego por sus valores correspondientes en la matriz de cuantización. Finalmente, el resultado se redondea hacia abajo. Esto reduce significativamente, o elimina por completo, la información en algunos componentes de frecuencia de la imagen. Por lo general, la información de alta frecuencia es menos importante visualmente, por lo que las altas frecuencias se cuantizan mucho más (se reducen drásticamente). MPEG-1 utiliza dos matrices de cuantización separadas, una para bloques internos (bloques I) y otra para bloques externos (bloques P y B), de modo que la cuantización de diferentes tipos de bloques se puede realizar de forma independiente y, por lo tanto, más eficaz. [ 3 ]
Este proceso de cuantización suele reducir a cero un número significativo de coeficientes de CA (lo que se conoce como datos dispersos ), que luego pueden comprimirse de forma más eficiente mediante codificación entrópica (compresión sin pérdidas) en el siguiente paso.
Un ejemplo de bloque DCT cuantificado:
La cuantización elimina una gran cantidad de datos y es el principal paso de procesamiento con pérdida en la codificación de video MPEG-1. También es la principal causa de la mayoría de los artefactos de compresión de video MPEG-1 , como el efecto de bloques , bandas de color , ruido , anillos , decoloración , etc. Esto ocurre cuando el video se codifica con una tasa de bits insuficiente, lo que obliga al codificador a utilizar cuantizadores de alto nivel de fotograma ( cuantización fuerte ) en gran parte del video.
Codificación de entropía
Varios pasos en la codificación de video MPEG-1 son sin pérdida, lo que significa que se revertirán al decodificar para producir exactamente los mismos valores (originales). Dado que estos pasos de compresión de datos sin pérdida no agregan ruido ni modifican el contenido (a diferencia de la cuantización), a veces se le denomina codificación sin ruido . [ 47 ] Dado que la compresión sin pérdida busca eliminar la mayor cantidad de redundancia posible, se conoce como codificación entrópica en el campo de la teoría de la información .
Los coeficientes de los bloques DCT cuantificados tienden a cero hacia la esquina inferior derecha. La máxima compresión se puede lograr mediante un escaneo en zigzag del bloque DCT, comenzando desde la esquina superior izquierda y utilizando técnicas de codificación de longitud variable.
Los coeficientes de CC y los vectores de movimiento están codificados en DPCM .
La codificación de longitud variable (RLE, por sus siglas en inglés) es un método sencillo para comprimir la repetición. Una cadena de caracteres, independientemente de su longitud, puede reemplazarse con unos pocos bytes que indiquen el valor que se repite y cuántas veces. Por ejemplo, si alguien dijera "cinco nueves", sabríamos que se refiere al número 99999.
RLE resulta especialmente eficaz tras la cuantización, ya que un número significativo de coeficientes AC ahora son cero (lo que se denomina datos dispersos ) y pueden representarse con tan solo un par de bytes. Esta información se almacena en una tabla Huffman bidimensional especial que codifica la longitud de la secuencia y el carácter de fin de secuencia.
La codificación Huffman es un método de codificación entrópica muy popular y relativamente sencillo, utilizado en vídeo MPEG-1 para reducir el tamaño de los datos. Estos se analizan para encontrar secuencias que se repiten con frecuencia. Dichas secuencias se almacenan en una tabla especial, asignando a los datos que se repiten con mayor frecuencia el código más corto. Esto permite mantener los datos lo más pequeños posible con este tipo de compresión. [ 47 ] Una vez construida la tabla, estas secuencias se reemplazan por sus códigos (mucho más cortos), que hacen referencia a la entrada correspondiente en la tabla. El decodificador simplemente invierte este proceso para generar los datos originales.
Este es el paso final del proceso de codificación de vídeo, por lo que el resultado de la codificación Huffman se conoce como el "flujo de bits" de vídeo MPEG-1.
Configuraciones GOP para aplicaciones específicas
Los fotogramas I almacenan información completa del fotograma dentro del mismo y, por lo tanto, son adecuados para el acceso aleatorio. Los fotogramas P proporcionan compresión utilizando vectores de movimiento relativos al fotograma anterior (I o P). Los fotogramas B proporcionan la máxima compresión, pero requieren tanto el fotograma anterior como el siguiente para el cálculo. Por lo tanto, el procesamiento de fotogramas B requiere más búfer en el lado decodificado. Una configuración del Grupo de Imágenes (GOP) debe seleccionarse en función de estos factores. Las secuencias de solo fotogramas I proporcionan la menor compresión, pero son útiles para el acceso aleatorio, el avance rápido/retroceso rápido y la edición. Las secuencias de fotogramas I y P proporcionan una compresión moderada, pero añaden cierto grado de acceso aleatorio y funcionalidad de avance rápido/retroceso rápido. Las secuencias de fotogramas I, P y B proporcionan una compresión muy alta, pero también aumentan significativamente el retardo de codificación/decodificación. Por lo tanto, dichas configuraciones no son adecuadas para aplicaciones de videotelefonía o videoconferencia.
La tasa de datos típica de un fotograma I es de 1 bit por píxel, mientras que la de un fotograma P es de 0,1 bits por píxel y la de un fotograma B es de 0,015 bits por píxel. [ 56 ]
Parte 3: Audio
La parte 3 del estándar MPEG-1 abarca el audio y está definida en la norma ISO/IEC-11172-3.
El audio MPEG-1 utiliza la psicoacústica para reducir significativamente la tasa de datos requerida por una transmisión de audio. Reduce o descarta por completo ciertas partes del audio que deduce que el oído humano no puede oír , ya sea porque están en frecuencias donde el oído tiene una sensibilidad limitada o porque están enmascaradas por otros sonidos (generalmente más fuertes). [ 57 ]
Modos de codificación de canal:
- Mononucleosis infecciosa
- Estéreo conjunto: intensidad codificada
- Estéreo conjunto – Codificación M/S (solo capa III)
- Estéreo
- Doble (dos canales mono no correlacionados )
- 32000 Hz
- 44100 Hz
- 48000 Hz
- Capa I: 32, 64, 96, 128, 160, 192, 224, 256, 288, 320, 352, 384, 416 y 448 kbit/s [ 58 ]
- Capa II: 32, 48, 56, 64, 80, 96, 112, 128, 160, 192, 224, 256, 320 y 384 kbit/s
- Capa III: 32, 40, 48, 56, 64, 80, 96, 112, 128, 160, 192, 224, 256 y 320 kbit/s
El audio MPEG-1 se divide en 3 capas. Cada capa superior es computacionalmente más compleja y, por lo general, más eficiente a tasas de bits más bajas que la anterior. [ 16 ] Las capas son parcialmente compatibles con versiones anteriores, ya que las capas superiores reutilizan tecnologías implementadas por las capas inferiores. Un decodificador "completo" de la Capa II también puede reproducir audio de la Capa I, pero no audio de la Capa III, aunque no todos los reproductores de nivel superior son "completos". [ 57 ]
Capa I
MPEG-1 Audio Layer I es una versión simplificada de MPEG-1 Audio Layer II. [ 18 ] Layer I utiliza un tamaño de trama más pequeño de 384 muestras para una latencia muy baja y una resolución más fina. [ 26 ] Esto es ventajoso para aplicaciones como teleconferencias, edición de estudio, etc. Tiene una complejidad menor que Layer II para facilitar la codificación en tiempo real en el hardware disponible alrededor de 1990. [ 47 ]
La capa I tuvo una adopción limitada en su época, y en particular se usó en el extinto casete digital compacto de Philips a una tasa de bits de 384 kbit/s. [ 2 ] Con las mejoras sustanciales en el rendimiento del procesamiento digital desde su introducción, la capa I rápidamente se volvió innecesaria y obsoleta.
Los archivos de audio de la capa I suelen usar la extensión ".mp1" o, a veces, ".m1a".
Capa II
MPEG-1 Audio Layer II (la primera versión de MP2, a menudo llamada informalmente MUSICAM) [ 57 ] es un formato de audio con pérdida diseñado para proporcionar alta calidad a unos 192 kbit/s para sonido estéreo. [ 59 ] La decodificación de audio MP2 es computacionalmente simple en comparación con MP3, AAC , etc.
Historia/Música
MPEG-1 Audio Layer II se derivó del códec de audio MUSICAM ( Masking pattern adapt Universal Subband Integrated Coding And Multiplexing ), desarrollado por el Centre commun d'études de télévision et télécommunications (CCETT), Philips y el Institut für Rundfunktechnik (IRT/CNET) [ 16 ] [ 18 ] [ 60 ] como parte de la iniciativa paneuropea intergubernamental de investigación y desarrollo EUREKA 147 para el desarrollo de la radiodifusión de audio digital.
La mayoría de las características clave del audio MPEG-1 se heredaron directamente de MUSICAM, incluyendo el banco de filtros, el procesamiento en el dominio del tiempo, los tamaños de los fotogramas de audio, etc. Sin embargo, se realizaron mejoras y el algoritmo MUSICAM no se utilizó en la versión final del estándar MPEG-1 Audio Layer II. El uso generalizado del término MUSICAM para referirse a Layer II es completamente incorrecto y se desaconseja por razones técnicas y legales. [ 57 ]
Detalles técnicos
MP2 es un codificador en el dominio del tiempo. Utiliza un banco de filtros polifásicos de 32 subbandas de baja latencia para el mapeo tiempo-frecuencia; con rangos superpuestos (es decir, polifásicos) para evitar el aliasing. [ 61 ] El modelo psicoacústico se basa en los principios de enmascaramiento auditivo , efectos de enmascaramiento simultáneo y el umbral absoluto de audición (ATH). El tamaño de un cuadro de la Capa II está fijo en 1152 muestras (coeficientes).
El dominio del tiempo se refiere a cómo se realiza el análisis y la cuantificación en muestras o fragmentos cortos y discretos de la forma de onda de audio. Esto ofrece una baja latencia, ya que solo se analiza un número reducido de muestras antes de la codificación, a diferencia de la codificación en el dominio de la frecuencia (como MP3), que debe analizar muchas más muestras antes de poder transformar y generar el audio codificado. Además, ofrece un mejor rendimiento en impulsos complejos, aleatorios y transitorios (como instrumentos de percusión y aplausos), evitando artefactos como el pre-eco.
El banco de filtros de 32 subbandas devuelve 32 coeficientes de amplitud , uno para cada banda/segmento de frecuencia de igual tamaño del audio, que tiene un ancho aproximado de 700 Hz (dependiendo de la frecuencia de muestreo del audio). El codificador utiliza entonces el modelo psicoacústico para determinar qué subbandas contienen información de audio menos importante y, por lo tanto, dónde la cuantización será inaudible, o al menos mucho menos perceptible. [ 47 ]

El modelo psicoacústico se aplica mediante una transformada rápida de Fourier (FFT) de 1024 puntos . De las 1152 muestras por trama, se ignoran 64 muestras en los extremos superior e inferior del rango de frecuencia para este análisis. Se presume que no son lo suficientemente significativas como para cambiar el resultado. El modelo psicoacústico utiliza un modelo de enmascaramiento determinado empíricamente para determinar qué subbandas contribuyen más al umbral de enmascaramiento y cuánto ruido de cuantización puede contener cada una sin ser percibido. Cualquier sonido por debajo del umbral absoluto de audición (ATH) se descarta por completo. Los bits disponibles se asignan a cada subbanda en consecuencia. [ 57 ] [ 61 ]
Por lo general, las subbandas son menos importantes si contienen sonidos más suaves (coeficiente menor) que una subbanda vecina (es decir, de frecuencia similar) con sonidos más fuertes (coeficiente mayor). Además, los componentes de "ruido" suelen tener un efecto de enmascaramiento más significativo que los componentes "tonales". [ 60 ]
La cuantización reduce la precisión de las subbandas menos significativas. Esto implica básicamente comprimir el rango de frecuencias (amplitud del coeficiente), es decir, aumentar el nivel de ruido. Luego se calcula un factor de amplificación que el decodificador utiliza para reexpandir cada subbanda al rango de frecuencias adecuado. [ 62 ] [ 63 ]
La capa II también puede utilizar opcionalmente la codificación estéreo de intensidad , una forma de estéreo conjunto. Esto significa que las frecuencias superiores a 6 kHz de ambos canales se combinan/mezclan en un único canal (mono), pero la información del "canal lateral" sobre la intensidad relativa (volumen, amplitud) de cada canal se conserva y se codifica en el flujo de bits por separado. Durante la reproducción, el único canal se reproduce a través de los altavoces izquierdo y derecho, con la información de intensidad aplicada a cada canal para dar la ilusión de sonido estéreo. [ 47 ] [ 60 ] Este truco perceptivo se conoce como "irrelevancia estéreo". Esto puede permitir una mayor reducción de la tasa de bits de audio sin mucha pérdida perceptible de fidelidad, pero generalmente no se utiliza con tasas de bits más altas, ya que no proporciona un audio de muy alta calidad (transparente). [ 47 ] [ 61 ] [ 64 ] [ 65 ]
Calidad
Las pruebas de audio subjetivas realizadas por expertos, en las condiciones más críticas jamás implementadas, han demostrado que MP2 ofrece una compresión de audio transparente a 256 kbit/s para audio de CD de 16 bits y 44,1 kHz utilizando la implementación de referencia más antigua (los codificadores más recientes presumiblemente deberían tener un rendimiento aún mejor). [ 2 ] [ 60 ] [ 61 ] [ 66 ] Esa relación de compresión (aproximadamente) 1:6 para audio de CD es particularmente impresionante porque está bastante cerca del límite superior estimado de entropía perceptual , en poco más de 1:8. [ 67 ] [ 68 ] Lograr una compresión mucho mayor simplemente no es posible sin descartar cierta información perceptible.
MP2 sigue siendo un estándar de codificación de audio con pérdida preferido debido a su rendimiento de codificación de audio particularmente alto en material de audio importante como castañuelas, orquesta sinfónica, voces masculinas y femeninas y transitorios (impulsos) particularmente complejos y de alta energía como sonidos de percusión: triángulo, glockenspiel y aplausos del público. [ 26 ] Pruebas más recientes han demostrado que MPEG Multichannel (basado en MP2), a pesar de estar comprometido por un modo matricial inferior (por el bien de la retrocompatibilidad) [ 2 ] [ 61 ] obtiene tasas solo ligeramente inferiores a las de códecs de audio mucho más recientes, como Dolby Digital (AC-3) y Advanced Audio Coding (AAC) (en su mayoría dentro del margen de error , y sustancialmente superior en algunos casos, como los aplausos del público). [ 69 ] [ 70 ] Esta es una razón por la que el audio MP2 continúa siendo ampliamente utilizado. Sin embargo, las pruebas de verificación de MPEG-2 AAC Stereo llegaron a una conclusión muy diferente, mostrando que AAC proporciona un rendimiento superior a MP2 a la mitad de la tasa de bits. [ 71 ] No está claro el motivo de esta disparidad entre las pruebas anteriores y posteriores, pero curiosamente, en la última prueba no se observa una muestra de aplausos.
Los archivos de audio de la capa II suelen usar la extensión ".mp2" o, a veces, ".m2a".
Capa III
MPEG-1 Audio Layer III (la primera versión de MP3 ) es un formato de audio con pérdida diseñado para proporcionar una calidad aceptable de aproximadamente 64 kbit/s para audio monofónico a través de enlaces ISDN de un solo canal ( BRI ) , y de 128 kbit/s para sonido estéreo.
Historia/ASPECTO

La capa III de audio MPEG-1 se derivó del códec ASPEC ( Adaptive Spectral Perceptual Entropy Coding ), desarrollado por Fraunhofer como parte de la iniciativa paneuropea intergubernamental de investigación y desarrollo EUREKA 147 para el desarrollo de la radiodifusión de audio digital. ASPEC se adaptó para ajustarse al modelo de la capa II (tamaño de trama, banco de filtros, FFT, etc.), convirtiéndose así en la capa III. [ 18 ]
ASPEC se basó a su vez en Multiple adaptive Spectral audio Coding (MSC) de EF Schroeder , Optimum Coding in the Frequency domain (OCF), la tesis doctoral de Karlheinz Brandenburg en la Universidad de Erlangen-Nuremberg , Perceptual Transform Coding (PXFM) de JD Johnston en AT&T Bell Labs , y Transform coding of audio signals de Y. Mahieux y J. Petit en Institut für Rundfunktechnik (IRT/CNET). [ 72 ]
Detalles técnicos
MP3 es un codificador de transformación de audio en el dominio de la frecuencia . Aunque utiliza algunas de las funciones de la capa inferior, MP3 es bastante diferente de MP2.
MP3 funciona con 1152 muestras como MP2, pero necesita tomar múltiples fotogramas para el análisis antes de que el procesamiento en el dominio de la frecuencia (MDCT) y la cuantización sean efectivos. Genera un número variable de muestras, utilizando un búfer de bits para permitir esta codificación de tasa de bits variable (VBR) manteniendo fotogramas de salida de tamaño de muestra de 1152. Esto provoca un retraso significativamente mayor antes de la salida, lo que ha hecho que MP3 se considere inadecuado para aplicaciones de estudio donde se requiere edición u otro procesamiento. [ 61 ]
MP3 no se beneficia del banco de filtros polifásicos de 32 subbandas, sino que simplemente utiliza una transformación MDCT de 18 puntos en cada salida para dividir los datos en 576 componentes de frecuencia y procesarlos en el dominio de la frecuencia. [ 60 ] Esta granularidad adicional permite que MP3 tenga un modelo psicoacústico mucho más preciso y aplique con mayor cuidado la cuantización adecuada a cada banda, lo que proporciona un rendimiento mucho mejor a bajas tasas de bits.
El procesamiento en el dominio de la frecuencia también impone algunas limitaciones, causando una resolución temporal 12 o 36 veces peor que la Capa II. Esto causa artefactos de cuantización, debido a sonidos transitorios como eventos percusivos y otros eventos de alta frecuencia que se extienden sobre una ventana más grande. Esto resulta en un desenfoque audible y pre-eco . [ 61 ] MP3 utiliza rutinas de detección de pre-eco y codificación VBR, lo que le permite aumentar temporalmente la tasa de bits durante pasajes difíciles, en un intento de reducir este efecto. También puede cambiar entre la ventana de cuantización normal de 36 muestras y, en su lugar, usar 3 × ventanas cortas de 12 muestras, para reducir la duración temporal (tiempo) de los artefactos de cuantización. [ 61 ] Sin embargo, al elegir un tamaño de ventana bastante pequeño para que la respuesta temporal de MP3 sea lo suficientemente adecuada para evitar los artefactos más graves, MP3 se vuelve mucho menos eficiente en la compresión en el dominio de la frecuencia de componentes tonales estacionarios.
El uso forzado de un modelo híbrido de dominio temporal (banco de filtros) / dominio de frecuencia (MDCT) para adaptarse a la Capa II simplemente desperdicia tiempo de procesamiento y compromete la calidad al introducir artefactos de aliasing. El formato MP3 cuenta con una etapa de cancelación de aliasing específicamente para enmascarar este problema, pero que en su lugar produce energía en el dominio de la frecuencia que debe codificarse en el audio. Esta energía se desplaza hacia la parte superior del rango de frecuencias, donde la mayoría de las personas tienen una audición limitada, con la esperanza de que la distorsión que produce sea menos audible.
La transformada rápida de Fourier (FFT) de 1024 puntos de Layer II no cubre todas las muestras y omitiría varias subbandas MP3 completas, donde se deben determinar los factores de cuantificación. En cambio, MP3 utiliza dos pasadas de análisis FFT para la estimación espectral, con el fin de calcular los umbrales de enmascaramiento globales e individuales. Esto le permite cubrir las 1152 muestras. De las dos, utiliza el nivel de umbral de enmascaramiento global de la pasada más crítica, que corresponde al audio más complejo.
Además del estéreo conjunto codificado por intensidad de Layer II, MP3 puede usar estéreo conjunto medio/lateral (m/s, MS, matriz). Con el estéreo medio/lateral, ciertos rangos de frecuencia de ambos canales se fusionan en un único canal mono (medio, medio, L+R), mientras que la diferencia de sonido entre los canales izquierdo y derecho se almacena como un canal separado (lateral, LR). A diferencia del estéreo por intensidad, este proceso no descarta ninguna información de audio. Sin embargo, al combinarse con la cuantización, puede exagerar los artefactos.
Si la diferencia entre los canales izquierdo y derecho es pequeña, el canal lateral también lo será, lo que ofrece un ahorro de hasta un 50 % en la tasa de bits y la consiguiente mejora de la calidad. Si la diferencia entre izquierda y derecha es grande, puede ser preferible la codificación estéreo estándar (discreta, izquierda/derecha), ya que la codificación estéreo conjunta mid/side no ofrece ninguna ventaja. Un codificador MP3 puede alternar entre estéreo m/s y estéreo completo fotograma a fotograma. [ 60 ] [ 65 ] [ 73 ]
A diferencia de las capas I y II, MP3 utiliza codificación Huffman de longitud variable (después de la perceptual) para reducir aún más la tasa de bits, sin ninguna pérdida adicional de calidad. [ 57 ] [ 61 ]
Calidad
La cuantización más fina y selectiva del MP3 demuestra ser notablemente superior a la del MP2 a tasas de bits más bajas. Es capaz de proporcionar una calidad de audio casi equivalente a la de Layer II, con una tasa de bits un 15 % menor (aproximadamente). [ 70 ] [ 71 ] 128 kbit/s se considera el punto óptimo para el MP3; es decir, proporciona un sonido estéreo de calidad generalmente aceptable en la mayoría de la música, y las mejoras de calidad disminuyen al aumentar aún más la tasa de bits. También se considera que el MP3 presenta artefactos menos molestos que Layer II, cuando ambos se utilizan a tasas de bits demasiado bajas para proporcionar una reproducción fiel.
Los archivos de audio de la capa III utilizan la extensión ".mp3".
extensiones de audio MPEG-2
El estándar MPEG-2 incluye varias extensiones de MPEG-1 Audio. [ 61 ] Estas se conocen como MPEG-2 BC – retrocompatible con MPEG-1 Audio. [ 74 ] [ 75 ] [ 76 ] [ 77 ] MPEG-2 Audio está definido en ISO/IEC 13818-3.
- MPEG Multichannel – Sonido envolvente de 5.1 canales compatible con versiones anteriores . [ 25 ]
- Frecuencias de muestreo : 16000, 22050 y 24000 Hz
- Tasas de bits : 8, 16, 24, 32, 40, 48, 56, 64, 80, 96, 112, 128, 144 y 160 kbit/s
Estas frecuencias de muestreo son exactamente la mitad de las definidas originalmente para MPEG-1 Audio. Se introdujeron para mantener una mayor calidad de sonido al codificar audio a tasas de bits más bajas. [ 25 ] Las tasas de bits aún más bajas se introdujeron porque las pruebas demostraron que MPEG-1 Audio podía proporcionar una mayor calidad que cualquier códec de audio existente ( c. 1994 ) de tasa de bits muy baja (es decir, voz ). [ 78 ]
Parte 4: Pruebas de conformidad
La parte 4 del estándar MPEG-1 abarca las pruebas de conformidad y está definida en la norma ISO/IEC-11172-4.
Conformidad: Procedimientos para comprobar la conformidad.
Proporciona dos conjuntos de directrices y flujos de bits de referencia para probar la conformidad de los decodificadores de audio y vídeo MPEG-1, así como los flujos de bits producidos por un codificador. [ 16 ] [ 23 ]
Parte 5: Software de referencia
La parte 5 del estándar MPEG-1 incluye software de referencia y está definida en la norma ISO/IEC TR 11172–5.
Simulación: Software de referencia.
Código de referencia en C para la codificación y decodificación de audio y vídeo, así como para la multiplexación y demultiplexación. [ 16 ] [ 23 ]
Esto incluye el código del codificador de audio ISO Dist10 , en el que se basaron originalmente LAME y TooLAME .
Extensión de archivo
.mpg es una de las extensiones de archivo para la compresión de audio y video MPEG-1 o MPEG-2 . El video MPEG-1 Parte 2 es poco común hoy en día, y esta extensión generalmente se refiere a un flujo de programa MPEG (definido en MPEG-1 y MPEG-2) o a un flujo de transporte MPEG (definido en MPEG-2). También existen otros sufijos, como .m2ts, que especifican el contenedor preciso, en este caso MPEG-2 TS, pero esto tiene poca relevancia para los medios MPEG-1.
La extensión .mp3 es la más común para archivos que contienen audio MP3 (normalmente MPEG-1 Audio, a veces MPEG-2 Audio). Un archivo MP3 suele ser un flujo de audio sin procesar; la forma convencional de etiquetar archivos MP3 consiste en escribir datos en segmentos de "basura" de cada fotograma, que conservan la información multimedia pero son descartados por el reproductor. Esto es similar en muchos aspectos a cómo se etiquetan los archivos .AAC sin procesar (aunque hoy en día tiene menos soporte, por ejemplo, en iTunes ).
Tenga en cuenta que, si bien podría aplicarse, la extensión .mpg normalmente no incluye archivos AAC sin comprimir ni archivos AAC en contenedores MPEG-2 Parte 7. La extensión .aac suele designar estos archivos de audio.
Véase también
- MPEG ( The Moving Picture Experts Group), desarrolladores del estándar MPEG-1
- MP3 Detalles técnicos adicionales sobre MPEG-1 Audio Layer III
- Extensión de sonido envolvente de 5.1 canales compatible con versiones anteriores de MPEG Multichannel para MPEG-1 Audio Layer II
- MPEG-2: El sucesor directo del estándar MPEG-1.
- ISO/IEC JTC 1/SC 29
- Implementaciones
- Libavcodec incluye codificadores y decodificadores de vídeo/audio MPEG-1/2.
- Mjpegtools Archivado el 20/04/2008 en Wayback Machine Codificadores de vídeo/audio MPEG-1/2
- TooLAME Un codificador de audio MPEG-1 Layer II de alta calidad.
- LAME Un codificador de audio MP3 de alta calidad.
- Musepack: Un formato originalmente basado en MPEG-1 Audio Layer II, pero ahora incompatible.
Referencias
- 1 2 Patel K, Smith BC, Rowe LA (1993-09-01). "Rendimiento de un decodificador de vídeo MPEG por software" . Actas de la primera conferencia internacional ACM sobre multimedia - MULTIMEDIA '93 . ACM Multimedia. Ciudad de Nueva York: Association for Computing Machinery. págs. 75–82 . doi : 10.1145/166266.166274 . ISBN 978-0-89791-596-0. S2CID 3773268 . Archivado del original el 15-12-2021 . Recuperado el 15-12-2021 . La referencia 3 del documento corresponde al borrador del Comité de la norma ISO/IEC 11172, del 6 de diciembre de 1991.
- 1 2 3 4 5 6 Adler, Mark; Popp, Harald; Hjerde, Morten (9 de noviembre de 1996), MPEG-FAQ: compresión multimedia [ 1/9 ] , faqs.org, archivado del original el 4 de enero de 2017 , recuperado el 11 de noviembre de 2016
- 1 2 3 4 5 6 7 8 Le Gall, Didier (abril de 1991), MPEG: un estándar de compresión de vídeo para aplicaciones multimedia (PDF) , Communications of the ACM , archivado (PDF) del original el 27 de enero de 2017 , recuperado el 11 de noviembre de 2016
- ↑ Chiariglione, Leonardo (21 de octubre de 1989), comunicado de prensa de Kurihama 89 , ISO / IEC , archivado del original el 5 de agosto de 2010 , consultado el 9 de abril de 2008.
- ↑ ISO/IEC JTC 1/SC 29 (30-10-2009). "Programa de trabajo — Asignado a SC 29/WG 11, MPEG-1 (Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a hasta aproximadamente 1,5 Mbit/s)" . Archivado del original el 31-12-2013 . Recuperado el 10-11-2009 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ ISO. "ISO/IEC 11172-1:1993 – Tecnología de la información – Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s – Parte 1: Sistemas" . Archivado del original el 12 de noviembre de 2016. Consultado el 11 de noviembre de 2016 .
- ↑ MPEG. "Acerca de MPEG – Logros" . chiariglione.org. Archivado del original el 8 de julio de 2008. Consultado el 31 de octubre de 2009 .
- ↑ MPEG. "Términos de referencia" . chiariglione.org. Archivado del original el 21 de febrero de 2010. Consultado el 31 de octubre de 2009 .
- 1 2 MPEG. "Estándares MPEG: lista completa de estándares desarrollados o en desarrollo" . chiariglione.org. Archivado del original el 20 de abril de 2010. Recuperado el 31 de octubre de 2009 .
- ↑ Lea, William (1994). Vídeo a la carta: Documento de investigación 94/68 . Biblioteca de la Cámara de los Comunes . Archivado del original el 20 de septiembre de 2019. Recuperado el 20 de septiembre de 2019 .
- ↑ "Historia de la compresión de vídeo" . UIT-T . Equipo conjunto de vídeo (JVT) de ISO/IEC MPEG e UIT-T VCEG (ISO/IEC JTC1/SC29/WG11 e UIT-T SG16 Q.6). Julio de 2002. págs. 11, 24–9 , 33, 40–1 , 53–6 . Archivado del original el 8 de marzo de 2021. Consultado el 3 de noviembre de 2019 .
- ↑ Ghanbari, Mohammed (2003). Códecs estándar: compresión de imágenes a codificación de vídeo avanzada . Institution of Engineering and Technology . págs. 1–2 . ISBN 9780852967102.
- ↑ "Infografía sobre la historia de los formatos de archivo de vídeo" . RealNetworks . 22 de abril de 2012. Archivado del original el 29 de junio de 2018. Consultado el 5 de agosto de 2019 .
- ↑ Hans Geog Musmann, Génesis del estándar de codificación de audio MP3 (PDF) , archivado del original (PDF) el 17 de enero de 2012 , consultado el 26 de julio de 2011.
- ↑ Fogg, Chad (2 de abril de 1996), Preguntas frecuentes sobre MPEG-2 , Universidad de California, Berkeley , archivado del original el 29 de agosto de 2000 , consultado el 9 de abril de 2008.
- 1 2 3 4 5 6 7 8 9 10 11 12 Fogg, Chad (2 de abril de 1996), Preguntas frecuentes sobre MPEG-2 (sitio web archivado) , Universidad de California, Berkeley , archivado del original el 16 de junio de 2008 , consultado el 11 de noviembre de 2016
- ↑ Chiariglione, Leonardo (marzo de 2001), Código abierto en MPEG , Linux Journal , archivado del original el 25 de julio de 2011 , consultado el 9 de abril de 2008.
- 1 2 3 4 Chiariglione, Leonardo; Le Gall, Didier; Musmann, Hans-Georg; Simon, Allen (septiembre de 1990), Comunicado de prensa – Informe de estado de ISO MPEG , ISO / IEC , archivado del original el 14 de febrero de 2010 , recuperado el 9 de abril de 2008
- ↑ Reuniones , ISO / IEC , archivado del original el 10/02/2010 , recuperado el 09/04/2008.
- 1 2 "MPEG-FAQ, Versión 3.1" . Archivado del original el 23/07/2009 . Consultado el 12/10/2008 .
P. Entonces, ¿cómo consigo los documentos, como el borrador de MPEG? R. MPEG es un borrador de norma ISO. Su
nombre
exacto
es ISO
CD 11172. [...] Puede solicitarlo a su organismo nacional de normalización (por ejemplo, ANSI en EE. UU.) o comprarlo a empresas como OMNICOM [...]
- ↑ "Comunicado de prensa de MPEG" (Comunicado de prensa). ISO/IEC JTC1/SC29/WG11. 6 de noviembre de 1992. Archivado del original el 12 de agosto de 2010. Consultado el 7 de mayo de 2018 .
- ↑ "Página de resumen n.° 101" . Archivado del original el 6 de octubre de 2008. Consultado el 13 de julio de 2008 ."BMRC" . Archivado del original el 12 de junio de 2008. Consultado el 13 de julio de 2008 .Un reproductor multimedia continuo, Lawrence A. Rowe y Brian C. Smith, Actas del 3er Taller Internacional sobre Soporte de Redes y Sistemas Operativos para Audio y Video Digital, San Diego, California (noviembre de 1992).
- 1 2 3 Logros , ISO / IEC , archivado del original el 08-07-2008 , recuperado el 03-04-2008
- ↑ Chiariglione, Leonardo (6 de noviembre de 1992), comunicado de prensa de MPEG, Londres, 6 de noviembre de 1992 , ISO / IEC , archivado del original el 12 de agosto de 2010 , consultado el 9 de abril de 2008.
- 1 2 3 Wallace, Greg (2 de abril de 1993), Comunicado de prensa , ISO / IEC , archivado del original el 6 de agosto de 2010 , recuperado el 9 de abril de 2008
- 1 2 3 4 Popp, Harald; Hjerde, Morten (9 de noviembre de 1996), MPEG-FAQ: compresión multimedia [ 2/9 ] , faqs.org, archivado del original el 4 de enero de 2017 , recuperado el 11 de noviembre de 2016
- ↑ "ORGANIZACIÓN INTERNACIONAL DE NORMALIZACIÓN ORGANISATION INTERNATIONALE DE NORMALISATION ISO" . 26 de julio de 2010. Archivado del original el 26 de julio de 2010. Consultado el 7 de mayo de 2018 .
- ↑ ISO/IEC JTC 1/SC 29 (17 de julio de 2010). "MPEG-1 (Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s)" . Archivado del original el 31 de diciembre de 2013. Consultado el 18 de julio de 2010 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ ISO. "ISO/IEC 11172-1:1993 – Tecnología de la información – Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s – Parte 1: Sistemas" . Archivado del original el 30 de agosto de 2017. Consultado el 11 de noviembre de 2016 .
- ↑ ISO. "ISO/IEC 11172-2:1993 – Tecnología de la información – Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s – Parte 2: Vídeo" . Archivado del original el 30 de agosto de 2017. Consultado el 11 de noviembre de 2016 .
- ↑ ISO. "ISO/IEC 11172-3:1993 – Tecnología de la información – Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s – Parte 3: Audio" . Archivado del original el 15 de mayo de 2017. Consultado el 11 de noviembre de 2016 .
- ↑ ISO. "ISO/IEC 11172-4:1995 – Tecnología de la información – Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s – Parte 4: Pruebas de conformidad" . Archivado del original el 30 de agosto de 2017. Consultado el 11 de noviembre de 2016 .
- ↑ ISO. "ISO/IEC TR 11172-5:1998 – Tecnología de la información – Codificación de imágenes en movimiento y audio asociado para soportes de almacenamiento digital a una velocidad de hasta aproximadamente 1,5 Mbit/s – Parte 5: Simulación de software" . Archivado del original el 30 de agosto de 2017. Consultado el 11 de noviembre de 2016 .
- ↑ Ozer, Jan (12 de octubre de 2001), Elegir la resolución de vídeo óptima: El mercado de reproductores MPEG-2 , extremetech.com , archivado del original el 7 de junio de 2011 , consultado el 11 de noviembre de 2016.
- ↑ Comparación entre MPEG 1 y 2 , archivada desde el original el 10/02/2012 , recuperada el 11/11/2016.
- ↑ Comparación de MPEG 1 y 2 , Pure Motion Ltd., 2003, archivado del original el 14/12/2005 , recuperado el 09/04/2008.
- ↑ Dave Singer (09/11/2007). " Resumen de la discusión sobre el códec de vídeo (y audio) para casa" . Archivado del original el 21 de diciembre de 2016. Consultado el 11 de noviembre de 2016 .
- ↑ "Codificación de vídeo MPEG-1 (H.261)" . Biblioteca del Congreso , Preservación Digital. 21 de octubre de 2014. Archivado del original el 11 de enero de 2017. Consultado el 11 de noviembre de 2016 .
- ↑ "Normas ISO y patentes" . Archivado del original el 15/11/2016 . Consultado el 11/11/2016 .
Buscar 11172
- ↑ "archive.ph" . archive.ph . Archivado del original el 16 de septiembre de 2008. Consultado el 21 de enero de 2023 .
{{cite web}}: CS1 maint: bot: estado de la URL original desconocido ( enlace ) - ↑ "[gst-devel] ¿Puede un plugin MPEG-1 con Audio Layers 1&2 estar en plugins-good (en cuanto a patentes)?" . SourceForge.net . 23-08-2008. Archivado del original el 02-02-2014 . Recuperado el 11-11-2016 .
- ↑ " [ whatwg ] Propuesta de subconjunto MPEG-1 para el códec de vídeo HTML5" . lists.whatwg.org . Archivado del original el 19 de julio de 2011 . Recuperado el 11 de enero de 2022 .
- ↑ http://patft1.uspto.gov/netacgi/nph-Parser?patentnumber=5214678 Enlace obsoleto archivado el 13/07/2012 en archive.today "Sistema de transmisión digital que utiliza codificación de subbanda de una señal digital" Presentado: 31 de mayo de 1990, Concedido el 25 de mayo de 1993, ¿Expira el 31 de mayo de 2010?
- ↑ "MP3 (Codificación de audio MPEG Layer III)" . www.loc.gov . 21 de abril de 2023. Archivado del original el 14 de agosto de 2017. Consultado el 24 de septiembre de 2023 .
- ↑ "mp3" . Instituto Fraunhofer de Circuitos Integrados IIS . Archivado del original el 22 de marzo de 2018. Recuperado el 7 de mayo de 2018 .
- ↑ "Normas y patentes ISO" . ISO . Archivado del original el 24 de mayo de 2019. Consultado el 10 de julio de 2019 .
- 1 2 3 4 5 6 7 Grill, B.; Quackenbush, S. (octubre de 2005), Audio MPEG-1 , ISO / IEC , archivado del original el 30 de abril de 2010
- ↑ Chiariglione, Leonardo, Sistemas MPEG-1 , ISO / IEC , archivado del original el 12/11/2016 , consultado el 11/11/2016.
- 1 2 Pack Header , archivado del original el 27/10/2016 , recuperado el 11/11/2016
- ↑ Fimoff, Mark; Bretl, Wayne E. (1 de diciembre de 1999), Tutorial de MPEG2 , archivado del original el 12 de noviembre de 2016 , consultado el 11 de noviembre de 2016.
- ↑ Fimoff, Mark; Bretl, Wayne E. (1 de diciembre de 1999), Tutorial de MPEG2 , archivado del original el 5 de noviembre de 2016 , consultado el 11 de noviembre de 2016.
- ↑ Fimoff, Mark; Bretl, Wayne E. (1 de diciembre de 1999), Tutorial de MPEG2 , archivado del original el 5 de noviembre de 2016 , consultado el 11 de noviembre de 2016.
- ↑ Fimoff, Mark; Bretl, Wayne E. (1 de diciembre de 1999), Tutorial de MPEG2 , archivado del original el 12 de noviembre de 2016 , consultado el 11 de noviembre de 2016.
- ↑ Acharya, Soam; Smith, Brian (1998), Transcodificación de dominio comprimido de MPEG , Universidad de Cornell , IEEE Computer Society , Conferencia Internacional IEEE sobre Computación y Sistemas Multimedia, pág. 3, archivado del original el 23 de febrero de 2011 , recuperado el 11 de noviembre de 2016 – (Requiere una lectura atenta: dice que las matrices de cuantización difieren, pero esos son solo valores predeterminados y seleccionables) ( se requiere registro )
- 1 2 3 Wee, Susie J.; Vasudev, Bhaskaran; Liu, Sam (13 de marzo de 1997), Transcodificación de flujos de vídeo MPEG en el dominio comprimido , Hewlett-Packard , CiteSeerX 10.1.1.24.633 , archivado del original el 17 de agosto de 2007 , recuperado el 11 de noviembre de 2016
- ↑ "BMRC" . Archivado del original el 3 de mayo de 2009. Consultado el 3 de mayo de 2009 .
- 1 2 3 4 5 6 Thom, D.; Purnhagen, H. (octubre de 1998), MPEG Audio FAQ Versión 9 , ISO / IEC , archivado del original el 18 de febrero de 2010 , recuperado el 11 de noviembre de 2016
- ↑ Encabezado de trama de audio MPEG , archivado del original el 8 de febrero de 2015 , recuperado el 11 de noviembre de 2016.
- ↑ "Estándar de audio: MPEG-2 Número de parte: 3" . Archivado del original el 4 de febrero de 2024. Consultado el 7 de febrero de 2024 .
- 1 2 3 4 5 6 Church, Steve, Codificación perceptual y compresión MPEG , Manual de ingeniería de la NAB, Telos Systems , archivado del original el 8 de mayo de 2001 , recuperado el 9 de abril de 2008
- 1 2 3 4 5 6 7 8 9 10 Pan, Davis (verano de 1995), Tutorial sobre compresión de audio/MPEG (PDF) , IEEE MultiMedia Journal, pág. 8, archivado del original (PDF) el 19 de septiembre de 2004 , consultado el 9 de abril de 2008.
- ↑ Smith, Brian (1996), A Survey of Compressed Domain Processing Techniques , Universidad de Cornell , pág. 7, archivado del original el 23 de febrero de 2011 , recuperado el 9 de abril de 2008. ( Se requiere registro )
- ↑ Cheng, Mike, Modelos psicoacústicos en TwoLAME , twolame.org, archivado del original el 22/10/2016 , consultado el 11/11/2016
- ↑ Grill, B.; Quackenbush, S. (octubre de 2005), Audio MPEG-1 , archivado del original el 27 de abril de 2008 , recuperado el 11 de noviembre de 2016.
- 1 2 Herre, Jurgen (5 de octubre de 2004), De la codificación estéreo conjunta a la codificación de audio espacial (PDF) , Conferencia internacional sobre efectos de audio digital, pág. 2, archivado del original (PDF) el 5 de abril de 2006 , consultado el 17 de abril de 2008.
- ↑ C.Grewin y T.Ryden, Evaluaciones subjetivas de códecs de audio de baja tasa de bits , Actas de la 10.ª Conferencia Internacional AES, págs. 91-102, Londres, 1991
- ↑ J. Johnston, Estimación de la entropía perceptual utilizando criterios de enmascaramiento de ruido, en Proc. ICASSP-88, pp. 2524-2527, mayo de 1988.
- ↑ J. Johnston, Codificación por transformación de señales de audio utilizando criterios de ruido perceptual, IEEE Journal on Select Areas in Communications, vol. 6, n.º 2, págs. 314-323, febrero de 1988.
- ↑ Wustenhagen et al., Prueba de escucha subjetiva de códecs de audio multicanal , Documento 4813 de la 105.ª Convención de la AES, San Francisco, 1998
- 1 2 Grupo de proyecto B/MAE (septiembre de 2007), Evaluaciones de la EBU sobre códecs de audio multicanal (PDF) , Unión Europea de Radiodifusión , archivado del original (PDF) el 30 de octubre de 2008 , consultado el 9 de abril de 2008.
- 1 2 Meares, David; Watanabe, Kaoru; Scheirer, Eric (febrero de 1998), Informe sobre las pruebas de verificación estéreo MPEG-2 AAC (PDF) , ISO / IEC , pág. 18, archivado del original (PDF) el 14 de abril de 2008 , consultado el 11 de noviembre de 2016
- ↑ Painter, Ted; Spanias, Andreas (abril de 2000), Codificación perceptiva de audio digital (Actas del IEEE, vol. 88, n.° 4) (PDF) , Actas del IEEE , archivado del original (PDF) el 16 de septiembre de 2006 , consultado el 11 de noviembre de 2016.
- ↑ Amorim, Roberto (19 de septiembre de 2006), GPSYCHO - Mid/Side Stereo , LAME , archivado del original el 16 de diciembre de 2016 , recuperado el 11 de noviembre de 2016
- ↑ ISO (octubre de 1998). "Preguntas frecuentes sobre audio MPEG, versión 9: compatibilidad entre MPEG-1 y MPEG-2" . ISO. Archivado del original el 18 de febrero de 2010. Consultado el 11 de noviembre de 2016 .
- ↑ D. Thom, H. Purnhagen y el subgrupo de audio MPEG (octubre de 1998). "Preguntas frecuentes sobre audio MPEG, versión 9 - Audio MPEG" . Archivado del original el 7 de agosto de 2011. Consultado el 11 de noviembre de 2016 .
{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ MPEG.ORG. "AAC" . Archivado del original el 31 de agosto de 2007. Consultado el 28 de octubre de 2009 .
- ↑ ISO (15/01/2006), ISO/IEC 13818-7, Cuarta edición, Parte 7 – Codificación de audio avanzada (AAC) (PDF) , archivado (PDF) del original el 06/03/2009 , recuperado el 11/11/2016
- ↑ Chiariglione, Leonardo (11 de noviembre de 1994), Comunicado de prensa , ISO / IEC , archivado del original el 8 de agosto de 2010 , consultado el 9 de abril de 2008.
Enlaces externos
- Página web oficial del Grupo de Expertos en Imágenes en Movimiento (MPEG), un grupo de trabajo de ISO/IEC. Archivada el 7 de diciembre de 2017 en Wayback Machine.
- Organización del Foro de la Industria MPEG Archivado el 30/08/2004 en Wayback Machine
- Código fuente para implementar MPEG-1 archivado el 30/12/2006 en Wayback Machine.
- Una explicación sencilla y concisa del Centro de Investigación Multimedia de Berkeley.
- Códecs de audio
- Códecs de vídeo
- MPEG
- Normas ISO/IEC
- Introducciones relacionadas con la informática en 1993
- Compresión de datos