Articulo de referencia

H.262/MPEG-2 Parte 2

{{cite web |title=MPEG-2 patent expiration opens door for royalty-free use |url=https://www.techrepublic.com/article/mpeg-2-patent-expiration-opens-door-for-royalty-free-use/ |w...

H.262 [ 2 ] o MPEG-2 Parte 2 (formalmente conocido como Recomendación H.262 de la UIT-T e ISO/IEC 13818-2 , [ 3 ] también conocido como MPEG-2 Video ) es un formato de codificación de video estandarizado y mantenido conjuntamente por el Grupo de Estudio 16 de Expertos en Codificación de Video (VCEG) de la UIT-T y el Grupo de Expertos en Imágenes en Movimiento (MPEG) de ISO / IEC , y desarrollado con la participación de muchas empresas. Es la segunda parte del estándar MPEG-2 de ISO/IEC . Los documentos Recomendación H.262 de la UIT-T e ISO/IEC 13818-2 son idénticos.

El estándar está disponible mediante pago en la ITU-T [ 2 ] e ISO. El vídeo MPEG-2 es muy similar al MPEG-1 , pero también admite vídeo entrelazado (una técnica de codificación utilizada en los sistemas de televisión analógicos NTSC, PAL y SECAM). El vídeo MPEG-2 no está optimizado para bajas tasas de bits (por ejemplo, menos de 1  Mbit/s), pero supera ligeramente al MPEG-1 a tasas de bits más altas (por ejemplo, 3  Mbit/s y superiores), aunque la diferencia no es muy grande a menos que el vídeo sea entrelazado. Todos los decodificadores de vídeo MPEG-2 que cumplen con los estándares también son totalmente capaces de reproducir secuencias de vídeo MPEG-1. [ 4 ]

Historia

El proceso de aprobación ISO/IEC se completó en noviembre de 1994. [ 5 ] La primera edición fue aprobada en julio de 1995 [ 6 ] y publicada por la UIT-T [ 2 ] e ISO/IEC en 1996. [ 7 ] Didier LeGall de Bellcore presidió el desarrollo de la norma [ 8 ] y Sakae Okubo de NTT fue el coordinador de la UIT-T y presidió los acuerdos sobre sus requisitos. [ 9 ]

La tecnología se desarrolló con contribuciones de varias empresas. Hyundai Electronics (ahora SK Hynix ) desarrolló el primer decodificador MPEG-2 SAVI (Sistema/Audio/Vídeo) en 1995. [ 10 ]

La mayoría de las patentes que posteriormente se consideraron esenciales para la implementación del estándar en un consorcio de patentes procedían de tres empresas: Sony (311 patentes), Thomson (198 patentes) y Mitsubishi Electric (119 patentes). [ 11 ]

En 1996, se amplió mediante dos enmiendas para incluir el registro de identificadores de derechos de autor y el Perfil 4:2:2. [ 2 ] [ 12 ] La UIT-T publicó estas enmiendas en 1996 y la ISO en 1997. [ 7 ]

También existen otras enmiendas publicadas posteriormente por la UIT-T e ISO/IEC. [ 2 ] [ 13 ] La edición más reciente de la norma se publicó en 2013 e incorpora todas las enmiendas anteriores. [ 3 ]

Ediciones

Codificación de vídeo

Muestreo de imágenes

Una cámara HDTV con muestreo de 8 bits genera un flujo de vídeo sin comprimir de 25  ×  1920  ×  1080  ×  3  =  155.520.000 bytes por segundo para  un vídeo de 25 fotogramas por segundo (utilizando el formato de muestreo 4:4:4 ). Este flujo de datos debe comprimirse para que la televisión digital se ajuste al ancho de banda de los canales de televisión disponibles y para que las películas quepan en DVD. La compresión de vídeo es práctica porque los datos de las imágenes suelen ser redundantes en el espacio y el tiempo. Por ejemplo, el cielo puede ser azul en la parte superior de una imagen y ese cielo azul puede persistir fotograma tras fotograma. Además, debido al funcionamiento del ojo humano, es posible eliminar o aproximar algunos datos de las imágenes de vídeo con poca o ninguna degradación perceptible de la calidad de la imagen.

Un truco común (y antiguo) para reducir la cantidad de datos es separar cada "fotograma" completo de vídeo en dos "campos" durante la transmisión/codificación: el "campo superior", que son las líneas horizontales impares, y el "campo inferior", que son las líneas pares. Durante la recepción/decodificación, los dos campos se muestran alternativamente, con las líneas de un campo intercalándose entre las líneas del campo anterior; este formato se llama vídeo entrelazado . La velocidad de campo típica es de 50 (Europa/PAL) o 59,94 (EE. UU./NTSC) campos por segundo, lo que corresponde a 25 (Europa/PAL) o 29,97 (Norteamérica/NTSC) fotogramas completos por segundo. Si el vídeo no está entrelazado, se denomina vídeo de escaneo progresivo y cada imagen es un fotograma completo. MPEG-2 admite ambas opciones.

La televisión digital requiere que estas imágenes se digitalicen para que puedan ser procesadas por el hardware de la computadora. Cada elemento de imagen (un píxel ) se representa mediante un valor de luminancia y dos valores de crominancia . Estos describen el brillo y el color del píxel (véase YCbCr ). Por lo tanto, cada imagen digitalizada se representa inicialmente mediante tres matrices rectangulares de números.

Otra práctica común para reducir la cantidad de datos a procesar es submuestrear los dos planos de croma (después de aplicar un filtro de paso bajo para evitar el aliasing ). Esto funciona porque el sistema visual humano resuelve mejor los detalles de brillo que los detalles de tono y saturación de los colores. El término 4:2:2 se usa para video con el croma submuestreado en una proporción de 2:1 horizontalmente, y 4:2:0 se usa para video con el croma submuestreado en una proporción de 2:1 tanto vertical como horizontalmente. El video que tiene luminancia y croma a la misma resolución se llama 4:4:4 . El documento MPEG-2 Video considera los tres tipos de muestreo, aunque 4:2:0 es, con mucho, el más común para video de consumo, y no hay "perfiles" definidos de MPEG-2 para video 4:4:4 (ver más abajo para una discusión más detallada sobre los perfiles).

Si bien la siguiente sección describe en general la compresión de video MPEG-2, existen muchos detalles que no se abordan, como los relacionados con los campos, los formatos de crominancia, las respuestas a los cambios de escena, los códigos especiales que identifican las partes del flujo de bits y otra información. Aparte de las funciones para el manejo de campos en la codificación entrelazada, el video MPEG-2 es muy similar al video MPEG-1 (e incluso bastante similar al estándar anterior H.261 ), por lo que toda la descripción que sigue se aplica igualmente bien a MPEG-1.

Marcos I, marcos P y marcos B

MPEG-2 incluye tres tipos básicos de fotogramas codificados: fotogramas codificados intra ( fotogramas I ), fotogramas codificados predictivamente ( fotogramas P ) y fotogramas codificados predictivamente bidireccionalmente ( fotogramas B ).

Un fotograma I es una versión comprimida por separado de un único fotograma sin comprimir (en bruto). La codificación de un fotograma I aprovecha la redundancia espacial y la incapacidad del ojo para detectar ciertos cambios en la imagen. A diferencia de los fotogramas P y B, los fotogramas I no dependen de los datos de los fotogramas anteriores o posteriores, por lo que su codificación es muy similar a la de una fotografía fija (aproximadamente similar a la codificación de imágenes JPEG ). En resumen, el fotograma en bruto se divide en bloques de 8 píxeles por 8 píxeles. Los datos de cada bloque se transforman mediante la transformada discreta del coseno (DCT). El resultado es una matriz de 8×8 de coeficientes con valores numéricos reales . La transformada convierte las variaciones espaciales en variaciones de frecuencia, pero no altera la información del bloque; si la transformada se calcula con precisión perfecta, el bloque original se puede recrear exactamente aplicando la transformada inversa del coseno (también con precisión perfecta). La conversión de enteros de 8 bits a coeficientes de transformación de valor real aumenta la cantidad de datos utilizados en esta etapa del procesamiento, pero la ventaja de la transformación es que los datos de la imagen se pueden aproximar cuantificando los coeficientes. Muchos de los coeficientes de transformación, generalmente los componentes de mayor frecuencia, serán cero después de la cuantificación, que es básicamente una operación de redondeo. La desventaja de este paso es la pérdida de algunas distinciones sutiles en brillo y color. La cuantificación puede ser gruesa o fina, según lo seleccione el codificador. Si la cuantificación no es demasiado gruesa y se aplica la transformada inversa a la matriz después de cuantificarla, se obtiene una imagen muy similar a la original, pero no exactamente igual. A continuación, la matriz de coeficientes cuantificada se comprime. Normalmente, una esquina de la matriz de coeficientes de 8×8 contiene solo ceros después de aplicar la cuantificación. Al comenzar en la esquina opuesta de la matriz, recorrerla en zigzag para combinar los coeficientes en una cadena, sustituir los ceros consecutivos en dicha cadena por códigos de longitud variable y aplicar la codificación Huffman al resultado, se reduce la matriz a una menor cantidad de datos. Estos datos codificados mediante entropía son los que se transmiten o se graban en DVD. En el receptor o reproductor, todo el proceso se invierte, lo que permite al receptor reconstruir, con una aproximación cercana, el fotograma original.

El procesamiento de los fotogramas B es similar al de los fotogramas P, con la diferencia de que los fotogramas B utilizan tanto la imagen de un fotograma de referencia posterior como la de un fotograma de referencia anterior. Por lo general, los fotogramas B ofrecen mayor compresión que los fotogramas P. En el vídeo MPEG-2, los fotogramas B nunca son fotogramas de referencia.

Normalmente, cada 15 fotogramas, aproximadamente, se convierte en un fotograma I. Los fotogramas P y B pueden seguir a un fotograma I de esta forma, IBBPBBPBBPBB(I), para formar un Grupo de Imágenes (GOP) ; sin embargo, el estándar es flexible al respecto. El codificador selecciona qué imágenes se codifican como fotogramas I, P y B.

Macrobloques

Los fotogramas P proporcionan mayor compresión que los fotogramas I porque aprovechan los datos de un fotograma I o P anterior (un fotograma de referencia) . Para generar un fotograma P, se reconstruye el fotograma de referencia anterior, al igual que en un receptor de TV o un reproductor de DVD. El fotograma que se está comprimiendo se divide en macrobloques de 16 píxeles por 16 píxeles . Luego, para cada uno de esos macrobloques, se busca en el fotograma de referencia reconstruido un área de 16 por 16 que coincida estrechamente con el contenido del macrobloque que se está comprimiendo. El desplazamiento se codifica como un "vector de movimiento". Con frecuencia, el desplazamiento es cero, pero si algo en la imagen se mueve, el desplazamiento podría ser algo como 23 píxeles a la derecha y 4 píxeles y medio hacia arriba. En MPEG-1 y MPEG-2, los valores del vector de movimiento pueden representar desplazamientos enteros o semi-enteros. La coincidencia entre las dos regiones a menudo no será perfecta. Para corregir esto, el codificador toma la diferencia de todos los píxeles correspondientes de las dos regiones y, sobre esa diferencia de macrobloque, calcula la DCT y las cadenas de valores de coeficientes para las cuatro áreas de 8×8 en el macrobloque de 16×16, como se describió anteriormente. Este "residuo" se agrega al vector de movimiento y el resultado se envía al receptor o se almacena en el DVD para cada macrobloque que se comprime. A veces no se encuentra una coincidencia adecuada. Entonces, el macrobloque se trata como un macrobloque de fotograma I.

Perfiles y niveles de vídeo

El vídeo MPEG-2 admite una amplia gama de aplicaciones, desde dispositivos móviles hasta edición HD de alta calidad. Para muchas aplicaciones, resulta poco práctico y demasiado costoso admitir el estándar completo. Para permitir que dichas aplicaciones admitan solo subconjuntos del mismo, el estándar define perfiles y niveles.

Un perfil define conjuntos de características como imágenes B, vídeo 3D, formato de croma, etc. El nivel limita la memoria y la potencia de procesamiento necesarias, definiendo las tasas de bits máximas, los tamaños de fotograma y las velocidades de fotogramas.

Una aplicación MPEG especifica entonces sus capacidades en términos de perfil y nivel. Por ejemplo, un reproductor de DVD puede indicar que admite hasta el perfil principal y el nivel principal (a menudo escrito como MP@ML). Esto significa que el reproductor puede reproducir cualquier flujo MPEG codificado como MP@ML o inferior.

Las tablas a continuación resumen las limitaciones de cada perfil y nivel, aunque existen restricciones que no se enumeran aquí. [ 2 ] : Anexo E Tenga en cuenta que no todas las combinaciones de perfiles y niveles son permisibles, y los modos escalables modifican las restricciones de nivel.

  1. 1 2 3 La escalabilidad de la relación señal/ruido (SNR) envía las diferencias del dominio de la transformada a un nivel de cuantificación inferior de cada bloque, lo que aumenta la calidad y la tasa de bits cuando se combinan ambos flujos. Un flujo principal se puede recrear sin pérdidas.
  2. 1 2 La escalabilidad espacial codifica la diferencia entre las secuencias HD y SD escaladas, que se combina con la SD para recrear la secuencia HD. Una secuencia principal no se puede recrear sin pérdidas.
  3. La escalabilidad temporal inserta fotogramas adicionales entre cada fotograma base para aumentar la velocidad de fotogramas o añadir una perspectiva 3D. Este es el único perfil MPEG-2 que permite referencias de fotograma adaptativas, una característica destacada de H.264/AVC . Un flujo principal solo se puede recrear sin pérdidas si no se utilizan referencias extendidas.

A continuación se presentan algunas combinaciones comunes de perfil/nivel MPEG-2, con la indicación de los límites máximos específicos:

Aplicaciones

A continuación se enumeran algunas aplicaciones.

  • DVD-Video : un formato de vídeo de definición estándar para el consumidor. Utiliza submuestreo de color 4:2:0 y una tasa de datos de vídeo variable de hasta 9,8  Mbit/s.
  • MPEG IMX : un formato de grabación de vídeo profesional de definición estándar. Utiliza compresión intraframe, submuestreo de color 4:2:2 y una velocidad de datos de vídeo constante seleccionable por el usuario de 30, 40 o 50  Mbit/s.
  • HDV : formato de grabación de vídeo de alta definición basado en cinta. Utiliza submuestreo de color 4:2:0 y  una velocidad de datos total de 19,4 o 25 Mbit/s.
  • XDCAM es una familia de formatos de grabación de vídeo sin cinta que incluye, en particular, formatos basados ​​en MPEG-2 Parte 2. Estos son: MPEG IMX de definición estándar (ver más arriba), MPEG HD de alta definición y MPEG HD422 de alta definición. MPEG IMX y MPEG HD422 emplean submuestreo de color 4:2:2, mientras que MPEG HD emplea submuestreo de color 4:2:0. La mayoría de los subformatos utilizan una tasa de datos de vídeo constante seleccionable de 25 a 50  Mbit/s, aunque también existe un modo de tasa de bits variable con  una tasa de datos máxima de 18 Mbit/s.
  • Códec XF: un formato de grabación de vídeo profesional sin cinta, similar a MPEG HD y MPEG HD422, pero almacenado en un archivo contenedor diferente.
  • HD DVD : formato de vídeo de alta definición para el consumidor que ya no se utiliza.
  • Disco Blu-ray : formato de vídeo de alta definición para el consumidor.
  • Televisión digital: en algunos países, se utiliza MPEG-2 Parte 2 para la transmisión digital en alta definición . Por ejemplo, ATSC especifica varios formatos de escaneo (480i, 480p, 720p, 1080i, 1080p) y velocidades de fotogramas/campos con submuestreo de color 4:2:0 y una velocidad de datos de hasta 19,4  Mbit/s por canal.
  • Televisión digital por cable
  • Televisión por satélite

titulares de patentes

Las siguientes organizaciones han sido titulares de patentes para la tecnología de vídeo MPEG-2, según se indica en MPEG LA . Todas estas patentes han expirado en EE. UU. y en la mayoría de los demás territorios. [ 1 ]

Referencias

  1. 1 2 "La expiración de la patente MPEG-2 abre la puerta al uso libre de regalías" . TechRepublic . 15 de febrero de 2018. Consultado el 13 de diciembre de 2021 .
  2. 1 2 3 4 5 6 7 "H.262 : Tecnología de la información – Codificación genérica de imágenes en movimiento e información de audio asociada: Vídeo" . Sitio web de la UIT-T . Unión Internacional de Telecomunicaciones – Sector de Normalización de las Telecomunicaciones ( UIT-T ). Febrero de 2000. Consultado el 13 de agosto de 2009 . 
  3. 1 2 3 ISO. "ISO/IEC 13818-2:2013 – Tecnología de la información – Codificación genérica de imágenes en movimiento e información de audio asociada: Vídeo" . ISO . Consultado el 22 de abril de 2026 .
  4. Grupo de Expertos en Imágenes en Movimiento. "Vídeo MPEG-2" . Archivado del original el 25 de marzo de 2019. Recuperado el 15 de junio de 2019 a través de mpeg.chiariglione.org.
  5. PN Tudor (diciembre de 2005). "Compresión de vídeo MPEG-2" . Consultado el 1 de noviembre de 2009 .
  6. H.262 (07/95) Tecnología de la información – Codificación genérica de imágenes en movimiento e información de audio asociada: vídeo , UIT , consultado el 3 de noviembre de 2009.
  7. 1 2 3 ISO. "ISO/IEC 13818-2:1996 – Tecnología de la información – Codificación genérica de imágenes en movimiento e información de audio asociada: Vídeo" . ISO . Consultado el 24 de julio de 2014 .
  8. "Didier LeGall, Vicepresidente Ejecutivo" . Ambarella Inc. Consultado el 2 de junio de 2017 .
  9. «Sakae Okubo» . UIT . Consultado el 27 de enero de 2017 .
  10. "Historia: década de 1990" . SK Hynix . Archivado del original el 5 de febrero de 2021. Consultado el 6 de julio de 2019 .
  11. "Lista de patentes MPEG-2" (PDF) . MPEG LA . Archivado del original (PDF) el 8 de marzo de 2021. Consultado el 7 de julio de 2019 .
  12. Leonardo Chiariglione – Coordinador (octubre de 2000). "Descripción breve de MPEG-2" . Consultado el 1 de noviembre de 2009 .
  13. 1 2 MPEG. "Estándares MPEG" . chiariglione.org . Consultado el 24 de julio de 2014 .
  14. ISO. "ISO/IEC 13818-2:2000/Amd 3 – Nuevo nivel para 1080@50p/60p" . Consultado el 24 de julio de 2014 .
  15. ISO. "ISO/IEC 13818-2:2000 – Tecnología de la información – Codificación genérica de imágenes en movimiento e información de audio asociada: Vídeo" . ISO . Consultado el 24 de julio de 2014 .
  16. "Lista de patentes MPEG-2" (PDF) . MPEG LA . Archivado del original (PDF) el 8 de marzo de 2021. Consultado el 7 de julio de 2019 .
  • Sitio web oficial de MPEG
  • Codificación de vídeo MPEG-2 (H.262) – Biblioteca del Congreso