Articulo de referencia

Evaluación perceptiva de la calidad del audio

La Evaluación Perceptual de la Calidad de Audio ( PEAQ ) es un algoritmo estandarizado para medir objetivamente la calidad de audio percibida , desarrollado entre 1994 y 1998 po...

La Evaluación Perceptual de la Calidad de Audio ( PEAQ ) es un algoritmo estandarizado para medir objetivamente la calidad de audio percibida , desarrollado entre 1994 y 1998 por un grupo de expertos del Grupo de Trabajo 6Q del Sector de Radiocomunicaciones de la Unión Internacional de Telecomunicaciones ( UIT-R ). Fue publicado originalmente como la Recomendación BS.1387 de la UIT-R en 1998 y su última actualización data de 2023. Utiliza software para simular las propiedades perceptivas del oído humano e integra múltiples variables de salida del modelo en una única métrica.

PEAQ caracteriza la calidad de audio percibida como lo harían los sujetos en una prueba de escucha según la norma ITU-R BS.1116. Los resultados de PEAQ modelan principalmente puntuaciones de opinión promedio que abarcan una escala de 1 (malo) a 5 (excelente). El Grado de Diferencia Subjetivo (GDS), que mide el grado de daño por compresión (deterioro), se define como la diferencia entre las puntuaciones de opinión de la versión probada y la referencia (fuente). El GDS generalmente oscila entre 0 (ningún deterioro percibido) y -4 (deterioro terrible). El Grado de Diferencia Objetivo (GDO) es el resultado real del algoritmo, diseñado para coincidir con el GDS. [ 1 ]

Motivación

La necesidad de conservar el ancho de banda ha impulsado el desarrollo de técnicas de compresión para la transmisión de datos de audio. Diversos métodos de codificación eliminan la redundancia y la irrelevancia perceptiva de la señal de audio, reduciendo significativamente la tasa de bits necesaria para su codificación. Estos métodos tienen en cuenta el conocimiento de la percepción auditiva humana y, por lo general, logran una tasa de bits reducida al ignorar la información de audio que probablemente no sea percibida por la mayoría de los oyentes. Las mediciones de audio tradicionales, como la respuesta en frecuencia basada en barridos sinusoidales, la relación señal/ruido (S/N) y la distorsión armónica total más ruido (THD+N), no siempre se correlacionan bien con la calidad del códec de audio . Es necesario utilizar un modelo psicoacústico para predecir cómo la información queda enmascarada por contenido de audio más fuerte adyacente en el tiempo y la frecuencia.

Dado que las pruebas de audición subjetivas consumen mucho tiempo, son costosas y poco prácticas para el uso diario, resultó beneficioso sustituirlas por métodos objetivos basados ​​en computadora. Bajo la dirección del Grupo de Trabajo 6Q de la UIT-R, un grupo de destacados expertos en calidad de sonido desarrolló un nuevo modelo objetivo para la calidad del sonido: PEAQ. Estos fueron los colaboradores:

Principios

En la codificación perceptiva, es fundamental determinar el nivel de ruido que se puede introducir en una señal antes de que se vuelva audible. Debido a que el sistema auditivo humano es altamente no lineal, los niveles de ruido varían con el tiempo y las características de frecuencia de la señal de audio. Los estudios psicoacústicos pueden proporcionar criterios de umbral para diversos eventos acústicos y los sonidos percibidos resultantes. La clave es el enmascaramiento , que describe el efecto que un sonido produce en otro sonido simultáneo. El enmascaramiento depende de la composición espectral tanto de la señal enmascaradora como de la señal enmascaradora, y de otras variaciones en el tiempo. El diagrama de bloques básico de un sistema de codificación perceptiva se muestra en la figura.

pulgares
pulgares

La señal de entrada se descompone en componentes espectrales submuestreadas. Para cada muestra, se obtiene una estimación del umbral enmascarado real mediante reglas conocidas de la psicoacústica. Este es el modelo perceptivo del sistema de codificación. Los componentes espectrales se cuantifican y codifican, manteniendo el ruido de cuantificación por debajo del umbral enmascarado. Finalmente, se genera el flujo de bits .

El análisis de los resultados se basa en el Grado de Diferencia Subjetiva . Este compara la señal bajo prueba con la señal de referencia original.

Modelos

El modelo sigue las propiedades fundamentales del sistema auditivo y distingue entre las etapas de los efectos fisiológicos y psicoacústicos. La primera parte modela la construcción de la señal mediante una transformada discreta de Fourier y bancos de filtros. La segunda parte proporciona el procesamiento cognitivo, tal como lo hace el cerebro humano. La siguiente imagen representa un diagrama de bloques simple de la relación entre el sistema auditivo humano y un modelo psicoacústico objetivo.

pulgares
pulgares

A partir de la comparación del modelo entre la señal de prueba y la señal de referencia (original), se derivan varias variables de salida del modelo. Cada variable de salida puede medir diferentes dimensiones psicoacústicas. En la etapa final, las variables de salida del modelo se combinan mediante una red neuronal (con ponderaciones definidas en el estándar) para producir un resultado que permita una evaluación subjetiva de la calidad.

Existen dos variantes del modelo. La versión básica (con menor consumo de recursos computacionales) se desarrolló para ser lo suficientemente rápida para la monitorización en tiempo real y solo utiliza la transformada rápida de Fourier (FFT). La versión avanzada requiere mayor capacidad de cálculo y puede ofrecer resultados ligeramente más precisos; utiliza la FFT y bancos de filtros para generar más objetos multivariables (MOV) con los que la red neuronal pueda trabajar.

Licencia

La tecnología PEAQ, tal como la recomienda la Recomendación BS.1387 de la UIT-R, está protegida por varias patentes y está disponible bajo licencia junto con el código original para aplicaciones comerciales de acuerdo con los términos justos, razonables y no discriminatorios de la UIT .

Implementaciones libres de regalías

  • Una implementación temprana de código abierto del modelo básico, llamada EAQUAL, se interrumpió en 2002 debido a demandas por infracción de patentes.
  • Para uso educativo, existe un programa multiplataforma gratuito llamado Peaqb que realiza las mismas funciones de forma limitada, ya que no ha sido validado con los datos de la UIT. La evaluación realizada por los autores de GstPEAQ muestra un RMSE de 0,2063 para 16 vectores de prueba de la UIT. [ 3 ]
  • Otra implementación no validada del modelo básico PEAQ para uso educativo, PQevalAudio, está disponible en el TSP Lab de la Universidad McGill. La evaluación realizada por los autores de GstPEAQ muestra un RMSE de 0,2329 para 16 vectores de prueba ITU. [ 3 ]
  • GstPEAQ implementa tanto el modelo básico como el avanzado, pero no cumple con las tolerancias de la norma BS.1387-1. Sin embargo, la diferencia con respecto a la conformidad (RMSE 0,2009 en modo básico) es menor que la de implementaciones de código abierto anteriores. El autor también encontró que la diferencia no es estadísticamente significativa en términos de usar el ODG como estimación del SDG. [ 3 ]

Véase también

Referencias

  1. Recomendación ITU-R BS.1387-2, páginas 10–11
  2. Recomendación BS.1284 de la UIT
  3. 1 2 3 Holters, Martin; Zölzer, Udo (2015). GstPEAQ: una implementación de código abierto del algoritmo PEAQ . 18.ª Conferencia Internacional sobre Efectos de Audio Digital (DAFx-15). Trondheim, Noruega.

Lecturas adicionales

  • Recomendación BS.1387 de la UIT-R : Método para mediciones objetivas de la calidad de audio percibida (PEAQ)
  • Recomendación BS.1116 de la UIT-R : Métodos para la evaluación subjetiva de pequeñas deficiencias en sistemas de audio, incluidos los sistemas de sonido multicanal.
  • Recomendación BS.1534 de la UIT-R : Método para la evaluación subjetiva de los niveles de calidad intermedios de los sistemas de codificación (MUSHRA)
  • Spanias, Andreas; Painter, Ted; Atti, Venkatraman (2007). «Medidas de calidad para la codificación de audio perceptual». Procesamiento y codificación de señales de audio . Wiley -Interscience . pp. 401. ISBN  978-0-47179147-8.
  • Cvejic, Nedeljko; Seppänen, Tapio Tapio (2007). «Evaluación subjetiva y objetiva de la calidad del audio con marca de agua». Técnicas y tecnologías de marca de agua de audio digital . Idea Group Inc. pág.  270. ISBN 978-1-59904515-3.
  • Delgado, Pablo M.; Herre, Jürgen (mayo de 2020). ¿Podemos seguir utilizando PEAQ? Un análisis de rendimiento del estándar ITU para la evaluación objetiva de la calidad de audio percibida . Duodécima Conferencia Internacional sobre Calidad de la Experiencia Multimedia (QoMEX) de 2020. pp. 1– 6. arXiv : 2212.01467 . doi : 10.1109/QoMEX48832.2020.9123105 .  Se observa que PEAQ se queda atrás de otros métodos objetivos en términos de precisión, pero el reentrenamiento de la red neuronal MOV-to-ODG produce un modelo que supera a otros métodos objetivos.
  • http://www.peaq.org Sitio web oficial de PEAQ
  • https://web.archive.org/web/20061207095623/http://www.crc.ca/en/html/aas/home/peaq/peaq PEAQ en el CRC
  • Información sobre PEAQ de OPTICOM : https://web.archive.org/web/20090423074959/http://www.opticom.de/technology/technology.html
  • http://elvera.nue.tu-berlin.de/files/0829Thiede1998.pdf PEAQ - der künftige ITU-Standard zur objektiven Messung der wahrgenommenen Audioqualität
  • https://ieeexplore.ieee.org/document/1613524 IEEE - Estimación de la calidad perceptual del sistema de audio mediante el algoritmo PEAQ
  • https://sourceforge.net/projects/peaqb/ Proyecto Peaqb
  • http://www-mmsp.ece.mcgill.ca/Documents/Software/index.html PQevalAudio - Implementación en Matlab y C del modelo básico PEAQ.
  • http://www.mp3-tech.org/programmer/sources/eaqual.tgz Código fuente de EAQUAL