Articulo de referencia

Análisis de la calidad de la escucha objetiva perceptiva

El Análisis de la Calidad de Escucha Objetiva Perceptual ( POLQA ) fue el título provisional de una norma de la UIT-T que abarca un modelo para predecir la calidad del habla med...

El Análisis de la Calidad de Escucha Objetiva Perceptual ( POLQA ) fue el título provisional de una norma de la UIT-T que abarca un modelo para predecir la calidad del habla mediante el análisis de señales de voz digitales. [ 1 ] El modelo se estandarizó como Recomendación UIT-T P.863 (Evaluación de la calidad de escucha objetiva perceptual) en 2011. La segunda edición de la norma apareció en 2014, y la tercera edición, actualmente en vigor, se adoptó en 2018 con el título Predicción de la calidad de escucha objetiva perceptual. [ 2 ]

Alcance de medición

POLQA abarca un modelo para predecir la calidad del habla, [ 3 ] [ 4 ] mediante el análisis de señales de voz digitales. Las predicciones de estas medidas objetivas deben aproximarse lo máximo posible a las puntuaciones de calidad subjetivas obtenidas en pruebas de escucha subjetivas. Generalmente, se predice una Puntuación Media de Opinión (MOS). POLQA utiliza habla real como estímulo de prueba para evaluar redes telefónicas.

Capacidades tecnológicas

POLQA es el sucesor de PESQ (Recomendación ITU-T P.862). [ 5 ] POLQA evita las debilidades del modelo P.862 actual y se extiende al manejo de señales de audio de mayor ancho de banda. Otras mejoras se centran en el manejo de señales con tiempo de llamada y señales con muchas variaciones de retardo. De forma similar a P.862, POLQA admite mediciones en la banda de telefonía común (300–3400  Hz), pero además tiene un segundo modo operativo para evaluar HD-Voice en señales de voz de banda ancha y súper ancha (50–14000  Hz). POLQA también se centra en la evaluación de señales de voz grabadas acústicamente por una cabeza artificial con simuladores de boca y oído.

Historia del desarrollo

Las actividades de POLQA comenzaron en la UIT-T a principios de 2006 bajo el nombre provisional de P.OLQA. A mediados de 2009, se inició un concurso para evaluar varios modelos candidatos. En mayo de 2010, la UIT-T seleccionó modelos candidatos de tres empresas (OPTICOM, SwissQual/ Rohde & Schwarz y TNO ( Organización Neerlandesa para la Investigación Científica Aplicada )). Las tres empresas fusionaron sus enfoques en un único modelo, que fue adoptado como Recomendación UIT-T P.863. [ 2 ]

La familia de mediciones objetivas de calidad de voz de referencia completa de la UIT-T comenzó en 1997 con la Recomendación UIT-T P.861 (PSQM), que fue reemplazada por la UIT-T P.862 (PESQ) [ 5 ] en 2001. La P.862 se complementó posteriormente con las Recomendaciones UIT-T P.862.1 [ 6 ] (mapeo de puntuaciones PESQ a una escala MOS), UIT-T P.862.2 [ 7 ] (mediciones de banda ancha) y UIT-T P.862.3 [ 8 ] (guía de aplicación). La primera edición de la UIT-T P.863 (POLQA) [ 2 ] entró en vigor en 2011. Una guía de aplicación para la Recomendación UIT-T P.863 fue aprobada en 2019 y publicada como UIT-T P.863.1. [ 9 ]

Además de los métodos de referencia completos enumerados anteriormente, la lista de estándares de medición de calidad de voz objetiva de la UIT-T también incluye la UIT-T P.563 [ 10 ] (algoritmo sin referencia).

Tipología de pruebas

POLQA, similar a P.862 PESQ, es un algoritmo de referencia completa (FR) que evalúa una señal de voz degradada o procesada en relación con la señal original. Compara cada muestra de la señal de referencia (lado del hablante) con cada muestra correspondiente de la señal degradada (lado del oyente). Las diferencias perceptuales entre ambas señales se puntúan como diferencias. El modelo psicoacústico perceptual se basa en modelos de percepción humana similares a los de MP3 o AAC. Básicamente, las señales se analizan en el dominio de la frecuencia (en bandas críticas) tras aplicar funciones de enmascaramiento. Las diferencias no enmascaradas entre las dos representaciones de la señal se contabilizan como distorsiones. Finalmente, las distorsiones acumuladas en el archivo de voz se asignan a una escala de calidad de 1 a 5, como es habitual en las pruebas MOS. Las mediciones FR ofrecen la máxima precisión y repetibilidad, pero solo pueden aplicarse a pruebas específicas en redes reales (por ejemplo, herramientas de prueba de campo para puntos de referencia de redes móviles).

POLQA es un algoritmo de referencia completa que analiza la señal de voz muestra por muestra tras una alineación temporal de los fragmentos correspondientes de la señal de referencia y la señal de prueba. POLQA puede aplicarse para proporcionar una evaluación de calidad de extremo a extremo (E2E) para una red o para caracterizar componentes individuales de la misma.

Los resultados de POLQA modelan principalmente puntuaciones medias de opinión (MOS) que abarcan una escala del 1 (malo) al 5 (excelente).

Descripción del algoritmo POLQA

Las entradas del algoritmo son dos formas de onda representadas por dos vectores de datos que contienen muestras PCM de 16 bits. El primer vector contiene las muestras de la señal de referencia (sin distorsión), mientras que el segundo contiene las muestras de la señal degradada. El algoritmo POLQA consta de un bloque de alineación temporal, un estimador de frecuencia de muestreo de un convertidor de frecuencia de muestreo, que se utiliza para compensar las diferencias en la frecuencia de muestreo de las señales de entrada, y el modelo central propiamente dicho, que realiza el cálculo MOS. En un primer paso, se determina el retardo entre las dos señales de entrada y se estima la frecuencia de muestreo de ambas señales en relación una con la otra. La estimación de la frecuencia de muestreo se basa en la información de retardo calculada por la alineación temporal. Si la frecuencia de muestreo difiere en más de aproximadamente un 1%, se submuestrea la señal con la frecuencia de muestreo más alta. Después de cada paso, los resultados se almacenan junto con un indicador de fiabilidad de retardo promedio, que es una medida de la calidad de la estimación del retardo. Finalmente, se elige el resultado del paso de remuestreo que arrojó la mayor fiabilidad general. Una vez determinado el retardo correcto y compensadas las diferencias en la frecuencia de muestreo, las señales y la información de retardo se transmiten al modelo central, que calcula la perceptibilidad y la molestia de las distorsiones y las asigna a una escala MOS. Una descripción mucho más detallada y completa del algoritmo se puede encontrar en [ 2 ] . Las siguientes secciones solo pretenden ofrecer una visión general de los fundamentos de la estructura interna de POLQA.

El modelo central

El elemento principal del modelo central es el modelo perceptivo, que se calcula cuatro veces utilizando diferentes parámetros para abordar los distintos tipos de distorsión principales. Estos tipos de distorsión se dividen en distorsiones aditivas y distorsiones sustractivas. Para ambos tipos, se distingue entre efectos muy fuertes y débiles. Las entradas a los modelos perceptivos son las formas de onda y la información de retardo. La salida es la Densidad de Perturbación, que mide la perceptibilidad de las distorsiones en las señales. El modelo perceptivo de la rama principal también genera indicadores de distorsiones de frecuencia, ruido y reverberación. Un interruptor posterior, activado por un detector de distorsiones muy fuertes, reduce los cuatro valores de Densidad de Perturbación a dos: uno para distorsiones aditivas y otro para distorsiones sustractivas. Hasta el momento, la Densidad de Perturbación solo indica la perceptibilidad de las distorsiones y aún no se han tenido en cuenta los efectos cognitivos. Sin embargo, los aspectos cognitivos son importantes cuando se pide a los seres humanos que califiquen la calidad de lo que pueden percibir. Básicamente, convierten la medida de perceptibilidad Densidad de perturbación en una medida de molestia. Esta conversión se realiza corrigiendo los valores de Densidad de perturbación para situaciones con:

  • Significant level variations
  • Many frame repetitions
  • Strong timbre
  • Spectral flatness
  • Noise switching during speech pauses
  • Many delay variations
  • Strong variations of the Disturbance Density over time
  • Strong variations of the loudness of the signals

Two further indicators, one for spectral flatness and one for level variations are also calculated in this step.

So far all operations were performed on frames with a duration of approximately 32 and 43ms duration (depending on the sample rate and using an overlap of 50%) and for each Bark band separately. In a final step all indicators are integrated over time and frequency in order to compute the final MOS LQO value.

The perceptual model

El concepto clave dentro del modelo perceptivo es la idealización. La idea es que POLQA simula las pruebas de calificación de categoría absoluta (ACR). Sin embargo, en una prueba ACR, los sujetos no tienen una referencia real para evaluar una señal de voz. En cambio, se asume que comprenden cómo suena una señal ideal y la utilizan como referencia. Por lo tanto, si se les pide que califiquen una señal de referencia que no es perfecta (por ejemplo, con un volumen incorrecto o con demasiado timbre, ruido o reverberación), la calificarán peor que la ideal. En su paso de idealización, POLQA corrige pequeñas imperfecciones de las señales de referencia para obtener la misma referencia ideal para la comparación con la señal degradada que los sujetos humanos usarían mentalmente. De forma similar a la idealización de la señal de referencia, algunas distorsiones presentes en la señal degradada, que son apenas perceptibles en una prueba ACR, se compensan parcialmente (por ejemplo, pequeños cambios de tono, distorsiones de frecuencia lineales). El modelo perceptivo comienza escalando la señal de referencia a un nivel ideal promedio de habla activa de aproximadamente -26 dBov. No se realiza ningún escalado similar en la señal degradada. Se asume que cualquier desviación del nivel de la señal degradada respecto al ideal de -26 dBov se considera una degradación de la señal. A continuación, se calculan los espectros de ambas señales mediante una FFT con un solapamiento del 50 % de tramas con una duración de entre 32 ms y 43 ms (dependiendo de la frecuencia de muestreo). Posteriormente, se eliminan los pequeños cambios de tono de la señal degradada (corrección de frecuencia). Finalmente, los espectros se transforman a una escala de tono con base psicoacústica, combinando líneas espectrales individuales (bandas de la FFT) en las denominadas bandas críticas. La escala de tono utilizada es similar a la escala Bark, con una resolución promedio de 0,3 Bark por banda. El resultado es la densidad de potencia de tono. En esta etapa, se calculan los tres primeros indicadores de distorsión para las distorsiones de respuesta en frecuencia , el ruido aditivo y la reverberación de la sala. A continuación, se deriva la excitación de cada banda. Esto incluye el modelado de los efectos de enmascaramiento tanto en el dominio de la frecuencia como en el temporal. El resultado es, para cada trama de cada señal, una representación interna de la cabeza que indica aproximadamente cuán fuerte se percibiría cada componente de frecuencia. Ahora, se lleva a cabo un paso adicional de idealización de la señal de referencia filtrando el timbre excesivo y el ruido estacionario de bajo nivel. Al mismo tiempo, las distorsiones de frecuencia lineales y el ruido estacionario se eliminan parcialmente de la señal degradada. La resta de las excitaciones idealizadas finalmente conduce a la Densidad de Distorsión, que es una medida de la audibilidad de las distorsiones.

POLQA en la investigación

Un artículo que utiliza POLQA para investigar el impacto del lenguaje tonal y la escucha no nativa en la medición de la calidad del habla se puede encontrar en [ 11 ] .

Véase también

Referencias

  1. "POLQA - El estándar de prueba de calidad de voz móvil de próxima generación" . www.polqa.info . Consultado el 11 de abril de 2021 .
  2. 1 2 3 4 "P.863 : Predicción de la calidad de escucha objetiva perceptual" . www.itu.int . Consultado el 11 de abril de 2021 . 
  3. Beerends, John G.; Schmidmer, Christian; Berger, Jens; Obermann, Matthias; Ullmann, Raphael; Pomy, Joachim; Keyhl, Michael (2013-07-08). "Evaluación objetiva de la calidad de escucha perceptual (POLQA), la tercera generación del estándar ITU-T para la medición de la calidad del habla de extremo a extremo, parte I: alineación temporal" . Journal of the Audio Engineering Society . 61 (6): 366–384 .
  4. Beerends, John G.; Schmidmer, Christian; Berger, Jens; Obermann, Matthias; Ullmann, Raphael; Pomy, Joachim; Keyhl, Michael (2013-07-08). "Evaluación objetiva de la calidad de escucha perceptual (POLQA), la tercera generación del estándar ITU-T para la medición de la calidad del habla de extremo a extremo, parte II: modelo perceptual" . Journal of the Audio Engineering Society . 61 (6): 385–402 .
  5. 1 2 "P.862 : Evaluación perceptual de la calidad del habla (PESQ): Un método objetivo para la evaluación de la calidad del habla de extremo a extremo de redes telefónicas de banda estrecha y códecs de voz" . www.itu.int . Consultado el 11 de abril de 2021 . 
  6. "P.862.1 : Función de mapeo para transformar las puntuaciones de resultados brutos P.862 a MOS-LQO" . www.itu.int . Consultado el 11 de abril de 2021 . 
  7. "P.862.2 : Extensión de banda ancha a la Recomendación P.862 para la evaluación de redes telefónicas de banda ancha y códecs de voz" . www.itu.int . Consultado el 11 de abril de 2021 . 
  8. "P.862.3 : Guía de aplicación para la medición objetiva de la calidad basada en las Recomendaciones P.862, P.862.1 y P.862.2" . www.itu.int . Consultado el 11 de abril de 2021 . 
  9. "P.863.1 : Application guide for Recommendation ITU-T P.863". www.itu.int. Retrieved 2021-04-11.
  10. "P.563 : Single-ended method for objective speech quality assessment in narrow-band telephony applications". www.itu.int. Retrieved 2021-04-11.
  11. D. Ebem (University of Nigeria); et al. (2011). "The Impact of Tone language and Non-Native Language Listening on Measuring Speech Quality"(PDF). Journal of the Audio Engineering Society. 59 (9, 2011 September): 9.