Articulo de referencia

Detección de actividad de voz

La detección de actividad de voz ( VAD ), también conocida como detección de actividad de habla o detección de habla , es la detección de la presencia o ausencia de habla humana...

La detección de actividad de voz ( VAD ), también conocida como detección de actividad de habla o detección de habla , es la detección de la presencia o ausencia de habla humana, utilizada en el procesamiento del habla . [ 1 ] Los principales usos de VAD son la diarización de hablantes , la codificación de voz y el reconocimiento de voz . [ 2 ] Puede facilitar el procesamiento del habla y también puede utilizarse para desactivar algunos procesos durante la sección sin habla de una sesión de audio: puede evitar la codificación /transmisión innecesaria de paquetes de silencio en aplicaciones de Voz sobre Protocolo de Internet (VoIP), ahorrando en computación y en ancho de banda de red .

La detección de actividad de voz (VAD, por sus siglas en inglés) es una tecnología clave para diversas aplicaciones basadas en el habla. Por ello, se han desarrollado varios algoritmos VAD que ofrecen diferentes características y equilibrios entre latencia , sensibilidad , precisión y coste computacional. Algunos algoritmos VAD también proporcionan análisis adicionales, como determinar si el habla es sonora , sorda o sostenida . La detección de actividad de voz suele ser independiente del idioma.

Se investigó por primera vez su uso en sistemas de interpolación de voz con asignación de tiempo (TASI). [ 3 ]

Descripción general del algoritmo

El diseño típico de un algoritmo VAD es el siguiente:

  1. En primer lugar, puede haber una etapa de reducción de ruido, por ejemplo, mediante sustracción espectral .
  2. A continuación, se calculan algunas características o cantidades a partir de una sección de la señal de entrada.
  3. Se aplica una regla de clasificación para clasificar la sección como habla o no habla; a menudo, esta regla de clasificación detecta cuándo un valor supera un determinado umbral.

En esta secuencia puede haber retroalimentación, donde la decisión del VAD se utiliza para mejorar la estimación del ruido en la etapa de reducción de ruido o para variar adaptativamente el/los umbral/es. Estas operaciones de retroalimentación mejoran el rendimiento del VAD en ruido no estacionario (es decir, cuando el ruido varía mucho).

Un conjunto representativo de métodos VAD publicados recientemente formula la regla de decisión fotograma a fotograma utilizando medidas instantáneas de la distancia de divergencia entre el habla y el ruido. Las diferentes medidas que se utilizan en los métodos VAD incluyen la pendiente espectral , los coeficientes de correlación, la razón de verosimilitud logarítmica, el cepstral, el cepstral ponderado y las medidas de distancia modificadas.

Independientemente del algoritmo VAD elegido, es necesario encontrar un equilibrio entre detectar la voz como ruido o el ruido como voz (entre falsos positivos y falsos negativos ). Un VAD que opere en un teléfono móvil debe ser capaz de detectar el habla en presencia de una amplia gama de ruidos acústicos de fondo. En estas difíciles condiciones de detección, suele ser preferible que el VAD sea a prueba de fallos , indicando que se ha detectado habla cuando la decisión es dudosa, para reducir la probabilidad de perder segmentos de habla. La mayor dificultad en la detección del habla en este entorno reside en las muy bajas relaciones señal-ruido (SNR) que se presentan. Puede resultar imposible distinguir entre habla y ruido utilizando técnicas sencillas de detección de nivel cuando partes de la locución quedan ocultas por el ruido.

Aplicaciones

Para una amplia gama de aplicaciones, como la radio móvil digital, la transmisión simultánea de voz y datos digitales (DSVD) o el almacenamiento de voz, es deseable proporcionar una transmisión discontinua de los parámetros de codificación de voz. Las ventajas pueden incluir un menor consumo de energía promedio en los teléfonos móviles, una mayor tasa de bits promedio para servicios simultáneos como la transmisión de datos o una mayor capacidad en los chips de almacenamiento . Sin embargo, la mejora depende principalmente del porcentaje de pausas durante el habla y de la fiabilidad del VAD utilizado para detectar estos intervalos. Por un lado, es ventajoso tener un bajo porcentaje de actividad de voz. Por otro lado, el recorte, es decir, la pérdida de milisegundos de habla activa, debe minimizarse para preservar la calidad. Este es el problema crucial para un algoritmo VAD en condiciones de ruido intenso.

Uso en telemarketing

Una aplicación controvertida de la VAD (Autorización de Disponibilidad de Mensajes) se da en combinación con los marcadores predictivos utilizados por las empresas de telemarketing. Para maximizar la productividad de los agentes, estas empresas configuran los marcadores predictivos para llamar a más números de los que tienen agentes disponibles, sabiendo que la mayoría de las llamadas terminarán en "Suena y nadie contesta" o en contestadores automáticos. Cuando una persona contesta, suele hablar brevemente (" Hola ", " Buenas noches ", etc.) y luego hay un breve período de silencio. Los mensajes del contestador automático suelen ser de 3 a 15 segundos de voz continua. Al configurar correctamente los parámetros de la VAD, los marcadores pueden determinar si una persona o una máquina contestó la llamada y, si es una persona, transferir la llamada a un agente disponible. Si detecta un mensaje de contestador automático, el marcador cuelga. A menudo, incluso cuando el sistema detecta correctamente que una persona contesta la llamada, puede que no haya ningún agente disponible, lo que resulta en una " llamada silenciosa ". El filtrado de llamadas con un mensaje de varios segundos como "Por favor, dígame quién es y quizás conteste el teléfono" frustrará este tipo de llamadas automatizadas.

Evaluación del desempeño

Para evaluar un VAD, su salida utilizando grabaciones de prueba se compara con la de un VAD "ideal", creado mediante la anotación manual de la presencia o ausencia de voz en las grabaciones. El rendimiento de un VAD se evalúa comúnmente en función de los siguientes cuatro parámetros: [ 4 ]

  • FEC (Front End Clipping): recorte introducido al pasar del ruido a la actividad del habla;
  • MSC (recorte de habla a mitad de la frase): recorte debido a que el habla se clasifica erróneamente como ruido;
  • OVER: ruido interpretado como habla debido a que el indicador VAD permanece activo al pasar de la actividad de habla al ruido;
  • NDS (Ruido detectado como habla): ruido interpretado como habla dentro de un período de silencio.

Aunque el método descrito anteriormente proporciona información objetiva útil sobre el rendimiento de un VAD, solo ofrece una medida aproximada del efecto subjetivo. Por ejemplo, los efectos del recorte de la señal de voz pueden quedar enmascarados por el ruido de fondo, según el modelo elegido para la síntesis de ruido de confort, por lo que parte del recorte medido con pruebas objetivas resulta inaudible. Por consiguiente, es importante realizar pruebas subjetivas en los VAD, cuyo objetivo principal es garantizar que el recorte percibido sea aceptable. En aplicaciones VoIP, el recorte inicial puede reducirse rebobinando la señal hasta poco antes de la detección y enviando datos con un ligero retardo.

Este tipo de prueba requiere que un cierto número de oyentes evalúen grabaciones que contienen los resultados del procesamiento de los dispositivos de audio y video que se están probando, asignando calificaciones a varias secuencias de habla según las siguientes características:

  • Calidad;
  • Dificultad de comprensión;
  • Audibilidad del recorte.

Estas marcas se utilizan posteriormente para calcular los resultados promedio de cada una de las características enumeradas anteriormente, proporcionando así una estimación global del comportamiento del VAD que se está probando.

En conclusión, si bien los métodos objetivos son muy útiles en la etapa inicial para evaluar la calidad de un dispositivo de asistencia ventricular (DAV), los métodos subjetivos son más relevantes. Dado que requieren la participación de varias personas durante algunos días, lo que incrementa los costos, generalmente solo se utilizan cuando una propuesta está a punto de estandarizarse.

Implementaciones

  • Un ejemplo temprano de sistema estándar de detección de voz (VAD, por sus siglas en inglés) es el desarrollado por British Telecom para su uso en el servicio paneuropeo de telefonía móvil digital celular en 1991. Utiliza un filtrado inverso entrenado en segmentos que no son de voz para filtrar el ruido de fondo, de modo que pueda utilizar de forma más fiable un umbral de potencia simple para determinar si hay una voz presente. [ 5 ]
  • El estándar G.729 calcula las siguientes características para su VAD: frecuencias espectrales de línea , energía de banda completa, energía de banda baja (<1  kHz) y tasa de cruce por cero . Aplica una clasificación simple utilizando un límite de decisión fijo en el espacio definido por estas características, y luego aplica suavizado y corrección adaptativa para mejorar la estimación. [ 6 ]
  • El estándar GSM incluye dos opciones VAD desarrolladas por ETSI . [ 7 ] La ​​opción 1 calcula la relación señal/ruido (SNR) en nueve bandas y aplica un umbral a estos valores. La opción 2 calcula diferentes parámetros: potencia del canal, métricas de voz y potencia de ruido. Luego, aplica un umbral a las métricas de voz que varía según la SNR estimada.
  • La biblioteca de compresión de audio Speex utiliza un procedimiento llamado Promediado recursivo controlado por mínimos mejorado , que utiliza una representación suavizada de la potencia espectral y luego examina los mínimos de un periodograma suavizado . [ 8 ] A partir de la versión 1.2, fue reemplazado por lo que el autor denominó una chapuza . [ 9 ]
  • Lingua Libre , una herramienta y proyecto de Wikimedia para la documentación de idiomas , utiliza la tecnología VAD para permitir la grabación de numerosas pronunciaciones en poco tiempo.
  • La biblioteca VAD para Android [ 10 ] utiliza una combinación de modelos GMM y DNN, como WebRTC GMM, Silero DNN y Yamnet DNN. Esta biblioteca supera a muchos modelos de nivel de producción tanto en calidad como en rendimiento.
  • Recientemente, los enfoques basados ​​en DNN han demostrado que el rendimiento de VAD puede mejorarse con la ayuda del aprendizaje profundo. TEN VAD [ 11 ] es un enfoque basado en DNN con alto rendimiento, tamaño reducido y baja latencia, superando a los enfoques tradicionales como webRTC VAD y Silero VAD, basado en DNN de última generación.

Véase también

Referencias

  1. ^ Manoj Bhatia; Jonathan Davidson; Satish Kalidindi; Sudipto Mukherjee; James Peters (20 de octubre de 2006). "VoIP: un análisis en profundidad: detección de actividad de voz" . Cisco .
  2. ^ Sahidullah, Maryland; Patiño, José; Cornell, Samuele; Yin, Ruiking; Sivasankaran, Sunit; Bredin, Hervé; Korshunov, Pavel; Brutti, Alessio; Serizel, Romain; Vicente, Emmanuel; Evans, Nicolás; Marcel, Sebastián; Squartini, Stefano; Barras, Claude (6 de noviembre de 2019). "La presentación rápida a DIHARD II: contribuciones y lecciones aprendidas". arXiv : 1911.02388 [ eess.AS ].
  3. Ravi Ramachandran; Richard Mammone (6 de diciembre de 2012). Métodos modernos de procesamiento del habla . Springer Science & Business Media. págs. 102–. ISBN  978-1-4615-2281-2.
  4. Beritelli, F.; Casale, S.; Ruggeri, G.; Serrano, S. (marzo de 2002). "Evaluación del rendimiento y comparación de detectores de actividad de voz difusos G.729/AMR". IEEE Signal Processing Letters . 9 (3): 85– 88. Bibcode : 2002ISPL....9...85B . doi : 10.1109/97.995824 . S2CID 16724847 . 
  5. Freeman, DK (mayo de 1989). "El detector de actividad de voz para el servicio de telefonía móvil celular digital paneuropeo". Actas de la Conferencia Internacional sobre Acústica, Habla y Procesamiento de Señales (ICASSP-89) . Vol. 1. págs. 369–372 . doi : 10.1109/ICASSP.1989.266442 .  
  6. Benyassine, A.; Shlomot, E.; Huan-yu Su; Massaloux, D.; Lamblin, C.; Petit, J.-P. (septiembre de 1997). "Recomendación G.729 Anexo B de la UIT-T: un esquema de compresión de silencio para su uso con G.729 optimizado para aplicaciones digitales simultáneas de voz y datos V.70". IEEE Communications Magazine . 35 (9): 64–73 . doi : 10.1109/35.620527 .
  7. ETSI (1999). "GSM 06.42, Sistema de telecomunicaciones celulares digitales (Fase 2+); Habla a media velocidad; Detector de actividad de voz (VAD) para canales de tráfico de voz a media velocidad" (Documento). ETSI.
  8. Cohen, I. (septiembre de 2003). "Estimación del espectro de ruido en entornos adversos: promedio recursivo controlado por mínimos mejorado". IEEE Transactions on Speech and Audio Processing . 11 (5): 466– 475. Bibcode : 2003ITSAP..11..466C . CiteSeerX 10.1.1.620.8768 . doi : 10.1109/TSA.2003.811544 . 
  9. «Algoritmo Speex VAD» . 30 de septiembre de 2004.
  10. "Biblioteca de detección de actividad de voz (VAD) para Android. Compatible con los modelos WebRTC VAD GMM, Silero VAD DNN y Yamnet VAD DNN" . Github . Consultado el 27 de noviembre de 2019 .
  11. "TEN VAD : Un detector de actividad de voz ligero, de alto rendimiento y baja latencia" . Github . 
  • Normas mínimas de rendimiento DMA para la operación de transmisión discontinua de estaciones móviles. Documento y base de datos TIA IS-727, junio de 1998.
  • MY Appiah, M. Sasikath, R. Makrickaite, M. Gusaite, " Mecanismo robusto de detección de actividad de voz y reducción de ruido ( PDF )", Instituto de Sistemas Electrónicos, Universidad de Aalborg
  • XL Liu, Y. Liang, YH Lou, H. Li, BS Shan, Detector de actividad de voz robusto al ruido basado en modelos semi-Markov ocultos , Proc. ICPR'10 , 81–84.