La normalización de media y varianza cepstral ( CMVN ) es unatécnica de normalización computacionalmente eficiente para el reconocimiento de voz robusto . Se sabe que el rendimiento de CMVN se degrada para enunciados cortos . Esto se debe a la insuficiencia de datos para la estimación de parámetros y a la pérdida de información discriminable, ya que todos los enunciados se ven obligados a tener media cero y varianza unitaria . [ 1 ]
CMVN minimiza la distorsión causada por la contaminación del ruido para una extracción de características robusta mediante la transformación lineal de los coeficientes cepstrales para que tengan las mismas estadísticas segmentales. [ 2 ] La normalización cepstral ha sido eficaz en el CMU Sphinx para mantener un alto nivel de precisión de reconocimiento en una amplia variedad de entornos acústicos. [ 3 ]
Técnicas de normalización cepstral
Existen múltiples algoritmos que logran la normalización cepstral de diferentes maneras.
Normalización cepstral dependiente de la palabra clave fija (FCDCN)
FCDCN se desarrolló para proporcionar una forma de compensación que ofrece mayor precisión de reconocimiento que SDCN, pero de una manera computacionalmente más eficiente que el algoritmo CDCN. El algoritmo FCDCN aplica una corrección aditiva que depende de la relación señal/ruido instantánea de la entrada (al igual que SDCN), pero que también puede variar de una palabra clave a otra (al igual que CDCN).
Normalización cepstral dependiente de múltiples palabras clave fijas (MFCDCN)
MFCDCN es una extensión sencilla del algoritmo FCDCN que no requiere entrenamiento específico para cada entorno. En MFCDCN, los vectores de compensación se precalculan en paralelo para un conjunto de entornos objetivo, utilizando el algoritmo FCDCN.
Normalización cepstral incremental dependiente de palabras clave fijas múltiples (IMFCDCN)
Si bien la selección del entorno para los vectores de compensación de MFCDCN generalmente se realiza enunciado por enunciado, IMFCFCN lo mejora al permitir que el proceso de clasificación utilice vectores cepstrales de enunciados anteriores en una sesión determinada.
Sustracción de ruido cepstral
El reconocimiento automático del habla (ASR) describe los pasos para transcribir enunciados de voz representados como formas de onda acústicas a palabras escritas. La CMVN se ha utilizado en diversas aplicaciones, ya que esta técnica ha demostrado proporcionar mejores resultados de reconocimiento del habla en diferentes entornos. La CMVN tiene la capacidad de reducir las diferencias entre los datos de prueba y entrenamiento producidas por distorsiones y coloraciones del canal. También se ha descubierto que la CMVN puede reducir las diferencias en la representación de características entre hablantes y, en parte, disminuir la influencia del ruido de fondo. [ 4 ]
Referencias
- ↑ Prasad, NV, Umesh, S. "Normalización mejorada de la media y la varianza cepstral mediante un marco bayesiano", IEEE, 2013, Automatic Speech Recognition and Understanding (ASRU), 2013 IEEE Workshop on, pp. 156–161, doi : 10.1109/ASRU.2013.6707722
- ↑ Viikki, O. y Laurila, K., “ Normalización del vector de características segmentales del dominio cepstral para el reconocimiento de voz robusto al ruido ”, Speech Communication, 25(1-3):133-147, 1998
- ↑ Liu, F., Stern, R., Huang, X., y Acero, A. (1993). Normalización cepstral eficiente para un reconocimiento de voz robusto . Actas del Taller ARPA sobre Tecnología del Lenguaje Humano, Princeton, NJ.
- ↑ Rehr, R., & Gerkmann, T. (2015). Sustracción de ruido cepstral para un reconocimiento automático de voz robusto. 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). doi : 10.1109/icassp.2015.7177994
- Reconocimiento de voz
- esbozos de informática