En el procesamiento de sonido , el cepstrum de frecuencia mel ( MFC ) es una representación del espectro de potencia a corto plazo de un sonido, basada en una transformada coseno lineal de un espectro de potencia logarítmica en una escala de frecuencia mel no lineal .
Los coeficientes cepstrales de frecuencia Mel ( MFCC ) son coeficientes que, en conjunto, conforman un MFC. [ 1 ] Se derivan de un tipo de representación cepstral del clip de audio (un "espectro de un espectro" no lineal). La diferencia entre el cepstrum y el cepstrum de frecuencia Mel radica en que, en el MFC, las bandas de frecuencia están espaciadas uniformemente en la escala Mel, lo que se aproxima más a la respuesta del sistema auditivo humano que las bandas de frecuencia espaciadas linealmente utilizadas en el espectro normal. Esta deformación de frecuencia permite una mejor representación del sonido, por ejemplo, en la compresión de audio , lo que podría reducir el ancho de banda de transmisión y los requisitos de almacenamiento de las señales de audio.
Los MFCC se derivan comúnmente de la siguiente manera: [ 2 ] [ 3 ]
- Toma la transformada de Fourier de (un extracto con ventana de) una señal.
- Mapea las potencias del espectro obtenido anteriormente sobre la escala mel , utilizando ventanas triangulares superpuestas o, alternativamente, ventanas cosenoidales superpuestas .
- Toma los logaritmos de las potencias en cada una de las frecuencias Mel.
- Toma la transformada discreta del coseno de la lista de potencias logarítmicas de Mel, como si fuera una señal.
- Los MFCC son las amplitudes del espectro resultante.
Este proceso puede presentar variaciones, por ejemplo: diferencias en la forma o el espaciado de las ventanas utilizadas para mapear la escala, [ 4 ] o la adición de características dinámicas como los coeficientes "delta" y "delta-delta" (diferencia de primer y segundo orden entre fotogramas). [ 5 ]
A principios de la década de 2000, el Instituto Europeo de Normas de Telecomunicaciones definió un algoritmo MFCC estandarizado para su uso en teléfonos móviles . [ 6 ]
Aplicaciones
Los MFCC se utilizan comúnmente como características en sistemas de reconocimiento de voz [ 7 ] , como los sistemas que pueden reconocer automáticamente los números que se dicen por teléfono.
Los MFCC también se utilizan cada vez más en aplicaciones de recuperación de información musical, como la clasificación de géneros , medidas de similitud de audio, etc. [ 8 ]
MFCC para el reconocimiento de locutores
Dado que las bandas de frecuencia Mel se distribuyen uniformemente en MFCC y son muy similares al sistema de voz humano, MFCC puede utilizarse eficazmente para caracterizar a los hablantes. Por ejemplo, puede emplearse para reconocer las características del modelo de teléfono móvil del hablante y, además, obtener detalles de su voz. [ 4 ]
Este tipo de reconocimiento de dispositivos móviles es posible gracias a las tolerancias inherentes a la producción de componentes electrónicos en un teléfono, ya que las distintas implementaciones de circuitos electrónicos no presentan funciones de transferencia idénticas . Las diferencias en la función de transferencia entre implementaciones se acentúan si los circuitos que realizan la tarea provienen de diferentes fabricantes. Por lo tanto, cada teléfono celular introduce una distorsión convolucional en la voz de entrada, lo que genera un impacto único en las grabaciones. En consecuencia, un teléfono específico puede identificarse a partir de la voz grabada multiplicando el espectro de frecuencia original por multiplicaciones adicionales de las funciones de transferencia específicas de cada teléfono, seguido de técnicas de procesamiento de señales. Así, mediante el uso de MFCC, se pueden caracterizar las grabaciones de teléfonos celulares para identificar la marca y el modelo del teléfono. [ 5 ]
Considerar la sección de grabación de un teléfono celular como un filtro lineal invariante en el tiempo ( LTI ):
Respuesta al impulso- h(n) , señal de voz grabada y(n) como salida del filtro en respuesta a la entrada x(n).
Por eso,(circunvolución)
Como el habla no es una señal estacionaria, se divide en tramas superpuestas dentro de las cuales se supone que la señal es estacionaria. Por lo tanto,El segmento (fotograma) de corta duración del habla de entrada grabada es:
- ,
donde w(n) : función con ventana de longitud W.
Por lo tanto, como se especifica, la huella del teléfono móvil en la grabación de voz es la distorsión de convolución que ayuda a identificar el teléfono que realiza la grabación.
La identidad integrada del teléfono celular requiere una conversión a una forma más fácilmente identificable, por lo tanto, se aplica la transformada de Fourier de corto tiempo:
puede considerarse como una función de transferencia concatenada que produjo el habla de entrada y el habla grabada.Puede percibirse como habla original de un teléfono celular.
Por lo tanto, la función de transferencia equivalente del tracto vocal y la grabadora del teléfono celular se considera como la fuente original del habla grabada. Por consiguiente,
donde Xew(f) es la función de excitación,es la función de transferencia del tracto vocal para el habla en elmarco yes la función de transferencia equivalente que caracteriza al teléfono celular.
Este enfoque puede resultar útil para el reconocimiento de locutores, ya que la identificación del dispositivo y la identificación del locutor están estrechamente relacionadas.
Dando importancia a la envolvente del espectro que se multiplica por el banco de filtros (cepstrum adecuado con banco de filtros de escala mel), después de suavizar el banco de filtros con la función de transferencia U(f), la operación logarítmica sobre las energías de salida es:
Representando
El MFCC tiene éxito gracias a esta transformación no lineal con propiedad aditiva.
Volviendo al dominio del tiempo:
donde cy(j), ce(j), cw(j) son el cepstrum de voz grabado y la respuesta de impulso equivalente ponderada de la grabadora del teléfono celular que caracteriza al teléfono celular, respectivamente, mientras que j es el número de filtros en el banco de filtros.
Más precisamente, la información específica del dispositivo se encuentra en la grabación de voz, que se convierte a un formato aditivo adecuado para su identificación.
cy(j) puede procesarse posteriormente para la identificación del teléfono que realiza la grabación.
Longitudes de trama utilizadas frecuentemente: 20 o 20 ms.
Funciones de ventana de uso común: ventanas de Hamming y Hanning.
Por lo tanto, la escala Mel es una escala de frecuencia de uso común que es lineal hasta los 1000 Hz y logarítmica por encima de esa cifra.
Cálculo de las frecuencias centrales de los filtros en la escala Mel:
- , base 10.
Procedimiento básico para el cálculo de MFCC:
- Las salidas del banco de filtros logarítmicos se generan y se multiplican por 20 para obtener envolventes espectrales en decibelios.
- Los MFCC se obtienen aplicando la transformada discreta del coseno (DCT) a la envolvente espectral.
- Los coeficientes cepstrales se obtienen de la siguiente manera:
,,
dóndecorresponde a la-ésimo coeficiente MFCC,es el número de filtros triangulares en el banco de filtros,es la producción de energía logarítmica decoeficiente de filtro -ésimo, yes el número de coeficientes MFCC que queremos calcular.
Inversión
Un MFCC se puede invertir aproximadamente a audio en cuatro pasos: (a1) DCT inversa para obtener un espectrograma de potencia logarítmica Mel [dB] , (a2) mapeo a potencia para obtener un espectrograma de potencia Mel, (b1) reescalado para obtener magnitudes de transformada de Fourier de tiempo corto y, finalmente, (b2) reconstrucción de fase y síntesis de audio usando Griffin-Lim. Cada paso corresponde a un paso en el cálculo del MFCC. [ 9 ]
Sensibilidad al ruido
Los valores MFCC no son muy robustos en presencia de ruido aditivo, por lo que es común normalizarlos en los sistemas de reconocimiento de voz para reducir la influencia del ruido. Algunos investigadores proponen modificaciones al algoritmo MFCC básico para mejorar la robustez, como elevar las amplitudes log-mel a una potencia adecuada (alrededor de 2 o 3) antes de aplicar la transformada discreta del coseno (DCT), lo que reduce la influencia de los componentes de baja energía. [ 10 ]
Historia
A Paul Mermelstein [ 11 ] [ 12 ] se le suele atribuir el desarrollo del MFC. Mermelstein atribuye la idea a Bridle y Brown [ 13 ] :
Bridle y Brown utilizaron un conjunto de 19 coeficientes ponderados de forma espectral, obtenidos mediante la transformada coseno de las salidas de un conjunto de filtros paso banda con espaciado no uniforme. El espaciado entre filtros se eligió de forma logarítmica por encima de 1 kHz, y los anchos de banda de los filtros también se incrementaron en ese rango. Por lo tanto, denominaremos a estos parámetros parámetros cepstrales basados en mel. [ 11 ]
A veces se citan ambos autores originales. [ 14 ]
Muchos autores, incluidos Davis y Mermelstein, [ 12 ] han comentado que las funciones base espectrales de la transformada coseno en el MFC son muy similares a los componentes principales de los espectros logarítmicos, que fueron aplicados a la representación y el reconocimiento del habla mucho antes por Pols y sus colegas. [ 15 ] [ 16 ]
Véase también
Referencias
- ↑ Min Xu; et al. (2004). "Generación de palabras clave de audio basada en HMM" (PDF) . En Kiyoharu Aizawa; Yuichi Nakamura; Shin'ichi Satoh (eds.). Avances en el procesamiento de información multimedia – PCM 2004: 5.ª Conferencia de la Cuenca del Pacífico sobre Multimedia . Lecture Notes in Computer Science. Vol. 3333. Springer. pp. 566–574 . doi : 10.1007/978-3-540-30543-9_71 . ISBN 978-3-540-23985-7Archivado del original (PDF) el 10 de mayo de 2007.
- ↑ Sahidullah, Md.; Saha, Goutam (mayo de 2012). "Diseño, análisis y evaluación experimental de la transformación basada en bloques en el cálculo de MFCC para el reconocimiento de locutores". Speech Communication . 54 (4): 543– 565. doi : 10.1016/j.specom.2011.11.004 . S2CID 14985832 .
- ↑ Abdulsatar, Assim Ara; Davydov, VV; Yushkova, VV; Glinushkin, AP; Rud, V Yu (2019-12-01). "Reconocimiento de edad y género a partir de señales de voz" . Journal of Physics: Conference Series . 1410 (1) 012073. Bibcode : 2019JPhCS1410a2073A . doi : 10.1088/1742-6596/1410/1/012073 . ISSN 1742-6588 . S2CID 213065622 .
- 1 2 Zheng, Fang; Zhang, Guoliang; Song, Zhanjiang (2001). "Comparación de diferentes implementaciones de MFCC". Journal of Computer Science and Technology . 16 (6): 582– 589. doi : 10.1007/BF02943243 .
- 1 2 Furui, S. (1986). "Reconocimiento de palabras aisladas independiente del hablante basado en dinámicas espectrales enfatizadas". ICASSP '86. Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales . Vol. 11. pp. 1991– 1994. doi : 10.1109/ICASSP.1986.1168654 .
- ↑ Instituto Europeo de Normas de Telecomunicaciones (2003), Procesamiento, transmisión y aspectos de calidad del habla (STQ); Reconocimiento de voz distribuido; Algoritmo de extracción de características de interfaz; Algoritmos de compresión . Norma técnica ES 201 108, v1.1.3.
- ↑ T. Ganchev, N. Fakotakis y G. Kokkinakis (2005), " Evaluación comparativa de varias implementaciones de MFCC en la tarea de verificación del hablante Archivado el 17-07-2011 en Wayback Machine ", en 10.ª Conferencia Internacional sobre Habla y Computación (SPECOM 2005), vol. 1, págs. 191-194.
- ↑ Meinard Müller (2007). Recuperación de información para música y movimiento . Springer. pág. 65. ISBN 978-3-540-74047-6.
- ^ "librosa.feature.inverse.mfcc_to_audio — documentación de librosa 0.10.0" . librosa.org .
- ↑ Tyagi, V.; Wellekens, C. (2005). "Sobre la desensibilización del Mel-Cepstrum a componentes espectrales espurios para un reconocimiento de voz robusto". Actas. (ICASSP '05). Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales, 2005. Vol. 1. pp. 529–532 . doi : 10.1109/ICASSP.2005.1415167 . ISBN 0-7803-8874-7.
- 1 2 P. Mermelstein (1976), " Medidas de distancia para el reconocimiento de voz, psicológicas e instrumentales," en Pattern Recognition and Artificial Intelligence , CH Chen, Ed., pp. 374–388. Academic, Nueva York.
- 1 2 Davis, S.; Mermelstein, P. (1980). "Comparación de representaciones paramétricas para el reconocimiento de palabras monosilábicas en oraciones habladas continuamente" . IEEE Transactions on Acoustics, Speech, and Signal Processing . 28 (4): 357– 366. doi : 10.1109/TASSP.1980.1163420 .
- ↑ JS Bridle y MD Brown (1974), "Un sistema experimental de reconocimiento automático de palabras", Informe JSRU n.º 1003, Unidad Conjunta de Investigación del Habla, Ruislip, Inglaterra.
- ↑ Nelson Morgan ; Hervé Bourlard y Hynek Hermansky (2004). «Reconocimiento automático del habla: una perspectiva auditiva» . En Steven Greenberg y William A. Ainsworth (eds.). Procesamiento del habla en el sistema auditivo . Springer. pág. 315. ISBN 978-0-387-00590-4.
- ↑ LCW Pols (1966), "Análisis espectral e identificación de vocales neerlandesas en palabras monosilábicas", Tesis doctoral, Universidad Libre de Ámsterdam, Países Bajos
- ^ Plomo, R.; Pols, LCW; Van De Geer, JP (1967). "Análisis dimensional de espectros vocales" . La Revista de la Sociedad de Acústica de América . 41 (3): 707– 712. Código bibliográfico : 1967ASAJ...41..707P . doi : 10.1121/1.1910398 .
Enlaces externos
- Códigos MATLAB para MFCC y otras características de voz.
- Tutorial sobre MFCC para el reconocimiento automático del habla.
- Procesamiento de señales
- recuperación de información musical