La minería de audio es una técnica que permite analizar y buscar automáticamente el contenido de una señal de audio. Se utiliza con mayor frecuencia en el campo del reconocimiento automático del habla , donde el análisis intenta identificar cualquier fragmento de voz dentro del audio. El término minería de audio se usa a veces indistintamente con indexación de audio, búsqueda fonética, indexación fonética, indexación del habla, análisis de audio, análisis del habla , detección de palabras y recuperación de información . Sin embargo, la indexación de audio se usa principalmente para describir el preprocesamiento de la minería de audio, en el que el archivo de audio se divide en un índice de palabras que permite realizar búsquedas.
Historia
La investigación académica sobre minería de audio comenzó a finales de la década de 1970 en instituciones como la Universidad Carnegie Mellon, la Universidad de Columbia, el Instituto Tecnológico de Georgia y la Universidad de Texas. [ 1 ] La indexación y recuperación de datos de audio comenzó a recibir atención y demanda a principios de la década de 1990, cuando el contenido multimedia comenzó a desarrollarse y el volumen de contenido de audio aumentó significativamente. [ 2 ] Antes de que la minería de audio se convirtiera en el método principal, se creaban transcripciones escritas del contenido de audio y se analizaban manualmente. [ 3 ]
Proceso
La minería de audio se divide generalmente en cuatro componentes: indexación de audio, sistemas de procesamiento y reconocimiento de voz, extracción de características y clasificación de audio. [ 4 ] El audio se procesa normalmente mediante un sistema de reconocimiento de voz para identificar unidades de palabras o fonemas que probablemente aparezcan en el contenido hablado. Esta información puede utilizarse inmediatamente en búsquedas predefinidas de palabras clave o frases (un sistema de detección de palabras en tiempo real), o bien, la salida del reconocedor de voz puede almacenarse en un archivo de índice. Posteriormente, se pueden cargar uno o más archivos de índice de minería de audio para realizar búsquedas de palabras clave o frases. Los resultados de una búsqueda se presentan normalmente en términos de coincidencias, que son regiones dentro de los archivos que coinciden con las palabras clave elegidas. El usuario puede entonces escuchar el audio correspondiente a estas coincidencias para verificar si se ha encontrado una coincidencia correcta.
Indexación de audio
En el ámbito del audio, el principal problema reside en la recuperación de información: la necesidad de localizar los documentos de texto que contienen la palabra clave de búsqueda. A diferencia de los humanos, un ordenador no puede distinguir entre los diferentes tipos de audio, como la velocidad, el estado de ánimo, el ruido, la música o el habla humana; por lo tanto, se requiere un método de búsqueda eficaz. En consecuencia, la indexación de audio permite una búsqueda eficiente de información mediante el análisis de un archivo completo utilizando el reconocimiento de voz. A continuación, se genera un índice de contenido que incluye las palabras y sus ubicaciones, obtenido mediante la recuperación de audio basada en contenido, centrándose en las características de audio extraídas.
Esto se realiza principalmente mediante dos métodos: el reconocimiento continuo del habla con vocabulario amplio (LVCSR, por sus siglas en inglés) y la indexación basada en la fonética.
Reconocedores de voz continua de vocabulario amplio (LVCSR)
En la indexación basada en texto o el reconocimiento continuo de voz con vocabulario amplio (LVCSR), el archivo de audio se divide primero en fonemas reconocibles. Luego se procesa mediante un diccionario que puede contener cientos de miles de entradas y se compara con palabras y frases para producir una transcripción completa del texto. El usuario puede entonces buscar fácilmente el término deseado y se le devolverá la parte relevante del contenido de audio. Si el texto o la palabra no se encuentra en el diccionario, el sistema seleccionará la siguiente entrada más similar que encuentre. El sistema utiliza un modelo de comprensión del lenguaje para crear un nivel de confianza para sus coincidencias. Si el nivel de confianza es inferior al 100 %, el sistema proporcionará opciones de todas las coincidencias encontradas. [ 5 ]
Ventajas y desventajas
La principal ventaja de LVCSR radica en su alta precisión y velocidad de búsqueda. En LVCSR, se utilizan métodos estadísticos para predecir la probabilidad de diferentes secuencias de palabras, lo que resulta en una precisión mucho mayor que la búsqueda de una sola palabra en una búsqueda fonética. Si se encuentra la palabra, la probabilidad de que se haya pronunciado es muy alta. [ 6 ] Si bien el procesamiento inicial del audio requiere bastante tiempo, la búsqueda es rápida, ya que solo se necesita una simple prueba de coincidencia de texto.
Por otro lado, LVCSR es susceptible a problemas comunes en el reconocimiento de voz . La naturaleza aleatoria inherente del audio y los problemas de ruido externo afectan la precisión de la indexación basada en texto.
Otro problema de LVCSR es su excesiva dependencia de su base de datos de diccionarios. LVCSR solo reconoce palabras que se encuentran en sus bases de datos de diccionarios, y estas bases de datos no pueden mantenerse al día con la constante evolución de la terminología , los nombres y las palabras. Si el diccionario no contiene una palabra, el sistema no puede identificarla ni predecirla. Esto reduce la precisión y la fiabilidad del sistema. Esto se conoce como el problema de palabras fuera del vocabulario (OOV). Los sistemas de minería de audio intentan solucionar el problema OOV actualizando continuamente el diccionario y el modelo de lenguaje utilizados, pero el problema sigue siendo significativo y ha impulsado la búsqueda de alternativas. [ 7 ]
Además, debido a la necesidad de actualizar y mantener constantemente el conocimiento basado en tareas y las grandes bases de datos de entrenamiento para hacer frente al problema de los datos fuera del vocabulario (OOV), se generan altos costos computacionales. Esto convierte a LVCSR en un método costoso para la minería de audio.
Indexación basada en la fonética
La indexación fonética también divide el archivo de audio en fonemas reconocibles, pero en lugar de convertirlos a un índice de texto, se mantienen tal cual y se analizan para crear un índice fonético. El proceso de indexación fonética se puede dividir en dos fases. La primera fase es la indexación. Comienza convirtiendo el medio de entrada a un formato de representación de audio estándar ( PCM ). Luego, se aplica un modelo acústico al habla. Este modelo acústico representa las características tanto de un canal acústico (un entorno en el que se pronunció el habla y un transductor a través del cual se grabó) como de un lenguaje natural (en el que los seres humanos expresaron el habla de entrada). Esto produce una pista de búsqueda fonética correspondiente, o pista de audio fonética (PAT), una representación altamente comprimida del contenido fonético del medio de entrada. La segunda fase es la búsqueda. El término de consulta de búsqueda del usuario se analiza en una posible cadena de fonemas utilizando un diccionario fonético. Luego, se pueden escanear varios archivos PAT a alta velocidad durante una sola búsqueda de secuencias fonéticas probables que coincidan estrechamente con las cadenas de fonemas correspondientes en el término de consulta. [ 8 ] [ 9 ]
Ventajas y desventajas
La indexación fonética resulta muy atractiva, ya que prácticamente no se ve afectada por problemas lingüísticos como palabras no reconocidas o errores ortográficos. El preprocesamiento fonético mantiene un vocabulario abierto que no requiere actualización. Esto lo hace especialmente útil para buscar terminología especializada o palabras en idiomas extranjeros que no suelen aparecer en los diccionarios. También es más eficaz para buscar archivos de audio con ruido de fondo o locuciones poco claras, ya que puede compilar resultados basándose en los sonidos que puede discernir y, si el usuario lo desea, puede buscar entre las opciones hasta encontrar el elemento deseado. [ 10 ]
Además, a diferencia de LVCSR, puede procesar archivos de audio muy rápidamente, ya que existen muy pocos fonemas únicos entre idiomas. Sin embargo, los fonemas no se pueden indexar eficazmente como una palabra completa, por lo que la búsqueda en un sistema basado en la fonética es lenta. [ 11 ]
Un problema de la indexación fonética es su baja precisión. Las búsquedas basadas en fonemas generan más coincidencias falsas que la indexación basada en texto. Esto es especialmente frecuente con términos de búsqueda cortos, que tienen mayor probabilidad de sonar similares a otras palabras o de formar parte de palabras más largas. También puede arrojar resultados irrelevantes de otros idiomas. A menos que el sistema reconozca la palabra completa con exactitud o comprenda las secuencias fonéticas de los idiomas, es difícil que la indexación fonética arroje resultados precisos. [ 12 ]
Sistema de procesamiento y reconocimiento de voz
Considerado el componente más crítico y complejo de la minería de audio, el reconocimiento de voz requiere el conocimiento del sistema de producción del habla humana y su modelado.
Para corresponder al sistema de producción del habla humana, el sistema eléctrico de producción del habla se desarrolla para constar de:
- Generación del habla
- Percepción del habla
- Habla con y sin voz
- Modelo del habla humana
El sistema de producción de voz electrónica convierte la señal acústica en la representación correspondiente del habla mediante los modelos acústicos de su software, donde se representan todos los fonemas. Un modelo estadístico del lenguaje facilita el proceso al identificar la probabilidad de que las palabras se sucedan en determinados idiomas. Combinado con un análisis de probabilidad complejo, el sistema de reconocimiento de voz es capaz de tomar una señal de voz desconocida y transcribirla en palabras basándose en el diccionario del programa. [ 13 ] [ 14 ]
El sistema ASR (reconocimiento automático del habla) incluye:
- Análisis acústico : la forma de onda del sonido de entrada se transforma en una característica
- Modelo acústico : establece la relación entre la señal de voz y los fonemas, el modelo de pronunciación y el modelo lingüístico. Se aplican algoritmos de entrenamiento a la base de datos de voz para crear una representación estadística de cada fonema, generando así un modelo acústico con un conjunto de fonemas y sus medidas de probabilidad.
- Modelo de pronunciación : Los fonemas se asignan a palabras específicas.
- Modelo lingüístico : Las palabras se organizan para formar oraciones con sentido.
Algunas aplicaciones del procesamiento del habla incluyen el reconocimiento del habla, la codificación del habla , la autenticación del hablante, la mejora del habla y la síntesis del habla .
Extracción de características
Como requisito previo para todo el proceso de reconocimiento de voz, primero debe establecerse la extracción de características dentro del sistema. Los archivos de audio deben procesarse de principio a fin, asegurando que no se pierda información importante.
Diferenciando las fuentes sonoras a través del tono, las características tímbricas, las características rítmicas, la inarmonicidad, la autocorrelación y otras características basadas en la predictibilidad de la señal, el patrón estadístico y las características dinámicas.
La aplicación de la estandarización en la extracción de características está regulada a través de las características del estándar internacional MPEG-7 , donde las características para la clasificación de señales de audio o voz se fijan en términos de las técnicas utilizadas para analizar y representar los datos brutos en términos de ciertas características.
Técnicas estándar de extracción de voz:
- La codificación predictiva lineal (LPC) estima la muestra de habla actual analizando la muestra de habla anterior.
- El coeficiente cepstral de frecuencia Mel (MFCC) representa la señal de voz mediante una forma paramétrica utilizando la escala Mel.
- La predicción lineal perceptual (PLP) tiene en cuenta el habla humana.
Sin embargo, las tres técnicas no son ideales, ya que se ignoran las señales no estacionarias. Las señales no estacionarias se pueden analizar utilizando Fourier y Fourier de tiempo corto , mientras que las señales que varían con el tiempo se analizan utilizando Wavelet y la transformada discreta de ondículas (DWT) .
Clasificación de audio
La clasificación de audio es una forma de aprendizaje supervisado e implica el análisis de grabaciones de audio. Se divide en varias categorías: clasificación de datos acústicos, clasificación de sonidos ambientales, clasificación musical y clasificación de enunciados en lenguaje natural. [ 15 ] Las características que se suelen utilizar para este proceso son el tono , las características tímbricas , las características rítmicas, la inarmonicidad y la correlación de audio, aunque también se pueden utilizar otras características. Existen varios métodos para la clasificación de audio que utilizan clasificadores existentes, como el k-vecinos más cercanos o el clasificador bayesiano ingenuo . Utilizando datos de audio anotados, las máquinas aprenden a identificar y clasificar los sonidos.
También se han realizado investigaciones sobre el uso de redes neuronales profundas para el reconocimiento de voz y la clasificación de audio, debido a su eficacia en otros campos como la clasificación de imágenes. [ 16 ] Un método para utilizar las DNN consiste en convertir archivos de audio en archivos de imagen, a través de espectrogramas , para realizar la clasificación.
Aplicaciones de la minería de audio
La minería de audio se utiliza en áreas como la minería de audio musical (también conocida como recuperación de información musical ), que se relaciona con la identificación de características perceptualmente importantes de una pieza musical, como la estructura melódica, armónica o rítmica. Posteriormente, se pueden realizar búsquedas para encontrar piezas musicales que sean similares en cuanto a sus características melódicas, armónicas y/o rítmicas.
Dentro del campo de la lingüística , la minería de audio se ha utilizado para el procesamiento fonético y el análisis semántico. [ 17 ] La eficiencia de la minería de audio en el procesamiento de datos audiovisuales ayuda en la identificación y segmentación de hablantes, así como en la transcripción de texto. A través de este proceso, el habla se puede categorizar para identificar información o extraer información a través de palabras clave pronunciadas en el audio. En particular, esto se ha utilizado para el análisis del habla . Los centros de llamadas han utilizado la tecnología para realizar análisis en tiempo real identificando cambios en el tono, el sentimiento o el timbre, entre otros, que luego son procesados por un motor de decisiones o inteligencia artificial para tomar acciones posteriores. [ 18 ] También se ha visto su uso en áreas de reconocimiento de voz y aplicaciones de texto a voz.
También se ha utilizado junto con la minería de vídeo, en proyectos como la minería de datos de películas.
Véase también
Referencias
- ↑ Leavitt, Neal (2002). "Aplausos para la minería de audio". Computer . 35 (10): 23– 25. doi : 10.1109/MC.2002.1039511 .
- ↑ Zhang, Zhongfei; Zhang, Ruofei (2008). Minería de datos multimedia: una introducción sistemática a los conceptos y la teoría . CRC Press. ISBN 9781584889670.
- ↑ Leavitt, Neal (2002). "Aplausos para la minería de audio". Computer . 35 (10): 23– 25. doi : 10.1109/MC.2002.1039511 .
- ↑ Sen, Soumya; Dutta, Anjan; Dey, Nilanjan (2019). Procesamiento de audio y reconocimiento de voz . Saltador. ISBN 978-981-13-6098-5.
- ↑ Leavitt, Neal (2002). "Aplausos para la minería de audio". Computer . 35 (10): 23– 25. doi : 10.1109/MC.2002.1039511 .
- ↑ Leavitt, Neal (2002). "Aplausos para la minería de audio". Computer . 35 (10): 23– 25. doi : 10.1109/MC.2002.1039511 .
- ↑ Sen, Soumya; Dutta, Anjan; Dey, Nilanjan (2019). Procesamiento de audio y reconocimiento de voz . Saltador. ISBN 978-981-13-6098-5.
- ↑ Sen, Soumya; Dutta, Anjan; Dey, Nilanjan (2019). Procesamiento de audio y reconocimiento de voz . Saltador. ISBN 978-981-13-6098-5.
- ↑ Leavitt, Neal (2002). "Aplausos para la minería de audio". Computer . 35 (10): 23– 25. doi : 10.1109/MC.2002.1039511 .
- ↑ Cardillo, P.; Clements, M.; Miller, M. (2002). "Búsqueda fonética vs. LVCSR: Cómo encontrar lo que realmente se busca en archivos de audio" . International Journal of Speech Technology . 5 (1): 9– 22. doi : 10.1023/A:1013670312989 . S2CID 36313454. Recuperado el 23 de abril de 2020 .
- ↑ Sen, Soumya; Dutta, Anjan; Dey, Nilanjan (2019). Procesamiento de audio y reconocimiento de voz . Saltador. ISBN 978-981-13-6098-5.
- ↑ Sen, Soumya; Dutta, Anjan; Dey, Nilanjan (2019). Procesamiento de audio y reconocimiento de voz . Saltador. ISBN 978-981-13-6098-5.
- ↑ Sen, Soumya; Dutta, Anjan; Dey, Nilanjan (2019). Procesamiento de audio y reconocimiento de voz . Saltador. ISBN 978-981-13-6098-5.
- ↑ Leavitt, Neal (2002). "Aplausos para la minería de audio". Computer . 35 (10): 23– 25. doi : 10.1109/MC.2002.1039511 .
- ↑ Lim, Hengtee. "¿Qué es la clasificación de audio?" . Lionbridge . Consultado el 20 de abril de 2020 .
- ↑ Smales, Mike. "Clasificación de sonido mediante aprendizaje profundo" . Medium . Consultado el 20 de abril de 2020 .
- ↑ Ezzat, Souraya; El Gayar, Neamat; Ghanem, Moustafa M. (2012). "Análisis de sentimiento de conversaciones de audio en centros de llamadas mediante clasificación de texto" (PDF) . Revista internacional de sistemas de información informática y aplicaciones de gestión industrial . 4 : 619–627 .
- ↑ Klie, Leonard. "La era del análisis de voz está a la vuelta de la esquina" . destinationCRM.com . Consultado el 12 de abril de 2020 .
Lecturas adicionales
Sen, Soumya; Dutta, Anjan; Dey, Nilanjan (2019). Procesamiento de audio y reconocimiento de voz . Saltador. ISBN 978-981-13-6098-5.
Enlaces externos
- Procesamiento de audio y reconocimiento de voz: conceptos, técnicas y panorama general de la investigación.
- Reconocimiento de voz
- recuperación de información musical
- Géneros de recuperación de información
- Lingüística computacional