Articulo de referencia

Análisis computacional de escenas auditivas

El análisis computacional de escenas auditivas ( CASA ) es el estudio del análisis de escenas auditivas por medios computacionales. [ 1 ] En esencia, los sistemas CASA son siste...

El análisis computacional de escenas auditivas ( CASA ) es el estudio del análisis de escenas auditivas por medios computacionales. [ 1 ] En esencia, los sistemas CASA son sistemas de "escucha automática" que buscan separar mezclas de fuentes sonoras de la misma manera que lo hacen los oyentes humanos. CASA se diferencia del campo de la separación ciega de señales en que se basa (al menos en cierta medida) en los mecanismos del sistema auditivo humano y, por lo tanto, utiliza no más de dos grabaciones de micrófono de un entorno acústico. Está relacionado con el problema de la fiesta de cóctel .

Principios

Dado que CASA sirve para modelar partes funcionales del sistema auditivo, es necesario ver partes del sistema auditivo biológico en términos de modelos físicos conocidos. Compuesto por tres áreas, el oído externo, medio e interno, el sistema auditivo periférico actúa como un transductor complejo que convierte las vibraciones sonoras en potenciales de acción en el nervio auditivo. El oído externo consta del oído externo, el conducto auditivo y el tímpano . El oído externo, como un embudo acústico, ayuda a localizar la fuente del sonido. [ 2 ] El conducto auditivo actúa como un tubo resonante (como un tubo de órgano) para amplificar frecuencias entre 2 y 5,5  kHz con una amplificación máxima de aproximadamente 11  dB que ocurre alrededor de 4  kHz. [ 3 ] Como órgano de la audición, la cóclea consta de dos membranas, la de Reissner y la membrana basilar . La membrana basilar se mueve hacia los estímulos auditivos a través de la frecuencia específica del estímulo que coincide con la frecuencia de resonancia de una región particular de la membrana basilar. El movimiento de la membrana basilar desplaza las células ciliadas internas en una dirección, lo que codifica una señal rectificada de media onda de potenciales de acción en las células del ganglio espiral . Los axones de estas células forman el nervio auditivo, que codifica el estímulo rectificado. Las respuestas del nervio auditivo seleccionan ciertas frecuencias, de forma similar a la membrana basilar. Para frecuencias más bajas, las fibras presentan "sincronización de fase". Las neuronas en los centros superiores de la vía auditiva están sintonizadas a características específicas de los estímulos, como la periodicidad, la intensidad del sonido, la amplitud y la modulación de frecuencia. [ 1 ] También existen asociaciones neuroanatómicas de ASA a través de las áreas corticales posteriores , incluidos los lóbulos temporales superiores posteriores y el cíngulo posterior . Los estudios han encontrado que las alteraciones en ASA y las operaciones de segregación y agrupación se ven afectadas en pacientes con enfermedad de Alzheimer . [ 4 ]

Arquitectura del sistema

Cocleografía

Como primera etapa del procesamiento CASA, el cocleograma crea una representación tiempo-frecuencia de la señal de entrada. Al imitar los componentes del oído externo y medio, la señal se divide en diferentes frecuencias que son seleccionadas naturalmente por la cóclea y las células ciliadas. Debido a la selectividad de frecuencia de la membrana basilar, se utiliza un banco de filtros para modelar la membrana, y cada filtro se asocia con un punto específico de la misma. [ 1 ]

Dado que las células ciliadas producen patrones de espigas, cada filtro del modelo también debería producir una espiga similar en la respuesta impulsional . El uso de un filtro gammatone proporciona una respuesta impulsional como producto de una función gamma y un tono. La salida del filtro gammatone puede considerarse como una medida del desplazamiento de la membrana basilar. La mayoría de los sistemas CASA representan la tasa de disparo en el nervio auditivo en lugar de una basada en espigas. Para obtener esto, las salidas del banco de filtros se rectifican a media onda seguidas de una raíz cuadrada. (Se han implementado otros modelos, como controladores automáticos de ganancia). La onda rectificada a media onda es similar al modelo de desplazamiento de las células ciliadas. Los modelos adicionales de las células ciliadas incluyen el modelo de célula ciliada Meddis que se empareja con el banco de filtros gammatone, modelando la transducción de la célula ciliada. [ 5 ] Basado en la suposición de que hay tres reservorios de sustancia transmisora ​​dentro de cada célula ciliada, y los transmisores se liberan en proporción al grado de desplazamiento a la membrana basilar, la liberación se iguala con la probabilidad de una espiga generada en la fibra nerviosa. Este modelo reproduce muchas de las respuestas nerviosas en los sistemas CASA, como la rectificación, la compresión, la descarga espontánea y la adaptación. [ 1 ]

Correlograma

Modelo importante de percepción del tono mediante la unificación de 2 escuelas de teoría del tono: [ 1 ]

  • Teorías de lugar (haciendo hincapié en el papel de los armónicos resueltos)
  • Teorías temporales (que enfatizan el papel de los armónicos no resueltos)

El correlograma se calcula generalmente en el dominio del tiempo mediante la autocorrelación de la actividad de disparo del nervio auditivo simulada con la salida de cada canal del filtro. [ 1 ] Al agrupar la autocorrelación en función de la frecuencia, la posición de los picos en el correlograma resumen corresponde al tono percibido. [ 1 ]

Correlograma cruzado

Debido a que los oídos reciben señales de audio en momentos diferentes, la fuente del sonido se puede determinar utilizando los retrasos obtenidos de ambos oídos. [ 6 ] Al correlacionar los retrasos de los canales izquierdo y derecho (del modelo), los picos coincidentes se pueden clasificar como el mismo sonido localizado, a pesar de su ubicación temporal en la señal de entrada. [ 1 ] El uso del mecanismo de correlación cruzada interaural ha sido respaldado por estudios fisiológicos, que son paralelos a la disposición de las neuronas en el mesencéfalo auditivo . [ 7 ]

Máscaras tiempo-frecuencia

Para aislar la fuente sonora, los sistemas CASA enmascaran el cocleograma. Este enmascaramiento, a veces un filtro de Wiener , pondera las regiones de la fuente objetivo y suprime el resto. [ 1 ] La motivación fisiológica detrás del enmascaramiento se debe a la percepción auditiva, donde un sonido más fuerte hace que el sonido sea inaudible. [ 8 ]

Resíntesis

Una vía de resíntesis reconstruye una señal de audio a partir de un grupo de segmentos. Al invertir el cocleograma, se pueden obtener señales de habla resintetizadas de alta calidad. [ 1 ]

Aplicaciones

Monoaural

La separación de sonido monoaural comenzó con la separación de voces según su frecuencia. Hubo muchos desarrollos iniciales basados ​​en la segmentación de diferentes señales de habla a través de la frecuencia. [ 1 ] Otros modelos siguieron este proceso, añadiendo adaptación mediante modelos de espacio de estados, procesamiento por lotes y arquitectura basada en predicción. [ 9 ] El uso de CASA ha mejorado la robustez de los sistemas ASR y de separación de voz. [ 10 ]

Binaural

Dado que CASA modela las vías auditivas humanas, los sistemas binaurales CASA mejoran el modelo humano al proporcionar localización del sonido, agrupación auditiva y robustez frente a la reverberación mediante la inclusión de dos micrófonos separados espacialmente. Con métodos similares a la correlación cruzada, los sistemas pueden extraer la señal objetivo de ambos micrófonos de entrada. [ 11 ] [ 12 ]

Modelos neuronales

Dado que el sistema auditivo biológico está profundamente conectado con la acción de las neuronas, los sistemas CASA también incorporaron modelos neuronales en su diseño. Dos modelos diferentes constituyen la base de esta área. Malsburg y Schneider propusieron un modelo de red neuronal con osciladores para representar las características de diferentes flujos (sincronizados y desincronizados). [ 13 ] Wang también presentó un modelo que utiliza una red de unidades excitatorias con un inhibidor global y líneas de retardo para representar la escena auditiva en el dominio tiempo-frecuencia. [ 14 ] [ 15 ]

Análisis de señales de audio musicales

Los enfoques típicos en los sistemas CASA comienzan con la segmentación de las fuentes de sonido en constituyentes individuales, en sus intentos de imitar el sistema auditivo físico. Sin embargo, hay evidencia de que el cerebro no necesariamente procesa la entrada de audio por separado, sino más bien como una mezcla. [ 16 ] En lugar de descomponer la señal de audio en constituyentes individuales, la entrada se descompone por descriptores de nivel superior, como acordes, bajo y melodía, estructura rítmica y repeticiones de estribillo y frase. Estos descriptores presentan dificultades en escenarios del mundo real, con señales monoaurales y binaurales. [ 1 ] Además, la estimación de estos descriptores depende en gran medida de la influencia cultural de la entrada musical. Por ejemplo, en la música occidental, la melodía y el bajo influyen en la identidad de la pieza, con el núcleo formado por la melodía. Al distinguir las respuestas de frecuencia de la melodía y el bajo, se puede estimar una frecuencia fundamental y filtrarla para su distinción. [ 17 ] La detección de acordes se puede implementar a través del reconocimiento de patrones, extrayendo características de bajo nivel que describen el contenido armónico. [ 18 ] Las técnicas utilizadas en el análisis de escenas musicales también se pueden aplicar al reconocimiento de voz y otros sonidos ambientales. [ 19 ] Los trabajos futuros incluyen una integración descendente del procesamiento de señales de audio , como un sistema de seguimiento de ritmos en tiempo real y la expansión más allá del ámbito del procesamiento de señales con la incorporación de la psicología y la fisiología auditivas. [ 20 ]

Modelado perceptivo neuronal

Si bien muchos modelos consideran la señal de audio como una combinación compleja de diferentes frecuencias, modelar el sistema auditivo también puede requerir considerar los componentes neuronales. Al adoptar un proceso holístico, donde un flujo (de sonidos basados ​​en características) corresponde a la actividad neuronal distribuida en muchas áreas del cerebro, la percepción del sonido podría ser mapeada y modelada. Se han propuesto dos soluciones diferentes para la vinculación de la percepción del audio y el área en el cerebro. Los modelos de codificación jerárquica modelan muchas células para codificar todas las combinaciones posibles de características y objetos en la escena auditiva. [ 21 ] [ 22 ] La correlación temporal u oscilatoria aborda el problema de la vinculación al centrarse en la sincronía y la desincronía entre las oscilaciones neuronales para codificar el estado de vinculación entre las características auditivas. [ 1 ] Estas dos soluciones son muy similares a la controversia entre la codificación de lugar y la codificación temporal. Al basarse en el modelado de componentes neuronales, otro fenómeno de ASA entra en juego con los sistemas CASA: el alcance del modelado de mecanismos neuronales. Los estudios de los sistemas CASA han implicado la modelización de algunos mecanismos conocidos, como la naturaleza de paso de banda del filtrado coclear y los patrones aleatorios de activación del nervio auditivo; sin embargo, estos modelos pueden no conducir al descubrimiento de nuevos mecanismos, sino más bien a una comprensión del propósito de los mecanismos conocidos. [ 23 ]

Véase también

Lecturas adicionales

DF Rosenthal y HG Okuno (1998) Análisis computacional de escenas auditivas. Mahwah, NJ: Lawrence Erlbaum

Referencias

  1. 1 2 3 4 5 6 7 8 9 10 11 12 13 Wang, DL y Brown, GJ (Eds.) (2006). Análisis computacional de escenas auditivas: Principios, algoritmos y aplicaciones . IEEE Press/Wiley-Interscience
  2. Warren, R. (1999). Percepción auditiva: un nuevo análisis y síntesis . Nueva York: Cambridge University Press.
  3. Wiener, F. (1947), "Sobre la difracción de una onda progresiva por la cabeza humana". Journal of the Acoustical Society of America , 19 , 143-146 .
  4. Goll, J., Kim, L. (2012), "Deterioro del análisis de escenas auditivas en la enfermedad de Alzheimer", Brain 135 (1) , 190 200.
  5. Meddis, R., Hewitt, M., Shackleton, T. (1990). "Detalles de implementación de un modelo computacional de la sinapsis entre la célula ciliada interna y el nervio auditivo". Journal of the Acoustical Society of America 87(4) 1813 1816.
  6. Jeffress, LA (1948). "Una teoría del lugar de la localización del sonido". Journal of Comparative and Physiological Psychology , 41 35 39.
  7. Yin, T., Chan, J. (1990). "Sensibilidad temporal interaural en la oliva superior medial del gato" Journal Neurophysiology , 64(2) 465 488.
  8. Moore, B. (2003). Introducción a la psicología de la audición (5.ª ed.). Academic Press, Londres.
  9. Ellis, D (1996). "Análisis computacional de escenas auditivas basado en predicados". Tesis doctoral, Departamento de Ingeniería Eléctrica y Ciencias de la Computación del MIT.
  10. Li, P., Guan, Y. (2010). "Separación de voz monoaural basada en MASVQ y CASA para un reconocimiento de voz robusto" Computer Speech and Language , 24 , 30 44.
  11. Bodden, M. (1993). "Modelado de la ubicación de las fuentes sonoras humanas y el efecto cóctel" Acta Acustica 1 43 55.
  12. Lyon, R. (1983). "Un modelo computacional de localizaciones y separación binaural". Actas de la Conferencia Internacional sobre Acústica, Habla y Procesamiento de Señales 1148 1151.
  13. Von der Malsburg, C., Schneider, W. (1986). "Un procesador de cóctel neuronal". Cibernética biológica 54 29 40.
  14. Wang, D. (1994). "Segregación de flujos auditivos basada en correlación oscilatoria". Actas del Taller Internacional IEEE sobre Redes Neuronales para el Procesamiento de Señales , 624 632.
  15. Wang, D. (1996), "Segregación auditiva primitiva basada en la correlación oscilatoria". Cognitive Science 20 , 409-456 .
  16. Bregman, A (1995). "Restricciones en los modelos computacionales de análisis de escenas auditivas derivados de la percepción humana". The Journal of the Acoustical Society of Japan (E) , 16(3) , 133 136.
  17. Goto, M. (2004). "Un sistema de descripción de escenas musicales en tiempo real: estimación de F0 predominante para la detección de melodías y líneas de bajo en señales de audio del mundo real". Speech Communication , 43 , 311-329 .
  18. Zbigniew, R., Wieczorkowska, A. (2010). "Avances en la recuperación de información musical". Estudios en inteligencia computacional , 274 , 119-142.
  19. Masuda-Katsuse, I (2001). "Un nuevo método para el reconocimiento de voz en presencia de ruido no estacionario, impredecible y de alto nivel". Actas de Eurospeech , 1119 1122.
  20. Goto, M (2001). "Un sistema de seguimiento de ritmos en tiempo real basado en audio para música con o sin sonidos de batería". Journal of New Music Research , 30(2) : 159 171.
  21. deCharms, R., Merzenich, M, (1996). "Representación cortical primaria de los sonidos mediante la coordinación de la sincronización del potencial de acción". Nature , 381 , 610–613 .
  22. Wang, D. (2005). "La dimensión temporal del análisis de escenas". IEEE Transactions on Neural Networks , 16(6) , 1401 1426.
  23. Bregman, A. (1990). Análisis de escenas auditivas . Cambridge: MIT Press.