Articulo de referencia

Reconocimiento de voz audiovisual

El reconocimiento audiovisual del habla ( AVSR , por sus siglas en inglés) es una técnica que utiliza las capacidades de procesamiento de imágenes en la lectura de labios para a...

El reconocimiento audiovisual del habla ( AVSR , por sus siglas en inglés) es una técnica que utiliza las capacidades de procesamiento de imágenes en la lectura de labios para ayudar a los sistemas de reconocimiento del habla a reconocer fonemas indeterministas o a dar preponderancia entre decisiones de probabilidad cercana.

Cada sistema de reconocimiento de labios y voz funciona por separado, y luego sus resultados se combinan en la etapa de fusión de características . Como su nombre lo indica, tiene dos partes. La primera es la parte de audio y la segunda es la parte visual. En la parte de audio, usamos características como el espectrograma log-mel, MFCC, etc., de las muestras de audio sin procesar y construimos un modelo para obtener un vector de características a partir de él. Para la parte visual, generalmente usamos alguna variante de red neuronal convolucional para comprimir la imagen en un vector de características; luego, concatenamos estos dos vectores (audio y visual) e intentamos predecir el objeto objetivo.

  • IBM Research - Tecnologías de voz audiovisual
  • Buscando escuchar en una fiesta de cóctel
  • Blog de IA de Google

Obtenido de " https://en.wikipedia.org/w/index.php?title=Audio-visual_speech_recognition&oldid=1361128052 "