El reconocimiento audiovisual del habla ( AVSR , por sus siglas en inglés) es una técnica que utiliza las capacidades de procesamiento de imágenes en la lectura de labios para ayudar a los sistemas de reconocimiento del habla a reconocer fonemas indeterministas o a dar preponderancia entre decisiones de probabilidad cercana.
Cada sistema de reconocimiento de labios y voz funciona por separado, y luego sus resultados se combinan en la etapa de fusión de características . Como su nombre lo indica, tiene dos partes. La primera es la parte de audio y la segunda es la parte visual. En la parte de audio, usamos características como el espectrograma log-mel, MFCC, etc., de las muestras de audio sin procesar y construimos un modelo para obtener un vector de características a partir de él. Para la parte visual, generalmente usamos alguna variante de red neuronal convolucional para comprimir la imagen en un vector de características; luego, concatenamos estos dos vectores (audio y visual) e intentamos predecir el objeto objetivo.
Enlaces externos
- IBM Research - Tecnologías de voz audiovisual
- Buscando escuchar en una fiesta de cóctel
- Blog de IA de Google
- Lingüística computacional
- Reconocimiento de voz
- Aplicaciones de la visión por computadora
- Interacción multimodal
- Esbozos de inteligencia artificial
- Fragmentos de lingüística computacional