Articulo de referencia

Sistema de diálogo hablado

Un sistema de diálogo hablado ( SDS ) es un sistema informático capaz de conversar con un ser humano mediante la voz. Cuenta con dos componentes esenciales que no existen en un ...

Un sistema de diálogo hablado ( SDS ) es un sistema informático capaz de conversar con un ser humano mediante la voz. Cuenta con dos componentes esenciales que no existen en un sistema de diálogo escrito : un reconocedor de voz y un módulo de conversión de texto a voz (los sistemas de diálogo escrito suelen utilizar otros sistemas de entrada proporcionados por el sistema operativo). Se diferencia además de los sistemas de voz de comando y control , que pueden responder a las solicitudes pero no intentan mantener la continuidad a lo largo del tiempo.

Componentes

  • Un reconocedor automático de voz (ASR) decodifica el habla y la convierte en texto. Se pueden configurar reconocedores específicos para cada dominio, diseñados para un lenguaje concreto de una aplicación determinada. Un reconocedor en la nube será adecuado para dominios que no dependan de vocabularios muy específicos.
  • La comprensión del lenguaje natural transforma el reconocimiento en una estructura conceptual que puede guiar el comportamiento del sistema. Algunos enfoques combinan el procesamiento del reconocimiento y la comprensión, pero se consideran menos flexibles, ya que la interpretación debe codificarse en la gramática.
  • El gestor de diálogo controla el comportamiento secuencial. Un sistema de diálogo sencillo puede formular preguntas al usuario y actuar en función de la respuesta. Estos sistemas de diálogo dirigido utilizan una estructura jerárquica para el control; los sistemas basados ​​en marcos (o formularios) permiten cierta iniciativa del usuario y se adaptan a diferentes estilos de interacción. Los gestores de diálogo más sofisticados incorporan mecanismos para resolver malentendidos y aclarar dudas.
  • El razonador de dominio, o simplemente el back-end, utiliza una base de conocimiento para recuperar información y ayuda a formular las respuestas del sistema. En sistemas sencillos, esta base de conocimiento puede consultarse mediante la información recopilada a través del diálogo. El razonador de dominio, junto con el gestor de diálogo, mantiene el contexto de la interacción y permite que el sistema refleje algunas habilidades conversacionales humanas (por ejemplo, mediante anáforas).
  • La generación de respuestas es similar a la generación de lenguaje natural basada en texto , pero tiene en cuenta las necesidades de la comunicación oral. Esto puede incluir el uso de construcciones gramaticales más simples, la gestión de la cantidad de información en cada enunciado de salida y la introducción de marcadores prosódicos para ayudar al participante humano a asimilar la información con mayor facilidad. Un diseño de sistema completo también incorporará elementos de sincronización léxica para incentivar al usuario a favorecer ciertas formas de hablar, lo que a su vez puede mejorar el rendimiento del reconocimiento.
  • La síntesis de voz (TTS) convierte una frase en voz. Según la aplicación, la TTS puede basarse en la concatenación de material pregrabado producido por profesionales de la voz. En aplicaciones más complejas, la TTS utiliza técnicas más flexibles que admiten vocabularios extensos y permiten al desarrollador controlar el carácter ("personalidad") del sistema.

Variedades de sistemas

Los sistemas de diálogo hablado varían en complejidad. Los sistemas de diálogo dirigido son muy sencillos y requieren que el desarrollador cree un grafo (normalmente un árbol) que gestione la tarea, pero que puede no corresponder a las necesidades del usuario. Los sistemas de acceso a la información, generalmente basados ​​en formularios, ofrecen cierta flexibilidad a los usuarios (por ejemplo, en el orden en que se especifican las restricciones de recuperación o en el uso de restricciones opcionales), pero sus capacidades son limitadas. Los sistemas de diálogo para la resolución de problemas permiten a los usuarios participar en diversas actividades, como el acceso a la información, la elaboración de planes y su posible ejecución.

Algunos ejemplos de sistemas incluyen:

  • Acceso a la información: El tiempo, horarios de trenes, cotizaciones bursátiles, información telefónica.
  • Transaccionales: consultas sobre tarjetas de crédito y cuentas bancarias; compra de entradas.
  • Mantenimiento: Soporte técnico que incluye acceso a la documentación y pruebas de diagnóstico.
  • Clases particulares: Para la enseñanza, por ejemplo de física o matemáticas, y el aprendizaje de idiomas.
  • Entretenimiento y charla

Historia

Entre los pioneros en sistemas de diálogo se encuentran empresas como AT&T (con su sistema de reconocimiento de voz en los años setenta) y los laboratorios CSELT , que lideraron algunos proyectos de investigación europeos durante los años ochenta (por ejemplo, SUNDIAL) tras la finalización del proyecto DARPA en Estados Unidos.

Referencias

El campo de los sistemas de diálogo hablado es bastante amplio e incluye investigación (presentada en conferencias científicas como SIGdial e Interspeech ) y un gran sector industrial (con sus propias reuniones como SpeechTek y AVIOS ).

Las siguientes opciones podrían servir como buenas introducciones técnicas:

  • Michael F. McTear, Tecnología de Diálogo Hablado
  • Icono de acceso abiertoGabriel Skantze, Manejo de errores en sistemas de diálogo hablado , 2007: capítulo 2, Sistemas de diálogo hablado .
  • Pirani, Giancarlo, ed. Algoritmos y arquitecturas avanzadas para la comprensión del habla. Vol. 1. Springer Science & Business Media, 2013. ISBN 978-3-540-53402-0