El reconocimiento de voz ( reconocimiento automático de voz ( ASR ), reconocimiento de voz por computadora o conversión de voz a texto ( STT )) es un subcampo de la lingüística computacional que se ocupa de los métodos y tecnologías que traducen el lenguaje hablado a texto u otras formas interpretables. [ 1 ]
Las aplicaciones de reconocimiento de voz incluyen interfaces de usuario de voz , donde el usuario habla a un dispositivo que "escucha" y procesa el audio. Las aplicaciones de voz más comunes incluyen la interpretación de comandos para llamadas, el enrutamiento de llamadas, la domótica y el control de aeronaves. Estas aplicaciones se denominan entrada de voz directa . Las aplicaciones de productividad incluyen la búsqueda de grabaciones de audio, la creación de transcripciones y el dictado.
El reconocimiento de voz se puede utilizar para analizar las características del hablante, como la identificación del idioma nativo mediante la evaluación de la pronunciación . [ 2 ]
El reconocimiento de voz [ 3 ] [ 4 ] [ 5 ] ( identificación del hablante ) [ 6 ] [ 7 ] [ 8 ] se refiere a la identificación del hablante, en lugar del contenido del discurso. Reconocer al hablante puede simplificar la tarea de traducir el habla en sistemas entrenados con la voz de una persona específica. También puede utilizarse para autenticar al hablante como parte de un proceso de seguridad.
Historia
Las aplicaciones de reconocimiento de voz se desarrollaron a lo largo de muchas décadas, y el progreso se aceleró gracias a los avances en el aprendizaje profundo y el uso de macrodatos . [ 9 ] Estos avances se reflejan en un aumento de las publicaciones académicas, [ 10 ] y una mayor adopción de los sistemas. [ 11 ]
Las áreas clave de mejora incluyen el tamaño del vocabulario, un reconocimiento más preciso de hablantes desconocidos (independencia del hablante) y una mayor velocidad de procesamiento.
Antes de 1970
- 1952 – Los investigadores de Bell Labs , Stephen Balashek, [ 12 ] R. Biddulph y KH Davis, construyeron Audrey [ 13 ] para el reconocimiento de dígitos de un solo hablante. Su sistema localizaba los formantes en el espectro de potencia de cada enunciado. [ 14 ]
- 1960 – Gunnar Fant desarrolló y publicó el modelo fuente-filtro de producción del habla. [ 15 ]
- 1962 – El reconocimiento de voz de la máquina "Shoebox" de IBM , capaz de reconocer 16 palabras, debutó en la Feria Mundial de 1962. [ 16 ]
- 1966 – Fumitada Itakura, de la Universidad de Nagoya, y Shuzo Saito, de Nippon Telegraph and Telephone , propusieron la codificación predictiva lineal , un método de codificación de voz . [ 17 ]
- 1969 – La financiación de Bell Labs se detuvo durante varios años después de que el ingeniero jefe de la compañía, John R. Pierce , escribiera una carta abierta criticando la investigación sobre el reconocimiento de voz. [ 18 ] Esta falta de financiación duró hasta que Pierce se jubiló y James L. Flanagan asumió el cargo.
Raj Reddy fue la primera persona en trabajar en el reconocimiento continuo del habla, [ 19 ] como estudiante de posgrado en la Universidad de Stanford a finales de la década de 1960. Los sistemas anteriores requerían que los usuarios hicieran una pausa después de cada palabra. El sistema de Reddy emitía comandos hablados para jugar al ajedrez .
Por esta época, investigadores soviéticos inventaron el algoritmo de alineación temporal dinámica (DTW) [ 20 ] y lo utilizaron para crear un reconocedor capaz de operar con un vocabulario de 200 palabras. [ 21 ] DTW procesaba el habla dividiéndola en tramas cortas (por ejemplo, segmentos de 10 ms) y tratando cada trama como una unidad. Sin embargo, la independencia del hablante seguía sin resolverse.
1970–1990
- 1971 – DARPA financió un proyecto de investigación de cinco años sobre reconocimiento de voz, Speech Understanding Research, con el objetivo de lograr un tamaño mínimo de vocabulario de 1000 palabras. El proyecto consideraba la comprensión del habla como clave para avanzar en el reconocimiento de voz, lo cual fue posteriormente refutado. [ 22 ] Participaron BBN , IBM, Carnegie Mellon (CMU) y el Instituto de Investigación de Stanford . [ 23 ] [ 24 ]
- 1972 – El grupo de Acústica, Habla y Procesamiento de Señales del IEEE celebró una conferencia en Newton, Massachusetts.
- 1976 – Se celebró en Filadelfia la primera ICASSP , que se convirtió en un importante foro para la publicación sobre reconocimiento de voz. [ 25 ]
A finales de la década de 1960, Leonard Baum desarrolló las matemáticas de las cadenas de Markov en el Instituto de Análisis de Defensa . Una década más tarde, en la CMU, los estudiantes de Raj Reddy, James Baker y Janet M. Baker, comenzaron a utilizar el modelo oculto de Markov (HMM) para el reconocimiento de voz. [ 26 ] James Baker había aprendido sobre los HMM mientras estaba en el Instituto de Análisis de Defensa . [ 27 ] Los HMM permitieron a los investigadores combinar fuentes de conocimiento, como acústica , lenguaje y sintaxis , en un modelo probabilístico unificado.
A mediados de la década de 1980, el equipo de Fred Jelinek en IBM creó una máquina de escribir activada por voz llamada Tangora, que podía manejar un vocabulario de 20 000 palabras. [ 28 ] El enfoque estadístico de Jelinek puso menos énfasis en emular los procesos del cerebro humano en favor del modelado estadístico. (El grupo de Jelinek descubrió de forma independiente la aplicación de los HMM al habla. [ 27 ] ) Esto fue controvertido entre los lingüistas, ya que los HMM son demasiado simplistas para dar cuenta de muchas características de los lenguajes humanos. [ 29 ] Sin embargo, el HMM demostró ser una forma muy útil de modelar el habla y reemplazó a la deformación temporal dinámica como el algoritmo dominante de reconocimiento de voz en la década de 1980. [ 30 ] [ 31 ]
- 1982 – Dragon Systems , fundada por James y Janet M. Baker, [ 32 ] fue uno de los pocos competidores de IBM.
Reconocimiento práctico del habla
En la década de 1980 también se introdujo el modelo de lenguaje n-grama .
- 1987 – El modelo de retroceso permitió que los modelos de lenguaje utilizaran n-gramas de longitud múltiple , y CSELT [ 33 ] utilizó HMM para reconocer idiomas (en software y hardware, por ejemplo, RIPAC ).
Al finalizar el programa DARPA en 1976, la mejor computadora disponible para los investigadores era la PDP-10 con 4 MB de RAM . [ 34 ] Podía tardar hasta 100 minutos en decodificar 30 segundos de voz. [ 35 ]
Productos prácticos incluidos:
- 1984 – se lanzó el Apricot Portable con soporte para hasta 4096 palabras, de las cuales solo 64 podían almacenarse en la RAM a la vez. [ 36 ]
- 1987 – un reconocedor de Kurzweil Applied Intelligence
- 1990 – Dragon Dictate, un producto de consumo lanzado en 1990. [ 37 ] [ 38 ] AT&T implementó el servicio de procesamiento de llamadas por reconocimiento de voz en 1992 para enrutar llamadas telefónicas sin un operador humano. [ 39 ] La tecnología fue desarrollada por Lawrence Rabiner y otros en Bell Labs.
A principios de la década de 1990, el vocabulario del sistema típico de reconocimiento de voz comercial había superado el vocabulario humano promedio. [ 34 ] El exalumno de Reddy, Xuedong Huang , desarrolló el sistema Sphinx-II en CMU. Sphinx-II fue el primero en realizar reconocimiento de voz continuo, independiente del hablante y con un amplio vocabulario, y ganó la evaluación de DARPA de 1992. El manejo del habla continua con un amplio vocabulario fue un hito importante. Huang fundó posteriormente el grupo de reconocimiento de voz en Microsoft en 1993. El alumno de Reddy, Kai-Fu Lee, se unió a Apple, donde, en 1992, ayudó a desarrollar el prototipo de interfaz de voz Casper.
Lernout & Hauspie , una empresa de reconocimiento de voz con sede en Bélgica, adquirió otras compañías, entre ellas Kurzweil Applied Intelligence en 1997 y Dragon Systems en 2000. L&H se utilizó en Windows XP . L&H fue líder del sector hasta que un escándalo contable la destruyó en 2001. La tecnología de voz de L&H fue comprada por ScanSoft, que se convirtió en Nuance en 2005. Apple obtuvo la licencia del software de Nuance para su asistente digital Siri . [ 40 ]
década de 2000
En la década de 2000, DARPA patrocinó dos programas de reconocimiento de voz: Effective Affordable Reusable Speech-to-Text (EARS) en 2002, seguido de Global Autonomous Language Exploitation (GALE) en 2005. Cuatro equipos participaron en EARS: IBM; un equipo liderado por BBN con LIMSI y la Universidad de Pittsburgh ; la Universidad de Cambridge ; y un equipo compuesto por ICSI , SRI y la Universidad de Washington . EARS financió la recopilación del corpus de voz telefónica Switchboard , que contenía 260 horas de conversaciones grabadas de más de 500 hablantes. [ 41 ] El programa GALE se centró en noticias de radiodifusión en árabe y mandarín . El primer esfuerzo de Google en reconocimiento de voz se produjo en 2007 después de reclutar investigadores de Nuance. [ 42 ] Su primer producto, GOOG-411 , fue un servicio de directorio basado en teléfono.
Desde al menos 2006, la Agencia de Seguridad Nacional de EE. UU. ha empleado la detección de palabras clave , lo que permite a los analistas indexar grandes volúmenes de conversaciones grabadas e identificar discursos que contienen palabras clave "interesantes". [ 43 ] Otros programas de investigación gubernamentales se centraron en aplicaciones de inteligencia, como el programa EARS de DARPA y el programa Babel de IARPA .
A principios de la década de 2000, el reconocimiento de voz estaba dominado por modelos ocultos de Markov combinados con redes neuronales artificiales (RNA) de alimentación directa. [ 44 ] Posteriormente, el reconocimiento de voz fue tomado por la memoria a corto y largo plazo (LSTM), una red neuronal recurrente (RNN) publicada por Sepp Hochreiter y Jürgen Schmidhuber en 1997. [ 45 ] Las RNN LSTM evitan el problema del gradiente evanescente y pueden aprender tareas de "aprendizaje muy profundo" [ 46 ] que requieren recuerdos de eventos que ocurrieron miles de pasos de tiempo discretos antes, lo cual es importante para el habla.
Alrededor de 2007, las LSTM entrenadas con Clasificación Temporal Conexionista (CTC) [ 47 ] comenzaron a superar a otras. [ 48 ] En 2015, Google informó una reducción del 49 por ciento en la tasa de error en su reconocimiento de voz mediante LSTM entrenada con CTC. [ 49 ] Los Transformers , un tipo de red neuronal basada únicamente en la atención , se adoptaron en visión artificial [ 50 ] [ 51 ] y modelado del lenguaje, [ 52 ] [ 53 ] y luego en reconocimiento de voz. [ 54 ] [ 55 ] [ 56 ]
Las redes neuronales profundas de alimentación directa (no recurrentes) para el modelado acústico fueron introducidas en 2009 por Geoffrey Hinton y sus estudiantes en la Universidad de Toronto , y por Li Deng [ 57 ] y colegas en Microsoft Research. [ 58 ] [ 59 ] [ 60 ] [ 61 ] En contraste con las mejoras incrementales anteriores, el aprendizaje profundo redujo las tasas de error en un 30%. [ 61 ]
Tanto las formas superficiales como las profundas (p. ej., redes recurrentes) de las ANN se han explorado desde la década de 1980. [ 62 ] [ 63 ] [ 64 ] Sin embargo, estos métodos nunca vencieron la tecnología del modelo de mezcla gaussiana / modelo oculto de Markov (GMM-HMM) de fabricación manual interna no uniforme. [ 65 ] Las dificultades analizadas en la década de 1990 incluyeron la disminución del gradiente [ 66 ] y la débil estructura de correlación temporal. [ 67 ] [ 68 ] Todas estas dificultades combinadas con datos de entrenamiento y potencia de cálculo insuficientes. La mayoría del reconocimiento de voz siguió enfoques de modelado generativo hasta que el aprendizaje profundo se impuso. Hinton et al. y Deng et al. [ 59 ] [ 60 ] [ 69 ] [ 70 ]
década de 2010
A principios de la década de 2010, el reconocimiento de voz [ 71 ] [ 72 ] [ 73 ] se diferenció del reconocimiento de locutor, y la independencia del locutor se consideró un gran avance. Hasta entonces, los sistemas requerían un período de "entrenamiento" para cada voz. [ 16 ]
En 2017, los investigadores de Microsoft alcanzaron el hito de la paridad humana en la transcripción de habla conversacional en la tarea Switchboard, ampliamente utilizada como referencia. Se emplearon múltiples modelos de aprendizaje profundo para mejorar la precisión. Se informó que la tasa de error era tan baja como la de cuatro transcriptores humanos profesionales trabajando juntos en la misma prueba. [ 74 ]
Modelos, métodos y algoritmos
Tanto el modelado acústico como el modelado del lenguaje son componentes importantes de los algoritmos de reconocimiento de voz basados en estadísticas. Los modelos ocultos de Markov (HMM) se utilizan ampliamente en muchos sistemas. El modelado del lenguaje también se emplea en otras aplicaciones de procesamiento del lenguaje natural, como la clasificación de documentos o la traducción automática estadística .
modelos ocultos de Markov
Los sistemas de reconocimiento de voz se basan en modelos ocultos de Markov (HMM). Estos son modelos estadísticos que generan una secuencia de símbolos o cantidades. Los HMM se utilizan en el reconocimiento de voz porque una señal de voz puede considerarse una señal estacionaria por partes o una señal estacionaria de corta duración. En una escala de tiempo corta (por ejemplo, 10 milisegundos), el habla puede aproximarse como un proceso estacionario . El habla puede considerarse un modelo de Markov para muchos fines estocásticos.
Los HMM son populares porque se pueden entrenar automáticamente y son sencillos y computacionalmente viables. Un HMM genera una secuencia de vectores reales n -dimensionales (donde n es un número entero como 10), generando uno cada 10 milisegundos. Los vectores consisten en coeficientes cepstrales , obtenidos mediante una transformada de Fourier de una ventana corta de voz y decorrelacionando el espectro mediante una transformada coseno , para luego tomar los primeros coeficientes (los más significativos). El HMM tiende a tener, en cada estado, una distribución estadística que es una mezcla de gaussianas de covarianza diagonal , que dan una probabilidad para cada vector observado. Cada palabra, o (para sistemas de reconocimiento de voz más generales), cada fonema , tiene una distribución de salida diferente; un HMM para una secuencia de palabras o fonemas se crea concatenando los HMM individuales entrenados para cada palabra y fonema por separado.
Los sistemas de reconocimiento de voz utilizan combinaciones de técnicas estándar para mejorar los resultados. Un sistema típico de vocabulario extenso aplica la dependencia del contexto para los fonemas (de modo que los fonemas con diferentes contextos izquierdo y derecho tienen diferentes realizaciones como estados HMM). Utiliza la normalización cepstral para manejar las condiciones del hablante y la grabación. Puede utilizar la normalización de la longitud del tracto vocal (VTLN) para la normalización hombre-mujer y la regresión lineal de máxima verosimilitud (MLLR) para una adaptación más general. Las características utilizan coeficientes delta y delta-delta para capturar la dinámica del habla, y además pueden utilizar el análisis discriminante lineal heterocedástico (HLDA); o pueden utilizar el empalme y la proyección basada en LDA , seguidos de HLDA o una transformación de covarianza semi-atada global (también conocida como transformación lineal de máxima verosimilitud (MLLT)). Muchos sistemas utilizan técnicas de entrenamiento discriminativo que prescinden de un enfoque puramente estadístico para la estimación de parámetros HMM y, en su lugar, optimizan alguna medida relacionada con la clasificación de los datos de entrenamiento. Ejemplos de ello son la información mutua máxima (MMI), el error de clasificación mínimo (MCE) y el error fonético mínimo (MPE).
Reconocimiento de voz basado en alineación temporal dinámica (DTW)
Históricamente, la deformación temporal dinámica se utilizaba para el reconocimiento de voz, pero posteriormente fue reemplazada por los modelos ocultos de Markov (HMM).
La deformación temporal dinámica (DTW) mide la similitud entre dos secuencias que pueden variar en tiempo o velocidad. Por ejemplo, se pueden detectar similitudes en los patrones de marcha, incluso si en un vídeo una persona camina despacio y en otro más rápido, o incluso si se producen aceleraciones y desaceleraciones durante una misma observación. La DTW se ha aplicado a vídeo, audio y gráficos; cualquier dato que pueda transformarse en una representación lineal puede analizarse con esta técnica.
Este método permite procesar el habla a diferentes velocidades. En general, posibilita una correspondencia óptima entre dos secuencias (por ejemplo, series temporales) con ciertas restricciones. Las secuencias se "deforman" de forma no lineal para que coincidan. Este método de alineación de secuencias se utiliza frecuentemente en el contexto de los modelos ocultos de Markov (HMM).
Redes neuronales
Las redes neuronales se volvieron interesantes a finales de la década de 1980 antes de comenzar a dominar en la década de 2010. Las redes neuronales se han utilizado en muchos aspectos del reconocimiento de voz, como la clasificación de fonemas, [ 75 ] la clasificación de fonemas a través de algoritmos evolutivos multiobjetivo, [ 76 ] el reconocimiento de palabras aisladas, [ 77 ] el reconocimiento de voz audiovisual , el reconocimiento de locutor audiovisual y la adaptación del locutor.
Las redes neuronales hacen menos suposiciones explícitas sobre las propiedades estadísticas de las características que los HMM. Cuando se utilizan para estimar las probabilidades de un segmento de habla, las redes neuronales permiten un entrenamiento discriminativo natural y eficiente. Sin embargo, a pesar de su eficacia en la clasificación de unidades de tiempo cortas, como fonemas individuales y palabras aisladas, [ 78 ] las primeras redes neuronales rara vez tuvieron éxito en el reconocimiento continuo debido a su limitada capacidad para modelar dependencias temporales.
Un enfoque fue utilizar redes neuronales para la transformación de características o reducción de dimensionalidad. [ 79 ] Sin embargo, más recientemente, LSTM y redes neuronales recurrentes relacionadas (RNN), [ 45 ] [ 49 ] [ 80 ] [ 81 ] redes neuronales con retardo de tiempo (TDNN), [ 82 ] y transformadores [ 54 ] [ 55 ] [ 56 ] demostraron un rendimiento mejorado.
Redes neuronales profundas de alimentación directa y recurrentes
Los investigadores están explorando las redes neuronales profundas (DNN) y los autoencoders de eliminación de ruido . [ 83 ] Una DNN es un tipo de red neuronal artificial que incluye múltiples capas ocultas entre la entrada y la salida. [ 59 ] Al igual que las redes neuronales más simples, las DNN pueden modelar relaciones complejas y no lineales. Sin embargo, su arquitectura más profunda les permite construir representaciones más sofisticadas que combinan características de capas anteriores. Esto les otorga una poderosa capacidad para aprender y reconocer patrones complejos en datos de voz. [ 84 ]
Un avance importante en el uso de DNN para el reconocimiento de voz con vocabulario extenso se produjo en 2010. En una colaboración entre la industria y la academia, los investigadores utilizaron DNN con grandes capas de salida basadas en estados HMM dependientes del contexto, creados mediante árboles de decisión. [ 85 ] [ 86 ] [ 87 ] Este enfoque mejoró significativamente el rendimiento. [ 88 ] [ 89 ] [ 90 ]
Una idea fundamental del aprendizaje profundo es eliminar la necesidad de diseñar manualmente características y, en su lugar, aprender directamente de los datos de entrada. Esto se demostró por primera vez utilizando autoencoders profundos entrenados con espectrogramas sin procesar o características de bancos de filtros lineales. [ 91 ] Estos modelos superaron a las características Mel-Cepstrales tradicionales, que se basan en transformaciones fijas. Más recientemente, los investigadores demostraron que las formas de onda pueden lograr excelentes resultados en el reconocimiento de voz a gran escala. [ 92 ]
Aprendizaje integral
Desde 2014, muchas investigaciones han considerado el ASR "de extremo a extremo". Los enfoques tradicionales basados en la fonética (es decir, todos los modelos basados en HMM ) requerían componentes y entrenamiento separados para la pronunciación, la acústica y el lenguaje . Los modelos de extremo a extremo aprenden de todos los componentes a la vez. Esto simplifica los procesos de entrenamiento e implementación. Por ejemplo, se requiere un modelo de lenguaje n-grama para todos los sistemas basados en HMM, y un modelo de lenguaje n-grama típico de la era de 2025 a menudo ocupa gigabytes de memoria, lo que los hace poco prácticos para implementar en dispositivos móviles. [ 93 ] En consecuencia, los sistemas ASR de Google y Apple ( a partir de 2017) se desplegaban en servidores y requerían una conexión de red para funcionar.
El primer intento de ASR de extremo a extremo fue el sistema basado en Clasificación Temporal Conexionista (CTC) presentado por Alex Graves de Google DeepMind y Navdeep Jaitly de la Universidad de Toronto en 2014. [ 94 ] El modelo consistía en RNN y una capa CTC. Conjuntamente, el modelo RNN-CTC aprende la pronunciación y el modelo acústico, sin embargo, es incapaz de aprender el modelo de lenguaje debido a supuestos de independencia condicional , similar a un HMM. En consecuencia, los modelos CTC pueden aprender directamente a mapear la acústica del habla a caracteres en inglés, pero cometen muchos errores ortográficos comunes y deben depender de un modelo de lenguaje separado para finalizar las transcripciones. Posteriormente, Baidu amplió el trabajo con conjuntos de datos extremadamente grandes y demostró cierto éxito comercial en mandarín e inglés. [ 95 ]
En 2016, la Universidad de Oxford presentó LipNet , [ 96 ] el primer modelo de lectura de labios de extremo a extremo a nivel de oración, que utiliza convoluciones espaciotemporales acopladas con una arquitectura RNN-CTC, superando el rendimiento a nivel humano en un conjunto de datos restringido. [ 97 ] Una arquitectura convolucional -RNN-CTC a gran escala fue presentada en 2018 por Google DeepMind, logrando un rendimiento 6 veces mejor que el de los expertos humanos. [ 98 ] En 2019, Nvidia lanzó dos modelos ASR CNN-CTC, Jasper y QuarzNet, con una tasa de error de palabras (WER) de rendimiento general del 3%. [ 99 ] [ 100 ] De manera similar a otras aplicaciones de aprendizaje profundo, el aprendizaje por transferencia y la adaptación de dominio son estrategias importantes para reutilizar y extender las capacidades de los modelos de aprendizaje profundo, particularmente debido al pequeño tamaño de los corpus disponibles en muchos idiomas y/o dominios específicos. [ 101 ] [ 102 ] [ 103 ]
En 2018, investigadores del MIT Media Lab anunciaron trabajos preliminares sobre AlterEgo, un dispositivo que utiliza electrodos para leer las señales neuromusculares que los usuarios producen al subvocalizar . [ 104 ] Entrenaron una red neuronal convolucional para traducir las señales de los electrodos en palabras. [ 105 ]
Modelos basados en la atención
Los modelos ASR basados en atención fueron presentados por Chan et al. de la Universidad Carnegie Mellon y Google Brain , y Bahdanau et al. de la Universidad de Montreal en 2016. [ 106 ] [ 107 ] El modelo llamado "Listen, Attend and Spell" (LAS), literalmente "escucha" la señal acústica, presta "atención" a todas las partes de la señal y "deletrea" la transcripción carácter por carácter. A diferencia de los modelos basados en CTC, los modelos basados en atención requieren supuestos de independencia condicional y pueden aprender directamente todos los componentes de un reconocedor de voz. Esto significa que durante la implementación, no se requiere un modelo de lenguaje a priori , lo que lo hace menos exigente para aplicaciones con memoria limitada.
Los modelos basados en atención superaron inmediatamente a los modelos CTC (con o sin un modelo de lenguaje externo) y continuaron mejorando. [ 108 ] La descomposición de secuencia latente (LSD) fue propuesta por la Universidad Carnegie Mellon, el MIT y Google Brain para emitir directamente unidades de subpalabras que son más naturales que los caracteres ingleses. [ 109 ] La Universidad de Oxford y Google DeepMind extendieron LAS a "Watch, Listen, Attend and Spell" (WLAS) para manejar la lectura de labios y superaron el rendimiento a nivel humano. [ 110 ]
Aplicaciones
Sistemas dentro del automóvil
Los comandos de voz pueden utilizarse para iniciar llamadas telefónicas, seleccionar emisoras de radio o reproducir música. Las capacidades de reconocimiento de voz varían según la marca y el modelo del coche. Algunos modelos ofrecen reconocimiento de voz en lenguaje natural, lo que permite al conductor utilizar frases completas y expresiones comunes en un estilo conversacional. Con estos sistemas, no se requieren comandos fijos. [ 111 ]
Educación
La evaluación automática de la pronunciación es el uso del reconocimiento de voz para verificar la corrección del habla, [ 112 ] a diferencia de la evaluación realizada por una persona. [ 113 ] También llamada verificación del habla, evaluación de la pronunciación y puntuación de la pronunciación, la principal aplicación de esta tecnología es la enseñanza de la pronunciación asistida por computadora (CAPT) cuando se combina con la instrucción asistida por computadora para el aprendizaje de idiomas asistido por computadora (CALL), la remediación del habla o la reducción del acento . La evaluación de la pronunciación no determina el habla desconocida (como en el dictado o la transcripción automática ) sino que compara el habla con un modelo de referencia para las palabras pronunciadas, [ 114 ] [ 115 ] a veces con prosodia intrascendente como la entonación , el tono , el tempo , el ritmo y el acento . [ 116 ] La evaluación de la pronunciación también se utiliza en la tutoría de lectura , por ejemplo en productos como Microsoft Teams [ 117 ] y Amira Learning. [ 118 ] La evaluación de la pronunciación también puede utilizarse para ayudar a diagnosticar y tratar trastornos del habla como la apraxia . [ 119 ]
Evaluar la inteligibilidad es esencial para evitar imprecisiones debidas al sesgo del acento, especialmente en evaluaciones de alto riesgo, [ 120 ] [ 121 ] [ 122 ] a partir de palabras con múltiples pronunciaciones correctas, [ 123 ] y a partir de errores de codificación de fonemas en diccionarios de pronunciación digitales. [ 124 ] En 2022, los investigadores descubrieron que algunos sistemas de voz a texto más recientes, basados en el aprendizaje por refuerzo de extremo a extremo para mapear señales de audio directamente en palabras, producen puntuaciones de confianza de palabras y frases estrechamente correlacionadas con la inteligibilidad del oyente. [ 125 ] En los criterios de evaluación del Marco Común Europeo de Referencia para las Lenguas (MCER) para el "control fonológico general", la inteligibilidad tiene más peso que la pronunciación formalmente correcta en todos los niveles. [ 126 ]
Cuidado de la salud
Documentación médica
En el sector sanitario, el reconocimiento de voz puede implementarse en los procesos de documentación médica, tanto en la fase inicial como en la final. En el reconocimiento de voz inicial, el profesional sanitario dicta a un motor de reconocimiento de voz, las palabras se muestran a medida que se reconocen y el hablante es responsable de editar y aprobar el documento. En el reconocimiento de voz diferido, el profesional sanitario habla a un sistema de dictado digital , la voz se procesa mediante un sistema de reconocimiento de voz y se envía un borrador del documento junto con el archivo de audio a un editor, quien edita y finaliza el borrador y el informe final.
Un problema importante es que la Ley de Recuperación y Reinversión Estadounidense de 2009 ( ARRA ) proporciona importantes beneficios financieros a los médicos que utilizan un registro electrónico de salud (EHR) que cumple con los estándares de "Uso Significativo". Estos estándares exigen que el EHR mantenga una cantidad sustancial de datos. El uso del reconocimiento de voz se adapta mejor a la generación de texto narrativo, como parte de una interpretación radiológica/patológica, una nota de progreso o un resumen de alta; las ventajas ergonómicas de usar el reconocimiento de voz para ingresar datos discretos estructurados (por ejemplo, valores numéricos o códigos de una lista o un vocabulario controlado ) son relativamente mínimas para las personas videntes que pueden usar un teclado y un ratón.
Un problema más significativo es que la mayoría de los sistemas de historia clínica electrónica (HCE) no se han adaptado específicamente para aprovechar las capacidades de reconocimiento de voz. Gran parte de la interacción del médico con la HCE implica la navegación a través de la interfaz de usuario, que depende en gran medida del teclado y el ratón; la navegación por voz ofrece solo modestos beneficios ergonómicos. Por el contrario, muchos sistemas altamente personalizados para dictado radiológico o patológico implementan "macros" de voz, donde el uso de ciertas frases, por ejemplo, "informe normal", rellena automáticamente una gran cantidad de valores predeterminados o genera texto predefinido, que varía según el tipo de examen, por ejemplo, una radiografía de tórax frente a una serie de contraste gastrointestinal para un sistema de radiología.
Uso terapéutico
El uso prolongado de software de reconocimiento de voz junto con procesadores de texto ha demostrado beneficios para el fortalecimiento de la memoria a corto plazo en pacientes con MAV cerebral tratados mediante resección . Es necesario realizar más investigaciones para determinar los beneficios cognitivos en personas cuyas MAV han sido tratadas con técnicas radiológicas. [ 127 ]
Militar
Aeronave
Se han dedicado importantes esfuerzos a la prueba y evaluación del reconocimiento de voz en aviones de combate . Cabe destacar el programa estadounidense de reconocimiento de voz para el avión AFTI / F-16 ( F-16 Vista ), el programa francés para el avión Mirage y los programas británicos para diversas plataformas aéreas. En estos programas, los sistemas de reconocimiento de voz se han utilizado con éxito, con aplicaciones que incluyen la configuración de frecuencias de radio, el control del sistema de piloto automático, la configuración de coordenadas de rumbo y parámetros de lanzamiento de armas, y el control de la pantalla de vuelo.
En 2004, trabajando con pilotos suecos que volaban el JAS-39 Gripen, Englund informó que el reconocimiento se deterioraba con el aumento de las cargas g . El estudio concluyó que la adaptación mejoró notablemente los resultados en todos los casos y que la introducción de modelos de respiración mejoró significativamente las puntuaciones de reconocimiento. Contrariamente a lo que cabría esperar, no se encontraron efectos del inglés deficiente de los hablantes. El habla espontánea causó problemas al reconocedor, como era de esperar. Por lo tanto, cabría esperar que un vocabulario restringido y, sobre todo, una sintaxis adecuada, mejoraran sustancialmente la precisión del reconocimiento. [ 128 ]
El Eurofighter Typhoon emplea un sistema dependiente del altavoz, que requiere que cada piloto cree una plantilla. El sistema no se utiliza para tareas críticas de seguridad o de armamento, como el lanzamiento de armas o el descenso del tren de aterrizaje, pero sí para muchas funciones de la cabina. Los comandos de voz se confirman mediante retroalimentación visual y/o auditiva. El sistema se considera una gran ventaja en la reducción de la carga de trabajo del piloto [ 129 ] y le permite asignar objetivos con dos comandos de voz o a un compañero de ala con solo cinco comandos [ 130 ] .
Se están probando sistemas independientes del hablante para el F-35 Lightning II (JSF) y el avión de entrenamiento avanzado Alenia Aermacchi M-346 Master . Estos sistemas han logrado índices de precisión de palabras superiores al 98 %. [ 131 ] [ 132 ]
Helicópteros
Los problemas para lograr una alta precisión de reconocimiento bajo estrés y ruido son particularmente relevantes en el entorno de los helicópteros , así como en el de los aviones de combate. El problema del ruido acústico es, de hecho, más grave en el entorno de los helicópteros, debido a los altos niveles de ruido y a que los pilotos de helicópteros, en general, no usan máscara facial , lo que reduciría el ruido acústico en el micrófono . Se han llevado a cabo importantes programas de prueba y evaluación, en particular por la Actividad de Investigación y Desarrollo de Aviónica del Ejército de los EE. UU . (AVRADA) y por el Establecimiento Aeroespacial Real ( RAE ) en el Reino Unido. El trabajo realizado en Francia incluyó el reconocimiento de voz en el helicóptero Puma . Las aplicaciones de voz incluyen el control de radios de comunicación, sistemas de navegación y un sistema automatizado de transferencia de objetivos.
El principal problema en el ámbito de la voz es su impacto en la eficacia de los pilotos. Se han reportado resultados alentadores en las pruebas de AVRADA, aunque estas representan únicamente una demostración de viabilidad en un entorno de prueba. Aún queda mucho por hacer, tanto en el reconocimiento de voz como en la tecnología de voz en general , para lograr mejoras de rendimiento consistentes en entornos operativos.
Control de tráfico aéreo
La formación de controladores de tráfico aéreo (ATC) representa una excelente aplicación para los sistemas de reconocimiento de voz. Muchos sistemas de formación de ATC requieren actualmente que un instructor actúe como "pseudopiloto", manteniendo un diálogo por voz con el controlador en formación, lo que simula la conversación que el controlador tendría con pilotos reales. Las técnicas de reconocimiento y síntesis de voz ofrecen la posibilidad de eliminar la necesidad de que una persona actúe como pseudopiloto, reduciendo así el personal de formación y de apoyo.
En teoría, las tareas de los controladores aéreos se caracterizan por un habla altamente estructurada como principal fuente de información, lo que reduce la dificultad del reconocimiento de voz. En la práctica, esto rara vez sucede. El documento 7110.65 de la FAA detalla las frases que deben usar los controladores de tráfico aéreo. Si bien este documento ofrece menos de 150 ejemplos de dichas frases, el número de frases compatibles con los sistemas de reconocimiento de voz de algunos proveedores de simuladores supera las 500 000.
La USAF, la USMC, el Ejército de los EE. UU., la Armada de los EE. UU. y la FAA, así como organizaciones internacionales de entrenamiento de control de tráfico aéreo como la Real Fuerza Aérea Australiana y las autoridades de aviación civil de Italia, Brasil y Canadá, utilizan simuladores de control de tráfico aéreo con reconocimiento de voz. [ 133 ]
Personas con discapacidad
Los programas de reconocimiento de voz pueden brindar muchos beneficios a las personas con discapacidades. Para las personas sordas o con discapacidad auditiva , el software de reconocimiento de voz puede utilizarse para generar subtítulos de conversaciones. [ 134 ] Además, las personas ciegas (véase ceguera y educación ) o con baja visión pueden beneficiarse al escuchar contenido textual, así como obtener mayor funcionalidad de una computadora al emitir comandos con su voz. [ 135 ]
El uso de software de reconocimiento de voz, junto con una grabadora de audio digital y un ordenador personal con un programa de procesamiento de textos, ha demostrado ser útil para restaurar la capacidad de memoria a corto plazo dañada en personas que han sufrido un derrame cerebral o se han sometido a una craneotomía .
El reconocimiento de voz ha demostrado ser muy útil para quienes tienen dificultades para usar las manos debido a causas que van desde lesiones leves por esfuerzo repetitivo hasta discapacidades que impiden el uso de dispositivos de entrada de computadora convencionales. Las personas con discapacidades físicas pueden usar comandos de voz y transcripción para navegar por dispositivos electrónicos sin usar las manos. [ 135 ] De hecho, las personas que desarrollaron RSI por el uso del teclado se convirtieron en un mercado temprano y urgente para el reconocimiento de voz. [ 136 ] [ 137 ] El reconocimiento de voz se utiliza en la telefonía para sordos , como el correo de voz a texto, los servicios de retransmisión y el teléfono con subtítulos . Las personas con discapacidades de aprendizaje que tienen dificultades con la comunicación del pensamiento al papel pueden beneficiarse del software, pero la falibilidad del producto sigue siendo una consideración importante para muchos. [ 138 ] Además, la tecnología de voz a texto solo es una ayuda eficaz para las personas con discapacidades intelectuales si se les proporciona la capacitación y los recursos adecuados (por ejemplo, en el entorno del aula). [ 139 ]
Este tipo de tecnología puede ayudar a quienes tienen dislexia y otras dificultades de aprendizaje . Se ha descubierto que la conversión de voz a texto mejora la calidad de la escritura [ 140 ] de los estudiantes con dificultades de aprendizaje. En comparación con las muestras de escritura a mano, se encontró que los estudiantes con dificultades de aprendizaje que usaron la conversión de voz a texto escribían más rápido [ 141 ] [ 142 ] y tenían oraciones más largas y complejas [ 142 ] con menos errores. [ 143 ] Se encontró que la autoestima [ 140 ] de los estudiantes jóvenes con dificultades de aprendizaje aumentaba al usar la conversión de voz a texto debido a la disminución de los niveles de ansiedad [ 144 ] asociados con la escritura. Los estudiantes cometen menos errores al usar el software en comparación con la escritura a mano, lo que les da más confianza en su escritura. Los errores cometidos por el software dificultan su efectividad, ya que las palabras mal escuchadas requieren más tiempo para corregirse. [ 145 ] El hecho de tener que volver atrás y revisar las palabras mal escuchadas ayuda a los estudiantes a ver y corregir sus errores. [ 141 ] Se ha demostrado que esto aumenta las habilidades de reconocimiento de errores para los usuarios. [ 144 ]
Otros dominios
El reconocimiento automático de voz (ASR) es ahora algo habitual en el campo de la telefonía . En los sistemas de telefonía, el ASR se utiliza principalmente en centros de contacto, integrándolo con sistemas IVR .
Su uso se está extendiendo cada vez más en los videojuegos y la simulación por ordenador.
A pesar del alto grado de integración con el procesamiento de textos en la informática personal en general, en el ámbito de la producción de documentos, el reconocimiento automático de voz no ha experimentado el aumento de uso esperado.
La mejora en la velocidad de los procesadores móviles ha hecho posible el reconocimiento de voz en los teléfonos inteligentes . La voz se utiliza principalmente como parte de una interfaz de usuario, para crear comandos de voz predefinidos o personalizados.
- Aeroespacial , por ejemplo, el Mars Polar Lander de la NASA utilizó tecnología de reconocimiento de voz de Sensory, Inc. en el micrófono de Marte del módulo de aterrizaje [ 146 ].
- Subtitulado automático con reconocimiento de voz
- Reconocimiento automático de emociones [ 147 ]
- Listado automático de tomas en producción audiovisual
- Traducción automática
- Descubrimiento electrónico
- Informática manos libres
- Automatización del hogar
- Respuesta de voz interactiva
- Telefonía móvil , incluido el correo electrónico móvil
- Interacción multimodal [ 70 ]
- Subtitulado en tiempo real [ 148 ]
- Robótica
- Seguridad, incluido el uso con otros escáneres biométricos para la autenticación multifactor [ 149 ]
- Conversión de voz a texto
- Telemática , por ejemplo, sistemas de navegación para vehículos.
- Transcripción
- Videojuegos como Tom Clancy's EndWar , Bow-wow Battle y Lifeline.
- Asistente virtual como Siri
Actuación
El rendimiento de los sistemas de reconocimiento de voz se suele evaluar en términos de precisión y velocidad. [ 150 ] [ 151 ] La precisión se suele medir con la tasa de error de palabras (WER), mientras que la velocidad se mide en tiempo transcurrido. Otras medidas de precisión incluyen la tasa de error de una sola palabra (SWER) y la tasa de éxito de comandos (CSR).
El reconocimiento de voz se ve dificultado por muchas propiedades del habla. Las vocalizaciones varían en cuanto a acento, pronunciación, articulación, aspereza, dialecto, nasalidad, tono, volumen y velocidad. El habla se distorsiona por el ruido de fondo, los ecos y las características de la grabación. La precisión del reconocimiento de voz puede variar según lo siguiente: [ 152 ] [ 153 ]
- Tamaño del vocabulario y capacidad de confusión
- Dependencia del hablante frente a independencia
- Habla aislada, discontinua o continua
- Restricciones de tarea y de idioma
- Lectura versus discurso espontáneo
- Condiciones adversas
Exactitud
La precisión del reconocimiento de voz puede variar dependiendo de los siguientes factores:
- Los índices de error aumentan a medida que crece el tamaño del vocabulario:
- Por ejemplo, los 10 dígitos del "cero" al "nueve" se pueden reconocer prácticamente a la perfección, pero los vocabularios de 200, 5000 o 100000 caracteres pueden tener tasas de error del 3%, 7% o 45% respectivamente.
- El vocabulario es difícil de reconocer si contiene letras confusas:
- Por ejemplo, las 26 letras del alfabeto inglés son difíciles de distinguir porque son palabras confusas (sobre todo, el conjunto E: "B, C, D, E, G, P, T, V, Z (cuando "Z" se pronuncia "zee" en lugar de "zed", dependiendo de la región); una tasa de error del 8% se considera buena para este vocabulario. [ 154 ]
- Dependencia versus independencia del hablante:
- Un sistema dependiente del altavoz está diseñado para ser utilizado por un solo altavoz.
- Un sistema independiente del hablante está diseñado para ser utilizado por cualquier hablante (más difícil). [ 155 ]
- Habla aislada, discontinua o continua
- En el habla aislada, se utilizan palabras sueltas, lo que facilita su reconocimiento.
- En el habla discontinua, se utilizan oraciones completas separadas por silencios. El silencio es más fácil de reconocer, de forma similar al habla aislada.
- En el habla continua se utilizan frases pronunciadas de forma natural, que son más difíciles de reconocer.
- Las limitaciones de la tarea y del idioma pueden influir en el reconocimiento.
- La solicitud puede descartar la hipótesis "La manzana es roja".
- Las restricciones pueden ser semánticas; por ejemplo, rechazar "La manzana está enfadada".
- Sintáctico; rechazando "Rojo es manzana el".
- Las restricciones suelen representarse mediante la gramática.
- Discurso leído versus discurso espontáneo
- Cuando una persona lee, generalmente lo hace en un contexto que ha sido preparado previamente.
- Cuando una persona habla espontáneamente, el reconocimiento debe lidiar con disfluencias como "uh" y "um", falsos comienzos, oraciones incompletas, tartamudeo, tos y risas, y un vocabulario limitado.
- Condiciones adversas
- ruido ambiental (por ejemplo, en un coche o una fábrica).
- Distorsiones acústicas (por ejemplo, ecos, acústica de la sala)
El reconocimiento de voz es una tarea de reconocimiento de patrones de varios niveles.
- Las señales acústicas se estructuran en una jerarquía de unidades, por ejemplo, fonemas , palabras, frases y oraciones;
- Cada nivel proporciona restricciones adicionales; por ejemplo, pronunciaciones de palabras conocidas o secuencias de palabras legales, que pueden compensar errores o incertidumbres en un nivel inferior;
Esta jerarquía de restricciones mejora la precisión. Al combinar decisiones probabilísticamente en todos los niveles inferiores y tomar decisiones finales solo en el nivel superior, el reconocimiento de voz se divide en varias fases. Computacionalmente, es un problema en el que un patrón de sonido debe ser reconocido o clasificado en una categoría que represente un significado para un ser humano. Cada señal acústica puede dividirse en subseñales más pequeñas. A medida que la señal de sonido más compleja se divide, se crean diferentes niveles, donde en el nivel superior se encuentran los sonidos complejos formados por sonidos más simples en el nivel inferior, etc. En el nivel más bajo, se aplican reglas simples y más probabilísticas. Estos sonidos se combinan para formar sonidos más complejos en el nivel superior, y un nuevo conjunto de reglas más deterministas predice lo que representa el sonido complejo. El nivel superior de una regla determinista debe determinar el significado de las expresiones complejas. Para ampliar nuestro conocimiento sobre el reconocimiento de voz, debemos tener en cuenta las redes neuronales. Los enfoques de redes neuronales utilizan los siguientes pasos:
- Digitalizar el habla: para el habla telefónica, se capturan 8000 muestras por segundo; [ 156 ]
- Calcular las características del dominio espectral del habla (con la transformada de Fourier); calculadas cada 10 ms, considerando cada sección de 10 ms como un fotograma;
El sonido se produce por la vibración del aire (u otro medio). El sonido crea una onda que tiene dos medidas: amplitud (intensidad) y frecuencia (vibraciones por segundo). [ 157 ] La precisión se puede calcular con la ayuda de la tasa de error de palabras (WER), que se calcula alineando la palabra reconocida y la palabra de referencia mediante alineación dinámica de cadenas. El problema puede surgir al calcular la WER debido a la diferencia entre las longitudes de secuencia de la palabra reconocida y la palabra de referencia.
La fórmula para calcular la tasa de error de palabras (WER) es:
donde s es el número de sustituciones, d es el número de eliminaciones, i es el número de inserciones y n es el número de referencias a palabras. [ 158 ]
Durante el cálculo se utiliza la tasa de reconocimiento de palabras (WRR). La fórmula es:
donde h es el número de palabras reconocidas correctamente:
Seguridad
El reconocimiento de voz puede convertirse en un medio para ataques, robos o activaciones accidentales. Por ejemplo, palabras de activación como "Alexa" pronunciadas en una transmisión de audio o video pueden provocar que dispositivos en hogares y oficinas comiencen a escuchar comandos de voz de forma inapropiada o incluso realicen acciones no deseadas. [ 159 ] Los dispositivos controlados por voz pueden ser accesibles a usuarios no autorizados. Los atacantes pueden acceder a información personal, como calendarios, contenido de la libreta de direcciones, mensajes privados y documentos. También pueden suplantar la identidad del usuario para enviar mensajes o realizar compras en línea.
Se han demostrado dos ataques que utilizan sonidos artificiales. Uno transmite ultrasonidos e intenta enviar comandos sin que las personas lo noten. [ 160 ] El otro añade pequeñas distorsiones inaudibles a otras voces o música, diseñadas específicamente para confundir al sistema de reconocimiento de voz y hacer que reconozca la música como voz, o para que lo que suena como un comando para un humano suene como un comando diferente para el sistema. [ 161 ]
Más información
Conferencias
Entre las conferencias habituales se incluyen SpeechTEK y SpeechTEK Europe, ICASSP , Interspeech/Eurospeech y la IEEE ASRU. Las conferencias en el campo del procesamiento del lenguaje natural , como ACL , NAACL , EMNLP y HLT, incluyen artículos sobre procesamiento del habla .
Diario
La revista principal es IEEE/ACM Transactions on Audio, Speech and Language Processing .
Libros
- Fundamentos del reconocimiento de voz por Lawrence Rabiner (1993)
- Métodos estadísticos para el reconocimiento de voz, por Frederick Jelinek.
- Procesamiento del lenguaje hablado por Xuedong Huang et al. (2001)
- El habla computacional, por Manfred R. Schroeder (2004)
- Procesamiento del habla: un enfoque dinámico y orientado a la optimización, por Li Deng y Doug O'Shaughnessey (2003).
- Procesamiento del habla y del lenguaje por Jurafsky y Martin (2008)
- Fundamentos del reconocimiento de locutores : fuente exhaustiva con información actualizada sobre la teoría y la práctica. [ 162 ]
- La voz en la máquina. Construyendo computadoras que entienden el habla, por Roberto Pieraccini (2012) – Introducción
- Reconocimiento automático del habla: un enfoque de aprendizaje profundo por los investigadores de Microsoft D. Yu y L. Deng (2014) – el tratamiento orientado matemáticamente de los métodos de aprendizaje profundo son [ 88 ]
- Aprendizaje profundo: métodos y aplicaciones por L. Deng y D. Yu (2014) – descripción general centrada en la metodología del reconocimiento de voz basado en DNN [ 84 ]
Proyectos
El proyecto más importante relacionado con el reconocimiento de voz que seguía en marcha en 2007 era el proyecto GALE, que incluye componentes tanto de reconocimiento de voz como de traducción.
Software
- El kit de herramientas Sphinx es un buen punto de partida para experimentar con el reconocimiento de voz.
- Libro HTK y kit de herramientas complementario
- Se puede utilizar el conjunto de herramientas Kaldi . [ 163 ]
- Voz común [ 164 ] [ 165 ] (utiliza TensorFlow ). [ 166 ]
- Coqui STT [ 167 ] (derivado de Common Voice, utilizando la misma licencia de código abierto) [ 168 ] [ 169 ]
- Gboard admite el reconocimiento de voz en todas las aplicaciones de Android . [ 170 ]
- El reconocimiento de voz está disponible en los sistemas operativos Microsoft Windows . [ 171 ]
- Las API comerciales de reconocimiento de voz basadas en la nube están ampliamente disponibles.
Véase también
- efecto de la IA
- ALPAC
- Etiquetas de idioma de aplicación para reconocimiento de voz
- Reconocimiento del habla articulada
- Minería de audio
- Reconocimiento de voz audiovisual
- Traductor automático de idiomas
- Unidad principal automotriz
- Braina
- Modelo de lenguaje de caché
- Dragón Naturalmente Habla
- Tecnología de voz fluida
- Búsqueda por voz de Google
- IBM ViaVoice
- detección de palabras clave
- Kinect
- Mondegreen
- Recuperación de información multimedia
- Origen del habla
- Tecnología de búsqueda fonética
- Diarización de oradores
- Reconocimiento del orador
- Análisis de voz
- Directrices para la interfaz de voz
- Software de reconocimiento de voz para Linux
- Síntesis de voz
- Verificación de voz
- Subtítulos (subtítulos)
- VoiceXML
- VoxForge
- Reconocimiento de voz de Windows
- Liza
Referencias
- ↑ "¿Qué es el reconocimiento de voz? | IBM" . www.ibm.com . 28 de septiembre de 2021. Consultado el 28 de agosto de 2025 .
- ↑ P. Nguyen (2010). "Clasificación automática de las características del hablante". Conferencia Internacional sobre Comunicaciones y Electrónica 2010. págs. 147–152 . doi : 10.1109/ICCE.2010.5670700 . ISBN 978-1-4244-7055-6. S2CID 13482115 .
- ↑ "Definición en inglés británico de reconocimiento de voz" . Macmillan Publishers Limited. Archivado del original el 16 de septiembre de 2011. Consultado el 21 de febrero de 2012 .
- ↑ "reconocimiento de voz, definición de" . WebFinance, Inc. Archivado del original el 3 de diciembre de 2011. Consultado el 21 de febrero de 2012 .
- ↑ "The Mailbag LG #114" . Linuxgazette.net. Archivado del original el 19 de febrero de 2013. Consultado el 15 de junio de 2013 .
- ↑ Sarangi, Susanta; Sahidullah, Md; Saha, Goutam (septiembre de 2020). "Optimización de un banco de filtros basado en datos para la verificación automática de locutores". Procesamiento de señales digitales . 104 102795. arXiv : 2007.10729 . Bibcode : 2020DSP...10402795S . doi : 10.1016/j.dsp.2020.102795 . S2CID 220665533 .
- ↑ Reynolds, Douglas; Rose, Richard (enero de 1995). "Identificación robusta de locutores independiente del texto mediante modelos de locutores de mezcla gaussiana" ( PDF ) . IEEE Transactions on Speech and Audio Processing . 3 (1): 72– 83. Bibcode : 1995ITSAP...3...72R . doi : 10.1109/89.365379 . ISSN 1063-6676 . OCLC 26108901. S2CID 7319345. Archivado (PDF) del original el 8 de marzo de 2014. Recuperado el 21 de febrero de 2014 .
- ↑ "Identificación de hablante (WhisperID)" . Microsoft Research . Microsoft. Archivado del original el 25 de febrero de 2014. Consultado el 21 de febrero de 2014.
Cuando hablas con alguien, no solo reconoce lo que dices, sino también quién eres. WhisperID permitirá que las computadoras hagan lo mismo, identificando a las personas por tu voz.
- ↑ Mills, Mara; Li, Xiaochang (2019). "Características vocales: De la identificación de voz al reconocimiento de voz por máquina" . Tecnología y cultura . 60 (2): 129–160 . doi : 10.1353/tech.2019.0066 . Recuperado el 21 de febrero de 2026 .
- ^ Alharbi, Sadin; Alrazgán, Muna; Alrased, Alanoud; Alnomasi, Turkiayh; Almojel, Raghad; Alharbi, Rimá; Alharbi, Saja; Alturki, Sahar; Alshehri, Fátima; Almojil, Maha (2021). "Reconocimiento automático de voz: revisión sistemática de la literatura" . Acceso IEEE . 9 : 131858– 131876. Código bibliográfico : 2021IEEEA...9m1858A . doi : 10.1109/ACCESS.2021.3112535 . ISSN 2169-3536 .
- ↑ Li, Suo; You, Jinchi; Zhang, Xin (agosto de 2022). «Descripción general y análisis del reconocimiento de voz». Conferencia Internacional IEEE de 2022 sobre Avances en Ingeniería Eléctrica y Aplicaciones Informáticas (AEECA) . págs. 391–395 . doi : 10.1109/AEECA55500.2022.9919050 . ISBN 978-1-6654-8090-1.
- ↑ "Obituarios: Stephen Balashek" . The Star-Ledger . 22 de julio de 2012. Archivado del original el 4 de abril de 2019. Consultado el 9 de septiembre de 2024 .
- ↑ "IBM-Shoebox-front.jpg" . androidauthority.net. Archivado del original el 9 de agosto de 2018. Consultado el 4 de abril de 2019 .
- ↑ Juang, BH; Rabiner, Lawrence R. "Reconocimiento automático del habla: una breve historia del desarrollo de la tecnología" (PDF) . pág. 6. Archivado (PDF) del original el 17 de agosto de 2014. Recuperado el 17 de enero de 2015 .
- ↑ GUNNAR, FANT. "TEORÍA ACÚSTICA DE LA PRODUCCIÓN DEL HABLA" (PDF) . Instituto Real de Tecnología de Estocolmo . Consultado el 20 de octubre de 2025 .
- 1 2 Melanie Pinola (2 de noviembre de 2011). "Reconocimiento de voz a través de las décadas: cómo terminamos con Siri" . PC World . Archivado del original el 3 de noviembre de 2018. Recuperado el 22 de octubre de 2018 .
- ↑ Gray, Robert M. (2010). "Una historia del habla digital en tiempo real en redes de paquetes: Parte II de la codificación predictiva lineal y el protocolo de Internet" (PDF) . Found. Trends Signal Process . 3 (4): 203– 303. doi : 10.1561/2000000036 . ISSN 1932-8346 . Archivado (PDF) del original el 9 de octubre de 2022. Recuperado el 9 de septiembre de 2024 .
- ↑ John R. Pierce (1969). "¿Hacia dónde se dirige el reconocimiento de voz?". Journal of the Acoustical Society of America . 46 (48): 1049– 1051. Bibcode : 1969ASAJ...46.1049P . doi : 10.1121/1.1911801 .
- ↑ Raj, Reddy (17 de junio de 1937). "Premio Turing de la ACM" . Association for Computing Machinery . Recuperado el 20 de octubre de 2025 .
- ↑ TK, Vintsyuk (1 de enero de 1968). "Discriminación del habla mediante programación dinámica" . Cibernética . 4 : 52–57 . doi : 10.1007/BF01074755 . Recuperado el 20 de octubre de 2025 .
- ↑ Benesty, Jacob; Sondhi, MM; Huang, Yiteng (2008). Springer Handbook of Speech Processing . Springer Science & Business Media. ISBN 978-3-540-49125-5.
- ↑ John Makhoul. «Medallista de la ISCA: Por su liderazgo y sus amplias contribuciones al procesamiento del habla y el lenguaje» . Archivado del original el 24 de enero de 2018. Consultado el 23 de enero de 2018 .
- ↑ Blechman, RO; Blechman, Nicholas (23 de junio de 2008). "Hola, Hal" . The New Yorker . Archivado del original el 20 de enero de 2015. Recuperado el 17 de enero de 2015 .
- ↑ Klatt, Dennis H. (1977). "Revisión del proyecto de comprensión del habla de ARPA". The Journal of the Acoustical Society of America . 62 (6): 1345– 1366. Bibcode : 1977ASAJ...62.1345K . doi : 10.1121/1.381666 .
- ↑ Rabiner (1984). "La Sociedad de Acústica, Habla y Procesamiento de Señales. Una perspectiva histórica" (PDF) . Archivado (PDF) del original el 9 de agosto de 2017. Recuperado el 23 de enero de 2018 .
- ↑ "De primera mano: El modelo oculto de Markov – Wiki de historia de la ingeniería y la tecnología" . ethw.org . 12 de enero de 2015. Archivado del original el 3 de abril de 2018. Consultado el 1 de mayo de 2018 .
- 1 2 "Entrevista a James Baker" . Archivado del original el 28 de agosto de 2017. Recuperado el 9 de febrero de 2017 .
- ↑ "Reconocimiento de voz pionero" . 7 de marzo de 2012. Archivado del original el 19 de febrero de 2015. Consultado el 18 de enero de 2015 .
- ↑ Huang, Xuedong; Baker, James; Reddy, Raj (enero de 2014). "Una perspectiva histórica del reconocimiento de voz" . Communications of the ACM . 57 (1): 94–103 . doi : 10.1145/2500887 . ISSN 0001-0782 . S2CID 6175701. Archivado del original el 8 de diciembre de 2023.
- ↑ Juang, BH; Rabiner, Lawrence R. Reconocimiento automático del habla: una breve historia del desarrollo de la tecnología (PDF) (Informe). pág. 10. Archivado (PDF) del original el 17 de agosto de 2014. Recuperado el 17 de enero de 2015 .
- ^ Li, Xiaochang (1 de julio de 2023). "«No hay datos como más datos»: Reconocimiento automático del habla y la creación de una cultura algorítmica . Osiris . 38 : 165–182 . doi : 10.1086/725132 . ISSN 0369-7827 . S2CID 259502346 .
- ↑ "Historia del reconocimiento de voz" . Transcripción médica de Dragon . Archivado del original el 13 de agosto de 2015. Consultado el 17 de enero de 2015 .
- ^ Billi, Roberto; Canavesio, Franco; Ciaramella, Alberto; Nebbia, Luciano (1 de noviembre de 1995). "Tecnología de voz interactiva en el trabajo: la experiencia CSELT" . Comunicación del habla . 17 (3): 263– 271. doi : 10.1016/0167-6393(95)00030-R .
- 1 2 Xuedong Huang; James Baker; Raj Reddy (enero de 2014). "Una perspectiva histórica del reconocimiento de voz" . Communications of the ACM. Archivado del original el 20 de enero de 2015. Recuperado el 20 de enero de 2015 .
- ↑ Kevin McKean (8 de abril de 1980). "Cuando Cole habla, las computadoras escuchan" . Sarasota Journal. AP . Consultado el 23 de noviembre de 2015 .
- ↑ "ACT/Apricot - Historia del albaricoque" . actapricot.org . Archivado del original el 21 de diciembre de 2016. Consultado el 2 de febrero de 2016 .
- ↑ Melanie Pinola (2 de noviembre de 2011). "Reconocimiento de voz a través de las décadas: cómo llegamos a Siri" . PC World . Archivado del original el 13 de enero de 2017. Consultado el 28 de julio de 2017 .
- ↑ "Biografía de Ray Kurzweil" . KurzweilAINetwork. Archivado del original el 5 de febrero de 2014. Consultado el 25 de septiembre de 2014 .
- ↑ Juang, BH; Rabiner, Lawrence. Reconocimiento automático del habla: una breve historia del desarrollo de la tecnología (PDF) (Informe). Archivado (PDF) del original el 9 de agosto de 2017. Recuperado el 28 de julio de 2017 .
- ↑ "Nuance Exec habla sobre el iPhone 4S, Siri y el futuro del reconocimiento de voz" . Tech.pinions. 10 de octubre de 2011. Archivado del original el 19 de noviembre de 2011. Consultado el 23 de noviembre de 2011 .
- ↑ "Switchboard-1 Release 2" . Archivado del original el 11 de julio de 2017. Recuperado el 26 de julio de 2017 .
- ↑ Jason Kincaid (13 de febrero de 2011). "El poder de la voz: una conversación con el jefe de la tecnología de voz de Google" . Tech Crunch . Archivado del original el 21 de julio de 2015. Recuperado el 21 de julio de 2015 .
- ↑ Froomkin, Dan (5 de mayo de 2015). "LAS COMPUTADORAS ESTÁN ESCUCHANDO" . The Intercept . Archivado del original el 27 de junio de 2015. Recuperado el 20 de junio de 2015 .
- ↑ Herve Bourlard y Nelson Morgan , Reconocimiento de voz conexionista: un enfoque híbrido, The Kluwer International Series in Engineering and Computer Science; vol. 247, Boston: Kluwer Academic Publishers, 1994.
- 1 2 Sepp Hochreiter ; J. Schmidhuber (1997). "Memoria a corto y largo plazo". Neural Computation . 9 (8): 1735– 1780. doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276. S2CID 1915014 .
- ↑ Schmidhuber, Jürgen (2015). "Aprendizaje profundo en redes neuronales: una visión general". Redes neuronales . 61 : 85–117 . arXiv : 1404.7828 . Bibcode : 2015NN.....61...85S . doi : 10.1016/j.neunet.2014.09.003 . PMID 25462637. S2CID 11715509 .
- ↑ Alex Graves, Santiago Fernandez, Faustino Gomez y Jürgen Schmidhuber (2006). Clasificación temporal conexionista: Etiquetado de datos de secuencias no segmentadas con redes neuronales recurrentes. Archivado el 9 de septiembre de 2024 en Wayback Machine . Actas de ICML'06, págs. 369–376.
- ↑ Santiago Fernández, Alex Graves y Jürgen Schmidhuber (2007). Una aplicación de redes neuronales recurrentes para la detección discriminativa de palabras clave . Actas de ICANN (2), págs. 220–229.
- 1 2 Haşim Sak, Andrew Senior, Kanishka Rao, Françoise Beaufays y Johan Schalkwyk (septiembre de 2015): " "Búsqueda por voz de Google: más rápida y precisa" . Archivado del original el 9 de marzo de 2016. Recuperado el 5 de abril de 2016 ."
- ↑ Dosovitskiy, Alexey; Beyer, Lucas; Kolesnikov, Alejandro; Weissenborn, Dirk; Zhai, Xiaohua; Unterthiner, Thomas; Dehghani, Mostafa; Minderer, Matías; Heigold, Georg; Gelly, Sylvain; Uszkoreit, Jakob; Houlsby, Neil (3 de junio de 2021). "Una imagen vale 16 x 16 palabras: transformadores para el reconocimiento de imágenes a escala". arXiv : 2010.11929 [ cs.CV ].
- ^ Wu, Haiping; Xiao, Bin; Codella, Noel; Liu, Mengchen; Dai, Xiyang; Yuan, Lu; Zhang, Lei (29 de marzo de 2021). "CvT: Introducción de convoluciones a los transformadores de visión". arXiv : 2103.15808 [ cs.CV ].
- ^ Vaswani, Ashish; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, León; Gómez, Aidan N; Káiser, Łukasz; Polosukhin, Illia (2017). "La atención es todo lo que necesitas" . Avances en los sistemas de procesamiento de información neuronal . 30 . Asociados Curran. Archivado desde el original el 9 de septiembre de 2024 . Consultado el 9 de septiembre de 2024 .
- ↑ Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (24 de mayo de 2019). "BERT: Pre-entrenamiento de transformadores bidireccionales profundos para la comprensión del lenguaje". arXiv : 1810.04805 [ cs.CL ].
- 1 2 Gong, Yuan; Chung, Yu-An; Glass, James (8 de julio de 2021). "AST: Audio Spectrogram Transformer". arXiv : 2104.01778 [ cs.SD ].
- ^ Ristea , Nicolae-Catalin; Ionescu, Radu Tudor; Khan, Fahad Shahbaz (20 de junio de 2022). "SepTr: transformador separable para procesamiento de espectrogramas de audio". arXiv : 2203.09581 [ cs.CV ].
- 1 2 Lohrenz, Timo; Li, Zhengyang; Fingscheidt, Tim (14 de julio de 2021). "Aprendizaje de codificadores múltiples y fusión de flujos para el reconocimiento automático de voz de extremo a extremo basado en transformadores". arXiv : 2104.00120 [ eess.AS ].
- ↑ "Li Deng" . Sitio de Li Deng. Archivado del original el 9 de septiembre de 2024. Consultado el 9 de septiembre de 2024 .
- ↑ Taller NIPS: Aprendizaje profundo para el reconocimiento de voz y aplicaciones relacionadas, Whistler, BC, Canadá, diciembre de 2009 (Organizadores: Li Deng, Geoff Hinton, D. Yu).
- 1 2 3 Hinton, Geoffrey; Deng, Li; Yu, Dong; Dahl, George; Mohamed, Abdel-Rahman; Jaitly, Navdeep; Senior, Andrew; Vanhoucke, Vincent; Nguyen, Patrick; Sainath, Tara ; Kingsbury, Brian (2012). "Redes neuronales profundas para el modelado acústico en el reconocimiento del habla: las opiniones compartidas de cuatro grupos de investigación". IEEE Signal Processing Magazine . 29 (6): 82– 97. Bibcode : 2012ISPM...29...82H . doi : 10.1109/MSP.2012.2205597 . S2CID 206485943 .
- 1 2 Deng, L.; Hinton, G.; Kingsbury, B. (2013). "Nuevos tipos de aprendizaje de redes neuronales profundas para el reconocimiento de voz y aplicaciones relacionadas: una visión general". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing: New types of deep neural network learning for speech recognition and related applications: An overview . p. 8599. doi : 10.1109/ICASSP.2013.6639344 . ISBN 978-1-4799-0356-6. S2CID 13953660 .
- 1 2 Markoff, John (23 de noviembre de 2012). "Los científicos ven potencial en los programas de aprendizaje profundo" . New York Times . Archivado del original el 30 de noviembre de 2012. Recuperado el 20 de enero de 2015 .
- ↑ Morgan, Bourlard, Renals, Cohen, Franco (1993) "Sistemas híbridos de redes neuronales/modelos ocultos de Markov para el reconocimiento continuo del habla. ICASSP/IJPRAI"
- ↑ T. Robinson (1992). "Un sistema de reconocimiento de palabras basado en una red de propagación de errores recurrente en tiempo real" . [ Actas ] ICASSP-92: Conferencia Internacional IEEE de 1992 sobre Acústica, Habla y Procesamiento de Señales . págs. 617–620 vol. 1. doi : 10.1109/ICASSP.1992.225833 . ISBN 0-7803-0532-9. S2CID 62446313 .
- ↑ Waibel , Hanazawa, Hinton, Shikano, Lang. (1989) " Reconocimiento de fonemas mediante redes neuronales con retardo temporal. Archivado el 25 de febrero de 2021 en Wayback Machine . IEEE Transactions on Acoustics, Speech, and Signal Processing."
- ↑ Baker, J.; Li Deng; Glass, J.; Khudanpur, S.; Chin-Hui Lee ; Morgan, N.; O'Shaughnessy, D. (2009). "Desarrollos y direcciones en el reconocimiento y la comprensión del habla, parte 1". IEEE Signal Processing Magazine . 26 (3): 75– 80. Bibcode : 2009ISPM...26...75B . doi : 10.1109/MSP.2009.932166 . hdl : 1721.1/51891 . S2CID 357467 .
- ↑ Sepp Hochreiter (1991), Untersuchungen zu dynamischen neuronalen Netzen Archivado el 6 de marzo de 2015 en Wayback Machine , Tesis de diploma. Instituto f. Informática, Universidad Técnica. Munich. Asesor: J. Schmidhuber.
- ↑ Bengio, Y. (1991). Redes neuronales artificiales y su aplicación al reconocimiento de voz/secuencias (tesis doctoral). Universidad McGill.
- ↑ Deng, L.; Hassanein, K.; Elmasry, M. (1994). "Análisis de la estructura de correlación para un modelo predictivo neuronal con aplicación al reconocimiento de voz". Redes neuronales . 7 (2): 331– 339. doi : 10.1016/0893-6080(94)90027-2 .
- ↑ Conferencia magistral: Desarrollos recientes en redes neuronales profundas. ICASSP, 2013 (por Geoff Hinton).
- 1 2 Charla magistral: " Logros y desafíos del aprendizaje profundo: del análisis y reconocimiento del habla al lenguaje y procesamiento multimodal Archivado el 5 de marzo de 2021 en Wayback Machine ", Interspeech, septiembre de 2014 (por Li Deng ).
- ↑ "Aumentan las mejoras en el software de reconocimiento de voz" . TechRepublic.com . 27 de agosto de 2002. Archivado del original el 23 de octubre de 2018. Consultado el 22 de octubre de 2018.
Maners dijo que IBM ha trabajado en el avance del reconocimiento de voz... o en el suelo de una ruidosa feria comercial.
- ↑ "Reconocimiento de voz para facilitar las reservas de viajes: Business Travel News" . BusinessTravelNews.com . 3 de marzo de 1997. Archivado del original el 9 de septiembre de 2024. Recuperado el 9 de septiembre de 2024.
Las primeras aplicaciones del software de reconocimiento de voz fueron el dictado... Hace cuatro meses, IBM presentó un "producto de dictado continuo" diseñado para... debutó en la feria comercial de la National Business Travel Association en 1994.
- ↑ Ellis Booker (14 de marzo de 1994). "El reconocimiento de voz se generaliza". Computerworld . pág. 45.
Hace tan solo unos años, el reconocimiento de voz se limitaba a...
- ↑ "Investigadores de Microsoft alcanzan un nuevo hito en el reconocimiento de voz conversacional" . Microsoft . 21 de agosto de 2017. Archivado del original el 9 de septiembre de 2024. Consultado el 9 de septiembre de 2024 .
- ↑ Waibel, A.; Hanazawa, T.; Hinton, G.; Shikano, K.; Lang, KJ (1989). "Reconocimiento de fonemas mediante redes neuronales con retardo temporal". IEEE Transactions on Acoustics, Speech, and Signal Processing . 37 (3): 328– 339. Bibcode : 1989ITASS..37..328W . doi : 10.1109/29.21701 . hdl : 10338.dmlcz/135496 . S2CID 9563026 .
- ↑ Bird, Jordan J.; Wanner, Elizabeth; Ekárt, Anikó; Faria, Diego R. (2020). "Optimización del reconocimiento de voz fonética mediante algoritmos evolutivos multiobjetivo" ( PDF) . Expert Systems with Applications . 153 113402. Elsevier BV. doi : 10.1016/j.eswa.2020.113402 . ISSN 0957-4174 . S2CID 216472225. Archivado (PDF) del original el 9 de septiembre de 2024. Recuperado el 9 de septiembre de 2024 .
- ↑ Wu, J.; Chan, C. (1993). "Reconocimiento de palabras aisladas mediante modelos de redes neuronales con coeficientes de correlación cruzada para la dinámica del habla". IEEE Transactions on Pattern Analysis and Machine Intelligence . 15 (11): 1174– 1185. Bibcode : 1993ITPAM..15.1174J . doi : 10.1109/34.244678 .
- ↑ SA Zahorian, AM Zimmer y F. Meng, (2002) " Clasificación de vocales para retroalimentación visual basada en computadora para el entrenamiento del habla para personas con discapacidad auditiva ", en ICSLP 2002
- ↑ Hu, Hongbing; Zahorian, Stephen A. (2010). "Métodos de reducción de dimensionalidad para el reconocimiento fonético HMM" (PDF) . ICASSP 2010. Archivado ( PDF) del original el 6 de julio de 2012.
- ↑ Fernández, Santiago; Graves, Alex; Schmidhuber, Jürgen (2007). "Etiquetado de secuencias en dominios estructurados con redes neuronales recurrentes jerárquicas" (PDF) . Actas de IJCAI . Archivado (PDF) del original el 15 de agosto de 2017.
- ↑ Graves, Alex; Mohamed, Abdel-rahman; Hinton, Geoffrey (2013). "Reconocimiento de voz con redes neuronales recurrentes profundas". arXiv : 1303.5778 [ cs.NE ].ICASSP 2013.
- ↑ Waibel, Alex (1989). "Construcción modular de redes neuronales con retardo temporal para el reconocimiento del habla" ( PDF) . Neural Computation . 1 (1): 39– 46. doi : 10.1162/neco.1989.1.1.39 . S2CID 236321. Archivado (PDF) del original el 29 de junio de 2016.
- ↑ Maas, Andrew L.; Le, Quoc V.; O'Neil, Tyler M.; Vinyals, Oriol; Nguyen, Patrick; Ng, Andrew Y. (2012). "Redes neuronales recurrentes para la reducción de ruido en ASR robusto". Actas de Interspeech 2012 .
- 1 2 Deng, Li; Yu, Dong (2014). "Aprendizaje profundo: métodos y aplicaciones" (PDF) . Fundamentos y tendencias en procesamiento de señales . 7 ( 3–4 ): 197–387 . CiteSeerX 10.1.1.691.3679 . doi : 10.1561/2000000039 . Archivado (PDF) del original el 22 de octubre de 2014.
- ↑ Yu, D.; Deng, L.; Dahl, G. (2010). "Roles of Pre-Training and Fine-Tuning in Context-Dependent DBN-HMMs for Real-World Speech Recognition" (PDF) . NIPS Workshop on Deep Learning and Unsupervised Feature Learning .
- ↑ Dahl, George E.; Yu, Dong; Deng, Li; Acero, Alex (2012). "Redes neuronales profundas preentrenadas dependientes del contexto para el reconocimiento de voz con vocabulario extenso". IEEE Transactions on Audio, Speech, and Language Processing . 20 (1): 30– 42. Bibcode : 2012ITASL..20...30D . doi : 10.1109/TASL.2011.2134090 . S2CID 14862572 .
- ↑ Deng L., Li, J., Huang, J., Yao, K., Yu, D., Seide, F. et al. Avances recientes en aprendizaje profundo para la investigación del habla en Microsoft. Archivado el 9 de septiembre de 2024 en Wayback Machine . ICASSP, 2013.
- 1 2 Yu, D.; Deng, L. (2014). "Reconocimiento automático del habla: un enfoque de aprendizaje profundo (Editorial: Springer)".
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Deng, L.; Li, Xiao (2013). "Paradigmas de aprendizaje automático para el reconocimiento de voz: una visión general" ( PDF) . IEEE Transactions on Audio, Speech, and Language Processing . 21 (5): 1060– 1089. Bibcode : 2013ITASL..21.1060D . doi : 10.1109/TASL.2013.2244083 . S2CID 16585863. Archivado (PDF) del original el 9 de septiembre de 2024. Recuperado el 9 de septiembre de 2024 .
- ↑ Schmidhuber, Jürgen (2015). "Aprendizaje profundo" . Scholarpedia . 10 (11) 32832. Bibcode : 2015SchpJ..1032832S . doi : 10.4249/scholarpedia.32832 .
- ↑ L. Deng, M. Seltzer, D. Yu, A. Acero, A. Mohamed y G. Hinton (2010) Codificación binaria de espectrogramas de voz mediante un autoencoder profundo . Interspeech.
- ↑ Tüske, Zoltán; Golik, Pavel; Schlüter, Ralf; Ney, Hermann (2014). "Modelado acústico con redes neuronales profundas utilizando señales de tiempo sin procesar para LVCSR" (PDF) . Interspeech 2014. Archivado ( PDF) del original el 21 de diciembre de 2016.
- ↑ Jurafsky, Daniel (2016). Procesamiento del habla y del lenguaje .
- ↑ Graves, Alex (2014). "Hacia el reconocimiento de voz de extremo a extremo con redes neuronales recurrentes" (PDF) . ICML . Archivado del original (PDF) el 10 de enero de 2017. Recuperado el 22 de julio de 2019 .
- ↑ Amodei, Dario (2016). "Deep Speech 2: End-to-End Speech Recognition in English and Mandarin". arXiv : 1512.02595 [ cs.CL ].
- ↑ "LipNet: ¿Qué tan fácil crees que es leer los labios?" . YouTube . 4 de noviembre de 2016. Archivado del original el 27 de abril de 2017. Consultado el 5 de mayo de 2017 .
- ↑ Assael, Yannis; Shillingford, Brendan; Whiteson, Shimon; de Freitas, Nando (5 de noviembre de 2016). "LipNet: Lectura de labios de extremo a extremo a nivel de oración". arXiv : 1611.01599 [ cs.CV ].
- ^ Shillingford, Brendan; Assael, Yannis; Hoffman, Mateo W.; Paine, Tomás; Hughes, Cian; Prabhu, Utsav; Liao, Hank; Sak, Hasim; Rao, Kanishka (13 de julio de 2018). "Reconocimiento visual de voz a gran escala". arXiv : 1807.05162 [ cs.CV ].
- ↑ Li, Jason; Lavrukhin, Vitaly; Ginsburg, Boris; Leary, Ryan; Kuchaiev, Oleksii; Cohen, Jonathan M.; Nguyen, Huyen; Gadde, Ravi Teja (2019). "Jasper: Un modelo acústico neuronal convolucional de extremo a extremo" . Interspeech 2019. pp. 71–75 . arXiv : 1904.03288 . doi : 10.21437/Interspeech.2019-1819 .
- ↑ Kriman, Samuel; Beliaev, Stanislav; Ginsburg, Boris; Huang, Jocelyn; Kuchaiev, Oleksii; Lavrukhin, Vitaly; Leary, Ryan; Li, Jason; Zhang, Yang (22 de octubre de 2019), QuartzNet: Reconocimiento automático profundo del habla con convoluciones separables de canal temporal 1D , arXiv : 1910.10261
- ↑ Medeiros, Eduardo; Corado, Leonel; Rato, Luis; Quaresma, Paulo; Salgueiro, Pedro (mayo de 2023). "Adaptación de dominio de voz a texto para portugueses europeos de bajos recursos mediante el aprendizaje profundo" . Internet del futuro . 15 (5): 159. doi : 10.3390/fi15050159 . hdl : 10174/41180 . ISSN 1999-5903 .
- ↑ Joshi, Raviraj; Singh, Anupam (mayo de 2022). Malmasi, Shervin; Rokhlenko, Oleg; Ueffing, Nicola; Guy, Ido; Agichtein, Eugene; Kallumadi, Surya (eds.). "Una línea base simple para la adaptación de dominio en sistemas ASR de extremo a extremo utilizando datos sintéticos" . Actas del Quinto Taller sobre Comercio Electrónico y PLN (ECNLP 5) . Dublín, Irlanda: Asociación de Lingüística Computacional: 244–249 . arXiv : 2206.13240 . doi : 10.18653/v1/2022.ecnlp-1.28 .
- ↑ Sukhadia, Vrunda N.; Umesh, S. (9 de enero de 2023). "Adaptación de dominio de modelos de dominio objetivo con pocos recursos utilizando modelos conformadores ASR bien entrenados". 2022 IEEE Spoken Language Technology Workshop (SLT) . IEEE. págs. 295–301 . arXiv : 2202.09167 . doi : 10.1109/SLT54892.2023.10023233 . ISBN 979-8-3503-9690-4.
- ↑ Petrova, Magdalena (10 de abril de 2018). "El MIT desarrolló unos auriculares que dan voz a la voz que hay dentro de tu cabeza" . CNBC . Consultado el 11 de septiembre de 2025 .
- ↑ Kapur, Arnav; Kapur, Shreyas; Maes, Pattie (2018). "AlterEgo: una interfaz de voz silenciosa portátil y personalizada". IUI '18: Actas de la 23.ª Conferencia Internacional sobre Interfaces de Usuario Inteligentes : 43–53 .
- ↑ Chan, William; Jaitly, Navdeep; Le, Quoc; Vinyals, Oriol (2016). "Listen, Attend and Spell: A Neural Network for Large Vocabulary Conversational Speech Recognition" (PDF) . ICASSP . Archivado (PDF) del original el 9 de septiembre de 2024. Recuperado el 9 de septiembre de 2024 .
- ↑ Bahdanau, Dzmitry (2016). "Reconocimiento de voz de vocabulario extenso basado en atención de extremo a extremo". arXiv : 1508.04395 [ cs.CL ].
- ↑ Chorowski, Jan; Jaitly, Navdeep (8 de diciembre de 2016). "Hacia una mejor decodificación e integración de modelos de lenguaje en modelos de secuencia a secuencia". arXiv : 1612.02695 [ cs.NE ].
- ^ Chan, William; Zhang, Yu; Le, Quoc; Jaitly, Navdeep (10 de octubre de 2016). "Descomposiciones de secuencias latentes". arXiv : 1610.03035 [ estad.ML ].
- ↑ Chung, Joon Son; Senior, Andrew; Vinyals, Oriol; Zisserman, Andrew (16 de noviembre de 2016). «Lectura de labios de oraciones en entornos reales». Conferencia IEEE de 2017 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . págs. 3444–3453 . arXiv : 1611.05358 . doi : 10.1109/CVPR.2017.367 . ISBN 978-1-5386-0457-1. S2CID 1662180 .
- ^ Fuliang, Weng; Pongtep, Angkititrakul; Elizabeth, E. Shriberg; Larry, diablos; Stanley, Peters; John, HL Hansen (4 de noviembre de 2016). "Sistemas de diálogo conversacional en el vehículo" (PDF) . doi : 10.1109/MSP.2016.2599201 . Consultado el 20 de octubre de 2025 .
- ↑ El Kheir, Yassine; et al. (21 de octubre de 2023), Automatic Pronunciation Assessment — A Review , Conference on Empirical Methods in Natural Language Processing, arXiv : 2310.13974 , S2CID 264426545
- ↑ Isaacs, Talia; Harding, Luke (julio de 2017). "Evaluación de la pronunciación" . Language Teaching . 50 (3): 347– 366. doi : 10.1017/S0261444817000118 . ISSN 0261-4448 . S2CID 209353525 .
- ↑ Loukina, Anastassia; et al. (6 de septiembre de 2015), "Precisión de la pronunciación e inteligibilidad del habla no nativa" (PDF) , INTERSPEECH 2015 , Dresde, Alemania: Asociación Internacional de Comunicación del Habla , págs. 1917–1921 , archivado (PDF) del original el 9 de septiembre de 2024 , recuperado el 9 de septiembre de 2024 ,
solo el 16% de la variabilidad en la inteligibilidad a nivel de palabra puede explicarse por la presencia de pronunciaciones erróneas obvias.
- ↑ O'Brien, Mary Grantham; et al. (31 de diciembre de 2018). "Direcciones para el futuro de la tecnología en la investigación y enseñanza de la pronunciación" . Journal of Second Language Pronunciation . 4 (2): 182– 207. doi : 10.1075/jslp.17001.obr . hdl : 2066/199273 . ISSN 2215-1931 . S2CID 86440885 .
Los investigadores de la pronunciación están interesados principalmente en mejorar la inteligibilidad y la comprensibilidad de los aprendices de L2, pero aún no han recopilado cantidades suficientes de datos representativos y confiables (grabaciones de voz con anotaciones y juicios correspondientes) que indiquen qué errores afectan estas dimensiones del habla y cuáles no. Estos datos son esenciales para entrenar algoritmos ASR para evaluar la inteligibilidad de los aprendices de L2.
- ↑ Eskenazi, Maxine (enero de 1999). "Uso del procesamiento automático del habla para la tutoría de pronunciación de lenguas extranjeras: algunos problemas y un prototipo" . Language Learning & Technology . 2 (2): 62– 76. doi : 10.64152/10125/25043 . hdl : 10125/25043 . Archivado del original el 9 de septiembre de 2024. Recuperado el 11 de febrero de 2023 .
- ↑ Tholfsen, Mike (9 de febrero de 2023). "Reading Coach en Immersive Reader más nuevas funciones que llegarán a Reading Progress en Microsoft Teams" . Blog de Techcommunity Education . Microsoft. Archivado del original el 9 de septiembre de 2024. Recuperado el 12 de febrero de 2023 .
- ↑ Banerji, Olina (7 de marzo de 2023). "Las escuelas están utilizando tecnología de voz para enseñar a leer. ¿Está dando resultados?" . EdSurge News . Archivado del original el 9 de septiembre de 2024. Consultado el 7 de marzo de 2023 .
- ↑ Hair, Adam; et al. (19 de junio de 2018). «Apraxia world: Un juego de terapia del habla para niños con trastornos del habla». Actas de la 17.ª Conferencia ACM sobre Diseño de Interacción y Niños (PDF) . págs. 119–131 . doi : 10.1145/3202185.3202733 . ISBN 978-1-4503-5152-2. S2CID 13790002 . Archivado (PDF) del original el 9 de septiembre de 2024 . Recuperado el 9 de septiembre de 2024 .
- ↑ «La computadora dice que no: un veterinario irlandés suspende la prueba oral de inglés necesaria para permanecer en Australia» . The Guardian . Australian Associated Press. 8 de agosto de 2017. Archivado del original el 9 de septiembre de 2024. Consultado el 12 de febrero de 2023 .
- ↑ Ferrier, Tracey (9 de agosto de 2017). «Expresentadora de noticias australiana con título en inglés suspende la prueba de inglés de un robot» . The Sydney Morning Herald . Archivado del original el 9 de septiembre de 2024. Consultado el 12 de febrero de 2023 .
- ↑ Main, Ed; Watson, Richard (9 de febrero de 2022). "El examen de inglés que arruinó miles de vidas" . BBC News . Archivado del original el 9 de septiembre de 2024. Consultado el 12 de febrero de 2023 .
- ↑ Joyce, Katy Spratte (24 de enero de 2023). "13 palabras que se pueden pronunciar de dos maneras" . Reader's Digest. Archivado del original el 9 de septiembre de 2024. Consultado el 23 de febrero de 2023 .
- ↑ Por ejemplo, CMUDICT , "El diccionario de pronunciación de CMU" . www.speech.cs.cmu.edu . Archivado del original el 15 de agosto de 2010. Consultado el 15 de febrero de 2023 .Compare "four" dado como "F AO R" con la vocal AO como en "caught", con "row" dado como "R OW" con la vocal OW como en "oat".
- ↑ Tu, Zehai; Ma, Ning; Barker, Jon (2022). "Medidas de incertidumbre no supervisadas del reconocimiento automático del habla para la predicción no intrusiva de la inteligibilidad del habla" (PDF) . Actas de Interspeech 2022. INTERSPEECH 2022. ISCA. págs. 3493–3497 . doi : 10.21437/Interspeech.2022-10408 . Archivado (PDF) del original el 9 de septiembre de 2024. Recuperado el 17 de diciembre de 2023 .
- ↑ Marco común europeo de referencia para el aprendizaje, la enseñanza y la evaluación de lenguas: Volumen complementario con nuevos descriptores . Programa de Política Lingüística, División de Política Educativa, Departamento de Educación, Consejo de Europa . Febrero de 2018. pág. 136. OCLC 1090351600. Archivado del original el 9 de septiembre de 2024. Consultado el 9 de septiembre de 2024 .
- ↑ María, Grazia Maggio; Daniela, De Bartolo; Rocco, Salvatore Calabró; Irene, Ciancarelli; Antonio, Cerasa; Paolo, Tonín; Fulvia, Di Iulio; Stefano, Paolucci; Gabriella, Antonucci; Giovanni, Morone; Marco, Iosa (29 de septiembre de 2023). "Rehabilitación cognitiva asistida por ordenador en pacientes neurológicos: estado del arte y perspectivas de futuro" . Fronteras en Neurología . 14 1255319.doi : 10.3389/ fneur.2023.1255319 . PMC 10580980 . PMID 37854065 .
- ↑ Englund, Christine (2004). Reconocimiento de voz en el avión JAS 39 Gripen: Adaptación al habla a diferentes cargas G (PDF) (Tesis de maestría). Instituto Real de Tecnología de Estocolmo . Archivado (PDF) del original el 2 de octubre de 2008.
- ↑ "La cabina" . Eurofighter Typhoon . Archivado del original el 1 de marzo de 2017.
- ↑ "Eurofighter Typhoon: el avión de combate más avanzado del mundo" . www.eurofighter.com . Archivado del original el 11 de mayo de 2013. Consultado el 1 de mayo de 2018 .
- ↑ Schutte, John (15 de octubre de 2007). "Investigadores perfeccionan el sistema de comunicación por voz entre el piloto y la aeronave F-35" . Fuerza Aérea de los Estados Unidos. Archivado del original el 20 de octubre de 2007.
- ↑ John, Schutte (17 de octubre de 2007). "Investigadores perfeccionan el sistema de comunicación por voz entre el piloto y la aeronave F-35" . AIR FORCE MATERIEL COMMAND . Consultado el 20 de octubre de 2025 .
- ↑ Trenten, Walters (27 de junio de 2022). "ATC lleva simulaciones a las residencias estudiantiles" . AIR FORCE LEARNING PROFESSIONALS . Archivado del original el 25 de octubre de 2025. Recuperado el 20 de octubre de 2025 .
- ↑ "Superando las barreras de comunicación en el aula" . MassMATCH. 18 de marzo de 2010. Archivado del original el 25 de julio de 2013. Consultado el 15 de junio de 2013 .
- 1 2 "Reconocimiento de voz para el aprendizaje" . Centro Nacional para la Innovación Tecnológica. 2010. Archivado del original el 13 de abril de 2014. Recuperado el 26 de marzo de 2014 .
- ↑ "Reconocimiento de voz para personas con discapacidad" . Archivado del original el 4 de abril de 2008.
- ↑ Grupo de apoyo internacional de Friends
- ↑ Garrett, Jennifer Tumlin; et al. (2011). "Uso de software de reconocimiento de voz para aumentar la fluidez en la escritura en personas con discapacidades físicas" . Journal of Special Education Technology . 26 (1): 25– 41. doi : 10.1177/016264341102600104 . S2CID 142730664. Archivado del original el 9 de septiembre de 2024. Recuperado el 9 de septiembre de 2024 .
- ↑ Forgrave, Karen E. "Tecnología de asistencia: empoderando a los estudiantes con discapacidades". Clearing House 75.3 (2002): 122–6. Web.
- 1 2 Kambouri, Maria; Simon, Helen; Brooks, Greg (2023). "Uso de la tecnología de voz a texto para empoderar a jóvenes escritores con necesidades educativas especiales" . Investigación en Discapacidades del Desarrollo . 135 104466. doi : 10.1016/j.ridd.2023.104466 . ISSN 0891-4222 . Archivado del original el 1 de mayo de 2023. Recuperado el 5 de junio de 2026 .
- 1 2 Forgrave, Karen E. (2002). "Tecnología de asistencia: empoderando a estudiantes con discapacidades de aprendizaje" . The Clearing House . 75 (3): 122– 126. ISSN 0009-8655 .
- 1 2 Almgren Back, Gunilla; Nordstrom, Thomas; Svensson, dor (13 de septiembre de 2024). "Mejora de la expresión textual de los estudiantes de secundaria: el papel complementario de la tecnología de conversión de voz a texto" . Reading & Writing Quarterly . 41 (2): 160– 175 – vía Taylor & Francis Online.
- ↑ Košak Babuder, Milena; Poredoš, Mojca; Pižorn, Karmen (octubre de 2025). "Aprendizaje con apoyo digital para estudiantes con dificultades específicas de aprendizaje en la educación superior" . Revista de Estudios de Educación Contemporánea . 76 (3).
- 1 2 "Reconocimiento de voz para el aprendizaje | LD OnLine" . www.ldonline.org . Consultado el 5 de junio de 2026 .
- ↑ Tang, KW; Kamoua, Ridha; Sutan, Victor (2004). "Tecnología de reconocimiento de voz para la educación de personas con discapacidad". Journal of Educational Technology Systems . 33 (2): 173– 84. CiteSeerX 10.1.1.631.3736 . doi : 10.2190/K6K8-78K2-59Y7-R9R2 . S2CID 143159997 .
- ↑ "Proyectos: Micrófonos Planetarios" . The Planetary Society. Archivado del original el 27 de enero de 2012.
- ↑ Caridakis, George; Castellano, Ginevra; Kessous, Loic; Raouzaiou, Amaryllis; Malatesta, Lori; Asteriadis, Stelios; Karpouzis, Kostas (19 de septiembre de 2007). «Reconocimiento multimodal de emociones a partir de rostros expresivos, gestos corporales y habla» . Inteligencia Artificial e Innovaciones 2007: De la Teoría a las Aplicaciones . IFIP, Federación Internacional para el Procesamiento de la Información. Vol. 247. Springer US. pp. 375–388 . doi : 10.1007/978-0-387-74161-1_41 . ISBN 978-0-387-74160-4.
- ↑ "¿Qué es el subtitulado en tiempo real? | HAZLO" . www.washington.edu . Archivado del original el 9 de septiembre de 2024. Consultado el 11 de abril de 2021 .
- ↑ Zheng, Thomas Fang; Li, Lantian (2017). Problemas relacionados con la robustez en el reconocimiento de locutores . SpringerBriefs in Electrical and Computer Engineering. Singapur: Springer Singapore. doi : 10.1007/978-981-10-3238-7 . ISBN 978-981-10-3237-0Archivado del original el 9 de septiembre de 2024. Consultado el 9 de septiembre de 2024 .
- ↑ Ciaramella, Alberto. "Informe de evaluación de rendimiento de un prototipo". Paquete de trabajo Sundial 8000 (1993).
- ↑ Gerbino, E.; Baggia, P.; Ciaramella, A.; Rullent, C. (1993). "Prueba y evaluación de un sistema de diálogo hablado". Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales . págs. 135–138 vol.2. doi : 10.1109/ICASSP.1993.319250 . ISBN 0-7803-0946-4. S2CID 57374050 .
- ↑ Instituto Nacional de Estándares y Tecnología. " Historia de la evaluación del reconocimiento automático del habla en el NIST. Archivado el 8 de octubre de 2013 en Wayback Machine ".
- ↑ "8.3. Reconocimiento de voz: Introducción al procesamiento de voz" . speechprocessingbook.aalto.fi . Consultado el 24 de octubre de 2025 .
- ↑ "Los nombres de las letras pueden causar confusión y otras cosas que debes saber sobre las relaciones entre letras y sonidos" . NAEYC . Archivado del original el 9 de septiembre de 2024. Consultado el 27 de octubre de 2023 .
- ↑ "Speaker-Dependent vs. Speaker-Independent ASR" . apxml.com . Consultado el 24 de octubre de 2025 .
- ↑ "Transmisiones multimedia - Mensajes WebSocket | Twilio" . www.twilio.com . Consultado el 24 de octubre de 2025 .
- ↑ "Sonido | Propiedades, tipos y datos | Britannica" . www.britannica.com . 13 de septiembre de 2025. Consultado el 24 de octubre de 2025 .
- ↑ "Medición de la precisión de la conversión de voz a texto: explicación de la tasa de error de palabras" . picovoice.ai . 2 de noviembre de 2022. Consultado el 24 de octubre de 2025 .
- ↑ "Escucha: Tu asistente de IA también se vuelve loco por NPR" . NPR . 6 de marzo de 2016. Archivado del original el 23 de julio de 2017.
- ↑ Claburn, Thomas (25 de agosto de 2017). "¿Es posible controlar Amazon Alexa y Google Now mediante comandos inaudibles? ¡Por supuesto!" . The Register . Archivado del original el 2 de septiembre de 2017.
- ↑ "Ataque dirigido a sistemas de reconocimiento automático de voz" . vice.com . 31 de enero de 2018. Archivado del original el 3 de marzo de 2018. Consultado el 1 de mayo de 2018 .
- ↑ Beigi, Homayoon (2011). Fundamentos del reconocimiento de hablantes . Nueva York: Springer. ISBN 978-0-387-77591-3Archivado del original el 31 de enero de 2018 .
- ↑ Povey, D., Ghoshal, A., Boulianne, G., Burget, L., Glembek, O., Goel, N., ... & Vesely, K. (2011). El kit de herramientas de reconocimiento de voz Kaldi. En IEEE 2011 workshop on automatic speech recognition and understanding (No. CONF). IEEE Signal Processing Society.
- ↑ "Voz común de Mozilla" . voice.mozilla.org . Archivado del original el 27 de febrero de 2020. Consultado el 9 de noviembre de 2019 .
- ↑ "Implementación en TensorFlow de la arquitectura DeepSpeech de Baidu: mozilla/DeepSpeech" . 9 de noviembre de 2019. Archivado del original el 9 de septiembre de 2024. Recuperado el 9 de septiembre de 2024 a través de GitHub.
- ↑ "GitHub - tensorflow/docs: Documentación de TensorFlow" . 9 de noviembre de 2019. Archivado del original el 9 de septiembre de 2024. Recuperado el 9 de septiembre de 2024 a través de GitHub.
- ↑ "Coqui, una startup que ofrece tecnología de expresión abierta para todos" . GitHub . Archivado del original el 9 de septiembre de 2024. Consultado el 7 de marzo de 2022 .
- ↑ Coffey, Donavyn (28 de abril de 2021). "Los maoríes intentan salvar su idioma de las grandes tecnológicas" . Wired UK . ISSN 1357-0978 . Archivado del original el 9 de septiembre de 2024. Consultado el 16 de octubre de 2021 .
- ↑ "Por qué deberías pasarte de DeepSpeech a coqui.ai" . Mozilla Discourse . 7 de julio de 2021. Archivado del original el 16 de octubre de 2021. Consultado el 16 de octubre de 2021 .
- ↑ "Escribe con tu voz" . Archivado del original el 9 de septiembre de 2024. Consultado el 9 de septiembre de 2024 .
- ↑ "Usar el reconocimiento de voz en Windows" . Archivado del original el 9 de abril de 2025.
Lecturas adicionales
- Cole, Ronald; Mariani, José ; Uszkoreit, Hans; Varile, Giovanni Battista; Zaenen, Annie; Zampolli; Zue, Víctor, eds. (1997). Estudio del estado del arte en tecnología del lenguaje humano . Estudios de Cambridge en procesamiento del lenguaje natural. vol. XII- XIII. Prensa de la Universidad de Cambridge. ISBN 978-0-521-59277-2.
- Junqua, J.-C.; Haton, J.-P. (1995). Robustez en el reconocimiento automático del habla: fundamentos y aplicaciones . Kluwer Academic Publishers. ISBN 978-0-7923-9646-8.
- Karat, Clare-Marie; Vergo, John; Nahamoo, David (2007). «Tecnologías de interfaz conversacional». En Sears, Andrew ; Jacko, Julie A. (eds.). Manual de interacción persona-ordenador: fundamentos, tecnologías en evolución y aplicaciones emergentes (factores humanos y ergonomía) . Lawrence Erlbaum Associates Inc. ISBN 978-0-8058-5870-9.
- Pieraccini, Roberto (2012). La voz en la máquina. Construyendo computadoras que entienden el habla . The MIT Press. ISBN 978-0-262-01685-8.
- Pirani, Giancarlo, ed. (2013). Algoritmos y arquitecturas avanzadas para la comprensión del habla . Springer Science & Business Media. ISBN 978-3-642-84341-9.
- Signer, Beat; Hoste, Lode (diciembre de 2013). "SpeeG2: una interfaz basada en voz y gestos para la entrada eficiente de texto sin controlador" . Actas de ICMI 2013. XV Conferencia Internacional sobre Interacción Multimodal. Sídney, Australia.
- Woelfel, Matthias; McDonough, John (26 de mayo de 2009). Reconocimiento de voz a distancia . Wiley. ISBN 978-0-470-51704-8.
- Reconocimiento de voz
- Identificación automática y captura de datos
- Lingüística computacional
- Técnicas de interfaz de usuario
- Historia de la interacción humano-computadora
- Accesibilidad informática
- tarea de aprendizaje automático