Articulo de referencia

Síntesis de voz

Comprobado La síntesis de voz es la producción artificial del habla humana . Un sistema informático utilizado para este fin se llama sintetizador de voz y puede implementarse en...

Comprobado
Página protegida con cambios pendientes

La síntesis de voz es la producción artificial del habla humana . Un sistema informático utilizado para este fin se llama sintetizador de voz y puede implementarse en productos de software o hardware . Un sistema de conversión de texto a voz ( TTS ) convierte texto en lenguaje natural en voz; otros sistemas convierten representaciones lingüísticas simbólicas, como transcripciones fonéticas, en voz. [ 1 ] El proceso inverso es el reconocimiento de voz .

El habla sintetizada se puede crear concatenando fragmentos de habla grabada almacenados en una base de datos . Los sistemas difieren en el tamaño de las unidades de habla almacenadas; un sistema que almacena fonemas o difonemas proporciona el mayor rango de salida, pero puede carecer de claridad. Para dominios de uso específicos, el almacenamiento de palabras o frases completas permite una salida de alta calidad. Alternativamente, un sintetizador puede incorporar un modelo del tracto vocal y otras características de la voz humana para crear una salida de voz completamente "sintética". [ 2 ]

La calidad de un sintetizador de voz se juzga por su similitud con la voz humana y por su capacidad de ser comprendido con claridad. Un programa de conversión de texto a voz inteligible permite a las personas con discapacidades visuales o dificultades de lectura escuchar palabras escritas en una computadora doméstica. El primer sistema operativo que incluyó un sintetizador de voz fue Unix en 1974, a través de la utilidad Unix speak . [ 3 ] En 2000, Microsoft Sam era el sintetizador de voz de conversión de texto a voz predeterminado utilizado por la función de accesibilidad del narrador , que venía con todos los sistemas operativos Windows 2000 y los sistemas Windows XP posteriores.

Descripción general de un sistema TTS típico

Un sistema de conversión de texto a voz (o "motor") se compone de dos partes: [ 4 ] un front-end y un back-end . El front-end tiene dos tareas principales. Primero, convierte el texto sin formato que contiene símbolos como números y abreviaturas en el equivalente de palabras escritas. Este proceso se suele llamar normalización de texto , preprocesamiento o tokenización . El front-end luego asigna transcripciones fonéticas a cada palabra y divide y marca el texto en unidades prosódicas , como frases , cláusulas y oraciones . El proceso de asignar transcripciones fonéticas a las palabras se llama conversión de texto a fonema o de grafema a fonema . Las transcripciones fonéticas y la información prosódica juntas conforman la representación lingüística simbólica que produce el front-end. El back-end, a menudo denominado sintetizador , luego convierte la representación lingüística simbólica en sonido. En ciertos sistemas, esta parte incluye el cálculo de la prosodia objetivo (contorno de tono, duraciones de fonemas), [ 5 ] que luego se impone al habla de salida.

Historia

Mucho antes de la invención del procesamiento electrónico de señales , algunas personas intentaron construir máquinas para emular el habla humana. [ 6 ] También existían leyendas sobre la existencia de " Cabezas de Bronce ", como las que involucraban al Papa Silvestre II (m. 1003 d. C.), Alberto Magno (1198-1280) y Roger Bacon (1214-1294). [ 7 ]

En 1779, el científico germano - danés Christian Gottlieb Kratzenstein ganó el primer premio en un concurso convocado por la Academia Imperial Rusa de Ciencias y Artes por modelos que construyó del tracto vocal humano que podían producir los cinco sonidos vocálicos largos (en notación del Alfabeto Fonético Internacional : [aː] , [eː] , [iː] , [oː] y [uː] ). [ 8 ] Le siguió la " máquina de habla acústico-mecánica " accionada por fuelle de Wolfgang von Kempelen de Pressburg , Hungría, descrita en un artículo de 1791. [ 9 ] Esta máquina añadió modelos de la lengua y los labios, lo que le permitió producir consonantes además de vocales. En 1837, Charles Wheatstone produjo una "máquina parlante" basada en el diseño de von Kempelen, y en 1846, Joseph Faber exhibió la " Eufonia ". En 1923, Paget resucitó el diseño de Wheatstone. [ 10 ]

En la década de 1930, Bell Labs desarrolló el vocoder , que analizaba automáticamente el habla en sus tonos y resonancias fundamentales. A partir de su trabajo con el vocoder, Homer Dudley desarrolló un sintetizador de voz controlado por teclado llamado The Voder (Voice Demonstrator), que exhibió en la Feria Mundial de Nueva York de 1939 .

Franklin S. Cooper y sus colegas de los Laboratorios Haskins construyeron el reproductor de patrones a finales de la década de 1940 y lo completaron en 1950. Existieron varias versiones de este dispositivo; actualmente solo se conserva una. La máquina convierte imágenes de los patrones acústicos del habla, representadas en forma de espectrograma, de nuevo en sonido. Utilizando este dispositivo, Alvin Liberman y sus colegas descubrieron claves acústicas para la percepción de segmentos fonéticos (consonantes y vocales).

Dispositivos electrónicos

Carcasa del ordenador y del sintetizador de voz utilizada por Stephen Hawking en 1999.

Los primeros sistemas de síntesis de voz basados ​​en computadora se originaron a finales de la década de 1950. Noriko Umeda y otros desarrollaron el primer sistema general de conversión de texto a voz en inglés en 1968, en el Laboratorio Electrotécnico de Japón. [ 11 ] En 1961, el físico John Larry Kelly, Jr. y su colega Louis Gerstman [ 12 ] utilizaron una computadora IBM 7090 para sintetizar voz, un evento entre los más destacados en la historia de Bell Labs . [ 13 ] El sintetizador de voz ( vocoder ) de Kelly recreó la canción " Daisy Bell ", con acompañamiento musical de Max Mathews . Casualmente, Arthur C. Clarke estaba visitando a su amigo y colega John Pierce en las instalaciones de Bell Labs en Murray Hill. Clarke quedó tan impresionado por la demostración que la utilizó en la escena culminante del guion de su novela 2001: Una odisea del espacio , [ 14 ] donde la computadora HAL 9000 canta la misma canción mientras el astronauta Dave Bowman la pone a dormir. [ 15 ] A pesar del éxito de la síntesis de voz puramente electrónica, la investigación sobre sintetizadores de voz mecánicos continúa. [ 16 ]

La codificación predictiva lineal (LPC), una forma de codificación de voz , comenzó a desarrollarse con el trabajo de Fumitada Itakura de la Universidad de Nagoya y Shuzo Saito de Nippon Telegraph and Telephone (NTT) en 1966. Bishnu S. Atal y Manfred R. Schroeder realizaron nuevos avances en la tecnología LPC en los Laboratorios Bell durante la década de 1970. [ 17 ] Posteriormente, la LPC fue la base de los primeros chips sintetizadores de voz, como los chips de voz LPC de Texas Instruments utilizados en los juguetes Speak & Spell a partir de 1978.

En 1975, Fumitada Itakura desarrolló el método de pares espectrales de línea (LSP) para la codificación de voz de alta compresión, mientras trabajaba en NTT. [ 18 ] [ 19 ] [ 20 ] De 1975 a 1981, Itakura estudió problemas en el análisis y la síntesis de voz basados ​​en el método LSP. [ 20 ] En 1980, su equipo desarrolló un chip sintetizador de voz basado en LSP. LSP es una tecnología importante para la síntesis y codificación de voz, y en la década de 1990 fue adoptada por casi todos los estándares internacionales de codificación de voz como un componente esencial, contribuyendo a la mejora de la comunicación de voz digital a través de canales móviles e Internet. [ 19 ]

En 1975 se lanzó MUSA , uno de los primeros sistemas de síntesis de voz. Consistía en un hardware informático independiente y un software especializado que le permitía leer italiano. Una segunda versión, lanzada en 1978, también podía cantar italiano a capela . [ 21 ]

Grabación de demostración de DECtalk utilizando las voces de Perfect Paul y Uppity Ursula.

Los sistemas dominantes en las décadas de 1980 y 1990 fueron el sistema DECtalk , basado en gran medida en el trabajo de Dennis Klatt en el MIT, y el sistema de Bell Labs; [ 22 ] este último fue uno de los primeros sistemas multilingües independientes del idioma, que hizo un uso extensivo de métodos de procesamiento del lenguaje natural .

Fidelity Voice Chess Challenger (1979), la primera computadora de ajedrez parlante
Salida de voz de Fidelity Voice Chess Challenger

Los dispositivos electrónicos portátiles con síntesis de voz comenzaron a aparecer en la década de 1970. Uno de los primeros fue la calculadora portátil Speech+ de Telesensory Systems Inc. (TSI) para ciegos en 1976. [ 23 ] [ 24 ] Otros dispositivos tenían principalmente fines educativos, como el juguete Speak & Spell producido por Texas Instruments en 1978. [ 25 ] Fidelity lanzó una versión parlante de su computadora de ajedrez electrónica en 1979. [ 26 ] El primer videojuego en presentar síntesis de voz fue el juego arcade de disparos de 1980 , Stratovox (conocido en Japón como Speak & Rescue ), de Sun Electronics . [ 27 ] [ 28 ] El primer juego de computadora personal con síntesis de voz fue Manbiki Shoujo ( Shoplifting Girl ), lanzado en 1980 para el PET 2001 , para el cual el desarrollador del juego, Hiroshi Suzuki, desarrolló una técnica de programación de " cruce cero " para producir una forma de onda de voz sintetizada. [ 29 ] Otro ejemplo temprano, la versión arcade de Berzerk , también data de 1980. La compañía Milton Bradley produjo el primer juego electrónico multijugador que utilizaba síntesis de voz, Milton , en el mismo año.

En 1976, Computalker Consultants lanzó su sintetizador de voz CT-1. Diseñado por D. Lloyd Rice y Jim Cooper, era un sintetizador analógico construido para funcionar con microcomputadoras que utilizaban el estándar de bus S-100. [ 30 ]

Las voces sintetizadas solían sonar masculinas hasta 1990, cuando Ann Syrdal , de los Laboratorios Bell de AT&T , creó una voz femenina. [ 31 ]

Ray Kurzweil predijo en 2005 que, a medida que la relación costo-rendimiento hiciera que los sintetizadores de voz fueran más baratos y accesibles, más personas se beneficiarían del uso de programas de conversión de texto a voz. [ 32 ]

Inteligencia artificial

En septiembre de 2016, DeepMind lanzó WaveNet , que demostró que los modelos de aprendizaje profundo son capaces de modelar formas de onda sin procesar y generar voz a partir de características acústicas como espectrogramas o espectrogramas Mel , dando inicio al campo de la síntesis de voz mediante aprendizaje profundo . Aunque WaveNet se consideró inicialmente costoso computacionalmente y lento para su uso en productos de consumo en ese momento, un año después de su lanzamiento, DeepMind presentó una versión modificada de WaveNet conocida como "Parallel WaveNet", un modelo de producción 1000 veces más rápido que el original. [ 33 ] A esto le siguió Tacotron 2 de Google AI en 2018, que demostró que las redes neuronales podían producir síntesis de voz altamente natural pero requería datos de entrenamiento sustanciales (normalmente decenas de horas de audio) para lograr una calidad aceptable. Tacotron 2 empleó una arquitectura de autoencoder con mecanismos de atención para convertir el texto de entrada en espectrogramas Mel, que luego se convirtieron en formas de onda utilizando un vocoder neuronal separado . Cuando se entrenó con conjuntos de datos más pequeños, como 2 horas de habla, la calidad de la salida se degradó aunque aún pudo mantener un habla inteligible, y con solo 24 minutos de datos de entrenamiento, Tacotron 2 no logró producir habla inteligible. [ 34 ]

En 2019, Microsoft Research presentó FastSpeech, que solucionó las limitaciones de velocidad en modelos autorregresivos como Tacotron 2. [ 35 ] Ese mismo año se lanzó HiFi-GAN, un vocoder basado en redes generativas antagónicas (GAN) que mejoró la eficiencia de la generación de formas de onda al tiempo que producía voz de alta fidelidad. [ 36 ] En 2020, el lanzamiento de Glow-TTS introdujo un enfoque basado en flujo que permitió capacidades de inferencia rápida y transferencia de estilo de voz. [ 37 ]

En marzo de 2020, se lanzó el sitio web gratuito de conversión de texto a voz 15.ai. 15.ai obtuvo una amplia atención internacional a principios de 2021 por su capacidad de sintetizar el habla emocionalmente expresiva de personajes ficticios de medios populares con una cantidad mínima de datos. [ 38 ] [ 39 ] [ 40 ] El creador de 15.ai afirmó que 15 segundos de datos de entrenamiento son suficientes para clonar perfectamente la voz de una persona (de ahí su nombre, "15.ai"), una reducción significativa con respecto al requisito de datos conocido anteriormente de decenas de horas. [ 41 ] Se le atribuye a 15.ai ser la primera plataforma en popularizar la clonación de voz por IA en memes y creación de contenido . [ 42 ] [ 43 ] [ 41 ] En enero de 2022, se produjo el primer caso de fraude de NFT de síntesis de voz cuando una empresa de criptomonedas llamada Voiceverse generó líneas de voz utilizando 15.ai , las modificó para que sonaran irreconocibles, las promocionó como un subproducto de su propia tecnología y las vendió como NFT sin permiso. [ 44 ] [ 45 ] [ 46 ] [ 47 ]

En enero de 2023, ElevenLabs lanzó su plataforma de conversión de texto a voz basada en navegador, que emplea algoritmos avanzados para analizar aspectos contextuales del texto y detectar emociones como ira, tristeza, felicidad o alarma. [ 48 ] [ 49 ] [ 50 ] La plataforma puede ajustar la entonación y el ritmo según el contexto lingüístico para producir un habla realista con inflexión humana, y ofrece funciones que incluyen la generación de voz multilingüe y la creación de contenido extenso. [ 51 ] [ 52 ]

En marzo de 2024, OpenAI corroboró el tiempo de referencia de 15 segundos para clonar la voz humana. [ 53 ] Sin embargo, consideraron que su herramienta Voice Engine era "demasiado arriesgada" para su lanzamiento general, y afirmaron que solo lanzarían una versión preliminar y no la tecnología para uso público. [ 54 ]

Tecnologías de sintetizadores

Las cualidades más importantes de un sistema de síntesis de voz son la naturalidad y la inteligibilidad . [ 55 ] La naturalidad describe cuán similar suena la salida al habla humana, mientras que la inteligibilidad es la facilidad con la que se entiende la salida. El sintetizador de voz ideal es natural e inteligible. Los sistemas de síntesis de voz generalmente intentan maximizar ambas características.

Las dos tecnologías principales para generar formas de onda de voz sintética son la síntesis concatenativa y la síntesis de formantes . Cada tecnología tiene sus ventajas y desventajas, y el uso previsto de un sistema de síntesis suele determinar qué enfoque se emplea.

Síntesis por concatenación

La síntesis concatenativa se basa en la concatenación (unión) de segmentos de voz grabada. Generalmente, la síntesis concatenativa produce la voz sintetizada con un sonido más natural. Sin embargo, las diferencias entre las variaciones naturales del habla y la naturaleza de las técnicas automatizadas para segmentar las ondas a veces provocan fallos audibles en la salida. Existen tres subtipos principales de síntesis concatenativa.

Síntesis de selección de unidades

La síntesis de selección de unidades utiliza grandes bases de datos de habla grabada. Durante la creación de la base de datos, cada enunciado grabado se segmenta en algunos o todos los siguientes: fonemas individuales , difonos , semifonemas, sílabas , morfemas , palabras , frases y oraciones . Normalmente, la división en segmentos se realiza utilizando un reconocedor de voz especialmente modificado configurado en un modo de "alineación forzada" con alguna corrección manual posterior, utilizando representaciones visuales como la forma de onda y el espectrograma . [ 56 ] Luego se crea un índice de las unidades en la base de datos de voz basado en la segmentación y parámetros acústicos como la frecuencia fundamental ( tono ), duración, posición en la sílaba y fonemas vecinos. En tiempo de ejecución , el enunciado objetivo deseado se crea determinando la mejor cadena de unidades candidatas de la base de datos (selección de unidades). Este proceso se logra normalmente utilizando un árbol de decisión ponderado especialmente .

La selección de unidades proporciona la mayor naturalidad, ya que aplica solo una pequeña cantidad de procesamiento digital de señales (DSP) al habla grabada. El DSP a menudo hace que el habla grabada suene menos natural, aunque algunos sistemas utilizan una pequeña cantidad de procesamiento de señales en el punto de concatenación para suavizar la forma de onda. La salida de los mejores sistemas de selección de unidades suele ser indistinguible de las voces humanas reales, especialmente en los contextos para los que se ha ajustado el sistema TTS. Sin embargo, la máxima naturalidad normalmente requiere bases de datos de voz de selección de unidades muy grandes, que en algunos sistemas alcanzan los gigabytes de datos grabados, lo que representa decenas de horas de habla. [ 57 ] Además, se sabe que los algoritmos de selección de unidades seleccionan segmentos de un lugar que da como resultado una síntesis menos que ideal (por ejemplo, las palabras menores se vuelven ininteligibles) incluso cuando existe una mejor opción en la base de datos. [ 58 ] Recientemente, los investigadores han propuesto varios métodos automatizados para detectar segmentos poco naturales en los sistemas de síntesis de voz de selección de unidades. [ 59 ]

Síntesis de difonos

La síntesis de difonos utiliza una base de datos de voz mínima que contiene todos los difonos (transiciones de sonido a sonido) que se producen en un idioma. El número de difonos depende de la fonotáctica del idioma: por ejemplo, el español tiene unos 800 difonos y el alemán unos 2500. En la síntesis de difonos, solo se contiene un ejemplo de cada difono en la base de datos de voz. En tiempo de ejecución, la prosodia objetivo de una oración se superpone a estas unidades mínimas mediante técnicas de procesamiento de señales digitales como la codificación predictiva lineal , PSOLA [ 60 ] o MBROLA [ 61 ] , o técnicas más recientes como la modificación del tono en el dominio de la fuente utilizando la transformada discreta del coseno [ 62 ] . La síntesis de difonos sufre de los fallos sonoros de la síntesis concatenativa y la naturaleza robótica de la síntesis de formantes, y tiene pocas de las ventajas de ambos enfoques aparte de su pequeño tamaño. Por ello, su uso en aplicaciones comerciales está disminuyendo, aunque se sigue utilizando en investigación debido a que existen varias implementaciones de software disponibles gratuitamente. Un ejemplo temprano de síntesis de difonemas es el robot de enseñanza Leachim , inventado por Michael J. Freeman . [ 63 ] Leachim contenía información sobre el currículo de la clase y cierta información biográfica sobre los estudiantes a quienes estaba programado para enseñar. [ 64 ] Fue probado en un aula de cuarto grado en el Bronx, Nueva York . [ 65 ] [ 66 ]

Síntesis específica de dominio

La síntesis específica de dominio concatena palabras y frases pregrabadas para crear enunciados completos. Se utiliza en aplicaciones donde la variedad de textos que el sistema generará se limita a un dominio particular, como anuncios de horarios de transporte público o informes meteorológicos. [ 67 ] La tecnología es muy sencilla de implementar y se ha utilizado comercialmente durante mucho tiempo en dispositivos como relojes parlantes y calculadoras. El nivel de naturalidad de estos sistemas puede ser muy alto porque la variedad de tipos de oraciones es limitada y se ajustan fielmente a la prosodia y la entonación de las grabaciones originales.

Debido a que estos sistemas están limitados por las palabras y frases en sus bases de datos, no son de propósito general y solo pueden sintetizar las combinaciones de palabras y frases con las que han sido preprogramados. Sin embargo, la mezcla de palabras dentro del lenguaje hablado naturalmente aún puede causar problemas a menos que se tengan en cuenta las muchas variaciones. Por ejemplo, en los dialectos no róticos del inglés, la "r" en palabras como "clear" /ˈklɪə/ generalmente solo se pronuncia cuando la palabra siguiente tiene una vocal como su letra inicial (por ejemplo, "clear out" se realiza como /ˌklɪəɹˈʌʊt/ ). De manera similar en francés , muchas consonantes finales ya no son mudas si van seguidas de una palabra que comienza con una vocal, un efecto llamado liaison . Esta alternancia no puede ser reproducida por un sistema simple de concatenación de palabras, que requeriría una complejidad adicional para ser sensible al contexto .

Síntesis de formantes

La síntesis de formantes no utiliza muestras de habla humana en tiempo de ejecución. En cambio, la salida de habla sintetizada se crea utilizando síntesis aditiva y un modelo acústico ( síntesis de modelado físico ). [ 68 ] Parámetros como la frecuencia fundamental , la sonoridad y los niveles de ruido varían con el tiempo para crear una forma de onda de habla artificial. Este método a veces se denomina síntesis basada en reglas ; sin embargo, muchos sistemas concatenativos también tienen componentes basados ​​en reglas. Muchos sistemas basados ​​en la tecnología de síntesis de formantes generan habla artificial, con sonido robótico, que nunca se confundiría con habla humana. Sin embargo, la máxima naturalidad no siempre es el objetivo de un sistema de síntesis de voz, y los sistemas de síntesis de formantes tienen ventajas sobre los sistemas concatenativos. El habla sintetizada por formantes puede ser fiablemente inteligible, incluso a velocidades muy altas, evitando los fallos acústicos que suelen afectar a los sistemas concatenativos. El habla sintetizada de alta velocidad es utilizada por personas con discapacidad visual para navegar rápidamente por ordenadores mediante un lector de pantalla . Los sintetizadores de formantes suelen ser programas más pequeños que los sistemas concatenativos, ya que no disponen de una base de datos de muestras de voz. Por lo tanto, pueden utilizarse en sistemas embebidos , donde la memoria y la potencia del microprocesador son especialmente limitadas. Gracias a que los sistemas basados ​​en formantes controlan por completo todos los aspectos de la voz de salida, pueden generar una amplia variedad de prosodias e entonaciones , transmitiendo no solo preguntas y afirmaciones, sino también diversas emociones y tonos de voz.

Ejemplos de control de entonación de alta precisión, aunque no en tiempo real, en la síntesis de formantes incluyen el trabajo realizado a finales de la década de 1970 para el juguete Speak & Spell de Texas Instruments , y a principios de la década de 1980 para las máquinas recreativas de Sega [ 69 ] y en muchos juegos de arcade de Atari, Inc. [ 70 ] utilizando los chips LPC TMS5220 . Crear una entonación adecuada para estos proyectos fue una tarea ardua, y los resultados aún no han sido igualados por las interfaces de conversión de texto a voz en tiempo real. [ 71 ]

Para lenguas tonales, como el chino o el taiwanés, se requieren diferentes niveles de sandhi tonal y, a veces, la salida del sintetizador de voz puede dar lugar a errores de sandhi tonal. [ 72 ]

Síntesis articulatoria

La síntesis articulatoria consiste en técnicas computacionales para sintetizar el habla basándose en modelos del tracto vocal humano y los procesos de articulación que allí ocurren. El primer sintetizador articulatorio utilizado regularmente en experimentos de laboratorio fue desarrollado en los Laboratorios Haskins a mediados de la década de 1970 por Philip Rubin , Tom Baer y Paul Mermelstein. Este sintetizador, conocido como ASY, se basó en modelos del tracto vocal desarrollados en los Laboratorios Bell en las décadas de 1960 y 1970 por Paul Mermelstein, Cecil Coker y sus colegas.

Hasta hace poco, los modelos de síntesis articulatoria no se habían incorporado a los sistemas comerciales de síntesis de voz. Una excepción notable es el sistema basado en NeXT , desarrollado y comercializado originalmente por Trillium Sound Research, una empresa derivada de la Universidad de Calgary , donde se llevó a cabo gran parte de la investigación original. Tras la desaparición de las diversas versiones de NeXT (fundada por Steve Jobs a finales de la década de 1980 y fusionada con Apple Computer en 1997), el software de Trillium se publicó bajo la Licencia Pública General GNU, y el trabajo continuó como gnuspeech . El sistema, comercializado por primera vez en 1994, proporciona una conversión completa de texto a voz basada en la articulación, utilizando una guía de ondas o una línea de transmisión análoga de los tractos oral y nasal humanos, controlada por el "modelo de región distintiva" de Carré.

Los sintetizadores más recientes, desarrollados por Jorge C. Lucero y sus colegas, incorporan modelos de biomecánica de las cuerdas vocales, aerodinámica glótica y propagación de ondas acústicas en los bronquios, la tráquea, las cavidades nasales y orales, y constituyen así sistemas completos de simulación del habla basados ​​en la física. [ 73 ] [ 74 ]

Síntesis basada en HMM

La síntesis basada en HMM es un método de síntesis basado en modelos ocultos de Markov , también llamado síntesis paramétrica estadística. En este sistema, el espectro de frecuencia ( tracto vocal ), la frecuencia fundamental (fuente de voz) y la duración ( prosodia ) del habla se modelan simultáneamente mediante HMM. Las formas de onda del habla se generan a partir de los propios HMM según el criterio de máxima verosimilitud . [ 75 ]

Síntesis de onda sinusoidal

La síntesis de onda sinusoidal es una técnica para sintetizar el habla mediante la sustitución de los formantes (bandas principales de energía) por silbidos de tono puro. [ 76 ]

Síntesis basada en aprendizaje profundo

Ejemplo de síntesis de voz utilizando el vocoder neuronal HiFi-GAN

La síntesis de voz mediante aprendizaje profundo utiliza redes neuronales profundas (DNN) para producir voz artificial a partir de texto (conversión de texto a voz) o espectro (vocoder). Estas redes neuronales se entrenan con una gran cantidad de grabaciones de voz y, en el caso de un sistema de conversión de texto a voz, con las etiquetas asociadas y/o el texto de entrada.

deepfakes de audio

Clip de audio deepfake que simula la voz de Donald Trump

La tecnología de deepfake de audio , también conocida como clonación de voz o audio deepfake, es una aplicación de inteligencia artificial diseñada para generar habla que imita de manera convincente a individuos específicos, a menudo sintetizando frases u oraciones que nunca han pronunciado. [ 77 ] [ 78 ] [ 79 ] [ 80 ]

Desarrollado inicialmente con la intención de mejorar diversos aspectos de la vida humana, tiene aplicaciones prácticas como la generación de audiolibros y la asistencia a personas que han perdido la voz debido a afecciones médicas . [ 81 ] [ 82 ] Además, tiene usos comerciales, incluyendo la creación de asistentes digitales personalizados, sistemas de conversión de texto a voz con sonido natural y servicios avanzados de traducción de voz . [ 83 ] Al igual que otras formas de deepfakes, los deepfakes de audio han sido objeto de críticas por su uso en estafas , phishing y campañas de desinformación .

En 2023, el reportero de VICE, Joseph Cox, publicó hallazgos que indicaban que había grabado cinco minutos de sí mismo hablando y luego había utilizado una herramienta desarrollada por ElevenLabs para crear deepfakes de voz que burlaban el sistema de autenticación de voz de un banco . [ 84 ]

Desafíos

Desafíos de la normalización de texto

El proceso de normalización de textos rara vez es sencillo. Los textos están llenos de heterónimos , números y abreviaturas que requieren ser convertidos a una representación fonética. En inglés existen muchas grafías que se pronuncian de forma diferente según el contexto. Por ejemplo, «My latest project is to learn how to better project my voice» contiene dos pronunciaciones de «project».

La mayoría de los sistemas de conversión de texto a voz (TTS) no generan representaciones semánticas de los textos de entrada, ya que los procesos para hacerlo son poco fiables, se comprenden mal y son computacionalmente ineficientes. Por consiguiente, se utilizan diversas técnicas heurísticas para intentar desambiguar los homógrafos , como examinar las palabras vecinas y utilizar estadísticas sobre su frecuencia de aparición.

Recientemente, los sistemas TTS han comenzado a utilizar HMM (como se mencionó anteriormente ) para generar " partes de la oración " y así ayudar a desambiguar homógrafos. Esta técnica resulta bastante eficaz en muchos casos, como por ejemplo, para determinar si "read" debe pronunciarse como "red" (que implica pasado) o como "reed" (que implica presente). Los índices de error típicos al usar HMM de esta manera suelen ser inferiores al cinco por ciento. Estas técnicas también funcionan bien para la mayoría de las lenguas europeas, aunque el acceso a los corpus de entrenamiento necesarios suele ser difícil en estos idiomas.

Decidir cómo convertir números es otro problema que los sistemas TTS deben abordar. Es un desafío de programación sencillo convertir un número en palabras (al menos en inglés), como "1325" que se convierte en "mil trescientos veinticinco". Sin embargo, los números aparecen en muchos contextos diferentes; "1325" también puede leerse como "uno tres dos cinco", "trece veinticinco" o "mil trescientos veinticinco". Un sistema TTS a menudo puede inferir cómo expandir un número basándose en las palabras, números y signos de puntuación que lo rodean, y a veces el sistema proporciona una forma de especificar el contexto si es ambiguo. [ 85 ] Los números romanos también pueden leerse de manera diferente según el contexto. Por ejemplo, "Enrique VIII" se lee como "Enrique el Octavo", mientras que "Capítulo VIII" se lee como "Capítulo Ocho".

De igual modo, las abreviaturas pueden ser ambiguas. Por ejemplo, la abreviatura "in" para "inches" debe diferenciarse de la palabra "in", y la dirección "12 St John St." usa la misma abreviatura para "Saint" y "Street". Los sistemas TTS con interfaces inteligentes pueden hacer conjeturas fundamentadas sobre las abreviaturas ambiguas, mientras que otros proporcionan el mismo resultado en todos los casos, lo que da lugar a resultados sin sentido (y a veces cómicos), como " Ulysses S. Grant " que se traduce como "Ulysses South Grant".

Desafíos de conversión de texto a fonemas

Los sistemas de síntesis de voz utilizan dos enfoques básicos para determinar la pronunciación de una palabra a partir de su ortografía , un proceso que a menudo se denomina conversión de texto a fonema o de grafema a fonema ( fonema es el término que utilizan los lingüistas para describir los sonidos distintivos de un idioma ). El enfoque más sencillo para la conversión de texto a fonema es el basado en diccionario, donde el programa almacena un diccionario extenso que contiene todas las palabras de un idioma y sus pronunciaciones correctas . Determinar la pronunciación correcta de cada palabra consiste en buscarla en el diccionario y reemplazar la ortografía con la pronunciación especificada en él. El otro enfoque se basa en reglas, en el que se aplican reglas de pronunciación a las palabras para determinar su pronunciación a partir de su ortografía. Esto es similar al método de "decodificación fonética" o fonética sintética para aprender a leer.

Cada enfoque tiene sus ventajas y desventajas. El enfoque basado en diccionarios es rápido y preciso, pero falla por completo si se le proporciona una palabra que no se encuentra en su diccionario. A medida que aumenta el tamaño del diccionario, también lo hacen los requisitos de memoria del sistema de síntesis. Por otro lado, el enfoque basado en reglas funciona con cualquier entrada, pero la complejidad de las reglas aumenta sustancialmente a medida que el sistema considera ortografías o pronunciaciones irregulares. (Considere que la palabra "of" es muy común en inglés, pero es la única en la que la letra "f" se pronuncia [v] ). Como resultado, casi todos los sistemas de síntesis de voz utilizan una combinación de estos enfoques.

Las lenguas con ortografía fonémica poseen un sistema de escritura muy regular, y la predicción de la pronunciación de las palabras a partir de su ortografía resulta bastante eficaz. Los sistemas de síntesis de voz para estas lenguas suelen emplear ampliamente el método basado en reglas, recurriendo a diccionarios solo para aquellas pocas palabras, como nombres extranjeros y préstamos lingüísticos, cuya pronunciación no resulta obvia a partir de su ortografía. Por otro lado, los sistemas de síntesis de voz para lenguas como el inglés, que tienen sistemas ortográficos extremadamente irregulares, tienden a depender más de los diccionarios y a utilizar métodos basados ​​en reglas únicamente para palabras inusuales o que no figuran en ellos.

Desafíos de la evaluación

La evaluación consistente de los sistemas de síntesis de voz puede resultar difícil debido a la falta de criterios de evaluación objetivos y universalmente aceptados. Diferentes organizaciones suelen utilizar datos de voz distintos. La calidad de estos sistemas también depende de la técnica de producción (que puede incluir grabación analógica o digital) y de los medios utilizados para reproducir la voz. Por lo tanto, la evaluación de los sistemas de síntesis de voz se ha visto frecuentemente dificultada por las diferencias entre las técnicas de producción y los sistemas de reproducción.

Sin embargo, desde 2005, algunos investigadores han comenzado a evaluar sistemas de síntesis de voz utilizando un conjunto de datos de voz común. [ 86 ]

Prosódica y contenido emocional

Un estudio publicado en la revista Speech Communication por Amy Drahota y sus colegas de la Universidad de Portsmouth , Reino Unido , informó que los oyentes de grabaciones de voz podían determinar, con una precisión superior al azar, si el hablante estaba sonriendo o no. [ 87 ] [ 88 ] [ 89 ] Se sugirió que la identificación de las características vocales que señalan el contenido emocional puede utilizarse para ayudar a que el habla sintetizada suene más natural. Uno de los problemas relacionados es la modificación del contorno de tono de la oración, dependiendo de si es una oración afirmativa, interrogativa o exclamativa. Una de las técnicas para la modificación del tono [ 62 ] utiliza la transformada discreta del coseno en el dominio de la fuente ( residuo de predicción lineal ). Estas técnicas de modificación de tono síncronas requieren un marcado de tono a priori de la base de datos de voz sintetizada utilizando técnicas como la extracción de épocas utilizando el índice de explosión dinámica aplicado al residuo de predicción lineal integrado de las regiones sonoras del habla. [ 90 ] En general, la prosodia sigue siendo un desafío para los sintetizadores de voz y es un tema de investigación activo.

Hardware dedicado

Un kit de síntesis de voz producido por Bell System.

Sistemas de hardware y software

Sistemas populares que ofrecen síntesis de voz como una función integrada.

Instrumentos Texas

Demostración de voz de la TI-99/4A utilizando el vocabulario integrado

A principios de la década de 1980, TI era reconocida como pionera en la síntesis de voz, y ofrecía un popular módulo sintetizador de voz enchufable para las calculadoras TI-99/4 y 4A. Estos sintetizadores se regalaban con la compra de varios cartuchos y se utilizaban en numerosos videojuegos desarrollados por TI (entre ellos, Alpiner y Parsec ). El sintetizador empleaba una variante de codificación predictiva lineal y contaba con un pequeño vocabulario integrado. La idea original era lanzar pequeños cartuchos que se conectaran directamente a la unidad del sintetizador, lo que ampliaría el vocabulario del dispositivo. Sin embargo, el éxito de la conversión de texto a voz por software en el cartucho Terminal Emulator II frustró este plan.

Mattel

La consola de videojuegos Mattel Intellivision ofreció el módulo de síntesis de voz Intellivoice en 1982. Este incluía el chip sintetizador de voz SP0256 Narrator en un cartucho extraíble. El Narrator contaba con 2 kB de memoria de solo lectura (ROM), que se utilizaba para almacenar una base de datos de palabras genéricas que podían combinarse para formar frases en los juegos de Intellivision. Dado que el chip Narrator también podía recibir datos de voz de una memoria externa, cualquier palabra o frase adicional necesaria podía almacenarse dentro del propio cartucho. Los datos consistían en cadenas de coeficientes de filtro analógico para modificar el comportamiento del modelo sintético del tracto vocal del chip, en lugar de simples muestras digitalizadas.

SAM

Una demostración de SAM en el C64

También lanzado en 1982, Software Automatic Mouth fue el primer programa comercial de síntesis de voz totalmente por software. Posteriormente se utilizó como base para Macintalk . El programa estaba disponible para ordenadores Apple que no fueran Macintosh (incluidos el Apple II y el Lisa), varios modelos de Atari y el Commodore 64. La versión de Apple prefería hardware adicional que contuviera convertidores digital-analógico (DAC), aunque podía utilizar la salida de audio de un bit del ordenador (con la adición de mucha distorsión) si la tarjeta no estaba presente. El Atari utilizaba el chip de audio POKEY integrado. La reproducción de voz en el Atari normalmente desactivaba las solicitudes de interrupción y apagaba el chip ANTIC durante la salida de voz. La salida audible es una voz extremadamente distorsionada cuando la pantalla está encendida. El Commodore 64 utilizaba el chip de audio SID integrado del 64.

Atari

Demostración de síntesis de voz de Atari ST

Podría decirse que el primer sistema de voz integrado en un sistema operativo fueron los ordenadores Atari 1400XL/1450XL , que no llegaron a comercializarse alrededor de 1983. Estos utilizaban el chip Votrax SC01 y una máquina de estados finitos para permitir la síntesis de voz con texto y ortografía del inglés mundial. [ 92 ]

Los ordenadores Atari ST se vendían con el archivo "stspeech.tos" en un disquete.

Manzana

Demostración de MacinTalk 1
Demostración de MacinTalk 2 con las voces del Sr. Hughes y Marvin.

El primer sistema de voz integrado en un sistema operativo que se comercializó en grandes cantidades fue MacInTalk de Apple Computer . El software fue licenciado a los desarrolladores externos Joseph Katz y Mark Barton (más tarde, SoftVoice, Inc.) y se presentó durante la introducción de la computadora Macintosh en 1984. Esta demostración de enero requería 512 kilobytes de RAM. Como resultado, no podía ejecutarse en los 128 kilobytes de RAM con los que se lanzó la primera Mac. [ 93 ] Así que, la demostración se realizó con un prototipo de Mac de 512k, aunque los asistentes no fueron informados de esto y la demostración de síntesis creó una gran expectación por la Macintosh. A principios de la década de 1990, Apple amplió sus capacidades ofreciendo soporte de texto a voz en todo el sistema. Con la introducción de computadoras más rápidas basadas en PowerPC, incluyeron un muestreo de voz de mayor calidad. Apple también introdujo el reconocimiento de voz en sus sistemas, lo que proporcionó un conjunto de comandos fluido. Más recientemente, Apple ha añadido voces basadas en muestras. Lo que comenzó como una curiosidad, el sistema de voz de Apple Macintosh ha evolucionado hasta convertirse en un programa totalmente compatible, PlainTalk , para personas con problemas de visión. VoiceOver se incluyó por primera vez en 2005 en Mac OS X Tiger (10.4). Durante 10.4 (Tiger) y las primeras versiones de 10.5 ( Leopard ), Mac OS X solo incluía una voz estándar. A partir de 10.6 ( Snow Leopard ), el usuario puede elegir entre una amplia lista de múltiples voces. Las voces de VoiceOver ofrecen respiraciones realistas entre frases, así como una mayor claridad a altas velocidades de lectura en comparación con PlainTalk. Mac OS X también incluye say , una aplicación de línea de comandos que convierte texto en voz audible. Las Adiciones Estándar de AppleScript incluyen un verbo say que permite que un script utilice cualquiera de las voces instaladas y controle el tono, la velocidad de habla y la modulación del texto hablado.

Amazonas

Utilizado en Alexa y como Software como Servicio en AWS [ 94 ] (desde 2017).

AmigaOS

Ejemplo de síntesis de voz con la utilidad Say incluida en Workbench 1.3.

El segundo sistema operativo en incorporar capacidades avanzadas de síntesis de voz fue AmigaOS , presentado en 1985. Commodore International obtuvo la licencia de la síntesis de voz de SoftVoice, Inc., empresa que también desarrolló el sistema original de conversión de texto a voz MacinTalk . Este sistema incluía una emulación completa de voz para inglés americano, con voces masculinas y femeninas e indicadores de acentuación, gracias al chipset de audio de Amiga . [ 95 ] El sistema de síntesis se dividía en una biblioteca de traducción que convertía texto en inglés sin restricciones en un conjunto estándar de códigos fonéticos y un dispositivo narrador que implementaba un modelo de formantes para la generación de voz. AmigaOS también incluía un " Controlador de Voz " de alto nivel , que permitía a los usuarios de la línea de comandos redirigir la salida de texto a voz. La síntesis de voz se utilizaba ocasionalmente en programas de terceros, especialmente en procesadores de texto y software educativo. El software de síntesis permaneció prácticamente sin cambios desde la primera versión de AmigaOS, y Commodore finalmente eliminó la compatibilidad con la síntesis de voz a partir de AmigaOS 2.1.

A pesar de la limitación de fonemas del inglés americano, se desarrolló una versión no oficial con síntesis de voz multilingüe. Esta utilizaba una versión mejorada de la biblioteca de traducción que podía traducir varios idiomas, a partir de un conjunto de reglas para cada idioma. [ 96 ]

Microsoft Windows

Los sistemas de escritorio Windows modernos pueden usar componentes SAPI 4 y SAPI 5 para admitir la síntesis y el reconocimiento de voz . SAPI 4.0 estaba disponible como un complemento opcional para Windows 95 y Windows 98. Windows 2000 agregó Narrador , una utilidad de texto a voz para personas con discapacidad visual. Programas de terceros como JAWS para Windows, Window-Eyes, Non-visual Desktop Access, Supernova y System Access pueden realizar varias tareas de texto a voz, como leer texto en voz alta desde un sitio web específico, una cuenta de correo electrónico, un documento de texto, el portapapeles de Windows, la escritura del teclado del usuario, etc. No todos los programas pueden usar la síntesis de voz directamente. [ 97 ] Algunos programas pueden usar complementos, extensiones o adiciones para leer texto en voz alta. Hay programas de terceros disponibles que pueden leer texto desde el portapapeles del sistema.

Microsoft Speech Server es un paquete basado en servidor para la síntesis y el reconocimiento de voz. Está diseñado para su uso en red con aplicaciones web y centros de llamadas .

Votrax

Sintetizador de voz Votrax Type 'N Talk (1980)

Entre 1971 y 1996, Votrax fabricó varios componentes comerciales para sintetizadores de voz. Un sintetizador Votrax se incluyó en la primera generación de la máquina de lectura Kurzweil para ciegos.

Sistemas de conversión de texto a voz

La conversión de texto a voz (TTS, por sus siglas en inglés) se refiere a la capacidad de las computadoras para leer texto en voz alta. Un motor TTS convierte el texto escrito en una representación fonémica y luego convierte dicha representación fonémica en formas de onda que pueden emitirse como sonido. Existen motores TTS con diferentes idiomas, dialectos y vocabularios especializados disponibles a través de editores externos. [ 98 ]

Androide

La versión 1.6 de Android añadió soporte para síntesis de voz (TTS). [ 99 ]

Internet

Actualmente, existen diversas aplicaciones , complementos y herramientas que permiten leer mensajes directamente desde un cliente de correo electrónico y páginas web desde un navegador o la barra de herramientas de Google . Algunos programas especializados pueden narrar fuentes RSS . Por un lado, los narradores RSS en línea simplifican la entrega de información al permitir a los usuarios escuchar sus fuentes de noticias favoritas y convertirlas en podcasts . Por otro lado, los lectores RSS en línea están disponibles en casi cualquier ordenador personal conectado a Internet. Los usuarios pueden descargar los archivos de audio generados a dispositivos portátiles, por ejemplo, con la ayuda de un receptor de podcasts , y escucharlos mientras caminan, corren o se desplazan al trabajo.

Un campo en auge en la síntesis de voz basada en Internet es la tecnología de asistencia web , por ejemplo, «Browsealoud» de una empresa británica y Readspeaker . Puede proporcionar funcionalidad de síntesis de voz a cualquier persona (por motivos de accesibilidad, comodidad, entretenimiento o información) con acceso a un navegador web. El proyecto sin ánimo de lucro Pediaphon se creó en 2006 para proporcionar una interfaz de síntesis de voz web similar a la de Wikipedia. [ 100 ]

También se están realizando otros trabajos en el marco del W3C a través del Grupo de Incubación de Audio del W3C, con la participación de la BBC y Google Inc.

Código abierto

Existen algunos sistemas de software de código abierto , como por ejemplo:

Otros

Sonidos digitales similares

En la Conferencia de 2018 sobre Sistemas de Procesamiento de Información Neuronal (NeurIPS), investigadores de Google presentaron el trabajo «Aprendizaje por transferencia de la verificación del hablante a la síntesis de texto a voz multispeaker», que transfiere el aprendizaje de la verificación del hablante para lograr la síntesis de texto a voz, que puede sonar casi como cualquier persona a partir de una muestra de voz de solo 5 segundos. [ 103 ]

Asimismo, investigadores de Baidu Research presentaron un sistema de clonación de voz con objetivos similares en la conferencia NeurIPS de 2018, [ 104 ] aunque el resultado es bastante poco convincente.

Para 2019, las imitaciones digitales de voces habían llegado a manos de delincuentes, ya que los investigadores de Symantec conocen 3 casos en los que la tecnología de imitaciones digitales de voces se ha utilizado para cometer delitos. [ 105 ] [ 106 ]

Esto aumenta la presión sobre la situación de desinformación junto con los hechos que

lenguajes de marcado para síntesis de voz

Se han establecido varios lenguajes de marcado para la conversión de texto a voz en formato XML . El más reciente es el Speech Synthesis Markup Language (SSML), que se convirtió en recomendación del W3C en 2004. Entre los lenguajes de marcado de síntesis de voz más antiguos se encuentran el Java Speech Markup Language ( JSML ) y SABLE . Si bien cada uno de ellos se propuso como estándar, ninguno ha sido ampliamente adoptado.

Los lenguajes de marcado para la síntesis de voz se distinguen de los lenguajes de marcado para el diálogo. VoiceXML , por ejemplo, incluye etiquetas relacionadas con el reconocimiento de voz, la gestión del diálogo y la marcación por tonos, además del marcado de texto a voz.

Aplicaciones

La síntesis de voz ha sido durante mucho tiempo una herramienta tecnológica de asistencia vital y su aplicación en este ámbito es significativa y generalizada. Permite eliminar barreras ambientales para personas con una amplia gama de discapacidades. La aplicación más antigua ha sido el uso de lectores de pantalla para personas con discapacidad visual, pero los sistemas de conversión de texto a voz ahora son comúnmente utilizados por personas con dislexia y otras dificultades de lectura , así como por niños prealfabetizados. [ 109 ] También se emplean con frecuencia para ayudar a quienes tienen una discapacidad grave del habla, generalmente a través de un dispositivo de comunicación con salida de voz específico . [ 110 ] Se están desarrollando herramientas para personalizar una voz sintética y que se ajuste mejor a la personalidad o la voz histórica de una persona. [ 111 ] Una aplicación destacada de la síntesis de voz fue la máquina de lectura Kurzweil para ciegos, que incorporaba software de conversión de texto a fonética basado en el trabajo de los Laboratorios Haskins y un sintetizador de caja negra construido por Votrax . [ 112 ]

Stephen Hawking fue una de las personas más famosas en utilizar un ordenador de reconocimiento de voz para comunicarse.
Ciclo de conferencias del Milenio de la Casa Blanca - -2 - Stephen Hawking

Las técnicas de síntesis de voz también se utilizan en producciones de entretenimiento como juegos y animaciones. En 2007, Animo Limited anunció el desarrollo de un paquete de aplicaciones de software basado en su software de síntesis de voz FineSpeech, específicamente dirigido a clientes en las industrias del entretenimiento, capaz de generar narración y líneas de diálogo según las especificaciones del usuario. [ 113 ] La aplicación alcanzó la madurez en 2008, cuando NEC Biglobe anunció un servicio web que permite a los usuarios crear frases a partir de las voces de los personajes de la serie de anime japonesa Code Geass: Lelouch of the Rebellion R2 . [ 114 ] 15.ai se ha utilizado frecuentemente para la creación de contenido en varios fandoms , incluidos el fandom de My Little Pony: Friendship Is Magic , el fandom de Team Fortress 2 , el fandom de Portal y el fandom de Bob Esponja . [ 115 ] [ 116 ] [ 117 ]

La conversión de texto a voz para personas con discapacidad y dificultades de comunicación se ha generalizado. Esta tecnología también está encontrando nuevas aplicaciones; por ejemplo, la síntesis de voz combinada con el reconocimiento de voz permite la interacción con dispositivos móviles mediante interfaces de procesamiento del lenguaje natural . Algunos usuarios también han creado asistentes virtuales de IA utilizando 15.ai y software externo de control por voz. [ 38 ] [ 118 ]

La conversión de texto a voz también se utiliza en la adquisición de un segundo idioma. Voki, por ejemplo, es una herramienta educativa creada por Oddcast que permite a los usuarios crear su propio avatar parlante con diferentes acentos. Estos avatares se pueden enviar por correo electrónico, insertar en sitios web o compartir en redes sociales.

Los creadores de contenido han utilizado herramientas de clonación de voz para recrear sus voces para podcasts, [ 119 ] [ 120 ] narraciones, [ 50 ] y programas de comedia. [ 121 ] [ 122 ] [ 123 ] Los editores y autores también han utilizado dicho software para narrar audiolibros y boletines informativos. [ 124 ] [ 125 ] Otra área de aplicación es la creación de videos con IA con cabezas parlantes. Las aplicaciones web y los editores de video como Elai.io o Synthesia permiten a los usuarios crear contenido de video que involucra avatares de IA, que se hacen hablar utilizando tecnología de texto a voz. [ 126 ] [ 127 ]

La síntesis de voz es una valiosa herramienta computacional para el análisis y la evaluación de los trastornos del habla. Un sintetizador de calidad de voz , desarrollado por Jorge C. Lucero y colaboradores en la Universidad de Brasilia , simula la física de la fonación e incluye modelos de fluctuación y temblor de frecuencia vocal, ruido del flujo de aire y asimetrías laríngeas. [ 73 ] El sintetizador se ha utilizado para imitar el timbre de hablantes disfónicos con niveles controlados de aspereza, respiración y tensión. [ 74 ]

Síntesis de canto

"Encore" de Jamie Paige, que muestra tanto su propia voz en vivo como voces sintetizadas por el banco de voces Vocaloid Gumi.

En la década de 2010, la tecnología de síntesis vocal aprovechó los avances en inteligencia artificial, escucha profunda y aprendizaje automático para representar mejor los matices de la voz humana. Las nuevas bibliotecas de muestras de alta fidelidad, combinadas con estaciones de trabajo de audio digital, facilitan la edición con gran precisión, como el cambio de formantes , el ajuste del vibrato y los ajustes de vocales y consonantes. Existen bibliotecas de muestras disponibles para diversos idiomas y acentos. Gracias a los avances en la síntesis vocal, los artistas a veces utilizan bibliotecas de muestras en lugar de coristas. [ 128 ]

Véase también

Referencias

  1. Allen, Jonathan; Hunnicutt, M. Sharon; Klatt, Dennis (1987). De texto a voz: El sistema MITalk . Cambridge University Press. ISBN 978-0-521-30641-6.
  2. Rubin, P.; Baer, ​​T.; Mermelstein, P. (1981). "Un sintetizador articulatorio para la investigación perceptiva". Journal of the Acoustical Society of America . 70 (2): 321– 328. Bibcode : 1981ASAJ...70..321R . doi : 10.1121/1.386780 .
  3. McIlroy, MD (1974-04-01). "Synthetic English speech by rule" . The Journal of the Acoustical Society of America . 55 (S1): S55– S56. Bibcode : 1974ASAJ...55R..55M . doi : 10.1121/1.1919804 . ISSN 0001-4966 . 
  4. ^ van Santen, enero PH; Sproat, Richard W.; Oliva, José P.; Hirschberg, Julia (1997). Avances en la síntesis del habla . Saltador. ISBN 978-0-387-94701-3.
  5. Van Santen, J. (abril de 1994). "Asignación de duración segmental en la síntesis de texto a voz". Computer Speech & Language . 8 (2): 95– 128. doi : 10.1006/csla.1994.1005 .
  6. Gomede, Everton (10 de marzo de 2024). "La evolución de la síntesis de voz a través del aprendizaje profundo" . The Modern Scientist . Medium . Consultado el 8 de septiembre de 2025 .
  7. ""Eres mi amigo": Primeros androides y habla artificial" . The Public Domain Review . Consultado el 8 de septiembre de 2025 .
  8. Historia y desarrollo de la síntesis de voz , Universidad Tecnológica de Helsinki, consultado el 4 de noviembre de 2006.
  9. Mechanismus der menschlichen Sprache nebst der Beschreibung seiner sprechenden Maschine ("Mecanismo del habla humana con descripción de su máquina parlante", JB Degen, Viena). (en alemán)
  10. Mattingly, Ignatius G. (1974). Sebeok, Thomas A. (ed.). "Síntesis del habla para modelos fonéticos y fonológicos" (PDF) . Current Trends in Linguistics . 12. Mouton, La Haya: 2451–2487 . Archivado del original (PDF) el 12 de mayo de 2013. Consultado el 13 de diciembre de 2011 .
  11. Klatt, D (1987). "Revisión de la conversión de texto a voz para inglés". Journal of the Acoustical Society of America . 82 (3): 737– 93. Bibcode : 1987ASAJ...82..737K . doi : 10.1121/1.395275 . PMID 2958525 . 
  12. Lambert, Bruce (21 de marzo de 1992). "Louis Gerstman, de 61 años, especialista en trastornos y procesos del habla" . The New York Times .
  13. "LP "Música de las Matemáticas" creado con un ordenador IBM 7090 - Evento - Historia de la Informática . www.computinghistory.org.uk . Consultado el 10 de junio de 2026 .
  14. "Biografía de Arthur C. Clarke" . Archivado del original el 11 de diciembre de 1997. Consultado el 5 de diciembre de 2017 .
  15. "Donde "HAL" habló por primera vez (sitio web de síntesis de voz de Bell Labs)" . Bell Labs. Archivado del original el 7 de abril de 2000. Consultado el 17 de febrero de 2010 .
  16. Robot parlante antropomórfico Serie Waseda-Talker Archivado el 4 de marzo de 2016 en Wayback Machine
  17. Gray, Robert M. (2010). "Una historia del habla digital en tiempo real en redes de paquetes: Parte II de la codificación predictiva lineal y el protocolo de Internet" (PDF) . Found. Trends Signal Process . 3 (4): 203– 303. doi : 10.1561/2000000036 . ISSN 1932-8346 . Archivado (PDF) del original el 09-10-2022. 
  18. Zheng, F.; Song, Z.; Li, L.; Yu, W. (1998). "La medida de distancia para pares de espectros de línea aplicada al reconocimiento de voz" (PDF) . Actas de la 5.ª Conferencia Internacional sobre Procesamiento del Lenguaje Hablado (ICSLP'98) (3): 1123–6 . Archivado (PDF) del original el 9 de octubre de 2022.
  19. 1 2 "Lista de hitos del IEEE" . IEEE . Consultado el 15 de julio de 2019 .
  20. ^ " Historia Oral Fumitada Itakura" . Red de Historia Global IEEE. 20 de mayo de 2009 . Consultado el 21 de julio de 2009 .
  21. ^ Billi, Roberto; Canavesio, Franco; Ciaramella, Alberto ; Nebbia, Luciano (1 de noviembre de 1995). "Tecnología de voz interactiva en el trabajo: la experiencia CSELT". Comunicación del habla . 17 (3): 263– 271. doi : 10.1016/0167-6393(95)00030-R .
  22. Sproat, Richard W. (1997). Síntesis multilingüe de texto a voz: El enfoque de Bell Labs . Springer. ISBN 978-0-7923-8027-6.
  23. [TSI Speech+ y otras calculadoras parlantes]
  24. Gevaryahu, Jonathan, [ "Guía del circuito integrado LSI del sintetizador de voz TSI S14001A"]
  25. Breslow, et al. US 4326710  : "Juego electrónico parlante", 27 de abril de 1982
  26. Desafío de ajedrez por voz
  27. Las evoluciones más importantes de los videojuegos. Archivado el 15/06/2011 en Wayback Machine , GamesRadar.
  28. Adlum, Eddie (noviembre de 1985). "Los años de Replay: reflexiones de Eddie Adlum" . RePlay . Vol. 11, n.º 2, págs. 134-175 (160-3).   
  29. Szczepaniak, John (2014). La historia no contada de los desarrolladores de videojuegos japoneses . Vol. 1. SMG Szczepaniak. págs. 544–615 . ISBN   978-0992926007.
  30. "Una breve historia de Computalker" . Proyecto de historia de la síntesis de voz del Smithsonian .
  31. CadeMetz (2020-08-20). "Ann Syrdal, quien ayudó a darle voz femenina a las computadoras, muere a los 74 años" . The New York Times . Consultado el 23 de agosto de 2020 .
  32. Kurzweil, Raymond (2005). La singularidad está cerca . Penguin Books . ISBN 978-0-14-303788-0.
  33. ^ van den Oord, Aäron (12 de noviembre de 2017). "Síntesis de voz de alta fidelidad con WaveNet" . Mente profunda . Consultado el 5 de junio de 2022 .
  34. "Muestras de audio de "Entrenamiento semisupervisado para mejorar la eficiencia de los datos en la síntesis de voz de extremo a extremo"" . 30-08-2018. Archivado del original el 11-11-2020 . Consultado el 05-06-2022 .
  35. Ren, Yi (2019). "FastSpeech: Conversión de texto a voz rápida, robusta y controlable". arXiv : 1905.09263 [ cs.CL ].
  36. Kong, Jungil (2020). "HiFi-GAN: Redes generativas adversarias para la síntesis de voz eficiente y de alta fidelidad". arXiv : 2010.05646 [ cs.SD ].
  37. Kim, Jaehyeon (2020). "Glow-TTS: Un flujo generativo para la conversión de texto a voz mediante búsqueda de alineación monótona". arXiv : 2005.11129 [ eess.AS ].
  38. ^ Kurosawa, Yuki (19 de enero de 2021) . "ゲームキャラ音声読み上げソフト「15.ai」公開中。『Bajo cuento』や『Portal』のキャラに好きなセリフを言ってもらえる" [ El software de lectura de voz de personajes del juego "15.ai" ya está disponible. Obtenga personajes de Undertale y Portal para decir las líneas deseadas ] . AUTÓMATO (en japonés). Archivado desde el original el 19 de enero de 2021 . Consultado el 18 de diciembre de 2024 .
  39. 遊戲, 遊戲角落 (20 de enero de 2021). "這個AI語音可以模仿《傳送門》GLaDOS講出任何對白!連《Undertale》都可以學" Esta voz de IA puede imitar el GLaDOS de Portal diciendo cualquier diálogo! Incluso puede aprender Undertale ] . United Daily News (en chino (Taiwán)). Archivado desde el original el 19 de diciembre de 2024 . Consultado el 18 de diciembre de 2024 .
  40. ^ Lamorlette, Robin (25 de enero de 2021). "Insolite : un sitio permet de faire dire ce que vous souhaitez à GlaDOS (et à d'autres personnages de jeux vidéo)" [ Inusual: un sitio te permite hacer que GlaDOS (y otros personajes de videojuegos) digan lo que quieras ] . Clubic (en francés). Archivado desde el original el 19 de enero de 2025 . Consultado el 23 de marzo de 2025 . 
  41. 1 2 Temitope, Yusuf (10 de diciembre de 2024). "El creador de 15.ai revela su trayectoria desde el proyecto del MIT hasta convertirse en un fenómeno de internet" . The Guardian . Lagos, Nigeria. Archivado del original el 28 de diciembre de 2024. Recuperado el 25 de diciembre de 2024 .
  42. Anirudh VK (18 de marzo de 2023). "Los deepfakes están impulsando la cultura de los memes, ¿pero a qué precio?" . Analytics India Magazine . Archivado del original el 26 de diciembre de 2024. Consultado el 18 de diciembre de 2024 .
  43. Wright, Steven (21 de marzo de 2023). "Por qué la discusión entre Biden, Trump y Obama sobre videojuegos es la nueva obsesión de YouTube" . Inverse . Archivado del original el 20 de diciembre de 2024. Recuperado el 18 de diciembre de 2024 .
  44. Innes, Ruby (18 de enero de 2022). "Voiceverse es la última empresa de NFT sorprendida usando contenido ajeno" . Kotaku Australia . Archivado del original el 26 de julio de 2024. Consultado el 28 de febrero de 2025 .
  45. Phillips, Tom (17 de enero de 2022). «La empresa de NFT respaldada por Troy Baker admite haber utilizado líneas de voz tomadas de otro servicio sin permiso» . Eurogamer . Archivado del original el 17 de enero de 2022. Consultado el 31 de diciembre de 2024 .
  46. Williams, Demi (18 de enero de 2022). "Voiceverse NFT admite haber tomado líneas de voz de un servicio no comercial" . NME . Archivado del original el 18 de enero de 2022. Recuperado el 18 de diciembre de 2024 .
  47. Lam, Khoa (14 de enero de 2022). "Incidente 277: Voces creadas con una aplicación disponible públicamente robadas y revendidas como NFT sin atribución" . Base de datos de incidentes de IA . Archivado del original el 13 de enero de 2025. Recuperado el 27 de febrero de 2025 .
  48. "La IA generativa llega al doblaje cinematográfico: la startup de IA de audio ElevenLabs recauda fondos pre-semilla" . Sifted . 23 de enero de 2023. Consultado el 3 de febrero de 2023 .
  49. Equipo de WIRED. "Este podcast no está presentado por clones de voz de IA. Lo juramos" . Wired . ISSN 1059-1028 . Consultado el 25 de julio de 2023 . 
  50. 1 2 Ashworth, Boone (12 de abril de 2023). "La IA puede clonar la voz de tu presentador de podcast favorito" . Wired . Recuperado el 25 de abril de 2023 .
  51. Wiggers, Kyle (2023-06-20). "La plataforma de generación de voz ElevenLabs recauda 19 millones de dólares y lanza una herramienta de detección" . TechCrunch . Consultado el 25 de julio de 2023 .
  52. Bonk, Lawrence. "La nueva y potente herramienta de IA de ElevenLabs te permite crear un audiolibro completo en minutos" . Lifewire . Consultado el 25 de julio de 2023 .
  53. "Navegando los desafíos y oportunidades de las voces sintéticas" . OpenAI . 9 de marzo de 2024. Archivado del original el 25 de noviembre de 2024. Consultado el 18 de diciembre de 2024 .
  54. Hern, Alex (31 de marzo de 2024). "OpenAI considera que su herramienta de clonación de voz es demasiado arriesgada para su lanzamiento general" . The Guardian . Consultado el 30 de septiembre de 2025 .
  55. Taylor, Paul (2009). Síntesis de texto a voz . Cambridge, Reino Unido: Cambridge University Press. pág . 3. ISBN  9780521899277.
  56. Alan W. Black , Síntesis perfecta para todas las personas en todo momento. Taller IEEE TTS 2002.
  57. John Kominek y Alan W. Black . (2003). Bases de datos CMU ARCTIC para síntesis de voz. CMU-LTI-03-177. Instituto de Tecnologías del Lenguaje, Facultad de Informática, Universidad Carnegie Mellon.
  58. Julia Zhang. Generación de lenguaje y síntesis de voz en diálogos para el aprendizaje de idiomas , tesis de maestría, Sección 5.6 en la página 54.
  59. William Yang Wang y Kallirroi Georgila. (2011). Detección automática de segmentos de palabras no naturales en la síntesis de voz por selección de unidades , IEEE ASRU 2011.
  60. "Síntesis de superposición y adición sincronizada con el tono (PSOLA)" . Archivado del original el 22 de febrero de 2007. Consultado el 28 de mayo de 2008 .
  61. T. Dutoit, V. Pagel, N. Pierret, F. Bataille, O. van der Vrecken. El proyecto MBROLA: Hacia un conjunto de sintetizadores de voz de alta calidad para uso no comercial . Actas de la ICSLP , 1996.
  62. 1 2 Muralishankar, R.; Ramakrishnan, AG; Prathibha, P. (febrero de 2004). "Modificación del tono mediante DCT en el dominio fuente". Speech Communication . 42 (2): 143– 154. doi : 10.1016/j.specom.2003.05.001 .
  63. "Educación: Maravilla del Bronx" . Time . 1974-04-01. ISSN 0040-781X . Archivado del original el 24-05-2019 . Consultado el 28-05-2019 . 
  64. "1960 - Rudy el Robot - Michael Freeman (estadounidense)" . cyberneticzoo.com . 13 de septiembre de 2010. Consultado el 23 de mayo de 2019 .
  65. Revista New York . New York Media, LLC. 30 de julio de 1979.
  66. El futurista . Sociedad Mundial del Futuro. 1978. págs. 359, 360, 361. 
  67. LF Lamel , JL Gauvain, B. Prouts, C. Bouhier, R. Boesch. Generación y síntesis de mensajes de difusión , Actas del taller ESCA-NATO y aplicaciones de la tecnología del habla , septiembre de 1993.
  68. Dartmouth College: Música y computadoras. Archivado el 8 de junio de 2011 en Wayback Machine , 1993.
  69. Algunos ejemplos son Astro Blaster , Space Fury y Star Trek: Strategic Operations Simulator.
  70. Algunos ejemplos incluyen Star Wars , Firefox , El retorno del Jedi , El correcaminos , El Imperio contraataca , Indiana Jones y el templo maldito , 720° , Gauntlet , Gauntlet II , APB , Paperboy , RoadBlasters , Vindicators Parte II , Escape del planeta de los monstruos robot .
  71. John Holmes y Wendy Holmes (2001). Síntesis y reconocimiento del habla (2.ª ed.). CRC. ISBN  978-0-7484-0856-6.
  72. Zhu, Jian (2020-05-25). "Explorando el conocimiento fonético y fonológico de los tonos en los modelos TTS del mandarín" . Speech Prosody 2020. ISCA: ISCA: 930–934 . arXiv : 1912.10915 . doi : 10.21437/speechprosody.2020-190 . S2CID 209444942 . 
  73. 1 2 Lucero, JC; Schoentgen, J.; Behlau, M. (2013). "Síntesis basada en la física de voces desordenadas" (PDF) . Interspeech 2013. Lyon, Francia: Asociación Internacional de Comunicación del Habla: 587–591 . doi : 10.21437/Interspeech.2013-161 . S2CID 17451802. Recuperado el 27 de agosto de 2015 . 
  74. 1 2 Englert, Marina; Madazio, Glaucya; Gielow, Ingrid; Lucero, Jorge; Behlau, Mara (2016). "Identificación de errores perceptuales de voces humanas y sintetizadas". Journal of Voice . 30 (5): 639.e17–639.e23. doi : 10.1016/j.jvoice.2015.07.017 . PMID 26337775 . 
  75. "El sistema de síntesis de voz basado en HMM" . Hts.sp.nitech.ac.j. Archivado del original el 13 de febrero de 2012. Consultado el 22 de febrero de 2012 .
  76. Remez, R.; Rubin, P.; Pisoni, D.; Carrell, T. (22 de mayo de 1981). "Percepción del habla sin señales de habla tradicionales" (PDF) . Science . 212 (4497): 947– 949. Bibcode : 1981Sci...212..947R . doi : 10.1126/science.7233191 . PMID 7233191. Archivado del original (PDF) el 16 de diciembre de 2011. Recuperado el 14 de diciembre de 2011 . 
  77. Smith, Hannah; Mansted, Katherine (1 de abril de 2020). Deepfakes como arma: seguridad nacional y democracia . Vol. 28. Instituto Australiano de Política Estratégica . págs. 11–13 . ISSN 2209-9689 .   
  78. Lyu, Siwei (2020). "Detección de deepfakes: desafíos actuales y próximos pasos". 2020 IEEE International Conference on Multimedia & Expo Workshops (ICMEW) . pp. 1–6 . arXiv : 2003.09234 . doi : 10.1109/icmew46912.2020.9105991 . ISBN  978-1-7281-1485-9. S2CID 214605906 . 
  79. Diakopoulos, Nicholas; Johnson, Deborah (junio de 2020). "Anticipando y abordando las implicaciones éticas de los deepfakes en el contexto de las elecciones" . New Media & Society . 23 (7) (publicado el 5 de junio de 2020): 2072–2098 . doi : 10.1177/1461444820925811 . ISSN 1461-4448 . S2CID 226196422 .  
  80. ^ Murphy, Margi (20 de febrero de 2024). "Deepfake Audio Boom explota la inteligencia artificial de una startup valorada en mil millones de dólares" . Bloomberg.
  81. Chadha, Anupama; Kumar, Vaibhav; Kashyap, Sonu; Gupta, Mayank (2021), "Deepfake: Una visión general" , en Singh, Pradeep Kumar; Wierzchoń, Sławomir T.; Tanwar, Sudeep; Ganzha, Maria (eds.), Actas de la Segunda Conferencia Internacional sobre Computación, Comunicaciones y Ciberseguridad , Lecture Notes in Networks and Systems, vol. 203, Singapur: Springer Singapore, pp. 557–566 , doi : 10.1007/978-981-16-0733-2_39 , ISBN   978-981-16-0732-5, S2CID 236666289 , consultado el 29-06-2022 
  82. "La IA le devolvió la voz a Val Kilmer. Pero los críticos temen que la tecnología pueda ser mal utilizada" . Washington Post . ISSN 0190-8286 . Consultado el 29 de junio de 2022 . 
  83. Etienne, Vanessa (19 de agosto de 2021). "Val Kilmer recupera su voz tras luchar contra el cáncer de garganta gracias a la tecnología de IA: escucha los resultados" . PEOPLE.com . Consultado el 1 de julio de 2022 .
  84. Newman, Lily Hay. "Las falsificaciones de voz generadas por IA no son aterradoramente buenas... todavía" . Wired . ISSN 1059-1028 . Consultado el 25 de julio de 2023 . 
  85. "Síntesis de voz" . Organización World Wide Web.
  86. "Desafío de ventisca" . Festvox.org . Consultado el 22 de febrero de 2012 .
  87. "Sonríe y el mundo te oirá" . Universidad de Portsmouth. 9 de enero de 2008. Archivado del original el 17 de mayo de 2008.
  88. "Sonríe, y el mundo te oirá, aunque te escondas" . Science Daily . Enero de 2008.
  89. Drahota, A. (2008). "La comunicación vocal de diferentes tipos de sonrisa" (PDF) . Speech Communication . 50 (4): 278– 287. doi : 10.1016/j.specom.2007.10.001 . S2CID 46693018. Archivado del original (PDF) el 3 de julio de 2013. 
  90. Prathosh, AP; Ramakrishnan, AG; Ananthapadmanabha, TV (diciembre de 2013). "Extracción de época basada en el residuo de predicción lineal integrado usando el índice de explosión". IEEE Transactions on Audio, Speech, and Language Processing . 21 (12): 2471– 2480. Bibcode : 2013ITASL..21.2471P . doi : 10.1109/TASL.2013.2273717 . S2CID 10491251 . 
  91. EE Times. " TI dejará de fabricar chips dedicados a la síntesis de voz y transferirá sus productos a Sensory. Archivado el 28 de mayo de 2012 en Wayback Machine ." 14 de junio de 2001.
  92. "Especificación de referencia externa del controlador de voz 1400XL/1450XL" (PDF) . Archivado del original (PDF) el 24 de marzo de 2012. Consultado el 22 de febrero de 2012 .
  93. "¡Qué bien se siente salir de esa bolsa!" . folklore.org . Consultado el 24 de marzo de 2013 .
  94. "Amazon Polly" . Amazon Web Services, Inc. Consultado el 28 de abril de 2020 .
  95. Miner, Jay ; et al. (1991). Manual de referencia de hardware de Amiga (3.ª ed.). Addison-Wesley Publishing Company, Inc. ISBN   978-0-201-56776-2.
  96. Devitt, Francesco (30 de junio de 1995). "Biblioteca de traducción (versión multilingüe con voz)" . Archivado del original el 26 de febrero de 2012. Recuperado el 9 de abril de 2013 .
  97. "Tutoriales de accesibilidad para Windows XP: Uso del Narrador" . Microsoft. 29 de enero de 2011. Archivado del original el 21 de junio de 2003. Consultado el 29 de enero de 2011 .
  98. "Cómo configurar y usar la función de texto a voz en Windows XP y en Windows Vista" . Microsoft. 7 de mayo de 2007. Consultado el 17 de febrero de 2010 .
  99. Jean-Michel Trivi (23 de septiembre de 2009). "Introducción a la conversión de texto a voz en Android" . Android-developers.blogspot.com . Consultado el 17 de febrero de 2010 .
  100. Andreas Bischoff, Pediaphon: Interfaz de voz para la enciclopedia gratuita Wikipedia para teléfonos móviles , PDA y reproductores de MP3, Actas de la 18.ª Conferencia Internacional sobre Aplicaciones de Bases de Datos y Sistemas Expertos, Páginas: 575–579 ISBN 0-7695-2932-1, 2007
  101. "gnuspeech" . Gnu.org . Consultado el 17 de febrero de 2010 .
  102. "Proyecto de Historia de la Síntesis del Habla del Smithsonian (SSSHP) 1986–2002" . Mindspring.com. Archivado del original el 3 de octubre de 2013. Consultado el 17 de febrero de 2010 .
  103. Jia, Ye; Zhang, Yu; Weiss, Ron J. (2018-06-12), "Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis", Advances in Neural Information Processing Systems , 31 : 4485–4495 , arXiv : 1806.04558
  104. Arık, Sercan Ö.; Chen, Jitong; Peng, Kainan; Ping, Wei; Zhou, Yanqi (2018), "Clonación de voz neuronal con algunas muestras" , Avances en sistemas de procesamiento de información neuronal , 31 , arXiv : 1802.06006
  105. "Las voces falsas 'ayudan a los ciberdelincuentes a robar dinero'"" . bbc.com . BBC . 2019-07-08 . Consultado el 2019-09-11 .
  106. Drew, Harwell (4 de septiembre de 2019). "Un hito en inteligencia artificial: Se informa que un software de imitación de voz se utilizó en un robo importante" . Washington Post . Consultado el 8 de septiembre de 2019 .
  107. Thies, Justus (2016). "Face2Face: Captura facial en tiempo real y recreación de vídeos RGB" . Actas de Computer Vision and Pattern Recognition (CVPR), IEEE . Consultado el 18 de junio de 2016 .
  108. Suwajanakorn, Supasorn; Seitz, Steven; Kemelmacher-Shlizerman, Ira (2017), Synthesizing Obama: Learning Lip Sync from Audio , University of Washington , consultado el 2 de marzo de 2018.
  109. Brunow, David A.; Cullen, Theresa A. (2021-07-03). "Efecto de la conversión de texto a voz y el lector humano en la comprensión auditiva de estudiantes con dificultades de aprendizaje" . Computers in the Schools . 38 (3): 214– 231. doi : 10.1080/07380569.2021.1953362 . hdl : 11244/316759 . ISSN 0738-0569 . S2CID 243101945 .  
  110. Triandafilidi, Ioanis I.; Tatarnikova, TM; Poponin, AS (30 de mayo de 2022). «Sistema de síntesis de voz para personas con discapacidad». 2022 Wave Electronics and its Application in Information and Telecommunication Systems (WECONF) . San Petersburgo, Federación Rusa: IEEE. págs. 1–5 . doi : 10.1109/WECONF55058.2022.9803600 . ISBN  978-1-6654-7083-4. S2CID 250118756 . 
  111. Zhao, Yunxin; Song, Minguang; Yue, Yanghao; Kuruvilla-Dugdale, Mili (27 de julio de 2021). «Personalización de voces TTS para la disartria progresiva». Conferencia Internacional IEEE EMBS de 2021 sobre Informática Biomédica y de la Salud (BHI) . Atenas, Grecia: IEEE. págs. 1-4 . doi : 10.1109/BHI50953.2021.9508522 . ISBN  978-1-6654-0358-0. S2CID 236982893 . 
  112. "Evolución de las máquinas de lectura para ciegos: la investigación de los Laboratorios Haskins como estudio de caso" (PDF) . Revista de Investigación y Desarrollo en Rehabilitación . 21 (1). 1984. Archivado del original (PDF) el 25 de julio de 2021. Consultado el 3 de julio de 2021 .
  113. "Anuncian software de síntesis de voz para anime" . Anime News Network . 2 de mayo de 2007. Consultado el 17 de febrero de 2010 .
  114. "Servicio de sintetizador de voz de Code Geass ofrecido en Japón" . Animenewsnetwork.com. 9 de septiembre de 2008. Consultado el 17 de febrero de 2010 .
  115. Ruppert, Liana (18 de enero de 2021). "Haz que GLaDOS de Portal y otros personajes queridos digan las cosas más raras con esta aplicación" . Game Informer . Archivado del original el 18 de enero de 2021. Recuperado el 18 de diciembre de 2024 .
  116. Clayton, Natalie (19 de enero de 2021). "Haz que el elenco de TF2 recite memes antiguos con esta herramienta de conversión de texto a voz con IA" . PC Gamer . Archivado del original el 19 de enero de 2021. Recuperado el 18 de diciembre de 2024 .
  117. ^ "这个网站可用AI生成语音 让ACG角色"说"出你输入的文本" [ Este sitio web puede utilizar IA para generar voz, haciendo que los caracteres ACG "digan" el texto que usted ingresa ] . GamerSky (en chino). 18 de enero de 2021. Archivado desde el original el 11 de diciembre de 2024 . Consultado el 18 de diciembre de 2024 .
  118. ^ Furushima, Takayuki (18 de enero de 2021). "『Portal』のGLaDOSや『UNDERTALE』のサンズがテキストを読み上げ" [ GLaDOS de Portal y Sans de UNDERTALE leerán el texto por usted. El servicio "15.ai" pretende reproducir incluso las emociones en el texto y se convierte en tema de debate . Den Fami Nico Gamer (en japonés). Archivado del original el 18 de enero de 2021. Consultado el 18 de diciembre de 2024 .
  119. "Escucha esto: la startup de IA de clonación de voz ElevenLabs consigue 19 millones de dólares de a16z y otros pesos pesados" . VentureBeat . 20 de junio de 2023. Consultado el 25 de julio de 2023 .
  120. "Sztuczna inteligencja czyta głosem Jarosława Kuźniara. Rewolucja w radiu i podcastach" . Press.pl (en polaco). 9 de abril de 2023 . Consultado el 25 de abril de 2023 .
  121. Knibbs, Kate. "Los podcasts de IA generativa ya están aquí. Prepárense para aburrirse" . Wired . ISSN 1059-1028 . Consultado el 25 de julio de 2023 . 
  122. Suciu, Peter. "Parodia de Arrested Succession en YouTube presenta 'narración' de Ron Howard generado por IA" . Forbes . Consultado el 25 de julio de 2023 .
  123. Fadulu, Lola (6 de julio de 2023). "¿Puede la IA ser graciosa? Este grupo cree que sí" . The New York Times . ISSN 0362-4331 . Consultado el 25 de julio de 2023 . 
  124. Kanetkar, Riddhi. "La prometedora startup de IA ElevenLabs, fundada por exempleados de Google y Palantir, está a punto de recaudar 18 millones de dólares con una valoración de 100 millones de dólares. Echa un vistazo a la presentación de 14 diapositivas que utilizó para su ronda de financiación pre-semilla de 2 millones de dólares" . Business Insider . Consultado el 25 de julio de 2023 .
  125. "Empresa de voz generada por IA toma medidas enérgicas después de que 4chan creara voces de celebridades para abusar" . Vice.com . 30 de enero de 2023. Consultado el 3 de febrero de 2023 .
  126. "Uso de la conversión de texto a voz en la generación de vídeo mediante IA" . elai.io. Consultado el 10 de agosto de 2022 .
  127. "Conversión de texto a voz mediante IA para vídeos" . synthesia.io . Consultado el 12 de octubre de 2023 .
  128. Bruno, Chelsea A (25-03-2014). Síntesis vocal y escucha profunda (tesis de maestría en música). Universidad Internacional de Florida. doi : 10.25148/etd.fi14040802 .
  • Canto simulado con el robot cantante Pavarobotti o una descripción de la BBC sobre cómo el robot sintetizó el canto .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Speech_synthesis&oldid=1358741088 "