Articulo de referencia

Reconocimiento y síntesis de voz

{{cite web\n | url = https://play.google.com/store/apps/details?id=com.google.android.tts\n | title = Speech Recognition & Synthesis\n | website = Google Play\n | access-date = ...

El reconocimiento y síntesis de voz , anteriormente conocido como Servicios de voz , [ 3 ] es una aplicación de lector de pantalla desarrollada por Google para su sistema operativo Android . Permite que las aplicaciones lean en voz alta (lean) el texto en pantalla, con soporte para muchos idiomas. La conversión de texto a voz puede ser utilizada por aplicaciones como Google Play Libros para leer libros en voz alta, Google Translate para leer en voz alta traducciones de la pronunciación de palabras, Google TalkBack y otras aplicaciones de accesibilidad basadas en retroalimentación hablada, así como por aplicaciones de terceros. Los usuarios deben instalar datos de voz para cada idioma.

Historia

Algunos desarrolladores de aplicaciones han comenzado a adaptar y modificar sus aplicaciones de Android Auto para incluir la función de texto a voz, como Hyundai en 2015. [ 4 ] Aplicaciones como textPlus y WhatsApp utilizan la función de texto a voz para leer las notificaciones en voz alta y proporcionar la funcionalidad de respuesta por voz.

Google Cloud Text-to-Speech funciona con WaveNet , [ 5 ] software creado por DeepMind , la filial de IA de Google con sede en el Reino Unido , que fue adquirida por Google en 2014. [ 6 ] Intenta diferenciarse de sus competidores, Amazon y Microsoft . [ 7 ]

La mayoría de los sintetizadores de voz (incluido Siri de Apple ) utilizan síntesis concatenativa , [ 5 ] en la que un programa almacena fonemas individuales y luego los combina para formar palabras y oraciones. WaveNet sintetiza el habla con énfasis e inflexión similares a los humanos en sílabas, fonemas y palabras. A diferencia de la mayoría de los demás sistemas de conversión de texto a voz, un modelo WaveNet crea formas de onda de audio sin procesar desde cero. El modelo utiliza una red neuronal que ha sido entrenada con un gran volumen de muestras de voz. Durante el entrenamiento, la red extrae la estructura subyacente del habla, como qué tonos se suceden y cómo se ve una forma de onda de voz realista. Cuando se le proporciona una entrada de texto, el modelo WaveNet entrenado puede generar las formas de onda de voz correspondientes desde cero, una muestra a la vez, con hasta 24 000 muestras por segundo y transiciones suaves entre los sonidos individuales. [ 5 ]

El servicio pasó a llamarse Reconocimiento y Síntesis de Voz en 2023.

Idiomas compatibles

  • Afrikáans (Sudáfrica)
  • Albanés (Albania)
  • Amárico (Etiopía)
  • Árabe (Arabia Saudita)
  • asamés (India)
  • Vasco (España)
  • Bengalí (Bangladesh)
  • Bengalí (India)
  • Bodo (India)
  • Bosnio (Bosnia y Herzegovina)
  • Búlgaro (Bulgaria)
  • Birmano (Myanmar)
  • Cantonés (Hong Kong)
  • Catalán (España)
  • Chino (China)
  • Chino (Taiwán)
  • Croata (Croacia)
  • República Checa
  • Danés (Dinamarca)
  • Dogri (India)
  • Neerlandés (Bélgica)
  • Neerlandés (Países Bajos)
  • Inglés (Australia)
  • Inglés (Nigeria)
  • Inglés (India)
  • Inglés (Reino Unido)
  • Inglés (Estados Unidos)
  • Estonio (Estonia)
  • Filipino (Filipinas)
  • Finlandés (Finlandia)
  • Francés (Canadá)
  • Francés (Francia)
  • Gallego (España)
  • Alemán (Alemania)
  • Griego (Grecia)
  • Gujarati (India)
  • Hausa (Nigeria)
  • Hebreo (Israel)
  • Hindi (India)
  • Húngaro (Hungría)
  • Islandés (Islandia)
  • Indonesio (Indonesia)
  • Italiano (Italia)
  • Japonés (Japón)
  • Javanés (Indonesia)
  • Kannada (India)
  • Cachemir (India)
  • Khmer (Camboya)
  • Konkani (India)
  • Coreano (Corea del Sur)
  • Latino (Ciudad del Vaticano)
  • Letón (Letonia)
  • Lituano (Lituania)
  • Maithili (India)
  • Malayo (Malasia)
  • Malayalam (India)
  • Manipuri (India)
  • Maratí (India)
  • Nepalí (Nepal)
  • Noruego (Noruega)
  • Odia (India)
  • Polaco (Polonia)
  • Portugués (Brasil)
  • Portugués (Portugal)
  • Punjabi (India)
  • Rumano (Rumania)
  • Ruso (Rusia)
  • Sánscrito (India)
  • Santali (India)
  • Serbio (Serbia)
  • Sindhi (India)
  • Cingalés (Sri Lanka)
  • Eslovaco (Eslovaquia)
  • Esloveno (Eslovenia)
  • Español (España)
  • Español (Estados Unidos)
  • Sundanés (Indonesia)
  • Suajili (Kenia)
  • Sueco (Suecia)
  • Tamil (India)
  • Telugu (India)
  • Tailandés (Tailandia)
  • Turco (Turquía)
  • Ucraniano (Ucrania)
  • Urdu (Pakistán)
  • Urdu (India)
  • vietnamita (Vietnam)
  • Galés (Reino Unido)

Véase también

Referencias

  1. "Reconocimiento y síntesis de voz" . Google Play . Consultado el 8 de diciembre de 2025 .
  2. "Reconocimiento y síntesis de voz googletts.google-speech-apk_20251028.02_p2.827711934" . APKMirror . 12/11/2025 . Consultado el 08/12/2025 .
  3. Wang, Jules (8 de noviembre de 2021). "Nunca adivinarás cuál es la última aplicación de Google que ha superado los 10 mil millones de instalaciones (en serio)" . Android Police . Archivado del original el 8 de noviembre de 2021. Recuperado el 18 de noviembre de 2021 .
  4. "Google y Hyundai presentan nuevas aplicaciones de terceros para Android Auto" . CNET . CBS Interactive . Consultado el 17 de enero de 2015 .
  5. 1 2 3 "WaveNet" . www.deepmind.com . Consultado el 22 de junio de 2023 .
  6. Gibbs, Samuel (27 de enero de 2014). "Google compra la startup británica de inteligencia artificial Deepmind por 400 millones de libras" . The Guardian . ISSN 0261-3077 . Consultado el 22 de junio de 2023 . 
  7. "Inteligencia artificial de texto a voz: síntesis de voz realista" . Google Cloud . Consultado el 22 de junio de 2023 .