Articulo de referencia

15.ai

15.ai era una aplicación web de inteligencia artificial de uso gratuito que generaba voces de texto a voz de personajes ficticios de varias fuentes de medios. [1] [2] [3] [4] Cr...

15.ai era una aplicación web de inteligencia artificial de uso gratuito que generaba voces de texto a voz de personajes ficticios de varias fuentes de medios. [1] [2] [3] [4] Creado por un desarrollador seudónimo bajo el alias 15 , [5] [6] [7] [8] el proyecto utilizó una combinación de algoritmos de síntesis de audio , redes neuronales profundas de síntesis de voz y modelos de análisis de sentimientos para generar voces de personajes emotivas. [9] [10]

A principios de 2020, 15.ai apareció en línea como una prueba de concepto de la democratización de la actuación de voz y el doblaje . [8] [11] Su naturaleza gratuita, facilidad de uso sin cuentas de usuario y mejoras sobre las implementaciones de texto a voz existentes lo hicieron popular. [2] [1] [3] Algunos críticos y actores de voz cuestionaron la legalidad y la ética de hacer que dicha tecnología fuera tan fácilmente accesible. [12]

El sitio fue adoptado por fandoms de Internet como My Little Pony , Team Fortress 2 y Bob Esponja . [5] [13] [8]

En los años siguientes aparecieron varias alternativas comerciales. [6] [7] En enero de 2022, la empresa Voiceverse NFT plagió el trabajo de 15.ai como parte de su plataforma. [14] [15]

Las implicaciones éticas de la clonación de voces (también conocidas como deepfakes de audio ) en la creación de contenido llevaron a una reevaluación del servicio por parte del desarrollador, y se plantearon preocupaciones con respecto a los derechos de autor y el uso no autorizado de las voces de los personajes. [8] En septiembre de 2022, un año después de su último lanzamiento estable, 15.ai fue desconectado. [6]

Características

HAL 9000 , conocido por su siniestra voz robótica, era uno de los personajes disponibles en 15.ai. [1]

La plataforma no requería el registro del usuario ni la creación de una cuenta para generar voces. [16] [17] [7] [8] Los usuarios podían generar voz ingresando texto y seleccionando la voz de un personaje (especificando opcionalmente un contextualizador emocional y/o transcripciones fonéticas), y el sistema producía tres variaciones del audio con diferentes entregas emocionales. [9] La plataforma funcionaba de forma completamente gratuita , aunque el desarrollador informó que gastaba miles de dólares mensuales para mantener el servicio. [8]

Los personajes disponibles incluyeron a GLaDOS y Wheatley de Portal , personajes de Team Fortress 2 , Twilight Sparkle y otros personajes de My Little Pony: La magia de la amistad , Bob Esponja , Daria Morgendorffer y Jane Lane de Daria , el décimo Doctor Who , HAL 9000 de 2001: Una odisea del espacio , el narrador de The Stanley Parable , Carl Brutananadilewski de Aqua Teen Hunger Force , Steven Universe , Dan de Dan Vs. y Sans de Undertale . [16] [17]

La naturaleza no determinista del modelo de aprendizaje profundo aseguró que cada generación tendría entonaciones ligeramente diferentes, similares a múltiples tomas de un actor de voz . [9] [5] La aplicación admitió alterar manualmente la emoción de una línea generada utilizando contextualizadores emocionales (un término acuñado por este proyecto), una oración o frase que transmite la emoción de la toma que sirve como guía para el modelo durante la inferencia. [5] [13] Los contextualizadores emocionales eran representaciones del contenido emocional de una oración deducida a través de incrustaciones de emojis aprendidos por transferencia utilizando DeepMoji , un algoritmo de análisis de sentimientos de redes neuronales profundas desarrollado por el MIT Media Lab en 2017. [18] [19] DeepMoji se entrenó con 1.200 millones de ocurrencias de emojis en datos de Twitter de 2013 a 2017, y superó a los sujetos humanos en la identificación correcta del sarcasmo en Tweets y otros modos de comunicación en línea. [20] [21] [22]

15.ai utilizó un modelo de múltiples hablantes : se entrenaron cientos de voces simultáneamente en lugar de secuencialmente, lo que disminuyó el tiempo de entrenamiento necesario y permitió que el modelo aprendiera y generalizara el contexto emocional compartido, incluso para voces sin exposición a ese contexto. [23] En consecuencia, los personajes de la aplicación fueron impulsados ​​por un solo modelo entrenado, en lugar de múltiples modelos de un solo hablante. [24] El léxico utilizado por 15.ai se extrajo de una variedad de fuentes de Internet, incluidos Oxford Dictionaries , Wiktionary , CMU Pronouncing Dictionary , 4chan , Reddit y Twitter . Las pronunciaciones de palabras desconocidas se dedujeron automáticamente utilizando reglas fonológicas aprendidas por el modelo de aprendizaje profundo. [5]

La aplicación admitía una transcripción fonética simplificada conocida como ARPABET , para corregir errores de pronunciación y dar cuenta de los heterónimos (palabras que se escriben igual pero se pronuncian de forma diferente, como la palabra read , que se puede pronunciar como / ˈrɛd / o / ˈriːd / según el tiempo verbal ). Seguía las convenciones ARPABET del Diccionario de pronunciación de la CMU . [5 ]

Fondo

Inteligencia artificial en la síntesis de voz

Una pila de capas convolucionales casuales dilatadas utilizadas en WaveNet de DeepMind . [25]

En 2016, con la propuesta de WaveNet de DeepMind , los modelos basados ​​en aprendizaje profundo para la síntesis de voz comenzaron a ganar popularidad como un método para modelar formas de onda y generar un habla humana de alta fidelidad. [26] [27] [25] Tacotron2, una arquitectura de red neuronal para la síntesis de voz desarrollada por Google AI , se publicó en 2018 y requirió decenas de horas de datos de audio para producir un habla inteligible; cuando se entrenó con 2 horas de habla, el modelo pudo producir un habla inteligible con una calidad mediocre, y cuando se entrenó con 36 minutos de habla, el modelo no pudo producir un habla inteligible. [28] [29]

Durante años, reducir la cantidad de datos necesarios para entrenar un modelo de texto a voz realista y de alta calidad ha sido un objetivo principal de los investigadores científicos en el campo de la síntesis de voz mediante aprendizaje profundo. [30] [31] El desarrollador de 15.ai afirma que tan solo 15 segundos de datos son suficientes para clonar una voz según los estándares humanos, una reducción significativa en la cantidad de datos necesarios. [32]

Desarrollo

15.ai fue diseñado y creado por un científico investigador anónimo conocido por el alias 15. [5] [6] [7] En su blog Marginal Revolution , el economista Tyler Cowen citó al desarrollador de 15.ai como un ejemplo de talento subestimado en IA. [33]

El desarrollo y funcionamiento de 15.ai costó varios miles de dólares al mes, financiados inicialmente por las finanzas personales del desarrollador después de una salida exitosa de la startup . [8] El algoritmo utilizado por el proyecto se denominó DeepThroat. [8] El proyecto y el algoritmo fueron concebidos como parte del Programa de Oportunidades de Investigación de Pregrado del MIT y habían estado en desarrollo desde 2018. [11] [5] [34] El modelo utilizado por 15.ai se inspiró en un artículo de 2019 que introdujo el aprendizaje por transferencia a los modelos de texto a voz. [11] [35]

El Proyecto de Preservación de Pony del foro /mlp/ de 4chan ha sido fundamental para el desarrollo de 15.ai. [36]

El desarrollador también trabajó en estrecha colaboración con el Pony Preservation Project de /mlp/, el foro de My Little Pony de 4chan . [8] Este proyecto fue un "esfuerzo colaborativo de /mlp/ para construir y curar conjuntos de datos de ponis" con el objetivo de crear aplicaciones en inteligencia artificial. [37] [38] Las voces de Friendship Is Magic en 15.ai se entrenaron en un gran conjunto de datos obtenidos colectivamente por el proyecto: audio y diálogo del programa y medios relacionados [8] —incluidas las nueve temporadas de Friendship Is Magic , la película de 2017 , spin-offs , filtraciones y varios otros contenidos expresados ​​por los mismos actores de voz— se analizaron , transcribieron a mano y procesaron para eliminar el ruido de fondo.

El primer lanzamiento público de 15.ai se dio a conocer en marzo de 2020, y el servicio experimentó una disponibilidad intermitente mientras el desarrollador realizaba un trabajo de investigación y desarrollo continuo . [ cita requerida ] La herramienta ganó una gran atención en los principales medios de comunicación a principios de 2021, y varios medios de noticias sobre juegos cubrieron sus capacidades. [3] [1] [2] 15.ai recibió más atención en 2022 cuando se descubrió que Voiceverse NFT había utilizado resultados de la herramienta. [14]

A fines de 2022, 15.ai dejó de estar disponible. A diciembre de 2024 [update], el sitio web sigue inactivo.

Recepción

15.ai tuvo una recepción mayoritariamente positiva por parte de los usuarios y los medios de comunicación . Liana Ruppert de Game Informer lo describió como "simplistamente brillante" [2] y José Villalobos de LaPS4 escribió que "funciona tan fácil como parece". [16] [a] Lauren Morton de Rock, Paper, Shotgun llamó a la herramienta "fascinante", [4] y Yuki Kurosawa de AUTOMATON la consideró "revolucionaria". [5] [b] Los usuarios elogiaron la capacidad de crear fácilmente audio de personajes populares que suenan creíbles para aquellos que no saben que han sido sintetizados. Zack Zwiezen de Kotaku informó que "[su] novia estaba convencida de que era una nueva línea de voz de la actriz de voz de GLaDOS , Ellen McLain ". [1] Natalie Clayton de PC Gamer escribió que " la voz nasal y estridente de Bob Esponja funciona sorprendentemente bien".

El impacto del sitio web se extendió más allá de los medios de comunicación de habla inglesa. Yoshiyuki Furushima, de Den Fami Nico Gamer, escribió que "es sorprendente que [las líneas de los personajes y los sketches] estén todos generados sintéticamente", y Eugenio Moto, de Yahoo! Finance, informó que "si bien los resultados ya son excepcionales, sin duda pueden mejorar".

Creación de contenido para fans

15.ai se usó con frecuencia para la creación de contenido en varios fandoms , incluido el fandom de My Little Pony: La magia de la amistad , el fandom de Team Fortress 2 , el fandom de Portal y el fandom de Bob Esponja , con numerosos videos y proyectos que contienen discursos de 15.ai que se volvieron virales . [1] [2] A la plataforma se le atribuye el impulso detrás de la popularización de la clonación de voz de IA en la creación de contenido, lo que demuestra el potencial de una tecnología de síntesis de voz accesible y de alta calidad. [8]

Como resultado, el fandom de My Little Pony: La magia de la amistad vio un resurgimiento en la creación de contenido de video y música, inspirando un nuevo género de contenido creado por fanáticos asistido por inteligencia artificial. Algunas fanfictions no fueron adaptadas a "episodios" completamente vocalizados: The Tax Breaks es una interpretación en video animada de 17 minutos de una historia escrita por un fan publicada en 2014 que usa voces generadas a partir de 15.ai con efectos de sonido y edición de audio , emulando el estilo episódico de las primeras temporadas de La magia de la amistad . [39] [40]

Los videos virales del fandom de Team Fortress 2 con voces de 15.ai incluyen Spy is a Furry (que obtuvo más de 3 millones de vistas en YouTube en varios videos [yt 1] [yt 2] [yt 3] ) y The RED Bread Bank , los cuales inspiraron representaciones de videos animados de Source Filmmaker . [5] Otros fandoms usaron voces de 15.ai para producir videos virales. En julio de 2022 [update], el video viral Among Us Struggles (con voces de Friendship Is Magic ) tenía más de 5.5 millones de vistas en YouTube; [yt 4] YouTubers , TikTokers y streamers de Twitch también usaron 15.ai para sus videos, como el video de FitMC sobre la historia de 2b2t , uno de los servidores de Minecraft en funcionamiento más antiguos , y el video de TikTok de datpon3 con los personajes principales de Friendship Is Magic , que tienen 1.4 millones y 510 mil vistas, respectivamente. [yt 5] [tt 1]

Algunos usuarios crearon asistentes virtuales de IA utilizando 15.ai y un software de control de voz externo. Un usuario en Twitter creó un asistente de escritorio personal inspirado en GLaDOS utilizando un diálogo generado por 15.ai junto con el sistema de control de voz VoiceAttack. [5] [13]

Véase también

Notas

  1. ^ Traducido de la cita original escrita en español: "La dirección es 15.AI y funciona tan fácil como parece". [16]
  2. ^ Traducido de la cita original escrita en japonés: "しかし15.aiが画期的なのは「データが30秒しかない文字でも、ほぼ100%の発音精度を達成できること」そして「ごくわずかなデータのみを使って、自然な感情" [5]

Referencias

Notas
  1. ^ abcdef Zwiezen, Zack (18 de enero de 2021). «Sitio web que te permite hacer que GLaDOS diga lo que quieras». Kotaku . Archivado desde el original el 17 de enero de 2021 . Consultado el 18 de enero de 2021 .
  2. ^ abcde Ruppert, Liana (18 de enero de 2021). "Haz que GLaDOS de Portal y otros personajes queridos digan las cosas más raras con esta aplicación". Game Informer . Archivado desde el original el 18 de enero de 2021 . Consultado el 18 de enero de 2021 .
  3. ^ abc Clayton, Natalie (19 de enero de 2021). «Haz que el elenco de TF2 recite viejos memes con esta herramienta de texto a voz con inteligencia artificial». PC Gamer . Archivado desde el original el 19 de enero de 2021. Consultado el 19 de enero de 2021 .
  4. ^ ab Morton, Lauren (18 de enero de 2021). "Pon palabras en boca de los personajes del juego con esta fascinante herramienta de texto a voz". Piedra, papel, escopeta . Archivado desde el original el 18 de enero de 2021. Consultado el 18 de enero de 2021 .
  5. ^ abcdefghijkl Kurosawa, Yuki (19 de enero de 2021). "ゲームキャラ音声読み上げソフト「15.ai」公開中。『Undert ale』や『Portal』のキャラに好きなセリフを言ってもらえる". AUTÓMATO . Archivado desde el original el 19 de enero de 2021 . Consultado el 19 de enero de 2021 .
  6. ^ abcd "15.AI: Todo lo que necesitas saber y las mejores alternativas". ElevenLabs . 7 de febrero de 2024. Archivado desde el original el 15 de julio de 2024 . Consultado el 18 de noviembre de 2024 .
  7. ^ abcd "Clonación gratuita de voces de personajes de 15.ai y alternativas". Resemble.ai . 17 de octubre de 2024 . Consultado el 18 de noviembre de 2024 .
  8. ^ abcdefghijk "Todo lo que necesitas saber sobre 15.ai: el generador de voz de IA". Play.ht . 12 de septiembre de 2024 . Consultado el 18 de noviembre de 2024 .
  9. ^ abc «15.ai – Texto a voz natural y emocional mediante redes neuronales». Hashdork . 15 de mayo de 2024. Archivado desde el original el 4 de julio de 2024 . Consultado el 18 de noviembre de 2024 .
  10. ^ "Desmitificando 15.ai: cómo la IA genera voces de texto a voz ultrarrealistas". TheLinuxCode . 27 de diciembre de 2023. Archivado desde el original el 27 de diciembre de 2023 . Consultado el 18 de noviembre de 2024 .
  11. ^ abc Ng, Andrew (1 de abril de 2020). «Clonación de voz para las masas». DeepLearning.AI . Archivado desde el original el 7 de agosto de 2020. Consultado el 5 de abril de 2020 .
  12. ^ Lopez, Ule (16 de enero de 2022). «La empresa de NFT respaldada por Troy Baker admite haber utilizado líneas de voz tomadas de otro servicio sin permiso». Wccftech . Archivado desde el original el 16 de enero de 2022 . Consultado el 7 de junio de 2022 .
  13. ^ abc Yoshiyuki, Furushima (18 de enero de 2021). "『Portal』のGLaDOSや『UNDERTALE』のサンズがテキストを読み上げて" Denfaminicogamer . Archivado desde el original el 18 de enero de 2021 . Recuperado el 18 de enero de 2021 .
  14. ^ ab Williams, Demi (18 de enero de 2022). «Voiceverse NFT admite haber tomado líneas de voz de un servicio no comercial». NME . Archivado desde el original el 18 de enero de 2022. Consultado el 18 de enero de 2022 .
  15. ^ Wright, Steve (17 de enero de 2022). «La empresa de NFT respaldada por Troy Baker admite usar contenido sin permiso». Stevivor . Archivado desde el original el 17 de enero de 2022 . Consultado el 17 de enero de 2022 .
  16. ↑ abcd Villalobos, José (18 de enero de 2021). "Descubre 15.AI, un sitio web en el que podrás hacer que GlaDOS diga lo que quieras". LaPS4 . Archivado desde el original el 18 de enero de 2021 . Consultado el 18 de enero de 2021 .
  17. ↑ ab Moto, Eugenio (20 de enero de 2021). "15.ai, el sitio que te permite usar voces de personajes populares para que digan lo que quieras". Yahoo! Finanzas . Archivado desde el original el 8 de marzo de 2022 . Consultado el 20 de enero de 2021 .
  18. ^ Felbo, Bjarke (2017). "Uso de millones de ocurrencias de emojis para aprender representaciones de cualquier dominio para detectar sentimientos, emociones y sarcasmo". Actas de la Conferencia de 2017 sobre métodos empíricos en procesamiento del lenguaje natural . págs. 1615–1625. arXiv : 1708.00524 . doi :10.18653/v1/D17-1169. S2CID  2493033.
  19. ^ Corfield, Gareth (7 de agosto de 2017). "¿Un robot detector de sarcasmo? Eso suena absolutamente brillante. Definitivamente". The Register . Archivado desde el original el 2 de junio de 2022. Consultado el 2 de junio de 2022 .
  20. ^ "Un algoritmo entrenado con emojis sabe cuándo estás siendo sarcástico en Twitter". MIT Technology Review . 3 de agosto de 2017. Archivado desde el original el 2 de junio de 2022 . Consultado el 2 de junio de 2022 .
  21. ^ "Los emojis ayudan al software a detectar emociones y sarcasmo". BBC . 7 de agosto de 2017. Archivado desde el original el 2 de junio de 2022 . Consultado el 2 de junio de 2022 .
  22. ^ Lowe, Josh (7 de agosto de 2017). «Los tuits malintencionados llenos de emojis ayudan a los científicos a crear un robot detector de sarcasmo que podría descubrir discursos de odio». Newsweek . Archivado desde el original el 2 de junio de 2022 . Consultado el 2 de junio de 2022 .
  23. ^ Valle, Rafael (2020). "Mellotron: síntesis de voz expresiva multiparlante mediante condicionamiento de ritmo, tono y tokens de estilo global". arXiv : 1910.11997 [eess].
  24. ^ Cooper, Erica (2020). "Texto a voz de múltiples hablantes con cero disparos e incrustaciones de hablantes neuronales de última generación". arXiv : 1910.10838 [eess].
  25. ^ ab van den Oord, Aäron; Li, Yazhe; Babuschkin, Igor (12 de noviembre de 2017). «Síntesis de voz de alta fidelidad con WaveNet». DeepMind . Archivado desde el original el 18 de junio de 2022. Consultado el 5 de junio de 2022 .
  26. ^ Hsu, Wei-Ning (2018). "Modelado generativo jerárquico para síntesis de voz controlable". arXiv : 1810.07217 [cs.CL].
  27. ^ Habib, Raza (2019). "Modelado generativo semisupervisado para síntesis de voz controlable". arXiv : 1910.01709 [cs.CL].
  28. ^ "Muestras de audio de "Entrenamiento semisupervisado para mejorar la eficiencia de los datos en la síntesis de voz de extremo a extremo"". 30 de agosto de 2018. Archivado desde el original el 11 de noviembre de 2020. Consultado el 5 de junio de 2022 .
  29. ^ Shen, Jonathan; Pang, Ruoming; Weiss, Ron J.; Schuster, Mike; Jaitly, Navdeep; Yang, Zongheng; Chen, Zhifeng; Zhang, Yu; Wang, Yuxuan; Skerry-Ryan, RJ; Saurous, Rif A.; Agiomyrgiannakis, Yannis; Wu, Yonghui (2018). "Síntesis natural de TTS mediante el condicionamiento de WaveNet en predicciones de espectrogramas Mel". arXiv : 1712.05884 [cs.CL].
  30. ^ Chung, Yu-An (2018). "Entrenamiento semisupervisado para mejorar la eficiencia de los datos en la síntesis de voz de extremo a extremo". arXiv : 1808.10128 [cs.CL].
  31. ^ Ren, Yi (2019). "Texto a voz casi sin supervisión y reconocimiento automático de voz". arXiv : 1905.06791 [cs.CL].
  32. ^ Phillips, Tom (17 de enero de 2022). «La empresa de NFT respaldada por Troy Baker admite haber utilizado líneas de voz tomadas de otro servicio sin permiso». Eurogamer . Archivado desde el original el 17 de enero de 2022. Consultado el 17 de enero de 2022 .
  33. ^ Cowen, Tyler (12 de mayo de 2022). «¿El talento más subestimado en IA?». Marginal Revolution (blog) . Archivado desde el original el 19 de junio de 2022. Consultado el 27 de noviembre de 2024 .
  34. ^ Button, Chris (19 de enero de 2021). «Haz que GLaDOS, Bob Esponja y otros amigos digan lo que quieras con esta herramienta de texto a voz con inteligencia artificial». Byteside . Archivado desde el original el 25 de junio de 2024. Consultado el 18 de noviembre de 2024 .
  35. ^ Jia, Ye (2019). 1806.04558 . arXiv : 1806.04558 .
  36. ^ Branwen, Gwern (6 de marzo de 2020). ""15.ai "⁠, 15, Proyecto de preservación de ponis". Gwern.net . Gwen. Archivado desde el original el 18 de marzo de 2022 . Consultado el 17 de junio de 2022 .
  37. ^ Scotellaro, Shaun (14 de marzo de 2020). "Proyecto de preservación de ponis: uso de redes neuronales para crear voces de ponis". Equestria Daily . Archivado desde el original el 23 de junio de 2021. Consultado el 11 de junio de 2022 .
  38. ^ "Proyecto de preservación de ponis (Hilo 108)". 4chan . Desuarchive. 20 de febrero de 2022 . Consultado el 20 de febrero de 2022 .
  39. ^ Scotellaro, Shaun (15 de mayo de 2022). «Episodio animado simple y completo: Las exenciones fiscales (Crepúsculo)». Equestria Daily . Archivado desde el original el 21 de mayo de 2022. Consultado el 28 de mayo de 2022 .
  40. ^ "Las terribles tribulaciones de Twilight Sparkle". Fimfiction.net . 27 de abril de 2014. Archivado desde el original el 30 de junio de 2022 . Consultado el 28 de abril de 2022 .
YouTube (se hace referencia solo a los recuentos de vistas y al uso de 15.ai)
  1. ^ "SPY IS A FURRY". YouTube . 17 de enero de 2021. Archivado desde el original el 13 de junio de 2022 . Consultado el 14 de junio de 2022 .
  2. ^ "Spy es un Furry Animated". YouTube . Archivado desde el original el 14 de junio de 2022 . Consultado el 14 de junio de 2022 .
  3. ^ "[SFM] – La confesión de un espía – [TF2 15.ai]". YouTube . 15 de enero de 2021. Archivado desde el original el 30 de junio de 2022 . Consultado el 14 de junio de 2022 .
  4. ^ "Entre nosotros luchan". YouTube . 21 de septiembre de 2020 . Consultado el 15 de julio de 2022 .
  5. ^ "La cronología ACTUALIZADA de 2b2t (2010-2020)". YouTube . 14 de marzo de 2020. Archivado desde el original el 1 de junio de 2022 . Consultado el 14 de junio de 2022 .
TikTok
  1. ^ "Ella dijo " 👹 "". TikTok . Archivado del original el 21 de febrero de 2022 . Consultado el 15 de julio de 2022 .
Retrieved from "https://en.wikipedia.org/w/index.php?title=15.ai&oldid=1263213842#Features"