Articulo de referencia

deepfake de audio

Clip de audio deepfake que simula la voz de Donald Trump La tecnología de deepfake de audio , también conocida como clonación de voz o audio deepfake , es una aplicación de inte...

Clip de audio deepfake que simula la voz de Donald Trump

La tecnología de deepfake de audio , también conocida como clonación de voz o audio deepfake , es una aplicación de inteligencia artificial diseñada para generar habla que imita de manera convincente a individuos específicos, a menudo sintetizando frases u oraciones que nunca han pronunciado. [ 1 ] [ 2 ] [ 3 ] [ 4 ]

Desarrollada inicialmente con la intención de mejorar diversos aspectos de la vida humana, tiene aplicaciones prácticas como la generación de audiolibros y la asistencia a personas que han perdido la voz debido a afecciones médicas . [ 5 ] [ 6 ] Además, tiene usos comerciales, incluyendo la creación de asistentes digitales personalizados, sistemas de conversión de texto a voz con sonido natural y servicios avanzados de traducción de voz . [ 7 ] Al igual que otras formas de deepfakes, los deepfakes de audio han sido objeto de críticas por su uso en estafas , phishing y campañas de desinformación .

Categorías

Los deepfakes de audio se pueden dividir en tres categorías diferentes:

Basado en repetición

Los deepfakes basados ​​en la reproducción son obras maliciosas que pretenden reproducir una grabación de la voz del interlocutor. [ 8 ]

Hay dos tipos: detección de campo lejano y detección de cortar y pegar . En la detección de campo lejano, se reproduce una grabación de micrófono de la víctima como segmento de prueba en un teléfono manos libres. [ 9 ] Por otro lado, cortar y pegar implica falsificar la frase solicitada de un sistema dependiente de texto. [ 10 ] La verificación del hablante dependiente de texto se puede utilizar para defenderse de ataques basados ​​en la reproducción. [ 8 ] [ 11 ] Una técnica actual que detecta ataques de reproducción de extremo a extremo es el uso de redes neuronales convolucionales profundas . [ 12 ]

De base sintética

Diagrama de bloques que ilustra el enfoque basado en síntesis para generar deepfakes de audio.
Diagrama del enfoque basado en síntesis

La categoría basada en síntesis de voz se refiere a la producción artificial de habla humana, utilizando programas de sistemas de software o hardware. La síntesis de voz incluye la conversión de texto a voz, cuyo objetivo es transformar el texto en habla aceptable y natural en tiempo real, [ 13 ] haciendo que el sonido del habla se ajuste al texto de entrada, utilizando las reglas de descripción lingüística del texto.

Un sistema clásico de este tipo consta de tres módulos: un modelo de análisis de texto, un modelo acústico y un vocoder . La generación generalmente requiere dos pasos esenciales. Primero, es necesario recopilar audio sin procesar, limpio y bien estructurado, junto con la transcripción de la frase original. Segundo, el modelo de conversión de texto a voz debe entrenarse con estos datos para construir un modelo de generación de audio sintético.

Específicamente, el texto transcrito con la voz del hablante objetivo es la entrada del modelo de generación. El módulo de análisis de texto procesa el texto de entrada y lo convierte en características lingüísticas. Luego, el módulo acústico extrae los parámetros del hablante objetivo de los datos de audio basándose en las características lingüísticas generadas por el módulo de análisis de texto. [ 14 ] Finalmente, el vocoder aprende a crear formas de onda vocales basándose en los parámetros de las características acústicas. Se genera el archivo de audio final, que incluye el audio de simulación sintética en formato de forma de onda, creando audio de voz con la voz de muchos hablantes, incluso aquellos que no participaron en el entrenamiento.

El primer avance en este sentido fue introducido por WaveNet , [ 15 ] una red neuronal para generar formas de onda de audio sin procesar capaces de emular las características de muchos hablantes diferentes. Esta red ha sido superada con el paso de los años por otros sistemas [ 16 ] [ 17 ] [ 18 ] [ 19 ] [ 20 ] [ 21 ] que sintetizan voces artificiales altamente realistas al alcance de todos. [ 22 ]

La conversión de texto a voz depende en gran medida de la calidad del corpus de voz utilizado para su funcionamiento, y crear un corpus completo resulta costoso. Otra desventaja es que los sistemas de síntesis de voz no reconocen puntos ni caracteres especiales. Además, persisten los problemas de ambigüedad, ya que dos palabras escritas de la misma manera pueden tener significados diferentes.

Basado en la imitación

Diagrama de bloques que ilustra el enfoque basado en la imitación para generar deepfakes de audio.
Diagrama del enfoque basado en la imitación

El deepfake de audio basado en la imitación es una forma de transformar el habla original de un hablante (el original) para que suene como la de otro hablante (el objetivo). [ 23 ] Un algoritmo basado en la imitación toma una señal hablada como entrada y la altera cambiando su estilo, entonación o prosodia, intentando imitar la voz objetivo sin modificar la información lingüística. [ 24 ] Esta técnica también se conoce como conversión de voz.

Este método suele confundirse con el método sintético anterior, ya que no existe una clara distinción entre ambos enfoques en cuanto al proceso de generación. De hecho, ambos métodos modifican las características acústicas, espectrales y de estilo de la señal de audio del habla, pero el método basado en imitación generalmente mantiene el texto de entrada y salida inalterados. Esto se logra cambiando la forma en que se pronuncia la oración para que coincida con las características del hablante objetivo. [ 25 ]

Las voces se pueden imitar de varias maneras, como utilizando personas con voces similares que puedan imitar al hablante original. En los últimos años, el enfoque más popular implica el uso de redes neuronales específicas llamadas redes generativas antagónicas (GAN) debido a su flexibilidad y a la alta calidad de sus resultados. [ 8 ] [ 23 ]

Luego, la señal de audio original se transforma para reproducir un discurso en el audio objetivo mediante un método de generación de imitación que genera un nuevo discurso, que se muestra en el audio falso.

Métodos de detección

La tarea de detección de deepfakes de audio determina si el audio de voz proporcionado es real o falso.

Recientemente, este tema se ha convertido en un asunto candente en la comunidad de investigación forense , que intenta mantenerse al día con la rápida evolución de las técnicas de falsificación.

En general, los métodos de detección de deepfakes se pueden dividir en dos categorías según el aspecto que utilizan para realizar la detección. La primera se centra en aspectos de bajo nivel, buscando artefactos introducidos por los generadores a nivel de muestra. La segunda, en cambio, se centra en características de nivel superior que representan aspectos más complejos, como el contenido semántico de la grabación de audio.

Diagrama que ilustra el marco habitual utilizado para realizar la tarea de detección de deepfakes de audio.
Un marco genérico para la detección de deepfakes de audio

Se han desarrollado muchos modelos de aprendizaje automático utilizando diferentes estrategias para detectar audio falso. La mayoría de las veces, estos algoritmos siguen un procedimiento de tres pasos:

  1. Cada grabación de audio de voz debe ser preprocesada y transformada en las características de audio adecuadas;
  2. Las características calculadas se introducen en el modelo de detección, que realiza las operaciones necesarias, como el proceso de entrenamiento, esenciales para discriminar entre audio de voz real y falso;
  3. La salida se introduce en el módulo final para producir una probabilidad de predicción de la clase Falsa o la Real . Siguiendo la nomenclatura del desafío ASVspoof [ 26 ] , el audio Falso se indica con el término "Spoof", mientras que el Real se denomina "Bonafide".

A lo largo de los años, numerosos investigadores han demostrado que los enfoques de aprendizaje automático son más precisos que los métodos de aprendizaje profundo, independientemente de las características utilizadas. [ 14 ] Sin embargo, la escalabilidad de los métodos de aprendizaje automático no está confirmada debido al entrenamiento excesivo y la extracción manual de características, especialmente con muchos archivos de audio. En cambio, cuando se utilizan algoritmos de aprendizaje profundo, se requieren transformaciones específicas en los archivos de audio para garantizar que los algoritmos puedan procesarlos.

La mayoría de los estudios de detección se centran en deepfakes en inglés. La investigación sobre los idiomas más hablados, como el chino y el español, sigue siendo limitada. El hindi y el árabe también están poco estudiados. Los modelos de detección entrenados principalmente en inglés muestran un rendimiento reducido cuando se prueban con audio en otros idiomas. La variación del acento también afecta la precisión de la detección. Las diferentes pronunciaciones asociadas con regiones o poblaciones específicas influyen en la capacidad de los modelos para identificar el habla sintética. [ 27 ]

Hay varias implementaciones de código abierto de diferentes métodos de detección, [ 28 ] [ 29 ] [ 30 ] y normalmente muchos grupos de investigación las publican en un servicio de alojamiento público como GitHub .

Preocupaciones y contramedidas

La creciente accesibilidad de la tecnología deepfake de audio ha generado preocupación por su uso en estafas y campañas de desinformación . [ 3 ] [ 31 ] Las personas pueden usarlas como una técnica de suplantación de voz de acceso lógico , [ 32 ] donde pueden usarse para manipular la opinión pública con fines propagandísticos, difamatorios o terroristas . Diariamente se transmiten grandes cantidades de grabaciones de voz por Internet, y la detección de suplantación es un desafío. [ 10 ] Los atacantes de deepfake de audio han atacado a individuos y organizaciones, incluidos políticos y gobiernos. [ 33 ]

En 2019, unos estafadores que utilizaron IA suplantaron la voz del director ejecutivo de una empresa energética alemana y obligaron al director ejecutivo de su filial en el Reino Unido a transferir 220 000 . [ 34 ] A principios de 2020, la misma técnica suplantó la identidad de un director de empresa como parte de un elaborado plan que convenció a un gerente de sucursal para transferir 35 millones de dólares. [ 35 ]

Según una encuesta global de McAfee de 2023 , una de cada diez personas informó haber sido víctima de una estafa de clonación de voz mediante IA; el 77 % de estas víctimas reportaron haber perdido dinero debido a la estafa. [ 36 ] [ 37 ] Las falsificaciones de audio profundas también podrían representar un peligro para los sistemas de identificación de voz que utilizan actualmente las instituciones financieras. [ 38 ] [ 39 ] En marzo de 2023, la Comisión Federal de Comercio de Estados Unidos emitió una advertencia a los consumidores sobre el uso de IA para falsificar la voz de un familiar angustiado que pide dinero. [ 40 ]

En octubre de 2023, durante el inicio de la conferencia del Partido Laborista británico en Liverpool , se publicó un deepfake de audio del líder laborista Keir Starmer que lo retrataba falsamente insultando a sus colaboradores y criticando a Liverpool. [ 41 ] Ese mismo mes, un deepfake de audio del político eslovaco Michal Šimečka afirmaba falsamente haberlo grabado discutiendo formas de manipular las próximas elecciones. [ 42 ]

Durante la campaña para las primarias presidenciales demócratas de New Hampshire de 2024 , más de 20.000 votantes recibieron llamadas automáticas de un supuesto presidente Joe Biden suplantado por IA que los instaba a no votar. [ 43 ] [ 44 ] El fiscal general de New Hampshire dijo que esto violó las leyes electorales estatales y alegó la participación de Life Corporation y Lingo Telecom. [ 45 ] En febrero de 2024, la Comisión Federal de Comunicaciones de Estados Unidos prohibió el uso de IA para falsificar voces en llamadas automáticas. [ 46 ] [ 47 ] Ese mismo mes, el consultor político Steve Kramer admitió que había encargado las llamadas por 500 dólares. Dijo que quería llamar la atención sobre la necesidad de reglas que regulen el uso de IA en campañas políticas. [ 48 ] En mayo, la FCC dijo que Kramer había violado la ley federal al suplantar el número de una figura política local y propuso una multa de 6 millones de dólares. Cuatro condados de New Hampshire acusaron a Kramer de delitos graves de supresión de votantes y de suplantación de identidad de un candidato, un delito menor. [ 49 ]

En 2024, el YouTuber Jeff Geerling atrajo la atención tras percatarse de que su voz había sido clonada sin su consentimiento por el fabricante de productos electrónicos Elecrow, [ 50 ] [ 51 ] y la empresa posteriormente se disculpó y eliminó el contenido ofensivo. [ 52 ] La experiencia de Geerling fue citada como un caso que se pretendía abordar con la tecnología de detección de semejanza de YouTube cuando se lanzara en 2025. [ 53 ] [ 54 ]

Propaganda patrocinada por el Estado

En febrero de 2023, la firma de investigación Graphika documentó el primer caso conocido de actores alineados con el Estado que utilizaron presentadores de noticias generados por IA para desinformación política. La red de propaganda china Spamouflage creó dos presentadores de noticias ficticios llamados "Alex" y "Anna" utilizando el software de IA Synthesia. Los presentadores deepfake aparecieron en videos publicados en Facebook, Twitter y YouTube a partir de finales de 2022. Los videos promovían narrativas a favor de China y criticaban a Estados Unidos. La operación costaba aproximadamente 30 dólares al mes por la suscripción al software de IA. Los indicadores de detección incluían patrones de habla robótica, errores de sincronización labial y errores gramaticales en los subtítulos de los videos. [ 55 ]

Retos abiertos y futuras líneas de investigación

La manipulación de audio mediante deepfake es un campo de investigación muy reciente. Por ello, existen numerosas posibilidades de desarrollo y mejora, así como posibles amenazas que la adopción de esta tecnología puede suponer para nuestra vida cotidiana. Las más importantes se enumeran a continuación.

Un estudio exhaustivo de 2023 sobre la detección de deepfakes de audio reveló que los sistemas de detección enfrentan desafíos significativos para generalizar a través de diferentes métodos de generación y condiciones acústicas. [ 27 ]

Generación de deepfakes

En lo que respecta a la generación, el aspecto más significativo es la credibilidad de la víctima, es decir, la calidad perceptiva del deepfake de audio.

Varias métricas determinan el nivel de precisión de la generación de deepfakes de audio, y la más utilizada es la puntuación media de opinión (MOS), que es el promedio aritmético de las calificaciones de los usuarios. Generalmente, la prueba a evaluar implica la evaluación perceptiva de oraciones creadas por diferentes algoritmos de generación de voz. Este índice mostró que el audio generado por algoritmos entrenados con un solo hablante tiene una MOS más alta. [ 25 ] [ 15 ] [ 56 ] [ 57 ] [ 20 ]

La frecuencia de muestreo también juega un papel esencial en la detección y generación de deepfakes de audio. Actualmente, los conjuntos de datos disponibles tienen una frecuencia de muestreo de alrededor de 16  kHz, lo que reduce significativamente la calidad del habla. Un aumento en la frecuencia de muestreo podría conducir a una generación de mayor calidad. [ 18 ]

En marzo de 2020, un investigador del Instituto Tecnológico de Massachusetts demostró la generación eficiente de deepfakes de audio mediante 15.ai , una aplicación web capaz de generar voz de alta calidad utilizando solo 15 segundos de datos de entrenamiento, [ 58 ] [ 59 ] en comparación con sistemas anteriores que requerían decenas de horas. [ 60 ] El sistema implementó un modelo multilocutor unificado que permitió el entrenamiento simultáneo de múltiples voces a través de incrustaciones de locutores, lo que permitió al modelo aprender patrones compartidos entre diferentes voces incluso cuando las voces individuales carecían de ejemplos de ciertos contextos emocionales. [ 61 ] La plataforma integró el análisis de sentimientos a través de DeepMoji para la expresión emocional y admitió un control preciso de la pronunciación a través de transcripciones fonéticas ARPABET . [ 62 ] El punto de referencia de eficiencia de datos de 15 segundos fue corroborado posteriormente por OpenAI en 2024. [ 63 ]

Detección de deepfakes

Centrándonos en la parte de detección, una de las principales debilidades que afectan a los modelos recientes es el lenguaje utilizado.

La mayoría de los estudios se centran en detectar deepfakes de audio en inglés, sin prestar mucha atención a los idiomas más hablados como el chino y el español, [ 64 ] así como el hindi y el árabe.

También es fundamental considerar otros factores relacionados con los distintos acentos, que representan la forma de pronunciación asociada a un individuo, lugar o nación en particular. En otros campos del audio, como el reconocimiento de locutores , se ha observado que el acento influye significativamente en el rendimiento [ 65 ] , por lo que se espera que esta característica afecte el rendimiento de los modelos incluso en esta tarea de detección.

Además, el preprocesamiento excesivo de los datos de audio ha generado un costo computacional muy elevado y, a menudo, insostenible. Por esta razón, muchos investigadores han sugerido adoptar un enfoque de aprendizaje autosupervisado [ 66 ] , que permite trabajar con datos sin etiquetar para lograr una detección eficaz y mejorar la escalabilidad del modelo, reduciendo al mismo tiempo el costo computacional. Asimismo, un factor clave para abordar los ataques de suplantación de identidad desconocidos reside en el uso de estrategias efectivas de aumento de datos, que exponen el modelo a una mayor variabilidad acústica y mejoran su capacidad de generalización a condiciones de ataque no vistas [ 67 ] .

El entrenamiento y la prueba de modelos con datos de audio reales sigue siendo un área poco desarrollada. De hecho, el uso de audio con ruido de fondo real puede aumentar la robustez de los modelos de detección de audio falso.

Además, la mayor parte del esfuerzo se centra en detectar deepfakes de audio basados ​​en sintéticos, y pocos estudios analizan los basados ​​en imitación debido a su dificultad intrínseca en el proceso de generación. [ 10 ]

Defensa contra deepfakes

Con el paso de los años, se ha observado un aumento en las técnicas destinadas a defenderse de las acciones maliciosas que podría ocasionar la manipulación de audio mediante deepfake, como el robo de identidad y la manipulación de discursos por parte de los gobernadores del país.

Para prevenir los deepfakes, algunos sugieren utilizar blockchain y otras tecnologías de registro distribuido (DLT) para identificar la procedencia de los datos y rastrear la información. [ 14 ] [ 68 ] [ 69 ] [ 70 ]

También se ha propuesto extraer y comparar señales afectivas correspondientes a emociones percibidas a partir de contenido digital para combatir los deepfakes. [ 71 ] [ 72 ] [ 73 ]

Otro aspecto crítico se refiere a la mitigación de este problema. Se ha sugerido que sería mejor reservar algunas herramientas de detección propietarias solo para quienes las necesiten, como verificadores de hechos para periodistas. [ 8 ] De esa manera, quienes crean los modelos de generación, quizás con fines maliciosos, no sabrían con precisión qué características facilitan la detección de un deepfake, [ 8 ] lo que disuadiría a posibles atacantes.

Para mejorar la detección, los investigadores están tratando de generalizar el proceso, [ 74 ] buscando técnicas de preprocesamiento que mejoren el rendimiento y probando diferentes funciones de pérdida utilizadas para el entrenamiento. [ 32 ] [ 75 ]

En enero de 2023, China implementó regulaciones que exigen que el contenido deepfake esté claramente etiquetado. Las normas prohíben el uso de la tecnología de síntesis profunda para producir o difundir noticias falsas. Los proveedores de servicios deben verificar la identidad de los usuarios y mantener registros de contenido. Estas regulaciones representan uno de los primeros marcos gubernamentales integrales dirigidos específicamente a la tecnología deepfake. [ 76 ]

Programas de investigación

Numerosos grupos de investigación en todo el mundo trabajan para detectar manipulaciones mediáticas, como los deepfakes de audio, pero también los deepfakes de imagen y vídeo. Estos proyectos suelen contar con financiación pública o privada y mantienen un estrecho contacto con universidades e instituciones de investigación.

Para este propósito, la Agencia de Proyectos de Investigación Avanzada de Defensa (DARPA) gestiona el programa de Análisis Forense Semántico (SemaFor). [ 77 ] [ 78 ] Aprovechando parte de la investigación del programa de Análisis Forense de Medios (MediFor) [ 79 ] [ 80 ] , también de DARPA, estos algoritmos de detección semántica deberán determinar si un objeto multimedia ha sido generado o manipulado, para automatizar el análisis de la procedencia de los medios y descubrir la intención detrás de la falsificación de diversos contenidos. [ 81 ] [ 77 ]

Otro programa de investigación es el programa PREMIER (Preserving Media Trustworthiness in the Artificial Intelligence Era) [ 82 ] , financiado por el Ministerio de Educación, Universidad e Investigación de Italia (MIUR) y gestionado por cinco universidades italianas. PREMIER buscará enfoques híbridos novedosos para obtener detectores forenses más interpretables y seguros. [ 83 ]

DEEP-VOICE [ 84 ] es un conjunto de datos de acceso público destinado a la investigación para desarrollar sistemas que detecten cuándo el habla se ha generado con redes neuronales mediante un proceso llamado Conversión de Voz Basada en Recuperación (RVC). Investigaciones preliminares mostraron numerosas diferencias estadísticamente significativas entre las características del habla humana y las generadas por algoritmos de inteligencia artificial.

Desafíos públicos

En los últimos años, se han organizado numerosos desafíos para impulsar aún más este campo de investigación sobre deepfake de audio.

El desafío mundial más famoso es el ASVspoof, [ 26 ] el Desafío de Suplantación de Identidad y Contramedidas de Verificación Automática de Hablantes. Este desafío es una iniciativa comunitaria bienal que busca promover la consideración de la suplantación de identidad y el desarrollo de contramedidas. [ 85 ]

Otro desafío reciente es el ADD [ 86 ] —Detección de Deepfake de Audio— que considera situaciones falsas en un escenario más realista. [ 87 ]

Asimismo, el Desafío de Conversión de Voz [ 88 ] es un desafío bianual, creado con la necesidad de comparar diferentes sistemas y enfoques de conversión de voz utilizando los mismos datos de voz.

Uso prolongado sin autorización

El 22 de mayo de 2025, se afirmó que el producto ReadSpeak de Hoya Corporations utilizó grabaciones realizadas por la actriz Gayanne Potter para ellos en 2021, las cuales en ese momento ella entendió que solo se usarían para software de accesibilidad y aprendizaje electrónico, pero ahora están disponibles en general como la voz Iona y se usan como locutora en los trenes de ScotRail . [ 89 ] [ 90 ] [ 91 ] Esto reemplazó mensajes anteriores grabados por Fletcher Mathers sin su permiso. [ 92 ] El 25 de agosto de 2025, ScotRail anunció que reemplazará la voz de IA en los trenes, sin embargo, no está confirmado si será una grabación humana u otra voz entrenada por IA. [ 93 ]

Véase también

Referencias

  1. Smith, Hannah; Mansted, Katherine (1 de abril de 2020). Deepfakes como arma: seguridad nacional y democracia . Vol.  28. Instituto Australiano de Política Estratégica . págs. 11–13 . ISSN 2209-9689 .  
  2. Lyu, Siwei (2020). "Detección de deepfakes: desafíos actuales y próximos pasos". 2020 IEEE International Conference on Multimedia & Expo Workshops (ICMEW) . pp. 1–6 . arXiv : 2003.09234 . doi : 10.1109/icmew46912.2020.9105991 . ISBN  978-1-7281-1485-9. S2CID 214605906 . 
  3. 1 2 Diakopoulos, Nicholas; Johnson, Deborah (junio de 2020). "Anticipando y abordando las implicaciones éticas de los deepfakes en el contexto de las elecciones" . New Media & Society . 23 (7) (publicado el 5 de junio de 2020): 2072–2098 . doi : 10.1177/1461444820925811 . ISSN 1461-4448 . S2CID 226196422 .  
  4. ^ Murphy, Margi (20 de febrero de 2024). "Deepfake Audio Boom explota la inteligencia artificial de una startup valorada en mil millones de dólares" . Bloomberg.
  5. Chadha, Anupama; Kumar, Vaibhav; Kashyap, Sonu; Gupta, Mayank (2021), "Deepfake: Una visión general" , en Singh, Pradeep Kumar; Wierzchoń, Sławomir T.; Tanwar, Sudeep; Ganzha, Maria (eds.), Actas de la Segunda Conferencia Internacional sobre Computación, Comunicaciones y Ciberseguridad , Lecture Notes in Networks and Systems, vol. 203, Singapur: Springer Singapore, pp. 557–566 , doi : 10.1007/978-981-16-0733-2_39 , ISBN   978-981-16-0732-5, S2CID 236666289 , consultado el 29-06-2022 
  6. "La IA le devolvió la voz a Val Kilmer. Pero los críticos temen que la tecnología pueda ser mal utilizada" . Washington Post . ISSN 0190-8286 . Consultado el 29 de junio de 2022 . 
  7. Etienne, Vanessa (19 de agosto de 2021). "Val Kilmer recupera su voz tras luchar contra el cáncer de garganta gracias a la tecnología de IA: escucha los resultados" . PEOPLE.com . Consultado el 1 de julio de 2022 .
  8. 1 2 3 4 5 Khanjani, Zahra; Watson, Gabrielle; Janeja, Vandana P. (2021-11-28). "¿Qué tan profundas son las falsificaciones? Centrándose en el deepfake de audio: una revisión". arXiv : 2111.14203 [ cs.SD ].
  9. Pradhan, Swadhin; Sun, Wei; Baig, Ghufran; Qiu, Lili (2019-09-09). "Combatiendo los ataques de repetición contra los asistentes de voz" . Actas de la ACM sobre tecnologías interactivas, móviles, portátiles y ubicuas . 3 (3): 100:1–100:26. doi : 10.1145/3351258 . S2CID 202159551 . 
  10. 1 2 3 Ballesteros, Dora M.; Rodríguez-Ortega, Yohanna; Renza, Diego; Arce, Gonzalo (01-12-2021). "Deep4SNet: aprendizaje profundo para la clasificación de discursos falsos" . Sistemas expertos con aplicaciones . 184 115465. doi : 10.1016/j.eswa.2021.115465 . ISSN 0957-4174 . S2CID 237659479 .  
  11. Villalba, Jesús; Lleida, Eduardo (2011). «Prevención de ataques de repetición en sistemas de verificación de locutores». Conferencia Carnahan de 2011 sobre Tecnología de Seguridad . págs. 1–8 . doi : 10.1109/CCST.2011.6095943 . ISBN  978-1-4577-0903-6. S2CID 17048213 . 
  12. Tom, Francis; Jain, Mohit; Dey, Prasenjit (2018-09-02). "Detección de ataques de reproducción de audio de extremo a extremo mediante redes neuronales convolucionales profundas con atención" . Interspeech 2018. ISCA: 681–685 . doi : 10.21437/Interspeech.2018-2279 . S2CID 52187155 . 
  13. Tan, Xu; Qin, Tao; Soong, Frank; Liu, Tie-Yan (23-07-2021). "Una revisión sobre la síntesis neuronal del habla". arXiv : 2106.15561 [ eess.AS ].
  14. 1 2 3 Almutairi, Zaynab; Elgibreen, Hebah (2022-05-04). "Una revisión de los métodos modernos de detección de deepfakes de audio: desafíos y direcciones futuras" . Algorithms . 15 (5): 155. doi : 10.3390/a15050155 . ISSN 1999-4893 . 
  15. 1 2 Oord, Aaron van den; Dieleman, Sander; Zen, Heiga; Simonyan, Karen; Vinyals, Oriol; Tumbas, Alex; Kalchbrenner, Nal; Mayor, Andrés; Kavukcuoglu, Koray (19 de septiembre de 2016). "WaveNet: un modelo generativo para audio sin formato". arXiv : 1609.03499 [ cs.SD ].
  16. Kuchaiev, Oleksii; Li, Jason; Nguyen, Huyen; Hrinchuk, Oleksii; Leary, Ryan; Ginsburg, Boris; Kriman, Samuel; Beliaev, Stanislav; Lavrukhin, Vitaly; Cocinero, Jack; Castonguay, Patrice (13 de septiembre de 2019). "NeMo: un conjunto de herramientas para crear aplicaciones de inteligencia artificial utilizando módulos neuronales". arXiv : 1909.09577 [ cs.LG ].
  17. Wang, Yuxuan; Skerry-Ryan, RJ; Stanton, Daisy; Wu, Yonghui; Weiss, Ron J.; Jaitly, Navdeep; Yang, Zongheng; Xiao, Ying; Chen, Zhifeng; Bengio, Samy; Le, Quoc (2017-04-06). "Tacotron: Hacia la síntesis de voz de extremo a extremo". arXiv : 1703.10135 [ cs.CL ].
  18. 1 2 Prenger, Ryan; Valle, Rafael; Catanzaro, Bryan (2018-10-30). "WaveGlow: una red generativa basada en flujo para la síntesis de voz". arXiv : 1811.00002 [ cs.SD ].
  19. Vasquez, Sean; Lewis, Mike (2019-06-04). "MelNet: Un modelo generativo para audio en el dominio de la frecuencia". arXiv : 1906.01083 [ eess.AS ].
  20. 1 2 Ping, Wei; Peng, Kainan; Gibiansky, Andrew; Arik, Sercan O.; Kannan, Ajay; Narang, Sharan; Raiman, Jonathan; Miller, John (2018-02-22). "Deep Voice 3: Escalando texto a voz con aprendizaje de secuencias convolucionales". arXiv : 1710.07654 [ cs.SD ].
  21. ^ Ren, Yi; Ruan, Yangjun; Tan, Xu; Qin, Tao; Zhao, Sheng; Zhao, Zhou; Liu, Tie-Yan (20 de noviembre de 2019). "FastSpeech: texto a voz rápido, robusto y controlable". arXiv : 1905.09263 [ cs.CL ].
  22. ^ Ning, Yishuang; Él, Sheng; Wu, Zhiyong; Xing, Chunxiao; Zhang, Liang-Jie (enero de 2019). "Una revisión de la síntesis del habla basada en el aprendizaje profundo" . Ciencias Aplicadas . 9 (19): 4050. doi : 10.3390/app9194050 . ISSN 2076-3417 . 
  23. 1 2 Rodríguez-Ortega, Yohanna; Ballesteros, Dora María; Renza, Diego (2020). "Un modelo de aprendizaje automático para detectar voces falsas" . En Florez, Hector; Misra, Sanjay (eds.). Informática aplicada . Comunicaciones en informática y ciencias de la información. Vol. 1277. Cham: Springer International Publishing. pp. 3–13 . doi : 10.1007/978-3-030-61702-8_1 . ISBN   978-3-030-61702-8. S2CID 226283369 . 
  24. Zhang, Mingyang; Wang, Xin; Fang, Fuming; Li, Haizhou; Yamagishi, Junichi (2019-04-07). "Marco de entrenamiento conjunto para la conversión de texto a voz y voz utilizando Tacotron y WaveNet de múltiples fuentes". arXiv : 1903.12389 [ eess.AS ].
  25. 1 2 Sercan, Ö Arık; Jitong, Chen; Kainan, Peng; Wei, Ping; Yanqi, Zhou (2018). "Clonación de voz neuronal con pocas muestras" . Advances in Neural Information Processing Systems (NeurIPS 2018) . 31 (publicado el 12 de octubre de 2018): 10040–10050 . arXiv : 1802.06006 .
  26. 1 2 "| ASVspoof" . www.asvspoof.org . Consultado el 1 de julio de 2022 .
  27. 1 2 Yi, Jiangyan; Tao, Jianhua; Bai, Ye; Tian, ​​Ziqiang; Fan, Chuaneng (2023). "Detección de audio deepfake: una encuesta". arXiv : 2308.14970 [ cs.SD ].
  28. seem-ai/Resemblyzer , IA de similitud, 30/06/2022 , consultado el 01/07/2022
  29. mendaxfz (28-06-2022), Detección de voz sintética , consultado el 1 de julio de 2022
  30. HUA, Guang (29 de junio de 2022), Detección de voz sintética de extremo a extremo , consultado el 1 de julio de 2022
  31. Caramancion, Kevin Matthe (junio de 2022). «Una exploración de la desinformación en formato de audio difundida en podcasts: estudio de caso de Spotify». 2022 IEEE International IOT, Electronics and Mechatronics Conference (IEMTRONICS) . pp. 1–6 . doi : 10.1109/IEMTRONICS55184.2022.9795760 . ISBN  978-1-6654-8684-2. S2CID 249903722 . 
  32. 1 2 Chen, Tianxiang; Kumar, Avrosh; Nagarsheth, Parav; Sivaraman, Ganesh; Khoury, Elie (2020-11-01). "Generalización de la detección de deepfakes de audio" . Taller de reconocimiento de hablantes e idiomas (Odyssey 2020) . ISCA: 132–137 . doi : 10.21437/Odyssey.2020-19 . S2CID 219492826 . 
  33. Suwajanakorn, Supasorn; Seitz, Steven M.; Kemelmacher-Shlizerman, Ira (2017-07-20). "Synthesizing Obama: learning lip sync from audio" . ACM Transactions on Graphics . 36 (4): 95:1–95:13. doi : 10.1145/3072959.3073640 . ISSN 0730-0301 . S2CID 207586187 .  
  34. Stupp, Catherine. "Unos estafadores usaron IA para imitar la voz del director ejecutivo en un caso inusual de ciberdelincuencia" . WSJ . Consultado el 26 de mayo de 2024 .
  35. Brewster, Thomas. "La policía descubre que unos estafadores clonaron la voz del director de la empresa en un robo bancario de 35 millones de dólares" . Forbes . Consultado el 29 de junio de 2022 .
  36. "La IA generativa hace que las estafas por voz sean más fáciles de creer" . Axios . 13 de junio de 2023. Consultado el 16 de junio de 2023 .
  37. Bunn, Amy (15 de mayo de 2023). "Impostores artificiales: los ciberdelincuentes recurren a la clonación de voz mediante IA para un nuevo tipo de estafa" . Blog de McAfee . Consultado el 16 de junio de 2023 .
  38. Cox, Joseph (23 de febrero de 2023). "Cómo accedí a una cuenta bancaria con una voz generada por IA" . Vice . Consultado el 16 de junio de 2023 .
  39. Evershed, Nick; Taylor, Josh (16 de marzo de 2023). "La IA puede engañar al reconocimiento de voz utilizado para verificar la identidad por Centrelink y la oficina de impuestos australiana" . The Guardian . Consultado el 16 de junio de 2023 .
  40. "Los estafadores usan IA para mejorar sus planes de emergencia familiar" . Consejos para el consumidor . 17 de marzo de 2023. Consultado el 26 de mayo de 2024 .
  41. "Audio deepfake de Sir Keir Starmer publicado el primer día de la conferencia del Partido Laborista" .
  42. Meaker, Morgan. "Los deepfakes electorales de Eslovaquia demuestran que la IA es un peligro para la democracia" . Wired .
  43. "Consultor político detrás de la falsa llamada automática de IA a favor de Biden enfrenta cargos en New Hampshire" .
  44. "Acusan a consultor político de contratar a un mago para enviar spam a los votantes con llamadas falsas de Biden" . Law & Crime . 15 de marzo de 2024. Consultado el 23 de mayo de 2024 .
  45. David Wright; Brian Fung; Brian Fung (6 de febrero de 2024). "Falsa llamada automática de Biden vinculada a empresas con sede en Texas, anuncia el fiscal general de Nuevo Hampshire" . CNN .
  46. Brian Fung (8 de febrero de 2024). "La FCC vota a favor de prohibir las llamadas automáticas fraudulentas que utilizan voces generadas por IA" . CNN.
  47. "La FCC declara ilegales las voces generadas por IA en las llamadas automáticas | Comisión Federal de Comunicaciones" . www.fcc.gov . 8 de febrero de 2024. Consultado el 26 de mayo de 2024 .
  48. Kramer, Marcia (26 de febrero de 2024). "Steve Kramer explica por qué usó IA para suplantar al presidente Biden en New Hampshire - CBS Nueva York" . www.cbsnews.com . Consultado el 23 de mayo de 2024 .
  49. "Un consultor político enfrenta cargos y multas por llamadas automáticas con deepfake de Biden" .
  50. Growcoot, Matt (26 de septiembre de 2024). "Un youtuber ve su voz clonada con IA y utilizada por una empresa sin su consentimiento" . Peta Pixel . Consultado el 12 de marzo de 2026 .
  51. "Me robaron la voz con IA (ACTUALIZACIÓN: Elecrow respondió)" . YouTube . 21 de septiembre de 2024. Consultado el 12 de marzo de 2026 .
  52. "El lado oscuro de la clonación de voz por IA" . YouTube . 25 de septiembre de 2024. Consultado el 12 de marzo de 2026 .
  53. Forristal, Lauren (21 de octubre de 2025). "La tecnología de detección de parecidos de YouTube se ha lanzado oficialmente" . Tech Crunch . Consultado el 12 de marzo de 2026 .
  54. Desreumaux, Geoff (21 de octubre de 2025). "YouTube lanza oficialmente la tecnología de detección de semejanza para creadores" . Somos redes sociales . Consultado el 12 de marzo de 2026 .
  55. Deepfake It Till You Make It (PDF) (Informe). Graphika. Febrero de 2023.
  56. Kong, Jungil; Kim, Jaehyeon; Bae, Jaekyoung (23-10-2020). "HiFi-GAN: Redes generativas adversarias para la síntesis de voz eficiente y de alta fidelidad". arXiv : 2010.05646 [ cs.SD ].
  57. ^ Kumar, Kundan; Kumar, Rithesh; de Boissière, Thibault; Gestín, Lucas; Teoh, Wei Zhen; Sotelo, José; de Brébisson, Alexandre; Bengio, Yoshua; Courville, Aaron (8 de diciembre de 2019). "MelGAN: redes generativas adversarias para síntesis de formas de onda condicionales". arXiv : 1910.06711 [ eess.AS ].
  58. Ng, Andrew (1 de abril de 2020). "Clonación de voz para las masas" . DeepLearning.AI . Archivado del original el 28 de diciembre de 2024. Recuperado el 22 de diciembre de 2024 .
  59. Chandraseta, Rionaldi (21 de enero de 2021). "Genera las líneas de voz de tus personajes favoritos usando aprendizaje automático" . Hacia la ciencia de datos . Archivado del original el 21 de enero de 2021. Recuperado el 18 de diciembre de 2024 .
  60. "Muestras de audio de "Entrenamiento semisupervisado para mejorar la eficiencia de los datos en la síntesis de voz de extremo a extremo"" . 30-08-2018. Archivado del original el 11-11-2020 . Consultado el 05-06-2022 .
  61. Temitope, Yusuf (10 de diciembre de 2024). "El creador de 15.ai revela su trayectoria desde el proyecto del MIT hasta convertirse en un fenómeno de internet" . The Guardian . Lagos, Nigeria. Archivado del original el 28 de diciembre de 2024. Consultado el 25 de diciembre de 2024 .
  62. Kurosawa, Yuki (19 de enero de 2021). "ゲームキャラ音声読み上げソフト「15.ai」公開中。『Bajo cuento』や『Portal』のキャラに好きなセリフを言ってもらえる" [ El software de lectura de voz de personajes del juego "15.ai" ya está disponible. Obtenga personajes de Undertale y Portal para decir las líneas deseadas ] . AUTÓMATO (en japonés). Archivado desde el original el 19 de enero de 2021 . Consultado el 18 de diciembre de 2024 .
  63. "Navegando los desafíos y oportunidades de las voces sintéticas" . OpenAI . 9 de marzo de 2024. Archivado del original el 25 de noviembre de 2024. Consultado el 18 de diciembre de 2024 .
  64. Babbel.com; GmbH, Lección Nueve. "Los 10 idiomas más hablados del mundo" . Revista Babbel . Consultado el 30 de junio de 2022 .
  65. Najafian, Maryam; Russell, Martin (septiembre de 2020). "Identificación automática del acento como herramienta analítica para el reconocimiento automático del habla robusto al acento" . Speech Communication . 122 : 44–55 . doi : 10.1016/j.specom.2020.05.003 . S2CID 225778214 . 
  66. ^ Liu, Xiao; Zhang, Fanjin; Hou, Zhenyu; Mian, Li; Wang, Zhaoyu; Zhang, Jing; Tang, Jie (2021). "Aprendizaje autosupervisado: generativo o contrastivo". Transacciones IEEE sobre conocimiento e ingeniería de datos . 35 (1): 857–876 . arXiv : 2006.08218 . doi : 10.1109/TKDE.2021.3090866 . ISSN 1558-2191 . S2CID 219687051 .  
  67. Rimon, Inbal; Gal, Oren; Permuter, Haim (2025). "Desenmascarando deepfakes: aprovechando aumentos y variabilidad de características para la detección de voz deepfake". arXiv : 2501.05545 [ cs.SD ].
  68. Rashid, Md Mamunur; Lee, Suk-Hwan; Kwon, Ki-Ryong (2021). "Tecnología blockchain para combatir la falsificación profunda y proteger la integridad de videos e imágenes" . Revista de la Sociedad Multimedia de Corea . 24 (8): 1044– 1058. doi : 10.9717/kmms.2021.24.8.1044 . ISSN 1229-7771 . 
  69. Fraga-Lamas, Paula; Fernández-Caramés, Tiago M. (2019-10-20). "Noticias falsas, desinformación y deepfakes: aprovechamiento de las tecnologías de registro distribuido y blockchain para combatir el engaño digital y la realidad falsificada". IT Professional . 22 (2): 53– 59. arXiv : 1904.05386 . doi : 10.1109/MITP.2020.2977589 .
  70. Ki Chan, Christopher Chun; Kumar, Vimal; Delaney, Steven; Gochoo, Munkhjargal (septiembre de 2020). «Combatiendo los deepfakes: Multi-LSTM y blockchain como prueba de autenticidad para medios digitales». 2020 IEEE / ITU International Conference on Artificial Intelligence for Good (AI4G) . pp. 55–62 . doi : 10.1109/AI4G50087.2020.9311067 . ISBN  978-1-7281-7031-2. S2CID 231618774 . 
  71. Mittal, Trisha; Bhattacharya, Uttaran; Chandra, Rohan; Bera, Aniket; Manocha, Dinesh (12 de octubre de 2020), "Las emociones no mienten: un método de detección de deepfakes audiovisuales mediante señales afectivas" , Actas de la 28.ª Conferencia Internacional ACM sobre Multimedia , Nueva York, NY, EE. UU.: Association for Computing Machinery, págs. 2823–2832 , doi : 10.1145/3394171.3413570 , ISBN  978-1-4503-7988-5, S2CID 220935571 , consultado el 29-06-2022 
  72. Conti, Emanuele; Salvi, Davide; Borrelli, Clara; Hosler, Brian; Bestagini, Paolo; Antonacci, Fabio; Sarti, Augusto; Stamm, Matthew C.; Tubaro, Stefano (23 de mayo de 2022). "Detección de voz deepfake mediante reconocimiento de emociones: un enfoque semántico". ICASSP 2022 - Conferencia Internacional IEEE de Acústica, Habla y Procesamiento de Señales (ICASSP) de 2022. Singapur, Singapur: IEEE. págs. 8962–8966 . doi : 10.1109/ICASSP43922.2022.9747186 . hdl : 11311/1220518 . ISBN  978-1-6654-0540-9. S2CID 249436701 . 
  73. Hosler, Brian; Salvi, Davide; Murray, Anthony; Antonacci, Fabio; Bestagini, Paolo; Tubaro, Stefano; Stamm, Matthew C. (June 2021). "Do Deepfakes Feel Emotions? A Semantic Approach to Detecting Deepfakes Via Emotional Inconsistencies". 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). Nashville, TN, USA: IEEE. pp. 1013–1022. doi:10.1109/CVPRW53098.2021.00112. hdl:11311/1183572. ISBN 978-1-6654-4899-4. S2CID 235679849.
  74. Müller, Nicolas M.; Czempin, Pavel; Dieckmann, Franziska; Froghyar, Adam; Böttinger, Konstantin (2022-04-21). "Does Audio Deepfake Detection Generalize?". arXiv:2203.16263 [cs.SD].
  75. Zhang, You; Jiang, Fei; Duan, Zhiyao (2021). "One-Class Learning Towards Synthetic Voice Spoofing Detection". IEEE Signal Processing Letters. 28: 937–941. arXiv:2010.13995. Bibcode:2021ISPL...28..937Z. doi:10.1109/LSP.2021.3076358. ISSN 1558-2361. S2CID 235077416.
  76. "China Cyberspace Administration Deep Synthesis Regulations". January 2023.
  77. 12"SAM.gov". sam.gov. Retrieved 2022-06-29.
  78. "The SemaFor Program". www.darpa.mil. Retrieved 2022-07-01.
  79. "The DARPA MediFor Program". govtribe.com. Retrieved 2022-06-29.
  80. "The MediFor Program". www.darpa.mil. Retrieved 2022-07-01.
  81. "DARPA Announces Research Teams Selected to Semantic Forensics Program". www.darpa.mil. Retrieved 2022-07-01.
  82. "PREMIER". sites.google.com. Retrieved 2022-07-01.
  83. "PREMIER - Project". sites.google.com. Retrieved 2022-06-29.
  84. Bird, Jordan J.; Lotfi, Ahmad (2023). "Real-time Detection of AI-Generated Speech for DeepFake Voice Conversion". arXiv:2308.12734 [cs.SD].
  85. Yamagishi, Junichi; Wang, Xin; Todisco, Massimiliano; Sahidullah, Maryland; Patiño, José; Nautsch, Andreas; Liu, Xuechen; Lee, Kong Aik; Kinnunen, Tomi; Evans, Nicolás; Delgado, Héctor (01-09-2021). "ASVspoof 2021: acelerando el progreso en la detección de voz falsificada y ultrafalsa". arXiv : 2109.00537 [ eess.AS ].
  86. "Detección de deepfakes de audio: ICASSP 2022" . IEEE Signal Processing Society . 17 de diciembre de 2021. Consultado el 1 de julio de 2022 .
  87. ^ Yi, Jiangyan; Fu, Ruibo; Tao, Jianhua; Nie, Shuai; Mamá, Haoxin; Wang, Chenglong; Wang, Tao; Tian, ​​Zhengkun; Bai, Ye; Fan, Cunhang; Liang, Shan (26 de febrero de 2022). "ADD 2022: el primer desafío de detección de síntesis profunda de audio". arXiv : 2202.08433 [ cs.SD ].
  88. "Taller conjunto para el Desafío Blizzard y el Desafío de Conversión de Voz 2020 - SynSIG" . www.synsig.org . Archivado del original el 2 de julio de 2022. Consultado el 1 de julio de 2022 .
  89. "«Dejen de usar mi voz»: el nuevo locutor de ScotRail es mi clon de IA . BBC News . 27 de mayo de 2025. Consultado el 28 de mayo de 2025 .
  90. "La locutora Gayanne Potter insta a ScotRail a eliminar su voz de los nuevos anuncios sobre IA" . Sky News . Consultado el 28 de mayo de 2025 .
  91. Inglés, David Leask | Paul (27 de mayo de 2025). "Una actriz se siente 'engañada' por el nuevo locutor de voz con IA de ScotRail" . www.thetimes.com . Consultado el 28 de mayo de 2025 .
  92. "He prestado mi voz a los trenes de ScotRail durante 20 años y me reemplazaron con IA sin avisarme" . The National . 30 de mayo de 2025. Consultado el 17 de agosto de 2025 .
  93. "ScotRail sustituirá la controvertida voz con IA en los trenes" . BBC News . 25 de agosto de 2025. Consultado el 27 de agosto de 2025 .