El aprendizaje automático adversario es el estudio de los ataques a los algoritmos de aprendizaje automático y de las defensas contra dichos ataques. [ 1 ]
Las técnicas de aprendizaje automático están diseñadas principalmente para trabajar con conjuntos de problemas específicos, bajo el supuesto de que los datos de entrenamiento y prueba se generan a partir de la misma distribución estadística ( IID ). Sin embargo, este supuesto suele incumplirse en aplicaciones prácticas de alto riesgo, donde los usuarios pueden proporcionar intencionadamente datos falsificados que violan el supuesto estadístico.
Los ataques más comunes en el aprendizaje automático adversario incluyen ataques de evasión , [ 2 ] ataques de envenenamiento de datos , [ 3 ] ataques bizantinos [ 4 ] y extracción de modelos . [ 5 ]
Historia
En la Conferencia sobre Spam del MIT en enero de 2004, John Graham-Cumming demostró que un filtro de spam basado en aprendizaje automático podía utilizarse para burlar otro filtro de spam basado en aprendizaje automático, aprendiendo automáticamente qué palabras añadir a un correo electrónico no deseado para que este se clasificara como no spam. [ 6 ]
En 2004, Nilesh Dalvi y otros observaron que los clasificadores lineales utilizados en los filtros de spam podían ser burlados por simples " ataques de evasión " ya que los spammers insertaban "buenas palabras" en sus correos electrónicos de spam. (Alrededor de 2007, algunos spammers agregaron ruido aleatorio a palabras difusas dentro del "spam de imágenes" para burlar los filtros basados en OCR ). En 2006, Marco Barreno y otros publicaron "¿Puede el aprendizaje automático ser seguro?", describiendo una amplia taxonomía de ataques. Incluso en 2013, muchos investigadores continuaron esperando que los clasificadores no lineales (como las máquinas de vectores de soporte y las redes neuronales ) pudieran ser robustos frente a adversarios, hasta que Battista Biggio y otros demostraron los primeros ataques basados en gradientes en dichos modelos de aprendizaje automático (2012 [ 7 ] –2013 [ 8 ] ). En 2012, las redes neuronales profundas comenzaron a dominar los problemas de visión por computadora ; A partir de 2014, Christian Szegedy y otros demostraron que las redes neuronales profundas podían ser engañadas por adversarios, utilizando nuevamente un ataque basado en gradientes para crear perturbaciones adversarias. [ 9 ] [ 10 ]
Trabajos posteriores demostrarían que los ataques adversarios son más difíciles de producir en entornos no controlados, debido a las diferentes restricciones ambientales que anulan el efecto del ruido. [ 11 ] [ 12 ] Por ejemplo, cualquier pequeña rotación o ligera iluminación en una imagen adversaria puede destruir la adversarialidad. Además, investigadores como Nick Frosst de Google Brain señalan que es mucho más fácil hacer que los coches autónomos [ 13 ] no se tomen las señales de stop quitando físicamente la señal, en lugar de crear ejemplos adversarios. [ 14 ] Frosst también cree que la comunidad de aprendizaje automático adversario asume erróneamente que los modelos entrenados en una determinada distribución de datos también funcionarán bien en una distribución de datos completamente diferente. Sugiere que se debería explorar un nuevo enfoque para el aprendizaje automático y actualmente está trabajando en una red neuronal única que tiene características más similares a la percepción humana que los enfoques de última generación. [ 14 ]
Aunque el aprendizaje automático adversario sigue estando muy arraigado en el ámbito académico, grandes empresas tecnológicas como Google, Microsoft e IBM han comenzado a recopilar documentación y bases de código abierto para permitir que otros evalúen de forma concreta la robustez de los modelos de aprendizaje automático y minimicen el riesgo de ataques adversarios. [ 15 ] [ 16 ] [ 17 ]
Ejemplos
Los ejemplos incluyen ataques en el filtrado de spam , donde los mensajes de spam se ofuscan mediante la ortografía incorrecta de palabras "malas" o la inserción de palabras "buenas"; [ 18 ] [ 19 ] ataques en la seguridad informática , como la ofuscación de código malicioso dentro de paquetes de red o la modificación de las características de un flujo de red para engañar a la detección de intrusiones; [ 20 ] [ 21 ] ataques en el reconocimiento biométrico donde se pueden explotar rasgos biométricos falsos para suplantar a un usuario legítimo; [ 22 ] o para comprometer las galerías de plantillas de los usuarios que se adaptan a rasgos actualizados con el tiempo.
Los investigadores demostraron que, cambiando solo un píxel, era posible engañar a los algoritmos de aprendizaje profundo. [ 23 ] Otros imprimieron en 3D una tortuga de juguete con una textura diseñada para que la IA de detección de objetos de Google la clasificara como un rifle, independientemente del ángulo desde el que se observara. [ 24 ] La creación de la tortuga solo requirió tecnología de impresión 3D comercial de bajo costo. [ 25 ]
Se demostró que una imagen de un perro modificada por máquina parecía un gato tanto para las computadoras como para los humanos. [ 26 ] Un estudio de 2019 informó que los humanos pueden adivinar cómo las máquinas clasificarán las imágenes adversarias. [ 27 ] Los investigadores descubrieron métodos para perturbar la apariencia de una señal de alto de tal manera que un vehículo autónomo la clasificara como una señal de incorporación o de límite de velocidad. [ 13 ] [ 28 ]
En 2023, investigadores de la Universidad de Chicago lanzaron un filtro de envenenamiento de datos llamado Nightshade . Fue creado para que los artistas visuales lo utilizaran en sus obras para corromper el conjunto de datos de los modelos de conversión de texto a imagen , que generalmente extraen sus datos de internet sin el consentimiento del creador de la imagen. [ 29 ] [ 30 ]
McAfee atacó el antiguo sistema Mobileye de Tesla , engañándolo para que condujera a 50 mph por encima del límite de velocidad, simplemente agregando una tira de cinta negra de dos pulgadas a una señal de límite de velocidad. [ 31 ] [ 32 ]
Los patrones adversarios en gafas o prendas de vestir, diseñados para engañar a los sistemas de reconocimiento facial o a los lectores de matrículas, han dado lugar a una industria especializada de "ropa urbana sigilosa". [ 33 ]
Un ataque adversario a una red neuronal puede permitir que un atacante inyecte algoritmos en el sistema objetivo. [ 34 ] Los investigadores también pueden crear entradas de audio adversarias para disfrazar comandos a asistentes inteligentes en audio aparentemente inofensivo; [ 35 ] una literatura paralela explora la percepción humana de tales estímulos. [ 36 ] [ 37 ]
Los algoritmos de agrupamiento se utilizan en aplicaciones de seguridad. El análisis de malware y virus informáticos tiene como objetivo identificar familias de malware y generar firmas de detección específicas. [ 38 ] [ 39 ]
En el contexto de la detección de malware, los investigadores han propuesto métodos para la generación de malware adversario que crean automáticamente binarios para evadir los detectores basados en aprendizaje, preservando al mismo tiempo la funcionalidad maliciosa. Los ataques basados en optimización, como GAMMA, utilizan algoritmos genéticos para inyectar contenido benigno (por ejemplo, relleno o nuevas secciones PE ) en ejecutables de Windows, planteando la evasión como un problema de optimización con restricciones que equilibra el éxito de la clasificación errónea con el tamaño de la carga útil inyectada y demostrando su transferibilidad a productos antivirus comerciales. [ 40 ] Un trabajo complementario utiliza redes generativas adversarias (GAN) para aprender perturbaciones en el espacio de características que hacen que el malware se clasifique como benigno; Mal-LSGAN, por ejemplo, reemplaza la pérdida estándar de GAN con un objetivo de mínimos cuadrados y funciones de activación modificadas para mejorar la estabilidad del entrenamiento y producir ejemplos de malware adversario que reducen sustancialmente las tasas de verdaderos positivos en múltiples detectores. [ 41 ]
Desafíos en la aplicación del aprendizaje automático a la seguridad
Los investigadores han observado que las limitaciones bajo las cuales funcionan las técnicas de aprendizaje automático en el ámbito de la seguridad difieren de las de los dominios de referencia comunes. Los datos de seguridad pueden cambiar con el tiempo, incluir muestras mal etiquetadas o reflejar comportamientos adversarios, lo que complica la evaluación y la reproducibilidad. [ 42 ]
Problemas de recopilación de datos
Los conjuntos de datos de seguridad varían en formato, incluyendo binarios, rastreos de red y archivos de registro. Algunos estudios han informado que el proceso de convertir estas fuentes en características puede introducir sesgos o inconsistencias. [ 42 ] Además, pueden producirse fugas temporales cuando las muestras de malware relacionadas no se separan adecuadamente entre los conjuntos de entrenamiento y prueba , lo que puede generar resultados excesivamente optimistas. [ 42 ]
Desafíos relacionados con el etiquetado y la verificación sobre el terreno
Las etiquetas de malware suelen ser inestables porque diferentes motores antivirus pueden clasificar la misma muestra de forma contradictoria. Ceschin et al. señalan que las familias pueden ser renombradas o reorganizadas con el tiempo, lo que provoca mayores discrepancias en la información de referencia y reduce la fiabilidad de los puntos de referencia. [ 42 ]
Desviación conceptual
Debido a que los creadores de malware adaptan continuamente sus técnicas, las propiedades estadísticas de las muestras maliciosas también cambian. Esta forma de deriva conceptual ha sido ampliamente documentada y puede reducir el rendimiento del modelo a menos que los sistemas se actualicen periódicamente o incorporen mecanismos de aprendizaje incremental . [ 42 ]
Robustez de las características
Los investigadores distinguen entre características que pueden manipularse fácilmente y aquellas que son más resistentes a la modificación. Por ejemplo, los atributos estáticos simples, como los campos de encabezado, pueden ser alterados por atacantes, mientras que las características estructurales, como los grafos de flujo de control , son generalmente más estables pero computacionalmente costosas de extraer . [ 42 ]
Desequilibrio de clases
En entornos de implementación reales, la proporción de muestras maliciosas puede ser extremadamente baja, oscilando entre el 0,01 % y el 2 % del total de datos. Esta distribución desequilibrada provoca que los modelos desarrollen un sesgo hacia la clase mayoritaria, logrando una alta precisión pero sin identificar las muestras maliciosas. [ 43 ]
Los enfoques previos para este problema han incluido soluciones a nivel de datos y modelos específicos de secuencia. Métodos como las redes n-grama y de memoria a largo y corto plazo (LSTM) pueden modelar datos secuenciales, pero se ha demostrado que su rendimiento disminuye significativamente cuando las muestras de malware se distribuyen de forma realista en el conjunto de entrenamiento, lo que demuestra sus limitaciones en contextos de seguridad reales. [ 43 ]
Para abordar este problema, un enfoque ha sido adaptar modelos de procesamiento del lenguaje natural , como BERT . Este método consiste en tratar las secuencias de actividades de la aplicación como una forma de "lenguaje" y ajustar un modelo BERT preentrenado para la tarea específica. Un estudio que aplicó esta técnica a secuencias de actividad de Android reportó una puntuación F1 de 0,919 en un conjunto de datos con solo un 0,5 % de muestras de malware. Este resultado representó una mejora significativa con respecto a los modelos LSTM y n-grama, lo que demuestra el potencial de los modelos preentrenados para manejar el desequilibrio de clases en la detección de malware. [ 43 ]
Diseño de sistemas y aprendizaje
La ingeniería de características y el entrenamiento pueden causar problemas. El rastreo de datos es una trampa común donde un modelo se entrena utilizando información que no estaría disponible en un escenario del mundo real. [ 44 ] Las correlaciones espurias resultan cuando un modelo aprende a asociar artefactos con una etiqueta, en lugar del patrón subyacente relevante para la seguridad. [ 44 ] Por ejemplo, un clasificador de malware podría aprender a identificar un artefacto de compilador específico en lugar del comportamiento malicioso en sí. La selección de parámetros sesgada es una forma de rastreo de datos donde los hiperparámetros del modelo se ajustan utilizando el conjunto de prueba . [ 44 ]
Evaluación del desempeño
La elección de las métricas de evaluación puede afectar la validez de los resultados. Tener una línea base inapropiada implica no comparar un nuevo modelo con líneas base más simples y bien establecidas. [ 44 ] Las medidas de rendimiento inapropiadas significan usar métricas que no se alinean con los objetivos prácticos del sistema. [ 44 ] Informar solo la " precisión " a menudo se describe como insuficiente para un sistema de detección de intrusiones, donde las tasas de falsos positivos se consideran de vital importancia. [ 44 ] La falacia de la tasa base es un error al interpretar correctamente el rendimiento en el contexto de grandes desequilibrios de clases. [ 44 ]
Despliegue y operación
El despliegue plantea desafíos relacionados con el rendimiento y la seguridad en entornos reales. La evaluación solo en laboratorio consiste en evaluar un sistema únicamente en un entorno de laboratorio controlado y estático, lo que no tiene en cuenta desafíos del mundo real como la deriva conceptual y la sobrecarga de rendimiento. [ 44 ] Un modelo de amenazas inapropiado se refiere a no considerar el propio sistema de aprendizaje automático como una superficie de ataque . [ 44 ]
Envenenamiento por IA, jailbreaking e inyección rápida
El envenenamiento de IA, el jailbreaking y la inyección instantánea son tres formas distintas en que los atacantes subvierten los sistemas de IA. [ 45 ] [ 46 ] [ 47 ]
- El envenenamiento de datos corrompe un modelo durante el entrenamiento al insertar ejemplos maliciosos en los datos de los que aprende. Un estudio de 2025 realizado por Anthropic , el Instituto de Seguridad de IA del Reino Unido y el Instituto Alan Turing descubrió que tan solo 250 documentos envenenados podían crear puertas traseras en modelos, independientemente de su tamaño.
- El jailbreaking manipula un modelo en tiempo de ejecución mediante texto diseñado específicamente para eludir las medidas de seguridad. Ataca directamente las reglas de seguridad del modelo.
- La inyección de promesas aprovecha la incapacidad de los modelos de lenguaje para distinguir entre instrucciones y datos, lo que rompe la barrera de confianza en las aplicaciones. El Centro Nacional de Ciberseguridad del Reino Unido ha advertido que la inyección de promesas podría no eliminarse por completo, a diferencia de lo que ocurrió con la inyección SQL .
La inyección de mensajes puede escalar desde la generación de texto hasta la vulneración real del sistema cuando los modelos tienen acceso a herramientas como el correo electrónico, la ejecución de código o las bases de datos.
Modalidades de ataque
Taxonomía
Los ataques contra los algoritmos de aprendizaje automático ( supervisado ) se han categorizado a lo largo de tres ejes principales: [ 48 ] influencia en el clasificador, la violación de seguridad y su especificidad.
- Influencia del clasificador: Un ataque puede influir en el clasificador interrumpiendo la fase de clasificación. Esto puede ir precedido de una fase de exploración para identificar vulnerabilidades. Las capacidades del atacante podrían verse restringidas por la presencia de limitaciones en la manipulación de datos. [ 49 ]
- Violación de seguridad: Un ataque puede proporcionar datos maliciosos que se clasifican como legítimos. Los datos maliciosos proporcionados durante el entrenamiento pueden provocar que los datos legítimos sean rechazados después del entrenamiento.
- Especificidad: Un ataque dirigido busca permitir una intrusión o interrupción específica. Por el contrario, un ataque indiscriminado genera caos generalizado.
Esta taxonomía se ha ampliado a un modelo de amenazas más completo que permite hacer suposiciones explícitas sobre el objetivo del adversario, el conocimiento del sistema atacado, la capacidad de manipular los datos de entrada/componentes del sistema y la estrategia de ataque. [ 50 ] [ 51 ] Esta taxonomía se ha ampliado aún más para incluir dimensiones para estrategias de defensa contra ataques adversarios. [ 52 ]
Estrategias
A continuación se describen algunos de los escenarios de ataque más comunes.
Envenenamiento de datos
El envenenamiento consiste en contaminar el conjunto de datos de entrenamiento con datos diseñados para aumentar los errores en la salida. Dado que los algoritmos de aprendizaje se ven influenciados por sus conjuntos de datos de entrenamiento, el envenenamiento puede reprogramar algoritmos con intenciones potencialmente maliciosas. Se han planteado preocupaciones, especialmente en relación con los datos de entrenamiento generados por los usuarios, por ejemplo, para la recomendación de contenido o los modelos de lenguaje natural. La omnipresencia de las cuentas falsas ofrece muchas oportunidades para el envenenamiento. Según se informa, Facebook elimina alrededor de 7 mil millones de cuentas falsas al año. [ 53 ] [ 54 ] El envenenamiento se ha señalado como la principal preocupación para las aplicaciones industriales. [ 55 ]
En las redes sociales, las campañas de desinformación intentan influir en los algoritmos de recomendación y moderación para dar prioridad a cierto contenido sobre otro.
Un caso particular de envenenamiento de datos es el ataque de puerta trasera , [ 56 ] que tiene como objetivo enseñar un comportamiento específico para entradas con un desencadenante dado, por ejemplo, un pequeño defecto en imágenes, sonidos, videos o textos.

Por ejemplo, los sistemas de detección de intrusiones suelen entrenarse utilizando datos recopilados. Un atacante puede envenenar estos datos inyectando muestras maliciosas durante el funcionamiento, lo que posteriormente interrumpe el reentrenamiento. [ 50 ] [ 51 ] [ 48 ] [ 58 ] [ 59 ]
Las técnicas de envenenamiento de datos también pueden aplicarse a los modelos de texto a imagen para alterar su resultado, lo cual utilizan los artistas para defender sus obras protegidas por derechos de autor o su estilo artístico contra la imitación. [ 29 ]
El envenenamiento de datos también puede ocurrir involuntariamente a través del colapso del modelo , donde los modelos se entrenan con datos sintéticos. [ 60 ]
Un estudio de 2025 realizado por Anthropic, el Instituto de Seguridad de IA del Reino Unido y el Instituto Alan Turing descubrió que tan solo 250 documentos envenenados eran suficientes para introducir puertas traseras en modelos con entre 600 millones y 13 mil millones de parámetros, aproximadamente el 0,00016 % del total de tokens de entrenamiento del modelo más grande. [ 46 ]
Los tipos comunes de envenenamiento de datos incluyen: [ 46 ] [ 61 ]
- Inversión de etiquetas : cambiar las etiquetas correctas de los datos de entrenamiento por etiquetas incorrectas.
- Inyección de datos : añadir datos falsificados con etiquetas incorrectas para distorsionar el comportamiento.
- Envenenamiento por etiquetas limpias : los datos manipulados parecen legítimos, pero aun así provocan un aprendizaje incorrecto.
- Ataques de puerta trasera : desencadenar comportamientos no deseados específicos cuando se presentan ciertos patrones de entrada.
ataques bizantinos
A medida que el aprendizaje automático se escala, suele depender de múltiples máquinas de computación. En el aprendizaje federado , por ejemplo, los dispositivos periféricos colaboran con un servidor central, normalmente enviando gradientes o parámetros del modelo. Sin embargo, algunos de estos dispositivos pueden desviarse de su comportamiento esperado, por ejemplo, para dañar el modelo del servidor central [ 62 ] o para sesgar los algoritmos hacia ciertos comportamientos (por ejemplo, amplificando la recomendación de contenido de desinformación). Por otro lado, si el entrenamiento se realiza en una sola máquina, el modelo es muy vulnerable a un fallo de la máquina o a un ataque a la misma; la máquina es un único punto de fallo [ 63 ] . De hecho, el propio propietario de la máquina puede insertar puertas traseras demostrablemente indetectables [ 64 ] .
Las soluciones líderes actuales para hacer que los algoritmos de aprendizaje (distribuido) sean demostrablemente resistentes a una minoría de participantes maliciosos (también conocidos como bizantinos ) se basan en reglas de agregación de gradiente robustas . [ 65 ] [ 66 ] [ 67 ] [ 68 ] [ 69 ] [ 70 ] Las reglas de agregación robustas no siempre funcionan, especialmente cuando los datos entre los participantes tienen una distribución no i.i.d. Sin embargo, en el contexto de participantes honestos heterogéneos, como usuarios con diferentes hábitos de consumo para algoritmos de recomendación o estilos de escritura para modelos de lenguaje, existen teoremas de imposibilidad demostrables sobre lo que cualquier algoritmo de aprendizaje robusto puede garantizar. [ 4 ] [ 71 ]
Evasión
Los ataques de evasión [ 8 ] [ 50 ] [ 51 ] [ 72 ] consisten en explotar la imperfección de un modelo entrenado. Por ejemplo, los spammers y los hackers a menudo intentan evadir la detección ofuscando el contenido de los correos electrónicos no deseados y el malware . Las muestras se modifican para evadir la detección; es decir, para ser clasificadas como legítimas. Esto no implica influencia sobre los datos de entrenamiento. Un ejemplo claro de evasión es el spam basado en imágenes, en el que el contenido del spam se incrusta dentro de una imagen adjunta para evadir el análisis textual de los filtros antispam. Otro ejemplo de evasión lo proporcionan los ataques de suplantación de identidad contra los sistemas de verificación biométrica. [ 22 ]
Los ataques de evasión generalmente se pueden dividir en dos categorías diferentes: ataques de caja negra y ataques de caja blanca . [ 16 ]
Extracción de modelos
La extracción de modelos implica que un adversario explore un sistema de aprendizaje automático de caja negra para extraer los datos con los que fue entrenado. [ 73 ] [ 74 ] Esto puede causar problemas cuando los datos de entrenamiento o el modelo en sí son sensibles y confidenciales. Por ejemplo, la extracción de modelos podría usarse para extraer un modelo de negociación de acciones patentado que el adversario podría usar para su propio beneficio financiero.
En casos extremos, la extracción del modelo puede dar lugar al robo del modelo, que consiste en extraer una cantidad suficiente de datos del modelo para permitir su reconstrucción completa.
Por otro lado, la inferencia de pertenencia es un ataque dirigido de extracción de modelos que infiere el propietario de un punto de datos, a menudo aprovechando el sobreajuste resultante de malas prácticas de aprendizaje automático. [ 75 ] Resulta preocupante que esto a veces se pueda lograr incluso sin conocimiento ni acceso a los parámetros del modelo objetivo, lo que plantea problemas de seguridad para los modelos entrenados con datos sensibles, incluidos, entre otros, los registros médicos y/o la información de identificación personal. Con la aparición del aprendizaje por transferencia y la accesibilidad pública de muchos modelos de aprendizaje automático de última generación, las empresas tecnológicas se ven cada vez más atraídas a crear modelos basados en modelos públicos, lo que proporciona a los atacantes información fácilmente accesible sobre la estructura y el tipo de modelo que se está utilizando. [ 75 ]
Categorías
Ataques adversarios y entrenamiento en modelos lineales
Existe una creciente bibliografía sobre ataques adversarios en modelos lineales . De hecho, desde el trabajo pionero de Goodfellow et al. [ 76 ] , el estudio de estos modelos en modelos lineales ha sido una herramienta importante para comprender cómo los ataques adversarios afectan a los modelos de aprendizaje automático. El análisis de estos modelos se simplifica porque el cálculo de los ataques adversarios se puede simplificar en problemas de regresión lineal y clasificación . Además, el entrenamiento adversario es convexo en este caso. [ 77 ]
Los modelos lineales permiten el análisis analítico a la vez que reproducen fenómenos observados en modelos de última generación. Un ejemplo clave es cómo este modelo puede utilizarse para explicar la relación de compromiso entre robustez y precisión . [ 78 ] De hecho, diversos trabajos proporcionan análisis de ataques adversarios en modelos lineales, incluyendo análisis asintóticos para clasificación [ 79 ] y para regresión lineal. [ 80 ] [ 81 ] Y análisis de muestras finitas basado en la complejidad de Rademacher . [ 82 ]
Un resultado del estudio de los ataques adversarios en modelos lineales es que se relaciona estrechamente con la regularización . [ 83 ] Bajo ciertas condiciones, se ha demostrado que
- El entrenamiento adversario de un modelo de regresión lineal con perturbaciones de entrada restringidas por la norma infinito se asemeja mucho a la regresión Lasso , y que
- El entrenamiento adversario de un modelo de regresión lineal con perturbaciones de entrada restringidas por la norma 2 se asemeja mucho a la regresión Ridge .
aprendizaje profundo por refuerzo adversario
El aprendizaje profundo por refuerzo adversario es un área de investigación activa en el aprendizaje por refuerzo que se centra en las vulnerabilidades de las políticas aprendidas. En esta área de investigación, algunos estudios mostraron inicialmente que las políticas de aprendizaje por refuerzo son susceptibles a manipulaciones adversarias imperceptibles. [ 76 ] [ 84 ] Si bien se han propuesto algunos métodos para superar estas susceptibilidades, en los estudios más recientes se ha demostrado que estas soluciones propuestas están lejos de proporcionar una representación precisa de las vulnerabilidades actuales de las políticas de aprendizaje profundo por refuerzo. [ 85 ]
Procesamiento adversario del lenguaje natural
Se han introducido ataques adversarios contra el reconocimiento de voz en aplicaciones de conversión de voz a texto, en particular contra la implementación de DeepSpeech de Mozilla [ 86 ] y el modelo Speech Commands de Google [ 87 ] . Se han propuesto varias técnicas de preprocesamiento para defenderse de estos ataques [ 88 ] , pero es posible que estos métodos no sean resistentes a atacantes que conozcan dichas defensas.
Tipos de ataque específicos
Existe una gran variedad de ataques adversarios que pueden utilizarse contra los sistemas de aprendizaje automático. Muchos de ellos funcionan tanto en sistemas de aprendizaje profundo como en modelos de aprendizaje automático tradicionales, como las SVM [ 7 ] y la regresión lineal [ 89 ] . Una muestra de alto nivel de estos tipos de ataques incluye:
- Ejemplos adversarios [ 90 ]
- Ataques troyanos y de puerta trasera [ 91 ]
- Inversión del modelo [ 92 ]
- Inferencia de pertenencia [ 93 ]
Ejemplos adversarios
Un ejemplo adversario se refiere a una entrada especialmente diseñada para parecer "normal" a los humanos, pero que provoca una clasificación errónea en un modelo de aprendizaje automático. A menudo, se utiliza algún tipo de "ruido" diseñado específicamente para provocar estas clasificaciones erróneas. A continuación, se presentan algunas técnicas actuales para generar ejemplos adversarios en la literatura (esta lista no es exhaustiva).
- Ataque de evasión basado en gradientes [ 8 ]
- Método de signo de gradiente rápido (FGSM) [ 94 ]
- Descenso de gradiente proyectado (PGD) [ 95 ]
- Ataque de Carlini y Wagner (C&W) [ 96 ]
- Ataque de parche adversario [ 97 ]
Ataques de caja negra
Los ataques de caja negra en el aprendizaje automático adversario asumen que el adversario solo puede obtener resultados para las entradas proporcionadas y no tiene conocimiento de la estructura o los parámetros del modelo. [ 16 ] [ 98 ] En este caso, el ejemplo adversario se genera utilizando un modelo creado desde cero o sin ningún modelo (excluyendo la capacidad de consultar el modelo original). En cualquier caso, el objetivo de estos ataques es crear ejemplos adversarios que puedan transferirse al modelo de caja negra en cuestión. [ 99 ]
Ataques adversarios simples de caja negra
Los ataques adversarios simples de caja negra son una forma eficiente en términos de consultas de atacar clasificadores de imágenes de caja negra. [ 100 ]
Tomar una base ortonormal aleatoriaenLos autores sugirieron la transformada discreta del coseno de la base estándar (los píxeles).
Para una imagen correctamente clasificada, intentary comparar la cantidad de error en el clasificador en. Elija la que cause la mayor cantidad de error.
Repita esto parahasta que se alcance el nivel de error deseado en el clasificador.
Se descubrió cuando los autores diseñaron una línea base simple para compararla con un algoritmo de ataque adversario de caja negra anterior basado en procesos gaussianos , y se sorprendieron de que la línea base funcionara incluso mejor. [ 101 ]
Ataque cuadrado
Los ataques Square se introdujeron en 2020 como una técnica de ataque adversario de evasión de caja negra basada en la consulta de puntuaciones de clasificación sin necesidad de información de gradiente. [ 102 ] Como ataque de caja negra basado en puntuación, este enfoque adversario puede consultar distribuciones de probabilidad entre las clases de salida del modelo, pero no tiene otro acceso al modelo en sí. Según los autores del artículo, el ataque Square propuesto requería menos consultas que los ataques de caja negra basados en puntuación de última generación en ese momento. [ 102 ]
Para describir el objetivo de la función, el ataque define el clasificador como, conrepresentando las dimensiones de la entrada ycomo el número total de clases de salida.devuelve la puntuación (o una probabilidad entre 0 y 1) que la entradapertenece a la clase, lo que permite que la salida de clase del clasificador sea para cualquier entradaser definido como. El objetivo de este ataque es el siguiente: [ 102 ]
En otras palabras, encontrar algún ejemplo adversario perturbadode tal manera que el clasificador lo clasifica incorrectamente en alguna otra clase bajo la restricción de queyson similares. El artículo luego define la pérdidacomoy propone la solución para encontrar ejemplos adversarioscomo solución del siguiente problema de optimización con restricciones : [ 102 ]
En teoría, el resultado es un ejemplo adversario que tiene una alta confianza en la clase incorrecta, pero que también es muy similar a la imagen original. Para encontrar dicho ejemplo, Square Attack utiliza la técnica de búsqueda aleatoria iterativa para perturbar aleatoriamente la imagen con la esperanza de mejorar la función objetivo. En cada paso, el algoritmo perturba solo una pequeña sección cuadrada de píxeles, de ahí el nombre Square Attack, que finaliza tan pronto como se encuentra un ejemplo adversario para mejorar la eficiencia de la consulta. Finalmente, dado que el algoritmo de ataque utiliza puntuaciones y no información de gradiente, los autores del artículo indican que este enfoque no se ve afectado por el enmascaramiento de gradiente, una técnica común utilizada anteriormente para prevenir ataques de evasión. [ 102 ]
Ataque de salto
Este ataque de caja negra también se propuso como un ataque eficiente en consultas, pero que se basa únicamente en el acceso a la clase de salida predicha de cualquier entrada. En otras palabras, el ataque HopSkipJump no requiere la capacidad de calcular gradientes ni el acceso a valores de puntuación como el Square Attack, y solo requerirá la salida de predicción de clase del modelo (para cualquier entrada dada). El ataque propuesto se divide en dos configuraciones diferentes, dirigida y no dirigida, pero ambas se basan en la idea general de agregar perturbaciones mínimas que conducen a una salida diferente del modelo. En la configuración dirigida, el objetivo es hacer que el modelo clasifique erróneamente la imagen perturbada en una etiqueta objetivo específica (que no es la etiqueta original). En la configuración no dirigida, el objetivo es hacer que el modelo clasifique erróneamente la imagen perturbada en cualquier etiqueta que no sea la etiqueta original. Los objetivos del ataque para ambos son los siguientes:es la imagen original,es la imagen adversaria,es una función de distancia entre imágenes,es la etiqueta objetivo, yes la función de etiqueta de clase de clasificación del modelo: [ 103 ]
Para resolver este problema, el ataque propone la siguiente función de frontera.tanto para el entorno no dirigido como para el dirigido: [ 103 ]
Esto se puede simplificar aún más para visualizar mejor el límite entre diferentes ejemplos adversarios potenciales: [ 103 ]
Con esta función límite, el ataque sigue un algoritmo iterativo para encontrar ejemplos adversarios.para una imagen dadaque satisface los objetivos del ataque.
- Inicializarhasta algún punto donde
- Itere a continuación
- Búsqueda de límites
- Actualización de gradiente
- Calcular el gradiente
- Encuentra el tamaño del paso
La búsqueda de límites utiliza una búsqueda binaria modificada para encontrar el punto en el que el límite (tal como se define por) se interseca con la línea entreyEl siguiente paso implica calcular el gradiente paray actualizar el originalutilizando este gradiente y un tamaño de paso preseleccionado. Los autores de HopSkipJump demuestran que este algoritmo iterativo convergerá, lo que lleva a...a un punto justo en el límite que está muy cerca en distancia de la imagen original. [ 103 ]
Sin embargo, dado que HopSkipJump es un ataque de caja negra propuesto y el algoritmo iterativo anterior requiere el cálculo de un gradiente en el segundo paso iterativo (al que los ataques de caja negra no tienen acceso), los autores proponen una solución para el cálculo del gradiente que solo requiere las predicciones de salida del modelo. [ 103 ] Al generar muchos vectores aleatorios en todas las direcciones, denotados comoSe puede calcular una aproximación del gradiente utilizando el promedio de estos vectores aleatorios ponderados por el signo de la función de contorno en la imagen., dóndees el tamaño de la perturbación del vector aleatorio: [ 103 ]
El resultado de la ecuación anterior proporciona una aproximación cercana del gradiente requerido en el paso 2 del algoritmo iterativo, completando HopSkipJump como un ataque de caja negra. [ 104 ] [ 105 ] [ 103 ]
Ataques de cajas blancas
Los ataques de caja blanca suponen que el adversario tiene acceso a los parámetros del modelo, además de poder obtener etiquetas para las entradas proporcionadas. [ 99 ]
Método de signo de gradiente rápido
Uno de los primeros ataques propuestos para generar ejemplos adversarios fue propuesto por los investigadores de Google Ian J. Goodfellow , Jonathon Shlens y Christian Szegedy. [ 106 ] El ataque se denominó método de signo de gradiente rápido (FGSM) y consiste en añadir una cantidad lineal de ruido imperceptible a la imagen y provocar que un modelo la clasifique incorrectamente. Este ruido se calcula multiplicando el signo del gradiente con respecto a la imagen que queremos perturbar por una pequeña constante épsilon. A medida que épsilon aumenta, es más probable que el modelo sea engañado, pero las perturbaciones también se vuelven más fáciles de identificar. A continuación se muestra la ecuación para generar un ejemplo adversario dondees la imagen original,es un número muy pequeño,es la función gradiente,es la función de pérdida,son los pesos del modelo yes la etiqueta verdadera. [ 107 ]
Una propiedad importante de esta ecuación es que el gradiente se calcula con respecto a la imagen de entrada, ya que el objetivo es generar una imagen que maximice la pérdida para la imagen original de etiqueta verdadera.En el descenso de gradiente tradicional (para el entrenamiento del modelo), el gradiente se utiliza para actualizar los pesos del modelo, ya que el objetivo es minimizar la pérdida del modelo en un conjunto de datos de referencia. El Método de Signo de Gradiente Rápido (FGSM) se propuso como una forma rápida de generar ejemplos adversarios para evadir el modelo, basándose en la hipótesis de que las redes neuronales no pueden resistir ni siquiera cantidades lineales de perturbación en la entrada. [ 108 ] [ 107 ] [ 106 ] El FGSM ha demostrado ser eficaz en ataques adversarios para la clasificación de imágenes y el reconocimiento de acciones esqueléticas. [ 109 ]
Carlini y Wagner
En un esfuerzo por analizar los ataques y defensas adversarios existentes, los investigadores de la Universidad de California, Berkeley, Nicholas Carlini y David Wagner propusieron en 2016 un método más rápido y robusto para generar ejemplos adversarios. [ 110 ]
El ataque propuesto por Carlini y Wagner comienza con el intento de resolver una difícil ecuación de optimización no lineal: [ 74 ]
Aquí el objetivo es minimizar el ruido (), añadido a la entrada original, de tal manera que el algoritmo de aprendizaje automático () predice la entrada original con delta (o) como alguna otra claseSin embargo, en lugar de utilizar directamente la ecuación anterior, Carlini y Wagner proponen usar una nueva función.de tal manera que: [ 74 ]
Esto condensa la primera ecuación al problema que se muestra a continuación: [ 74 ]
y aún más a la ecuación siguiente: [ 74 ]
Carlini y Wagner proponen entonces el uso de la siguiente función en lugar deusando, una función que determina las probabilidades de clase para una entrada dada. Cuando se sustituye, esta ecuación puede pensarse como encontrar una clase objetivo que sea más segura que la siguiente clase más probable por una cantidad constante: [ 74 ]
Cuando se resuelve utilizando el descenso de gradiente, esta ecuación es capaz de producir ejemplos adversarios más fuertes en comparación con el método de signo de gradiente rápido que también es capaz de eludir la destilación defensiva , una defensa que alguna vez se propuso como efectiva contra ejemplos adversarios. [ 111 ] [ 112 ] [ 110 ] [ 74 ]
Defensas

Los investigadores han propuesto un enfoque de varios pasos para proteger el aprendizaje automático. [ 10 ]
- Modelado de amenazas: formalizar los objetivos y capacidades de los atacantes con respecto al sistema objetivo.
- Simulación de ataque: formalizar el problema de optimización que el atacante intenta resolver según las posibles estrategias de ataque.
- Evaluación del impacto del ataque
- Diseño de contramedidas
- Detección de ruido (para ataques basados en la evasión) [ 113 ]
- Lavado de información: Alterar la información recibida por los adversarios (para ataques de robo de modelos) [ 74 ]
Mecanismos
Se han propuesto varios mecanismos de defensa contra la evasión, el envenenamiento y los ataques a la privacidad, entre ellos:
- Algoritmos de aprendizaje seguros [ 19 ] [ 114 ] [ 115 ]
- Algoritmos resistentes a ataques bizantinos [ 65 ] [ 4 ]
- Sistemas de clasificación múltiple [ 18 ] [ 116 ]
- Algoritmos escritos por IA. [ 34 ]
- IA que exploran el entorno de entrenamiento; por ejemplo, en el reconocimiento de imágenes, navegan activamente por un entorno 3D en lugar de escanear pasivamente un conjunto fijo de imágenes 2D. [ 34 ]
- Aprendizaje que preserva la privacidad [ 51 ] [ 117 ]
- Algoritmo de escalera para competiciones al estilo Kaggle [ 118 ]
- modelos de teoría de juegos [ 119 ] [ 120 ] [ 121 ]
- Saneamiento de datos de entrenamiento
- Entrenamiento adversario [ 94 ] [ 21 ]
- Algoritmos de detección de puertas traseras [ 122 ]
- Técnicas de enmascaramiento/ofuscación de gradientes: para evitar que el adversario explote el gradiente en ataques de caja blanca. Esta familia de defensas se considera poco fiable, ya que estos modelos siguen siendo vulnerables a ataques de caja negra o pueden eludirse de otras maneras. [ 123 ]
- En la literatura se han propuesto conjuntos de modelos que han demostrado ser ineficaces contra ataques de evasión [ 124 ] pero eficaces contra ataques de envenenamiento de datos. [ 125 ]
- Defensa de objetivo móvil [ 126 ]
Véase también
Referencias
- ↑ Kianpour, Mazaher; Wen, Shao-Fang (2020). «Ataques de sincronización en el aprendizaje automático: estado del arte». Sistemas inteligentes y aplicaciones . Avances en sistemas inteligentes y computación. Vol. 1037. pp. 111–125 . doi : 10.1007/978-3-030-29516-5_10 . ISBN 978-3-030-29515-8. S2CID 201705926 .
- ↑ Goodfellow, Ian; McDaniel, Patrick; Papernot, Nicolas (25 de junio de 2018). "Cómo hacer que el aprendizaje automático sea robusto frente a entradas adversarias" . Communications of the ACM . 61 (7): 56– 66. doi : 10.1145/3134599 . ISSN 0001-0782 .
- ↑ Geiping, Jonas; Fowl, Liam H.; Huang, W. Ronny; Czaja, Wojciech; Taylor, Gavin; Moeller, Michael; Goldstein, Tom (2020-09-28). Witches' Brew: Industrial Scale Data Poisoning via Gradient Matching . International Conference on Learning Representations 2021 (Póster).
- 1 2 3 El-Mhamdi, El Mahdi; Farhadkhani, Sadegh; Guerraoui, Rachid; Guirguis, Arsany; Hoang, Lê-Nguyên; Rouault, Sébastien (2021-12-06). "Aprendizaje colaborativo en la jungla (aprendizaje descentralizado, bizantino, heterogéneo, asíncrono y no convexo)" . Avances en sistemas de procesamiento de información neuronal . 34. arXiv : 2008.00742 .
- ↑ Tramèr, Florian; Zhang, Fan; Juels, Ari; Reiter, Michael K.; Ristenpart, Thomas (2016). Robo de modelos de aprendizaje automático mediante API de predicción . 25.º Simposio de Seguridad de USENIX. págs. 601–618 . ISBN 978-1-931971-32-4.
- ↑ "Cómo vencer un filtro de spam adaptativo/bayesiano (2004)" . Consultado el 5 de julio de 2023 .
- 1 2 Biggio, Battista; Nelson, Blaine; Laskov, Pavel (2013-03-25). "Ataques de envenenamiento contra máquinas de vectores de soporte". arXiv : 1206.6389 [ cs.LG ].
- 1 2 3 Biggio, Battista; Corona, Igino; Maiorca, Davide; Nelson, Blaine; Srndic, Nedim; Laskov, Pavel; Giacinto, Giorgio; Roli, Fabio (2013). "Ataques de evasión contra el aprendizaje automático en tiempo de prueba". Aprendizaje automático y descubrimiento de conocimiento en bases de datos . Notas de clase en ciencias de la computación. Vol. 8190. Springer. págs. 387–402 . arXiv : 1708.06131 . doi : 10.1007/978-3-642-40994-3_25 . ISBN 978-3-642-38708-1. S2CID 18716873 .
- ↑ Szegedy, cristiano; Zaremba, Wojciech; Sutskever, Ilya; Bruna, Juana; Erhan, Dumitru; Buen compañero, Ian; Fergus, Rob (19 de febrero de 2014). "Propiedades intrigantes de las redes neuronales". arXiv : 1312.6199 [ cs.CV ].
- 1 2 Biggio, Battista; Roli, Fabio (diciembre de 2018). "Patrones salvajes: diez años después del auge del aprendizaje automático adversario". Pattern Recognition . 84 : 317–331 . arXiv : 1712.03141 . Bibcode : 2018PatRe..84..317B . doi : 10.1016/j.patcog.2018.07.023 . S2CID 207324435 .
- ↑ Kurakin, Alexey; Goodfellow, Ian; Bengio, Samy (2016). "Ejemplos adversariales en el mundo físico". arXiv : 1607.02533 [ cs.CV ].
- ^ Gupta, Kishor Datta; Dasgupta, Dipankar; Akhtar, Zahid (2020). "Cuestiones de aplicabilidad de técnicas de mitigación y ataques adversarios basados en evasión" . Serie de simposios IEEE 2020 sobre inteligencia computacional (SSCI). doi : 10.1109/SSCI47803.2020.9308589 .
- 1 2 Lim, Hazel Si Min; Taeihagh, Araz (2019). "Toma de decisiones algorítmica en AVs: comprensión de las preocupaciones éticas y técnicas para las ciudades inteligentes" . Sustainability . 11 (20): 5791. arXiv : 1910.13122 . Bibcode : 2019arXiv191013122L . doi : 10.3390/su11205791 . S2CID 204951009 .
- 1 2 "Nicholas Frosst de Google Brain sobre ejemplos adversarios y respuestas emocionales" . Sincronizado . 21/11/2019 . Recuperado el 23/10/2021 .
- ↑ "Prácticas de IA responsables" . Google AI . Consultado el 23 de octubre de 2021 .
- 1 2 3 Adversarial Robustness Toolbox (ART) v1.8 , Trusted-AI, 23/10/2021 , consultado el 23/10/2021
- ↑ amarshal. "Modos de fallo en el aprendizaje automático: documentación de seguridad" . docs.microsoft.com . Consultado el 23 de octubre de 2021 .
- 1 2 Biggio, Battista; Fumera, Giorgio; Roli, Fabio (2010). "Sistemas de clasificadores múltiples para el diseño robusto de clasificadores en entornos adversarios" . Revista Internacional de Aprendizaje Automático y Cibernética . 1 ( 1– 4): 27– 41. doi : 10.1007/s13042-010-0007-7 . hdl : 11567/1087824 . ISSN 1868-8071 . S2CID 8729381 . Archivado del original el 19-01-2023 . Recuperado el 14-01-2015 .
- 1 2 Brückner, Michael; Kanzow, Christian; Scheffer, Tobias (2012). "Juegos de predicción estática para problemas de aprendizaje adversario" (PDF) . Journal of Machine Learning Research . 13 (septiembre): 2617–2654 . ISSN 1533-7928 .
- ↑ Apruzzese, Giovanni; Andreolini, Mauro; Ferretti, Luca; Marchetti, Mirco; Colajanni, Michele (2021-06-03). "Modelado de ataques adversarios realistas contra sistemas de detección de intrusiones en la red". Amenazas digitales: investigación y práctica . 3 (3): 1– 19. arXiv : 2106.09380 . doi : 10.1145/3469659 . ISSN 2692-1626 . S2CID 235458519 .
- 1 2 Vitorino, João; Oliveira, Nuño; Praça, Isabel (marzo 2022). "Patrones de perturbación adaptativos: aprendizaje adversario realista para una detección sólida de intrusiones" . Internet del futuro . 14 (4): 108. arXiv : 2203.04234 . doi : 10.3390/fi14040108 . hdl : 10400.22/21851 . ISSN 1999-5903 .
- 1 2 Rodrigues, Ricardo N.; Ling, Lee Luan; Govindaraju, Venu (1 de junio de 2009). "Robustez de los métodos de fusión biométrica multimodal frente a ataques de suplantación" (PDF) . Journal of Visual Languages & Computing . 20 (3): 169– 179. doi : 10.1016/j.jvlc.2009.01.010 . ISSN 1045-926X .
- ↑ Su, Jiawei; Vargas, Danilo Vasconcellos; Sakurai, Kouichi (octubre de 2019). "Ataque de un píxel para engañar a las redes neuronales profundas". IEEE Transactions on Evolutionary Computation . 23 (5): 828– 841. arXiv : 1710.08864 . Bibcode : 2019ITEC...23..828S . doi : 10.1109/TEVC.2019.2890858 . ISSN 1941-0026 . S2CID 2698863 .
- ↑ "Un solo cambio de píxel engaña a los programas de IA" . BBC News . 3 de noviembre de 2017. Consultado el 12 de febrero de 2018 .
- ↑ Athalye, Anish; Engstrom, Logan; Ilyas, Andrew; Kwok, Kevin (2017). "Synthesizing Robust Adversarial Examples". arXiv : 1707.07397 [ cs.CV ].
- ↑ "La IA tiene un problema de alucinaciones que está resultando difícil de solucionar" . WIRED . 2018. Consultado el 10 de marzo de 2018 .
- ↑ Zhou, Zhenglong; Firestone, Chaz (2019). "Los humanos pueden descifrar imágenes adversarias" . Nature Communications . 10 (1): 1334. arXiv : 1809.04120 . Bibcode : 2019NatCo..10.1334Z . doi : 10.1038/ s41467-019-08931-6 . PMC 6430776. PMID 30902973 .
- ↑ Ackerman, Evan (4 de agosto de 2017). "Modificaciones leves en las señales de tráfico pueden engañar por completo a los algoritmos de aprendizaje automático" . IEEE Spectrum: Noticias sobre tecnología, ingeniería y ciencia . Consultado el 15 de julio de 2019 .
- 1 2 Edwards, Benj (25-10-2023). "Investigadores de la Universidad de Chicago buscan "envenenar" los generadores de arte de IA con Nightshade" . Ars Technica . Recuperado el 27-10-2023 .
- ↑ Shan, Shawn; Ding, Wenxin; Passananti, Josephine; Wu, Stanley; Zheng, Haitao; Zhao, Ben Y. (2023). "Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models". arXiv : 2310.13828 [ cs.CR ].
- ↑ "Un pequeño trozo de cinta adhesiva engañó a los Tesla para que aceleraran hasta 80 km/h" . Wired . 2020. Consultado el 11 de marzo de 2020 .
- ↑ "Modificación de modelos ADAS para allanar el camino a vehículos autónomos más seguros" . Blogs de McAfee . 19 de febrero de 2020. Consultado el 4 de enero de 2026 .
- ↑ Seabrook, John (2020). "Vestirse para la era de la vigilancia" . The New Yorker . Recuperado el 5 de abril de 2020 .
- 1 2 3 Heaven, Douglas (octubre de 2019). "Por qué las IA de aprendizaje profundo son tan fáciles de engañar". Nature . 574 (7777): 163– 166. Bibcode : 2019Natur.574..163H . doi : 10.1038/ d41586-019-03013-5 . PMID 31597977. S2CID 203928744 .
- ↑ Hutson, Matthew (10 de mayo de 2019). "La IA ahora puede defenderse contra mensajes maliciosos ocultos en el habla". Nature . doi : 10.1038/d41586-019-01510-1 . PMID 32385365. S2CID 189666088 .
- ↑ Lepori, Michael A; Firestone, Chaz (27-03-2020). "¿Puedes oírme ahora? Comparaciones sensibles de la percepción humana y de la máquina". arXiv : 2003.12362 [ eess.AS ].
- ↑ Vadillo, Jon; Santana, Roberto (23 de enero de 2020). "Sobre la evaluación humana de ejemplos adversarios de audio". arXiv : 2001.08444 [ eess.AS ].
- ↑ Skillicorn, DB (2009). "Descubrimiento de conocimiento adversario". IEEE Intelligent Systems . 24 : 54–61 . doi : 10.1109/MIS.2009.82 .
- 1 2 Biggio, B.; Fumera, G.; Roli, F. (2014). "Sistemas de reconocimiento de patrones bajo ataque: Problemas de diseño y desafíos de investigación" . Int'l J. Patt. Recogn. Artif. Intell . 28 (7): 1460002. doi : 10.1142/S0218001414600027 . Archivado del original el 20 de mayo de 2022.
- ↑ Demetrio, L.; Biggio, B.; Lagorio, G.; Roli, F.; Armando, A. (2021). "Optimización de caja negra que preserva la funcionalidad de malware adversario para Windows". IEEE Transactions on Information Forensics and Security . 16 : 3469–3478 . arXiv : 2003.13526 . Bibcode : 2021ITIF...16.3469D . doi : 10.1109/TIFS.2021.3082330 .
- ↑ Wang, J.; Chang, X.; Mišić, J.; Mišić, VB; Wang, Y.; Zhang, J. (2021). Mal-LSGAN: Un modelo eficaz de generación de ejemplos de malware adversario . IEEE GLOBECOM. doi : 10.1109/GLOBECOM46510.2021.9685442 .
- 1 2 3 4 5 6 Ceschin, Fabricio; Botacin, Marcus; Bifet, Albert; Pfahringer, Bernhard; Oliveira, Luis S.; Gómez, Heitor Murilo; Gregio, André (2023). "Aprendizaje automático (en) seguridad: una corriente de problemas". Amenazas digitales: investigación y práctica . 1 (1): 1– 32. arXiv : 2010.16045 . doi : 10.1145/3617897 .
- 1 2 3 Oak, Rajvardhan; Du, Min; Yan, David; Takawale, Harshvardhan; Amit, Idan (11 de noviembre de 2019). "Detección de malware en datos altamente desequilibrados mediante modelado de secuencias" . Actas del 12.º Taller ACM sobre Inteligencia Artificial y Seguridad . ACM. págs. 37–48 . doi : 10.1145/3338501.3357374 . ISBN 978-1-4503-6833-9.
- 1 2 3 4 5 6 7 8 9 Arp, Daniel; Preguntando, Erwin; Pendlebury, Feargus; Warnecke, Alejandro; Pierazzi, Fabio; Wressnegger, cristiano; Cavallaro, Lorenzo; Rieck, Konrad (30 de noviembre de 2021), Lo que se debe y no se debe hacer en el aprendizaje automático en seguridad informática , arXiv : 2010.09470
- ↑ Forrest, Matthew Kosinski, Amber (26 de marzo de 2024). "¿Qué es un ataque de inyección de mensajes? | IBM" . www.ibm.com . Consultado el 17 de julio de 2026 .
{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 3 "¿Qué es el envenenamiento por IA? Guía de jailbreak, inyección de prompts y envenenamiento de datos" . TraceX Labs . 17 de julio de 2026. Consultado el 17 de julio de 2026 .
- ↑ "Defensa de los sistemas de IA contra ataques de inyección rápida | Wiz" . wiz.io. 29/12/2025 . Consultado el 17/07/2026 .
- 1 2 Barreno, Marco; Nelson, Blaine; Joseph, Anthony D.; Tygar, JD (2010). "La seguridad del aprendizaje automático" (PDF) . Machine Learning . 81 (2): 121– 148. Bibcode : 2010MLear..81..121B . doi : 10.1007/s10994-010-5188-5 . S2CID 2304759 .
- ↑ Sikos, Leslie F. (2019). IA en ciberseguridad . Biblioteca de referencia de sistemas inteligentes. Vol. 151. Cham: Springer. p. 50. doi : 10.1007/978-3-319-98842-9 . ISBN 978-3-319-98841-2. S2CID 259216663 .
- 1 2 3 Biggio, B.; Fumera, G.; Roli, F. (2014). "Evaluación de seguridad de clasificadores de patrones bajo ataque" . IEEE Transactions on Knowledge and Data Engineering . 26 (4): 984– 996. arXiv : 1709.00609 . Bibcode : 2014ITKDE..26..984B . doi : 10.1109/TKDE.2013.57 . Archivado del original el 18 de mayo de 2018.
- 1 2 3 4 5 Biggio, Battista; Corona, Igino; Nelson, Blaine; Rubinstein, Benjamin IP; Maiorca, Davide; Fumera, Giorgio; Giacinto, Giorgio; Roli, Fabio (2014). "Evaluación de seguridad de máquinas de vectores de soporte en entornos adversarios". Aplicaciones de máquinas de vectores de soporte . Springer International Publishing. pp. 105–153 . arXiv : 1401.7727 . doi : 10.1007/978-3-319-02300-7_4 . ISBN 978-3-319-02300-7. S2CID 18666561 .
- ↑ Heinrich, Kai; Graf, Johannes; Chen, Ji; Laurisch, Jakob; Zschech, Patrick (15 de junio de 2020). "Si me engañas una vez, la culpa es tuya; si me engañas dos veces, la culpa es mía: una taxonomía de patrones de ataque y defensa para la seguridad de la IA" . Documentos de investigación de ECIS 2020 .
- ↑ "Facebook elimina 15 mil millones de cuentas falsas en dos años" . Tech Digest . 27 de septiembre de 2021. Consultado el 8 de junio de 2022 .
- ↑ "Facebook eliminó 3 mil millones de cuentas falsas en solo 6 meses" . New York Post . Associated Press. 23 de mayo de 2019. Consultado el 8 de junio de 2022 .
- ↑ Siva Kumar, Ram Shankar; Nyström, Magnus; Lambert, John; Marshall, Andrew; Goertzel, Mario; Comissoneru, Andi; Swann, Matt; Xia, Sharon (mayo de 2020). «Aprendizaje automático adversario: perspectivas de la industria». Talleres de seguridad y privacidad IEEE 2020 (SPW) . págs. 69–75 . doi : 10.1109/SPW50608.2020.00028 . ISBN 978-1-7281-9346-5. S2CID 229357721 .
- ↑ Schwarzschild, Avi; Goldblum, Micah; Gupta, Arjun; Dickerson, John P.; Goldstein, Tom (1 de julio de 2021). "¿Qué tan tóxico es el envenenamiento de datos? Un punto de referencia unificado para ataques de puerta trasera y envenenamiento de datos" . Conferencia Internacional sobre Aprendizaje Automático . PMLR: 9389–9398 .
- ↑ Shan, Shawn; Ding, Wenxin; Passananti, Josephine; Wu, Stanley; Zheng, Haitao; Zhao, Ben Y. (2023). "Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models". arXiv : 2310.13828 [ cs.CR ].
- ↑ Biggio, B.; Nelson, B.; Laskov, P. (2011). "Máquinas de vectores de soporte bajo ruido de etiquetas adversario" . Journal of Machine Learning Research – Proc. 3rd Asian Conf. Machine Learning . 20 : 97–112 . Archivado del original el 3 de agosto de 2020.
- ↑ Kloft, M.; Laskov, P. (2012). "Análisis de seguridad de la detección de anomalías del centroide en línea" (PDF) . Journal of Machine Learning Research . 13 : 3647–3690 .
- ↑ Rao, Rahul. "Los datos generados por IA pueden envenenar los futuros modelos de IA" . Scientific American . Consultado el 22 de junio de 2024 .
- ↑ Jonker, Tom Krantz, Alexandra (10 de diciembre de 2024). "¿Qué es el envenenamiento de datos? | IBM" . www.ibm.com . Consultado el 17 de julio de 2026 .
{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Baruch, Gilad; Baruch, Moran; Goldberg, Yoav (2019). "Un poco es suficiente: eludiendo las defensas para el aprendizaje distribuido" . Advances in Neural Information Processing Systems . 32. Curran Associates, Inc. arXiv : 1902.06156 .
- ^ El-Mhamdi, El-Mahdi; Guerraoui, Rachid; Guirguis, Arsany; Hoang, Lê-Nguyên; Rouault, Sébastien (26 de mayo de 2022). "Aprendizaje automático bizantino genuinamente distribuido" . Computación distribuida . 35 (4): 305– 331. arXiv : 1905.03853 . doi : 10.1007/s00446-022-00427-9 . ISSN 1432-0452 . S2CID 249111966 .
- ↑ Goldwasser, S.; Kim, Michael P.; Vaikuntanathan, V.; Zamir, Or (2022). "Planting Undetectable Backdoors in Machine Learning Models". arXiv : 2204.06974 [ cs.LG ].
- 1 2 Blanchard, Peva; El Mhamdi, El Mahdi; Guerraoui, Rachid; Stainer, Julien (2017). "Aprendizaje automático con adversarios: descenso de gradiente tolerante a bizantinos" . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc.
- ↑ Chen, Lingjiao; Wang, Hongyi; Charles, Zachary; Papailiopoulos, Dimitris (2018-07-03). "DRACO: Entrenamiento distribuido resistente a la complejidad bizantina mediante gradientes redundantes" . Conferencia internacional sobre aprendizaje automático . PMLR: 903–912 . arXiv : 1803.09877 .
- ↑ Mhamdi, El Mahdi El; Guerraoui, Rachid; Rouault, Sébastien (2018-07-03). "La vulnerabilidad oculta del aprendizaje distribuido en Bizancio" . Conferencia Internacional sobre Aprendizaje Automático . PMLR: 3521–3530 . arXiv : 1802.07927 .
- ↑ Allen-Zhu, Zeyuan; Ebrahimianghazani, Faeze; Li, Jerry; Alistahr, Dan (2020-09-28). "Descenso de gradiente estocástico no convexo resistente a bizantinos". arXiv : 2012.14368 [ cs.LG ].Revisar
- ↑ Mhamdi, El Mahdi El; Guerraoui, Rachid; Rouault, Sébastien (2020-09-28). Momento distribuido para descenso de gradiente estocástico resistente a bizantinos . 9.ª Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR), 4-8 de mayo de 2021 (conferencia virtual) . Recuperado el 20 de octubre de 2022 .Revisar
- ↑ Datos, Deepesh; Diggavi, Suhas (1 de julio de 2021). "SGD de alta dimensión resistente a errores bizantinos con iteraciones locales en datos heterogéneos" . Conferencia Internacional sobre Aprendizaje Automático . PMLR: 2478–2488 .
- ↑ Karimireddy, Sai Praneeth; He, Lie; Jaggi, Martin (2021-09-29). "Aprendizaje robusto bizantino en conjuntos de datos heterogéneos mediante agrupamiento". arXiv : 2006.09365 [ cs.LG ].Revisar
- ↑ Nelson, B.; Rubinstein, BI; Huang, L.; Joseph, AD; Lee, SJ; Rao, S.; Tygar, JD (2012). "Estrategias de consulta para evadir clasificadores inductores de convexidad" (PDF) . J. Mach. Learn. Res . 13 : 1293–1332 .
- ↑ "¿Cómo robar sistemas modernos de PLN con galimatías?" . cleverhans-blog . 2020-04-06 . Consultado el 2020-10-15 .
- 1 2 3 4 5 6 7 8 Wang, Xinran; Xiang, Yu; Gao, junio; Ding, Jie (13 de septiembre de 2020). "Lavado de Información para la Privacidad de Modelos". arXiv : 2009.06112 [ cs.CR ].
- 1 2 Dickson, Ben (23 de abril de 2021). "Aprendizaje automático: ¿Qué son los ataques de inferencia de pertenencia?" . TechTalks . Recuperado el 7 de noviembre de 2021 .
- 1 2 Goodfellow, Ian J. ; Shlens, Jonathon; Szegedy, Christian (2015). Explicando y aprovechando ejemplos adversarios . Conferencia internacional sobre representaciones de aprendizaje (ICLR). arXiv : 1412.6572 .
- ↑ Ribeiro, Antonio H.; Zachariah, Dave; Bach, Francis; Schön, Thomas B. (2023). Propiedades de regularización de la regresión lineal entrenada adversarialmente . Trigésimo séptima Conferencia sobre Sistemas de Procesamiento de Información Neuronal.
- ↑ Tsipras, Dimitris; Santurkar, Shibani; Engstrom, Logan; Turner, Alexander; Ma, Aleksander (2019). La robustez puede estar reñida con la precisión . Conferencia Internacional sobre Representaciones de Aprendizaje.
- ↑ Dan, C.; Wei, Y.; Ravikumar, P. (2020). Garantías estadísticas precisas para la clasificación gaussiana robusta frente a ataques adversarios . Conferencia Internacional sobre Aprendizaje Automático.
- ↑ Javanmard, A.; Soltanolkotabi, M.; Hassani, H. (2020). Compromisos precisos en el entrenamiento adversario para la regresión lineal . Conferencia sobre Teoría del Aprendizaje.
- ↑ Ribeiro, AH; Schön, TB (2023). "Regresión lineal sobreparametrizada bajo ataques adversarios". IEEE Transactions on Signal Processing . 71 : 601–614 . arXiv : 2204.06274 . Bibcode : 2023ITSP...71..601R . doi : 10.1109/TSP.2023.3246228 .
- ↑ Yin, D.; Kannan, R.; Bartlett, P. (2019). Complejidad de Rademacher para la generalización robusta adversarial . Conferencia Internacional sobre Aprendizaje Automático.
- ↑ Ribeiro, Antônio H.; Zachariah, Dave; Bach, Francis; Schön, Thomas B. (16 de octubre de 2023), Propiedades de regularización de la regresión lineal entrenada adversariamente , arXiv : 2310.10807
- ↑ Pieter, Huang; Papernot, Sandy; Goodfellow, Nicolas; Duan, Ian; Abbeel, Yan (2017-02-07). Ataques adversarios a políticas de redes neuronales . OCLC 1106256905 .
- ↑ Korkmaz, Ezgi (2022). "Las políticas de aprendizaje por refuerzo profundo aprenden características adversarias compartidas entre MDP". Trigésimo sexta Conferencia AAAI sobre Inteligencia Artificial (AAAI-22) . 36 (7): 7229– 7238. arXiv : 2112.09025 . doi : 10.1609/aaai.v36i7.20684 . S2CID 245219157 .
- ↑ Carlini, Nicholas; Wagner, David (2018). «Ejemplos adversarios de audio: ataques dirigidos a la conversión de voz a texto». Talleres de seguridad y privacidad IEEE de 2018 (SPW) . págs. 1–7 . arXiv : 1801.01944 . doi : 10.1109/SPW.2018.00009 . ISBN 978-1-5386-8276-0. S2CID 4475201 .
- ↑ Alzantot, Moustafa; Balaji, Bharathan; Srivastava, Mani (2017). "¿Oíste eso? Ejemplos adversarios contra el reconocimiento automático del habla". 31.ª Conferencia sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2017) . arXiv : 1801.00554 .
- ↑ Rajaratnam, Krishan; Kalita, Jugal (2018). "Inundación de ruido para la detección de ejemplos adversarios de audio contra el reconocimiento automático del habla". Simposio Internacional IEEE de Procesamiento de Señales y Tecnología de la Información (ISSPIT) de 2018. pp. 197–201 . arXiv : 1812.10061 . doi : 10.1109/ISSPIT.2018.8642623 .
- ↑ Jagielski, Matthew; Oprea, Alina; Biggio, Battista; Liu, Chang; Nita-Rotaru, Cristina; Li, Bo (mayo de 2018). "Manipulación del aprendizaje automático: ataques de envenenamiento y contramedidas para el aprendizaje de regresión". Simposio IEEE de 2018 sobre seguridad y privacidad (SP) . IEEE. págs. 19–35 . arXiv : 1804.00308 . doi : 10.1109/sp.2018.00057 . ISBN 978-1-5386-4353-2. S2CID 4551073 .
- ↑ "Ataque al aprendizaje automático con ejemplos adversarios" . OpenAI . 24 de febrero de 2017. Consultado el 15 de octubre de 2020 .
- ↑ Gu, Tianyu; Dolan-Gavitt, Brendan; Garg, Siddharth (2019-03-11). "BadNets: Identificación de vulnerabilidades en la cadena de suministro de modelos de aprendizaje automático". arXiv : 1708.06733 [ cs.CR ].
- ↑ Veale, Michael; Binns, Reuben; Edwards, Lilian (2018-11-28). "Algoritmos que recuerdan: ataques de inversión de modelos y ley de protección de datos" . Philosophical Transactions. Serie A, Ciencias Matemáticas, Físicas y de Ingeniería . 376 (2133). arXiv : 1807.04644 . Bibcode : 2018RSPTA.37680083V . doi : 10.1098/rsta.2018.0083 . ISSN 1364-503X . PMC 6191664. PMID 30322998 .
- ↑ Shokri, Reza; Stronati, Marco; Song, Congzheng; Shmatikov, Vitaly (2017-03-31). "Ataques de inferencia de membresía contra modelos de aprendizaje automático". arXiv : 1610.05820 [ cs.CR ].
- 1 2 Goodfellow, Ian J.; Shlens, Jonathon; Szegedy, Christian (2015-03-20). "Explicando y aprovechando ejemplos adversarios". arXiv : 1412.6572 [ stat.ML ].
- ↑ Madry, Aleksander; Makelov, Aleksandar; Schmidt, Ludwig; Tsipras, Dimitris; Vladu, Adrian (2019-09-04). "Hacia modelos de aprendizaje profundo resistentes a ataques adversarios". arXiv : 1706.06083 [ stat.ML ].
- ↑ Carlini, Nicholas; Wagner, David (22 de marzo de 2017). "Hacia la evaluación de la robustez de las redes neuronales". arXiv : 1608.04644 [ cs.CR ].
- ↑ Brown, Tom B.; Mané, Dandelion; Roy, Aurko; Abadi, Martín; Gilmer, Justin (2018-05-16). "Adversarial Patch". arXiv : 1712.09665 [ cs.CV ].
- ↑ Guo, Sensen; Zhao, Jinxiong; Li, Xiaoyu; Duan, Junhong; Mu, Dejun; Jing, Xiao (24 de abril de 2021). "Un método de ataque de caja negra contra modelos de detección de flujo de red anómalos basados en aprendizaje automático" . Security and Communication Networks . 2021. e5578335. doi : 10.1155/2021/5578335 . ISSN 1939-0114 .
- 1 2 Gomes, Joao (2018-01-17). "Ataques y defensas adversarias para redes neuronales convolucionales" . Onfido Tech . Recuperado el 23 de octubre de 2021 .
- ↑ Guo, Chuan; Gardner, Jacob; You, Yurong; Wilson, Andrew Gordon; Weinberger, Kilian (2019-05-24). "Ataques adversarios simples de caja negra" . Actas de la 36.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 2484–2493 . arXiv : 1905.07121 .
- ↑ Weinberger, Kilian (2020). "ML-Retrospectivas". Sobre la importancia de la deconstrucción en la investigación del aprendizaje automático . NeurIPS 2020.
- 1 2 3 4 5 Andriushchenko, Maksym; Croce, Francesco; Flammarion, Nicolas; Hein, Matthias (2020). "Ataque cuadrado: un ataque adversario de caja negra eficiente en consultas mediante búsqueda aleatoria" . En Vedaldi, Andrea; Bischof, Horst; Brox, Thomas; Frahm, Jan-Michael (eds.). Visión por computadora – ECCV 2020. Notas de clase en ciencias de la computación. Vol. 12368. Cham: Springer International Publishing. pp. 484–501 . arXiv : 1912.00049 . doi : 10.1007/978-3-030-58592-1_29 . ISBN 978-3-030-58592-1. S2CID 208527215 .
- 1 2 3 4 5 6 7 Chen, Jianbo; Jordan, Michael I.; Wainwright, Martin J. (2019). "HopSkipJumpAttack: un ataque basado en decisiones eficiente en consultas". arXiv : 1904.02144 [ cs.LG ].Presentación de YouTube
- ↑ Andriushchenko, Maksym; Croce, Francesco; Flammarion, Nicolas; Hein, Matthias (2020-07-29). "Square Attack: un ataque adversario de caja negra eficiente en consultas mediante búsqueda aleatoria". arXiv : 1912.00049 [ cs.LG ].
- ↑ "Ataques basados en decisiones de caja negra sobre imágenes" . KejiTech . 21 de junio de 2020. Consultado el 25 de octubre de 2021 .
- 1 2 Goodfellow, Ian J.; Shlens, Jonathon; Szegedy, Christian (2015-03-20). "Explicando y aprovechando ejemplos adversarios". arXiv : 1412.6572 [ stat.ML ].
- 1 2 "Ejemplo adversario usando FGSM | TensorFlow Core" . TensorFlow . Recuperado el 24 de octubre de 2021 .
- ↑ Tsui, Ken (22 de agosto de 2018). "Quizás la introducción más sencilla a los ejemplos adversariales jamás presentada" . Medium . Consultado el 24 de octubre de 2021 .
- ↑ Corona-Figueroa, Abril; Bond-Taylor, Sam; Bhowmik, Neelanjan; Gaus, Yona Falinie A.; Breckon, Toby P.; Shum, Hubert PH; Willcocks, Chris G. (2023). Traducción 2D a 3D no alineada con difusión de código vectorial-cuantizado condicional usando transformadores . IEEE/CVF. arXiv : 2308.14152 .
- 1 2 Carlini, Nicholas; Wagner, David (2017-03-22). "Hacia la evaluación de la robustez de las redes neuronales". arXiv : 1608.04644 [ cs.CR ].
- ↑ "ataque a Carlini Wagner" . richardjordan.com . Consultado el 23 de octubre de 2021 .
- ↑ Plotz, Mike (26 de noviembre de 2018). "Resumen del artículo: Los ejemplos adversarios no se detectan fácilmente: Eludiendo diez métodos de detección" . Medium . Consultado el 23 de octubre de 2021 .
- ↑ Kishor Datta Gupta; Akhtar, Zahid; Dasgupta, Dipankar (2021). "Determinación de la secuencia de técnicas de procesamiento de imágenes (IPT) para detectar ataques adversarios". SN Computer Science . 2 (5): 383. arXiv : 2007.00337 . doi : 10.1007/s42979-021-00773-8 . ISSN 2662-995X . S2CID 220281087 .
- ↑ Dekel, O.; Shamir, O.; Xiao, L. (2010). "Aprendizaje para clasificar con características faltantes y corruptas" (PDF) . Machine Learning . 81 (2): 149– 178. doi : 10.1007/s10994-009-5124-8 .
- ↑ Liu, Wei; Chawla, Sanjay (2010). "Extracción de patrones adversarios mediante minimización de pérdida regularizada" (PDF) . Machine Learning . 81 : 69–83 . doi : 10.1007/s10994-010-5199-2 . S2CID 17497168 .
- ↑ Biggio, B.; Fumera, G.; Roli, F. (2009). "Evadir sistemas de clasificación múltiple difíciles" . En Okun, O.; Valentini, G. (eds.). Métodos de conjunto supervisados y no supervisados y sus aplicaciones . Estudios en inteligencia computacional. Vol. 245. Berlín/Heidelberg: Springer. pp. 15–38 . Archivado del original el 15 de enero de 2015.
- ↑ Rubinstein, BIP; Bartlett, PL; Huang, L.; Taft, N. (2012). "Aprendizaje en un gran espacio de funciones: mecanismos de preservación de la privacidad para el aprendizaje de SVM". Journal of Privacy and Confidentiality . 4 (1): 65– 100. arXiv : 0911.5708 . doi : 10.29012/jpc.v4i1.612 .
- ↑ Blum, Avrim; Hardt, Moritz (2015-02-16). "The Ladder: A Reliable Leaderboard for Machine Learning Competitions". arXiv : 1502.04585 [ cs.LG ].
- ↑ Kantarcioglu, M.; Xi, B.; Clifton, C. (enero de 2011). "Evaluación de clasificadores y selección de atributos frente a adversarios activos" (PDF) . Data Min. Knowl. Discov . 22 ( 1–2 ): 291–335 . doi : 10.1007/s10618-010-0197-3 .
- ↑ Chivukula, Aneesh; Yang, Xinghao; Liu, Wei; Zhu, Tianqing; Zhou, Wanlei (2020). "Aprendizaje profundo adversario basado en la teoría de juegos con adversarios variacionales". IEEE Transactions on Knowledge and Data Engineering . 33 (11): 3568– 3581. doi : 10.1109/TKDE.2020.2972320 . hdl : 10453/145751 . ISSN 1558-2191 . S2CID 213845560 .
- ^ Chivukula, Aneesh Sreevallabh; Liu, Wei (2019). "Modelos adversarios de aprendizaje profundo con múltiples adversarios". Transacciones IEEE sobre conocimiento e ingeniería de datos . 31 (6): 1066– 1079. Código bibliográfico : 2019ITKDE..31.1066C . doi : 10.1109/TKDE.2018.2851247 . hdl : 10453/136227 . ISSN 1558-2191 . S2CID 67024195 .
- ↑ "TrojAI" . www.iarpa.gov . Consultado el 14 de octubre de 2020 .
- ↑ Athalye, Anish; Carlini, Nicholas; Wagner, David (2018-02-01). "Los gradientes ofuscados dan una falsa sensación de seguridad: eludiendo las defensas ante un ejemplo adversario". arXiv : 1802.00420v1 [ cs.LG ].
- ↑ He, Warren; Wei, James; Chen, Xinyun; Carlini, Nicholas; Song, Dawn (2017-06-15). "Defensas de ejemplos adversarios: los conjuntos de defensas débiles no son fuertes". arXiv : 1706.04701 [ cs.LG ].
- ↑ Yerlikaya, Fahri Anıl; Bahtiyar, Şerif (14 de julio de 2022). "Ataques de envenenamiento de datos contra algoritmos de aprendizaje automático" . Expert Systems with Applications . 208 118101. doi : 10.1016/j.eswa.2022.118101 – vía Elsevier Science Direct.
- ↑ Chhabra, Anshuman; Mohapatra, Prasant (15 de noviembre de 2021). «Defensa de objetivo móvil contra el aprendizaje automático adversario» . Actas del 8.º Taller ACM sobre Defensa de Objetivo Móvil . MTD '21. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 29-30 . doi : 10.1145/3474370.3485662 . ISBN 978-1-4503-8658-6.
Enlaces externos
- ATLAS DE MITRE: Panorama de amenazas adversarias para sistemas de inteligencia artificial
- Borrador NIST 8269: Taxonomía y terminología del aprendizaje automático adversario.
- Laskov, Pavel; Lippmann, Richard (2010). "Aprendizaje automático en entornos adversarios". Machine Learning . 81 (2): 115– 119. doi : 10.1007/s10994-010-5207-6 . S2CID 12567278 .
- Serie de talleres sobre inteligencia artificial y seguridad (AISec).
- Aprendizaje automático
- Seguridad informática
- seguridad de la IA
