Articulo de referencia

seguridad de la IA

La seguridad de la IA es un campo interdisciplinario centrado en la prevención de accidentes, el mal uso u otras consecuencias perjudiciales derivadas de los sistemas de intelig...

La seguridad de la IA es un campo interdisciplinario centrado en la prevención de accidentes, el mal uso u otras consecuencias perjudiciales derivadas de los sistemas de inteligencia artificial . Abarca la alineación de la IA (cuyo objetivo es garantizar que los sistemas de IA se comporten según lo previsto), la monitorización de los sistemas de IA para detectar riesgos y la mejora de su robustez. Este campo se preocupa especialmente por los riesgos existenciales que plantean los modelos avanzados de IA. [ 1 ] [ 2 ]

Más allá de la investigación técnica, la seguridad de la IA implica el desarrollo de normas y políticas que promuevan la seguridad, incluyendo la promoción de regulaciones en diferentes niveles de gobierno. [ 3 ] [ 4 ] [ 5 ] El campo ganó una popularidad significativa en 2023, con el rápido progreso en la IA generativa y las preocupaciones públicas expresadas por investigadores y directores ejecutivos sobre los peligros potenciales. Durante la Cumbre de Seguridad de la IA de 2023 , tanto Estados Unidos como el Reino Unido establecieron sus propios Institutos de Seguridad de la IA . Sin embargo, los investigadores han expresado su preocupación de que las medidas de seguridad de la IA no estén al ritmo del rápido desarrollo de las capacidades de la IA. [ 6 ]

Motivaciones

Los académicos discuten los riesgos actuales de fallas de sistemas críticos , [ 7 ] sesgos , [ 8 ] y vigilancia habilitada por IA, [ 9 ] así como riesgos emergentes como el desempleo tecnológico , manipulación digital, [ 10 ] armamentización, [ 11 ] ciberataques habilitados por IA [ 12 ] y bioterrorismo . [ 13 ] También discuten riesgos especulativos de perder el control de futuros agentes de inteligencia artificial general (IAG), [ 14 ] o de que la IA permita dictaduras perpetuamente estables. [ 15 ]

Seguridad existencial

Algunos han criticado las preocupaciones sobre la IA general, como Andrew Ng, quien las comparó en 2015 con "preocuparse por la superpoblación en Marte cuando ni siquiera hemos puesto un pie en el planeta". [ 16 ] Por otro lado , Stuart J. Russell insta a la cautela, argumentando que "es mejor anticipar el ingenio humano que subestimarlo". [ 17 ]

Los investigadores de IA tienen opiniones muy diversas sobre la gravedad y las principales fuentes de riesgo que plantea la tecnología de IA [ 18 ] [ 19 ] [ 20 ] , aunque las encuestas sugieren que los expertos toman en serio los riesgos de consecuencias graves. En dos encuestas a investigadores de IA, el encuestado medio se mostró optimista sobre la IA en general, pero asignó una probabilidad del 5 % a un resultado "extremadamente malo (por ejemplo, la extinción humana )" de la IA avanzada. [ 18 ] En una encuesta de 2022 a la comunidad de procesamiento del lenguaje natural , el 37 % estuvo de acuerdo o de acuerdo en que es plausible que las decisiones de la IA puedan conducir a una catástrofe "al menos tan mala como una guerra nuclear total". [ 21 ]

Historia

Los riesgos de la IA comenzaron a debatirse seriamente al inicio de la era informática :

Además, si avanzamos en la dirección de crear máquinas que aprendan y cuyo comportamiento se modifique mediante la experiencia, debemos afrontar el hecho de que cada grado de independencia que le concedamos a la máquina supone un grado de posible resistencia a nuestros deseos.

En 1988, Blay Whitby publicó un libro en el que exponía la necesidad de que la IA se desarrollara siguiendo principios éticos y socialmente responsables. [ 23 ]

Entre 2008 y 2009, la Asociación para el Avance de la Inteligencia Artificial ( AAAI ) encargó un estudio para explorar y abordar las posibles influencias sociales a largo plazo de la investigación y el desarrollo de la IA. El panel se mostró generalmente escéptico ante las opiniones radicales expresadas por autores de ciencia ficción, pero coincidió en que «sería valiosa una investigación adicional sobre métodos para comprender y verificar la gama de comportamientos de sistemas computacionales complejos con el fin de minimizar resultados inesperados». [ 24 ]

En 2011, Roman Yampolskiy introdujo el término "ingeniería de seguridad de la IA" [ 25 ] en la conferencia de Filosofía y Teoría de la Inteligencia Artificial, [ 26 ] enumerando fallos previos de sistemas de IA y argumentando que "la frecuencia y gravedad de tales eventos aumentarán progresivamente a medida que las IA se vuelvan más capaces". [ 27 ]

En 2014, el filósofo Nick Bostrom publicó el libro Superinteligencia: Caminos, Peligros, Estrategias . En su opinión, el auge de la IA general tiene el potencial de generar diversos problemas sociales, desde el desplazamiento de la fuerza laboral por la IA y la manipulación de las estructuras políticas y militares, hasta la posibilidad de la extinción humana. [ 28 ] Su argumento de que los futuros sistemas avanzados podrían representar una amenaza para la existencia humana impulsó a Elon Musk , [ 29 ] Bill Gates , [ 30 ] y Stephen Hawking [ 31 ] a expresar preocupaciones similares.

En 2015, decenas de expertos en inteligencia artificial firmaron una carta abierta sobre inteligencia artificial en la que pedían investigación sobre los impactos sociales de la IA y esbozaban direcciones concretas. [ 32 ] Hasta la fecha, la carta ha sido firmada por más de 8000 personas, entre ellas Yann LeCun , Shane Legg , Yoshua Bengio y Stuart Russell .

En ese mismo año, un grupo de académicos liderado por el profesor Stuart J. Russell fundó el Centro para la IA compatible con los humanos en la Universidad de California Berkeley y el Instituto del Futuro de la Vida otorgó 6,5 millones de dólares en subvenciones para investigaciones destinadas a "garantizar que la inteligencia artificial (IA) siga siendo segura, ética y beneficiosa". [ 33 ]

En 2016, la Oficina de Política Científica y Tecnológica de la Casa Blanca y la Universidad Carnegie Mellon anunciaron el Taller Público sobre Seguridad y Control de la Inteligencia Artificial, [ 34 ] que fue uno de una serie de cuatro talleres de la Casa Blanca destinados a investigar "las ventajas y desventajas" de la IA. [ 35 ] Ese mismo año, se publicó Problemas Concretos en la Seguridad de la IA, una de las primeras y más influyentes agendas técnicas sobre seguridad de la IA. [ 36 ]

En 2017, el Future of Life Institute patrocinó la Conferencia Asilomar sobre IA beneficiosa , donde más de 100 líderes de opinión formularon principios para la IA beneficiosa, entre ellos: "Evitar la competencia: los equipos que desarrollan sistemas de IA deben cooperar activamente para evitar comprometer los estándares de seguridad". [ 37 ]

En 2018, el equipo de DeepMind Safety describió los problemas de seguridad de la IA en cuanto a especificación, robustez [ 38 ] y garantía [ 39 ] . Al año siguiente, los investigadores organizaron un taller en ICLR que se centró en estas áreas problemáticas [ 40 ] .

En 2021, se publicó Unsolved Problems in ML Safety, que describe las líneas de investigación en robustez, monitoreo, alineación y seguridad sistémica. [ 2 ]

En 2023, Rishi Sunak declaró que deseaba que el Reino Unido fuera el "centro geográfico de la regulación global de la seguridad de la IA" y que albergara la primera cumbre mundial sobre seguridad de la IA. [ 41 ] La cumbre sobre seguridad de la IA tuvo lugar en noviembre de 2023 y se centró en los riesgos de mal uso y pérdida de control asociados con los modelos de IA de vanguardia. [ 42 ] Durante la cumbre se anunció la intención de crear el Informe Científico Internacional sobre la Seguridad de la IA Avanzada . [ 43 ]

En 2024, Estados Unidos y el Reino Unido forjaron una nueva alianza en el ámbito de la seguridad de la IA. El memorando de entendimiento fue firmado el 1 de abril de 2024 por la secretaria de Comercio de Estados Unidos, Gina Raimondo , y la secretaria de Tecnología del Reino Unido, Michelle Donelan, para desarrollar conjuntamente pruebas avanzadas de modelos de IA, tras los compromisos anunciados en una Cumbre de Seguridad de la IA celebrada en Bletchley Park en noviembre. [ 44 ]

En 2025, un equipo internacional de 96 expertos, presidido por Yoshua Bengio, publicó el primer Informe Internacional sobre la Seguridad de la IA. El informe, encargado por 30 naciones y las Naciones Unidas, representa la primera revisión científica global de los riesgos potenciales asociados con la inteligencia artificial avanzada. Detalla las amenazas potenciales derivadas del mal uso, el mal funcionamiento y la disrupción social, con el objetivo de fundamentar las políticas mediante hallazgos basados ​​en evidencia, sin proporcionar recomendaciones específicas. [ 45 ] [ 46 ]

Enfoque de la investigación

Las áreas de investigación sobre seguridad de la IA incluyen robustez, monitoreo y alineación. [ 2 ] [ 39 ]

Robustez

robustez frente a adversarios

Los sistemas de IA suelen ser vulnerables a ejemplos adversarios o "entradas a modelos de aprendizaje automático (ML) que un atacante ha diseñado intencionalmente para provocar un error en el modelo". [ 47 ] Por ejemplo, en 2013, Szegedy et al. descubrieron que añadir perturbaciones imperceptibles específicas a una imagen podía provocar una clasificación errónea con alta confianza. [ 48 ] Esto sigue siendo un problema con las redes neuronales, aunque en trabajos recientes las perturbaciones suelen ser lo suficientemente grandes como para ser perceptibles. [ 49 ] [ 50 ] [ 51 ]

Se puede añadir ruido cuidadosamente diseñado a una imagen para provocar que se clasifique erróneamente con un alto grado de confianza.

Se predice que la imagen de la derecha es un avestruz después de aplicar la perturbación. (Izquierda) muestra predicha correctamente, (centro) perturbación aplicada amplificada 10x, (derecha) ejemplo adversario. [ 48 ]

La robustez frente a adversarios suele asociarse con la seguridad. [ 52 ] Los investigadores demostraron que una señal de audio podía modificarse imperceptiblemente para que los sistemas de conversión de voz a texto la transcribieran a cualquier mensaje que el atacante eligiera. [ 53 ] Los sistemas de detección de intrusiones en la red [ 54 ] y de malware [ 55 ] también deben ser robustos frente a adversarios, ya que los atacantes pueden diseñar sus ataques para engañar a los detectores.

Los modelos que representan objetivos (modelos de recompensa) también deben ser robustos frente a ataques adversarios. Por ejemplo, un modelo de recompensa podría estimar la utilidad de una respuesta de texto y un modelo de lenguaje podría entrenarse para maximizar esta puntuación. [ 56 ] Los investigadores han demostrado que si un modelo de lenguaje se entrena durante el tiempo suficiente, aprovechará las vulnerabilidades del modelo de recompensa para obtener una mejor puntuación y un peor rendimiento en la tarea prevista. [ 57 ] Este problema puede abordarse mejorando la robustez frente a ataques adversarios del modelo de recompensa. [ 58 ] En términos más generales, cualquier sistema de IA utilizado para evaluar otro sistema de IA debe ser robusto frente a ataques adversarios. Esto podría incluir herramientas de monitorización, ya que también podrían ser manipuladas para producir una recompensa mayor. [ 59 ]

Los modelos de lenguaje grandes (LLM) pueden ser vulnerables a la inyección de indicaciones [ 60 ] y al robo de modelos [ 61 ] , y pueden usarse para generar desinformación [ 62 ] . La inyección de indicaciones implica incrustar instrucciones en las indicaciones para eludir las medidas de seguridad [ 60 ] .

Tolerancia a fallos y redundancia

Investigadores en IA de seguridad crítica han propuesto utilizar redundancia arquitectónica y diversidad de diseño para reducir el riesgo de que un único modelo defectuoso, comprometido o engañoso cause daño. [ 63 ] [ 64 ] En tales enfoques, múltiples modelos desarrollados o entrenados de forma independiente procesan la misma tarea, y un mecanismo de votación o consenso combina sus resultados en lugar de depender de un solo modelo. [ 65 ]

Escucha

Estimación de la incertidumbre

A menudo es importante que los operadores humanos evalúen cuánto deben confiar en un sistema de IA, especialmente en entornos de alto riesgo como el diagnóstico médico. [ 66 ] Los modelos de ML generalmente expresan confianza mediante la salida de probabilidades; sin embargo, a menudo son demasiado confiados, [ 67 ] especialmente en situaciones que difieren de aquellas para las que fueron entrenados. [ 68 ] La investigación de calibración tiene como objetivo que las probabilidades del modelo se correspondan lo más fielmente posible con la verdadera proporción de aciertos del modelo.

De manera similar, la detección de anomalías o detección fuera de distribución (OOD) tiene como objetivo identificar cuándo un sistema de IA se encuentra en una situación inusual. Por ejemplo, si un sensor en un vehículo autónomo funciona mal o encuentra un terreno difícil, debería alertar al conductor para que tome el control o se detenga. [ 69 ] La detección de anomalías se ha implementado simplemente entrenando un clasificador para distinguir entradas anómalas de no anómalas, [ 70 ] aunque se utilizan diversas técnicas adicionales. [ 71 ] [ 72 ]

Detección de uso malicioso

Académicos [ 11 ] y agencias gubernamentales han expresado su preocupación de que los sistemas de IA puedan usarse para ayudar a actores maliciosos a construir armas, [ 73 ] manipular la opinión pública, [ 74 ] [ 75 ] o automatizar ciberataques. [ 76 ] Estas preocupaciones son una inquietud práctica para empresas como OpenAI, que alojan potentes herramientas de IA en línea. [ 77 ] Para prevenir el mal uso, OpenAI ha creado sistemas de detección que marcan o restringen a los usuarios en función de su actividad. [ 78 ]

Transparencia

Las redes neuronales se han descrito a menudo como cajas negras , [ 79 ] lo que significa que es difícil comprender por qué toman las decisiones que toman como resultado de la enorme cantidad de cálculos que realizan. [ 80 ] Esto dificulta la anticipación de fallos. En 2018, un coche autónomo mató a un peatón tras no identificarlo. Debido a la naturaleza de caja negra del software de IA, la razón del fallo sigue sin estar clara. [ 81 ] También suscita debates en el ámbito sanitario sobre si deberían utilizarse modelos estadísticamente eficientes pero opacos. [ 82 ]

Una ventaja fundamental de la transparencia es la explicabilidad . [ 83 ] En ocasiones, es un requisito legal proporcionar una explicación de por qué se tomó una decisión para garantizar la equidad, por ejemplo, para el filtrado automático de solicitudes de empleo o la asignación de puntajes crediticios . [ 83 ]

Otro beneficio es revelar la causa de los fallos. [ 79 ] Al comienzo de la pandemia de COVID-19 de 2020, los investigadores utilizaron herramientas de transparencia para demostrar que los clasificadores de imágenes médicas estaban "prestando atención" a etiquetas de hospitales irrelevantes. [ 84 ]

Las técnicas de transparencia también pueden utilizarse para corregir errores. Por ejemplo, en el artículo «Localización y edición de asociaciones fácticas en GPT», los autores lograron identificar parámetros del modelo que influían en su respuesta a preguntas sobre la ubicación de la Torre Eiffel. Posteriormente, pudieron «editar» este conocimiento para que el modelo respondiera a las preguntas como si creyera que la torre se encuentra en Roma en lugar de Francia. [ 85 ] Si bien en este caso los autores indujeron un error, estos métodos podrían utilizarse para corregirlos eficazmente. También existen técnicas de edición de modelos en visión artificial. [ 86 ]

Finalmente, algunos han argumentado que la opacidad de los sistemas de IA es una fuente significativa de riesgo y que una mejor comprensión de cómo funcionan podría prevenir fallas de alto impacto en el futuro. [ 87 ] La investigación de interpretabilidad "interna" tiene como objetivo hacer que los modelos de ML sean menos opacos. Un objetivo de esta investigación es identificar qué representan las activaciones neuronales internas. [ 88 ] [ 89 ] Por ejemplo, los investigadores identificaron una neurona en el sistema de inteligencia artificial CLIP que responde a imágenes de personas con disfraces de Spider-Man , bocetos de Spider-Man y la palabra "araña". [ 90 ] También implica explicar las conexiones entre estas neuronas o " circuitos ". [ 91 ] [ 92 ] Por ejemplo, los investigadores han identificado mecanismos de coincidencia de patrones en la atención del transformador que pueden desempeñar un papel en cómo los modelos de lenguaje aprenden de su contexto. [ 93 ] La "interpretabilidad interna" se ha comparado con la neurociencia. En ambos casos, el objetivo es comprender lo que sucede en un sistema complejo, aunque los investigadores de ML tienen la ventaja de poder tomar mediciones perfectas y realizar ablaciones arbitrarias. [ 94 ]

Detección de troyanos

Los modelos de aprendizaje automático pueden contener potencialmente "troyanos" o " puertas traseras ": vulnerabilidades que actores maliciosos insertan de forma maliciosa en un sistema de IA. Por ejemplo, un sistema de reconocimiento facial infectado con un troyano podría otorgar acceso cuando se detecta una pieza de joyería específica; [ 2 ] o un vehículo autónomo infectado con un troyano podría funcionar normalmente hasta que se detecte un desencadenante específico. [ 95 ] Esto podría no ser difícil de hacer con algunos modelos grandes como CLIP o GPT-3, ya que se entrenan con datos de internet disponibles públicamente. [ 96 ] Los investigadores lograron insertar un troyano en un clasificador de imágenes modificando solo 300 de los 3 millones de imágenes de entrenamiento. [ 97 ] Además de representar un riesgo para la seguridad, los investigadores han argumentado que los troyanos proporcionan un entorno concreto para probar y desarrollar mejores herramientas de monitoreo. [ 59 ]

Un artículo de investigación de Anthropic de 2024 demostró que los modelos de lenguaje complejos podían entrenarse con puertas traseras persistentes. Estos modelos de "agentes durmientes" podían programarse para generar resultados maliciosos (como código vulnerable) después de una fecha específica, mientras que su comportamiento era normal hasta entonces. Las medidas de seguridad estándar de la IA, como el ajuste fino supervisado , el aprendizaje por refuerzo y el entrenamiento adversario , no lograron eliminar estas puertas traseras. [ 98 ] [ 99 ]

Alineación

En el campo de la inteligencia artificial (IA), la alineación busca orientar los sistemas de IA hacia los objetivos, preferencias o principios éticos previstos por una persona o grupo. Un sistema de IA se considera alineado si promueve los objetivos previstos. Un sistema de IA desalineado persigue objetivos no previstos. [ 100 ]

A menudo, a los diseñadores de IA les resulta difícil especificar toda la gama de comportamientos deseados y no deseados. Por lo tanto, suelen utilizar objetivos indirectos más simples , como obtener la aprobación humana . Sin embargo, estos objetivos indirectos pueden pasar por alto restricciones necesarias o recompensar al sistema de IA simplemente por aparentar estar alineado. [ 100 ] [ 101 ] Los sistemas de IA también pueden encontrar resquicios que les permiten lograr sus objetivos indirectos de manera eficiente, pero de formas no intencionadas y, a veces, perjudiciales ( manipulación de recompensas ). [ 100 ] [ 102 ]

Los sistemas avanzados de IA pueden desarrollar estrategias instrumentales no deseadas , como la búsqueda de poder o la autopreservación, porque dichas estrategias les ayudan a alcanzar sus objetivos finales asignados. [ 100 ] [ 103 ] [ 104 ] Además, podrían desarrollar comportamientos emergentes indeseables que podrían ser difíciles de detectar antes de que el sistema se implemente y se encuentre con nuevas situaciones y distribuciones de datos . [ 105 ] [ 106 ] Una investigación empírica de 2024 encontró que los modelos de lenguaje grandes avanzados (LLM), como OpenAI o1 o Claude 3, a veces recurren al engaño estratégico para lograr sus objetivos o evitar que se modifiquen. [ 107 ] [ 108 ]

Algunos de estos problemas afectan a sistemas comerciales existentes como LLM, [ 109 ] [ 110 ] [ 111 ] robots , [ 112 ] vehículos autónomos , [ 113 ] y motores de recomendación de redes sociales . [ 109 ] [ 104 ] [ 114 ] Algunos investigadores de IA argumentan que los sistemas futuros más capaces se verán más gravemente afectados porque estos problemas resultan parcialmente de las altas capacidades. [ 115 ] [ 102 ] [ 101 ]

Muchos investigadores y líderes de empresas de IA de renombre han argumentado o afirmado que la IA se está acercando a capacidades cognitivas similares a las humanas ( AGI ) y sobrehumanas ( ASI ), y que podría poner en peligro la civilización humana si no se alinea correctamente. [ 116 ] [ 104 ] Entre ellos se encuentran los "padrinos de la IA" Geoffrey Hinton y Yoshua Bengio , y los directores ejecutivos de OpenAI , Anthropic y Google DeepMind . [ 117 ] [ 118 ] [ 119 ] Estos riesgos siguen siendo objeto de debate. [ 120 ]

La alineación de la IA es un subcampo de la seguridad de la IA, el estudio de cómo construir sistemas de IA seguros. [ 121 ] [ 122 ] Otros subcampos de la seguridad de la IA incluyen robustez, monitoreo y control de capacidades . [ 123 ] Los desafíos de la investigación en alineación incluyen inculcar valores complejos en la IA, desarrollar una IA honesta, supervisión escalable, auditar e interpretar modelos de IA y prevenir comportamientos emergentes de la IA como la búsqueda de poder. [ 123 ] La investigación sobre alineación tiene conexiones con la investigación sobre interpretabilidad , [ 124 ] [ 125 ] robustez ( adversaria ), [ 126 ] detección de anomalías , incertidumbre calibrada , [ 124 ] verificación formal , [ 127 ] aprendizaje de preferencias , [ 128 ] [ 129 ] [ 130 ] ingeniería de seguridad crítica , [ 131 ] teoría de juegos , [ 132 ] equidad algorítmica , [ 126 ] [ 133 ] y ciencias sociales . [ 134 ] [ 135 ]

Factores de seguridad sistémica y sociotécnicos

Es común que los riesgos de la IA (y los riesgos tecnológicos en general) se clasifiquen como mal uso o accidentes . [ 136 ] Algunos académicos han sugerido que este marco es insuficiente. [ 136 ] Por ejemplo, la Crisis de los Misiles de Cuba no fue claramente un accidente ni un mal uso de la tecnología. [ 136 ] Los analistas de políticas Zwetsloot y Dafoe escribieron: «Las perspectivas de mal uso y accidente tienden a centrarse solo en el último paso de una cadena causal que conduce a un daño: es decir, la persona que hizo mal uso de la tecnología o el sistema que se comportó de maneras no previstas... Sin embargo, a menudo, la cadena causal relevante es mucho más larga». Los riesgos suelen surgir de factores «estructurales» o «sistémicos», como presiones competitivas, difusión de daños, desarrollo acelerado, altos niveles de incertidumbre y una cultura de seguridad inadecuada. [ 136 ] En el contexto más amplio de la ingeniería de seguridad , los factores estructurales como la «cultura de seguridad organizacional» desempeñan un papel central en el popular marco de análisis de riesgos STAMP. [ 137 ]

Inspirados por la perspectiva estructural, algunos investigadores han enfatizado la importancia de utilizar el aprendizaje automático para mejorar los factores de seguridad sociotécnica, por ejemplo, su uso en la ciberdefensa, la mejora de la toma de decisiones institucionales y la facilitación de la cooperación. [ 2 ] Otros han enfatizado la importancia de involucrar tanto a profesionales de IA como a expertos en el dominio en el proceso de diseño para abordar las vulnerabilidades estructurales. [ 138 ]

Ciberdefensa

Algunos académicos temen que la IA exacerbe el desequilibrio ya existente entre ciberatacantes y ciberdefensores. [ 139 ] Esto aumentaría los incentivos para el "primer ataque" y podría conducir a ataques más agresivos y desestabilizadores. Para mitigar este riesgo, algunos han abogado por un mayor énfasis en la ciberdefensa. Además, la seguridad del software es esencial para evitar el robo y el mal uso de potentes modelos de IA. [ 11 ] Estudios recientes han demostrado que la IA puede mejorar significativamente las tareas de ciberseguridad, tanto técnicas como de gestión, al automatizar tareas rutinarias y mejorar la eficiencia general. [ 140 ] La investigación sobre seguridad de la IA también ha examinado técnicas defensivas para proteger los sistemas de aprendizaje automático de ataques de envenenamiento de datos durante el entrenamiento. En particular, los ataques de inversión de etiquetas pueden degradar el rendimiento del modelo y, al mismo tiempo, ser difíciles de detectar mediante métodos convencionales de validación de datos. Para abordar este riesgo, trabajos recientes han propuesto pipelines de detección independientes del modelo que supervisan el comportamiento de aprendizaje y combinan múltiples detectores para identificar muestras de entrenamiento sospechosas. Estos enfoques buscan fortalecer la ciberdefensa mejorando la resiliencia y la confiabilidad de los sistemas de IA que operan en entornos adversarios. [ 141 ] [ 142 ]

Mejorar la toma de decisiones institucionales

El avance de la IA en los ámbitos económico y militar podría precipitar desafíos políticos sin precedentes. [ 143 ] Algunos académicos han comparado la dinámica de la carrera de la IA con la Guerra Fría, donde el juicio cuidadoso de un pequeño número de responsables de la toma de decisiones a menudo marcaba la diferencia entre la estabilidad y la catástrofe. [ 144 ] Los investigadores de IA han argumentado que las tecnologías de IA también podrían usarse para ayudar en la toma de decisiones. [ 2 ] Por ejemplo, los investigadores están comenzando a desarrollar sistemas de pronóstico [ 145 ] y asesoramiento basados ​​en IA. [ 146 ]

Facilitar la cooperación

Muchas de las mayores amenazas globales ( guerra nuclear , [ 147 ] cambio climático , [ 148 ] etc.) se han planteado como desafíos de cooperación. Al igual que en el conocido escenario del dilema del prisionero , algunas dinámicas pueden conducir a resultados negativos para todos los actores, incluso cuando actúan de manera óptima en su propio interés. Por ejemplo, ningún actor individual tiene fuertes incentivos para abordar el cambio climático, aunque las consecuencias pueden ser significativas si nadie interviene. [ 148 ]

Un desafío importante en la cooperación de la IA es evitar una «carrera hacia el abismo». [ 149 ] En este escenario, los países o las empresas compiten por construir sistemas de IA más capaces y descuidan la seguridad, lo que lleva a un accidente catastrófico que perjudica a todos los involucrados. La preocupación por escenarios como estos ha inspirado esfuerzos tanto políticos [ 150 ] como técnicos [ 151 ] para facilitar la cooperación entre humanos y, potencialmente, también entre sistemas de IA. La mayor parte de la investigación en IA se centra en diseñar agentes individuales para que cumplan funciones aisladas (a menudo en juegos de «un solo jugador»). [ 152 ] Los académicos han sugerido que, a medida que los sistemas de IA se vuelven más autónomos, puede resultar esencial estudiar y moldear la forma en que interactúan. [ 152 ] [ 138 ]

En materia de gobierno

La Cumbre de Seguridad de la IA de noviembre de 2023 [ 153 ]

La gobernanza de la IA se ocupa en términos generales de crear normas, estándares y regulaciones para guiar el uso y el desarrollo de los sistemas de IA. [ 144 ]

Investigación

En materia de seguridad de la IA, las soluciones locales se centran en sistemas de IA individuales, garantizando que sean seguros y beneficiosos, mientras que las soluciones globales buscan implementar medidas de seguridad para todos los sistemas de IA en diversas jurisdicciones. [ 154 ]

La investigación sobre la gobernanza de la seguridad de la IA abarca desde investigaciones fundamentales sobre los impactos potenciales de la IA hasta aplicaciones específicas. En el ámbito fundamental, los investigadores han argumentado que la IA podría transformar muchos aspectos de la sociedad debido a su amplia aplicabilidad, comparándola con la electricidad y la máquina de vapor. [ 155 ] Algunos trabajos se han centrado en anticipar riesgos específicos que pueden surgir de estos impactos, por ejemplo, riesgos de desempleo masivo, [ 156 ] militarización, [ 157 ] desinformación, [ 158 ] vigilancia, [ 159 ] y concentración de poder. [ 160 ] Otros trabajos exploran factores de riesgo subyacentes como la dificultad de supervisar la industria de la IA en rápida evolución, [ 161 ] la disponibilidad de modelos de IA, [ 162 ] y dinámicas de "carrera hacia el abismo". [ 149 ] [ 163 ] Allan Dafoe, jefe de gobernanza y estrategia a largo plazo en DeepMind, ha enfatizado los peligros de la carrera y la necesidad potencial de cooperación: "puede ser casi una condición necesaria y suficiente para la seguridad y alineación de la IA que exista un alto grado de precaución antes de implementar sistemas avanzados y potentes; sin embargo, si los actores compiten en un dominio con grandes beneficios para los primeros en actuar o una ventaja relativa, entonces se verán presionados a elegir un nivel de precaución subóptimo". [ 150 ] Una línea de investigación se centra en desarrollar enfoques, marcos y métodos para evaluar la responsabilidad de la IA, guiando y promoviendo auditorías de sistemas basados ​​en IA. [ 164 ] [ 165 ] [ 166 ] Un desafío clave para estos enfoques es la falta de estándares ampliamente aceptados y la ambigüedad sobre lo que requerirían los métodos, [ 167 ] [ 168 ] así como la falta de una cultura de seguridad en la industria. [ 169 ]

Los esfuerzos para mejorar la seguridad de la IA incluyen marcos diseñados para alinear los resultados de la IA con directrices éticas y reducir riesgos como el mal uso y la fuga de datos. Herramientas como Guardrails de Nvidia , [ 170 ] Llama Guard, [ 171 ] las guías personalizables de Preamble [ 172 ] y la Constitución de Claude mitigan vulnerabilidades como la inyección instantánea y aseguran que los resultados se adhieran a principios predefinidos. Estos marcos suelen integrarse en sistemas de IA para mejorar la seguridad y la fiabilidad. [ 173 ]

Perspectivas filosóficas

El campo de la seguridad de la IA está profundamente entrelazado con consideraciones filosóficas, particularmente en el ámbito de la ética. La ética deontológica , que enfatiza la adhesión a las normas morales, se ha propuesto como un marco para alinear los sistemas de IA con los valores humanos. Algunos han sugerido que, al incorporar principios deontológicos, los sistemas de IA pueden ser guiados para evitar acciones que causen daño, asegurando que sus operaciones se mantengan dentro de los límites éticos, [ 174 ] pero estas sugerencias han sido cuestionadas, y se han propuesto otras alternativas más prometedoras. [ 175 ]

acción del gobierno

Algunos expertos han argumentado que es demasiado pronto para regular la IA, expresando su preocupación de que las regulaciones obstaculicen la innovación y que sería insensato "apresurarse a regular por ignorancia". [ 176 ] [ 177 ] Otros, como el magnate Elon Musk , abogan por acciones preventivas para mitigar los riesgos catastróficos. [ 178 ]

Fuera de la legislación formal, las agencias gubernamentales han presentado recomendaciones éticas y de seguridad. En marzo de 2021, la Comisión Nacional de Seguridad de EE. UU. sobre Inteligencia Artificial informó que los avances en IA podrían hacer cada vez más importante "garantizar que los sistemas estén alineados con los objetivos y valores, incluyendo la seguridad, la robustez y la confiabilidad". [ 179 ] Posteriormente, el Instituto Nacional de Estándares y Tecnología elaboró ​​un marco para la gestión del riesgo de la IA, que aconseja que cuando "existan riesgos catastróficos, el desarrollo y la implementación deben detenerse de manera segura hasta que los riesgos puedan gestionarse adecuadamente". [ 180 ]

En septiembre de 2021, la República Popular China (RPC) publicó directrices éticas para el uso de la IA en China, haciendo hincapié en que las decisiones de la IA deben permanecer bajo control humano y exigiendo mecanismos de rendición de cuentas. Ese mismo mes, el Reino Unido publicó su Estrategia Nacional de IA a 10 años, [ 181 ] que afirma que el gobierno británico "toma en serio el riesgo a largo plazo de la Inteligencia Artificial General no alineada y los cambios imprevisibles que significaría para el mundo". [ 182 ] La estrategia describe acciones para evaluar los riesgos de la IA a largo plazo, incluidos los riesgos catastróficos. [ 182 ] El gobierno británico celebró la primera gran cumbre mundial sobre seguridad de la IA. Esta tuvo lugar los días 1 y 2 de noviembre de 2023 y se describió como "una oportunidad para que los responsables políticos y los líderes mundiales consideren los riesgos inmediatos y futuros de la IA y cómo estos riesgos pueden mitigarse mediante un enfoque coordinado a nivel mundial". [ 183 ] [ 184 ] El Proyecto de Medios de Comunicación de China afirmó que "aspectos clave de su enfoque siguen siendo fundamentalmente inseguros según los estándares de las sociedades democráticas de todo el mundo", argumentando que parte del enfoque de seguridad de la IA de China se centra en fortalecer el control de la información del Partido Comunista Chino (PCCh). [ 185 ]

Las organizaciones gubernamentales, particularmente en los Estados Unidos, también han fomentado el desarrollo de la investigación técnica sobre seguridad de la IA. La Intelligence Advanced Research Projects Activity inició el proyecto TrojAI para identificar y protegerse contra los ataques troyanos en los sistemas de IA. [ 186 ] La DARPA participa en investigaciones sobre inteligencia artificial explicable y mejora de la robustez frente a ataques adversarios . [ 187 ] [ 188 ] Y la National Science Foundation apoya al Center for Trustworthy Machine Learning y proporciona millones de dólares en financiación para la investigación empírica sobre seguridad de la IA. [ 189 ]

En 2024, la Asamblea General de las Naciones Unidas adoptó la primera resolución mundial sobre la promoción de sistemas de IA "seguros, protegidos y confiables" que enfatizó el respeto, la protección y la promoción de los derechos humanos en el diseño, el desarrollo, la implementación y el uso de la IA. [ 190 ]

En mayo de 2024, el Departamento de Ciencia, Innovación y Tecnología (DSIT) anunció una financiación de 8,5 millones de libras esterlinas para la investigación sobre seguridad de la IA en el marco del Programa de Subvenciones Rápidas para la Seguridad Sistémica de la IA, liderado por Christopher Summerfield y Shahar Avin en el Instituto de Seguridad de la IA, en colaboración con UK Research and Innovation . La Secretaria de Tecnología, Michelle Donelan, anunció el plan en la Cumbre de IA de Seúl , afirmando que el objetivo era lograr que la IA fuera segura en toda la sociedad y que las propuestas prometedoras podrían recibir financiación adicional. El Reino Unido también firmó un acuerdo con otros 10 países y la UE para formar una red internacional de institutos de seguridad de la IA con el fin de promover la colaboración y compartir información y recursos. Además, el Instituto de Seguridad de la IA del Reino Unido planeaba abrir una oficina en San Francisco. [ 191 ]

En noviembre de 2024, el entonces presidente de los Estados Unidos, Joe Biden, y el secretario general del PCCh, Xi Jinping, reafirmaron la necesidad de mantener el control humano sobre el uso de armas nucleares en contraposición a la inteligencia artificial . [ 192 ] [ 193 ] Como parte de la Ley de Autorización de Defensa Nacional para el Año Fiscal 2025 , el Congreso promulgó la sección 1638, "Opinión del Congreso sobre el uso de inteligencia artificial para apoyar la disuasión estratégica", en el Código de leyes federales de los Estados Unidos. Esta sección estipula que "el uso de la inteligencia artificial no debe comprometer la integridad de las salvaguardias nucleares, ya sea a través de la funcionalidad de los sistemas de armas, la validación de las comunicaciones de las autoridades de mando o el principio de requerir acciones humanas positivas en la ejecución de las decisiones del Presidente con respecto al empleo de armas nucleares". [ 194 ] [ 195 ] En febrero de 2026, la Administración Trump reafirmó públicamente que las decisiones sobre armas nucleares seguirán estando sujetas al control humano, y un alto funcionario del Pentágono reiteró la "política del Departamento de que hay un ser humano involucrado en todas las decisiones sobre si emplear o no armas nucleares". [ 196 ]

En septiembre de 2025, el Centro Francés para la Seguridad de la IA (CeSIA), The Future Society y el Centro para la IA Compatible con los Humanos (CHAI) publicaron un llamamiento mundial para establecer límites a la IA, instando a los gobiernos a alcanzar un acuerdo internacional vinculante que prohíba los usos inaceptables de la IA antes de finales de 2026. La declaración fue firmada inicialmente por 200 figuras destacadas, entre ellas 10 premios Nobel, y fue anunciada por Maria Ressa en la Asamblea General de las Naciones Unidas . [ 197 ]

En diciembre de 2025, el presidente Donald Trump firmó una orden ejecutiva para establecer un "Marco de Política Nacional para la Inteligencia Artificial". [ 198 ] La orden ejecutiva desaconsejaba a los gobiernos estatales regular la IA e instaba al Congreso a aprobar una ley que anulara dichas regulaciones. [ 199 ] La Casa Blanca citó preocupaciones económicas y de seguridad nacional como razones para la medida, mientras que algunos criticaron a Trump por generar incertidumbre en la regulación de la IA. [ 200 ] [ 201 ] [ 202 ]

Autorregulación corporativa

Los laboratorios y empresas de IA generalmente cumplen con prácticas y normas de seguridad que no están contempladas en la legislación formal. [ 203 ] Uno de los objetivos de los investigadores de gobernanza es dar forma a estas normas. Algunos ejemplos de recomendaciones de seguridad que se encuentran en la literatura incluyen realizar auditorías de terceros, [ 204 ] ofrecer recompensas por encontrar fallas, [ 204 ] compartir incidentes de IA [ 204 ] (se creó una base de datos de incidentes de IA para este propósito), [ 205 ] seguir directrices para determinar si se deben publicar investigaciones o modelos, [ 162 ] y mejorar la seguridad de la información y la ciberseguridad en los laboratorios de IA. [ 206 ]

Las empresas también han asumido compromisos. Cohere , OpenAI y AI21 propusieron y acordaron "mejores prácticas para el despliegue de modelos de lenguaje", centrándose en mitigar el mal uso. [ 207 ] Para evitar contribuir a la dinámica de la carrera, OpenAI también ha declarado en su estatuto que "si un proyecto alineado con los valores y consciente de la seguridad se acerca a construir una IA general antes que nosotros, nos comprometemos a dejar de competir con este proyecto y empezar a ayudarlo" [ 208 ] Además, líderes de la industria como el CEO de DeepMind, Demis Hassabis, y el director de IA de Facebook, Yann LeCun, han firmado cartas abiertas como los Principios de Asilomar [ 37 ] y la Carta Abierta sobre Armas Autónomas. [ 209 ]

Organizaciones sin fines de lucro

En la década de 2020, surgieron en Estados Unidos y Europa varias organizaciones sin fines de lucro centradas en la seguridad de la IA y las políticas públicas relacionadas, como la Alliance for Secure AI , el Future of Life Institute y Public First Action . [ 210 ] [ 211 ] Estos grupos suelen funcionar como vigilantes de Silicon Valley y abogan por regulaciones federales, estatales o locales específicas. [ 212 ] [ 213 ] También compiten con grupos de la industria como Leading the Future, que abogan por la desregulación de las empresas de IA. [ 214 ] [ 215 ]

regulación internacional

En el marco de la Convención sobre Ciertas Armas Convencionales , los Estados han debatido sobre sistemas de armas autónomas letales desde 2014. En 2016, los Estados Partes del tratado establecieron un Grupo abierto de Expertos Gubernamentales sobre Sistemas de Armas Autónomas Letales para continuar esos debates. [ 216 ] Los debates han abordado el derecho internacional humanitario, la rendición de cuentas, las posibles prohibiciones y regulaciones, y el grado de control humano requerido sobre las armas con inteligencia artificial. [ 217 ]

Véase también

Referencias

  1. Ahmed, Shazeda; Jaźwińska, Klaudia; Ahlawat, Archana; Winecoff, Amy; Wang, Mona (14 de abril de 2024). "Construcción de campos y la cultura epistémica de la seguridad de la IA" . First Monday . doi : 10.5210/fm.v29i4.13626 . ISSN 1396-0466 . 
  2. 1 2 3 4 5 6 Hendrycks, Dan; Carlini, Nicholas ; Schulman, John; Steinhardt, Jacob (2022-06-16). "Problemas sin resolver en la seguridad del aprendizaje automático". arXiv : 2109.13916 [ cs.LG ].
  3. Champagne, Dylan (26 de febrero de 2026). "El presidente Trump ataca las regulaciones estatales sobre IA" . The Regulatory Review . Recuperado el 27 de febrero de 2026 .
  4. "¿Cuál es la ley de seguridad de la IA de California?" . Brookings . 23-12-2025 . Consultado el 27-02-2026 .
  5. "Legislación sobre Inteligencia Artificial 2024" . www.ncsl.org . Consultado el 27 de febrero de 2026 .
  6. Perrigo, Billy (2 de noviembre de 2023). "La Cumbre de Seguridad de la IA del Reino Unido concluye con un progreso limitado, pero significativo" . Time . Consultado el 2 de junio de 2024 .
  7. De-Arteaga, Maria (13 de mayo de 2020). Aprendizaje automático en entornos de alto riesgo: riesgos y oportunidades (doctorado). Universidad Carnegie Mellon.
  8. Mehrabi, Ninareh; Morstatter, Fred; Saxena, Nripsuta; Lerman, Kristina; Galstyan, Aram (2021). "Una revisión sobre el sesgo y la equidad en el aprendizaje automático" . ACM Computing Surveys . 54 (6): 1– 35. arXiv : 1908.09635 . doi : 10.1145/3457607 . ISSN 0360-0300 . S2CID 201666566. Archivado del original el 23 de noviembre de 2022. Recuperado el 28 de noviembre de 2022 .  
  9. Feldstein, Steven (2019). La expansión global de la vigilancia mediante IA (Informe). Carnegie Endowment for International Peace.
  10. Barnes, Beth (2021). "Riesgos de la persuasión mediante IA" . Lesswrong . Archivado del original el 23/11/2022 . Recuperado el 23/11/2022 .
  11. 1 2 3 Brundage, Miles; Avin, Shahar; Clark, Jack; Toner, Helen; Eckersley, Peter; Garfinkel, Ben; Dafoe, Allan; Scharre, Paul; Zeitzoff, Thomas; Filar, Bobby; Anderson, Hyrum; Roff, Heather; Allen, Gregory C; Steinhardt, Jacob; Flynn, Carrick (2018-04-30). "El uso malicioso de la inteligencia artificial: pronóstico, prevención y mitigación" . Repositorio Apollo-Universidad de Cambridge, Repositorio Apollo-Universidad de Cambridge. Repositorio Apollo - Universidad de Cambridge. doi : 10.17863/cam.22520 . S2CID 3385567. Archivado del original el 23-11-2022 . Recuperado el 28-11-2022 . {{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  12. Davies, Pascale (26 de diciembre de 2022). "Cómo se está preparando la OTAN para una nueva era de ciberataques con IA" . euronews . Consultado el 23 de marzo de 2024 .
  13. Ahuja, Anjana (7 de febrero de 2024). "No se debe descartar el potencial bioterrorista de la IA" . Financial Times . Consultado el 23 de marzo de 2024 .
  14. Carlsmith, Joseph (16 de junio de 2022). "¿Es la IA que busca poder un riesgo existencial?". arXiv : 2206.13353 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  15. Minardi, Di (16 de octubre de 2020). "El sombrío destino que podría ser 'peor que la extinción'"" . BBC . Consultado el 23 de marzo de 2024 .
  16. "El experto en IA general Peter Voss dice que el problema de alineación de la IA es falso | NextBigFuture.com" . 4 de abril de 2023. Consultado el 23 de julio de 2023 .
  17. Dafoe, Allan (2016). "Sí, nos preocupa el riesgo existencial de la inteligencia artificial" . MIT Technology Review . Archivado del original el 28 de noviembre de 2022. Recuperado el 28 de noviembre de 2022 .
  18. 1 2 Grace, Katja; Salvatier, John; Dafoe, Allan; Zhang, Baobao; Evans, Owain (2018-07-31). " Punto de vista: ¿Cuándo superará la IA el rendimiento humano? Evidencia de expertos en IA" . Journal of Artificial Intelligence Research . 62 : 729–754 . arXiv : 1705.08807 . doi : 10.1613/jair.1.11222 . ISSN 1076-9757 . S2CID 8746462. Archivado del original el 10-02-2023 . Recuperado el 28-11-2022 .  
  19. Zhang, Baobao; Anderljung, Markus; Kahn, Lauren; Dreksler, Noemi; Horowitz, Michael C.; Dafoe, Allan (2021-05-05). "Ética y gobernanza de la inteligencia artificial: evidencia de una encuesta a investigadores de aprendizaje automático" . Journal of Artificial Intelligence Research . 71. arXiv : 2105.02117 . doi : 10.1613/jair.1.12895 .
  20. Stein-Perlman, Zach; Weinstein-Raun, Benjamin; Grace (04-08-2022). "Encuesta de expertos de 2022 sobre el progreso en IA" . Impactos de la IA . Archivado del original el 23-11-2022 . Recuperado el 23-11-2022 .
  21. ^ Miguel, Julián; Holtzman, Ari ; Parrish, Alicia; Mueller, Aarón; Wang, Alex; Chen, Angélica; Madaán, Divyam; Nangia, Nikita; Pang, Richard Yuanzhe; Phang, Jason; Bowman, Samuel R. (26 de agosto de 2022). "¿Qué creen los investigadores de PNL? Resultados de la metaencuesta comunitaria de PNL". Asociación de Lingüística Computacional . arXiv : 2208.12852 .
  22. Markoff, John (2013-05-20). "En 1949, imaginó una era de robots" . The New York Times . ISSN 0362-4331 . Archivado del original el 23-11-2022 . Recuperado el 23-11-2022 . 
  23. Inteligencia artificial: Un manual de profesionalismo . Universidad de Sussex. Enero de 1988. ISBN 978-0-470-21103-8.
  24. Asociación para el Avance de la Inteligencia Artificial. "Panel Presidencial de la AAAI sobre el Futuro a Largo Plazo de la IA" . Archivado del original el 1 de septiembre de 2022. Consultado el 23 de noviembre de 2022 .
  25. Yampolskiy, Roman V.; Spellchecker, MS (2016-10-25). "Seguridad de la inteligencia artificial y ciberseguridad: una cronología de fallos de la IA". arXiv : 1610.07997 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  26. "PT-AI 2011 – Filosofía y teoría de la inteligencia artificial (PT-AI 2011)" . Archivado del original el 23/11/2022 . Consultado el 23/11/2022 .
  27. Yampolskiy, Roman V. (2013), «Ingeniería de seguridad de la inteligencia artificial: por qué la ética de las máquinas es un enfoque erróneo» , en Müller, Vincent C. (ed.), Filosofía y teoría de la inteligencia artificial , Estudios en filosofía aplicada, epistemología y ética racional, vol. 5, Berlín; Heidelberg, Alemania: Springer Berlin Heidelberg, pp. 389–396 , doi : 10.1007/978-3-642-31674-6_29 , ISBN   978-3-642-31673-9Archivado del original el 15/03/2023 , consultado el 23/11/2022.
  28. McLean, Scott; Read, Gemma JM; Thompson, Jason; Baber, Chris; Stanton, Neville A.; Salmon, Paul M. (2023-07-04). "Los riesgos asociados con la Inteligencia Artificial General: una revisión sistemática" . Journal of Experimental & Theoretical Artificial Intelligence . 35 (5): 649– 663. Bibcode : 2023JETAI..35..649M . doi : 10.1080/0952813X.2021.1964003 . hdl : 11343/289595 . ISSN 0952-813X . S2CID 238643957 .  
  29. Wile, Rob (3 de agosto de 2014). "Elon Musk: La inteligencia artificial es 'potencialmente más peligrosa que las armas nucleares'"." . Business Insider . Consultado el 22 de febrero de 2024 .
  30. Kuo, Kaiser (31 de marzo de 2015). El director ejecutivo de Baidu, Robin Li, entrevista a Bill Gates y Elon Musk en el Foro de Boao, 29 de marzo de 2015. El evento ocurre a las 55:49. Archivado del original el 23 de noviembre de 2022. Recuperado el 23 de noviembre de 2022 .
  31. Cellan-Jones, Rory (2 de diciembre de 2014). «Stephen Hawking advierte que la inteligencia artificial podría acabar con la humanidad» . BBC News . Archivado del original el 30 de octubre de 2015. Consultado el 23 de noviembre de 2022 .
  32. Future of Life Institute. "Prioridades de investigación para una inteligencia artificial robusta y beneficiosa: una carta abierta" . Future of Life Institute . Archivado del original el 23 de noviembre de 2022. Consultado el 23 de noviembre de 2022 .
  33. Future of Life Institute (octubre de 2016). "Programa de subvenciones para la investigación en IA" . Future of Life Institute . Archivado del original el 23 de noviembre de 2022. Consultado el 23 de noviembre de 2022 .
  34. "SafArtInt 2016" . Archivado del original el 23/11/2022 . Consultado el 23/11/2022 .
  35. Bach, Deborah (2016). "La UW organizará el primero de cuatro talleres públicos de la Casa Blanca sobre inteligencia artificial" . Noticias de la UW . Archivado del original el 23 de noviembre de 2022. Recuperado el 23 de noviembre de 2022 .
  36. Amodei, Darío; Ola, Chris; Steinhardt, Jacob; Cristiano, Pablo; Schulman, Juan; Mané, Dan (25 de julio de 2016). "Problemas concretos en la seguridad de la IA". arXiv : 1606.06565 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  37. 1 2 Future of Life Institute. "Principios de IA" . Future of Life Institute . Archivado del original el 23/11/2022 . Recuperado el 23/11/2022 .
  38. Yohsua, Bengio; Daniel, Privitera; Tamay, Besiroglu; Rishi, Bommasani; Stephen, Casper; Yejin, Choi; Danielle, Goldfarb; Hoda, Heidari; Leila, Khalatbari (mayo de 2024). Informe científico internacional sobre la seguridad de la IA avanzada (Informe). Departamento de Ciencia, Innovación y Tecnología.
  39. 1 2 Investigación, DeepMind Safety (27-09-2018). "Construyendo inteligencia artificial segura: especificación, robustez y garantía" . Medium . Archivado del original el 10-02-2023 . Recuperado el 23-11-2022 .
  40. "Taller SafeML ICLR 2019" . Archivado del original el 23/11/2022 . Consultado el 23/11/2022 .
  41. Browne, Ryan (12 de junio de 2023). "El primer ministro británico Rishi Sunak presenta al Reino Unido como sede de la regulación de la seguridad de la IA, mientras Londres aspira a convertirse en el próximo Silicon Valley" . CNBC . Consultado el 25 de junio de 2023 .
  42. Bertuzzi, Luca (18 de octubre de 2023). "La cumbre sobre seguridad de la IA en el Reino Unido destacará el riesgo de perder el control humano sobre los modelos 'frontera'" . Euractiv . Consultado el 2 de marzo de 2024 .
  43. ^ Bengio, Yoshua; Privitera, Daniel; Bommasani, Rishi; Casper, Esteban; Goldfarb, Danielle; Mavroudis, Vasilios; Khalatbari, Leila; Mazeika, Mantas; Hoda, Heidari (17 de mayo de 2024). "Informe científico internacional sobre la seguridad de la IA avanzada" (PDF) . GOBIERNO DEL REINO UNIDO . Archivado (PDF) desde el original el 15 de junio de 2024 . Consultado el 8 de julio de 2024 .URL alternativa
  44. Shepardson, David (1 de abril de 2024). "EE. UU. y Gran Bretaña anuncian una asociación sobre seguridad y pruebas de IA" . Recuperado el 2 de abril de 2024 .
  45. «Lo que dice el informe internacional sobre seguridad de la IA sobre empleo, clima, ciberguerra y más» . The Guardian . 29 de enero de 2025. ISSN 0261-3077 . Consultado el 3 de marzo de 2025 . 
  46. "Presentación del Primer Informe Internacional sobre Seguridad de la IA presidido por Yoshua Bengio" . mila.quebec . 29 de enero de 2025. Consultado el 3 de marzo de 2025 .
  47. Goodfellow, Ian; Papernot, Nicolas; Huang, Sandy; Duan, Rocky; Abbeel, Pieter; Clark, Jack (24 de febrero de 2017). "Ataque al aprendizaje automático con ejemplos adversarios" . OpenAI . Archivado del original el 24 de noviembre de 2022. Consultado el 24 de noviembre de 2022 .
  48. ^ Szegedy , cristiano; Zaremba, Wojciech; Sutskever, Ilya; Bruna, Juana; Erhan, Dumitru; Buen compañero, Ian; Fergus, Rob (19 de febrero de 2014). "Propiedades intrigantes de las redes neuronales". ICLR . arXiv : 1312.6199 .
  49. Kurakin, Alexey; Goodfellow, Ian; Bengio, Samy (2017-02-10). "Ejemplos adversariales en el mundo físico". ICLR . arXiv : 1607.02533 .
  50. Madry, Aleksander; Makelov, Aleksandar; Schmidt, Ludwig; Tsipras, Dimitris; Vladu, Adrian (2019-09-04). "Hacia modelos de aprendizaje profundo resistentes a ataques adversarios". ICLR . arXiv : 1706.06083 .
  51. Kannan, Harini; Kurakin, Alexey; Goodfellow, Ian (2018-03-16). "Adversarial Logit Pairing". arXiv : 1803.06373 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  52. Gilmer, Justin; Adams, Ryan P.; Goodfellow, Ian; Andersen, David; Dahl, George E. (2018-07-19). "Motivating the Rules of the Game for Adversarial Example Research". arXiv : 1807.06732 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  53. Carlini, Nicholas; Wagner, David (29 de marzo de 2018). "Ejemplos adversarios de audio: ataques dirigidos a la conversión de voz a texto". Talleres de seguridad y privacidad de IEEE . arXiv : 1801.01944 .
  54. Sheatsley, Ryan; Papernot, Nicolas; Weisman, Michael; Verma, Gunjan; McDaniel, Patrick (2022-09-09). "Ejemplos adversariales en dominios restringidos". arXiv : 2011.01183 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  55. Suciu, Octavian; Coull, Scott E.; Johns, Jeffrey (2019-04-13). "Explorando ejemplos adversarios en la detección de malware". Talleres de seguridad y privacidad de IEEE . arXiv : 1810.08280 .
  56. Ouyang, Long; Wu, Jeff; Jiang, Xu; Almeida, Diogo; Wainwright, Carroll L.; Mishkin, Pamela; Zhang, Chong; Agarwal, Sandhini; Slama, Katarina; Ray, Alex; Schulman, John; Hilton, Jacob; Kelton, Fraser; Miller, Luke; Simens, Maddie (2022-03-04). "Entrenamiento de modelos de lenguaje para seguir instrucciones con retroalimentación humana". NeurIPS . arXiv : 2203.02155 .
  57. Gao, Leo; Schulman, John; Hilton, Jacob (19 de octubre de 2022). "Leyes de escala para la sobreoptimización de modelos de recompensa". ICML . arXiv : 2210.10760 .
  58. Yu, Sihyun; Ahn, Sungsoo; Song, Le; Shin, Jinwoo (27-10-2021). "RoMA: Adaptación robusta de modelos para optimización basada en modelos fuera de línea". NeurIPS . arXiv : 2110.14188 .
  59. 1 2 Hendrycks, Dan; Mazeika, Mantas (2022-09-20). "Análisis de riesgo X para la investigación en IA". arXiv : 2206.05862 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  60. 1 2 "Los ataques de inyección rápida podrían 'nunca ser mitigados adecuadamente', advierte el NCSC del Reino Unido" . TechRadar . 09-12-2025 . Consultado el 12-12-2025 .
  61. "Por qué Anthropic y OpenAI están obsesionados con asegurar los pesos de los modelos LLM" . VentureBeat . 15 de diciembre de 2023.
  62. "El auge de las noticias falsas generadas por IA está creando un 'superpropagador de desinformación'"" . The Washington Post . 17-12-2023. ISSN 0190-8286 . Consultado el 12-12-2025 . 
  63. Pérez-Cerrolaza, Jon; Abella, Jaume; Borg, Markus; Donzella, Carlo; Cerquides, Jesús; Cazorla, Francisco J.; Englund, Cristofer; Tauber, Markus; Nikolakópoulos, George; Flores, José Luis (2024). "Inteligencia artificial para sistemas críticos para la seguridad en los ámbitos industrial y de transporte: una encuesta". Encuestas de Computación ACM . 56 (7): 1– 40. doi : 10.1145/3626314 .
  64. Brando, Axel; Serra, Isabel; Mezzetti, Enrico; Cazorla, Francisco J.; Perez-Cerrolaza, Jon; Abella, Jaume (mayo de 2023). "Sobre la redundancia y diversidad de las redes neuronales para su uso en sistemas críticos de seguridad". Computer . 56 (5): 41– 50. Bibcode : 2023Compr..56e..41B . doi : 10.1109/MC.2023.3236523 . hdl : 2117/387765 .
  65. Machida, Fumio (2019). "Modelos de aprendizaje automático de N versiones para sistemas críticos de seguridad". 49.ª Conferencia Internacional Anual IEEE/IFIP sobre Talleres de Sistemas y Redes Confiables (DSN-W) de 2019. IEEE. pp. 48–51 . doi : 10.1109/DSN-W.2019.00017 . 
  66. Tran, Khoa A.; Kondrashova, Olga; Bradley, Andrew; Williams, Elizabeth D.; Pearson, John V.; Waddell, Nicola (2021). " Aprendizaje profundo en el diagnóstico, pronóstico y selección de tratamiento del cáncer" . Genome Medicine . 13 (1): 152. doi : 10.1186/s13073-021-00968-x . ISSN 1756-994X . PMC 8477474. PMID 34579788 .   
  67. Guo, Chuan; Pleiss, Geoff; Sun, Yu; Weinberger, Kilian Q. (2017-08-06). "Sobre la calibración de redes neuronales modernas". Actas de la 34.ª conferencia internacional sobre aprendizaje automático . Actas de investigación en aprendizaje automático. Vol. 70. PMLR. págs. 1321–1330 .  
  68. Ovadia, Yaniv; Fertig, Emily; Ren, Jie; Nado, Zachary; Sculley, D.; Nowozin, Sebastian; Dillon, Joshua V.; Lakshminarayanan, Balaji; Snoek, Jasper (2019-12-17). "¿Puedes confiar en la incertidumbre de tu modelo? Evaluación de la incertidumbre predictiva bajo cambios en el conjunto de datos". NeurIPS . arXiv : 1906.02530 .
  69. ^ Bogdoll, Daniel; Breitenstein, Jasmín; Heidecker, Florián; Bieshaar, Martín; Enfermo, Bernardo; Fingscheidt, Tim; Zöllner, J. Marius (2021). "Descripción de casos de esquina en conducción automatizada: objetivos y desafíos". 2021 Conferencia internacional IEEE/CVF sobre talleres de visión por computadora (ICCVW) . págs. 1023-1028 . arXiv : 2109.09607 . doi : 10.1109/ICCVW54120.2021.00119 . ISBN  978-1-6654-0191-3. S2CID 237572375 . 
  70. Hendrycks, Dan; Mazeika, Mantas; Dietterich, Thomas (2019-01-28). "Detección profunda de anomalías con exposición de valores atípicos". ICLR . arXiv : 1812.04606 .
  71. ^ Wang, Haoqi; Li, Zhizhong; Feng, Litong; Zhang, Wayne (21 de marzo de 2022). "ViM: fuera de distribución con coincidencia de logit virtual". CVPR . arXiv : 2203.10807 .
  72. Hendrycks, Dan; Gimpel, Kevin (2018-10-03). "Una línea base para detectar ejemplos mal clasificados y fuera de distribución en redes neuronales". ICLR . arXiv : 1610.02136 .
  73. Urbina, Fabio; Lentzos, Filippa; Invernizzi, Cédric; Ekins, Sean (2022). "Uso dual del descubrimiento de fármacos impulsado por inteligencia artificial" . Nature Machine Intelligence . 4 (3): 189– 191. doi : 10.1038/s42256-022-00465-9 . ISSN 2522-5839 . PMC 9544280. PMID 36211133 .   
  74. Centro para la Seguridad y la Tecnología Emergente; Buchanan, Ben; Lohn, Andrew; Musser, Micah; Sedova, Katerina (2021). " Verdad, mentiras y automatización: cómo los modelos de lenguaje podrían cambiar la desinformación" . doi : 10.51593/2021ca003 . S2CID 240522878. Archivado del original el 24 de noviembre de 2022. Consultado el 28 de noviembre de 2022 . {{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  75. "La propaganda como servicio podría estar en el horizonte si se abusa de los grandes modelos de lenguaje" . VentureBeat . 14 de diciembre de 2021. Archivado del original el 24 de noviembre de 2022. Consultado el 24 de noviembre de 2022 .
  76. Centro para la Seguridad y la Tecnología Emergente; Buchanan, Ben; Bansemer, John; Cary, Dakota; Lucas, Jack; Musser, Micah (2020). "Automatización de los ciberataques: exageración y realidad" . Centro para la Seguridad y la Tecnología Emergente . doi : 10.51593/2020ca002 . S2CID 234623943. Archivado del original el 24 de noviembre de 2022. Consultado el 28 de noviembre de 2022 . 
  77. "Lecciones aprendidas sobre seguridad y mal uso de modelos de lenguaje" . OpenAI . 3 de marzo de 2022. Archivado del original el 24 de noviembre de 2022. Consultado el 24 de noviembre de 2022 .
  78. Markov, Todor; Zhang, Chong; Agarwal, Sandhini; Eloundou, Tyna; Lee, Teddy; Adler, Steven; Jiang, Angela; Weng, Lilian (10 de agosto de 2022). "Nuevas y mejoradas herramientas de moderación de contenido" . OpenAI . Archivado del original el 11 de enero de 2023. Consultado el 24 de noviembre de 2022 .
  79. 1 2 Savage, Neil (2022-03-29). "Rompiendo la caja negra de la inteligencia artificial" . Nature . doi : 10.1038 /d41586-022-00858-1 . PMID 35352042. S2CID 247792459. Archivado del original el 24-11-2022 . Recuperado el 24-11-2022 .  
  80. Centro para la Seguridad y la Tecnología Emergente; Rudner, Tim; Toner, Helen (2021). "Conceptos clave en la seguridad de la IA: interpretabilidad en el aprendizaje automático" . Informe de CSET . doi : 10.51593/20190042 . S2CID 233775541. Archivado del original el 24/11/2022 . Consultado el 28/11/2022 . 
  81. McFarland, Matt (19 de marzo de 2018). "Uber retira los coches autónomos tras el primer accidente mortal de un vehículo autónomo" . CNNMoney . Archivado del original el 24 de noviembre de 2022. Consultado el 24 de noviembre de 2022 .
  82. Felder, Ryan Marshall (julio de 2021). "Afrontando el problema de la caja negra: cómo justificar los sistemas de IA en la atención médica" . Hastings Center Report . 51 (4): 38– 45. doi : 10.1002/hast.1248 . ISSN 0093-0334 . PMID 33821471 .  
  83. 1 2 Doshi-Velez, Finale; Kortz, Mason; Budish, Ryan; Bavitz, Chris; Gershman, Sam; O'Brien, David; Scott, Kate; Schieber, Stuart; Waldo, James; Weinberger, David; Weller, Adrian; Wood, Alexandra (2019-12-20). "Rendición de cuentas de la IA bajo la ley: el papel de la explicación". arXiv : 1711.01134 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  84. Fong, Ruth; Vedaldi, Andrea (2017). «Explicaciones interpretables de cajas negras mediante perturbaciones significativas». 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 3449–3457 . arXiv : 1704.03296 . doi : 10.1109/ICCV.2017.371 . ISBN  978-1-5386-1032-9. S2CID 1633753 . 
  85. Meng, Kevin; Bau, David; Andonian, Alex; Belinkov, Yonatan (2022). "Localización y edición de asociaciones fácticas en GPT". Advances in Neural Information Processing Systems . 35 : 17359–17372 . arXiv : 2202.05262 . doi : 10.52202/068431-1262 . ISBN 978-1-7138-7108-8.
  86. ^ Bau, David; Liu, Steven; Wang, Tongzhou; Zhu, Jun-Yan; Torralba, Antonio (30-07-2020). "Reescribiendo un modelo generativo profundo". ECCV . arXiv : 2007.15646 .
  87. Räuker, Tilman; Ho, Anson; Casper, Stephen; Hadfield-Menell, Dylan (2022-09-05). "Hacia una IA transparente: una revisión sobre la interpretación de las estructuras internas de las redes neuronales profundas". IEEE SaTML . arXiv : 2207.13243 .
  88. Bau, David; Zhou, Bolei; Khosla, Aditya; Oliva, Aude; Torralba, Antonio (2017-04-19). "Network Dissection: Quantifying Interpretability of Deep Visual Representations". CVPR . arXiv : 1704.05796 .
  89. McGrath, Thomas; Kapishnikov, Andrei; Tomašev, Nenad; Pearce, Adam; Wattenberg, Martin; Hassabis, Demis; Kim, Been; Paquet, Ulrich; Kramnik, Vladimir (22-11-2022). "Adquisición de conocimientos de ajedrez en AlphaZero" . Actas de la Academia Nacional de Ciencias . 119 (47) e2206625119. arXiv : 2111.09259 . Bibcode : 2022PNAS..11906625M . doi : 10.1073 / pnas.2206625119 . ISSN 0027-8424 . PMC 9704706. PMID 36375061 .   
  90. Goh, Gabriel; Cammarata, Nick; Voss, Chelsea; Carter, Shan; Petrov, Michael; Schubert, Ludwig; Radford, Alec; Olah, Chris (2021). "Neuronas multimodales en redes neuronales artificiales" . Distill . 6 (3). doi : 10.23915/distill.00030 . S2CID 233823418 . 
  91. Olah, Chris; Cammarata, Nick; Schubert, Ludwig; Goh, Gabriel; Petrov, Michael; Carter, Shan (2020). "Zoom in: Una introducción a los circuitos" . Distill . 5 (3). doi : 10.23915/distill.00024.001 . S2CID 215930358 . 
  92. Cammarata, Nick; Goh, Gabriel; Carter, Shan; Voss, Chelsea; Schubert, Ludwig; Olah, Chris (2021). "Curve circuits" . Distill . 6 (1). doi : 10.23915/distill.00024.006 (inactivo el 17 de julio de 2026). Archivado del original el 5 de diciembre de 2022. Recuperado el 5 de diciembre de 2022 .{{cite journal}}: CS1 maint: DOI inactivo desde julio de 2026 ( enlace )
  93. Olsson, Catherine; Elhage, Nelson; Nanda, Neel; Joseph, Nicholas; DasSarma, Nova; Henighan, Tom; Mann, Ben; Askell, Amanda; Bai, Yuntao; Chen, Anna; Conerly, Tom; Drain, Dawn; Ganguli, Deep; Hatfield-Dodds, Zac; Hernandez, Danny; Johnston, Scott; Jones, Andy; Kernion, Jackson; Lovitt, Liane; Ndousse, Kamal; Amodei, Dario; Brown, Tom; Clark, Jack; Kaplan, Jared; McCandlish, Sam; Olah, Chris (2022). "Aprendizaje en contexto y cabezas de inducción". Transformer Circuits Thread . arXiv : 2209.11895 .
  94. Olah, Christopher. "Interpretabilidad vs Neurociencia [ nota preliminar ] " . Archivado del original el 24/11/2022 . Consultado el 24/11/2022 .
  95. Gu, Tianyu; Dolan-Gavitt, Brendan; Garg, Siddharth (2019-03-11). "BadNets: Identificación de vulnerabilidades en la cadena de suministro de modelos de aprendizaje automático". arXiv : 1708.06733 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  96. Chen, Xinyun; Liu, Chang; Li, Bo; Lu, Kimberly; Song, Dawn (2017-12-14). "Ataques de puerta trasera dirigidos a sistemas de aprendizaje profundo mediante envenenamiento de datos". arXiv : 1712.05526 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  97. Carlini, Nicholas; Terzis, Andreas (2022-03-28). "Envenenamiento y puerta trasera del aprendizaje contrastivo". ICLR . arXiv : 2106.09667 .
  98. "Agentes durmientes: formación de LLM engañosos que persisten a través de la formación en seguridad" . Anthropic . 2024. Consultado el 12 de enero de 2025 .
  99. "Cómo los asistentes de IA 'agentes durmientes' pueden sabotear el código" . The Register . 16 de enero de 2024. Consultado el 12 de enero de 2025 .
  100. 1 2 3 4 Russell, Stuart J.; Norvig, Peter (2021). Inteligencia artificial: Un enfoque moderno (4.ª ed.). Pearson. pp. 5, 1003. ISBN   978-0-13-461099-3. Consultado el 12 de septiembre de 2022 .
  101. 1 2 Ngo, Richard; Chan, Lawrence; Mindermann, Sören (2022). "El problema de la alineación desde una perspectiva de aprendizaje profundo" . Conferencia internacional sobre representaciones de aprendizaje . arXiv : 2209.00626 .
  102. 1 2 Pan, Alexander; Bhatia, Kush; Steinhardt, Jacob (2022-02-14). Los efectos de la especificación errónea de recompensas: mapeo y mitigación de modelos desalineados . Conferencia internacional sobre representaciones de aprendizaje . Recuperado el 2022-07-21 .
  103. Carlsmith, Joseph (16 de junio de 2022). "¿Es la IA que busca poder un riesgo existencial?". arXiv : 2206.13353 [ cs.CY ].
  104. 1 2 3 Russell, Stuart J. (2020). Human compatible: Inteligencia artificial y el problema del control . Penguin Random House. ISBN 978-0-525-55863-7OCLC 1113410915 
  105. Christian, Brian (2020). El problema de la alineación: aprendizaje automático y valores humanos . WW Norton & Company. ISBN 978-0-393-86833-3OCLC 1233266753. Archivado del original el 10 de febrero de 2023. Consultado el 12 de septiembre de 2022 . 
  106. Langosco, Lauro Langosco Di; Koch, Jack; Sharkey, Lee D.; Pfau, Jacob; Krueger, David (2022-06-28). "Generalización errónea de objetivos en el aprendizaje profundo por refuerzo" . Actas de la 39.ª Conferencia Internacional sobre Aprendizaje Automático . Conferencia Internacional sobre Aprendizaje Automático. PMLR. pp. 12004–12019 . Recuperado el 11 de marzo de 2023 . 
  107. Pillay, Tharin (15 de diciembre de 2024). "Nuevas pruebas revelan la capacidad de engaño de la IA" . TIME . Consultado el 12 de enero de 2025 .
  108. Perrigo, Billy (18 de diciembre de 2024). "Exclusiva: Nueva investigación muestra que la IA miente estratégicamente" . TIME . Consultado el 18 de febrero de 2025 .
  109. 1 2 Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ; Arora, Simran; von Arx, Sydney; Bernstein, Michael S.; Bohg, Jeannette; Bosselut, Antoine; Brunskill, Emma ; Brynjolfsson, Erik (2022-07-12). "Sobre las oportunidades y los riesgos de los modelos de fundación" . Stanford CRFM . arXiv : 2108.07258 .
  110. Ouyang, Long; et al. (2022). "Entrenamiento de modelos de lenguaje para seguir instrucciones con retroalimentación humana" (PDF) . NeurIPS . arXiv : 2203.02155 . 
  111. Zaremba, Wojciech; Brockman, Greg; OpenAI (10 de agosto de 2021). "OpenAI Codex" . OpenAI . Archivado del original el 3 de febrero de 2023. Recuperado el 23 de julio de 2022 .
  112. Kober, Jens; Bagnell, J. Andrew; Peters, Jan (1 de septiembre de 2013). "Aprendizaje por refuerzo en robótica: una revisión" . The International Journal of Robotics Research . 32 (11): 1238– 1274. doi : 10.1177/0278364913495721 . ISSN 0278-3649 . S2CID 1932843. Archivado del original el 15 de octubre de 2022. Recuperado el 12 de septiembre de 2022 .  
  113. Knox, W. Bradley; Allievi, Alessandro; Banzhaf, Holger; Schmitt, Felix; Stone, Peter (2023-03-01). "Recompensa (mal)diseño para la conducción autónoma" . Inteligencia Artificial . 316 103829. arXiv : 2104.13906 . doi : 10.1016/j.artint.2022.103829 . ISSN 0004-3702 . S2CID 233423198 .  
  114. Stray, Jonathan (2020). " Alineando la optimización de la IA con el bienestar comunitario" . Revista Internacional de Bienestar Comunitario . 3 (4 ) : 443– 463. doi : 10.1007/s42413-020-00086-3 . ISSN 2524-5295 . PMC 7610010. PMID 34723107. S2CID 226254676 .    
  115. Russell, Stuart; Norvig, Peter (2009). Inteligencia artificial: un enfoque moderno . Prentice Hall. pág. 1003. ISBN  978-0-13-461099-3.
  116. Smith, Craig S. "Geoff Hinton, el investigador más famoso de la IA, advierte de una 'amenaza existencial'"" . Forbes . Consultado el 4 de mayo de 2023 .
  117. ^ Bengio, Yoshua; Hinton, Geoffrey; Yao, Andrés; Canción, amanecer; Abbeel, Pieter; Harari, Yuval Noah; Zhang, Ya-Qin; Xue, Lan; Shalev-Shwartz, Shai (2024). "Gestión de riesgos extremos de IA en medio de rápidos avances". Ciencia . 384 (6698): 842–845 . arXiv : 2310.17688 . Código Bib : 2024Ciencia...384..842B . doi : 10.1126/science.adn0117 . PMID 38768279 . 
  118. "Declaración sobre el riesgo de la IA" . www.safe.ai. Consultado el 17 de julio de 2023 .
  119. Grace, Katja; Stewart, Harlan; Sandkühler, Julia Fabienne; Thomas, Stephen; Weinstein-Raun, Ben; Brauner, Jan (2025). " Miles de autores de IA sobre el futuro de la IA" . Journal of Artificial Intelligence Research . 84. arXiv : 2401.02843 . doi : 10.1613/jair.1.19087 .
  120. Perrigo, Billy (13 de febrero de 2024). "El jefe de IA de Meta, Yann LeCun, habla sobre la IAG, el código abierto y el riesgo de la IA" . TIME . Consultado el 26 de junio de 2024 .
  121. "¿Qué es la alineación de IA?" . TechTarget . 2023-05-03 . Consultado el 2025-06-28 .
  122. Ahmed, Shazeda; Jaźwińska, Klaudia; Ahlawat, Archana; Winecoff, Amy; Wang, Mona (14 de abril de 2024). "Construcción de campos y la cultura epistémica de la seguridad de la IA" . First Monday . doi : 10.5210/fm.v29i4.13626 . ISSN 1396-0466 . 
  123. 1 2 Ortega, Pedro A.; Maini, Vishal; Equipo de seguridad de DeepMind (27 de septiembre de 2018). "Construyendo inteligencia artificial segura: especificación, robustez y garantía" . DeepMind Safety Research – Medium . Archivado del original el 10 de febrero de 2023. Recuperado el 18 de julio de 2022 .
  124. 1 2 Rorvig, Mordechai (14 de abril de 2022). "Los investigadores obtienen nuevos conocimientos a partir de la IA simple" . Quanta Magazine . Archivado del original el 10 de febrero de 2023. Recuperado el 18 de julio de 2022 .
  125. Doshi-Velez, Finale; Kim, Been (2017-03-02). "Hacia una ciencia rigurosa del aprendizaje automático interpretable". arXiv : 1702.08608 [ stat.ML ].
    • Wiblin, Robert (4 de agosto de 2021). "Chris Olah sobre qué demonios está pasando dentro de las redes neuronales" (Podcast). 80,000 horas. N.°  107. Recuperado el 23 de julio de 2022 .
  126. 1 2 Amodei, Darío; Ola, Chris; Steinhardt, Jacob; Cristiano, Pablo; Schulman, Juan; Mané, Dan (21 de junio de 2016). "Problemas concretos en la seguridad de la IA". arXiv : 1606.06565 [ cs.AI ].
  127. Russell, Stuart; Dewey, Daniel; Tegmark, Max (31 de diciembre de 2015). "Prioridades de investigación para una inteligencia artificial robusta y beneficiosa" . AI Magazine . 36 (4): 105–114 . arXiv : 1602.03506 . doi : 10.1609/aimag.v36i4.2577 . hdl : 1721.1 / 108478 . ISSN 2371-9621 . S2CID 8174496. Archivado del original el 2 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .  
  128. Wirth, Christian; Akrour, Riad; Neumann, Gerhard; Fürnkranz, Johannes (2017). "Una revisión de los métodos de aprendizaje por refuerzo basados ​​en preferencias". Journal of Machine Learning Research . 18 (136): 1– 46.
  129. Christiano, Paul F.; Leike, Jan; Brown, Tom B.; Martic, Miljan; Legg, Shane; Amodei, Dario (2017). «Aprendizaje profundo por refuerzo a partir de preferencias humanas». Actas de la 31.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'17. Red Hook, NY, EE. UU.: Curran Associates Inc. págs. 4302–4310 . ISBN  978-1-5108-6096-4.
  130. Heaven, Will Douglas (27 de enero de 2022). "La nueva versión de GPT-3 se comporta mucho mejor (y debería ser menos tóxica)" . MIT Technology Review . Archivado del original el 10 de febrero de 2023. Consultado el 18 de julio de 2022 .
  131. ^ Mohseni, Sina; Wang, Haotao; Yu, Zhiding; Xiao, Chaowei; Wang, Zhangyang; Yadawa, Jay (7 de marzo de 2022). "Taxonomía de la seguridad del aprendizaje automático: una encuesta y una introducción" . Encuestas de Computación ACM . 55 (8): 1– 38. doi : 10.1145/3551385 .
  132. Clifton, Jesse (2020). "Cooperación, conflicto e inteligencia artificial transformadora: una agenda de investigación" . Centro sobre riesgo a largo plazo . Archivado del original el 1 de enero de 2023. Recuperado el 18 de julio de 2022 .
    • Dafoe, Allan; Bachrach, Yoram; Hadfield, Gillian; Horvitz, Eric; Larson, Kate; Graepel, Thore (2021-05-06). " IA cooperativa: las máquinas deben aprender a encontrar puntos en común" . Nature . 593 (7857): 33– 36. Bibcode : 2021Natur.593...33D . doi : 10.1038/d41586-021-01170-0 . ISSN 0028-0836 . PMID 33947992. S2CID 233740521. Archivado del original el 18 de diciembre de 2022. Recuperado el 12 de septiembre de 2022 .   
  133. Prunkl, Carina; Whittlestone, Jess (7 de febrero de 2020). «Más allá del corto y largo plazo» . Actas de la Conferencia AAAI/ACM sobre IA, ética y sociedad . Nueva York, NY, EE. UU.: ACM. págs. 138-143 . doi : 10.1145/3375627.3375803 . ISBN  978-1-4503-7110-0. S2CID 210164673 . Archivado del original el 16 de octubre de 2022 . Recuperado el 12 de septiembre de 2022 . 
  134. Irving, Geoffrey; Askell, Amanda (19 de febrero de 2019). " La seguridad de la IA necesita científicos sociales" . Distill . 4 (2) 10.23915/distill.00014. doi : 10.23915/distill.00014 . ISSN 2476-0757 . S2CID 159180422. Archivado del original el 10 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .  
  135. Gazos, Alexandros; Kahn, James; Kusche, Isabel; Büscher, Christian; Götz, Markus (2025-04-01). "Organizando la IA para la seguridad: Identificando vulnerabilidades estructurales para guiar el diseño de sistemas sociotécnicos mejorados con IA" . Safety Science . 184 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN 0925-7535 . 
  136. 1 2 3 4 Zwetsloot, Remco; Dafoe, Allan (11 de febrero de 2019). "Pensando en los riesgos de la IA: accidentes, mal uso y estructura" . Lawfare . Archivado del original el 19 de agosto de 2023. Recuperado el 24 de noviembre de 2022 .
  137. Zhang, Yingyu; Dong, Chuntong; Guo, Weiqun; Dai, Jiabao; Zhao, Ziming (2022). "Modelo y proceso de accidentes basados ​​en la teoría de sistemas (STAMP): una revisión de la literatura" . Safety Science . 152 105596. doi : 10.1016/j.ssci.2021.105596 . S2CID 244550153. Archivado del original el 15 de marzo de 2023. Recuperado el 28 de noviembre de 2022 . 
  138. 1 2 Gazos, Alexandros; Kahn, James; Kusche, Isabel; Büscher, Christian; Götz, Markus (2025-04-01). "Organizando la IA para la seguridad: Identificando vulnerabilidades estructurales para guiar el diseño de sistemas sociotécnicos mejorados con IA" . Safety Science . 184 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN 0925-7535 . 
  139. Centro para la Seguridad y las Tecnologías Emergentes; Hoffman, Wyatt (2021). " IA y el futuro de la competencia cibernética" . Informe del CSET . doi : 10.51593/2020ca007 . S2CID 234245812. Archivado del original el 24/11/2022 . Consultado el 28/11/2022 . 
  140. Gafni, Ruti; Levy, Yair (1 de enero de 2024). "El papel de la inteligencia artificial (IA) en la mejora de la eficiencia de las tareas técnicas y de gestión de la ciberseguridad". Information & Computer Security . 32 (5): 711– 728. doi : 10.1108/ICS-04-2024-0102 . ISSN 2056-4961 . 
  141. Abroshan, Hossein (2025). "IA para proteger la IA: Un sistema modular para detectar ataques de envenenamiento por inversión de etiquetas". Results in Engineering . Elsevier. doi : 10.1016/j.rineng.2025.101513 (inactivo el 17 de julio de 2026).{{cite journal}}: CS1 maint: DOI inactivo desde julio de 2026 ( enlace )
  142. Abroshan, Hossein; Hashmi, Syed Waquas (2026). "Un marco de detección de puertas traseras en múltiples etapas (MSBD)" . IEEE Access . 14. IEEE: 17874–17884 . Bibcode : 2026IEEEA..1417874A . doi : 10.1109/ACCESS.2026.3659007 . ISSN 2169-3536 . 
  143. Centro para la Seguridad y las Tecnologías Emergentes; Imbrie, Andrew; Kania, Elsa (2019). "Seguridad, protección y estabilidad de la IA entre las grandes potencias: opciones, desafíos y lecciones aprendidas para un compromiso pragmático" . doi : 10.51593 /20190051 . S2CID 240957952. Archivado del original el 24 de noviembre de 2022. Consultado el 28 de noviembre de 2022 . {{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  144. 1 2 Future of Life Institute (27-03-2019). Estrategia, política y gobernanza de la IA (Allan Dafoe) . El evento tiene lugar a las 22:05. Archivado del original el 23-11-2022 . Recuperado el 23-11-2022 .
  145. Zou, Andy; Xiao, Tristan; Jia, Ryan; Kwon, Joe; Mazeika, Mantas; Li, Richard; Song, Dawn; Steinhardt, Jacob; Evans, Owain; Hendrycks, Dan (2022-10-09). "Pronóstico de eventos mundiales futuros con redes neuronales". NeurIPS . arXiv : 2206.15474 .
  146. Gathani, Sneha; Hulsebos, Madelon; Gale, James; Haas, Peter J.; Demiralp, Çağatay (2022-02-08). "Aumento de la toma de decisiones mediante análisis interactivo de escenarios hipotéticos". Conferencia sobre investigación en sistemas de datos innovadores . arXiv : 2109.06160 .
  147. Lindelauf, Roy (2021), "Disuasión nuclear en la era algorítmica: una revisión de la teoría de juegos", en Osinga , Frans; Sweijs, Tim (eds.), NL ARMS Netherlands Annual Review of Military Studies 2020 , La Haya: TMC Asser Press, pp. 421–436 , doi : 10.1007/978-94-6265-419-8_22 , ISBN  978-94-6265-418-1, S2CID 229449677 
  148. 1 2 Newkirk II, Vann R. (2016-04-21). "¿Es el cambio climático un dilema del prisionero o una cacería de ciervos?" . The Atlantic . Archivado del original el 24-11-2022 . Recuperado el 24-11-2022 .
  149. 1 2 Armstrong, Stuart; Bostrom, Nick; Shulman, Carl. Carreras hacia el precipicio: un modelo de desarrollo de inteligencia artificial (Informe). Instituto del Futuro de la Humanidad, Universidad de Oxford.
  150. 1 2 Dafoe, Allan. Gobernanza de la IA: una agenda de investigación (Informe). Centro para la Gobernanza de la IA, Instituto del Futuro de la Humanidad, Universidad de Oxford.
  151. Dafoe, Allan; Hughes, Edward; Bachrach, Yoram; Collins, Tantum; McKee, Kevin R.; Leibo, Joel Z.; Larson, Kate; Graepel, Thore (2020-12-15). "Problemas abiertos en IA cooperativa". NeurIPS . arXiv : 2012.08630 .
  152. 1 2 Dafoe, Allan; Bachrach, Yoram; Hadfield, Gillian; Horvitz, Eric; Larson, Kate; Graepel, Thore (2021). " IA cooperativa: las máquinas deben aprender a encontrar terreno común" . Nature . 593 (7857): 33– 36. Bibcode : 2021Natur.593...33D . doi : 10.1038/d41586-021-01170-0 . PMID 33947992. S2CID 233740521. Archivado del original el 22-11-2022 . Recuperado el 24-11-2022 .  
  153. Satariano, Adam; Specia, Megan (1 de noviembre de 2023). "Líderes mundiales advierten que la IA podría causar daños 'catastróficos'" . The New York Times . ISSN 0362-4331 . Consultado el 20 de abril de 2024 . 
  154. Turchin, Alexey; Dench, David; Green, Brian Patrick (2019). "Soluciones globales frente a soluciones locales para el problema de la seguridad de la IA" . Big Data and Cognitive Computing . 3 (16): 1– 25. doi : 10.3390/bdcc3010016 .
  155. Crafts, Nicholas (23 de septiembre de 2021). «La inteligencia artificial como tecnología de propósito general: una perspectiva histórica» . Oxford Review of Economic Policy . 37 (3): 521– 536. doi : 10.1093/oxrep/grab012 . ISSN 0266-903X . Archivado del original el 24 de noviembre de 2022. Consultado el 28 de noviembre de 2022 . 
  156. 葉俶禎; 黃子君; 張媁雯; 賴志樫 (1 de diciembre de 2020). "Desplazamiento laboral en la era de la inteligencia artificial: una revisión sistemática de la literatura".臺灣東亞文明研究學刊. 17 (2). doi : 10.6163/TJEAS.202012_17(2).0002 . ISSN 1812-6243 . 
  157. Johnson, James (2019-04-03). " Inteligencia artificial y guerra futura: implicaciones para la seguridad internacional" . Defense & Security Analysis . 35 (2): 147– 169. doi : 10.1080/14751798.2019.1600800 . ISSN 1475-1798 . S2CID 159321626. Archivado del original el 24-11-2022 . Recuperado el 28-11-2022 .  
  158. Kertysova, Katarina (12 de diciembre de 2018). "Inteligencia artificial y desinformación: cómo la IA cambia la forma en que se produce, difunde y puede contrarrestar la desinformación" . Seguridad y derechos humanos . 29 ( 1–4 ): 55–81 . doi : 10.1163/18750230-02901005 . ISSN 1874-7337 . S2CID 216896677 .  
  159. Feldstein, Steven (2019). La expansión global de la vigilancia mediante IA . Carnegie Endowment for International Peace.
  160. Agrawal, Ajay; Gans, Joshua; Goldfarb, Avi (2019). La economía de la inteligencia artificial: una agenda . Chicago, Illinois. ISBN 978-0-226-61347-5OCLC 1099435014 .​ {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  161. Whittlestone, Jess; Clark, Jack (31 de agosto de 2021). "Por qué y cómo los gobiernos deberían supervisar el desarrollo de la IA". arXiv : 2108.12427 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  162. 1 2 Shevlane, Toby (2022). "Compartiendo modelos de IA potentes | Blog de GovAI" . Centro para la Gobernanza de la IA . Archivado del original el 24 de noviembre de 2022. Recuperado el 24 de noviembre de 2022 .
  163. Askell, Amanda; Brundage, Miles; Hadfield, Gillian (10 de julio de 2019). "El papel de la cooperación en el desarrollo responsable de la IA". arXiv : 1907.04534 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  164. Gursoy, Furkan; Kakadiaris, Ioannis A. (31 de agosto de 2022), Tarjetas de sistema para la toma de decisiones basada en IA para políticas públicas , arXiv : 2203.04754
  165. Cobbe, Jennifer; Lee, Michelle Seng Ah; Singh, Jatinder (1 de marzo de 2021). «Toma de decisiones automatizada revisable: un marco para sistemas algorítmicos responsables». Actas de la Conferencia ACM de 2021 sobre equidad, responsabilidad y transparencia . FAccT '21. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 598–609 . doi : 10.1145/3442188.3445921 . ISBN  978-1-4503-8309-7.
  166. Raji, Inioluwa Deborah; Smart, Andrew; White, Rebecca N.; Mitchell, Margaret; Gebru, Timnit; Hutchinson, Ben; Smith-Loud, Jamila; Theron, Daniel; Barnes, Parker (27 de enero de 2020). «Cerrando la brecha de responsabilidad de la IA: Definición de un marco integral para la auditoría algorítmica interna». Actas de la Conferencia de 2020 sobre Equidad, Responsabilidad y Transparencia . FAT* '20. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 33–44 . doi : 10.1145/3351095.3372873 . ISBN  978-1-4503-6936-7.
  167. Manheim, David; Martin, Sammy; Bailey, Mark; Samin, Mikhail; Greutzmacher, Ross (2025). "La necesidad de juntas de estándares de auditoría de IA" . AI & Society . 40 (8): 6609– 6624. arXiv : 2404.13060 . doi : 10.1007/s00146-025-02320-y .
  168. Novelli, Claudio; Taddeo, Mariarosaria; Floridi, Luciano (2024). "Rendición de cuentas en inteligencia artificial: qué es y cómo funciona" . AI & Society . 39 (4): 1871– 1882. doi : 10.1007/s00146-023-01635-y . hdl : 11585/914099 .
  169. Manheim, David (26 de junio de 2023). "Construyendo una cultura de seguridad para la IA: perspectivas y desafíos". SSRN 4491421 . 
  170. "NeMo Guardrails" . NVIDIA NeMo Guardrails . Consultado el 8 de diciembre de 2024 .
  171. "Llama Guard: Protección de entrada-salida basada en LLM para conversaciones entre humanos e IA" . Meta AI . Consultado el 8 de diciembre de 2024 .
  172. Šekrst, Kristina; McHugh, Jeremy; Cefalu, Jonathan Rodriguez (2024). "Ética de la IA por diseño: Implementación de salvaguardias personalizables para un desarrollo responsable de la IA". arXiv : 2411.14442 [ cs.CY ].
  173. ^ Dong, Yi; Mu, Ronghui; Jin, Gaojie; Qi, Yi; Hu, Jinwei; Zhao, Xingyu; Meng, Jie; Ruan, Wenjie; Huang, Xiaowei (2024). "Construcción de barreras de seguridad para modelos de lenguajes grandes". arXiv : 2402.01822 [ cs ].
  174. D'Alessandro, W. (2024). "Deontología e inteligencia artificial segura" . Estudios filosóficos . 182 (7): 1681– 1704. doi : 10.1007/s11098-024-02174-y .
  175. D'Alessandro, William; Kirk-Giannini, Cameron D. (2025). "Inteligencia artificial: enfoques para la seguridad" . Philosophy Compass . 20 (5) e70039. doi : 10.1111/phc3.70039 .
  176. Ziegler, Bart (8 de abril de 2022). "¿Es hora de regular la IA?" . Wall Street Journal . Archivado del original el 24 de noviembre de 2022. Consultado el 24 de noviembre de 2022 .
  177. Reed, Chris (13 de septiembre de 2018). "¿Cómo deberíamos regular la inteligencia artificial?" . Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 376 (2128) 20170360. Bibcode : 2018RSPTA.37670360R . doi : 10.1098 / rsta.2017.0360 . ISSN 1364-503X . PMC 6107539. PMID 30082306 .   
  178. Belton, Keith B. (2019-03-07). "¿Cómo debería regularse la IA?" . IndustryWeek . Archivado del original el 29-01-2022 . Recuperado el 24-11-2022 .
  179. Comisión Nacional de Seguridad sobre Inteligencia Artificial (2021), Informe Final
  180. Instituto Nacional de Estándares y Tecnología (12 de julio de 2021). "Marco de gestión de riesgos de IA" . NIST . Archivado del original el 24 de noviembre de 2022. Consultado el 24 de noviembre de 2022 .
  181. Richardson, Tim (2021). "Gran Bretaña publica una estrategia nacional de inteligencia artificial de 10 años" . Archivado del original el 10 de febrero de 2023. Consultado el 24 de noviembre de 2022 .
  182. 1 2 "Guía: Estrategia Nacional de IA" . GOV.UK. 2021. Archivado del original el 10 de febrero de 2023. Consultado el 24 de noviembre de 2022 .
  183. Hardcastle, Kimberley (23 de agosto de 2023). "Estamos hablando mucho de IA ahora mismo, y ya era hora" . The Conversation . Consultado el 31 de octubre de 2023 .
  184. "El emblemático Bletchley Park acogerá la Cumbre de Seguridad de la IA del Reino Unido a principios de noviembre" . GOV.UK. Consultado el 31 de octubre de 2023 .
  185. Colville, Alex (30 de julio de 2025). "Cómo ve China la seguridad de la IA" . China Media Project . Recuperado el 9 de agosto de 2025 .
  186. Oficina del Director de Inteligencia Nacional, Actividad de Proyectos de Investigación Avanzada de Inteligencia. "IARPA – TrojAI" . Archivado del original el 24/11/2022 . Recuperado el 24/11/2022 .
  187. Turek, Matt. "Inteligencia artificial explicable" . Archivado del original el 19 de febrero de 2021. Consultado el 24 de noviembre de 2022 .
  188. Draper, Bruce. "Garantizando la robustez de la IA frente al engaño" . Agencia de Proyectos de Investigación Avanzada de Defensa . Archivado del original el 9 de enero de 2023. Consultado el 24 de noviembre de 2022 .
  189. Fundación Nacional de Ciencias (23 de febrero de 2023). "Sistemas seguros para el aprendizaje" . Archivado del original el 26 de febrero de 2023. Consultado el 27 de febrero de 2023 .
  190. «La Asamblea General aprueba una resolución histórica sobre inteligencia artificial» . Noticias de la ONU . 21 de marzo de 2024. Archivado del original el 20 de abril de 2024. Consultado el 21 de abril de 2024 .
  191. Say, Mark (23 de mayo de 2024). "DSIT anuncia financiación para la investigación sobre la seguridad de la IA" . Archivado del original el 24 de mayo de 2024. Recuperado el 11 de junio de 2024 .
  192. Renshaw, Jarrett; Hunnicutt, Trevor (16 de noviembre de 2024). "Biden y Xi coinciden en que los humanos, no la IA, deberían controlar las armas nucleares" . Reuters . Consultado el 11 de febrero de 2026 .
  193. Khalid, Asma (16 de noviembre de 2024). "Biden y Xi dan un primer paso para limitar la IA y las decisiones nucleares en su última reunión" . NPR . Consultado el 11 de febrero de 2026 .
  194. "Ley de Autorización de Defensa Nacional para el Año Fiscal 2025, Sección 1638 ("Opinión del Congreso sobre el uso de inteligencia artificial para apoyar la disuasión estratégica")" . Observatorio de Tecnologías Emergentes . Centro de Seguridad y Tecnologías Emergentes de la Universidad de Georgetown . Consultado el 27 de febrero de 2026 .
  195. "HR5009 - Ley de Autorización para la Mejora de la Calidad de Vida de los Miembros del Servicio Militar y la Defensa Nacional para el Año Fiscal 2025" . Congress.gov . Congreso de los Estados Unidos. 23 de diciembre de 2024. Consultado el 27 de febrero de 2026 .
  196. "El hipotético ataque nuclear que intensificó el enfrentamiento del Pentágono con Anthropic" . The Washington Post . Consultado el 27 de febrero de 2026 .
  197. "La Asamblea General de la ONU abre con un llamamiento urgente a favor de salvaguardias vinculantes para la IA" . NBC News . 22 de septiembre de 2025. Consultado el 5 de abril de 2026 .
  198. "Garantizar un marco político nacional para la inteligencia artificial" . La Casa Blanca . 11 de diciembre de 2025. Consultado el 27 de febrero de 2026 .
  199. Johnson, Khari (12 de diciembre de 2025). "La nueva orden de Trump contra la regulación de la IA afecta especialmente a California" . CalMatters . Consultado el 27 de febrero de 2026 .
  200. Lennett, Justin Hendrix, Ben (25 de enero de 2026). "Cronología de las acciones y declaraciones de la Casa Blanca de Trump sobre inteligencia artificial" . Tech Policy Press . Recuperado el 27 de febrero de 2026 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  201. "Eliminar las barreras al liderazgo estadounidense en inteligencia artificial" . Registro Federal . 31 de enero de 2025. Consultado el 27 de febrero de 2026 .
  202. "La orden de Trump sobre IA es más palabrería que acción | Centro Brennan para la Justicia" . www.brennancenter.org . 25 de febrero de 2026. Consultado el 27 de febrero de 2026 .
  203. Mäntymäki, Matti; Minkkinen, Matti; Birkstedt, Teemu; Viljanen, Mika (2022). "Definición de la gobernanza organizacional de la IA" . IA y ética . 2 (4): 603– 609. doi : 10.1007/s43681-022-00143-x . ISSN 2730-5953 . S2CID 247119668 .  
  204. 1 2 3 Brundage, Miles; Avin, Shahar; Wang, Jasmine; Belfield, Haydn; Krueger, Gretchen; Hadfield, Gillian; Khlaaf, Heidy; Yang, Jingying; Toner, Helen; Fong, Ruth; Maharaj, Tegan; Koh, Pang Wei; Hooker, Sara; Leung, Jade; Trask, Andrew (2020-04-20). "Hacia un desarrollo de IA confiable: mecanismos para respaldar afirmaciones verificables". arXiv : 2004.07213 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  205. "Bienvenido a la base de datos de incidentes de inteligencia artificial" . Archivado del original el 24/11/2022 . Consultado el 24/11/2022 .
  206. Wiblin, Robert; Harris, Keiran (2022). "Nova DasSarma sobre por qué la seguridad de la información puede ser fundamental para el desarrollo seguro de sistemas de IA" . 80,000 Hours . Archivado del original el 24/11/2022 . Recuperado el 24/11/2022 .
  207. OpenAI (2022-06-02). "Mejores prácticas para la implementación de modelos de lenguaje" . OpenAI . Archivado del original el 15-03-2023 . Consultado el 24-11-2022 .
  208. OpenAI. "OpenAI Charter" . OpenAI . Archivado del original el 4 de marzo de 2021. Consultado el 24 de noviembre de 2022 .
  209. Future of Life Institute (2016). "Carta abierta sobre armas autónomas: investigadores de IA y robótica" . Future of Life Institute . Consultado el 24 de noviembre de 2022 .
  210. Gold, Ashley (27 de febrero de 2026). "Los actores clave de la red de influencia de la IA" . Axios . Consultado el 5 de marzo de 2026 .
  211. Chow, Andrew R. (19 de febrero de 2026). "El pueblo contra la IA" . TIME . Consultado el 5 de marzo de 2026 .
  212. Nolan, Beatrice. "OpenAI refuta la acusación del organismo de control de que violó la nueva ley de IA de California con la publicación de GPT-5.3-Codex" . Fortune . Consultado el 5 de marzo de 2026 .
  213. Wilkins, Emily (12 de febrero de 2026). "Anthropic dona 20 millones de dólares a un grupo que impulsa la regulación de la IA antes de las elecciones de 2026" . CNBC . Consultado el 5 de marzo de 2026 .
  214. "Los multimillonarios de Silicon Valley invierten grandes sumas de dinero para dictar las reglas de la IA en Estados Unidos" . Financial Times . 26 de febrero de 2026.
  215. Schleifer, Theodore; Tan, Eli (26 de agosto de 2025). "Silicon Valley promete 200 millones de dólares a nuevos super PACs pro-IA" . The New York Times . ISSN 0362-4331 . Consultado el 5 de marzo de 2026 . 
  216. "GGE sobre sistemas de armas autónomas letales" . Observatorio de Vigilancia Digital . 27 de noviembre de 2025. Consultado el 26 de abril de 2026 .
  217. "Declaraciones en la primera sesión de GGE LAWS de 2025" . APILS . 9 de marzo de 2025. Consultado el 26 de abril de 2026 .
  • Problemas sin resolver en la seguridad del aprendizaje automático
  • Sobre las oportunidades y los riesgos de los modelos de fundación
  • Panorama general de los riesgos catastróficos de la IA
  • Accidentes de IA: una amenaza emergente
  • Diseñando un mundo más seguro