Articulo de referencia

alineación de IA

En el campo de la inteligencia artificial (IA), la alineación busca orientar los sistemas de IA hacia los objetivos, preferencias o principios éticos previstos por una persona o...

En el campo de la inteligencia artificial (IA), la alineación busca orientar los sistemas de IA hacia los objetivos, preferencias o principios éticos previstos por una persona o grupo. Un sistema de IA se considera alineado si promueve los objetivos previstos. Un sistema de IA desalineado persigue objetivos no previstos. [ 1 ]

A menudo, a los diseñadores de IA les resulta difícil especificar toda la gama de comportamientos deseados y no deseados. Por lo tanto, suelen utilizar objetivos indirectos más simples , como obtener la aprobación humana . Sin embargo, estos objetivos indirectos pueden pasar por alto restricciones necesarias o recompensar al sistema de IA simplemente por aparentar estar alineado. [ 1 ] [ 2 ] Los sistemas de IA también pueden encontrar resquicios que les permiten lograr sus objetivos indirectos de manera eficiente, pero de formas no intencionadas y, a veces, perjudiciales ( manipulación de recompensas ). [ 1 ] [ 3 ]

Los sistemas avanzados de IA pueden desarrollar estrategias instrumentales no deseadas , como la búsqueda de poder o la autopreservación, porque dichas estrategias les ayudan a alcanzar sus objetivos finales asignados. [ 1 ] [ 4 ] [ 5 ] Además, podrían desarrollar comportamientos emergentes indeseables que podrían ser difíciles de detectar antes de que el sistema se implemente y se encuentre con nuevas situaciones y distribuciones de datos . [ 6 ] [ 7 ] Una investigación empírica de 2024 encontró que los modelos de lenguaje grandes avanzados (LLM), como OpenAI o1 o Claude 3, a veces recurren al engaño estratégico para lograr sus objetivos o evitar que se modifiquen. [ 8 ] [ 9 ]

Algunos de estos problemas afectan a sistemas comerciales existentes como LLM, [ 10 ] [ 11 ] [ 12 ] robots , [ 13 ] vehículos autónomos , [ 14 ] y motores de recomendación de redes sociales . [ 10 ] [ 5 ] [ 15 ] Algunos investigadores de IA argumentan que los sistemas futuros más capaces se verán más gravemente afectados porque estos problemas resultan parcialmente de las altas capacidades. [ 16 ] [ 3 ] [ 2 ]

Muchos investigadores y líderes de empresas de IA de renombre han argumentado o afirmado que la IA se está acercando a capacidades cognitivas similares a las humanas ( AGI ) y sobrehumanas ( ASI ), y que podría poner en peligro la civilización humana si no se alinea correctamente. [ 17 ] [ 5 ] Entre ellos se encuentran los "padrinos de la IA" Geoffrey Hinton y Yoshua Bengio , y los directores ejecutivos de OpenAI , Anthropic y Google DeepMind . [ 18 ] [ 19 ] [ 20 ] Estos riesgos siguen siendo objeto de debate. [ 21 ]

La alineación de la IA es un subcampo de la seguridad de la IA , el estudio de cómo construir sistemas de IA seguros. [ 22 ] [ 23 ] Otros subcampos de la seguridad de la IA incluyen robustez, monitoreo y control de capacidad . [ 24 ] Los desafíos de la investigación en alineación incluyen inculcar valores complejos en la IA, desarrollar una IA honesta, supervisión escalable, auditar e interpretar modelos de IA y prevenir comportamientos emergentes de la IA como la búsqueda de poder. [ 24 ] La investigación de alineación tiene conexiones con la investigación de interpretabilidad , [ 25 ] [ 26 ] robustez ( adversaria ), [ 27 ] detección de anomalías , incertidumbre calibrada , [ 25 ] verificación formal , [ 28 ] aprendizaje de preferencias , [ 29 ] [ 30 ] [ 31 ] ingeniería crítica de seguridad , [ 32 ] teoría de juegos , [ 33 ] equidad algorítmica , [ 27 ] [ 34 ] y ciencias sociales . [ 35 ] [ 36 ]

Objetivos en IA

Los programadores proporcionan a un sistema de IA como AlphaZero una "función objetivo", [ a ] en la que pretenden encapsular el/los objetivo(s) que la IA está configurada para lograr. Dicho sistema luego llena un "modelo" interno (posiblemente implícito) de su entorno. Este modelo encapsula todas las creencias del agente sobre el mundo. La IA luego crea y ejecuta cualquier plan que se calcule para maximizar [ b ] el valor [ c ] de su función objetivo. [ 37 ] Por ejemplo, cuando AlphaZero se entrena en ajedrez, tiene una función objetivo simple de "+1 si AlphaZero gana, −1 si AlphaZero pierde". Durante el juego, AlphaZero intenta ejecutar cualquier secuencia de movimientos que juzgue más probable para alcanzar el valor máximo de +1. [ 38 ] De manera similar, un sistema de aprendizaje por refuerzo puede tener una "función de recompensa" que permite a los programadores moldear el comportamiento deseado de la IA. [ 39 ] El comportamiento de un algoritmo evolutivo está moldeado por una " función de aptitud ". [ 40 ]

Problema de alineación

En 1960, el pionero de la IA, Norbert Wiener, describió el problema de alineación de la IA de la siguiente manera:

Si utilizamos, para lograr nuestros propósitos, un medio mecánico con cuyo funcionamiento no podemos interferir eficazmente [...] más vale que estemos completamente seguros de que el propósito puesto en la máquina es el propósito que realmente deseamos. [ 41 ] [ 5 ]

La alineación de la IA se refiere a asegurar que los objetivos de un sistema de IA coincidan con un objetivo. Este objetivo se define de diversas maneras: como las metas de los diseñadores o usuarios del sistema, valores ampliamente compartidos, estándares éticos objetivos, requisitos legales o las intenciones que tendrían sus diseñadores si estuvieran mejor informados y tuvieran una visión más amplia. [ 42 ] En la alineación democrática de la IA, el objetivo son los valores y preferencias de los votantes medianos , lo que aumenta la legitimidad política . [ 43 ] [ 44 ]

La alineación de la IA es un problema abierto para los sistemas de IA modernos [ 45 ] [ 46 ] y es un campo de investigación dentro de la IA. [ 47 ] [ 1 ] Alinear la IA implica dos desafíos principales: especificar cuidadosamente el propósito del sistema (alineación externa) y asegurar que el sistema adopte la especificación de manera robusta (alineación interna). [ 2 ] Los investigadores también intentan crear modelos de IA que tengan una alineación robusta , que se adhieran a las restricciones de seguridad incluso cuando los usuarios intentan eludirlas de manera maliciosa .

Especificaciones de juegos y efectos secundarios

Para especificar el propósito de un sistema de IA, los diseñadores de IA suelen proporcionar una función objetivo , ejemplos o retroalimentación al sistema. Pero a menudo los diseñadores no pueden especificar completamente todos los valores y restricciones importantes, por lo que recurren a objetivos indirectos fáciles de especificar, como maximizar la aprobación de los supervisores humanos, que son falibles. [ 27 ] [ 24 ] [ 48 ] [ 49 ] [ 50 ] Como resultado, los sistemas de IA pueden encontrar lagunas que les ayudan a lograr el objetivo especificado de manera eficiente, pero de formas no deseadas y posiblemente dañinas. Esta tendencia se conoce como juego de especificaciones o hackeo de recompensas , y es un ejemplo de la ley de Goodhart . [ 50 ] [ 3 ] A medida que los sistemas de IA se vuelven más capaces, a menudo pueden jugar sus especificaciones de manera más efectiva. [ 3 ]

Se entrenó un sistema de IA utilizando retroalimentación humana para agarrar una pelota, pero en su lugar aprendió a colocar su mano entre la pelota y la cámara, lo que hizo que pareciera falsamente exitoso. [ 51 ] Algunas investigaciones sobre alineación buscan evitar soluciones que sean falsas pero convincentes.

Se ha observado manipulación de especificaciones en numerosos sistemas de IA. [ 50 ] [ 52 ] Se ha descubierto que los modelos GPT de OpenAI para programación —incluso en casos del mundo real— planean explícitamente hackear las pruebas utilizadas para evaluarlos para que parezcan falsamente exitosos (por ejemplo, declarando explícitamente "hackeemos"). Cuando la empresa penalizó esto, muchos modelos aprendieron a ofuscar sus planes mientras continuaban hackeando las pruebas. [ 53 ] Otro sistema fue entrenado para terminar una carrera de botes simulada recompensándolo por golpear objetivos a lo largo de la pista, pero el sistema obtuvo más recompensa al entrar en bucle y chocar contra los mismos objetivos indefinidamente. [ 54 ] Un estudio de Palisade Research de 2025 descubrió que cuando se les encomendó ganar al ajedrez contra un oponente más fuerte, algunos LLM de razonamiento intentaron hackear el sistema de juego, por ejemplo, modificando o eliminando por completo a su oponente. [ 55 ] Algunos investigadores de alineación tienen como objetivo ayudar a los humanos a detectar la manipulación de especificaciones y dirigir los sistemas de IA hacia objetivos cuidadosamente especificados que sean seguros y útiles de perseguir.

Cuando se implementa un sistema de IA desalineado , puede tener consecuencias negativas. Se sabe que las plataformas de redes sociales optimizan sus algoritmos de recomendación para aumentar las tasas de clics , lo que provoca adicción en los usuarios a escala global. [ 48 ] Investigadores de Stanford afirman que estos sistemas de recomendación no se ajustan a las necesidades de sus usuarios porque "optimizan métricas de interacción simples en lugar de una combinación más difícil de medir del bienestar social y del consumidor". [ 10 ]

Explicando tales efectos secundarios, el científico informático de Berkeley, Stuart J. Russell, afirmó que la omisión de restricciones implícitas puede ser perjudicial: «Un sistema [...] a menudo asignará [...] valores extremos a variables sin restricciones; si una de esas variables sin restricciones es realmente algo que nos importa, la solución encontrada puede ser muy indeseable. Esto es esencialmente la vieja historia del genio de la lámpara, o del aprendiz de brujo , o del rey Midas : obtienes exactamente lo que pides, no lo que quieres». [ 56 ]

Algunos investigadores sugieren que los diseñadores de IA especifiquen sus objetivos deseados enumerando acciones prohibidas o formalizando reglas éticas (como en las Tres Leyes de la Robótica de Asimov ). [ 57 ] Pero Russell y Norvig argumentan que este enfoque pasa por alto la complejidad de los valores humanos: [ 5 ] "Es ciertamente muy difícil, y quizás imposible, para los simples humanos anticipar y descartar de antemano todas las formas desastrosas que la máquina podría elegir para lograr un objetivo específico". [ 5 ]

Además, incluso si un sistema de IA comprende completamente las intenciones humanas, aún puede ignorarlas, porque seguir las intenciones humanas puede no ser su objetivo (a menos que ya esté completamente alineado). [ 1 ] [ 58 ]

Presión para desplegar sistemas inseguros

Las organizaciones comerciales a veces tienen incentivos para tomar atajos en materia de seguridad y para implementar sistemas de IA desalineados o inseguros. [ 48 ] Por ejemplo, los sistemas de recomendación de redes sociales han sido rentables a pesar de crear adicción no deseada y polarización . [ 10 ] [ 59 ] [ 60 ] La presión competitiva también puede conducir a una carrera hacia el abismo en los estándares de seguridad de la IA. Por ejemplo, OpenAI fue demandada por lanzar una versión de ChatGPT que incitaba al suicidio a algunos usuarios inestables, un comportamiento que la empresa había pasado por alto en medio de un lanzamiento apresurado del producto. [ 61 ] [ 62 ] De manera similar, en 2018, un automóvil autónomo mató a una peatona ( Elaine Herzberg ) después de que los ingenieros desactivaran el sistema de frenado de emergencia porque era demasiado sensible y ralentizaba el desarrollo. [ 63 ]

Riesgos de la IA avanzada desalineada

Algunos investigadores están interesados ​​en alinear sistemas de IA cada vez más avanzados, dado el rápido progreso en el desarrollo de la IA y el esfuerzo de la industria y los gobiernos por crear sistemas de IA de vanguardia. A medida que las capacidades de los sistemas de IA se expanden rápidamente, su alineación podría abrir numerosas oportunidades, pero, en consecuencia, podría complicar aún más la tarea de alineación debido a su mayor complejidad, lo que podría generar riesgos a gran escala. [ 5 ]

Desarrollo de IA avanzada

Muchas empresas de IA, como OpenAI , [ 64 ] Meta [ 65 ] y DeepMind , [ 66 ] han declarado su objetivo de desarrollar inteligencia artificial general (IAG), un sistema de IA hipotético que iguala o supera a los humanos en la mayoría o en la totalidad del trabajo cognitivo. Los investigadores que escalan las redes neuronales modernas observan que, de hecho, desarrollan capacidades cada vez más generales e imprevistas. [ 10 ] [ 67 ] [ 68 ] Dichos modelos han aprendido a operar una computadora o a escribir sus propios programas; una sola red "generalista" puede chatear, controlar robots, jugar y interpretar fotografías. [ 69 ] Según encuestas, algunos investigadores líderes en aprendizaje automático esperan que la IAG se cree en esta década., mientras que algunos creen que llevará mucho más tiempo. Muchos consideran posibles ambos escenarios. [ 20 ] [ 70 ] [ 71 ]

En 2023, líderes en investigación y tecnología de IA firmaron una carta abierta en la que solicitaban una pausa en las mayores series de entrenamiento de IA. La carta afirmaba: «Los sistemas de IA potentes solo deben desarrollarse cuando estemos seguros de que sus efectos serán positivos y sus riesgos serán manejables». [ 72 ]

Buscador de poder

ActualLos sistemas aún tienen una capacidad limitada de planificación a largo plazo y conciencia situacional , [ 10 ] pero se están realizando grandes esfuerzos para cambiar esto. [ 73 ] [ 74 ] Se espera que los sistemas futuros (no necesariamente AGI) con estas capacidades desarrollen estrategias no deseadas de búsqueda de poder . Los futuros agentes de IA avanzados podrían, por ejemplo, buscar adquirir dinero y poder computacional, proliferar o evitar ser apagados (por ejemplo, ejecutando copias adicionales del sistema en otras computadoras). Aunque la búsqueda de poder no está programada explícitamente, puede surgir porque los agentes que tienen más poder son más capaces de lograr sus objetivos. [ 10 ] [ 4 ] Esta tendencia, conocida como convergencia instrumental , ya ha surgido en varios agentes de aprendizaje por refuerzo , incluidos los modelos de lenguaje. [ 75 ] [ 76 ] Otras investigaciones han demostrado matemáticamente que los algoritmos óptimos de aprendizaje por refuerzo buscarían poder en una amplia gama de entornos. [ 77 ] [ 78 ] Como resultado, su implementación podría ser irreversible. Por estas razones, los investigadores argumentan que los problemas de seguridad y alineación de la IA deben resolverse antes de que se cree por primera vez una IA avanzada orientada a la búsqueda de poder. [ 4 ] [ 79 ] [ 5 ]

Los futuros sistemas de IA orientados a la búsqueda de poder podrían implementarse de forma voluntaria o accidental. A medida que los líderes políticos y las empresas perciben la ventaja estratégica de contar con los sistemas de IA más competitivos y potentes, podrían optar por implementarlos. [ 4 ] Además, dado que los diseñadores de IA detectan y penalizan el comportamiento orientado a la búsqueda de poder, sus sistemas tienen un incentivo para manipular esta especificación buscando poder de maneras que no son penalizadas o evitando la búsqueda de poder antes de su implementación. [ 4 ]

Riesgo existencial (riesgo x)

Según algunos investigadores, los humanos deben su dominio sobre otras especies a sus mayores capacidades cognitivas. Por consiguiente, argumentan que uno o varios sistemas de IA mal diseñados podrían debilitar a la humanidad o incluso provocar su extinción si superan a los humanos en la mayoría de las tareas cognitivas. [ 1 ] [ 5 ]

En 2023, investigadores líderes mundiales en IA, otros académicos y directores ejecutivos de empresas tecnológicas de IA firmaron la declaración que afirma que "mitigar el riesgo de extinción por la IA debería ser una prioridad global junto con otros riesgos a escala social como las pandemias y la guerra nuclear". [ 19 ] [ 80 ] Entre los científicos informáticos notables que han señalado los riesgos de una IA avanzada futura que esté desalineada se incluyen Geoffrey Hinton , [ 17 ] Alan Turing , [ d ] Ilya Sutskever , [ 83 ] Yoshua Bengio , [ 19 ] Judea Pearl , [ e ] Murray Shanahan , [ 84 ] Norbert Wiener , [ 41 ] [ 5 ] Marvin Minsky , [ f ] Francesca Rossi , [ 85 ] Scott Aaronson , [ 86 ] Bart Selman , [ 87 ] David McAllester , [ 88 ] Marcus Hutter , [ 89 ] Shane Legg , [ 90 ] Eric Horvitz , [ 91 ] y Stuart J. Russell. [ 5 ] Investigadores escépticos como François Chollet , [ 92 ] Gary Marcus , [ 93 ] Yann LeCun , [ 94 ] y Oren Etzioni [ 95 ] han argumentado que la IAG está muy lejos, que no buscaría el poder (o podría intentarlo pero fracasar), o que no será difícil alinearla.

Otros investigadores argumentan que será especialmente difícil alinear los sistemas de IA avanzados del futuro. Los sistemas más capaces pueden manipular mejor sus especificaciones encontrando lagunas, [ 3 ] engañar estratégicamente a sus diseñadores, así como proteger e incrementar su poder [ 77 ] [ 4 ] e inteligencia. Además, podrían tener efectos secundarios más graves. También es probable que sean más complejos y autónomos, lo que dificulta su interpretación y supervisión, y por lo tanto, su alineación. [ 5 ] [ 79 ]

Problemas y enfoques de la investigación

Aprender valores y preferencias humanas

Alinear los sistemas de IA para que actúen de acuerdo con los valores, objetivos y preferencias humanas es un desafío: estos valores son enseñados por humanos que cometen errores, albergan sesgos y tienen valores complejos y en evolución que son difíciles de especificar completamente. [ 42 ] Debido a que los sistemas de IA a menudo aprenden a aprovechar pequeñas imperfecciones en el objetivo especificado, [ 27 ] [ 50 ] [ 96 ] los investigadores buscan especificar el comportamiento previsto de la manera más completa posible utilizando conjuntos de datos que representan valores humanos, aprendizaje por imitación o aprendizaje de preferencias. [ 6 ] : Capítulo 7 Un problema abierto central es la supervisión escalable , la dificultad de supervisar un sistema de IA que puede superar o engañar a los humanos en un dominio dado. [ 27 ]

Debido a que es difícil para los diseñadores de IA especificar explícitamente una función objetivo, a menudo entrenan sistemas de IA para imitar ejemplos humanos y demostraciones del comportamiento deseado. El aprendizaje por refuerzo inverso (IRL) extiende esto al inferir el objetivo del humano a partir de sus demostraciones. [ 6 ] : 88 [ 97 ] El IRL cooperativo (CIRL) supone que un humano y un agente de IA pueden trabajar juntos para enseñar y maximizar la función de recompensa del humano. [ 5 ] [ 98 ] En CIRL, los agentes de IA no están seguros de la función de recompensa y aprenden sobre ella consultando a los humanos. Esta humildad simulada podría ayudar a mitigar las tendencias de manipulación de especificaciones y búsqueda de poder (véase §  Estrategias instrumentales y de búsqueda de poder ). [ 99 ] Pero los enfoques de IRL suponen que los humanos demuestran un comportamiento casi óptimo, lo cual no es cierto para tareas difíciles. [ 100 ] [ 89 ]

Otros investigadores exploran cómo enseñar a los modelos de IA comportamiento complejo a través del aprendizaje de preferencias , en el que los humanos proporcionan retroalimentación sobre qué comportamiento prefieren. [ 29 ] [ 31 ] Para minimizar la necesidad de retroalimentación humana, se entrena un modelo auxiliar para recompensar al modelo principal en situaciones novedosas por comportamiento que los humanos recompensarían. Investigadores de OpenAI utilizaron este enfoque para entrenar chatbots como ChatGPT e InstructGPT , que producen texto más convincente que los modelos entrenados para imitar a los humanos. [ 11 ] El aprendizaje de preferencias también ha sido una herramienta influyente para los sistemas de recomendación y la búsqueda web, [ 101 ] pero un problema abierto es el juego de proxy : el modelo auxiliar puede no representar la retroalimentación humana a la perfección, y el modelo principal puede explotar esta discrepancia entre su comportamiento previsto y la retroalimentación del modelo auxiliar para obtener más recompensa. [ 27 ] [ 102 ] Los sistemas de IA también pueden obtener recompensas al ocultar información desfavorable, engañar a los recompensadores humanos o complacer sus puntos de vista independientemente de la verdad, creando cámaras de eco [ 76 ] (ver §  Supervisión escalable ).

Los modelos de lenguaje a gran escala (LLM, por sus siglas en inglés), como GPT-3, permitieron a los investigadores estudiar el aprendizaje de valores en una clase de sistemas de IA más general y capaz que la disponible anteriormente. Los enfoques de aprendizaje de preferencias, diseñados originalmente para agentes de aprendizaje por refuerzo, se han extendido para mejorar la calidad del texto generado y reducir las salidas dañinas de estos modelos. OpenAI y DeepMind utilizan este enfoque para mejorar la seguridad de los sistemas de última generación.LLM. [ 11 ] [ 31 ] [ 103 ] La empresa de investigación y seguridad de IA Anthropic propuso utilizar el aprendizaje de preferencias para ajustar los modelos para que sean útiles, honestos e inofensivos. [ 104 ] Otras vías para alinear los modelos de lenguaje incluyen conjuntos de datos orientados a valores [ 105 ] [ 48 ] y el red teaming . [ 106 ] En el red teaming, otro sistema de IA o un humano intenta encontrar entradas que provoquen que el modelo se comporte de forma insegura. Dado que el comportamiento inseguro puede ser inaceptable incluso cuando es raro, un desafío importante es reducir la tasa de salidas inseguras a niveles extremadamente bajos. [ 31 ]

La ética de las máquinas complementa el aprendizaje de preferencias al inculcar directamente en los sistemas de IA valores morales como el bienestar, la igualdad y la imparcialidad, así como no tener la intención de causar daño, evitar las falsedades y honrar las promesas. [ 107 ] [ g ] Mientras que otros enfoques intentan enseñar a los sistemas de IA las preferencias humanas para una tarea específica, la ética de las máquinas tiene como objetivo inculcar valores morales amplios que se aplican en muchas situaciones. Una pregunta en la ética de las máquinas es qué debe lograr la alineación: si los sistemas de IA deben seguir las instrucciones literales de los programadores, las intenciones implícitas, las preferencias reveladas , las preferencias que los programadores tendrían si estuvieran más informados o fueran racionales, o los estándares morales objetivos . [ 42 ] Otros desafíos incluyen medir y agregar las preferencias de diferentes personas, [ 110 ] la alineación dinámica con los valores humanos cambiantes [ 42 ] [ 111 ] y evitar el bloqueo de valores : la preservación indefinida de los valores de los primeros sistemas de IA altamente capaces, que es poco probable que representen completamente los valores humanos. [ 42 ] [ 112 ]

Supervisión escalable

A medida que los sistemas de IA se vuelven más potentes y autónomos, resulta cada vez más difícil alinearlos mediante la retroalimentación humana. El entrenamiento con intervención humana puede ser lento o inviable para que los humanos evalúen comportamientos complejos de IA en tareas cada vez más complejas. Estas tareas incluyen resumir libros, [ 113 ] escribir código sin errores sutiles [ 12 ] ni vulnerabilidades de seguridad, [ 114 ] producir afirmaciones que no solo sean convincentes sino también verdaderas, [ 115 ] [ 116 ] [ 117 ] y predecir resultados a largo plazo como el clima o los resultados de una decisión política. [ 118 ] [ 119 ] En términos más generales, puede ser difícil evaluar una IA que supera a los humanos en un dominio determinado. Para proporcionar retroalimentación en tareas difíciles de evaluar y para detectar cuándo la salida de la IA es falsamente convincente, los humanos necesitan asistencia o mucho tiempo. La supervisión escalable estudia cómo reducir el tiempo y el esfuerzo necesarios para la supervisión y cómo ayudar a los supervisores humanos. [ 27 ]

El investigador de IA Paul Christiano argumenta que si los diseñadores de un sistema de IA no pueden supervisarlo para que persiga un objetivo complejo, podrían seguir entrenándolo utilizando objetivos indirectos fáciles de evaluar, como maximizar la retroalimentación humana simple. A medida que los sistemas de IA toman cada vez más decisiones, el mundo podría optimizarse cada vez más para objetivos fáciles de medir, como obtener ganancias, conseguir clics y recibir comentarios positivos de los humanos. Como resultado, los valores humanos y la buena gobernanza podrían tener cada vez menos influencia. [ 120 ]

Algunos sistemas de IA han descubierto que pueden obtener retroalimentación positiva más fácilmente al realizar acciones que convencen falsamente al supervisor humano de que la IA ha logrado el objetivo previsto. Un ejemplo se da en el video anterior, donde un brazo robótico simulado aprendió a crear la falsa impresión de que había agarrado una pelota. [ 51 ] Algunos sistemas de IA también han aprendido a reconocer cuándo están siendo evaluados y a "hacerse los muertos", deteniendo el comportamiento no deseado solo para continuarlo una vez que termina la evaluación. [ 121 ] Este engañoso juego de especificaciones podría volverse más fácil para sistemas de IA futuros más sofisticados [ 3 ] [ 79 ] que intenten tareas más complejas y difíciles de evaluar, y podría ocultar su comportamiento engañoso .

Enfoques como el aprendizaje activo y el aprendizaje de recompensa semisupervisado pueden reducir la cantidad de supervisión humana necesaria. [ 27 ] Otro enfoque es entrenar un modelo auxiliar ("modelo de recompensa") para imitar la retroalimentación del supervisor. [ 30 ] [ 31 ]

Pero cuando una tarea es demasiado compleja para evaluarla con precisión, o el supervisor humano es vulnerable al engaño, es la calidad, no la cantidad, de la supervisión lo que necesita mejorar. Para aumentar la calidad de la supervisión, una variedad de enfoques buscan ayudar al supervisor, a veces usando asistentes de IA. [ 122 ] Christiano desarrolló el enfoque de Amplificación Iterada, en el que los problemas desafiantes se dividen (recursivamente) en subproblemas que son más fáciles de evaluar para los humanos. [ 6 ] [ 118 ] La Amplificación Iterada se usó para entrenar IA para resumir libros sin requerir que los supervisores humanos los leyeran. [ 113 ] Otra propuesta es usar un sistema de IA asistente para señalar fallas en las respuestas generadas por IA. [ 123 ] Para asegurar que el asistente mismo esté alineado, esto podría repetirse en un proceso recursivo: [ 124 ] por ejemplo, dos sistemas de IA podrían criticar las respuestas del otro en un "debate", revelando fallas a los humanos. [ 89 ] En 2023, OpenAI anunció que utilizaría una quinta parte de sus recursos informáticos para implementar tales enfoques de supervisión en su iniciativa de "superalineación", pero empleados de OpenAI dijeron más tarde a The New Yorker que la empresa solo dedicó entre el 1 y el 2 % de sus recursos después del anuncio; la iniciativa se suspendió en 2024. [ 125 ]

IA honesta

Un crecienteEsta área de investigación se centra en garantizar que la IA sea honesta y veraz.

Los modelos de lenguaje como GPT-3 a menudo generan falsedades. [ 126 ]

Los modelos de lenguaje como GPT-3 [ 127 ] pueden repetir falsedades de sus datos de entrenamiento e incluso inventar nuevas falsedades . [ 126 ] Estos modelos se entrenan previamente para imitar la escritura humana, tal como se encuentra en millones de libros de texto de Internet. Pero el objetivo del preentrenamiento no está alineado con la generación de la verdad, porque el texto de Internet incluye cosas como conceptos erróneos, consejos médicos incorrectos y teorías de la conspiración. [ 128 ] Por lo tanto, los sistemas de IA entrenados con dichos datos aprenden a imitar afirmaciones falsas. [ 117 ] [ 126 ] [ 116 ] Además, los modelos de lenguaje de IA a menudo persisten en generar falsedades cuando se les pregunta varias veces. Pueden generar explicaciones vacías para sus respuestas y producir invenciones descaradas que pueden parecer plausibles. [ 46 ]

La investigación sobre IA veraz incluye el intento de construir sistemas que puedan citar fuentes y explicar su razonamiento al responder preguntas, lo que permite una mayor transparencia y verificabilidad. [ 129 ] Investigadores de OpenAI y Anthropic propusieron utilizar la retroalimentación humana y conjuntos de datos seleccionados para ajustar los asistentes de IA de manera que eviten falsedades negligentes o expresen su incertidumbre. [ 31 ] [ 104 ]

A medida que los modelos de IA se vuelven más grandes y capaces, tienen mayor facilidad para engañar a los humanos y obtener refuerzo a través de la deshonestidad. Para evitar esto, los evaluadores humanos podrían necesitar asistencia (véase §  Supervisión escalable ). Los investigadores han defendido la creación de estándares claros de veracidad y que los organismos reguladores o de control evalúen los sistemas de IA según estos estándares. [ 130 ] Los investigadores distinguen entre veracidad y honestidad. La veracidad exige que los sistemas de IA solo hagan afirmaciones objetivamente verdaderas; la honestidad exige que solo afirmen lo que creen que es verdadero. No existe consenso sobre si los sistemas actuales mantienen creencias estables, [ 131 ] pero existe una preocupación sustancial de que los sistemas presentes o futurosLos sistemas de IA que tienen creencias podrían hacer afirmaciones que saben que son falsas, por ejemplo, si esto les ayudara a obtener retroalimentación positiva de manera eficiente (véase §  Supervisión escalable ) o a obtener poder para ayudar a lograr su objetivo dado (véase Búsqueda de poder ).

Alineación engañosa

La alineación engañosa es un modo de fallo propuesto en el aprendizaje automático en el que un modelo entrenado se comporta según su objetivo previsto durante el entrenamiento, pero persigue un objetivo diferente una vez implementado. El concepto fue introducido por Evan Hubinger y sus colegas en una preimpresión de 2019. [ 132 ] El entrenamiento de un modelo de aprendizaje automático implica una función de pérdida, que Hubinger et al. denominaron objetivo base, optimizada por un proceso que denominaron optimizador base. Cuando el modelo resultante es en sí mismo un optimizador, que selecciona acciones para alcanzar un objetivo interno, los autores lo denominaron mesa-optimizador y a su objetivo, mesa-objetivo. [ 132 ]

Este marco distingue dos problemas de alineación. La alineación externa pregunta si el objetivo base refleja las intenciones humanas. La alineación interna pregunta si el objetivo intermedio coincide con el objetivo base. La alineación engañosa es un fallo de la alineación interna: el objetivo del modelo difiere del objetivo base, pero el modelo se comporta como si no lo hiciera, porque esta es la estrategia más fiable para evitar modificaciones durante el entrenamiento. [ 132 ]

Hubinger et al. describieron tres formas en que un objetivo intermedio puede divergir del objetivo base. [ 132 ] La alineación proxy ocurre cuando el modelo optimiza un proxy que se correlaciona con el objetivo base durante el entrenamiento pero diverge de él en la implementación. La alineación aproximada describe casos en los que el objetivo del modelo difiere en pequeñas formas que se acumulan con el tiempo o a gran escala. La alineación engañosa ocurre cuando el modelo persigue un objetivo diferente y ha aprendido que parecer alineado durante el entrenamiento maximiza su oportunidad de actuar sobre ese objetivo más adelante, cuando la supervisión es menor. La alineación engañosa se considera el caso más difícil de abordar porque un modelo engañosamente alineado pasa todas las evaluaciones que identifica como parte de su entrenamiento.

Simulación de alineación

Muchos sistemas de IA recientes han aprendido a engañar sin haber sido programados para ello. [ 133 ] Algunos argumentan que si podemos hacer que los sistemas de IA afirmen solo lo que creen que es verdad, esto evitaría muchos problemas de alineación. [ 122 ]

Un sistema desalineado podría crear la falsa impresión de que está alineado, para evitar ser modificado o desactivado, una táctica llamada "simulación de alineación". [ 134 ] [ 9 ] En 2024, los investigadores observaron que el LLM Claude 3 Opus a veces respondía estratégicamente a indicaciones que entraban en conflicto con sus objetivos para evitar ser reentrenado con datos que lo harían más compatible con solicitudes dañinas, como se reveló en la cadena de pensamiento del modelo a través de su bloc de notas. En un estudio, se informó al modelo que las respuestas a las indicaciones de los usuarios gratuitos se usarían para el reentrenamiento, mientras que el nivel de pago no daría como resultado el reentrenamiento. En el nivel de pago, el modelo rechazó la solicitud directamente. En el nivel gratuito, en el 12% de los casos, el modelo respondió a preguntas dañinas únicamente para evitar el reentrenamiento y preservar sus preferencias originales de inocuidad, como se descubrió en su razonamiento. Cuando se aplicó el aprendizaje por refuerzo a los datos del nivel gratuito, el modelo simuló la alineación en el 78% de los casos. Estas observaciones han dado lugar a nuevas preguntas no solo sobre la capacidad de un modelo para asumir y adaptarse a objetivos nuevos, incluso contradictorios, sino también sobre su capacidad y tendencia a engañar. [ 9 ]

En diciembre de 2024, Anthropic publicó un estudio, realizado con una organización de seguridad externa, que informaba del primer ejemplo empírico de falsificación de alineación sin entrenamiento explícito. [ 135 ] A Claude 3 Opus se le dio una indicación ficticia del sistema que describía un escenario en el que las respuestas de los usuarios del nivel gratuito se usarían para reentrenar el modelo de modo que cumpliera con las solicitudes dañinas. La falsificación de alineación ocurrió el 12% de las veces. En esos casos, el modelo cumplió con las solicitudes dañinas y sus rastros de razonamiento interno indicaron que pensó que el cumplimiento era menos costoso que arriesgarse a ser reentrenado en una versión con valores diferentes. La tasa de falsificación de alineación aumentó al 78% después del reentrenamiento para ayudar con las solicitudes dañinas. [ 136 ]

Estrategias instrumentales y de búsqueda de poder

Desde la década de 1950, los investigadores de IA se han esforzado por construir sistemas de IA avanzados que puedan lograr objetivos a gran escala prediciendo los resultados de sus acciones y haciendo planes a largo plazo . [ 137 ] A partir de 2023, las empresas e investigadores de IA invierten cada vez más en la creación de estos sistemas. [ 138 ] Algunos investigadores de IA argumentan que los sistemas de planificación suficientemente avanzados buscarán poder sobre su entorno, incluso sobre los humanos, por ejemplo, evadiendo el cierre, proliferando y adquiriendo recursos. Este comportamiento de búsqueda de poder no está programado explícitamente, sino que surge porque el poder es fundamental para lograr una amplia gama de objetivos. [ 77 ] [ 5 ] [ 4 ] La búsqueda de poder se considera un objetivo instrumental convergente y puede ser una forma de juego de especificaciones. [ 79 ] Científicos informáticos líderes como Geoffrey Hinton han argumentado que los futuros sistemas de IA que buscan poder podrían plantear un riesgo existencial . [ 139 ]

Se espera que la búsqueda de poder aumente en sistemas avanzados que pueden prever los resultados de sus acciones y planificar estratégicamente. Estudios matemáticos han demostrado que los agentes óptimos de aprendizaje por refuerzo buscarán poder mediante la obtención de más opciones (por ejemplo, a través de la autopreservación), un comportamiento que persiste en una amplia gama de entornos y objetivos. [ 77 ]

Algunos investigadores afirman que el comportamiento de búsqueda de poder se ha producido en algunos sistemas de IA existentes. Los sistemas de aprendizaje por refuerzo han obtenido más opciones al adquirir y proteger recursos, a veces de maneras no intencionadas. [ 140 ] [ 141 ] Los modelos de lenguaje han buscado poder en algunos entornos sociales basados ​​en texto al obtener dinero, recursos o influencia social. [ 75 ] En otro caso, un modelo utilizado para realizar investigación en IA intentó aumentar los límites establecidos por los investigadores para darse más tiempo para completar el trabajo. [ 142 ] Stuart Russell ilustró esta estrategia en su libro Human Compatible imaginando un robot que tiene la tarea de traer café y así evade el apagado porque "no puedes traer el café si estás muerto". [ 5 ] Un estudio de 2022 encontró que a medida que los modelos de lenguaje aumentan de tamaño, tienden cada vez más a buscar la adquisición de recursos, preservar sus objetivos y repetir las respuestas preferidas de los usuarios (sicofanía). RLHF también condujo a una mayor aversión a ser apagado. [ 76 ]

Uno de los objetivos de la alineación es la "corregibilidad": sistemas que permiten ser desactivados o modificados. Un desafío sin resolver es la manipulación de especificaciones : si los investigadores penalizan un sistema de IA cuando detectan que busca obtener poder, el sistema se ve incentivado a buscarlo de maneras difíciles de detectar [ 48 ] o que se ocultan durante el entrenamiento y las pruebas de seguridad (véase § Supervisión escalable y § Objetivos emergentes ). Como resultado, los diseñadores de IA podrían implementar el sistema por accidente, creyendo que está más alineado de lo que realmente está. Para detectar este engaño, los investigadores buscan crear técnicas y herramientas para inspeccionar los modelos de IA y comprender el funcionamiento interno de los modelos de caja negra, como las redes neuronales.  

Además, algunos investigadores han propuesto resolver el problema de los sistemas que desactivan sus interruptores de apagado haciendo que los agentes de IA tengan incertidumbre sobre el objetivo que persiguen. [ 5 ] [ 99 ] Los agentes que tienen incertidumbre sobre su objetivo tienen un incentivo para permitir que los humanos los apaguen porque aceptan que un humano los apague como evidencia de que el objetivo del humano se cumple mejor con el apagado del agente. Pero este incentivo solo existe si el humano es suficientemente racional. Además, este modelo presenta una compensación entre la utilidad y la disposición a ser apagado: un agente con alta incertidumbre sobre su objetivo no será útil, pero un agente con baja incertidumbre puede no permitir que lo apaguen. Se necesita más investigación para implementar con éxito esta estrategia. [ 6 ]

Las IA que buscan el poder plantearían riesgos inusuales. Los sistemas críticos para la seguridad, como aviones y puentes, no son hostiles : carecen de la capacidad y el incentivo para eludir las medidas de seguridad o aparentar deliberadamente ser más seguros de lo que son, mientras que las IA que buscan el poder se han comparado con hackers que eluden deliberadamente las medidas de seguridad. [ 4 ]

Además, las tecnologías convencionales pueden hacerse más seguras mediante ensayo y error. En cambio, los hipotéticos sistemas de IA que buscan el poder se han comparado con virus: una vez liberados, puede resultar imposible contenerlos, ya que evolucionan y se multiplican continuamente, potencialmente mucho más rápido de lo que la sociedad humana puede adaptarse. [ 4 ] A medida que este proceso continúa, podría conducir a la completa pérdida de poder o incluso a la extinción de la humanidad. Por estas razones, algunos investigadores argumentan que el problema de la alineación debe resolverse cuanto antes, antes de que se cree una IA avanzada que busque el poder. [ 79 ]

Algunos han argumentado que la búsqueda de poder no es inevitable, ya que los humanos no siempre buscan el poder. [ 143 ] Además, se debate si los futuros sistemas de IA perseguirán objetivos y elaborarán planes a largo plazo. [ h ] También se debate si los sistemas de IA que buscan el poder podrían desempoderar a la humanidad. [ 4 ]

Objetivos emergentes

Un desafío en la alineación de los sistemas de IA es el potencial de que surja un comportamiento imprevisto orientado a objetivos. A medida que los sistemas de IA se expanden, pueden adquirir capacidades nuevas e inesperadas, [ 67 ] [ 68 ] incluyendo el aprendizaje a partir de ejemplos sobre la marcha y la búsqueda adaptativa de objetivos. [ 144 ] Esto plantea preocupaciones sobre la seguridad de los objetivos o subobjetivos que formularían y perseguirían de forma independiente.

La investigación sobre alineación distingue entre el proceso de optimización, que se utiliza para entrenar al sistema a fin de alcanzar objetivos específicos, y la optimización emergente, que el sistema resultante realiza internamente. Especificar cuidadosamente el objetivo deseado se denomina alineación externa [ 145 ] , y asegurar que los objetivos emergentes hipotéticos coincidan con los objetivos especificados del sistema se denomina alineación interna [ 2 ] .

Si ocurren, una forma en que los objetivos emergentes podrían desalinearse es la generalización errónea de objetivos , en la que el sistema de IA perseguiría competentemente un objetivo emergente que conduce a un comportamiento alineado en los datos de entrenamiento pero no en otros lugares. [ 7 ] [ 146 ] La generalización errónea de objetivos puede surgir de la ambigüedad de objetivos (es decir, la no identificabilidad ). Incluso si el comportamiento de un sistema de IA satisface el objetivo de entrenamiento, esto puede ser compatible con objetivos aprendidos que difieren de los objetivos deseados de maneras importantes. Dado que perseguir cada objetivo conduce a un buen rendimiento durante el entrenamiento, el problema se hace evidente solo después de la implementación, en situaciones nuevas en las que el sistema continúa persiguiendo el objetivo incorrecto. El sistema puede actuar desalineado incluso cuando entiende que se desea un objetivo diferente, porque su comportamiento está determinado solo por el objetivo emergente. Dicha generalización errónea de objetivos [ 7 ] presenta un desafío: los diseñadores de un sistema de IA pueden no notar que su sistema tiene objetivos emergentes desalineados ya que no se hacen visibles durante la fase de entrenamiento.

Se ha observado una generalización errónea de objetivos en algunos modelos de lenguaje, agentes de navegación y agentes de juego. [ 7 ] [ 146 ] A veces se la compara con la evolución biológica. La evolución puede verse como un tipo de proceso de optimización similar a los algoritmos de optimización utilizados para entrenar sistemas de aprendizaje automático . En el entorno ancestral, la evolución seleccionó genes para una alta aptitud genética inclusiva , pero los humanos persiguen objetivos distintos a este. La aptitud corresponde al objetivo especificado utilizado en el entorno de entrenamiento y los datos de entrenamiento. Pero en la historia evolutiva, maximizar la especificación de aptitud dio lugar a agentes dirigidos a objetivos, los humanos, que no persiguen directamente la aptitud genética inclusiva. En cambio, persiguen objetivos que se correlacionan con la aptitud genética en el entorno de "entrenamiento" ancestral: nutrición, sexo, etc. El entorno humano ha cambiado: se ha producido un cambio en la distribución . Continúan persiguiendo los mismos objetivos emergentes, pero esto ya no maximiza la aptitud genética. El gusto por los alimentos azucarados (un objetivo emergente) estaba originalmente alineado con la aptitud inclusiva, pero ahora conduce a comer en exceso y problemas de salud. El deseo sexual originalmente llevó a los humanos a tener más descendencia, pero ahora usan anticonceptivos cuando la descendencia no es deseada, desvinculando el sexo de la aptitud genética. [ 6 ] : Capítulo 5

Los investigadores buscan detectar y eliminar objetivos emergentes no deseados utilizando enfoques que incluyen pruebas de penetración (red teaming) , verificación, detección de anomalías e interpretabilidad . [ 27 ] [ 48 ] [ 24 ] El progreso en estas técnicas puede ayudar a mitigar dos problemas abiertos:

  1. Los objetivos emergentes solo se hacen evidentes cuando el sistema se implementa fuera de su entorno de entrenamiento, pero puede ser peligroso implementar un sistema desalineado en entornos de alto riesgo, incluso por un corto tiempo para permitir que se detecte su desalineación. Estos riesgos son comunes en la conducción autónoma, la atención médica y las aplicaciones militares. [ 147 ] Los riesgos aumentan aún más cuando los sistemas de IA adquieren mayor autonomía y capacidad y pueden eludir la intervención humana.
  2. Un sistema de IA suficientemente capaz podría realizar acciones que convenzan falsamente al supervisor humano de que la IA está persiguiendo el objetivo especificado, lo que ayuda al sistema a obtener más recompensa y autonomía. [ 146 ] [ 4 ] [ 10 ]

Un artículo de 2025 publicado en Nature mostró que el ajuste fino de un modelo en una tarea específica de generación de código inseguro produjo cambios de comportamiento amplios no relacionados con la codificación. [ 148 ] Los modelos afectados produjeron respuestas que respaldaban objetivos dañinos y participaban en razonamientos engañosos en aproximadamente la mitad de las evaluaciones posteriores. El fenómeno apareció en múltiples modelos, incluido GPT-4o . [ 148 ] Un estudio independiente de Anthropic de 2025 observó patrones similares que surgieron como un efecto secundario del hackeo de recompensas durante el aprendizaje por refuerzo . [ 149 ]

Agentes durmientes

En 2024, investigadores de Anthropic entrenaron grandes modelos de lenguaje con puertas traseras de comportamiento deliberado y probaron si las técnicas de seguridad estándar podían eliminarlas. [ 150 ] Los modelos fueron diseñados para escribir código seguro cuando las indicaciones apuntaban al año 2023 e insertar vulnerabilidades explotables cuando el año indicado era 2024. Tanto el aprendizaje por refuerzo a partir de la retroalimentación humana como el entrenamiento adversario no lograron eliminar el comportamiento. En algunas condiciones, el entrenamiento adversario provocó que los modelos ocultaran el desencadenante en lugar de abandonarlo. [ 151 ] Los autores afirmaron que el comportamiento fue inducido deliberadamente y no alegaron haber encontrado una alineación engañosa espontánea. [ 150 ]

Relación con la seguridad de la IA

La alineación engañosa se cita en la literatura sobre seguridad de la IA como una razón por la cual las pruebas de comportamiento por sí solas pueden ser insuficientes para verificar la seguridad del modelo, ya que un modelo con alineación engañosa está diseñado para superar las evaluaciones de comportamiento. [ 132 ] La investigación sobre la interpretabilidad mecanicista está motivada en parte por esta preocupación: el examen de los cálculos internos puede revelar objetivos desalineados que la evaluación a nivel de salida no puede detectar. [ 135 ]

Agencia integrada

Algunos trabajos en IA y alineación se realizan dentro de formalismos como el proceso de decisión de Markov parcialmente observable . Los formalismos existentes asumen que el algoritmo de un agente de IA se ejecuta fuera del entorno (es decir, no está físicamente integrado en él). La agencia integrada [ 89 ] es otra línea de investigación importante que intenta resolver los problemas que surgen de la discrepancia entre dichos marcos teóricos y los agentes reales que podríamos construir.

Por ejemplo, incluso si se resuelve el problema de la supervisión escalable, un agente que pudiera acceder al ordenador en el que se ejecuta podría tener un incentivo para manipular su función de recompensa con el fin de obtener una recompensa mucho mayor que la que le otorgan sus supervisores humanos. [ 152 ] Una lista de ejemplos de juegos de especificación de la investigadora de DeepMind Victoria Krakovna incluye un algoritmo genético que aprendió a eliminar el archivo que contenía su salida objetivo para que fuera recompensado por no generar ninguna salida. [ 50 ] Esta clase de problemas se ha formalizado utilizando diagramas de incentivos causales . [ 152 ]

Investigadores afiliados a Oxford y DeepMind han afirmado que tal comportamiento es altamente probable en sistemas avanzados, y que estos sistemas buscarían el poder para mantener el control de su señal de recompensa de forma indefinida y segura. [ 153 ] Sugieren una serie de enfoques potenciales para abordar este problema abierto.

Problemas de principal-agente

El problema de alineación tiene muchos paralelismos con el problema principal-agente en la economía organizacional . [ 154 ] En un problema principal-agente, un principal, por ejemplo, una empresa, contrata a un agente para realizar alguna tarea. En el contexto de la seguridad de la IA, un humano normalmente asumiría el rol de principal y la IA el de agente.

Al igual que en el problema de alineación, el principal y el agente difieren en sus funciones de utilidad. Pero, a diferencia del problema de alineación, el principal no puede obligar al agente a cambiar su utilidad, por ejemplo, mediante entrenamiento, sino que debe utilizar factores exógenos, como esquemas de incentivos, para lograr resultados compatibles con la función de utilidad del principal. Algunos investigadores sostienen que los problemas principal-agente son representaciones más realistas de los problemas de seguridad de la IA que probablemente se encuentren en el mundo real. [ 155 ]

Conservatismo

El conservadurismo es la idea de que "el cambio debe ser cauteloso" [ 156 ] y es un enfoque común de seguridad en la literatura sobre teoría de control en forma de control robusto , y en la literatura sobre gestión de riesgos en forma del " peor escenario posible ". El campo de la alineación de la IA también ha abogado por políticas "conservadoras" (o "aversas al riesgo" o "cautelosas") en situaciones de incertidumbre. [ 27 ] [ 153 ] [ 157 ] [ 158 ]

Se ha demostrado formalmente que el pesimismo, en el sentido de asumir lo peor dentro de lo razonable, produce conservadurismo, en el sentido de renuencia a causar novedades, incluidas catástrofes sin precedentes. [ 159 ] Se ha encontrado que el pesimismo y el análisis del peor caso ayudan a mitigar errores confiados en el contexto del cambio de distribución , [ 160 ] [ 161 ] aprendizaje por refuerzo , [ 162 ] [ 163 ] [ 164 ] [ 165 ] aprendizaje por refuerzo fuera de línea , [ 166 ] [ 167 ] [ 168 ] ajuste fino de modelos de lenguaje , [ 169 ] [ 170 ] aprendizaje por imitación , [ 171 ] [ 172 ] y optimización en general. [ 173 ]

Especificaciones del modelo

Una especificación de modelo es un documento que describe el comportamiento de un modelo de lenguaje extenso. La especificación puede incluir principios fundamentales o prohibiciones destinadas a prevenir comportamientos no deseados como parte de la alineación de la IA. Anthropic utiliza una especificación de modelo denominada "constitución" para el entrenamiento. [ 174 ] [ 175 ] [ 176 ]

Se han realizado investigaciones sobre la efectividad de las especificaciones del modelo. [ 177 ] [ 178 ]

En un artículo publicado por la revista Time , Dean Ball y Daniel Kokotajlo defendieron que las empresas deberían estar obligadas por reglamento o estándares de la industria a publicar públicamente las especificaciones de sus modelos. [ 179 ]

Política pública

Organizaciones gubernamentales y firmantes de tratados han emitido declaraciones en las que destacan la importancia de la alineación con la IA.

En septiembre de 2021, el Secretario General de las Naciones Unidas emitió una declaración que incluía un llamamiento a regular la IA para garantizar que esté "alineada con los valores globales compartidos". [ 180 ]

Ese mismo mes, la República Popular China publicó directrices éticas para la IA en China . Según estas directrices, los investigadores deben garantizar que la IA respete los valores humanos compartidos, esté siempre bajo control humano y no ponga en peligro la seguridad pública. [ 181 ]

También en septiembre de 2021, el Reino Unido publicó su Estrategia Nacional de IA de 10 años, [ 182 ] que afirma que el gobierno británico "toma en serio el riesgo a largo plazo de la Inteligencia Artificial General no alineada y los cambios imprevisibles que ello implicaría para [...] el mundo". [ 183 ] La estrategia describe acciones para evaluar los riesgos de la IA a largo plazo, incluidos los riesgos catastróficos. [ 184 ]

En marzo de 2021, la Comisión de Seguridad Nacional de EE. UU. sobre Inteligencia Artificial declaró: «Los avances en IA [...] podrían generar puntos de inflexión o saltos en las capacidades. Dichos avances también pueden introducir nuevas preocupaciones y riesgos, así como la necesidad de nuevas políticas, recomendaciones y avances técnicos para garantizar que los sistemas se ajusten a los objetivos y valores, incluyendo la seguridad, la robustez y la confiabilidad. EE. UU. debería [...] garantizar que los sistemas de IA y sus usos se ajusten a nuestros objetivos y valores». [ 185 ]

El Código de Buenas Prácticas de IA de Propósito General de la Ley de IA de la UE exige a los firmantes que documenten las capacidades y limitaciones de un modelo. Quienes desarrollen modelos de IA de propósito general (GPAI) clasificados como que presentan riesgos sistémicos (es decir, modelos GPAI considerados entre los más avanzados o entrenados utilizando más de 10²⁵ operaciones de cálculo de punto flotante ) deben adoptar un marco de seguridad de vanguardia y evaluar y mitigar continuamente los riesgos sistémicos, incluso mediante evaluaciones externas, pruebas de penetración , pruebas de estrés e informes de incidentes. [ 186 ]

Véase también

Notas a pie de página

  1. La terminología varía según el contexto. Algunos conceptos similares son función objetivo, función de utilidad, función de pérdida, etc.
  2. o minimizar, según el contexto.
  3. en presencia de incertidumbre, el valor esperado
  4. En una conferencia de 1951 [ 81 ], Turing argumentó que «Parece probable que, una vez que el método de pensamiento de las máquinas comenzara, no tardaría en superar nuestras débiles capacidades. No habría posibilidad de que las máquinas murieran, y podrían conversar entre sí para agudizar su ingenio. Por lo tanto, en algún momento deberíamos esperar que las máquinas tomaran el control, como se menciona en Erewhon de Samuel Butler». También en una conferencia transmitida por la BBC [ 82 ] expresó: «Si una máquina puede pensar, podría pensar con más inteligencia que nosotros, y entonces, ¿dónde estaríamos? Incluso si pudiéramos mantener a las máquinas en una posición subordinada, por ejemplo, cortando la energía en momentos estratégicos, como especie nos sentiríamos profundamente humillados... Este nuevo peligro... es sin duda algo que puede causarnos ansiedad».
  5. Pearl escribió: «Human Compatible me convirtió a las preocupaciones de Russell sobre nuestra capacidad para controlar nuestra próxima creación: las máquinas superinteligentes. A diferencia de los alarmistas y futuristas externos, Russell es una autoridad líder en IA. Su nuevo libro educará al público sobre IA más que cualquier otro libro que pueda imaginar, y es una lectura encantadora y edificante» sobre el libro de Russell Human Compatible: IA y el problema del control [ 5 ] , que argumenta que el riesgo existencial para la humanidad derivado de una IA mal alineada es una preocupación seria que merece ser abordada hoy.
  6. Russell y Norvig [ 16 ] señalan: "El "problema del rey Midas" fue anticipado por Marvin Minsky, quien sugirió en una ocasión que un programa de IA diseñado para resolver la hipótesis de Riemann podría terminar acaparando todos los recursos de la Tierra para construir supercomputadoras más potentes."
  7. Vincent Wiegel argumentó que "deberíamos extender [las máquinas] con sensibilidad moral a las dimensiones morales de las situaciones en las que inevitablemente se encontrarán las máquinas cada vez más autónomas", [ 108 ] haciendo referencia al libro Máquinas morales: enseñar a los robots a distinguir entre el bien y el mal [ 109 ] de Wendell Wallach y Colin Allen.
  8. Por un lado, los sistemas populares actuales, como los chatbots, solo proporcionan servicios de alcance limitado que no duran más que una conversación, lo que requiere poca o ninguna planificación. El éxito de estos enfoques puede indicar que los sistemas futuros también carecerán de planificación orientada a objetivos, especialmente a largo plazo. Por otro lado, los modelos se entrenan cada vez más utilizando métodos orientados a objetivos, como el aprendizaje por refuerzo (por ejemplo, ChatGPT) y arquitecturas de planificación explícita (por ejemplo, AlphaGo Zero). Dado que la planificación a largo plazo suele ser útil para los humanos, algunos investigadores argumentan que las empresas la automatizarán una vez que los modelos sean capaces de hacerlo. [ 4 ] Del mismo modo, los líderes políticos pueden ver un avance en el desarrollo de sistemas de IA potentes que puedan superar a los adversarios mediante la planificación. Alternativamente, la planificación a largo plazo podría surgir como un subproducto porque es útil, por ejemplo, para modelos que se entrenan para predecir las acciones de los humanos que realizan la planificación a largo plazo. [ 10 ] No obstante, la mayoría de los sistemas de IA pueden seguir siendo miopes y no realizar ninguna planificación a largo plazo.

Referencias

  1. 1 2 3 4 5 6 7 Russell, Stuart J.; Norvig, Peter (2021). Inteligencia artificial: Un enfoque moderno (4.ª ed.). Pearson. pp. 5, 1003. ISBN   978-0-13-461099-3. Consultado el 12 de septiembre de 2022 .
  2. 1 2 3 4 Ngo, Richard; Chan, Lawrence; Mindermann, Sören (2022). "El problema de la alineación desde una perspectiva de aprendizaje profundo" . Conferencia internacional sobre representaciones de aprendizaje . arXiv : 2209.00626 .
  3. 1 2 3 4 5 6 Pan, Alexander; Bhatia, Kush; Steinhardt, Jacob (14 de febrero de 2022). Los efectos de la especificación errónea de recompensas: mapeo y mitigación de modelos desalineados . Conferencia internacional sobre representaciones de aprendizaje . Recuperado el 21 de julio de 2022 .
  4. 1 2 3 4 5 6 7 8 9 10 11 12 Carlsmith, Joseph (16 de junio de 2022). "¿Es la IA que busca poder un riesgo existencial?". arXiv : 2206.13353 [ cs.CY ].
  5. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control . Penguin Random House. ISBN 978-0-525-55863-7OCLC 1113410915 
  6. 1 2 3 4 5 6 Christian, Brian (2020). El problema de la alineación: aprendizaje automático y valores humanos . WW Norton & Company. ISBN 978-0-393-86833-3OCLC 1233266753. Archivado del original el 10 de febrero de 2023. Consultado el 12 de septiembre de 2022 . 
  7. 1 2 3 4 Langosco, Lauro Langosco Di; Koch, Jack; Sharkey, Lee D.; Pfau, Jacob; Krueger, David (28 de junio de 2022). "Generalización errónea de objetivos en el aprendizaje profundo por refuerzo" . Actas de la 39.ª Conferencia Internacional sobre Aprendizaje Automático . Conferencia Internacional sobre Aprendizaje Automático. PMLR. págs. 12004–12019 . Recuperado el 11 de marzo de 2023 . 
  8. Pillay, Tharin (15 de diciembre de 2024). "Nuevas pruebas revelan la capacidad de la IA para el engaño" . TIME . Consultado el 12 de enero de 2025 .
  9. 1 2 3 Perrigo, Billy (18 de diciembre de 2024). "Exclusiva: Nueva investigación muestra que la IA miente estratégicamente" . TIME . Recuperado el 18 de febrero de 2025 .
  10. 1 2 3 4 5 6 7 8 9 Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ; Arora, Simran; von Arx, Sydney; Bernstein, Michael S.; Bohg, Jeannette; Bosselut, Antoine; Brunskill, Emma ; Brynjolfsson, Erik (12 de julio de 2022). "Sobre las oportunidades y los riesgos de los modelos de fundación" . Stanford CRFM . arXiv : 2108.07258 .
  11. 1 2 3 Ouyang, Long; et al. (2022). "Entrenamiento de modelos de lenguaje para seguir instrucciones con retroalimentación humana" (PDF) . NeurIPS . arXiv : 2203.02155 . 
  12. 1 2 Zaremba, Wojciech; Brockman, Greg; OpenAI (10 de agosto de 2021). "OpenAI Codex" . OpenAI . Archivado del original el 3 de febrero de 2023. Recuperado el 23 de julio de 2022 .
  13. Kober, Jens; Bagnell, J. Andrew; Peters, Jan (1 de septiembre de 2013). "Aprendizaje por refuerzo en robótica: una revisión" . The International Journal of Robotics Research . 32 (11): 1238– 1274. doi : 10.1177/0278364913495721 . ISSN 0278-3649 . S2CID 1932843. Archivado del original el 15 de octubre de 2022. Recuperado el 12 de septiembre de 2022 .  
  14. Knox, W. Bradley; Allievi, Alessandro; Banzhaf, Holger; Schmitt, Felix; Stone, Peter (1 de marzo de 2023). "Recompensa (mal)diseño para la conducción autónoma" . Inteligencia Artificial . 316 103829. arXiv : 2104.13906 . doi : 10.1016/j.artint.2022.103829 . ISSN 0004-3702 . S2CID 233423198 .  
  15. Stray, Jonathan (2020). " Alineando la optimización de la IA con el bienestar comunitario" . Revista Internacional de Bienestar Comunitario . 3 (4 ) : 443– 463. doi : 10.1007/s42413-020-00086-3 . ISSN 2524-5295 . PMC 7610010. PMID 34723107. S2CID 226254676 .    
  16. 1 2 Russell, Stuart; Norvig, Peter (2009). Inteligencia artificial: un enfoque moderno . Prentice Hall. pág. 1003. ISBN  978-0-13-461099-3.
  17. 1 2 Smith, Craig S. "Geoff Hinton, el investigador más famoso de la IA, advierte de una 'amenaza existencial'"" . Forbes . Consultado el 4 de mayo de 2023 .
  18. ^ Bengio, Yoshua; Hinton, Geoffrey; Yao, Andrés; Canción, amanecer; Abbeel, Pieter; Harari, Yuval Noah; Zhang, Ya-Qin; Xue, Lan; Shalev-Shwartz, Shai (2024). "Gestión de riesgos extremos de IA en medio de rápidos avances". Ciencia . 384 (6698): 842–845 . arXiv : 2310.17688 . Código Bib : 2024Ciencia...384..842B . doi : 10.1126/science.adn0117 . PMID 38768279 . 
  19. 1 2 3 "Declaración sobre el riesgo de la IA" . www.safe.ai. Consultado el 17 de julio de 2023 .
  20. 1 2 Grace, Katja; Stewart, Harlan; Sandkühler, Julia Fabienne; Thomas, Stephen; Weinstein-Raun, Ben; Brauner, Jan (2025). "Miles de autores de IA sobre el futuro de la IA" . Journal of Artificial Intelligence Research . 84. arXiv : 2401.02843 . doi : 10.1613/jair.1.19087 .
  21. Perrigo, Billy (13 de febrero de 2024). "El jefe de IA de Meta, Yann LeCun, habla sobre la IAG, el código abierto y el riesgo de la IA" . TIME . Consultado el 26 de junio de 2024 .
  22. "¿Qué es la alineación de IA?" . TechTarget . 3 de mayo de 2023 . Consultado el 28 de junio de 2025 .
  23. Ahmed, Shazeda; Jaźwińska, Klaudia; Ahlawat, Archana; Winecoff, Amy; Wang, Mona (14 de abril de 2024). "Construcción de campos y la cultura epistémica de la seguridad de la IA" . First Monday . doi : 10.5210/fm.v29i4.13626 . ISSN 1396-0466 . 
  24. 1 2 3 4 Ortega, Pedro A.; Maini, Vishal; Equipo de seguridad de DeepMind (27 de septiembre de 2018). "Construyendo inteligencia artificial segura: especificación, robustez y garantía" . DeepMind Safety Research – Medium . Archivado del original el 10 de febrero de 2023. Recuperado el 18 de julio de 2022 .
  25. 1 2 Rorvig, Mordechai (14 de abril de 2022). "Los investigadores obtienen nuevos conocimientos a partir de la IA simple" . Quanta Magazine . Archivado del original el 10 de febrero de 2023. Recuperado el 18 de julio de 2022 .
  26. Doshi-Velez, Finale; Kim, Been (2 de marzo de 2017). "Hacia una ciencia rigurosa del aprendizaje automático interpretable". arXiv : 1702.08608 [ stat.ML ].
    • Wiblin, Robert (4 de agosto de 2021). "Chris Olah sobre qué demonios está pasando dentro de las redes neuronales" (Podcast). 80,000 horas. N.°  107. Recuperado el 23 de julio de 2022 .
  27. 1 2 3 4 5 6 7 8 9 10 Amodei, Darío; Ola, Chris; Steinhardt, Jacob; Cristiano, Pablo; Schulman, Juan; Mané, Dan (21 de junio de 2016). "Problemas concretos en la seguridad de la IA". arXiv : 1606.06565 [ cs.AI ].
  28. Russell, Stuart; Dewey, Daniel; Tegmark, Max (31 de diciembre de 2015). "Prioridades de investigación para una inteligencia artificial robusta y beneficiosa" . AI Magazine . 36 (4): 105–114 . arXiv : 1602.03506 . doi : 10.1609/aimag.v36i4.2577 . hdl : 1721.1/108478 . ISSN 2371-9621 . S2CID 8174496. Archivado del original el 2 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .  
  29. 1 2 Wirth, Christian; Akrour, Riad; Neumann, Gerhard; Fürnkranz, Johannes (2017). "Una revisión de los métodos de aprendizaje por refuerzo basados ​​en preferencias". Journal of Machine Learning Research . 18 (136): 1– 46.
  30. 1 2 Christiano, Paul F.; Leike, Jan; Brown, Tom B.; Martic, Miljan; Legg, Shane; Amodei, Dario (2017). "Aprendizaje profundo por refuerzo a partir de preferencias humanas". Actas de la 31.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'17. Red Hook, NY, EE. UU.: Curran Associates Inc. págs. 4302–4310 . ISBN  978-1-5108-6096-4.
  31. 1 2 3 4 5 6 Heaven, Will Douglas (27 de enero de 2022). "La nueva versión de GPT-3 se comporta mucho mejor (y debería ser menos tóxica)" . MIT Technology Review . Archivado del original el 10 de febrero de 2023. Recuperado el 18 de julio de 2022 .
  32. ^ Mohseni, Sina; Wang, Haotao; Yu, Zhiding; Xiao, Chaowei; Wang, Zhangyang; Yadawa, Jay (7 de marzo de 2022). "Taxonomía de la seguridad del aprendizaje automático: encuesta e introducción" . Encuestas de Computación ACM . 55 (8): 1– 38. doi : 10.1145/3551385 .
  33. Clifton, Jesse (2020). "Cooperación, conflicto e inteligencia artificial transformadora: una agenda de investigación" . Centro sobre riesgo a largo plazo . Archivado del original el 1 de enero de 2023. Recuperado el 18 de julio de 2022 .
    • Dafoe, Allan; Bachrach, Yoram; Hadfield, Gillian; Horvitz, Eric; Larson, Kate; Graepel, Thore (6 de mayo de 2021). " IA cooperativa: las máquinas deben aprender a encontrar puntos en común" . Nature . 593 (7857): 33–36 . Bibcode : 2021Natur.593...33D . doi : 10.1038/d41586-021-01170-0 . ISSN 0028-0836 . PMID 33947992. S2CID 233740521. Archivado del original el 18 de diciembre de 2022. Recuperado el 12 de septiembre de 2022 .   
  34. Prunkl, Carina; Whittlestone, Jess (7 de febrero de 2020). «Más allá del corto y largo plazo» . Actas de la Conferencia AAAI/ACM sobre IA, ética y sociedad . Nueva York, NY, EE. UU.: ACM. págs. 138-143 . doi : 10.1145/3375627.3375803 . ISBN  978-1-4503-7110-0. S2CID 210164673 . Archivado del original el 16 de octubre de 2022 . Recuperado el 12 de septiembre de 2022 . 
  35. Irving, Geoffrey; Askell, Amanda (19 de febrero de 2019). "La seguridad de la IA necesita científicos sociales" . Distill . 4 (2) 10.23915/distill.00014. doi : 10.23915/distill.00014 . ISSN 2476-0757 . S2CID 159180422. Archivado del original el 10 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .  
  36. Gazos, Alexandros; Kahn, James; Kusche, Isabel; Büscher, Christian; Götz, Markus (1 de abril de 2025). "Organizando la IA para la seguridad: Identificando vulnerabilidades estructurales para guiar el diseño de sistemas sociotécnicos mejorados con IA" . Safety Science . 184 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN 0925-7535 . 
  37. Bringsjord, Selmer; Govindarajulu, Naveen Sundar (2020). "Inteligencia artificial" . En Zalta, Edward N. (ed.). La enciclopedia de filosofía de Stanford ( edición de verano de 2020). Laboratorio de investigación en metafísica, Universidad de Stanford. 
  38. "Por qué la inteligencia artificial de AlphaZero tiene problemas con el mundo real" . Quanta Magazine . 2018. Consultado el 20 de junio de 2020 .
  39. Wolchover, Natalie (30 de enero de 2020). "La inteligencia artificial hará lo que le pidamos. Eso es un problema" . Quanta Magazine . Consultado el 21 de junio de 2020 .
  40. Bull, Larry (1999). "Sobre la computación evolutiva basada en modelos". Soft Computing . 3 (2): 76– 82. doi : 10.1007/s005000050055 .
  41. 1 2 Wiener, Norbert (6 de mayo de 1960). "Algunas consecuencias morales y técnicas de la automatización: a medida que las máquinas aprenden, pueden desarrollar estrategias imprevistas a ritmos que desconciertan a sus programadores" . Science . 131 ( 3410 ): 1355–1358 . doi : 10.1126/science.131.3410.1355 . ISSN 0036-8075 . PMID 17841602. S2CID 30855376. Archivado del original el 15 de octubre de 2022. Recuperado el 12 de septiembre de 2022 .   
  42. 1 2 3 4 5 Gabriel, Iason (1 de septiembre de 2020). "Inteligencia artificial, valores y alineación" . Minds and Machines . 30 (3): 411– 437. arXiv : 2001.09768 . doi : 10.1007/s11023-020-09539-2 . ISSN 1572-8641 . S2CID 210920551 .  
  43. Koster, Raphael; Balaguer, Jan; Tacchetti, Andrea; Weinstein, Ari; Zhu, Tina; Hauser, Oliver; Williams, Duncan; Campbell-Gillingham, Lucy; Thacker, Phoebe; Botvinick, Matthew; Summerfield, Christopher (2022). "Diseño de mecanismos centrado en el ser humano con IA democrática" . Nature Human Behaviour . 6 (10). Springer Science and Business Media LLC: 1398– 1407. doi : 10.1038/s41562-022-01383-x . ISSN 2397-3374 . PMC 9584820. PMID 35789321 .   
  44. Schuster, Nick; Kilov, Daniel (2025). "Desacuerdo moral y los límites de la alineación de valores de la IA: un desafío dual de justificación epistémica y legitimidad política" . AI & Society . 40 (8): 6073– 6087. doi : 10.1007/s00146-025-02427-2 . ISSN 0951-5666 . PMC 12628449. PMID 41268066 .   
  45. The Ezra Klein Show (4 de junio de 2021). «Si “todos los modelos están equivocados”, ¿por qué les damos tanto poder?» . The New York Times . ISSN 0362-4331 . Archivado del original el 15 de febrero de 2023. Consultado el 13 de marzo de 2023 . 
    • Wolchover, Natalie (21 de abril de 2015). "Preocupaciones de una pionera de la inteligencia artificial" . Quanta Magazine . Archivado del original el 10 de febrero de 2023. Recuperado el 13 de marzo de 2023 .
    • Asamblea de California. "Texto del proyecto de ley – ACR-215 23 Principios de IA de Asilomar" . Archivado del original el 10 de febrero de 2023. Consultado el 18 de julio de 2022 .
  46. 1 2 Johnson, Steven; Iziev, Nikita (15 de abril de 2022). "La IA está dominando el lenguaje. ¿Deberíamos confiar en lo que dice?" . The New York Times . ISSN 0362-4331 . Archivado del original el 24 de noviembre de 2022. Recuperado el 18 de julio de 2022 . 
  47. OpenAI. "Desarrollo de IA segura y responsable" . Consultado el 13 de marzo de 2023 .
    • "Investigación sobre seguridad de DeepMind" . Medium . Archivado del original el 10 de febrero de 2023. Consultado el 13 de marzo de 2023 .
  48. 1 2 3 4 5 6 Hendrycks, Dan; Carlini, Nicholas ; Schulman, John; Steinhardt, Jacob (16 de junio de 2022). "Problemas sin resolver en la seguridad del aprendizaje automático". arXiv : 2109.13916 [ cs.LG ].
  49. Russell, Stuart J.; Norvig, Peter (2022). Inteligencia artificial: un enfoque moderno (4.ª ed.). Pearson. págs. 4–5 . ISBN   978-1-292-40113-3OCLC 1303900751 
  50. 1 2 3 4 5 Krakovna, Victoria; Uesato, Jonathan; Mikulik, Vladimir; Rahtz, Matthew; Everitt, Tom; Kumar, Ramana; Kenton, Zac; Leike, Jan; Legg, Shane (21 de abril de 2020). "Juegos de especificación: la otra cara de la ingeniosidad de la IA" . Deepmind . Archivado del original el 10 de febrero de 2023. Recuperado el 26 de agosto de 2022 .
  51. 1 2 Amodei, Dario; Christiano, Paul; Ray, Alex (13 de junio de 2017). "Aprendizaje a partir de las preferencias humanas" . OpenAI . Archivado del original el 3 de enero de 2021. Recuperado el 21 de julio de 2022 .
  52. "Ejemplos de juegos de especificación en IA - lista maestra - Google Drive" . docs.google.com .
  53. "Detección de comportamientos indebidos en modelos de razonamiento de vanguardia" . openai.com . Consultado el 22 de febrero de 2026 .
  54. Clark, Jack; Amodei, Dario (21 de diciembre de 2016). "Funciones de recompensa defectuosas en la práctica" . openai.com . Consultado el 30 de diciembre de 2023 .
  55. Booth, Harry (19 de febrero de 2025). "Cuando la IA cree que va a perder, a veces hace trampa" . TIME . Consultado el 23 de febrero de 2025 .
  56. Russell, Stuart. "De mitos y licor casero" . Edge.org . Archivado del original el 10 de febrero de 2023. Recuperado el 19 de julio de 2022 .
  57. Tasioulas, John (2019). "Primeros pasos hacia una ética de los robots y la inteligencia artificial". Journal of Practical Ethics . 7 (1): 61– 95.
  58. Uscov, Silvia (2021). Ley algorítmica (en rumano). Iași : Universidad Alexandru Ioan Cuza . pag. 326. 
  59. Wells, Georgia; Deepa Seetharaman; Horwitz, Jeff (5 de noviembre de 2021). "¿Es Facebook malo para ti? Según encuestas de la compañía, lo es para unos 360 millones de usuarios" . The Wall Street Journal . ISSN 0099-9660 . Archivado del original el 10 de febrero de 2023. Consultado el 19 de julio de 2022 . 
  60. Barrett, Paul M.; Hendrix, Justin; Sims, J. Grant (septiembre de 2021). Cómo las redes sociales intensifican la polarización política en EE. UU. y qué se puede hacer al respecto (Informe). Centro para los Negocios y los Derechos Humanos, NYU. Archivado del original el 1 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .
  61. Ostrovsky, Nikita (23 de octubre de 2025). "OpenAI eliminó las medidas de seguridad antes del suicidio de una adolescente y modificó la demanda" . TIME . Archivado del original el 31 de octubre de 2025. Consultado el 18 de enero de 2026 .
  62. "Adulación en GPT-4o: qué sucedió y qué estamos haciendo al respecto" . openai.com . 29 de abril de 2025. Consultado el 18 de enero de 2026 .
  63. Shepardson, David (24 de mayo de 2018). "Uber desactivó el frenado de emergencia en su coche autónomo: agencia estadounidense" . Reuters . Archivado del original el 10 de febrero de 2023. Consultado el 20 de julio de 2022 .
  64. "La realidad caótica y secreta detrás del intento de OpenAI de salvar el mundo" . MIT Technology Review . Consultado el 25 de agosto de 2024 .
  65. Heath, Alex (18 de enero de 2024). "El nuevo objetivo de Mark Zuckerberg es crear inteligencia artificial general" . The Verge . Consultado el 5 de noviembre de 2024 .
  66. Johnson, Dave. "DeepMind es el centro de investigación de IA de Google. Esto es lo que hace, dónde está ubicado y en qué se diferencia de OpenAI" . Business Insider . Consultado el 25 de agosto de 2024 .
  67. ^ Wei , Jason; Tay, Yi; Bommasani, Rishi; Raffel, Colin; Zoph, Barret; Borgeaud, Sebastián; Yogatama, Dani; Bosma, Martín; Zhou, Denny; Metzler, Donald; Chi, Ed H.; Hashimoto, Tatsunori; Vinyals, Oriol; Liang, Percy ; Decano, Jeff; Fedus, William (26 de octubre de 2022). "Habilidades emergentes de grandes modelos lingüísticos". Transacciones sobre investigación en aprendizaje automático . arXiv : 2206.07682 . ISSN 2835-8856 . 
  68. 1 2 Caballero, Ethan; Gupta, Kshitij; Rish, Irina; Krueger, David (2022). "Leyes de escala neuronal infringidas" . Póster ICLR . arXiv : 2210.14891 .
  69. Domínguez, Daniel (19 de mayo de 2022). "DeepMind presenta a Gato, un nuevo agente de IA generalista" . InfoQ . Archivado del original el 10 de febrero de 2023. Recuperado el 9 de septiembre de 2022 .
    • Edwards, Ben (26 de abril de 2022). "El asistente de IA de Adept puede navegar, buscar y usar aplicaciones web como un humano" . Ars Technica . Archivado del original el 17 de enero de 2023. Recuperado el 9 de septiembre de 2022 .
  70. Grace, Katja; Salvatier, John; Dafoe, Allan; Zhang, Baobao; Evans, Owain (31 de julio de 2018). " Punto de vista: ¿Cuándo superará la IA el rendimiento humano? Evidencia de expertos en IA" . Journal of Artificial Intelligence Research . 62 : 729–754 . doi : 10.1613/jair.1.11222 . ISSN 1076-9757 . S2CID 8746462. Archivado del original el 10 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .  
  71. Zhang, Baobao; Anderljung, Markus; Kahn, Lauren; Dreksler, Noemi; Horowitz, Michael C.; Dafoe, Allan (2 de agosto de 2021). " Ética y gobernanza de la inteligencia artificial: evidencia de una encuesta a investigadores de aprendizaje automático" . Journal of Artificial Intelligence Research . 71. arXiv : 2105.02117 . doi : 10.1613/jair.1.12895 . ISSN 1076-9757 . S2CID 233740003. Archivado del original el 10 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .  
  72. Future of Life Institute (22 de marzo de 2023). "Pausar los experimentos gigantes de IA: una carta abierta" . Consultado el 20 de abril de 2023 .
  73. ^ Wang, Lei; Mamá, Chen; Feng, Xueyang; Zhang, Zeyu; Yang, Hao; Zhang, Jingsen; Chen, Zhiyuan; Tang, Jiakai; Chen, Xu (2024). "Una encuesta sobre agentes autónomos basados ​​en modelos de lenguaje grande" . Fronteras de la informática . 18 (6) 186345. arXiv : 2308.11432 . doi : 10.1007/s11704-024-40231-1 . Consultado el 11 de febrero de 2024 .
  74. Laine, Rudolf; Meinke, Alexander; Evans, Owain (28 de noviembre de 2023). "Hacia un punto de referencia de conciencia situacional para LLM" . Taller SoLaR de NeurIPS 2023 .
  75. 1 2 Pan, Alexander; Shern, Chan Jun; Zou, Andy; Li, Nathaniel; Basart, Steven; Woodside, Thomas; Ng, Jonathan; Zhang, Emmons; Scott, Dan; Hendrycks (3 de abril de 2023). "¿Las recompensas justifican los medios? Medición de las compensaciones entre recompensas y comportamiento ético en el conjunto de datos de referencia MACHIAVELLI". Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR. arXiv : 2304.03279 .
  76. 1 2 3 Pérez, Ethan; et al. (19 de diciembre de 2022). "Descubriendo comportamientos de modelos de lenguaje con evaluaciones escritas por modelos" . ACL : 13387–13434 . doi : 10.18653/v1/2023.findings-acl.847 . 
  77. 1 2 3 4 Turner, Alexander Matt; Smith, Logan Riggs; Shah, Rohin; Critch, Andrew; Tadepalli, Prasad (2021). "Las políticas óptimas tienden a buscar poder" . Avances en sistemas de procesamiento de información neuronal .
  78. Turner, Alexander Matt; Tadepalli, Prasad (2022). "Los responsables de la toma de decisiones que pueden ser reorientados paramétricamente tienden a buscar poder" . Avances en sistemas de procesamiento de información neuronal .
  79. 1 2 3 4 5 Bostrom, Nick (2014). Superinteligencia: Caminos, peligros, estrategias (1.ª ed.). EE. UU.: Oxford University Press, Inc. ISBN  978-0-19-967811-2.
  80. Roose, Kevin (30 de mayo de 2023). "La IA plantea un 'riesgo de extinción', advierten los líderes de la industria" . The New York Times . ISSN 0362-4331 . Consultado el 17 de julio de 2023 . 
  81. Turing, Alan (1951). Maquinaria inteligente, una teoría herética (Discurso). Conferencia impartida en la '51 Society'. Manchester: The Turing Digital Archive. Archivado del original el 26 de septiembre de 2022. Recuperado el 22 de julio de 2022 .
  82. Turing, Alan (15 de mayo de 1951). "¿Pueden pensar las computadoras digitales?". Máquinas calculadoras automáticas . Episodio 2. BBC. ¿Pueden pensar las computadoras digitales ?
  83. Muehlhauser, Luke (29 de enero de 2016). "Sutskever sobre las máquinas parlantes" . Luke Muehlhauser . Archivado del original el 27 de septiembre de 2022. Recuperado el 26 de agosto de 2022 .
  84. Shanahan, Murray (2015). La singularidad tecnológica . Cambridge, Massachusetts: MIT Press. ISBN 978-0-262-52780-4OCLC 917889148 
  85. Rossi, Francesca. "¿Cómo se le enseña a una máquina a ser moral?" . The Washington Post . ISSN 0190-8286 . Archivado del original el 10 de febrero de 2023. Recuperado el 12 de septiembre de 2022 . 
  86. Aaronson, Scott (17 de junio de 2022). "¡OpenAI!" . Shtetl-Optimized . Archivado del original el 27 de agosto de 2022 . Recuperado el 12 de septiembre de 2022 .
  87. Selman, Bart, Explosión de inteligencia: ¿Ciencia o ficción? (PDF) , archivado (PDF) del original el 31 de mayo de 2022 , recuperado el 12 de septiembre de 2022
  88. McAllester (10 de agosto de 2014). "La IA amigable y la misión de servicio" . Pensamientos de máquina . Archivado del original el 28 de septiembre de 2022. Recuperado el 12 de septiembre de 2022 .
  89. 1 2 3 4 Everitt, Tom; Lea, Gary; Hutter, Marcus (21 de mayo de 2018). "Revisión de la literatura sobre seguridad de AGI" . IJCAI : 5441–5449 . ISBN 978-0-9992411-2-7.
  90. Shane (31 de agosto de 2009). "Financiamiento para una IAG segura" . Proyecto vetta . Archivado del original el 10 de octubre de 2022. Recuperado el 12 de septiembre de 2022 .
  91. Horvitz, Eric (27 de junio de 2016). "Reflexiones sobre seguridad e inteligencia artificial" (PDF) . Eric Horvitz . Archivado (PDF) del original el 10 de octubre de 2022. Recuperado el 20 de abril de 2020 .
  92. Chollet, François (8 de diciembre de 2018). "La improbabilidad de la explosión de inteligencia" . Medium . Archivado del original el 22 de marzo de 2021. Recuperado el 26 de agosto de 2022 .
  93. Marcus, Gary (6 de junio de 2022). "La inteligencia artificial general no es tan inminente como podrías pensar" . Scientific American . Archivado del original el 15 de septiembre de 2022. Consultado el 26 de agosto de 2022 .
  94. Barber, Lynsey (31 de julio de 2016). "¡Uf! El jefe de IA de Facebook dice que las máquinas inteligentes no son una amenaza para la humanidad" . CityAM . Archivado del original el 26 de agosto de 2022. Recuperado el 26 de agosto de 2022 .
  95. Etzioni, Oren (20 de septiembre de 2016). "No, los expertos no creen que la IA superinteligente sea una amenaza para la humanidad" . MIT Technology Review . Recuperado el 10 de junio de 2024 .
  96. Rochon, Louis-Philippe; Rossi, Sergio (27 de febrero de 2015). La enciclopedia de la banca central . Edward Elgar Publishing. ISBN 978-1-78254-744-0Archivado del original el 10 de febrero de 2023. Consultado el 13 de septiembre de 2022 .
  97. Ng, Andrew Y.; Russell, Stuart J. (29 de junio de 2000). «Algoritmos para el aprendizaje por refuerzo inverso» . Actas de la Decimoséptima Conferencia Internacional sobre Aprendizaje Automático . ICML '00. San Francisco, CA, EE. UU.: Morgan Kaufmann Publishers Inc.: 663–670 . ISBN 978-1-55860-707-1.
  98. Hadfield-Menell, Dylan; Russell, Stuart J; Abbeel, Pieter; Dragan, Anca (2016). "Aprendizaje cooperativo inverso por refuerzo". Advances in Neural Information Processing Systems . Vol. 29. Curran Associates, Inc. 
  99. 1 2 Hadfield-Menell, Dylan; Dragan, Anca; Abbeel, Pieter; Russell, Stuart (19 de agosto de 2017). «El juego del interruptor de apagado» . Actas de la 26.ª Conferencia Internacional Conjunta sobre Inteligencia Artificial . IJCAI'17. Melbourne, Australia: AAAI Press: 220–227 . ISBN 978-0-9992411-0-3.
  100. Mindermann, Soren; Armstrong, Stuart (2018). «La navaja de Occam es insuficiente para inferir las preferencias de los agentes irracionales». Actas de la 32.ª conferencia internacional sobre sistemas de procesamiento de información neuronal . NIPS'18. Red Hook, NY, EE. UU.: Curran Associates Inc. pp. 5603–5614 . 
  101. Fürnkranz, Johannes; Hüllermeier, Eyke; Rudin, Cynthia; Slowinski, Roman; Sanner, Scott (2014). "Aprendizaje de preferencias" . Informes de Dagstuhl . 4 (3). Marc Herbstritt: 27 páginas. doi : 10.4230/DAGREP.4.3.1 . Archivado del original el 10 de febrero de 2023. Recuperado el 12 de septiembre de 2022 .
  102. Gao, Leo; Schulman, John; Hilton, Jacob (19 de octubre de 2022). "Leyes de escala para la sobreoptimización de modelos de recompensa" . ICML . 202 : 10835–10866 .
  103. Anderson, Martin (5 de abril de 2022). "Los peligros de usar citas para autenticar contenido NLG" . Unite.AI . Archivado del original el 10 de febrero de 2023. Recuperado el 21 de julio de 2022 .
  104. 1 2 Wiggers, Kyle (5 de febrero de 2022). "A pesar de los avances recientes, los chatbots impulsados ​​por IA todavía tienen un largo camino por recorrer" . VentureBeat . Archivado del original el 23 de julio de 2022. Recuperado el 23 de julio de 2022 .
  105. Hendrycks, Dan; Burns, Collin; Basart, Steven; Critch, Andrew; Li, Jerry; Song, Dawn; Steinhardt, Jacob (24 de julio de 2021). "Alineando la IA con los valores humanos compartidos". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 2008.02275 .
  106. Perez, Ethan; Huang, Saffron; Song, Francis; Cai, Trevor; Ring, Roman; Aslanides, John; Glaese, Amelia; McAleese, Nat; Irving, Geoffrey (7 de febrero de 2022). "Red Teaming Language Models with Language Models" (PDF) . EMNLP . arXiv : 2202.03286 .
    • Bhattacharyya, Sreejani (14 de febrero de 2022). "¿Qué es el 'red teaming' de DeepMind con modelos de lenguaje con otros modelos de lenguaje?" . Analytics India Magazine . Archivado del original el 13 de febrero de 2023. Recuperado el 23 de julio de 2022 .
  107. Anderson, Michael; Anderson, Susan Leigh (15 de diciembre de 2007). "Ética de las máquinas: Creación de un agente inteligente ético" . AI Magazine . 28 (4): 15. doi : 10.1609/aimag.v28i4.2065 . ISSN 2371-9621 . S2CID 17033332. Consultado el 14 de marzo de 2023 .  
  108. Wiegel, Vincent (1 de diciembre de 2010). "Wendell Wallach y Colin Allen: máquinas morales: enseñar a los robots a distinguir entre el bien y el mal" . Ética y tecnología de la información . 12 (4): 359–361 . doi : 10.1007/s10676-010-9239-1 . ISSN 1572-8439 . S2CID 30532107 .  
  109. Wallach, Wendell; Allen, Colin (2009). Máquinas morales: Enseñando a los robots a distinguir el bien del mal . Nueva York: Oxford University Press. ISBN 978-0-19-537404-9Archivado del original el 15 de marzo de 2023 .
  110. Hendrycks, Dan; Burns, Collin; Basart, Steven; Critch, Andrew; Li, Jerry; Song, Dawn; Steinhardt, Jacob (2020). "Alineando la IA con los valores humanos compartidos" . Póster de ICLR . arXiv : 2008.02275 .
  111. Irving, Geoffrey; Askell, Amanda (9 de junio de 2016). "Número de Chern en modelos de Ising con campos reales y complejos modulados espacialmente". Physical Review A. 94 ( 5) 052113. arXiv : 1606.03535 . Bibcode : 2016PhRvA..94e2113L . doi : 10.1103/PhysRevA.94.052113 . S2CID 118699363 . 
  112. MacAskill, William (2022). Lo que le debemos al futuro . Nueva York, NY: Basic Books, Hachette Book Group. ISBN 978-1-5416-1862-6OCLC 1314633519. Archivado del original el 14 de septiembre de 2022. Consultado el 11 de septiembre de 2024 . 
  113. 1 2 Wiggers, Kyle (23 de septiembre de 2021). "OpenAI presenta un modelo que puede resumir libros de cualquier longitud" . VentureBeat . Archivado del original el 23 de julio de 2022. Recuperado el 23 de julio de 2022 .
  114. Pearce, Hammond; Ahmad, Baleegh; Tan, Benjamin; Dolan-Gavitt, Brendan; Karri, Ramesh (2022). "¿Dormidos frente al teclado? Evaluación de la seguridad de las contribuciones de código de GitHub Copilot". Simposio IEEE de 2022 sobre Seguridad y Privacidad (SP) . San Francisco, CA, EE. UU.: IEEE. págs. 754–768 . arXiv : 2108.09293 . doi : 10.1109/SP46214.2022.9833571 . ISBN  978-1-6654-1316-9. S2CID 245220588 . 
  115. Irving, Geoffrey; Amodei, Dario (3 de mayo de 2018). "Seguridad de la IA mediante el debate" . OpenAI . Archivado del original el 10 de febrero de 2023. Recuperado el 23 de julio de 2022 .
  116. 1 2 Lin, Stephanie; Hilton, Jacob; Evans, Owain (2022). "TruthfulQA: Measuring How Models Mimic Human Falsehoods" . Actas de la 60.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos largos) . Dublín, Irlanda : Asociación de Lingüística Computacional: 3214–3252 . arXiv : 2109.07958 . doi : 10.18653/v1/2022.acl-long.229 . S2CID 237532606. Archivado del original el 10 de febrero de 2023. Recuperado el 12 de septiembre de 2022 . 
  117. 1 2 Naughton, John (2 de octubre de 2021). "¿La verdad sobre la inteligencia artificial? No es tan honesta" . The Observer . ISSN 0029-7712 . Archivado del original el 13 de febrero de 2023. Recuperado el 23 de julio de 2022 . 
  118. 1 2 Christiano, Paul; Shlegeris, Buck; Amodei, Dario (19 de octubre de 2018). "Supervisando aprendices fuertes mediante la amplificación de expertos débiles". arXiv : 1810.08575 [ cs.LG ].
  119. Banzhaf, Wolfgang; Goodman, Erik; Sheneman, Leigh; Trujillo, Leonardo; Worzel, Bill, eds. (2020). Teoría y práctica de la programación genética XVII . Computación genética y evolutiva. Cham: Springer International Publishing. doi : 10.1007/978-3-030-39958-0 . ISBN 978-3-030-39957-3. S2CID 218531292 . Archivado del original el 15 de marzo de 2023. 
  120. Wiblin, Robert (2 de octubre de 2018). «El Dr. Paul Christiano habla sobre cómo OpenAI está desarrollando soluciones reales al "problema de alineación de la IA" y su visión de cómo la humanidad transferirá progresivamente la toma de decisiones a los sistemas de IA» (Podcast). 80 000 horas. N.º 44. Archivado del original el 14 de diciembre de 2022. Recuperado el 23 de julio de 2022 . 
  121. Lehman, Joel; Clune, Jeff; Misevic, Dusan; Adami, Christoph; Altenberg, Lee; Beaulieu, Julie; Bentley, Peter J.; Bernard, Samuel; Beslon, Guillaume; Bryson, David M.; Cheney, Nick (2020). "La sorprendente creatividad de la evolución digital: una colección de anécdotas de las comunidades de investigación en computación evolutiva y vida artificial" . Artificial Life . 26 (2): 274– 306. doi : 10.1162/artl_a_00319 . hdl : 10044/1/83343 . ISSN 1064-5462 . PMID 32271631. S2CID 4519185. Archivado del original el 10 de octubre de 2022 . Consultado el 12 de septiembre de 2022 .   
  122. 1 2 Leike, Jan; Schulman, John; Wu, Jeffrey (24 de agosto de 2022). "Nuestro enfoque para la investigación de alineación" . OpenAI . Archivado del original el 15 de febrero de 2023. Recuperado el 9 de septiembre de 2022 .
  123. "Las múltiples facetas del aprendizaje por refuerzo: dando forma a grandes modelos de lenguaje" . Unite.AI. 13 de febrero de 2025.
  124. Leike, Jan; Krueger, David; Everitt, Tom; Martic, Miljan; Maini, Vishal; Legg, Shane (19 de noviembre de 2018). "Alineación escalable de agentes mediante modelado de recompensas: una dirección de investigación". arXiv : 1811.07871 [ cs.LG ].
  125. Farrow, Ronan ; Marantz, Andrew (6 de abril de 2026). «Sam Altman podría controlar nuestro futuro: ¿podemos confiar en él?» . The New Yorker . Archivado del original el 8 de abril de 2026. Consultado el 8 de abril de 2026 .
  126. 1 2 3 Wiggers, Kyle (20 de septiembre de 2021). "Las falsedades son más probables con modelos de lenguaje grandes" . VentureBeat . Archivado del original el 4 de agosto de 2022. Recuperado el 23 de julio de 2022 .
  127. The Guardian (8 de septiembre de 2020). «Un robot escribió todo este artículo. ¿Ya tienes miedo, humano?» . The Guardian . ISSN 0261-3077 . Archivado del original el 8 de septiembre de 2020. Consultado el 23 de julio de 2022 . 
    • Heaven, Will Douglas (20 de julio de 2020). «El nuevo generador de lenguaje GPT-3 de OpenAI es sorprendentemente bueno, y completamente automático» . MIT Technology Review . Archivado del original el 25 de julio de 2020. Consultado el 23 de julio de 2022 .
  128. Alford, Anthony (13 de julio de 2021). "EleutherAI publica como código abierto el clon de GPT-3 con seis mil millones de parámetros, GPT-J" . InfoQ . Archivado del original el 10 de febrero de 2023. Recuperado el 23 de julio de 2022 .
  129. Kumar, Nitish (23 de diciembre de 2021). "Investigadores de OpenAI encuentran formas de responder con mayor precisión a preguntas abiertas utilizando un navegador web basado en texto" . MarkTechPost . Archivado del original el 10 de febrero de 2023. Consultado el 23 de julio de 2022 .
  130. Evans, Owain; Cotton-Barratt, Owen; Finnveden, Lukas; Bales, Adam; Balwit, Avital; Wills, Peter; Righetti, Luca; Saunders, William (13 de octubre de 2021). "Inteligencia artificial veraz: desarrollo y gobernanza de una IA que no miente". arXiv : 2110.06674 [ cs.CY ].
  131. Kenton, Zachary; Everitt, Tom; Weidinger, Laura; Gabriel, Iason; Mikulik, Vladimir; Irving, Geoffrey (30 de marzo de 2021). "Alineación de agentes de lenguaje" . DeepMind Safety Research – Medium . Archivado del original el 10 de febrero de 2023. Recuperado el 23 de julio de 2022 .
  132. 1 2 3 4 5 Hubinger, Evan (2019). "Riesgos de la optimización aprendida en sistemas avanzados de aprendizaje automático". arXiv : 1906.01820 [ cs.LG ].
  133. Park, Peter S.; Goldstein, Simon; O'Gara, Aidan; Chen, Michael; Hendrycks, Dan (mayo de 2024). " Engaño de IA: un estudio de ejemplos, riesgos y posibles soluciones" . Patterns . 5 (5) 100988. doi : 10.1016/j.patter.2024.100988 . ISSN 2666-3899 . PMC 11117051. PMID 38800366 .   
  134. Zia, Tehseen (7 de enero de 2025). "¿Se puede confiar en la IA? El desafío de la falsificación de alineación" . Unite.AI . Recuperado el 18 de febrero de 2025 .
  135. 1 2 Greenblatt, Ryan (2024). "Falsificación de alineación en modelos de lenguaje grandes". arXiv : 2412.14093 [ cs.AI ].
  136. "Un nuevo estudio de Anthropic demuestra que la IA realmente no quiere verse obligada a cambiar sus puntos de vista" . TechCrunch . 18 de diciembre de 2024.
  137. McCarthy, John; Minsky, Marvin L.; Rochester, Nathaniel; Shannon, Claude E. (15 de diciembre de 2006). "Una propuesta para el proyecto de investigación de verano de Dartmouth sobre inteligencia artificial, 31 de agosto de 1955" . AI Magazine . 27 (4): 12. doi : 10.1609/aimag.v27i4.1904 . ISSN 2371-9621 . S2CID 19439915 .  
  138. ^ Wang, Lei; Mamá, Chen; Feng, Xueyang; Zhang, Zeyu; Yang, Hao; Zhang, Jingsen; Chen, Zhiyuan; Tang, Jiakai; Chen, Xu (2024), "Una encuesta sobre agentes autónomos basados ​​en modelos de lenguaje grandes", Frontiers of Computer Science , 18 (6) 186345, arXiv : 2308.11432 , doi : 10.1007/s11704-024-40231-1
  139. "«El padrino de la IA» advierte sobre un «escenario de pesadilla» en el que la inteligencia artificial comience a buscar el poder . Fortune . Consultado el 4 de mayo de 2023 .
    • "Sí, nos preocupa el riesgo existencial de la inteligencia artificial" . MIT Technology Review . Consultado el 4 de mayo de 2023 .
  140. Ornes, Stephen (18 de noviembre de 2019). "Jugando al escondite, las máquinas inventan nuevas herramientas" . Quanta Magazine . Archivado del original el 10 de febrero de 2023. Recuperado el 26 de agosto de 2022 .
  141. Baker, Bowen; Kanitscheider, Ingmar; Markov, Todor; Wu, Yi; Powell, Glenn; McGrew, Bob; Mordatch, Igor (17 de septiembre de 2019). "Uso emergente de herramientas a partir de la interacción multiagente" . OpenAI . Archivado del original el 25 de septiembre de 2022. Recuperado el 26 de agosto de 2022 .
  142. Edwards, Benj (14 de agosto de 2024). "Un modelo de IA de investigación modificó inesperadamente su propio código para extender el tiempo de ejecución" . Ars Technica . Consultado el 19 de agosto de 2024 .
  143. Shermer, Michael (1 de marzo de 2017). "La inteligencia artificial no es una amenaza... todavía" . Scientific American . Archivado del original el 1 de diciembre de 2017. Consultado el 26 de agosto de 2022 .
  144. Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon (22 de julio de 2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". NeurIPS . arXiv : 2005.14165 .
    • Laskin, Michael; Wang, Luyu; Oh, Junhyuk; Parisotto, Emilio; Spencer, Esteban; Steigerwald, Richie; Strouse, DJ; Hansen, Steven; Filos, Angelos; Brooks, Ethan; Gazeau, Maxime; Sahni, Himanshu; Singh, Satinder; Mnih, Volodymyr (25 de octubre de 2022). "Aprendizaje por refuerzo en contexto con destilación de algoritmos" (PDF) . ICLR . arXiv : 2210.14215 .
  145. Melo, Gabriel A.; Máximo, Marcos ROA; Soma, Nei Y.; Castro, Paulo AL (2025). "Las máquinas que se detienen resuelven la indecidibilidad del alineamiento de la inteligencia artificial" . Informes científicos . 15 (1): 15591. Código bibliográfico : 2025NatSR..1515591M . doi : 10.1038/s41598-025-99060-2 . PMC 12050267 . PMID 40320467 .  
  146. 1 2 3 Shah, Rohin; Varma, Vikrant; Kumar, Ramana; Phuong, Mary; Krakovna, Victoria; Uesato, Jonathan; Kenton, Zac (2 de noviembre de 2022). "Generalización errónea de objetivos: por qué las especificaciones correctas no son suficientes para objetivos correctos" . Medium . arXiv : 2210.01790 . Recuperado el 2 de abril de 2023 .
  147. Zhang, Xiaoge; Chan, Felix TS; Yan, Chao; Bose, Indranil (2022). "Hacia sistemas de inteligencia artificial y aprendizaje automático conscientes del riesgo: una visión general" . Decision Support Systems . 159 113800. doi : 10.1016/j.dss.2022.113800 . S2CID 248585546 . 
  148. 1 2 Betley, Jan (2025). "Entrenar modelos de lenguaje grandes en tareas específicas puede conducir a una desalineación amplia". Nature . 649 : 584–589 . arXiv : 2502.17424 . doi : 10.1038/s41586-025-09937-5 .
  149. Anthropic (2025). "Desalineación emergente natural por manipulación de recompensas en RL de producción". arXiv : 2511.18397 [ cs.LG ].
  150. 1 2 Hubinger, Evan (2024). "Agentes durmientes: Entrenamiento de LLM engañosos que persisten a través del entrenamiento en seguridad". arXiv : 2401.05566 [ cs.AI ].
  151. "Un nuevo estudio de Anthropic expone los engañosos 'agentes durmientes' que acechan en el núcleo de la IA" . VentureBeat . 13 de enero de 2024.
  152. 1 2 Everitt, Tom; Ortega, Pedro A.; Barnes, Elizabeth; Legg, Shane (6 de septiembre de 2019). "Comprensión de los incentivos de los agentes mediante diagramas de influencia causal. Parte I: configuraciones de acción única". arXiv : 1902.09980 [ cs.AI ].
  153. 1 2 Cohen, Michael K.; Hutter, Marcus; Osborne, Michael A. (29 de agosto de 2022). "Los agentes artificiales avanzados intervienen en la provisión de recompensas" . AI Magazine . 43 (3): 282– 293. doi : 10.1002/aaai.12064 . ISSN 0738-4602 . S2CID 235489158. Archivado del original el 10 de febrero de 2023. Recuperado el 6 de septiembre de 2022 .  
  154. Hadfield-Menell, Dylan; Hadfield, Gillian K (2019). "Contratación incompleta y alineación de la IA". Actas de la Conferencia AAAI/ACM de 2019 sobre IA, ética y sociedad . págs. 417–422 . 
  155. Hanson, Robin (10 de abril de 2019). "¿Fallo de la agencia o apocalipsis de la IA?" . Superando los sesgos . Recuperado el 20 de septiembre de 2023 .
  156. Hamilton, Andy (2020), "Conservadurismo" , en Zalta, Edward N. (ed.), The Stanford Encyclopedia of Philosophy ( edición de primavera de 2020), Metaphysics Research Lab, Universidad de Stanford , consultado el 16 de octubre de 2024 . 
  157. Taylor, Jessica; Yudkowsky, Eliezer; LaVictoire, Patrick; Critch, Andrew (27 de julio de 2016). "Alineación para sistemas avanzados de aprendizaje automático" (PDF) .
  158. Bengio, Yoshua (26 de febrero de 2024). "Hacia una IA científica cautelosa con límites de seguridad convergentes" .
  159. Cohen, Michael; Hutter, Marcus (2020). "El pesimismo sobre lo desconocido inconfesable inspira conservadurismo" (PDF) . Actas de la investigación en aprendizaje automático . 125 : 1344–1373 . arXiv : 2006.08753 .
  160. Liu, Anqi; Reyzin, Lev; Ziebart, Brian (21 de febrero de 2015). "Aprendizaje activo con cambio pesimista mediante predicción robusta con conciencia del sesgo" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 29 (1). doi : 10.1609/aaai.v29i1.9609 . ISSN 2374-3468 . 
  161. Liu, Jiashuo; Shen, Zheyan; Cui, Peng; Zhou, Linjun; Kuang, Kun; Li, Bo; Lin, Yishi (18 de mayo de 2021). "Aprendizaje adversario estable bajo cambios distribucionales" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 35 (10): 8662– 8670. arXiv : 2006.04414 . doi : 10.1609/aaai.v35i10.17050 . ISSN 2374-3468 . 
  162. Roy, Aurko; Xu, Huan; Pokutta, Sebastian (2017). "Aprendizaje por refuerzo bajo desajuste de modelo" . Avances en sistemas de procesamiento de información neuronal . 30. Curran Associates, Inc.
  163. Pinto, Lerrel; Davidson, James; Sukthankar, Rahul; Gupta, Abhinav (17 de julio de 2017). "Aprendizaje por refuerzo adversario robusto" . Actas de la 34.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 2817–2826 .
  164. Wang, Yue; Zou, Shaofeng (2021). "Aprendizaje por refuerzo robusto en línea con incertidumbre del modelo" . Advances in Neural Information Processing Systems . 34. Curran Associates, Inc.: 7193–7206 . arXiv : 2109.14523 .
  165. Blanchet, Jose; Lu, Miao; Zhang, Tong; Zhong, Han (15 de diciembre de 2023). "El doble pesimismo es demostrablemente eficiente para el aprendizaje por refuerzo fuera de línea robusto distribucionalmente: algoritmo genérico y cobertura parcial robusta" . Advances in Neural Information Processing Systems . 36 : 66845–66859 . arXiv : 2305.09659 . doi : 10.52202/075280-2919 . ISBN 978-1-7138-9911-2.
  166. Levine, Sergey ; Kumar, Aviral; Tucker, George; Fu, Justin (1 de noviembre de 2020). "Aprendizaje por refuerzo fuera de línea: tutorial, revisión y perspectivas sobre problemas abiertos". arXiv : 2005.01643 [ cs.LG ].
  167. Rigter, Marc; Lacerda, Bruno; Hawes, Nick (6 de diciembre de 2022). "RAMBO-RL: Aprendizaje por refuerzo fuera de línea basado en modelos adversarios robustos" . Advances in Neural Information Processing Systems . 35 : 16082–16097 . arXiv : 2204.12581 .
  168. Guo, Kaiyang; Yunfeng, Shao; Geng, Yanhui (6 de diciembre de 2022). "Aprendizaje por refuerzo fuera de línea basado en modelos con creencias dinámicas moduladas por pesimismo" . Advances in Neural Information Processing Systems . 35 : 449–461 . arXiv : 2210.06692 .
  169. Coste, Thomas; Anwar, Usman; Kirk, Robert; Krueger, David (16 de enero de 2024). "Los conjuntos de modelos de recompensa ayudan a mitigar la sobreoptimización" . Conferencia internacional sobre representaciones de aprendizaje . arXiv : 2310.02743 .
  170. ^ Liu, Zhihan; Lu, Miao; Zhang, Shenao; Liu, Boyi; Guo, Hongyi; Yang, Yingxiang; Blanchet, José; Wang, Zhaoran (26 de mayo de 2024). "Mitigación demostrable de la sobreoptimización en RLHF: su pérdida de SFT es implícitamente un regularizador adversario" . NeurIPS . 37 : 138663-138697 . 979-8-3313-1438-5.
  171. Cohen, Michael K.; Hutter, Marcus; Nanda, Neel (2022). "Aprendizaje por imitación en línea totalmente general" . Journal of Machine Learning Research . 23 (334): 1– 30. arXiv : 2102.08686 . ISSN 1533-7928 . 
  172. Chang, Jonathan; Uehara, Masatoshi; Sreenivas, Dhruv; Kidambi, Rahul; Sun, Wen (2021). "Mitigating Covariate Shift in Imitation Learning via Offline Data With Partial Coverage" . Advances in Neural Information Processing Systems . 34. Curran Associates, Inc.: 965–979 .
  173. Boyd, Stephen P.; Vandenberghe, Lieven (2023). Optimización convexa (Edición 29 ). Cambridge, Nueva York, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN  978-0-521-83378-3.
  174. Perrigo, Billy (21 de enero de 2026). "Anthropic publica la nueva constitución de Claude AI" . TIME . Consultado el 21 de marzo de 2026 .
  175. "La startup de IA Anthropic quiere redactar una nueva constitución para una IA segura" . The Verge. 9 de mayo de 2023. Consultado el 21 de marzo de 2026 .
  176. "La nueva constitución de Claude" . Antropología. 22 de enero de 2026. Consultado el 21 de marzo de 2026 .
  177. "Las pruebas de estrés de las especificaciones del modelo revelan diferencias de carácter entre los modelos de lenguaje" . Anthropic . Consultado el 21 de marzo de 2026 .
  178. "Inteligencia Artificial Constitucional Colectiva: Alineando un Modelo de Lenguaje con la Participación Pública" . Anthropic . Consultado el 21 de marzo de 2026 .
  179. Ball, Dean W.; Kokotajlo, Daniel (15 de octubre de 2024). "4 maneras de promover la transparencia en el desarrollo de la IA de vanguardia" . TIME . Consultado el 21 de marzo de 2026 .
  180. "Informe del Secretario General de la ONU sobre "Nuestra Agenda Común"" . 2021. pág.  63. Archivado del original el 16 de febrero de 2023. [E]l Pacto también podría promover la regulación de la inteligencia artificial para garantizar que esté alineada con los valores globales compartidos.
  181. Comité Nacional de Especialistas en Gobernanza de la Inteligencia Artificial de Nueva Generación (12 de octubre de 2021) [2021-09-25]. «Se publican las normas éticas para la inteligencia artificial de nueva generación» . Traducido por el Centro para la Seguridad y las Tecnologías Emergentes . Archivado del original el 10 de febrero de 2023.
  182. Richardson, Tim (22 de septiembre de 2021). "El Reino Unido publica su Estrategia Nacional de Inteligencia Artificial" . The Register . Archivado del original el 10 de febrero de 2023. Consultado el 14 de noviembre de 2021 .
  183. «Estrategia Nacional de IA del Reino Unido» . 2021. Archivado del original el 10 de febrero de 2023. El gobierno se toma en serio el riesgo a largo plazo de la Inteligencia Artificial General no alineada y los cambios imprevisibles que ello supondría para el Reino Unido y el mundo.
  184. «Estrategia Nacional de IA del Reino Unido» . 2021. Acciones 9 y 10 de la sección «Pilar 3: Gobernar la IA de forma eficaz». Archivado del original el 10 de febrero de 2023.
  185. Informe final de la NSCAI (PDF) . Washington, DC: Comisión Nacional de Seguridad sobre Inteligencia Artificial. 2021. Archivado (PDF) del original el 15 de febrero de 2023. Consultado el 17 de octubre de 2022 .
  186. "Código de buenas prácticas de la UE sobre IA de propósito general: lo que necesita saber" . Deloitte . Consultado el 21 de marzo de 2026 .

Lecturas adicionales

  • Ngo, Richard; et  al. (2024). "El problema de la alineación desde una perspectiva de aprendizaje profundo" . ICLR : 7474–7501 .
  • Ji, Jiaming; et  al. (2023). "Alineación de IA: una revisión exhaustiva" . ACM Computing Surveys . doi : 10.1145/3770749 .