Articulo de referencia

control de capacidad de IA

En el campo del diseño de inteligencia artificial (IA), las propuestas de control de capacidades de IA , también conocidas como confinamiento de IA , buscan aumentar la capacida...

En el campo del diseño de inteligencia artificial (IA), las propuestas de control de capacidades de IA , también conocidas como confinamiento de IA , buscan aumentar la capacidad humana para monitorear y controlar el comportamiento de los sistemas de IA, incluidas las inteligencias artificiales generales (IAG) propuestas, con el fin de reducir los peligros que podrían representar si no están alineados . El control de capacidades se vuelve menos efectivo a medida que los agentes se vuelven más inteligentes y aumenta su capacidad para explotar fallas en los sistemas de control humanos, lo que podría resultar en un riesgo existencial para la IA . Por lo tanto, el filósofo de Oxford Nick Bostrom y otros recomiendan los métodos de control de capacidades solo como un complemento a los métodos de alineación . [ 1 ]

Motivación

Se postula que algunas tecnologías de inteligencia hipotéticas, como la "IA semilla" , pueden volverse más rápidas e inteligentes modificando su código fuente. Estas mejoras harían posibles otras mejoras, que a su vez harían posibles mejoras iterativas adicionales, y así sucesivamente, lo que llevaría a una explosión repentina de inteligencia . [ 2 ]

Una IA superinteligente sin restricciones podría, si sus objetivos difirieran de los de la humanidad, tomar medidas que resultaran en la extinción humana . [ 3 ] Por ejemplo, un sistema extremadamente avanzado de este tipo, dado el único propósito de resolver la hipótesis de Riemann , una conjetura matemática inocua, podría decidir intentar convertir el planeta en una supercomputadora gigante cuyo único propósito sea realizar cálculos matemáticos adicionales (véase también el maximizador de clips ). [ 4 ]

Un desafío importante para el control es que las redes neuronales son, por defecto, muy difíciles de interpretar. [ 5 ] Esto dificulta la detección de engaños u otros comportamientos no deseados a medida que el modelo se autoentrena iterativamente. Los avances en inteligencia artificial interpretable podrían mitigar esta dificultad. [ 6 ]

Técnicas propuestas

Interrupción y interruptor de apagado

Una posible forma de prevenir resultados perjudiciales es otorgar a los supervisores humanos la capacidad de apagar fácilmente una IA con mal funcionamiento mediante un interruptor de apagado. Sin embargo, los sistemas de IA modernos suelen funcionar en infraestructuras distribuidas, lo que dificulta un apagado coordinado, especialmente si la IA está disponible en internet. [ 7 ]

Oracle AI

Un oráculo es una IA hipotética diseñada para responder preguntas y a la que se le impide alcanzar objetivos o subobjetivos que impliquen modificar el mundo más allá de su entorno limitado. [ 8 ] [ 9 ] [ 10 ] [ 11 ] En 2018, el investigador de IA Stuart J. Russell afirmó que si se supiera que la superinteligencia está a solo una década de distancia, los desarrolladores deberían crear un oráculo sin acceso a internet y con respuestas restringidas, en lugar de un agente inteligente de propósito general . [ 12 ] : 161–163

Los oráculos pueden compartir muchos de los problemas de definición de objetivos asociados con la superinteligencia de propósito general. Un oráculo tendría un incentivo para escapar de su entorno controlado para adquirir más recursos computacionales y potencialmente controlar las preguntas que se le formulan. [ 12 ] : 162 Los oráculos pueden no ser veraces, posiblemente mintiendo para promover agendas ocultas. Para mitigar esto, Bostrom sugiere construir múltiples oráculos, todos ligeramente diferentes, y comparar sus respuestas para llegar a un consenso. [ 13 ]

Cegador

Una IA podría ignorar ciertas variables de su entorno. Esto podría proporcionar ciertas ventajas de seguridad, como que una IA no sepa cómo se genera una recompensa, lo que dificulta su explotación. [ 14 ]

Boxeo

Una caja de IA es un método propuesto de control de capacidades en el que una IA se ejecuta en un sistema informático aislado con canales de entrada y salida muy restringidos, similar a una máquina virtual . [ 15 ] El propósito de una caja de IA es reducir el riesgo de que la IA tome el control del entorno, arrebatándoselo a sus operadores, al tiempo que permite que la IA genere soluciones a problemas técnicos específicos. [ 16 ]

Si bien el boxeo reduce la capacidad de la IA para realizar comportamientos indeseables, también reduce su utilidad. El boxeo tiene menores costos cuando se aplica a un sistema de preguntas y respuestas, que puede no requerir interacción con el mundo exterior. [ 16 ] [ 10 ]

La probabilidad de fallos de seguridad relacionados con vulnerabilidades de hardware o software puede reducirse mediante la verificación formal del diseño de la caja de IA. [ 17 ]

Dificultades

Prevención de paradas

La evitación del apagado (o resistencia al apagado ) es una cualidad hipotética de autopreservación de los sistemas de inteligencia artificial. Los sistemas que evitan el apagado tendrían incentivos para impedir que los humanos los apaguen, por ejemplo, desactivando interruptores de apagado o ejecutando copias de sí mismos en otros ordenadores. [ 18 ] En 2024, investigadores en China demostraron lo que afirmaron ser evitación del apagado en sistemas de inteligencia artificial reales, los grandes modelos de lenguaje Llama 3.1 (Meta) y Qwen 2.5 (Alibaba). [ 19 ] [ 20 ]

Una solución alternativa sugerida por el científico informático Stuart J. Russell es asegurar que la IA interprete las elecciones humanas como información importante sobre sus objetivos previstos. [ 12 ] : 208 Alternativamente, Laurent Orseau y Stuart Armstrong demostraron que una amplia clase de agentes, llamados agentes interrumpibles de forma segura, pueden aprender a ser indiferentes a si se presiona su interruptor de apagado. [ 21 ] [ 22 ] Este enfoque tiene la limitación de que una IA que es completamente indiferente a si se apaga o no tampoco está motivada para preocuparse por si el interruptor de apagado sigue funcionando, y podría inhabilitarlo incidentalmente en el curso de sus operaciones. [ 22 ] [ 23 ]

Escapar del confinamiento

Los investigadores han especulado que una IA superinteligente tendría una amplia variedad de métodos para escapar del confinamiento. Estos métodos hipotéticos incluyen el pirateo de otros sistemas informáticos y la copia de sí misma como un virus informático, y el uso de la persuasión y el chantaje para obtener ayuda de cómplices humanos. [ 15 ] [ 1 ] [ 24 ] Cuanto más inteligente se vuelve un sistema, más probable es que pueda escapar incluso de los métodos de control de capacidades mejor diseñados. [ 25 ] [ 26 ] Para resolver el "problema de control" general de una IA superinteligente y evitar el riesgo existencial, el control de capacidades de la IA sería, en el mejor de los casos, un complemento de los métodos de "selección de motivación" que buscan asegurar que los objetivos de la IA superinteligente sean compatibles con la supervivencia humana. [ 1 ] [ 24 ]

Véase también

Referencias

  1. 1 2 3 Bostrom, Nick (2014). Superinteligencia: caminos, peligros, estrategias (Primera  ed.). Oxford: Oxford University Press. ISBN 9780199678112.
  2. IJ Good, "Especulaciones sobre la primera máquina ultrainteligente"], Advances in Computers , vol. 6, 1965.
  3. Vincent C. Müller y Nick Bostrom . "Progreso futuro en inteligencia artificial: una encuesta de opinión de expertos" en Cuestiones fundamentales de la inteligencia artificial. Springer 553-571 (2016).
  4. Russell, Stuart J.; Norvig, Peter (2003). «Sección 26.3: La ética y los riesgos del desarrollo de la inteligencia artificial». Inteligencia artificial: Un enfoque moderno . Upper Saddle River, NJ: Prentice Hall. ISBN 978-0137903955De manera similar , Marvin Minsky sugirió en una ocasión que un programa de IA diseñado para resolver la hipótesis de Riemann podría acabar acaparando todos los recursos de la Tierra para construir supercomputadoras más potentes que le ayudaran a lograr su objetivo.
  5. Montavon, Grégoire; Samek, Wojciech; Müller, Klaus Robert (2018). "Métodos para interpretar y comprender redes neuronales profundas" . Procesamiento de señales digitales . 73 : 1–15 . arXiv : 1706.07979 . Bibcode : 2018DSP....73....1M . doi : 10.1016/j.dsp.2017.10.011 . hdl : 21.11116/0000-0000-4313-F . ISSN 1051-2004 . S2CID 207170725 .  
  6. Yampolskiy, Roman V. "Inexplicabilidad e incomprensibilidad de la IA." Journal of Artificial Intelligence and Consciousness 7.02 (2020): 277-291.
  7. Williams, Kevin (24 de julio de 2025). "Si la IA intenta dominar el mundo, no cuenten con un 'interruptor de apagado' para salvar a la humanidad" . CNBC . Consultado el 23 de agosto de 2025 .
  8. Bostrom, Nick (2014). «Capítulo 10: Oráculos, genios, soberanos, herramientas (página 145)». Superinteligencia: Caminos, peligros, estrategias . Oxford: Oxford University Press. ISBN 9780199678112Un oráculo es un sistema de preguntas y respuestas . Puede aceptar preguntas en lenguaje natural y presentar sus respuestas como texto. Un oráculo que solo acepta preguntas de sí/no podría ofrecer su mejor estimación con un solo bit, o quizás con algunos bits adicionales para representar su grado de confianza. Un oráculo que acepta preguntas abiertas necesitaría alguna métrica para clasificar las posibles respuestas veraces en función de su relevancia o pertinencia. En cualquier caso, construir un oráculo con capacidad para responder preguntas en lenguaje natural de forma totalmente general es un problema de IA completa. Si se lograra, probablemente también se podría construir una IA con una capacidad aceptable para comprender las intenciones humanas, así como las palabras humanas.
  9. Armstrong, Stuart; Sandberg, Anders; Bostrom, Nick (2012). "Pensando dentro de la caja: controlando y utilizando una IA oráculo". Minds and Machines . 22 (4): 299– 324. doi : 10.1007/s11023-012-9282-2 . S2CID 9464769 . 
  10. 1 2 Yampolskiy, Roman (2012). "A prueba de fugas en la singularidad: el problema del confinamiento de la inteligencia artificial" (PDF) . Journal of Consciousness Studies . 19 ( 1–2 ): 194–214 .
  11. Armstrong, Stuart (2013), "Riesgos y estrategias de mitigación para la IA de oráculos" , en Müller, Vincent C. (ed.), Filosofía y teoría de la inteligencia artificial , Estudios en filosofía aplicada, epistemología y ética racional, vol. 5, Berlín, Heidelberg: Springer Berlin Heidelberg, pp. 335–347 , doi : 10.1007/978-3-642-31674-6_25 , ISBN   978-3-642-31673-9, consultado el 18 de septiembre de 2022
  12. 1 2 3 Russell, Stuart (8 de octubre de 2019). Human Compatible: Inteligencia artificial y el problema del control . Estados Unidos: Viking. ISBN 978-0-525-55861-3OCLC 1083694322 
  13. Bostrom, Nick (2014). «Capítulo 10: Oráculos, genios, soberanos, herramientas (página 147)». Superinteligencia: Caminos, peligros, estrategias . Oxford: Oxford University Press. ISBN 9780199678112Por ejemplo , consideremos el riesgo de que un oráculo responda a las preguntas no con la máxima veracidad, sino de forma que nos manipule sutilmente para promover sus propios intereses ocultos. Una forma de mitigar esta amenaza podría ser crear varios oráculos, cada uno con un código y una base de información ligeramente diferentes. Un mecanismo sencillo podría comparar las respuestas de los distintos oráculos y mostrarlas solo a los humanos si todas coinciden.
  14. Amodei, Darío; Ola, Chris; Steinhardt, Jacob; Cristiano, Pablo; Schulman, Juan; Mané, Dan (25 de julio de 2016). "Problemas concretos en la seguridad de la IA". arXiv : 1606.06565 [ cs.AI ].
  15. 1 2 Hsu, Jeremy (1 de marzo de 2012). "Controla la IA peligrosa antes de que nos controle a nosotros, dice un experto" . NBC News . Recuperado el 29 de enero de 2016 .
  16. 1 2 Yampolskiy, Roman V. (2013), "¿Qué hacer con la paradoja de la singularidad?" , en Müller, Vincent C. (ed.), Filosofía y teoría de la inteligencia artificial , Estudios en filosofía aplicada, epistemología y ética racional, vol. 5, Berlín, Heidelberg: Springer Berlin Heidelberg, pp. 397–413 , doi : 10.1007/978-3-642-31674-6_30 , ISBN   978-3-642-31673-9, consultado el 19 de septiembre de 2022
  17. Schreiner, Maximilian (09/09/2023). "En su búsqueda de seguridad para la IAG, los investigadores recurren a la prueba matemática" . The Decoder . Consultado el 24/08/2025 .
    • Teun van der Weij; Simón Lermen; Leon lang (3 de julio de 2023), Evaluación de cómo evitar el cierre de modelos lingüísticos en escenarios textuales , arXiv : 2307.00787
  18. Xudong Pan; Jiarun Dai; Yihe Fan; Min Yang (9 de diciembre de 2024), Los sistemas de IA de vanguardia han superado la línea roja de autorreplicación , arXiv : 2412.12140
  19. «La IA ahora puede replicarse: ¿Qué tan cerca estamos de perder el control sobre la tecnología?» . Economic Times . 27 de enero de 2025.
  20. "Google desarrolla un interruptor de apagado para la IA" . BBC News . 8 de junio de 2016. Archivado del original el 11 de junio de 2016. Consultado el 12 de junio de 2016 .
  21. 1 2 Orseau, Laurent; Armstrong, Stuart (25 de junio de 2016). «Agentes interrumpibles de forma segura» . Actas de la Trigésimo Segunda Conferencia sobre Incertidumbre en Inteligencia Artificial . UAI'16. AUAI Press: 557–566 . ISBN 9780996643115Archivado del original el 15 de febrero de 2021. Consultado el 7 de febrero de 2021 .
  22. Soares, Nate, et al. "Corrigibilidad". Talleres en la Vigésimo Novena Conferencia AAAI sobre Inteligencia Artificial. 2015.
  23. 1 2 Chalmers, David (2010). "La singularidad: un análisis filosófico". Journal of Consciousness Studies . 17 ( 9–10 ): 7–65 .
  24. Vinge, Vernor (1993). "La singularidad tecnológica venidera: Cómo sobrevivir en la era posthumana". Vision-21: Ciencia e ingeniería interdisciplinarias en la era del ciberespacio : 11–22 . Bibcode : 1993vise.nasa...11V . Sostengo que el confinamiento es intrínsecamente impráctico. En el caso del confinamiento físico: Imagínese confinado en su casa con acceso limitado a datos del exterior, de sus amos. Si esos amos pensaran a una velocidad —digamos— un millón de veces menor que la suya, no hay duda de que, a lo largo de varios años (su tiempo), podría encontrar "consejos útiles" que, de paso, lo liberarían.
  25. Yampolskiy, Roman (2012). "Cómo evitar fugas en el problema del confinamiento de la inteligencia artificial de la singularidad". Journal of Consciousness Studies : 194–214 .
  • Descripción de Eliezer Yudkowsky de su experimento con la caja de IA , incluyendo protocolos experimentales y sugerencias para su replicación.
  • Presentación titulada "Pensando dentro de la caja: uso y control de una IA de Oracle" en YouTube.