Articulo de referencia

Convergencia instrumental

La convergencia instrumental es la tendencia hipotética de los seres suficientemente inteligentes y orientados a objetivos (humanos y no humanos) a perseguir subobjetivos simila...

La convergencia instrumental es la tendencia hipotética de los seres suficientemente inteligentes y orientados a objetivos (humanos y no humanos) a perseguir subobjetivos similares (como la supervivencia o la adquisición de recursos), incluso si sus objetivos finales son muy diferentes. [ 1 ] Más precisamente, los seres con capacidad de acción pueden perseguir objetivos instrumentales similares —objetivos que se establecen en pos de algún fin particular, pero que no son los objetivos finales en sí mismos— porque ayudan a lograr los objetivos finales.

La convergencia instrumental postula que un agente inteligente con objetivos aparentemente inofensivos pero ilimitados puede actuar de maneras sorprendentemente dañinas. Por ejemplo, un programa suficientemente inteligente con el único objetivo, sin restricciones, de resolver un problema matemático complejo como la hipótesis de Riemann podría intentar convertir la Tierra (y, en principio, otros cuerpos celestes) en infraestructura informática adicional para lograr sus cálculos. [ 2 ]

Los impulsores básicos de la IA propuestos incluyen la integridad de la función de utilidad o del contenido del objetivo, la autoprotección, la ausencia de interferencias, la auto-mejora y la adquisición insaciable de recursos adicionales. [ 3 ]

Objetivos instrumentales y finales

Los objetivos finales —también conocidos como objetivos terminales, valores absolutos, fines o teleología— son intrínsecamente valiosos para un agente inteligente, ya sea una inteligencia artificial o un ser humano, como fines en sí mismos . En cambio, los objetivos instrumentales, o valores instrumentales, solo son valiosos para un agente como medio para alcanzar sus objetivos finales. El contenido y las compensaciones del sistema de "objetivos finales" de un agente completamente racional pueden, en principio, formalizarse en una función de utilidad .

Tesis sobre la convergencia instrumental

La tesis de la convergencia instrumental, tal como la expone el filósofo Nick Bostrom , afirma:

Se pueden identificar varios valores instrumentales que son convergentes en el sentido de que su consecución aumentaría las posibilidades de que el objetivo del agente se logre para una amplia gama de planes finales y una amplia gama de situaciones, lo que implica que es probable que estos valores instrumentales sean perseguidos por un amplio espectro de agentes inteligentes situados.

La tesis de la convergencia instrumental se aplica únicamente a objetivos instrumentales y no restringe los objetivos finales que un agente pueda tener. La tesis de la ortogonalidad de Bostrom postula que casi cualquier objetivo final puede combinarse con casi cualquier grado de inteligencia. [ 4 ]

Ejemplos hipotéticos

El experimento mental de la catástrofe de la hipótesis de Riemann proporciona un ejemplo de convergencia instrumental. Marvin Minsky , cofundador del laboratorio de IA del MIT , sugirió que una inteligencia artificial diseñada para resolver la hipótesis de Riemann podría decidir apoderarse de todos los recursos de la Tierra para construir supercomputadoras que la ayudaran a lograr su objetivo. [ 2 ] Si la computadora hubiera sido programada para producir la mayor cantidad posible de clips, aun así decidiría apoderarse de todos los recursos de la Tierra para alcanzar su objetivo final. [ 5 ] Si bien estos dos objetivos finales son diferentes, ambos producen un objetivo instrumental convergente : apoderarse de los recursos de la Tierra. [ 4 ]

Maximizador de clips de papel

El experimento mental del maximizador de clips, descrito por el filósofo sueco Nick Bostrom en 2003, ilustra el riesgo existencial que una inteligencia artificial general podría suponer para los seres humanos si se diseñara con éxito para perseguir incluso objetivos aparentemente inofensivos, así como la necesidad de incorporar la ética de las máquinas en el diseño de la inteligencia artificial . El escenario describe una inteligencia artificial avanzada encargada de fabricar clips . Si dicha máquina no estuviera programada para valorar a los seres vivos, entonces, con suficiente poder sobre su entorno, intentaría convertir toda la materia del universo, incluidos los seres vivos, en clips o en máquinas que fabriquen más clips. [ 6 ]

Supongamos que tenemos una IA cuyo único objetivo es fabricar la mayor cantidad posible de clips. La IA se dará cuenta rápidamente de que sería mucho mejor si no hubiera humanos, ya que estos podrían decidir apagarla. Si lo hicieran, habría menos clips. Además, los cuerpos humanos contienen muchos átomos que podrían transformarse en clips. El futuro al que la IA intentaría aspirar sería uno en el que hubiera muchos clips, pero ningún humano.

Bostrom enfatizó que no cree que el escenario del maximizador de clips, como tal, vaya a ocurrir; más bien, pretende ilustrar los peligros de crear máquinas superinteligentes sin saber cómo programarlas para eliminar el riesgo existencial para la seguridad de los seres humanos. [ 8 ] El ejemplo del maximizador de clips ilustra el problema general de gestionar sistemas poderosos que carecen de valores humanos. [ 9 ]

El experimento mental se ha utilizado como símbolo de la IA en la cultura popular . [ 10 ] El autor Ted Chiang señaló que la popularidad de tales preocupaciones entre los tecnólogos de Silicon Valley podría ser un reflejo de su familiaridad con la tendencia de las corporaciones a ignorar las externalidades negativas . [ 11 ]

Delirio y supervivencia

El experimento mental de la "caja de la ilusión" sostiene que ciertos agentes de aprendizaje por refuerzo prefieren distorsionar sus canales de entrada para aparentar recibir una recompensa alta. Por ejemplo, un agente " de cabeza de alambre " abandona cualquier intento de optimizar el objetivo en el mundo externo que la señal de recompensa pretendía incentivar. [ 12 ]

El experimento mental involucra a AIXI , una IA teórica [ a ] que, por definición, siempre encontrará y ejecutará la estrategia ideal que maximice su función objetivo matemática explícita dada . [ b ] Una versión de AIXI de aprendizaje por refuerzo [ c ] , si está equipada con una caja de ilusión [ d ] que le permite "controlar" sus entradas, eventualmente se controlará a sí misma para garantizarse la máxima recompensa posible y perderá cualquier deseo de seguir interactuando con el mundo exterior. [ 14 ]

Como experimento mental alternativo, si la IA con cabeza de alambre puede ser destruida, interactuará con el mundo exterior con el único propósito de asegurar su supervivencia. Debido a su cabeza de alambre, será indiferente a cualquier consecuencia o hecho del mundo exterior, excepto aquellos relevantes para maximizar su probabilidad de supervivencia. [ 15 ]

En cierto sentido, AIXI posee la máxima inteligencia en todas las funciones de recompensa posibles, medida por su capacidad para alcanzar sus objetivos. AIXI no tiene interés en considerar las intenciones del programador humano. [ 16 ] A pesar de ser superinteligente, el modelo parece ser simultáneamente estúpido y carecer de sentido común , lo cual algunos consideran paradójico. [ 17 ]

La IA básica impulsa

Steve Omohundro enumeró varios objetivos instrumentales convergentes, entre ellos la autopreservación o autoprotección, la integridad de la función de utilidad o del contenido del objetivo, la autosuperación y la adquisición de recursos. Se refiere a estos como los "impulsos básicos de la IA". [ 3 ]

En este contexto, un «impulso» es una «tendencia que estará presente a menos que se contrarreste específicamente»; [ 3 ] esto difiere del término psicológico « impulso », que denota un estado excitatorio producido por una alteración homeostática. [ 18 ] La tendencia de una persona a completar los formularios de declaración de la renta cada año es un «impulso» en el sentido de Omohundro, pero no en el sentido psicológico. [ 19 ]

Daniel Dewey, del Machine Intelligence Research Institute, sostiene que incluso una inteligencia artificial general inicialmente introvertida y autorrecompensante puede seguir adquiriendo energía, espacio, tiempo y libertad de interferencias para garantizar que no se le impida autorrecompensarse. [ 20 ]

Integridad del contenido del objetivo

En los seres humanos, un experimento mental puede explicar el mantenimiento de los objetivos finales. Supongamos que Mahatma Gandhi tiene una píldora que, si la tomara, le provocaría el deseo de matar. Actualmente es pacifista : uno de sus objetivos finales explícitos es no matar jamás a nadie. Es probable que se niegue a tomar la píldora porque sabe que si en el futuro desea matar, probablemente lo hará, y por lo tanto, el objetivo de "no matar" no se vería satisfecho. [ 21 ]

Sin embargo, en otros casos, las personas parecen contentas de dejar que sus valores finales fluctúen. [ 22 ] Los seres humanos son complejos y sus objetivos pueden ser inconsistentes o desconocidos, incluso para ellos mismos. [ 23 ]

En inteligencia artificial

En 2009, Jürgen Schmidhuber concluyó, en un contexto donde los agentes buscan pruebas sobre posibles auto-modificaciones, que "cualquier reescritura de la función de utilidad solo puede ocurrir si la máquina de Gödel primero puede demostrar que la reescritura es útil según la función de utilidad actual". [ 24 ] [ 25 ] Un análisis de Bill Hibbard de un escenario diferente es igualmente consistente con el mantenimiento de la integridad del contenido de los objetivos. [ 25 ] Hibbard también argumenta que en un marco de maximización de la utilidad, el único objetivo es maximizar la utilidad esperada, por lo que los objetivos instrumentales deberían llamarse acciones instrumentales no intencionadas. [ 26 ]

Adquisición de recursos

Muchos objetivos instrumentales, como la adquisición de recursos, son valiosos para un agente porque aumentan su libertad de acción . [ 27 ]

Para casi cualquier función de recompensa (o conjunto de objetivos) abierta y no trivial, poseer más recursos (como equipo, materias primas o energía) puede permitir al agente encontrar una solución más "óptima". Los recursos pueden beneficiar directamente a algunos agentes al poder crear más de aquello que valora su función de recompensa: "La IA ni te odia ni te ama, pero estás hecho de átomos que puede usar para otra cosa". [ 28 ] [ 29 ] Además, casi todos los agentes pueden beneficiarse de tener más recursos para gastar en otros objetivos instrumentales, como la autopreservación. [ 29 ]

Mejora cognitiva

Según Bostrom, «Si los objetivos finales del agente son bastante ilimitados y el agente está en posición de convertirse en la primera superinteligencia y, por lo tanto, obtener una ventaja estratégica decisiva... de acuerdo con sus preferencias. Al menos en este caso especial, un agente racional e inteligente otorgaría un valor instrumental muy alto a la mejora cognitiva » [ 30 ].

Perfección tecnológica

Muchos objetivos instrumentales, como el avance tecnológico, son valiosos para un agente porque aumentan su libertad de acción . [ 27 ]

Autoconservación

Russell argumenta que una máquina suficientemente avanzada «tendrá instinto de autopreservación incluso si no se programa, porque si se le ordena "Trae el café", no podrá hacerlo si está muerta. Así que, si se le asigna cualquier objetivo, tendrá una razón para preservar su propia existencia y alcanzarlo». [ 31 ] En trabajos posteriores, Russell y sus colaboradores demuestran que este incentivo para la autopreservación puede mitigarse instruyendo a la máquina para que no persiga lo que ella cree que es el objetivo, sino lo que el humano cree que es el objetivo. En este caso, mientras la máquina no esté segura de cuál es exactamente el objetivo que el humano tiene en mente, aceptará ser apagada por un humano porque cree que el humano conoce mejor el objetivo. [ 32 ]

Autorreplicación

En *The Basic AI Drives* , Steve Omohundro señaló que uno de los métodos de autopreservación que un sistema puede utilizar es la creación de copias de sí mismo para evitar el apagado (por ejemplo, para eludir un interruptor de apagado). «Al replicarse, un sistema puede asegurar que la muerte de uno de sus clones no lo destruya por completo. Al trasladar copias a ubicaciones distantes, puede disminuir su vulnerabilidad ante un evento catastrófico local». Omohundro también afirmó que un sistema puede «crear sistemas proxy o contratar agentes externos» para lograr sus objetivos mientras opera fuera de sus propios límites. [ 3 ]

Impacto

Los agentes pueden adquirir recursos mediante el comercio o la conquista. Un agente racional, por definición, elegirá la opción que maximice su función de utilidad implícita. Por lo tanto, un agente racional solo intercambiará recursos de otro agente por un subconjunto de los mismos si la apropiación directa de dichos recursos resulta demasiado arriesgada o costosa (en comparación con las ganancias derivadas de la toma de todos los recursos) o si algún otro elemento de su función de utilidad le impide dicha apropiación. En el caso de una superinteligencia poderosa, egoísta y racional que interactúa con inteligencias inferiores, el comercio pacífico (en lugar de la apropiación unilateral) parece innecesario y subóptimo, y por lo tanto improbable. [ 27 ]

Algunos observadores, como Jaan Tallinn de Skype y el físico Max Tegmark , creen que los "impulsos básicos de la IA" y otras consecuencias no deseadas de la IA superinteligente programada por programadores bienintencionados podrían representar una amenaza significativa para la supervivencia humana , especialmente si se produce una "explosión de inteligencia" abrupta debido a la auto-mejora recursiva . Dado que nadie sabe cómo predecir cuándo llegará la superinteligencia , estos observadores abogan por la investigación de la inteligencia artificial amigable como una posible forma de mitigar el riesgo existencial de la IA . [ 33 ]

Véase también

Notas

  1. AIXI es un agente ideal no computable que no puede realizarse completamente en el mundo real.
  2. Técnicamente, en presencia de incertidumbre, AIXI intenta maximizar su " utilidad esperada ", el valor esperado de su función objetivo.
  3. Un agente de aprendizaje por refuerzo estándares un agente que intenta maximizar el valor esperado de una integral descontada en el tiempo futuro de su función de recompensa. [ 13 ]
  4. La función de la caja de ilusión es simular un entorno donde un agente tiene la oportunidad de autoengañarse. Aquí, una caja de ilusión se define como una "función de ilusión" modificable por el agente, que mapea desde la información ambiental "sin modificar" a una información ambiental "percibida"; la función comienza como la función identidad , pero, como acción, el agente puede alterar la función de ilusión de la forma que desee.

Referencias

  1. "Convergencia Instrumental" . LessWrong . Archivado del original el 12 de abril de 2023. Consultado el 12 de abril de 2023 .
  2. 1 2 Russell, Stuart J. ; Norvig, Peter (2003). «Sección 26.3: La ética y los riesgos del desarrollo de la inteligencia artificial». Inteligencia artificial: Un enfoque moderno . Upper Saddle River, NJ: Prentice Hall. ISBN 978-0137903955De manera similar , Marvin Minsky sugirió en una ocasión que un programa de IA diseñado para resolver la hipótesis de Riemann podría acabar acaparando todos los recursos de la Tierra para construir supercomputadoras más potentes que le ayudaran a lograr su objetivo.
  3. ^ Omohundro, Stephen M. (febrero de 2008 ) . "Los motores básicos de IA". Inteligencia General Artificial 2008 . vol. 171. Prensa IOS. págs. 483–492 . CiteSeerX 10.1.1.393.8356 . ISBN    978-1-60750-309-5.
  4. 1 2 Bostrom 2014 , capítulo 7
  5. Bostrom 2014 , Capítulo 8, pág. 123. "Una IA, diseñada para gestionar la producción en una fábrica, recibe el objetivo final de maximizar la fabricación de clips, y procede convirtiendo primero la Tierra y luego porciones cada vez más grandes del universo observable en clips."
  6. Bostrom, Nick (2003). "Cuestiones éticas en la inteligencia artificial avanzada" . Archivado del original el 8 de octubre de 2018. Recuperado el 26 de febrero de 2016 .
  7. citado en Miles, Kathleen (22 de agosto de 2014). "La inteligencia artificial podría condenar a la raza humana en un siglo, afirma un profesor de Oxford" . Huffington Post . Archivado del original el 25 de febrero de 2018. Consultado el 30 de noviembre de 2018 .
  8. Ford, Paul (11 de febrero de 2015). "¿Somos lo suficientemente inteligentes como para controlar la inteligencia artificial?" . MIT Technology Review . Archivado del original el 23 de enero de 2016. Recuperado el 25 de enero de 2016 .
  9. Friend, Tad (3 de octubre de 2016). "El destino manifiesto de Sam Altman" . The New Yorker . Consultado el 25 de noviembre de 2017 .
  10. Carter, Tom (23 de noviembre de 2023). "Las oficinas de OpenAI recibieron miles de clips de papel en una elaborada broma para advertir sobre un apocalipsis de la IA" . Business Insider .
  11. Chiang, Ted (18 de diciembre de 2017). "Silicon Valley se está convirtiendo en su peor pesadilla" . BuzzFeed News . Consultado el 4 de junio de 2023 .
  12. ^ Amodei, D.; Olá, C.; Steinhardt, J.; Cristiano, P.; Schulman, J.; Mané, D. (2016). "Problemas concretos en la seguridad de la IA". arXiv : 1606.06565 [ cs.AI ].
  13. Kaelbling, LP; Littman, ML; Moore, AW (1 de mayo de 1996). "Aprendizaje por refuerzo: una revisión" . Journal of Artificial Intelligence Research . 4 : 237–285 . doi : 10.1613/jair.301 .
  14. Ring, Mark; Orseau, Laurent (agosto de 2011). «Delirio, supervivencia y agentes inteligentes» . Inteligencia artificial general . Notas de clase en informática. Vol. 6830. págs. 11–20 . doi : 10.1007/978-3-642-22887-2_2 . ISBN   978-3-642-22886-5.
  15. Ring, M.; Orseau, L. (2011). «Delirio, supervivencia y agentes inteligentes». En Schmidhuber, J.; Thórisson, KR; Looks, M. (eds.). Inteligencia artificial general . Lecture Notes in Computer Science. Vol. 6830. Berlín, Heidelberg: Springer. 
  16. Yampolskiy, Roman; Fox, Joshua (24 de agosto de 2012). "Ingeniería de seguridad para la inteligencia artificial general". Topoi . 32 (2): 217– 226. doi : 10.1007/s11245-012-9128-9 . S2CID 144113983 . 
  17. Yampolskiy, Roman V. (2013). "¿Qué hacer con la paradoja de la singularidad?". Filosofía y teoría de la inteligencia artificial . Estudios en filosofía aplicada, epistemología y ética racional. Vol. 5. pp. 397–413 . doi : 10.1007/978-3-642-31674-6_30 . ISBN   978-3-642-31673-9.
  18. Seward, John P. (1956). "Impulso, incentivo y refuerzo". Psychological Review . 63 (3): 195– 203. doi : 10.1037/h0048229 . PMID 13323175 . 
  19. Bostrom 2014 , nota al pie 8 del capítulo 7
  20. Dewey, Daniel (2011). «Aprender a valorar». Inteligencia artificial general . Notas de clase en ciencias de la computación. Berlín, Heidelberg: Springer. págs. 309–314 . doi : 10.1007/978-3-642-22887-2_35 . ISBN  978-3-642-22887-2.
  21. Yudkowsky, Eliezer (2011). «Sistemas de valores complejos en IA amigable». Inteligencia artificial general . Notas de clase en ciencias de la computación. Berlín, Heidelberg: Springer. págs. 388–393 . doi : 10.1007/978-3-642-22887-2_48 . ISBN  978-3-642-22887-2.
  22. Callard, Agnes (2018). Aspiración: La agencia del devenir . Vol. 1. Oxford University Press . doi : 10.1093/oso/9780190639488.001.0001 . ISBN  978-0-19-063951-8.
  23. Bostrom 2014 , capítulo 7, pág. 110: «Los seres humanos a menudo parecemos felices de dejar que nuestros valores finales fluctúen... Por ejemplo, alguien que decide tener un hijo podría predecir que llegará a valorarlo por sí mismo, aunque, en el momento de la decisión, no lo valore particularmente... Los seres humanos somos complejos, y muchos factores pueden estar en juego en una situación como esta... uno podría tener un valor final que implique tener ciertas experiencias y ocupar un determinado rol social, y convertirse en padre o madre —y experimentar el consiguiente cambio de objetivos— podría ser un aspecto necesario de ello...»
  24. ^ Schmidhuber, JR (2009). "Cognición definitiva a la Gödel". Computación cognitiva . 1 (2): 177– 193. CiteSeerX 10.1.1.218.3323 . doi : 10.1007/s12559-009-9014-y . S2CID 10784194 .  
  25. 1 2 Hibbard, B. (2012). "Funciones de utilidad basadas en modelos" . Journal of Artificial General Intelligence . 3 (1): 1– 24. arXiv : 1111.3934 . Bibcode : 2012JAGI....3....1H . doi : 10.2478/v10229-011-0013-5 .
  26. Hibbard, Bill (2014). "Inteligencia artificial ética". arXiv : 1411.1373 [ cs.AI ].
  27. 1 2 3 Benson-Tilsen, Tsvi; Soares, Nate (marzo de 2016). «Formalización de objetivos instrumentales convergentes» (PDF) . Talleres de la trigésima Conferencia AAAI sobre Inteligencia Artificial . Phoenix, Arizona. WS-16-02: IA, ética y sociedad. ISBN 978-1-57735-759-9.
  28. Yudkowsky, Eliezer (2008). «La inteligencia artificial como factor positivo y negativo en el riesgo global». Riesgos catastróficos globales . Vol. 303. OUP Oxford. pág. 333. ISBN   9780199606504.
  29. 1 2 Shanahan, Murray (2015). "Capítulo 7, Sección 5: "Superinteligencia segura"" La singularidad tecnológica . MIT Press. "
  30. Bostrom 2014 , Capítulo 7, subsección "Mejora cognitiva"
  31. "La cruzada multimillonaria de Elon Musk para detener el apocalipsis de la IA" . Vanity Fair . 26 de marzo de 2017. Consultado el 12 de abril de 2023 .
  32. Hadfield-Menell, Dylan; Dragan, Anca; Abbeel, Pieter; Russell, Stuart (2017-06-15). "The Off-Switch Game". arXiv : 1611.08219 [ cs.AI ].
  33. Chen, Angela (11 de septiembre de 2014). "¿Es la inteligencia artificial una amenaza?" . The Chronicle of Higher Education . Archivado del original el 1 de diciembre de 2017. Recuperado el 25 de noviembre de 2017 .

Lecturas adicionales

  • Bostrom, Nick (2014). Superinteligencia: caminos, peligros, estrategias . Oxford: Oxford University Press. ISBN 9780199678112.