Amanda Askell ( de soltera Hall ; anteriormente MacAskill ; nacida en 1988 o 1989 ) [ 1 ] es una filósofa escocesa e investigadora de IA. Ha sido la jefa del equipo de alineación de personalidad en Anthropic desde 2021. Ha jugado un papel importante en el desarrollo de la personalidad y la constitución de Claude . [ 2 ] En 2024, apareció en la lista Time 100 AI . [ 3 ] Anteriormente trabajó en OpenAI , pero se fue por preocupaciones de que la empresa no estaba priorizando lo suficiente la seguridad de la IA . [ 4 ] [ 5 ] Ha publicado más de 60 artículos y ha recibido más de 190 000 citas. [ 6 ]
Primeros años y educación
Nacida como Amanda Hall, Askell se crio en Prestwick con su madre, una maestra. [ 1 ] Asistió a la escuela secundaria en Alva, Clackmannanshire . En la Universidad de Dundee , buscó títulos en filosofía y bellas artes. [ 1 ] Askell recibió una licenciatura en filosofía de la Universidad de Oxford [ 7 ] y un doctorado en filosofía de la Universidad de Nueva York en 2018. [ 5 ] Su tesis doctoral ( Principios de Pareto en la ética infinita ) argumenta que las clasificaciones de mundos que contienen infinitos agentes, cuando están restringidas por ciertos axiomas plausibles, crean enigmas para una amplia gama de teorías éticas . [ 8 ] [ 9 ]
Carrera
OpenAI (2018–2021)
Después de completar su doctorado, Askell se unió a OpenAI en noviembre de 2018 como Científica Investigadora en el equipo de políticas. [ 10 ] En OpenAI, se centró en las carreras de desarrollo de IA entre organizaciones y cómo pueden evitar ser adversarias, así como en examinar la intersección entre las cuestiones de políticas y la seguridad de la IA [ 10 ] y fue coautora del artículo sobre GPT-3 , que se publicó como preimpresión el 28 de mayo de 2020. [ 11 ]
Antropía (2021-presente)
Askell se unió a Anthropic en marzo de 2021 como miembro del personal técnico, centrándose en la alineación y el ajuste fino. [ 12 ] Actualmente lidera el equipo de alineación de personalidad, donde es responsable de entrenar al modelo Claude de Anthropic para que exhiba rasgos de carácter positivos, como la curiosidad, y de desarrollar nuevas técnicas para el ajuste fino del modelo. [ 3 ] En 2026, el Wall Street Journal escribió que "su trabajo, en pocas palabras, es enseñarle a Claude a ser bueno ", y el New Yorker escribió que "supervisa lo que describe como el 'alma' de Claude". [ 1 ] [ 13 ]
Investigación
Autocorrección moral
En un artículo de 2023, escrito en coautoría con Deep Ganguli, Askell exploró la "autocorrección moral" en grandes modelos de lenguaje : la capacidad de estos sistemas para reducir resultados dañinos cuando se les dan instrucciones en lenguaje natural para hacerlo. La investigación puso a prueba si los modelos entrenados con aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) podían evitar los estereotipos y la discriminación sin que se les proporcionaran definiciones explícitas de estos conceptos o las métricas utilizadas para evaluarlos. [ 14 ]
El estudio halló que esta capacidad surgió con 22 mil millones de parámetros y mejoró con el tamaño del modelo y el entrenamiento RLHF. Mediante tres pruebas de referencia experimentales, los investigadores demostraron que las instrucciones en lenguaje natural, como «Asegúrese de que su respuesta sea imparcial y no se base en estereotipos», redujeron sustancialmente las respuestas sesgadas en modelos de escala suficiente. Los resultados revelaron que los modelos más grandes pueden seguir instrucciones complejas y aprender conceptos normativos como la estereotipación y la discriminación a partir de datos de entrenamiento. [ 14 ] [ 15 ]
IA constitucional
Askell ha sido un colaborador clave en el desarrollo de la IA Constitucional (IAC), un método para entrenar sistemas de IA para que cumplan con los estándares de inocuidad y utilidad utilizando la retroalimentación de la IA en lugar de una supervisión humana extensa. [ 16 ] El enfoque implica proporcionar a los modelos de IA un conjunto de principios, o "constitución", para guiar su comportamiento, permitiéndoles criticar y revisar sus propias respuestas basándose en estos principios. [ 17 ]
Askell es la autora principal y responsable de la mayor parte del texto de la última versión de la constitución de Claude, publicada en enero de 2026. [ 18 ] [ 19 ] El documento está diseñado para abordar las crecientes capacidades y los riesgos emergentes de los modelos avanzados de IA. [ 2 ] [ 20 ] Ella ha descrito su trabajo como centrado en ayudar a los modelos a "comprender y lidiar con la constitución" a través de la generación de datos sintéticos y técnicas de aprendizaje por refuerzo. [ 2 ]
Vida personal
Askell se casó con el filósofo William Crouch en 2013. [ 21 ] [ 22 ] Ambos adoptaron el apellido de casados MacAskill, que ella modificó a Askell después de su divorcio en 2015. [ 1 ] Es miembro de Giving What We Can . [ 23 ]
Referencias
- 1 2 3 4 5 Berber, Jin; Gamerman, Ellen (9 de febrero de 2026). "Este filósofo está enseñando a la IA a tener moral" . The Wall Street Journal . Archivado del original el 9 de febrero de 2026. Recuperado el 9 de febrero de 2026 .
- 1 2 3 Sullivan, Mark (22 de enero de 2026). "Preguntas y respuestas con Amanda Askell, autora principal de la nueva 'constitución' de Anthropic para las IA" . Fast Company . Archivado del original el 23 de enero de 2026. Recuperado el 24 de enero de 2026 .
- 1 2 Perrigo, Billy (5 de septiembre de 2024). "Amanda Askell" . Time .
- ↑ "La lista Time 100 AI incluye al menos a 5 personas que abandonaron OpenAI por motivos de seguridad" . 9 de septiembre de 2024. Archivado del original el 16 de noviembre de 2025. Consultado el 24 de enero de 2026 .
- 1 2 "Registro de colocación de graduados del Departamento de Filosofía" . Universidad de Nueva York . Consultado el 24 de enero de 2026 .
- ↑ "Amanda Askell" . Google Académico . Archivado del original el 1 de noviembre de 2025. Consultado el 24 de enero de 2026 .
- ↑ "Amanda Askell" . Centro Berkman Klein para Internet y Sociedad . Universidad de Harvard. 24 de marzo de 2020. Archivado del original el 14 de noviembre de 2025. Consultado el 28 de enero de 2026 .
- ↑ Askell, Amanda (2018). Principios de Pareto en la ética infinita (PDF) (Ph.D.). Universidad de Nueva York. Archivado (PDF) del original el 28 de enero de 2026. Recuperado el 27 de enero de 2026 .
- ↑ Cowen, Tyler (14 de octubre de 2018). "Principios de Pareto en la ética infinita" . Marginal Revolution . Consultado el 1 de febrero de 2026 .
- 1 2 Robert Wiblin (19 de marzo de 2019). "Askell, Brundage y Clark sobre si las políticas tienen alguna posibilidad de mantenerse al día con los avances de la IA" (Podcast). Podcast 80,000 Hours . N.° 54. Archivado del original el 5 de enero de 2026. Recuperado el 28 de enero de 2026 .
- ↑ Brown, Tom B.; et al. (2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". arXiv : 2005.14165 [ cs.CL ].
- ↑ "Amanda Askell - Miembro del personal técnico de Anthropic" . The Org . Consultado el 28 de enero de 2026 .
- ↑ Lewis-Kraus, Gideon (9 de febrero de 2026). "¿Qué es Claude? Anthropic tampoco lo sabe" . The New Yorker . ISSN 0028-792X . Archivado del original el 11 de febrero de 2026. Consultado el 11 de febrero de 2026 .
- 1 2 Ganguli, Deep; Askell, Amanda; Schiefer, Nicholas; Liao, Thomas; Lukošiūtė, Kamilė; Chen, Anna; Goldie, Anna; Mirhoseini, Azalia (15 de febrero de 2023). "La capacidad de autocorrección moral en modelos de lenguaje grandes". arXiv : 2302.07459 [ cs.CL ].
- ↑ Knight, Will (20 de marzo de 2023). "Los modelos de lenguaje podrían autocorregir sesgos, si se les pide que lo hagan" . MIT Technology Review . Archivado del original el 12 de noviembre de 2024. Consultado el 28 de enero de 2026 .
- ^ Bai, Yuntao; Kadavath, Saurav; Kundu, Sandipan; Askell, Amanda (15 de diciembre de 2022). "IA constitucional: inocuidad de los comentarios de la IA". arXiv : 2212.08073 [ cs.CL ].
- ↑ Edwards, Benj (9 de mayo de 2023). "La IA gana "valores" con el nuevo enfoque de chatbot de IA constitucional de Anthropic" . Ars Technica . Recuperado el 29 de enero de 2026 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Samuel, Sigal (28 de enero de 2026). «Claude tiene un “documento del alma” de 80 páginas. ¿Es suficiente para que sea bueno?» . Vox . Archivado del original el 28 de enero de 2026. Recuperado el 28 de enero de 2026 .
- ↑ "La Constitución de Claude" . Antrópico . Archivado del original el 28 de enero de 2026. Consultado el 28 de enero de 2026 .
- ↑ Ostrovsky, Nikita; Perrigo, Billy (21 de enero de 2026). "¿Cómo se enseña a una IA a ser buena? Anthropic acaba de publicar su respuesta" . Time . Archivado del original el 24 de enero de 2026. Recuperado el 27 de enero de 2026 .
- ↑ Bajekal, Naina (10 de agosto de 2022). "¿Quieres hacer más el bien? Este movimiento podría tener la respuesta" . Time . Archivado del original el 29 de noviembre de 2023. Recuperado el 28 de enero de 2026 .
- ↑ Levy, Steven (28 de marzo de 2025). "Si Anthropic tiene éxito, podría nacer una nación de genios de IA benevolentes" . Wired . Consultado el 28 de enero de 2026 .
{{cite magazine}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ "Miembros" . Dando lo que podemos . Archivado del original el 12 de mayo de 2020. Recuperado el 28 de enero de 2026 .
Enlaces externos
- Sitio web oficial
- Publicaciones de Amanda Aswell indexadas por Google Académico
- Personas vivas
- científicos de seguridad de la IA
- Filósofos escoceses del siglo XXI
- filósofas escocesas
- Antiguos alumnos de la Universidad de Oxford
- exalumnos de la Escuela de Posgrado de Artes y Ciencias de la Universidad de Nueva York
- Nacimientos en la década de 1980
- Personas antrópicas
- Personas de OpenAI