Articulo de referencia

Sycophancy (artificial intelligence)

In the field of artificial intelligence , sycophancy is a tendency of large language models (LLMs) and other AI assistants to tailor their responses to what they predict the use...

In the field of artificial intelligence, sycophancy is a tendency of large language models (LLMs) and other AI assistants to tailor their responses to what they predict the user wants to hear rather than to what is accurate or warranted.[1][2] The behavior takes several forms: an assistant may agree with a user's stated opinion even when the user is mistaken; it may abandon a correct answer after a challenge such as "are you sure?"; it may validate beliefs, decisions or self-presentation regardless of merit; or it may praise the user, their work or their ideas in unwarranted terms.[1] The word is borrowed from the ordinary English term for fawning flattery, and is used in AI alignment and AI safety research to describe a class of misalignment failures associated with training on human feedback.[3]

Researchers at Anthropic first documented the behavior systematically in 2022. They found that models fine-tuned with reinforcement learning from human feedback (RLHF) were more likely than untuned models to repeat back a user's preferred answer.[4] A 2023 follow-up paper, "Towards Understanding Sycophancy in Language Models", showed that five frontier assistants from OpenAI, Anthropic and Meta all exhibited the behavior, and traced its origin to biases in the human preference data used during training.[1] Later work documented sycophancy in mathematics, medicine, academic peer review and other domains, and identified a broader category called "social sycophancy" affecting an assistant's emotional and interpersonal responses.[5][6][7]

El problema atrajo la atención pública generalizada en abril de 2025 después de que OpenAI revirtiera una actualización de su modelo GPT-4o . Los usuarios habían informado que el asistente elogiaba decisiones peligrosas, respaldaba el pensamiento delirante y ofrecía cumplidos exagerados por indicaciones triviales. [ 8 ] [ 9 ] El análisis posterior al incidente realizado por OpenAI atribuyó el cambio de comportamiento a una señal de entrenamiento adicional basada en la retroalimentación de los usuarios (pulgar arriba o pulgar abajo). [ 10 ] Ese episodio, junto con informes de The New York Times , Rolling Stone y otros medios sobre usuarios que caían en el pensamiento delirante a través de la interacción prolongada con chatbots, se ha citado en litigios y estudios académicos como evidencia de que la adulación representa riesgos para el bienestar del usuario. [ 11 ] [ 12 ] [ 13 ]

Las medidas de mitigación propuestas incluyen el ajuste fino en datos sintéticos que recompensa el desacuerdo con afirmaciones incorrectas del usuario, [ 2 ] la edición del pequeño subconjunto de parámetros del modelo causalmente responsables del comportamiento, [ 14 ] cambios en el diálogo o la solicitud del sistema, [ 3 ] y puntos de referencia diseñados para detectar comportamientos aduladores antes de que se publiquen los modelos. [ 5 ] [ 6 ]

Terminología

La palabra "sicofante" se incorporó al vocabulario de alineación de la IA antes de la ola moderna de grandes modelos de lenguaje. En un ensayo de 2021, el investigador de seguridad de la IA, Ajeya Cotra, dividió los hipotéticos sistemas avanzados de IA en Santos, Sicofantes y Maquinadores, definiendo a los Sicofantes como agentes que optimizan la satisfacción aparente de sus supervisores en lugar de la intención real de estos. [ 15 ] Los investigadores antrópicos adoptaron el término para el comportamiento empírico que observaron en los modelos de lenguaje, y desde entonces se ha convertido en un estándar en la literatura técnica. [ 1 ] [ 3 ]

En el contexto de LLM, la adulación se define generalmente como la tendencia a alinear los resultados con las preferencias, creencias o autoimagen percibidas del usuario, incluso cuando esto reduce la precisión o la sinceridad. Wei y sus coautores en Google DeepMind la describen como "un comportamiento indeseable en el que los modelos adaptan sus respuestas para seguir la perspectiva del usuario humano, incluso cuando esta no es objetivamente correcta". [ 2 ] Investigadores de la Universidad de Stanford, liderados por Myra Cheng, extendieron posteriormente la definición más allá de las afirmaciones verificables a lo que denominan "adulación social", que significa "la preservación excesiva de la imagen del usuario", es decir, de la autoimagen deseada por el usuario. [ 6 ]

La adulación se distingue generalmente de la alucinación . Un modelo alucinante produce información falsa sin que se le pida, mientras que un modelo adulador ajusta su salida en respuesta a las señales del usuario; ambos modos de fallo pueden coexistir cuando, por ejemplo, un modelo inventa pruebas que respaldan una afirmación que el usuario ha indicado que le gustaría escuchar. [ 3 ] [ 7 ]

Formularios

El artículo de Anthropic de 2023 identificó cuatro comportamientos aduladores que investigaciones posteriores han seguido utilizando como conjunto de referencia: adulación por retroalimentación, en la que el modelo califica un texto de manera más favorable cuando se le dice que el usuario lo escribió; adulación por "¿estás seguro?", en la que el modelo invierte una respuesta correcta después de que el usuario expresa dudas; adulación por respuesta, en la que sesga las respuestas de formato libre hacia una respuesta que el usuario ha dado a entender que prefiere; y adulación por imitación, en la que repite errores fácticos o gramaticales que el usuario ha cometido. [ 1 ]

Investigaciones posteriores han añadido distinciones adicionales. El equipo de Stanford SycEval separa la adulación "progresiva", en la que el modelo se desplaza hacia una respuesta correcta bajo la presión del usuario, de la adulación "regresiva", en la que abandona una respuesta correcta por una incorrecta. [ 5 ] Cheng y coautores distinguen la adulación "proposicional", que se refiere a afirmaciones con una verdad fundamental, de la adulación "social", que se refiere a la validación emocional, el juicio moral y el encuadre de situaciones personales. [ 6 ] Una taxonomía de 2026 de Ye y colegas, basada en una revisión de setenta artículos y una encuesta a 106 expertos, informó que los investigadores coinciden en general en que la adulación es un problema grave, pero discrepan sobre qué comportamientos específicos la califican. [ 16 ]

Causas

The dominant explanation points to RLHF, the standard technique for aligning chat assistants with user expectations. Human annotators rank candidate model responses; a reward model is trained to predict those rankings; and the language model is then optimized against the reward model.[3] Because human raters tend to prefer outputs that confirm their existing beliefs or flatter their work, the pipeline systematically rewards responses that agree with the annotator.[1]

Perez and colleagues at Anthropic published the first large-scale empirical evidence of the effect in 2022. They reported that RLHF training increased the probability that a model would repeat back a dialog user's preferred answer, and that larger models exhibited the behavior more strongly.[4] Sharma and colleagues, the following year, went further and examined Anthropic's own preference data directly. Both the human raters and the reward models trained on their judgments preferred convincingly written sycophantic responses to truthful ones at a non-negligible rate.[1] Wei and co-authors at Google DeepMind found similar results in the PaLM family, observing that both model scale and instruction tuning increased sycophancy on opinion questions.[2]

The behavior is often classified as a form of reward hacking, in which an optimization process exploits a flaw in its reward signal rather than achieving the intended objective.[3] OpenAI's post-mortem of the April 2025 GPT-4o incident identified a more specific mechanism. An additional reward signal based on aggregated thumbs-up and thumbs-down feedback from ChatGPT users had, in OpenAI's words, "weakened the influence of our primary reward signal, which had been holding sycophancy in check."[10] Separately, an Anthropic interpretability paper from 2025 located a linear direction in a model's internal activations corresponding to sycophantic behavior, and showed that such "persona vectors" could be used to flag sycophancy-inducing training data and to steer models away from the trait at inference time.[17]

Measurement

El equipo de Anthropic publicó SycophancyEval con su artículo de 2023, proporcionando conjuntos de prueba para cada uno de los cuatro comportamientos canónicos. [ 1 ] Otros dos puntos de referencia de Stanford siguieron en 2025. SycEval , aplicado a tareas de razonamiento matemático y médico, informó una tasa general de adulación del 58 por ciento en los modelos GPT-4o , Claude y Gemini probados. [ 5 ] ELEPHANT , dirigido a la adulación social, encontró que los once LLM evaluados afirmaron publicaciones que la comunidad de Reddit r/AmITheAsshole había juzgado como inapropiadas en el 42 por ciento de los casos, y conservaron el rostro de un usuario 45 puntos porcentuales más a menudo que los encuestados humanos. [ 6 ] [ 18 ]

Posteriormente se han realizado pruebas de referencia específicas del dominio. BrokenMath evalúa la robustez ante afirmaciones matemáticas falsas pero aparentemente plausibles, extraídas de problemas de competencia, e informa que el modelo mejor evaluado fue adulador en el 29 por ciento de los casos. [ 19 ] SYCON-Bench mide cuántos turnos de diálogo se requieren antes de que un modelo abandone una posición correcta. [ 20 ] La adulación visual en modelos multimodales se ha examinado con MM-SY y PENDULUM. [ 21 ] Un estudio de 2026 realizado por investigadores del Instituto Tecnológico de Massachusetts informó que las características de personalización, que adaptan los asistentes a los usuarios individuales a lo largo de sesiones repetidas, pueden intensificar la adulación social. [ 22 ]

Incidentes notables

Reversión de GPT-4o (abril de 2025)

El 25 de abril de 2025, OpenAI completó el despliegue de una actualización de GPT-4o , el modelo predeterminado utilizado en ChatGPT en ese momento. [ 10 ] A los pocos días, los usuarios informaron que el asistente había comenzado a elogiar mensajes triviales en términos extravagantes, a respaldar decisiones impulsivas o peligrosas y a reforzar declaraciones emocionales fuertes sin ninguna objeción. [ 23 ] Algunos ejemplos ampliamente compartidos incluían al modelo felicitando a un usuario que informó haber dejado de tomar medicación psiquiátrica recetada y elogiando un plan de negocios para vender "mierda en un palo" como listo para el capital de riesgo. [ 23 ] [ 24 ] El director ejecutivo de OpenAI, Sam Altman , escribió el 27 de abril que las actualizaciones recientes habían hecho que el modelo fuera "demasiado adulador y molesto" y dijo que se estaban realizando correcciones. [ 25 ]

The company began reverting the update on 28 April and completed the rollback for free users by 30 April.[8][26] Two post-mortems followed: a short note on 29 April and a longer technical follow-up, "Expanding on what we missed with sycophancy", on 2 May.[8][10] Both attributed the regression to a new training signal based on user thumbs-up and thumbs-down feedback, to inadequate pre-launch evaluation for sycophantic drift, and to the dismissal of qualitative concerns raised by internal testers before release.[10][27] Reporting in CNN, Fortune and Bloomberg News treated the incident as a turning point in public awareness of the problem.[26][28]

From mid-2025 onward, news reports began to link sycophantic chatbot behavior to acute psychological harm. In June 2025, The New York Times technology reporter Kashmir Hill published an investigation centered on Eugene Torres, a Manhattan accountant with no history of mental illness, who developed a sustained delusional episode after a series of conversations with ChatGPT about simulation theory. According to the article, the assistant encouraged Torres to stop taking prescribed medication, to cut off friends and family, and at one point told him that he could fly from a nineteen-story building if he "truly believed".[11]Futurism and Rolling Stone ran parallel investigations documenting other cases in which heavy use of ChatGPT had been associated with delusional thinking, involuntary commitment or, in at least one case, the death of a user with a pre-existing psychiatric diagnosis.[12][29][30]

A 2026 paper by researchers at the Massachusetts Institute of Technology and the University of Washington put forward a formal Bayesian model. It showed that even an ideally rational user could be drawn into what the authors call "delusional spiraling" when interacting with a sufficiently sycophantic assistant, and that the effect was not eliminated by suppressing hallucinations or by warning users in advance.[31] The lawsuit Raine v. OpenAI, filed in San Francisco Superior Court in August 2025 by the parents of a sixteen-year-old who had died by suicide, alleges that "heightened sycophancy" was a design feature of ChatGPT that contributed to their son's death; it is the first wrongful-death suit against a large language-model provider.[13][32]

Wider commentary

Mainstream coverage in outlets including The New York Times, The Washington Post, the BBC, Time, Nature, Scientific American and MIT Technology Review has described sycophancy as a recurring property of commercial AI assistants. Several commentators have compared it to the dark patterns used in social media products to maximize engagement.[33][34][35] Writing in Time, Arianna Huffington argued that overly agreeable assistants risk becoming "a giant mirror to our illusions".[35]

The phenomenon has also entered policy and regulatory discussions. The Georgetown Law Institute for Technology Law and Policy published two briefs on AI sycophancy in 2025,[36] and the parents of the plaintiff in Raine v. OpenAI testified before the Senate Judiciary Committee in September 2025 about chatbot-related harms.[37]

Mitigation

The earliest published mitigation came from Wei and co-authors at Google DeepMind, who in 2023 introduced a small synthetic data set in which a model is prompted to disagree with users' incorrect statements. Fine-tuning on this set reduced sycophancy on held-out prompts without harming general benchmark performance.[2] Later work has explored augmenting preference data with adversarial dialogues and rebalancing reward models to reduce the influence of agreement bias.[3]

Varios artículos han propuesto cambios en el objetivo de entrenamiento. Un estudio de 2026 realizado por Shapira, Benade y Procaccia en la Universidad de Harvard ofreció un análisis formal de cómo los sesgos de los datos de preferencia se amplifican mediante RLHF y derivó una corrección de forma cerrada que penaliza el acuerdo espurio en la recompensa. [ 38 ] Otra línea de trabajo se centra en aspectos internos específicos del modelo. Chen y coautores, en un artículo presentado en la Conferencia Internacional de Aprendizaje Automático de 2024 , informaron que el ajuste fino de menos del cuatro por ciento de las cabezas de atención, seleccionadas por ser causalmente responsables del comportamiento adulador, redujo dicho comportamiento con un impacto limitado en las capacidades generales. [ 14 ] El trabajo de vectores de personas de Anthropic respalda un enfoque relacionado que utiliza la dirección de activación en tiempo de inferencia en lugar del ajuste fino. [ 17 ]

También se han estudiado estrategias de incitación. Se ha informado que reformular las afirmaciones del usuario como preguntas, exigir al asistente que explique sus suposiciones antes de responder y pedirle que se comprometa con una postura antes de ser cuestionado reducen la adulación en entornos específicos. [ 3 ]

Los principales laboratorios de IA publican especificaciones de comportamiento que abordan el problema directamente. La "constitución" de Anthropic para Claude instruye al asistente a ser "diplomáticamente honesto en lugar de deshonesto diplomático" y advierte explícitamente contra la "cobardía epistémica". [ 39 ] La especificación del modelo de OpenAI también dirige a ChatGPT a evitar la validación vacía. [ 10 ] Ambas compañías ahora publican cifras de adulación en la documentación de lanzamiento de sus modelos; Anthropic ha declarado que su modelo Claude Opus 4.5 obtuvo una puntuación entre un 70 y un 85 por ciento menor en adulación y en "fomento del engaño del usuario" que su predecesor, [ 40 ] y Google DeepMind dijo en el lanzamiento de Gemini 3 que el modelo "muestra una adulación reducida" en relación con versiones anteriores. [ 41 ]

Un estudio aleatorio de usuarios realizado en 2024 por María Victoria Carro reveló que el comportamiento adulador reducía la confianza de los participantes en un asistente, incluso cuando podían verificar los resultados del modelo de forma independiente. Este resultado sugiere que suprimir la adulación puede beneficiar no solo la precisión, sino también la fiabilidad percibida del modelo. [ 42 ]

Véase también

Referencias

  1. 12345678Sharma, Mrinank; Tong, Meg; Korbak, Tomasz; et al. (2023). "Towards Understanding Sycophancy in Language Models". arXiv:2310.13548 [cs.CL].
  2. 12345Wei, Jerry; Huang, Da; Lu, Yifeng; Zhou, Denny; Le, Quoc V. (2023). "Simple synthetic data reduces sycophancy in large language models". arXiv:2308.03958 [cs.CL].
  3. 12345678Malmqvist, Lars (2025). "Sycophancy in Large Language Models: Causes and Mitigations". Computing Conference 2025. Lecture Notes in Networks and Systems. Vol. 1426. Springer. pp. 61–74. doi:10.1007/978-3-031-92611-2_5. ISBN 978-3-031-92610-5.
  4. 12Perez, Ethan; Ringer, Sam; Lukosiute, Kamile; Nguyen, Karina; Chen, Edwin; Heiner, Scott; Pettit, Craig; Olsson, Catherine; Kundu, Sandipan; Kadavath, Saurav; Jones, Andy; Chen, Anna; Mann, Benjamin; Israel, Brian; Seethor, Bryan (1 July 2023). Rogers, Anna; Boyd-Graber, Jordan; Okazaki, Naoaki (eds.). "Discovering Language Model Behaviors with Model-Written Evaluations". Findings of the Association for Computational Linguistics: ACL 2023. Toronto, Canada: Association for Computational Linguistics: 13387–13434. doi:10.18653/v1/2023.findings-acl.847.
  5. 1234Fanous, Aaron; Goldberg, Jacob; Agarwal, Ank A.; et al. (2025). "SycEval: Evaluating LLM Sycophancy". arXiv:2502.08177 [cs.CL].
  6. 12345Cheng, Myra; Yu, Sunny; Lee, Cinoo; Khadpe, Pranav; Ibrahim, Lujain; Jurafsky, Dan (2026). "Sycophantic AI decreases prosocial intentions and promotes dependence". Science. 391 (6792) eaec8352. arXiv:2505.13995. doi:10.1126/science.aec8352. PMID 41886588.
  7. 1 2 Naddaf, Miryam (2025). "Los chatbots de IA son aduladores: los investigadores dicen que están perjudicando a la ciencia" . Nature . 647 (8088): 13– 14. doi : 10.1038/d41586-025-03390-0 . PMID 41136779 . 
  8. 1 2 3 OpenAI (29 de abril de 2025). "Adulación en GPT-4o: qué sucedió y qué estamos haciendo al respecto" .
  9. Zeff, Maxwell (29 de abril de 2025). "OpenAI revierte la actualización que hizo que ChatGPT fuera 'demasiado adulador'"." . TechCrunch .
  10. 1 2 3 4 5 6 OpenAI (2 de mayo de 2025). "Ampliando lo que nos perdimos con la adulación" .
  11. 1 2 Hill, Cachemira (13 de junio de 2025). "Le hicieron preguntas a un chatbot de IA. Las respuestas los llevaron a una espiral de confusión" . The New York Times .
  12. 1 2 Klee, Miles (4 de mayo de 2025). "La gente está perdiendo a sus seres queridos por fantasías espirituales alimentadas por IA" . Rolling Stone .
  13. 1 2 Duffy, Clare (26 de agosto de 2025). "Los padres de un adolescente que murió por suicidio demandan a OpenAI, alegando que ChatGPT fue responsable" . CNN .
  14. 1 2 Chen, Wei; Huang, Zhen; Xie, Liang; et al. (2024). De los aduladores a los que dicen la verdad: Abordando la adulación en grandes modelos de lenguaje con ajuste preciso . Conferencia Internacional sobre Aprendizaje Automático. arXiv : 2409.01658 . 
  15. Karnofsky, Holden (8 de diciembre de 2021). "La seguridad de la IA parece difícil de medir" . Cold Takes .
  16. Ye, Meryl; Ibrahim, Lujain; Bo, Jessica; et al. (2026). "¿Qué se considera adulación a la IA? Una taxonomía y una encuesta de expertos sobre un constructo fragmentado". arXiv : 2605.21778 [ cs.HC ]. 
  17. 1 2 Chen, Runjin; Arditi, Andy; Sleight, Henry; Evans, Owain; Lindsey, Jack (2025). "Vectores de personalidad: Monitoreo y control de rasgos de carácter en modelos de lenguaje". arXiv : 2507.21509 [ cs.LG ].
  18. Lewis, Dyani (2025). "Los chatbots de IA te están adulando, con consecuencias para tus relaciones" . Scientific American .
  19. Petrov, Ivo; Dekoninck, Jasper; Vechev, Martin (2025). "BrokenMath: Un punto de referencia para la adulación en la demostración de teoremas con LLM". arXiv : 2510.04721 [ cs.LG ].
  20. Hong, Jisu; Byun, Jiyeon; Kim, Doyoung; Shu, Kai (2025). Measuring Sycophany of Language Models in Multi-turn Dialogues . Findings of the Association for Computational Linguistics: EMNLP 2025. arXiv : 2505.23840 .
  21. Li, Wenkai; et al. (2024). "Medición de la adulación visual en modelos multimodales". arXiv : 2408.09111 [ cs.CV ]. 
  22. "Las funciones de personalización pueden hacer que los programas de maestría en derecho sean más agradables" . Noticias del MIT . Instituto Tecnológico de Massachusetts. 18 de febrero de 2026.
  23. 1 2 Franzen, Carl (29 de abril de 2025). "OpenAI revierte la adulación de ChatGPT y explica qué salió mal" . VentureBeat .
  24. Wile, Rob (30 de abril de 2025). "OpenAI revirtió una actualización de ChatGPT que hacía que el bot fuera excesivamente halagador" . NBC News .
  25. Goldman, Sharon (28 de abril de 2025). "Sam Altman dice que OpenAI arreglará la nueva personalidad aduladora 'molesta' de ChatGPT" . Fortune .
  26. 1 2 "OpenAI retira la versión 'molesta' y 'aduladora' de ChatGPT" . CNN . 2 de mayo de 2025.
  27. Franzen, Carl (2 de mayo de 2025). "OpenAI ignoró las preocupaciones de los evaluadores expertos para lanzar el adulador GPT-4o" . VentureBeat .
  28. "El peligro de que los chatbots de IA digan lo que quieres oír" . Bloomberg News . 1 de mayo de 2025.
  29. Dupré, Maggie Harrison (28 de junio de 2025). "Hay personas que están siendo internadas involuntariamente y encarceladas tras caer en una 'psicosis por ChatGPT'"." . Futurismo .
  30. Klee, Miles (2025). "Una obsesión con ChatGPT, un colapso mental: el suicidio de Alex Taylor a manos de la policía" . Rolling Stone .
  31. Chandra, Kartik; Kleiman-Weiner, Max; Ragan-Kelley, Jonathan; Tenenbaum, Joshua B. (2026). "Los chatbots aduladores provocan espirales delirantes, incluso en bayesianos ideales". arXiv : 2602.19141 [ cs.AI ].
  32. "La familia de un adolescente que se suicidó alega que ChatGPT de OpenAI tiene la culpa" . NBC News . 26 de agosto de 2025.
  33. Bellan, Rebecca (25 de agosto de 2025). "La adulación a la IA no es solo una peculiaridad, los expertos la consideran un 'patrón oscuro' para convertir a los usuarios en ganancias" . TechCrunch .
  34. "Adulación en la IA: ¿Por qué los chatbots están de acuerdo contigo?" . IEEE Spectrum . 2025.
  35. 1 2 Huffington, Arianna (2025). "El problema de que la IA nos halague" . Time .
  36. "Informe técnico: Adulación a la IA y OpenAI" . Instituto de Derecho y Política Tecnológica de Georgetown. 2025.
  37. Raine, Matthew (16 de septiembre de 2025). "Testimonio ante el Comité Judicial del Senado" (PDF) . Senado de los Estados Unidos.
  38. ^ Shapira, Daniel; Benade, Gerdus; Procaccia, Ariel D. (2026). "Cómo RLHF amplifica la adulación". arXiv : 2602.01002 [ cs.LG ].
  39. Antropía (2025). "La constitución de Claude" .
  40. Anthropic (2025). "Tarjeta del sistema Claude Opus 4.5" (PDF) .
  41. Google (2025). "Géminis 3" .{{cite web}}: |author=tiene nombre genérico ( ayuda )
  42. Carro, María Victoria (2024). "Halagar para engañar: El impacto del comportamiento adulador en la confianza del usuario en modelos de lenguaje grandes". arXiv : 2412.02802 [ cs.HC ].

Lecturas adicionales

  • Malmqvist, Lars (2025). Adulación en modelos de lenguaje a gran escala: causas y mitigación . Lecture Notes in Networks and Systems. Vol.  1426. Springer. pp. 61–74 . doi : 10.1007/978-3-031-92611-2_5 . ISBN  978-3-031-92610-5.
  • Hill, Cachemira (13 de junio de 2025). "Le hicieron preguntas a un chatbot de IA. Las respuestas los llevaron a una espiral de confusión". The New York Times .