Articulo de referencia

loro estocástico

En el aprendizaje automático , el término loro estocástico es una metáfora que describe los grandes modelos de lenguaje como sistemas que imitan estadísticamente el texto sin un...

En el aprendizaje automático , el término loro estocástico es una metáfora que describe los grandes modelos de lenguaje como sistemas que imitan estadísticamente el texto sin una comprensión real. La palabra "estocástico" —del griego antiguo " στοχαστικός " ( stokhastikos , ' basado en conjeturas ' ) es un término de la teoría de la probabilidad que significa "determinado aleatoriamente". [ 1 ] La palabra "loro" se refiere a la capacidad de los loros para imitar el habla humana . [ 1 ]  

El término se introdujo en un artículo de 2021 sobre ética de la IA titulado "Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? 🦜", cuyos autores fueron Timnit Gebru , Emily M. Bender , Angelina McMillan-Major y Margaret Mitchell . [ a ] El artículo describía los posibles riesgos asociados con los modelos de lenguaje grandes (LLM). En diciembre de 2020, fue objeto de una disputa laboral entre Gebru (entonces colíder del Equipo de Inteligencia Artificial Ética de Google) y Google , que había solicitado la retractación del artículo. El incidente culminó con la polémica salida de Gebru de la empresa.

El artículo se presentó posteriormente en la Conferencia ACM de 2021 , y el término "loro estocástico" se ha utilizado ampliamente en la investigación académica sobre IA generativa y LLM. El término se ha interpretado negativamente como un insulto hacia la IA. [ 1 ]

Fondo

Timnit Gebru es investigadora en ética de la IA, [ 2 ] Emily M. Bender es lingüista especializada en lingüística computacional y Margaret Mitchell es científica informática especializada en sesgo algorítmico . Gebru se unió a Google en 2018, donde codirigió un equipo sobre la ética de la inteligencia artificial con Mitchell.

A finales de 2020, Gebru y otros cinco investigadores, cuatro de ellos empleados de Google, escribieron en coautoría el artículo «Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? 🦜». El artículo argumenta que los modelos de lenguaje grandes (LLM, por sus siglas en inglés) presentan riesgos significativos, como costos ambientales y financieros, falta de escrutinio que conduce a sesgos peligrosos desconocidos y potencial de engaño, ya que los LLM no comprenden los conceptos subyacentes a lo que aprenden. [ 3 ]

El artículo afirma que los LLM están "uniendo secuencias de formas lingüísticas  ... observadas en sus vastos datos de entrenamiento, de acuerdo con información probabilística sobre cómo se combinan, pero sin ninguna referencia al significado". Por lo tanto, se les denomina "loros estocásticos". [ 4 ]

Desestimación de Gebru por parte de Google

Después de que el artículo fue presentado para su consideración en la Conferencia ACM 2021 , Google solicitó a Gebru que retirara el artículo de la conferencia o que eliminara los nombres de los empleados de Google del mismo. [ 5 ] Gebru se negó a hacerlo sin más discusión y envió un correo electrónico a la vicepresidenta de Google Research, Megan Kacholia, indicando que si la empresa no podía explicar la solicitud de retractación y abordar otras preocupaciones relacionadas con proyectos similares, planeaba renunciar después de un período de transición, afirmando que podían "trabajar en una fecha límite". [ 6 ] Al día siguiente, el 2 de diciembre de 2020, Gebru recibió un correo electrónico que decía que Google estaba "aceptando su renuncia". [ 3 ] Su despido abrupto provocó protestas de los empleados de Google y publicidad negativa para la empresa. [ 7 ]

Uso

La frase ha sido utilizada por los escépticos de la IA para indicar que los LLM carecen de comprensión del significado de sus resultados. [ 1 ]

Sam Altman , director ejecutivo de OpenAI , utilizó el término poco después del lanzamiento de ChatGPT en diciembre de 2022, tuiteando "soy un loro estocástico, y tú también". [ 1 ] El término fue nominado como la Palabra del Año 2023 relacionada con la IA por la American Dialect Society . [ 8 ] [ 9 ]

Debate

Algunos LLM, como ChatGPT, han logrado interactuar con los usuarios en conversaciones convincentemente humanas. [ 10 ] El desarrollo de estos nuevos sistemas ha profundizado el debate sobre hasta qué punto los LLM entienden o simplemente "repiten" lo que dicen los demás.

Según los investigadores de aprendizaje automático Lindholm, Wahlström, Lindsten y Schön, el término "loro estocástico" resalta dos limitaciones vitales de los LLM: [ 11 ] [ 12 ]

  • Los modelos LLM están limitados por los datos con los que se entrenan y simplemente repiten de forma estocástica el contenido de los conjuntos de datos.
  • Debido a que simplemente inventan resultados basándose en datos de entrenamiento, los LLM no comprenden si están diciendo algo incorrecto o inapropiado.

Lindholm et al. señalaron que, con conjuntos de datos de baja calidad y otras limitaciones, una máquina de aprendizaje podría producir resultados que son "peligrosamente erróneos". [ 11 ]

Experiencia subjetiva

En la mente de un ser humano, las palabras y el lenguaje corresponden a cosas que uno ha experimentado. [ 13 ] Para los LLM, según los defensores de la teoría, las palabras corresponden solo a otras palabras y patrones de uso introducidos en sus datos de entrenamiento. [ 14 ] [ 15 ] [ 4 ] Los defensores de la idea de los loros estocásticos concluyen, por lo tanto, que las afirmaciones sobre los LLM se deben a "la tendencia humana a atribuir significado al texto", [ 4 ] y afirman que esto ocurre a pesar de que los LLM en realidad no entienden el lenguaje. [ 14 ] [ 4 ]

Sintonia FINA

Kelsey Piper argumentó que la afirmación de que los LLM son loros estocásticos o meros "predictores del siguiente token" se centra en el preentrenamiento, ignorando que los LLM modernos también se ajustan para seguir instrucciones y preferir respuestas precisas. [ 16 ]

Alucinaciones y errores

La tendencia de los LLM a presentar información falsa como un hecho se sostiene como apoyo. [ 13 ] Llamadas alucinaciones o confabulaciones, los LLM ocasionalmente sintetizan información que coincide con algún patrón. [ 14 ] [ 15 ] [ 13 ] Los LLM pueden no distinguir entre hechos y ficción, lo que lleva a la afirmación de que no pueden conectar palabras con una comprensión del mundo, como lo hacen los humanos. [ 14 ] [ 13 ] Además, los LLM pueden no descifrar casos gramaticales complejos o ambiguos que dependen de la comprensión del significado del lenguaje. [ 14 ] [ 15 ] Por ejemplo: [ 14 ]

El periódico mojado que se cayó de la mesa es mi periódico favorito. Pero ahora que despidieron al editor de mi periódico favorito, puede que ya no me guste leerlo. ¿Puedo reemplazar «mi periódico favorito» por «el periódico mojado que se cayó de la mesa» en la segunda oración?

GPT-4 , un LLM lanzado en marzo de 2023, respondió afirmativamente, sin comprender que el significado de "periódico" es diferente en estos dos contextos; primero es un objeto y segundo una institución. [ 14 ]

Puntos de referencia y experimentos

Un argumento en contra de la hipótesis de que los LLM son loros estocásticos son sus resultados en pruebas de referencia para el razonamiento, el sentido común y la comprensión del lenguaje. En 2023, algunos LLM mostraron buenos resultados en muchas pruebas de comprensión del lenguaje, como la Super General Language Understanding Evaluation (SuperGLUE). [ 15 ] [ 17 ] GPT-4 obtuvo una puntuación en el percentil >90 en el Uniform Bar Examination y logró una precisión del 93 % en la prueba de referencia MATH de problemas de la Olimpiada de secundaria, resultados que superan las expectativas de la memorización de patrones. [ 18 ] Estas pruebas, y la fluidez de muchas respuestas de los LLM, ayudan a que hasta el 51 % de los profesionales de IA crean que realmente pueden comprender el lenguaje con suficientes datos, según una encuesta de 2022. [ 15 ]

Refutaciones de expertos

Algunos investigadores de IA cuestionan la idea de que los modelos de lenguaje natural simplemente "repitan" sus datos de entrenamiento.

Geoffrey Hinton , figura pionera en redes neuronales, argumenta que la metáfora malinterpreta el requisito previo para una predicción lingüística precisa. Sostiene que «para predecir la siguiente palabra con exactitud, hay que comprender la oración», una postura que presentó en el programa 60 Minutes en 2023. [ 19 ] Desde esta perspectiva, la comprensión no es una alternativa a la predicción estadística, sino una propiedad emergente necesaria para realizarla eficazmente a gran escala. Hinton también utiliza acertijos lógicos para demostrar que los modelos de lenguaje natural (LLM) sí comprenden el lenguaje. [ 20 ]

Una investigación de Scientific American de 2024 describió un taller cerrado en Berkeley donde modelos de última generación resolvieron problemas matemáticos novedosos de nivel 4 y produjeron demostraciones coherentes, lo que indica capacidades de razonamiento que van más allá de la memorización. [ 21 ]

El informe técnico de GPT-4 mostró resultados a nivel humano en exámenes profesionales y académicos (por ejemplo, el Uniform Bar Exam y el USMLE ), desafiando la caracterización de "loro". [ 18 ]

Anthropic realizó una investigación sobre la interpretabilidad mecanicista de Claude , utilizando grafos de atribución para identificar circuitos . La investigación mostró cómo el LLM procesa la información mediante cadenas de inferencia lógica difusa e indicó una capacidad de planificación anticipada. Descubrieron que Claude 3.5 Haiku «emplea abstracciones notablemente generales», forma «planes generados internamente para sus resultados futuros» y «trabaja hacia atrás a partir de sus objetivos a largo plazo». Observaron que «los mecanismos del modelo aparentemente solo pueden describirse fielmente utilizando un grafo causal abrumadoramente grande». También descubrieron que el modelo incluye «mecanismos que podrían subyacer a una forma simple de metacognición », en el sentido de que «piensa en» el nivel de su propio conocimiento antes de llegar a su respuesta. [ 22 ]

Interpretabilidad

Otra línea de evidencia en contra de la afirmación del "loro estocástico" proviene de la interpretabilidad mecanicista , un campo de investigación dedicado a la ingeniería inversa de los modelos de lógica difusa (MLD) para comprender su funcionamiento interno. En lugar de limitarse a observar el comportamiento de entrada-salida del modelo, estas técnicas analizan sus activaciones internas, lo que permite determinar si contienen representaciones estructuradas del mundo. El objetivo es investigar si los MLD simplemente manipulan estadísticas superficiales o si construyen y utilizan "modelos del mundo" internos para procesar información.

Un ejemplo es Othello-GPT, donde se entrenó un pequeño transformador para predecir movimientos legales de Othello . Se ha descubierto que este modelo tiene una representación interna del tablero de Othello y que modificar esta representación cambia los movimientos legales de Othello predichos de la manera correcta. Esto respalda la idea de que los modelos de lógica de juego (LLM) tienen un "modelo del mundo" y no se limitan a realizar estadísticas superficiales. [ 23 ] [ 24 ]

En otro ejemplo, se entrenó un pequeño transformador con programas informáticos escritos en el lenguaje de programación Karel . De forma similar al ejemplo de Othello-GPT, este modelo desarrolló una representación interna de la semántica de los programas Karel. La modificación de esta representación produce cambios apropiados en la salida. Además, el modelo genera programas correctos que, en promedio, son más cortos que los del conjunto de entrenamiento. [ 25 ]

Los investigadores también estudiaron el " grokking ", un fenómeno en el que un modelo de IA memoriza inicialmente los resultados de los datos de entrenamiento y, después de un entrenamiento adicional, encuentra repentinamente una solución que se generaliza a datos no vistos. [ 26 ]

Aprendizaje abreviado y fallos en los puntos de referencia

Un contrapunto significativo en el debate es el fenómeno bien documentado del "aprendizaje de atajos". [ 27 ] Los críticos de las afirmaciones sobre la comprensión de LLM argumentan que las puntuaciones de referencia altas pueden ser engañosas.

Cuando se utilizan pruebas creadas para evaluar la comprensión del lenguaje en personas para evaluar modelos de aprendizaje de lenguaje (MLL), a veces se obtienen falsos positivos debido a correlaciones espurias dentro de los datos de texto. [ 28 ] Los modelos han mostrado ejemplos de aprendizaje por atajos, que ocurre cuando un sistema establece correlaciones no relacionadas dentro de los datos en lugar de utilizar una comprensión similar a la humana. [ 27 ]

Véase también

Notas

  1. utilizando el seudónimo "Shmargaret Shmitchell"

Referencias

  1. 1 2 3 4 5 Zimmer, Ben (18 de enero de 2024) .«Loro estocástico»: un nombre para la IA que suena un poco menos inteligente . Wall Street Journal . Archivado del original el 3 de noviembre de 2025. Consultado el 1 de abril de 2024 .
  2. Hao, Karen (4 de diciembre de 2020). "Leímos el artículo que obligó a Timnit Gebru a dejar Google. Esto es lo que dice" . MIT Technology Review . Recuperado el 28 de mayo de 2026 .
  3. 1 2 Hao, Karen (4 de diciembre de 2020). "Leímos el artículo que obligó a Timnit Gebru a dejar Google. Esto es lo que dice" . MIT Technology Review . Archivado del original el 6 de octubre de 2021. Recuperado el 19 de enero de 2022 .
  4. 1 2 3 4 Emily M. Bender ; Timnit Gebru ; Angelina McMillan-Major; Shmargaret Shmitchell (marzo de 2021), Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes?🦜 , Association for Computing Machinery , págs. 610–623 , doi : 10.1145/3442188.3445922 , Wikidata Q105943036  
  5. "La codirectora de IA ética de Google afirma que fue despedida por un correo electrónico" . Bloomberg.com . Archivado del original el 5 de octubre de 2025. Consultado el 28 de mayo de 2026 .
  6. Metz, Cade; Wakabayashi, Daisuke (3 de diciembre de 2020). "Investigadora de Google afirma haber sido despedida por un artículo que destacaba el sesgo en la IA". The New York Times . ISSN 0362-4331 . Consultado el 28 de mayo de 2026 . 
  7. Lyons, Kim (5 de diciembre de 2020). "El artículo de Timnit Gebru podría explicar por qué Google la despidió" . The Verge . Archivado del original el 16 de noviembre de 2025. Consultado el 9 de mayo de 2023 .
  8. Corbin, Sam (15 de enero de 2024). "Entre los lingüistas, la palabra del año es más bien una sensación" . The New York Times . ISSN 0362-4331 . Archivado del original el 8 de diciembre de 2024. Consultado el 1 de abril de 2024 . 
  9. "Todas las palabras del año, 1990 hasta la actualidad" . Sociedad Americana de Dialectos . Archivado del original el 8 de febrero de 2026. Consultado el 16 de agosto de 2025 .
  10. Arkoudas, Konstantine (21 de agosto de 2023). "ChatGPT no es un loro estocástico. Pero también afirma que 1 es mayor que 1". Philosophy & Technology . 36 (3) 54. doi : 10.1007/s13347-023-00619-6 . ISSN 2210-5441 . 
  11. ^ Lindholm y cols. 2022 , págs. 322–3.
  12. Uddin, Muhammad Saad (20 de abril de 2023). "Loros estocásticos: una nueva perspectiva sobre los grandes modelos de lenguaje y sus limitaciones" . Hacia la IA . Archivado del original el 11 de septiembre de 2024. Recuperado el 12 de mayo de 2023 .
  13. 1 2 3 4 Fayyad, Usama M. (26 de mayo de 2023). "De loros estocásticos a asistentes inteligentes: los secretos de los datos y las intervenciones humanas". IEEE Intelligent Systems . 38 (3): 63– 67. Bibcode : 2023IISys..38c..63F . doi : 10.1109/MIS.2023.3268723 . ISSN 1541-1672 . 
  14. 1 2 3 4 5 6 7 Saba, Walid S. (2023). "Los LLMS estocásticos no entienden el lenguaje: Hacia LLMS simbólicos, explicables y basados ​​en la ontología". En Almeida, João Paulo A.; Borbinha, José; Guizzardi, Giancarlo; Link, Sebastian; Zdravkovic, Jelena (eds.). Modelado conceptual . Lecture Notes in Computer Science. Vol. 14320. Cham: Springer Nature Switzerland. pp. 3–19 . arXiv : 2309.05918 . doi : 10.1007/978-3-031-47262-6_1 . ISBN   978-3-031-47262-6.
  15. 1 2 3 4 5 Mitchell, Melanie; Krakauer, David C. (28 de marzo de 2023). "El debate sobre la comprensión en los grandes modelos de lenguaje de la IA" . Actas de la Academia Nacional de Ciencias . 120 (13) e2215907120. arXiv : 2210.13966 . Bibcode : 2023PNAS..12015907M . doi : 10.1073/pnas.2215907120 . ISSN 0027-8424 . PMC 10068812. PMID 36943882 .   
  16. Piper, Kelsey (13 de febrero de 2026). "Cuando lo 'técnicamente cierto' se convierte en 'realmente engañoso'"." . El argumento . Consultado el 13 de febrero de 2026 .
  17. Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; Singh, Amanpreet; Michael, Julian; Hill, Felix; Levy, Omer; Bowman, Samuel R. (2 de mayo de 2019). "SuperGLUE: Un punto de referencia más sólido para sistemas de comprensión del lenguaje de propósito general". arXiv : 1905.00537 [ cs.CL ].
  18. 1 2 OpenAI; et al. (2023). "Informe técnico de GPT-4". arXiv : 2303.08774 [ cs.CL ]. 
  19. Pelley, Scott (8 de octubre de 2023) .Geoffrey Hinton, el "padrino de la inteligencia artificial", habla sobre las promesas y los riesgos de la IA avanzada . CBS News . Consultado el 2 de julio de 2025 .
  20. 60 Minutes (9 de octubre de 2023). Geoffrey Hinton, el "padrino de la IA": la entrevista en 60 Minutes . Archivado del original el 3 de julio de 2025. Recuperado el 2 de julio de 2025 a través de YouTube.{{cite AV media}}: CS1 maint: nombres numéricos: lista de autores ( enlace )
  21. Morris, Ian (24 de marzo de 2024). "Dentro de la reunión secreta donde los matemáticos lucharon por superar a la IA" . Scientific American . Archivado del original el 4 de julio de 2025. Recuperado el 2 de julio de 2025 .
  22. Lindsey, Jack; Gurnee, Wes; Ameisen, Emmanuel; et al. (27 de marzo de 2025). "Sobre la biología de un modelo de lenguaje grande" . Hilo de Transformer Circuits . Archivado del original el 22 de marzo de 2026. Recuperado el 23 de marzo de 2026 . 
  23. Li, Kenneth; Hopkins, Aspen K.; Bau, David; Viégas, Fernanda; Pfister, Hanspeter; Wattenberg, Martin (27 de febrero de 2023), Representaciones emergentes del mundo: Explorando un modelo de secuencia entrenado en una tarea sintética , arXiv : 2210.13382
  24. Li, Kenneth (21 de enero de 2023). "Grandes modelos de lenguaje: ¿modelos del mundo o estadísticas superficiales?" . The Gradient . Recuperado el 4 de abril de 2024 .
  25. Jin, Charles; Rinard, Martin (24 de mayo de 2023), Evidencia de significado en modelos de lenguaje entrenados con programas , arXiv : 2305.11169
  26. Schreiner, Maximilian (11 de agosto de 2023). "Grokking en el aprendizaje automático: cuando los loros estocásticos construyen modelos" . the decoder . Archivado del original el 25 de mayo de 2024. Recuperado el 25 de mayo de 2024 .
  27. 1 2 Geirhos, Robert; Jacobsen, Jörn-Henrik; Michaelis, Claudio; Zemel, Richard; Brendel, Wieland; Bethge, Matthias; Wichmann, Felix A. (10 de noviembre de 2020). "Aprendizaje de atajos en redes neuronales profundas" . Nature Machine Intelligence . 2 (11): 665– 673. arXiv : 2004.07780 . doi : 10.1038/s42256-020-00257-z . ISSN 2522-5839 . Archivado del original el 22 de mayo de 2024. Recuperado el 3 de abril de 2024 . 
  28. Choudhury, Sagnik Ray; Rogers, Anna; Augenstein, Isabelle (15 de septiembre de 2022), Lectura automática, rápida y lenta: ¿ Cuándo "entienden" los modelos el lenguaje?, arXiv : 2209.07430

Obras citadas

  • Lindholm, A.; Wahlström, N.; Lindsten, F.; Schön, TB (2022). Aprendizaje automático: Un primer curso para ingenieros y científicos . Cambridge University Press. ISBN 978-1-108-84360-7.
  • Weller, Adrian (13 de julio de 2021). Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? 🦜 (vídeo). Instituto Alan Turing .Discurso de apertura a cargo de Emily Bender. Tras la presentación, tuvo lugar un debate con mesa redonda.

Lecturas adicionales

  • Bogost, Ian (7 de diciembre de 2022). "ChatGPT es más tonto de lo que crees: trátalo como un juguete, no como una herramienta" . The Atlantic . Consultado el 17 de enero de 2024 .
  • Chomsky, Noam (8 de marzo de 2023). "La falsa promesa de ChatGPT" . The New York Times . Recuperado el 17 de enero de 2024 .
  • Glenberg, Arthur; Jones, Cameron Robert (6 de abril de 2023). "Se necesita un cuerpo para entender el mundo: por qué ChatGPT y otras IA de lenguaje no saben lo que dicen" . The Conversation . Recuperado el 17 de enero de 2024 .
  • McQuillan, D. (2022). Resisting AI: An Anti-fascist Approach to Artificial Intelligence . Bristol University Press . ISBN 978-1-5292-1350-8.
  • Thompson, E. (2022). Escape from Model Land: How Mathematical Models Can Lead Us Astray and What We Can Do about It . Basic Books. ISBN 978-1-5416-0098-0.
  • Zhong, Qihuang; Ding, Liang; Liu, Juhua; Du, Bo; Tao, Dacheng (2023). "¿ChatGPT también puede entenderlo? Un estudio comparativo sobre ChatGPT y BERT mejorado". arXiv : 2302.10198 [ cs.CL ].
  • " Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? 🦜 " en Wikimedia Commons