Articulo de referencia

Red neuronal de retroalimentación

Las redes neuronales con retroalimentación son redes neuronales capaces de proporcionar retroalimentación de diseño ascendente y descendente a sus capas de entrada o anteriores,...

Las redes neuronales con retroalimentación son redes neuronales capaces de proporcionar retroalimentación de diseño ascendente y descendente a sus capas de entrada o anteriores, basándose en sus salidas o capas subsiguientes. Esto se utiliza notablemente en grandes modelos de lenguaje , específicamente en modelos de lenguaje de razonamiento (RLM). Este proceso está diseñado para imitar la autoevaluación y la deliberación interna, con el objetivo de minimizar errores (como alucinaciones ) y aumentar la interpretabilidad . Esta reflexión es una forma de " computación en tiempo de prueba ", donde se utilizan recursos computacionales adicionales durante la inferencia.

Introducción

Las redes neuronales tradicionales procesan las entradas de forma directa , generando salidas en una sola pasada. Sin embargo, sus limitaciones para manejar tareas complejas, especialmente las compositivas, han impulsado el desarrollo de métodos que simulan la deliberación interna. Técnicas como la estimulación de la cadena de pensamiento animan a los modelos a generar pasos de razonamiento intermedios, mejorando así su rendimiento en dichas tareas.

La retroalimentación puede tener lugar después de un recorrido completo de la red y la decodificación a tokens, o de forma continua en el espacio latente (la última capa puede retroalimentarse a la primera capa). [ 1 ] [ 2 ] En los LLM, los tokens especiales pueden marcar el principio y el final de la reflexión antes de producir una respuesta final (por ejemplo, <pensando>).

Este proceso interno de "pensar" sobre los pasos que conducen a una respuesta está diseñado para ser análogo a la metacognición humana o "pensar sobre el pensamiento". Ayuda a los sistemas de IA a abordar tareas que requieren razonamiento, planificación y pensamiento lógico en múltiples pasos.

Técnicas

Aumentar la longitud del proceso de razonamiento de la Cadena de Pensamiento , al pasar la salida del modelo de vuelta a su entrada y realizar múltiples pasadas de red, aumenta la escala del tiempo de inferencia. [ 3 ] Los marcos de aprendizaje por refuerzo también se han utilizado para dirigir la Cadena de Pensamiento. Un ejemplo es la Optimización de Política Relativa de Grupo (GRPO), utilizada en DeepSeek-R1 , [ 4 ] una variante de los métodos de gradiente de política que elimina la necesidad de un modelo "crítico" separado al normalizar las recompensas dentro de un grupo de salidas generadas, reduciendo el costo computacional. Técnicas simples como el "forzamiento de presupuesto" (obligar al modelo a continuar generando pasos de razonamiento) también han demostrado ser eficaces para mejorar el rendimiento. [ 5 ]

Tipos de reflexión

Reflexión posterior

Analiza y critica un resultado inicial por separado, a menudo indicándole al modelo que identifique errores o sugiera mejoras después de generar una respuesta. El marco de Reflexión sigue este enfoque. [ 6 ]

Reflexión iterativa

Durante su generación, el modelo revisa dinámicamente partes anteriores de una respuesta. Los mecanismos de autocontrol permiten ajustar el razonamiento a medida que avanza. Métodos como el Árbol de Pensamientos son un ejemplo de esto, ya que posibilitan el retroceso y la exploración de alternativas.

Reflexión intrínseca

Integra el automonitoreo directamente en la arquitectura del modelo en lugar de depender únicamente de indicaciones externas, lo que permite que los modelos tengan una conciencia inherente de sus limitaciones e incertidumbres de razonamiento. Google DeepMind ha utilizado esta técnica llamada Autocorrección mediante Aprendizaje por Refuerzo (SCoRe), que recompensa al modelo por mejorar sus respuestas. [ 7 ]

Modelos de recompensa de procesos y limitaciones

Las primeras investigaciones exploraron los PRM para proporcionar retroalimentación en cada paso del razonamiento, a diferencia del aprendizaje por refuerzo tradicional que solo recompensa el resultado final. Sin embargo, los PRM han enfrentado desafíos, incluyendo el costo computacional y la manipulación de recompensas. Los desarrolladores de DeepSeek-R1 descubrieron que no eran beneficiosos. [ 8 ] [ 9 ]

Véase también

Referencias

  1. Geiping, Jonas; McLeish, Sean; Jain, Neel; Kirchenbauer, John; Singh, Siddharth; Bartoldson, Brian R.; Kailkhura, Bhavya; Bhatele, Abhinav; Goldstein, Tom (2025). "Ampliando la computación en tiempo de prueba con razonamiento latente: un enfoque de profundidad recurrente". arXiv : 2502.05171 [ cs.LG ].
  2. ^ Hao, Shibo; Sukhbaatar, Sainbayar; Su, DiJia; Li, Xian; Hu, Zhiting; Weston, Jason; Tian, ​​Yuandong (2024). "Entrenamiento de modelos de lenguaje grandes para razonar en un espacio latente continuo". arXiv : 2412.06769 [ cs.CL ].
  3. DeepSeek-AI; et al. (2025). "DeepSeek-R1: Incentivando la capacidad de razonamiento en LLMS mediante aprendizaje por refuerzo". arXiv : 2501.12948 [ cs.CL ]. 
  4. ^ Shao, Zhihong; Wang, Peiyi; Zhu, Qihao; Xu, Runxin; Canción, Junxiao; Bi, Xiao; Zhang, Haowei; Zhang, Mingchuan; Li, YK; Wu, Y.; Guo, Daya (2024). "DeepSeekMath: superando los límites del razonamiento matemático en modelos de lenguaje abierto". arXiv : 2402.03300 [ cs.CL ].
  5. Muennighoff, Niklas; Yang, Zitong; Shi, Weijia; Xiang Lisa Li; Fei-Fei, Li; Hajishirzi, Hannaneh ; Zettlemoyer, Luke; Liang, Percy ; Candès, Emmanuel; Hashimoto, Tatsunori (2025). "S1: Escalado simple del tiempo de prueba". arXiv : 2501.19393 [ cs.CL ].
  6. Shinn, Noah; Cassano, Federico; Berman, Edward; Gopinath, Ashwin; Narasimhan, Karthik; Yao, Shunyu (2023). "Reflexión: Agentes de lenguaje con aprendizaje por refuerzo verbal". arXiv : 2303.11366 [ cs.AI ].
  7. Dickson, Ben (1 de octubre de 2024). "SCoRe de DeepMind demuestra que los LLM pueden usar su conocimiento interno para corregir sus errores" . VentureBeat . Recuperado el 20 de febrero de 2025 .
  8. Uesato, Jonathan; Kushman, Nate; Kumar, Ramana; Song, Francis; Siegel, Noah; Wang, Lisa; Creswell, Antonia; Irving, Geoffrey; Higgins, Irina (2022). "Resolución de problemas matemáticos verbales con retroalimentación basada en el proceso y el resultado". arXiv : 2211.14275 [ cs.LG ].
  9. Lightman, Hunter; Kosaraju, Vineet; Burda, Yura; Edwards, Harri; Baker, Bowen; Lee, Teddy; Leike, Jan; Schulman, John; Sutskever, Ilya; Cobbe, Karl (2023). "Let's Verify Step by Step". arXiv : 2305.20050 [ cs.LG ].