
En el aprendizaje automático , el grokking , o generalización retardada , es un fenómeno observado en algunos entornos donde un modelo pasa abruptamente del sobreajuste (que funciona bien solo en los datos de entrenamiento ) a la generalización (que funciona bien tanto en los datos de entrenamiento como en los de prueba), después de muchas iteraciones de entrenamiento con poca o ninguna mejora en los datos reservados. [ 2 ] : 2 Esto contrasta con lo que se observa típicamente en el aprendizaje automático, donde la generalización ocurre gradualmente junto con una mejora en el rendimiento en los datos de entrenamiento. [ 3 ] [ 4 ]
Origen
El término "grokking" fue introducido por la investigadora de OpenAI, Alethea Power, y sus colegas en el artículo de enero de 2022 "Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets". [ 2 ] Se deriva de la palabra " grok" , acuñada por Robert Heinlein en su novela " Forastero en tierra extraña" . [ 1 ] En la investigación de aprendizaje automático, "grokking" no se usa como sinónimo de "generalización"; más bien, designa un fenómeno de entrenamiento de generalización retardada que a veces se observa, en el que el rendimiento del entrenamiento y el rendimiento de prueba no mejoran simultáneamente, y en el que el rendimiento de prueba aumenta abruptamente después de un largo período en el que el rendimiento de prueba ha alcanzado lo que parece ser un valor máximo. Los autores también analizan el "tiempo de grokking", la época o paso en el que ocurre esta transición en esos escenarios. [ 2 ] : 10
Interpretaciones
El fenómeno de Grokking puede entenderse como una transición de fase durante el proceso de entrenamiento. [ 5 ] En particular, trabajos recientes han demostrado que el Grokking puede deberse a una transición de fase de complejidad en el modelo durante el entrenamiento. [ 6 ] Si bien se ha pensado que el Grokking es principalmente un fenómeno de modelos relativamente simples, se ha observado en redes neuronales profundas y modelos no neuronales, y es objeto de investigación activa. [ 7 ] [ 8 ] [ 9 ] [ 10 ]
Una posible explicación es que la regularización (un componente de la función de pérdida que penaliza los valores más altos de los parámetros de la red neuronal ) favorece ligeramente la solución general, que es más simple (ya que implica valores de peso más bajos), pero que también es más difícil de encontrar. Según Neel Nanda, el proceso de aprendizaje de la solución general puede ser gradual, aunque la transición a dicha solución se produzca más repentinamente más adelante. [ 1 ]
Teorías recientes [ 11 ] [ 12 ] han planteado la hipótesis de que el grokking ocurre cuando las redes neuronales transitan de un régimen de "entrenamiento perezoso" [ 13 ] , donde los pesos no se desvían mucho de la inicialización, a un régimen "rico", donde los pesos comienzan abruptamente a moverse en direcciones relevantes para la tarea. Trabajos empíricos y teóricos posteriores [ 14 ] han acumulado evidencia en apoyo de esta perspectiva y ofrecen una visión unificadora de trabajos anteriores, ya que se sabe que la transición de la dinámica de entrenamiento perezoso a la rica surge de propiedades de optimizadores adaptativos, [ 15 ] decaimiento de pesos, [ 16 ] norma de peso de parámetros iniciales, [ 9 ] y más. Esta perspectiva es complementaria a un marco unificador de "velocidades de aprendizaje de patrones" que vincula el grokking y el doble descenso ; dentro de esta visión, la generalización retardada puede surgir a lo largo del tiempo de entrenamiento ("por época") o a lo largo del tamaño del modelo ("por modelo"), y los autores informan de "grokking por modelo". [ 17 ]
Véase también
Referencias
- 1 2 3 Ananthaswamy, Anil (2024-04-12). "¿Cómo 'comprenden' las máquinas los datos?" . Quanta Magazine . Recuperado el 2025-01-21 .
- 1 2 3 Power et al. 2022 .
- ↑ Pearce, Adam; Ghandeharioun, Asma; Hussein, Nada; Thain, Nithum; Wattenberg, Martin; Dixon, Lucas. "¿Los modelos de aprendizaje automático memorizan o generalizan?" . pair.withgoogle.com . Consultado el 4 de junio de 2024 .
- ↑ Minegishi, Gouki; Iwasawa, Yusuke; Matsuo, Yutaka (2024-05-09). "Uniendo el billete de lotería y Grokking: ¿Es suficiente la norma de peso para explicar la generalización retardada?". arXiv : 2310.19470 [ cs.LG ].
- ↑ Liu, Ziming; Kitouni, Ouail; Nolte, Niklas; Michaud, Eric J.; Tegmark, Max; Williams, Mike (2022). "Hacia la comprensión de Grokking: una teoría eficaz del aprendizaje de representaciones" . En Koyejo, Sanmi; Mohamed, S.; Agarwal, A.; Belgrave, Danielle; Cho, K.; Oh, A. (eds.). Avances en sistemas de procesamiento de información neuronal 35: Conferencia anual sobre sistemas de procesamiento de información neuronal 2022, NeurIPS 2022, Nueva Orleans, LA, EE. UU., 28 de noviembre - 9 de diciembre de 2022. arXiv : 2205.10343 .
- ↑ DeMoss, Branton; Sapora, Silvia; Foerster, Jakob; Hawes, Nick; Posner, Ingmar (2025). "La dinámica de complejidad del grokking" . Physica D: Nonlinear Phenomena . 482 134859. doi : 10.1016/j.physd.2025.134859 . ISSN 0167-2789 .
- ↑ Fan, Simin; Pascanu, Razvan; Jaggi, Martin (2024-05-29). "Deep Grokking: ¿Las redes neuronales profundas generalizarían mejor?". arXiv : 2405.19454 [ cs.LG ].
- ↑ Miller, Jack; O'Neill, Charles; Bui, Thang (2024-03-31). "Grokking Beyond Neural Networks: An Empirical Exploration with Model Complexity". arXiv : 2310.17247 [ cs.LG ].
- 1 2 Liu, Ziming; Michaud, Eric J.; Tegmark, Max (2023). "Omnigrok: Grokking más allá de los datos algorítmicos" . Undécima Conferencia Internacional sobre Representaciones de Aprendizaje, ICLR 2023, Kigali, Ruanda, 1-5 de mayo de 2023. OpenReview.net. arXiv : 2210.01117 .
- ↑ Samothrakis, Spyridon; Matran-Fernandez, Ana; Abdullahi, Umar I.; Fairbank, Michael; Fasli, Maria (2022). "Efectos tipo Grokking en la inferencia contrafactual" . Conferencia Internacional Conjunta sobre Redes Neuronales, IJCNN 2022, Padua, Italia, 18-23 de julio de 2022. IEEE. pp. 1-8 . doi : 10.1109/IJCNN55064.2022.9891910 . ISBN 978-1-7281-8671-9.
- ↑ Kumar, Tanishq; Bordelon, Blake; Gershman, Samuel J.; Pehlevan, Cengiz (2023). "Grokking como la transición de la dinámica de entrenamiento perezosa a la rica". arXiv : 2310.06110 [ stat.ML ].
- ↑ Lyu, Kaifeng; Jin, Jikai; Li, Zhiyuan; Du, Simon S.; Lee, Jason D.; Hu, Wei (2023). "La dicotomía de los sesgos implícitos de fase temprana y tardía puede inducir Grokking de manera demostrable". arXiv : 2311.18817 [ cs.LG ].
- ↑ Chizat, Lenaic; Oyallon, Edouard; Bach, Francis (2018). "Sobre el entrenamiento perezoso en programación diferenciable". arXiv : 1812.07956 [ math.OC ].
- ↑ Mohamad Amin Mohamadi; Li, Zhiyuan; Wu, Lei; Sutherland, Danica J. (2024). "¿Por qué Grok? Un análisis teórico de la suma modular Grokking". arXiv : 2407.12332 [ cs.LG ].
- ↑ Thilak, Vimal; Littwin, Etai; Zhai, Shuangfei; Saremi, Omid; Paiss, Roni; Susskind, Joshua (2022). "El mecanismo de la honda: un estudio empírico de optimizadores adaptativos y el fenómeno Grokking". arXiv : 2206.04817 [ cs.LG ].
- ^ Varma, Vikrant; Shah, Rohin; Kenton, Zachary; Kramár, János; Kumar, Ramana (2023). "Explicando la asimilación a través de la eficiencia del circuito". arXiv : 2309.02390 [ cs.LG ].
- ↑ Davies, Xander; Langosco, Lauro; Krueger, David (2023). "Unifying Grokking and Double Descent". arXiv : 2303.06173 [ cs.LG ].
Fuentes
- Power, Alethea; Burda, Yuri; Edwards, Harri; Babuschkin, Igor; Misra, Vedant (2022-01-06). "Grokking: Generalización más allá del sobreajuste en pequeños conjuntos de datos algorítmicos". arXiv : 2201.02177 [ cs.LG ].
- Aprendizaje automático
- fenómenos