
En el aprendizaje automático , una ley de escalado neuronal es una ley de escalado empírica que describe cómo cambia el rendimiento de una red neuronal a medida que se incrementan o reducen factores clave. Estos factores suelen incluir el número de parámetros, el tamaño del conjunto de datos de entrenamiento [ 1 ] [ 2 ] y el coste del entrenamiento. Algunos modelos también muestran mejoras en el rendimiento al escalar la inferencia mediante un mayor tiempo de cómputo en tiempo de prueba (TTC), extendiendo las leyes de escalado neuronal más allá del entrenamiento hasta la fase de implementación. [ 3 ]
Introducción
En general, un modelo de aprendizaje profundo se puede caracterizar por cuatro parámetros: tamaño del modelo, tamaño del conjunto de datos de entrenamiento, costo de entrenamiento y tasa de error posterior al entrenamiento (por ejemplo, la tasa de error del conjunto de prueba). Cada una de estas variables se puede definir como un número real , generalmente escrito como(respectivamente: número de parámetros, tamaño del conjunto de datos, coste computacional y pérdida ).
Una ley de escalamiento neuronal es una ley estadística, teórica o empírica , que relaciona estos parámetros. Existen también otros parámetros con otras leyes de escalamiento.
Tamaño del modelo
En la mayoría de los casos, el tamaño del modelo se define simplemente por el número de parámetros. Sin embargo, surge una complicación con el uso de modelos dispersos, como los modelos de mezcla de expertos . [ 4 ] Con los modelos dispersos, durante la inferencia, solo se utiliza una fracción de sus parámetros. En comparación, la mayoría de los demás tipos de redes neuronales, como los modelos Transformer , siempre utilizan todos sus parámetros durante la inferencia.
Tamaño del conjunto de datos de entrenamiento
El tamaño del conjunto de datos de entrenamiento se suele cuantificar por el número de puntos de datos que contiene. Generalmente se prefieren los conjuntos de datos de entrenamiento más grandes, ya que proporcionan una fuente de información más rica y diversa a partir de la cual el modelo puede aprender. Esto puede conducir a un mejor rendimiento de generalización cuando el modelo se aplica a datos nuevos y no vistos. [ 5 ] Sin embargo, aumentar el tamaño del conjunto de datos de entrenamiento también incrementa los recursos computacionales y el tiempo necesarios para el entrenamiento del modelo.
Con el método de "preentrenamiento y ajuste fino" utilizado para la mayoría de los modelos de lenguaje grandes , existen dos tipos de conjuntos de datos de entrenamiento: el conjunto de datos de preentrenamiento y el conjunto de datos de ajuste fino . Sus tamaños tienen efectos diferentes en el rendimiento del modelo. Generalmente, el conjunto de datos de ajuste fino es menor al 1 % del tamaño del conjunto de datos de preentrenamiento. [ 6 ]
En algunos casos, una pequeña cantidad de datos de alta calidad es suficiente para el ajuste fino, y más datos no necesariamente mejoran el rendimiento. [ 6 ]
Muchas leyes de escala, debido a su naturaleza inherente de rendimientos decrecientes, valoran los datos en función de una función de conjunto submodular que se mostró en un artículo [ 7 ] sobre este tema.
Costo de la formación

El coste del entrenamiento se suele medir en términos de tiempo (cuánto tiempo se tarda en entrenar el modelo) y recursos computacionales (cuánta potencia de procesamiento y memoria se requieren). Es importante destacar que el coste del entrenamiento se puede reducir significativamente con algoritmos de entrenamiento eficientes, bibliotecas de software optimizadas y computación paralela en hardware especializado como GPU o TPU .
El costo de entrenar un modelo de red neuronal depende de varios factores, como el tamaño del modelo, el tamaño del conjunto de datos de entrenamiento, la complejidad del algoritmo de entrenamiento y los recursos computacionales disponibles. [ 5 ] En particular, duplicar el tamaño del conjunto de datos de entrenamiento no necesariamente duplica el costo del entrenamiento, ya que se puede entrenar el modelo varias veces sobre el mismo conjunto de datos (cada una de ellas una " época ").
Actuación



El rendimiento de un modelo de red neuronal se evalúa en función de su capacidad para predecir con precisión la salida a partir de ciertos datos de entrada. Las métricas comunes para evaluar el rendimiento del modelo incluyen: [ 5 ]
- Log-verosimilitud negativa por token (logaritmo de perplejidad ) para el modelado del lenguaje ;
- Precisión , exactitud, exhaustividad y puntuación F1 para tareas de clasificación ;
- Error cuadrático medio (ECM) o error absoluto medio (EAM) para tareas de regresión ;
- Clasificación Elo en una competición contra otros modelos, como el juego [ 10 ] o la preferencia de un juez humano . [ 11 ]
El rendimiento puede mejorarse utilizando más datos, modelos más grandes, diferentes algoritmos de entrenamiento, regularizando el modelo para evitar el sobreajuste y deteniendo el proceso prematuramente mediante un conjunto de validación.
Cuando el rendimiento es un número acotado dentro del rango de, como exactitud, precisión, etc., a menudo se escala como una función sigmoide del costo, como se ve en las figuras.
Ejemplos
(Hestness, Narang, et al, 2017)
El artículo de 2017 [ 2 ] es un punto de referencia común para las leyes de escalamiento neuronal ajustadas mediante análisis estadístico de datos experimentales. Los trabajos anteriores a la década de 2000, citados en el artículo, eran teóricos o de órdenes de magnitud menores en escala. Mientras que los trabajos anteriores generalmente encontraron que el exponente de escalamiento escalaba como, conEl artículo encontró que.
De los factores que variaron, solo la tarea puede cambiar el exponente.Cambiar los optimizadores de arquitectura, los regularizadores y las funciones de pérdida solo cambiaría el factor de proporcionalidad, no el exponente. Por ejemplo, para la misma tarea, una arquitectura podría tenermientras que otro podría tenerTambién descubrieron que, para una arquitectura dada, el número de parámetros necesarios para alcanzar los niveles más bajos de pérdida, dado un tamaño de conjunto de datos fijo, crece comopara otro exponente.
Estudiaron traducción automática con LSTM (), modelado de lenguaje generativo con LSTM (), clasificación de ImageNet con ResNet (), y reconocimiento de voz con dos arquitecturas híbridas (LSTM complementadas con CNN o un decodificador de atención)).
(Henighan, Kaplan y otros, 2020)
Un análisis de 2020 [ 12 ] estudió las relaciones estadísticas entresobre una amplia gama de valores y encontraron leyes de escala similares, sobre la gama de,y en múltiples modalidades (texto, vídeo, imagen, texto a imagen, etc.). [ 12 ]
En particular, las leyes de escala que encontró son (Tabla 1 de [ 12 ] ):
- Para cada modalidad, fijaron uno de los dosy variando el otro (es variado a lo largo del uso), la pérdida de prueba alcanzable satisfacedóndees la variable variada, yson parámetros que se deben encontrar mediante ajuste estadístico. El parámetroes la más importante.
- Cuandoes la variable variada,abarca desdeadependiendo de la modalidad del modelo. Esto corresponde a ladel artículo sobre la escala de las chinchillas.
- Cuandoes la variable variada,abarca desdeadependiendo de la modalidad del modelo. Esto corresponde a ladel artículo sobre la escala de las chinchillas.
- Dado un presupuesto de computación fijo, el número óptimo de parámetros del modelo es consistentemente alrededor deEl parámetroVaría hasta en un factor de 10 para diferentes modalidades. El parámetro exponencialvaría deapara diferentes modalidades. Este exponente corresponde a ladel artículo sobre la escala de las chinchillas.
- Se "sugiere firmemente" (pero no se ha comprobado estadísticamente) queEste exponente corresponde aldel artículo sobre la escala de las chinchillas.
La ley de escala dese confirmó durante el entrenamiento de GPT-3 (Figura 3.1 [ 13 ] ).
Escalamiento de chinchillas (Hoffmann, et al, 2022)

Una ley de escalamiento particular (" escalamiento de chinchilla ") establece que, para un modelo de lenguaje grande (LLM) entrenado autorregresivamente durante una época, con un programa de tasa de aprendizaje de coseno , tenemos: [ 15 ]donde las variables son
- es el costo de entrenar el modelo, medido en operaciones de punto flotante (FLOPs).
- es el número de tokens en el conjunto de entrenamiento.
- es la pérdida promedio de log-verosimilitud negativa por token ( nats /token), lograda por el LLM entrenado en el conjunto de datos de prueba.
- representa la pérdida de un proceso generativo ideal en los datos de prueba.
- captura el hecho de que un modelo de lenguaje Transformer conLos parámetros tienen un rendimiento inferior al del proceso generativo ideal.
- captura el hecho de que el modelo entrenado enEl rendimiento de los tokens es inferior al del proceso generativo ideal.
y los parámetros estadísticos son
- , lo que significa que cuesta 6 FLOPs por parámetro entrenar en un token. Esto es estimado por Kaplan et al. [ 16 ] Nótese que el costo de entrenamiento es mucho mayor que el costo de inferencia, ya que el entrenamiento implica tanto pasadas hacia adelante como hacia atrás , mientras que la inferencia cuesta de 1 a 2 FLOPs por parámetro para inferir en un token.
- .
Aunque Besiroglu et al. [ 17 ] afirman que la estimación estadística es ligeramente errónea y debería ser.
Las leyes estadísticas se ajustaron a los datos experimentales con.
Dado que hay 4 variables relacionadas por 2 ecuaciones, imponer 1 restricción adicional y 1 objetivo de optimización adicional nos permite resolver para las cuatro variables. En particular, para cualquier fijo, podemos resolver de forma única para las 4 variables que minimizaEsto nos proporciona el óptimopara cualquier fijo:Al introducir los valores numéricos, obtenemos el tamaño del modelo "eficiente para la chinchilla" y el tamaño del conjunto de datos de entrenamiento, así como la pérdida de prueba alcanzable:De forma similar, podemos encontrar el tamaño óptimo del conjunto de datos de entrenamiento y el presupuesto de cómputo para el entrenamiento para cualquier tamaño fijo de parámetros del modelo, y así sucesivamente.
Existen otras estimaciones para el tamaño del modelo "eficiente para chinchilla" y el tamaño del conjunto de datos de entrenamiento. Lo anterior se basa en un modelo estadístico deTambién se puede ajustar directamente una ley estadística parasin pasar por el desvío, por el cual se obtiene:o como se muestra en la tabla:
Discrepancia
El análisis de la ley de escala de Chinchilla para el entrenamiento de modelos de lenguaje transformadores sugiere que para un presupuesto de cómputo de entrenamiento dado (), para lograr la pérdida de preentrenamiento mínima para ese presupuesto, el número de parámetros del modelo () y el número de tokens de entrenamiento () deben escalarse en proporciones iguales,Esta conclusión difiere del análisis realizado por Kaplan et al., [ 16 ] que encontró quedebería aumentarse más rápidamente que,.
Esta discrepancia puede atribuirse principalmente a que los dos estudios utilizaron métodos diferentes para medir el tamaño del modelo. Kaplan et al.: [ 18 ]
- No se tuvieron en cuenta los parámetros en la capa de incrustación de tokens, lo que, al analizarse con tamaños de modelo más pequeños, da lugar a coeficientes sesgados;
- Se estudiaron modelos más pequeños que el grupo de chinchillas, lo que magnificó el efecto;
- supuso que.
También surgen efectos secundarios debido a diferencias en el ajuste de hiperparámetros y esquemas de tasa de aprendizaje. Kaplan et al.: [ 19 ]
- Se utilizó un programa de calentamiento demasiado largo para los modelos más pequeños, lo que hizo que parecieran menos eficientes;
- No se ajustaron completamente los hiperparámetros de optimización.
Escala más allá de la chinchilla
Dado que el escalado de Chinchilla ha sido el punto de referencia para muchas ejecuciones de entrenamiento a gran escala, se ha realizado un esfuerzo simultáneo para ir "más allá del escalado de Chinchilla", es decir, modificar parte del proceso de entrenamiento para obtener la misma pérdida con menos esfuerzo, o entrenar deliberadamente durante más tiempo del que es "óptimo para Chinchilla".
Por lo general, el objetivo es aumentar el exponente de la ley de escala, lo que significa que la misma función de pérdida se puede entrenar con mucho menos esfuerzo computacional. Por ejemplo, filtrar los datos puede aumentar el exponente de la ley de escala. [ 20 ]
Otra línea de investigación estudia cómo lidiar con datos limitados, ya que, según las leyes de escalado de Chinchilla, el tamaño del conjunto de datos de entrenamiento para los modelos de lenguaje más grandes ya se acerca a lo que está disponible en Internet. [ 21 ] encontraron que aumentar el conjunto de datos con una mezcla de "objetivos de eliminación de ruido" construidos a partir del conjunto de datos mejora el rendimiento. [ 22 ] estudia el escalado óptimo cuando todos los datos disponibles ya se han agotado (como en lenguas poco comunes), por lo que se deben entrenar múltiples épocas sobre el mismo conjunto de datos (mientras que el escalado de Chinchilla requiere solo una época). La serie Phi de modelos de lenguaje pequeños se entrenó con datos similares a los de un libro de texto generados por modelos de lenguaje grandes, para los cuales los datos solo están limitados por la cantidad de cómputo disponible. [ 23 ]
La optimalidad de Chinchilla se definió como "óptima para el cálculo del entrenamiento", mientras que en los modelos de calidad de producción reales, habrá mucha inferencia después de que el entrenamiento se complete. El "sobreentrenamiento" durante el entrenamiento significa un mejor rendimiento durante la inferencia. [ 24 ] Los modelos LLaMA se sobreentrenaron por esta razón. Estudios posteriores descubrieron leyes de escala en el régimen de sobreentrenamiento, para tamaños de conjuntos de datos hasta 32 veces mayores que el óptimo de Chinchilla. [ 25 ]
Leyes de escalamiento neuronal rotas (BNSL)
Un análisis de 2022 [ 26 ] encontró que muchos comportamientos de escalamiento de las redes neuronales artificiales siguen una forma funcional de ley de potencia suavemente interrumpida :
en el cualse refiere a la cantidad que se está escalando (es decir,,,, número de pasos de entrenamiento, número de pasos de inferencia o tamaño de entrada del modelo) ySe refiere a la métrica de evaluación de rendimiento descendente (o ascendente) de interés (por ejemplo, error de predicción, entropía cruzada , error de calibración, AUROC , porcentaje de puntuación BLEU , puntuación F1 , recompensa, clasificación Elo , tasa de resolución o puntuación FID ) en configuraciones de cero disparos , con indicaciones o ajustadas . Los parámetrosse obtienen mediante ajuste estadístico.
En un gráfico log-log , cuandono es demasiado grande ySe resta del eje y, esta forma funcional parece una serie de segmentos lineales conectados por arcos;Las transiciones entre los segmentos se denominan "rupturas", de ahí el nombre de leyes de escalamiento neuronal rotas (BNSL, por sus siglas en inglés) .
Los escenarios en los que se encontró que los comportamientos de escalado de las redes neuronales artificiales siguen esta forma funcional incluyen visión a gran escala , lenguaje , audio, video, difusión , modelado generativo , aprendizaje multimodal , aprendizaje contrastivo , alineación de IA , capacidades de IA, robótica , generalización fuera de distribución (OOD), aprendizaje continuo, aprendizaje por transferencia , estimación / calibración de incertidumbre , detección fuera de distribución , robustez adversaria , destilación , escasez, recuperación, cuantización, poda , equidad , moléculas, programación/codificación informática, problemas matemáticos verbales, aritmética, habilidades emergentes , doble descenso , aprendizaje supervisado , aprendizaje no supervisado / autosupervisado y aprendizaje por refuerzo (agente único y multiagente ).
Las arquitecturas para las que se ha descubierto que los comportamientos de escalado de las redes neuronales artificiales siguen esta forma funcional incluyen redes neuronales residuales , transformadores , MLP , mezcladores MLP , redes neuronales recurrentes , redes neuronales convolucionales , redes neuronales gráficas , U-nets , modelos codificador-decodificador (y solo codificador) (y solo decodificador), conjuntos (y no conjuntos), modelos MoE (mezcla de expertos) (y no MoE) y modelos podados dispersos (y no podados dispersos).
Escalado de inferencia

Además de aumentar el cálculo de entrenamiento, también se puede aumentar el cálculo de inferencia (o "cálculo en tiempo de prueba" [ 3 ] ). Por ejemplo, la calificación Elo de AlphaGo mejora constantemente a medida que se le permite dedicar más tiempo a su búsqueda en árbol de Monte Carlo por partida. [ 27 ] : Fig. 4 Para AlphaGo Zero , aumentar Elo en 120 requiere duplicar el tamaño del modelo y el entrenamiento, o duplicar la búsqueda en tiempo de prueba. [ 28 ] De manera similar, un modelo de lenguaje para resolver desafíos de codificación de nivel competitivo, AlphaCode, mejoró consistentemente (log-linealmente) su rendimiento con más tiempo de búsqueda. [ 29 ]
Para Hex , 10 veces el tiempo de cálculo de entrenamiento se intercambia por 15 veces el tiempo de cálculo de prueba. [ 10 ] Para Libratus para Texas hold 'em sin límite cara a cara , y Cicero para Diplomacy , y muchos otros juegos abstractos de información parcial, la búsqueda en tiempo de inferencia mejora el rendimiento con una relación de intercambio similar, para un aumento efectivo de hasta 100 000 veces en el tiempo de cálculo de entrenamiento. [ 28 ]
En 2024, el informe OpenAI o1 documentó que el rendimiento de o1 mejoró de forma constante con el aumento tanto del cálculo en tiempo de entrenamiento como en tiempo de prueba, y proporcionó numerosos ejemplos de escalado del cálculo en tiempo de prueba en matemáticas, razonamiento científico y tareas de codificación. [ 30 ] [ 31 ]
Un método para aumentar la capacidad de cálculo en tiempo de prueba es la supervisión basada en procesos , donde un modelo genera una cadena de razonamiento paso a paso para responder una pregunta, y otro modelo (ya sea humano o IA) proporciona una puntuación de recompensa en algunos de los pasos intermedios, no solo en la respuesta final. La supervisión basada en procesos se puede escalar arbitrariamente utilizando una puntuación de recompensa sintética sin otro modelo, por ejemplo, ejecutando simulaciones de Monte Carlo y puntuando cada paso del razonamiento según la probabilidad de que conduzca a la respuesta correcta. Otro método son los modelos de revisión , que son modelos entrenados para resolver un problema varias veces, revisando cada vez el intento anterior. [ 32 ]
Otros ejemplos
transformadores de visión
Los transformadores de visión , similares a los transformadores de lenguaje, exhiben leyes de escala. Una investigación de 2022 entrenó transformadores de visión, con recuentos de parámetros., en conjuntos de imágenes de tamaños, para computación(en unidades de TPUv3-core-days). [ 33 ]
Después de entrenar el modelo, se ajusta en el conjunto de entrenamiento ImageNet .sea la probabilidad de error del modelo ajustado que clasifica el conjunto de prueba ImageNet. Encontraron.
traducción automática neuronal
Ghorbani, Behrooz et al. [ 34 ] estudiaron leyes de escala para la traducción automática neuronal (específicamente, inglés como origen y alemán como destino) en modelos Transformer codificador-decodificador , entrenados hasta la convergencia en los mismos conjuntos de datos (por lo tanto, no ajustaron leyes de escala para el costo computacional).o tamaño del conjunto de datos). VariabanEncontraron tres resultados:
- es una función de ley de escala de, dóndeson el recuento de parámetros del codificador y del decodificador. No es simplemente una función del recuento total de parámetros.La función tiene forma, dóndeson parámetros ajustados. Encontraron queminimiza la pérdida sise mantiene fijo.
- "satura" (es decir, alcanza) para modelos más pequeños cuando los conjuntos de datos de entrenamiento y prueba son "naturales de origen" en lugar de "naturales de destino". Un punto de datos "natural de origen" significa un par de oraciones en inglés y alemán, y se le pide al modelo que traduzca la oración en inglés al alemán, y la oración en inglés es escrita por un escritor natural de inglés, mientras que la oración en alemán es traducida de la oración en inglés por un traductor automático. [ 35 ] Para construir los dos tipos de conjuntos de datos, los autores recopilaron oraciones naturales en inglés y alemán en línea, luego usaron traducción automática para generar sus traducciones.
- A medida que los modelos se hacen más grandes, los modelos entrenados en conjuntos de datos originales de origen pueden lograr una pérdida baja pero una puntuación BLEU mala . Por el contrario, los modelos entrenados en conjuntos de datos originales de destino logran una pérdida baja y una buena puntuación BLEU al mismo tiempo (Figura 10, 11 [ 34 ] ).
Los autores plantean la hipótesis de que los conjuntos de datos de origen natural contienen oraciones objetivo uniformes y monótonas, por lo que un modelo entrenado para predecir las oraciones objetivo se sobreajustaría rápidamente.
[ 36 ] Transformers entrenados para traducciones automáticas con tamañosen tamaños de conjuntos de datos. Encontraron la ley de escala de Kaplan et al. (2020) [ 16 ] aplicada a la traducción automática:También encontraron que la escala de puntuación BLEU era.
Aprendizaje por transferencia
Hernández, Danny et al. [ 37 ] estudiaron las leyes de escala para el aprendizaje por transferencia en modelos de lenguaje. Entrenaron una familia de Transformers de tres maneras:
- preentrenamiento en inglés, ajuste fino en Python
- preentrenamiento en una mezcla equitativa de inglés y Python, ajuste fino en Python
- formación en Python
La idea es que el preentrenamiento en inglés debería ayudar al modelo a lograr una baja pérdida en un conjunto de prueba de texto Python. Supongamos que el modelo tiene un número de parámetros.y después de haber sido ajustado enLos tokens de Python, logran cierta pérdida.Decimos que su "recuento de tokens transferidos" es, si otro modelo con el mismologra lo mismodespués del entrenamiento enTokens de Python.
Encontraronpara el preentrenamiento en texto en inglés ypara el preentrenamiento en inglés y código que no sea Python.
Precisión
Kumar et al. [ 38 ] estudian las leyes de escalado para la precisión numérica en el entrenamiento de modelos de lenguaje. Entrenan una familia de modelos de lenguaje con pesos, activaciones y caché KV con precisión numérica variable, tanto en tipo entero como de punto flotante, para medir los efectos en la pérdida en función de la precisión. Para el entrenamiento, su ley de escalado tiene en cuenta la menor precisión al envolver los efectos de la precisión en un "recuento de parámetros efectivos" general que gobierna el escalado de la pérdida, utilizando la parametrización.Esto ilustra cómo el entrenamiento con menor precisión degrada el rendimiento al reducir la capacidad real del modelo de una manera que varía exponencialmente con los bits.
Para la inferencia, encuentran que el sobreentrenamiento extremo de los modelos de lenguaje más allá de la optimalidad de Chinchilla puede hacer que los modelos sean más sensibles a la cuantización, una técnica estándar para el aprendizaje profundo eficiente. Esto se demuestra al observar que la degradación en la pérdida debido a la cuantización de pesos aumenta como una ley de potencia aproximada en la relación token/parámetro.Se observa durante el preentrenamiento, de modo que los modelos preentrenados con presupuestos de tokens extremos pueden tener un rendimiento peor en términos de pérdida de validación que aquellos entrenados con presupuestos de tokens más modestos si se aplica la cuantización posterior al entrenamiento. Otros trabajos que examinan los efectos del sobreentrenamiento incluyen a Sardana et al. [ 39 ] y Gadre et al. [ 40 ].
Leyes de Densing
Xiao et al. [ 9 ] consideraron la eficiencia de los parámetros ("densidad") de los modelos a lo largo del tiempo. La idea es que, con el tiempo, los investigadores descubrirían modelos que utilizan sus parámetros de manera más eficiente, de modo que los modelos con el mismo rendimiento pueden tener menos parámetros.
Un modelo puede tener un número real de parámetros., definido como el número real de parámetros en el modelo, y un recuento de parámetros "efectivos", definido como la cantidad de parámetros que un modelo conocido anterior habría necesitado para alcanzar el mismo rendimiento en algunos puntos de referencia, como MMLU .No se mide directamente, sino midiendo el rendimiento real del modelo., luego lo conectamos de nuevo a una ley de escalado previamente ajustada, como la ley de escalado de Chinchilla, para obtener lo quesería necesario para alcanzar ese rendimiento., de acuerdo con las leyes de escala previamente ajustadas.
Una ley de densificación establece que, dóndees tiempo real, medido en días.
Véase también
- Modelo de lenguaje grande : tipo de modelo de aprendizaje automático
- Modelo fundamental : paradigma del modelo de inteligencia artificial
- Inteligencia artificial general : tipo de IA con capacidades de amplio alcance.
- Hipótesis de Hilberg : crecimiento de la entropía del lenguaje según una ley de potencias o un proceso estocástico.
Referencias
- ↑ Bahri, Yasaman; Dyer, Ethan; Kaplan, Jared; Lee, Jaehoon; Sharma, Utkarsh (2024). "Explicando las leyes de escalamiento neuronal" . Actas de la Academia Nacional de Ciencias . 121 (27) e2311878121. arXiv : 2102.06701 . Bibcode : 2024PNAS..12111878B . doi : 10.1073/pnas.2311878121 . PMC 11228526. PMID 38913889 .
- 1 2 Hestness, Joel; Narang, Sharan; Ardalani, Newsha; Diamos, Gregorio; Jun, Heewoo; Kianinejad, Hassan; Patwary, doctor Mostofa Ali; Yang, Yang; Zhou, Yanqi (1 de diciembre de 2017). "La escala del aprendizaje profundo es predecible, empíricamente". arXiv : 1712.00409 [ cs.LG ].
- 1 2 Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; Chen, Mark; Jun, Heewoo; Kaiser, Lukasz; Plappert, Matthias; Tworek, Jerry; Hilton, Jacob (2021-11-18). "Entrenamiento de verificadores para resolver problemas matemáticos verbales". arXiv : 2110.14168 [ cs.LG ].
- ↑ Rajbhandari, Samyam; Li, Conglong; Yao, Zhewei; Zhang, Minjia; Aminabadi, Reza Yazdani; Awan, Ammar Ahmad; Rasley, Jeff; He, Yuxiong (2022-06-28). "DeepSpeed-MoE: Avances en la inferencia y el entrenamiento de mezcla de expertos para potenciar la escala de la IA de próxima generación" . Actas de la 39.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 18332–18346 . arXiv : 2201.05596 .
- 1 2 3 Goodfellow, I., Bengio, Y., & Courville, A. (2016). Aprendizaje profundo. MIT Press.
- ^ Zhou , Chunting; Liu, Pengfei; Xu, Puxin; Iyer, Srini; Sol, Jiao; Mao, Yuning; Mamá, Xuezhe; Efrat, Avia; Yu, Ping; Yu, Lili; Zhang, Susan; Ghosh, Gargi; Lewis, Mike; Zettlemoyer, Lucas; Levy, Omer (1 de mayo de 2023). "LIMA: Menos es más para la alineación". arXiv : 2305.11206 [ cs.CL ].
- ↑ Bilmes, Jeff; Bhatt, Gantavya; Das, Arnav (28 de mayo de 2026). "¿Cuánto vale un conjunto de datos? Leyes de escala, la puntuación de Vendi y funciones espectrales de matrices". arXiv : 2605.29448 [ cs.LG ].
- ↑ "google/BIG-bench" . Google. 24 de septiembre de 2024. Consultado el 25 de septiembre de 2024 .
- 1 2 Xiao, Chaojun; Cai, Jie; Zhao, Weilin; Zeng, Guoyang; Lin, Biyuan; Zhou, Jie; Zheng, Zhi; Han, Xu; Liu, Zhiyuan (6 de diciembre de 2024). "Ley de Densidad de los LLM". arXiv : 2412.04315 [ cs.AI ].
- 1 2 Jones, Andy L. (2021). "Scaling Scaling Laws with Board Games". arXiv : 2104.03113 [ cs.LG ].
- ↑ Clasificación del chatbot de LMSYS
- 1 2 3 Henighan, Tom; Kaplan, Jared; Katz, Mor; Chen, Mark; Hesse, Christopher; Jackson, Jacob; Heewoo, Jun; Brown, Tom B.; Dhariwal, Prafulla; Mann, Chris; Radford, Alec; Ramesh, Aditya; Ryder, Nick; Ziegler, Daniel M.; Schulman, John; Gray, Scott; Hallacy, Chris; Amodei, Dario; McCandlish, Sam (27-10-2020). Leyes de escala para el modelado generativo autorregresivo . arXiv : 2010.14701 . OCLC 1228442047 .
- ↑ Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, J.; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, T.; Child, Rewon (2020-05-28). "Los modelos de lenguaje son aprendices con pocos ejemplos". arXiv : 2005.14165 [ cs.CL ].
- ↑ Besiroglu, Tamay (17 de abril de 2024). "Escalado de chinchillas: un intento de replicación" . Epoch AI . Recuperado el 24 de septiembre de 2024 .
- ^ Hoffmann, Jordania; Borgeaud, Sebastián; Mensch, Arturo; Buchatskaya, Elena; Cai, Trevor; Rutherford, Eliza; Casas, Diego de Las; Hendricks, Lisa Anne; Welbl, Johannes; Clark, Aidan; Hennigan, Tom; Noland, Eric; Millican, Katie; Driessche, George van den; Damoc, Bogdan (29 de marzo de 2022). "Entrenamiento de modelos de lenguajes grandes óptimos para la computación". arXiv : 2203.15556 [ cs.CL ].
- 1 2 3 Kaplan, Jared; McCandlish, Sam; Henighan, Tom; Brown, Tom B.; Chess, Benjamin; Child, Rewon; Gray, Scott; Radford, Alec; Wu, Jeffrey; Amodei, Dario (2020). "Leyes de escala para modelos de lenguaje neuronal". CoRR . abs/2001.08361. arXiv : 2001.08361 .
- ↑ Besiroglu, Tamay; Erdil, Ege; Barnett, Matthew; You, Josh (2024-04-15). "Escalado de chinchillas: un intento de replicación". arXiv : 2404.10102 [ cs.AI ].
- ↑ Pearce, Tim; Song, Jinyeop (2024). "Conciliando las leyes de escala de Kaplan y Chinchilla". arXiv : 2406.12907 [ cs.LG ].
- ↑ Porian, Tomer; Wortsman, Mitchell; Jitsev, Jenia; Schmidt, Ludwig; Carmon, Yair (2024-07-25). "Resolviendo discrepancias en el escalado computacionalmente óptimo de modelos de lenguaje". arXiv : 2406.19146 [ cs.LG ].
- ^ Sorscher, Ben; Geirhos, Robert; Shekhar, Shashank; Ganguli, Surya; Morcos, Ari S. (21 de abril de 2023). "Más allá de las leyes de escala neuronal: superar la escala de la ley de potencia mediante la poda de datos". arXiv : 2206.14486 [ cs.LG ].
- ^ Tay, Yi; Wei, Jason; Chung, Hyung Won; Tran, Vinh Q.; Entonces, David R.; Shakeri, Siamak; García, Xavier; Zheng, Huaixiu Steven; Rao, Jinfeng (16 de noviembre de 2022). "Trascendiendo las leyes de escala con un 0,1% de cálculo adicional". arXiv : 2210.11399 [ cs.CL ].
- ↑ Muennighoff, Niklas; Rush, Alexander; Barak, Boaz; Le Scao, Teven; Tazi, Nouamane; Piktus, Aleksandra; Pyysalo, Sampo; Wolf, Thomas; Raffel, Colin A. (2023-12-15). "Escalado de modelos de lenguaje con restricciones de datos" . Advances in Neural Information Processing Systems . 36 : 50358–50376 . arXiv : 2305.16264 .
- ↑ Li, Yuanzhi; Bubeck, Sébastien; Eldan, Ronen; Del Giorno, Allie; Gunasekar, Suriya; Lee, Yin Tat (11 de septiembre de 2023). "Los libros de texto son todo lo que necesita II: informe técnico de phi-1.5". arXiv : 2309.05463 [ cs.CL ].
- ↑ Sardana, Nikhil; Frankle, Jonathan (2023-12-31). "Más allá de Chinchilla-Optimal: Contabilizando la inferencia en las leyes de escalado de modelos de lenguaje". arXiv : 2401.00448 [ cs.LG ].
- ↑ Gadre, Samir Yitzhak; Smyrnis, Georgios; Shankar, Vaishaal; Gururangan, Suchin; Wortsman, Mitchell; Shao, Rulin; Mercat, Jean; Fang, Alex; Li, Jeffrey (2024-03-13). "Los modelos de lenguaje escalan de forma fiable con el sobreentrenamiento y en tareas posteriores". arXiv : 2403.08540 [ cs.CL ].
- ↑ Caballero, Ethan; Gupta, Kshitij; Rish, Irina; Krueger, David (2022). "Leyes de escala neuronal infringidas". arXiv : 2210.14891 [ cs.LG ].
- ^ Plata, David; Huang, Aja; Maddison, Chris J.; Guez, Arturo; Sifré, Laurent; van den Driessche, George; Schrittwieser, Julián; Antonoglou, Ioannis; Panneershelvam, Veda; Lanctot, Marc; Dieleman, Sander; Grewe, Dominik; Nham, Juan; Kalchbrenner, Nal; Sutskever, Ilya (enero de 2016). "Dominar el juego de Go con redes neuronales profundas y búsqueda de árboles" . Naturaleza . 529 (7587): 484– 489. Bibcode : 2016Natur.529..484S . doi : 10.1038/naturaleza16961 . ISSN 1476-4687 . PMID 26819042 .
- 1 2 Noam, Brown (17 de septiembre de 2024). Parábolas sobre el poder de la planificación en IA: del póker a la diplomacia: Noam Brown (OpenAI) (vídeo) . Recuperado el 24 de septiembre de 2024 a través de YouTube. Conferencia en la Escuela Paul G. Allen el jueves 23 de mayo de 2024 a las 15:30.
- ↑ Li, Yujia; Choi, David; Chung, Junyoung; Kushman, Nate; Schrittwieser, Julian; Leblond, Rémi; Eccles, Tom; Keeling, James; Gimeno, Felix; Dal Lago, Agustín; Hubert, Thomas; Choy, Peter; de Masson d'Autume, Cyprien; Babuschkin, Igor; Chen, Xinyun (2022-12-09). "Generación de código a nivel de competición con AlphaCode" . Science . 378 (6624): 1092– 1097. arXiv : 2203.07814 . Bibcode : 2022Sci...378.1092L . doi : 10.1126/science.abq1158 . ISSN 0036-8075 . PMID 36480631 .
- ↑ Villalobos, Pablo (28-07-2023). "Trading Off Compute in Training and Inference" . Epoch AI . Recuperado el 24-09-2024 .
- ↑ "Aprender a razonar con LLM" . OpenAI . Consultado el 16 de septiembre de 2024 .
- ↑ Snell, Charlie; Lee, Jaehoon; Xu, Kelvin; Kumar, Aviral (2024-08-06). "Escalar el cálculo óptimo en tiempo de prueba de LLM puede ser más efectivo que escalar los parámetros del modelo". arXiv : 2408.03314 [ cs.LG ].
- ↑ Zhai, Xiaohua; Kolesnikov, Alexander; Houlsby, Neil; Beyer, Lucas (2022). "Scaling Vision Transformers" . CVPR : 12104–12113 .
- 1 2 Ghorbani, Behrooz; Firat, Orhan; Freitag, Markus; Bapna, Ankur; Krikun, Maxim; Garcia, Xavier; Chelba, Ciprian; Cherry, Colin (2021-09-01). "Leyes de escala para la traducción automática neuronal". arXiv : 2109.07740 [ cs.LG ].
- ↑ Chen, Mia Xu; Firat, Orhan; Bapna, Ankur; Johnson, Melvin; Macherey, Wolfgang; Foster, George; Jones, Llion; Schuster, Mike; Shazeer, Noam; Parmar, Niki; Vaswani, Ashish; Uszkoreit, Jakob; Kaiser, Lukasz; Chen, Zhifeng; Wu, Yonghui (julio de 2018). "Lo mejor de ambos mundos: combinar los avances recientes en la traducción automática neuronal" . Actas de la 56.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Melbourne, Australia: Asociación de Lingüística Computacional: 76–86 . arXiv : 1804.09849 . doi : 10.18653/v1/P18-1008 .
- ↑ Gordon, Mitchell A; Duh, Kevin; Kaplan, Jared (2021). "Leyes de escalado de datos y parámetros para la traducción automática neuronal". Actas de la Conferencia de 2021 sobre métodos empíricos en el procesamiento del lenguaje natural . Stroudsburg, PA, EE. UU.: Asociación de Lingüística Computacional. págs. 5915–5922 . doi : 10.18653/v1/2021.emnlp-main.478 .
- ↑ Hernandez, Danny; Kaplan, Jared; Henighan, Tom; McCandlish, Sam (2021-02-01). "Leyes de escala para la transferencia". arXiv : 2102.01293 [ cs.LG ].
- ^ Kumar, Tanishq; Ankner, Zachary; Spector, Benjamín F.; Bordelón, Blake; Muennighoff, Niklas; Pablo, Mansheej; Pehlevan, Cengiz; Ré, Christopher; Raghunathan, Aditi (30 de noviembre de 2024). "Leyes de escala para la precisión". arXiv : 2411.04330 [ cs.LG ].
- ↑ Sardana, Nikhil; Portes, Jacob; Doubov, Sasha; Frankle, Jonathan (2024-07-18). "Más allá de Chinchilla-Optimal: Contabilizando la inferencia en las leyes de escalado de modelos de lenguaje". arXiv : 2401.00448 [ cs.LG ].
- ↑ Gadre, Samir Yitzhak; Smyrnis, Georgios; Shankar, Vaishaal; Gururangan, Suchin; Wortsman, Mitchell; Shao, Rulin; Mercat, Jean; Fang, Alex; Li, Jeffrey (2024-06-14). "Los modelos de lenguaje escalan de forma fiable con el sobreentrenamiento y en tareas posteriores". arXiv : 2403.08540 [ cs.CL ].
- Redes neuronales artificiales
- Inteligencia artificial
- Aprendizaje profundo
- Leyes de potencia
- Leyes estadísticas