La mezcla de expertos ( MoE ) es una técnica de aprendizaje automático donde se utilizan múltiples redes de expertos (aprendices) para dividir un espacio de problemas en regiones homogéneas. [ 1 ] MoE representa una forma de aprendizaje de conjunto . [ 2 ] También se les llamaba máquinas de comité . [ 3 ]
Teoría básica
MoE siempre tiene los siguientes componentes, pero se implementan y combinan de manera diferente según el problema que se esté resolviendo:
- Expertos, cada uno tomando la misma entraday produciendo resultados.
- Una función de ponderación (también conocida como función de compuerta), que toma entraday produce un vector de salidasEsto puede o no ser una distribución de probabilidad, pero en ambos casos, sus entradas son no negativas.
- es el conjunto de parámetros. El parámetroes para la función de ponderación. Los parámetrosson para los expertos.
- Dado un inputLa mezcla de expertos produce un único resultado mediante la combinaciónsegún los pesosde alguna manera, generalmente por.
Tanto los expertos como la función de ponderación se entrenan minimizando alguna función de pérdida , generalmente mediante descenso de gradiente . Existe mucha libertad para elegir la forma precisa de los expertos, la función de ponderación y la función de pérdida.
Red Meta-pi
La red meta-pi, reportada por Hampshire y Waibel, [ 4 ] utilizacomo resultado. El modelo se entrena realizando un descenso de gradiente sobre la pérdida de error cuadrático medio.Los expertos pueden desempeñar funciones arbitrarias.
En su publicación original, resolvieron el problema de clasificar fonemas en la señal de voz de 6 hablantes japoneses diferentes, 2 mujeres y 4 hombres. Entrenaron a 6 expertos, cada uno de los cuales era una "red neuronal con retardo temporal" [ 5 ] (esencialmente una red convolucional multicapa sobre el espectrograma mel ). Descubrieron que la mezcla resultante de expertos asignaba 5 expertos a 5 de los hablantes, pero el sexto hablante (hombre) no tenía un experto asignado; en cambio, su voz fue clasificada por una combinación lineal de los expertos de los otros 3 hablantes masculinos.
Mezclas adaptativas de expertos locales
Las mezclas adaptativas de expertos locales [ 6 ] [ 7 ] utilizan un modelo de mezcla gaussiana . Cada experto simplemente predice una distribución gaussiana e ignora por completo la entrada. Específicamente, el-el experto predice que el resultado es, dóndees un parámetro que se puede aprender. La función de ponderación es una función softmax lineal:La mezcla de expertos predice que el resultado se distribuye según la función de densidad de probabilidad logarítmica:Se entrena mediante estimación de máxima verosimilitud, es decir, ascenso de gradiente en. El gradiente para el-el experto es
y el gradiente para la función de ponderación es
Para cada par entrada-salidaSe modifica la función de ponderación para aumentar el peso de todos los expertos con un rendimiento superior al promedio y disminuir el de aquellos con un rendimiento inferior. Esto fomenta que la función de ponderación aprenda a seleccionar únicamente a los expertos que realizan las predicciones correctas para cada entrada.
El-el experto cambia para que su predicción sea más cercana a, pero la cantidad de cambio es proporcional aEsto tiene una interpretación bayesiana. Dado el input, la probabilidad previa de que el expertoes el correcto es, yes la probabilidad de evidencia. Entonces,es la probabilidad posterior para el expertoy por lo tanto la tasa de cambio para elEl experto -ésimo es proporcional a su probabilidad posterior.
En otras palabras, a los expertos que, en retrospectiva, parecían los más indicados para consultar, se les pide que aprendan del ejemplo. A los expertos que, en retrospectiva, no lo eran, se les deja en paz.
El efecto combinado es que los expertos se especializan: supongamos que dos expertos son buenos prediciendo un tipo de entrada, pero uno es ligeramente mejor; entonces, la función de ponderación eventualmente aprenderá a favorecer al mejor. Después de esto, el experto menos hábil no puede obtener una señal de gradiente alto y empeora aún más en la predicción de ese tipo de entrada. Por el contrario, el experto menos hábil puede mejorar en la predicción de otros tipos de entrada y se especializa cada vez más en otra región. Esto tiene un efecto de retroalimentación positiva, lo que hace que cada experto se separe del resto y se ocupe de una región local en solitario (de ahí el nombre de " expertos locales ").
MoE jerárquico
Las mezclas jerárquicas de expertos [ 8 ] [ 9 ] utilizan múltiples niveles de compuertas en un árbol. Cada compuerta es una distribución de probabilidad sobre el siguiente nivel de compuertas, y los expertos están en los nodos hoja del árbol. Son similares a los árboles de decisión .
Por ejemplo, un MoE jerárquico de 2 niveles tendría una función de compuerta de primer orden.y funciones de compuerta de segundo ordeny expertosLa predicción total es entonces.
Variantes
La mezcla de expertos, similar al modelo de mezcla gaussiana, también puede entrenarse mediante el algoritmo de expectativa-maximización, al igual que los modelos de mezcla gaussiana . Específicamente, durante el paso de expectativa, la "carga" para explicar cada punto de datos se asigna a los expertos, y durante el paso de maximización, los expertos se entrenan para mejorar las explicaciones para las que obtuvieron una carga alta, mientras que la puerta se entrena para mejorar su asignación de carga. Esto puede converger más rápido que el ascenso de gradiente en la log-verosimilitud. [ 9 ] [ 10 ]
La función de compuerta elegida suele ser softmax. Además, la compuerta puede utilizar distribuciones gaussianas [ 11 ] y familias exponenciales [ 10 ] .
En lugar de realizar una suma ponderada de todos los expertos, en el método MoE duro, [ 12 ] solo se elige al experto mejor clasificado. Es decir,Esto puede acelerar el tiempo de entrenamiento e inferencia. [ 13 ]
Los expertos pueden utilizar formas más generales de distribuciones gaussianas multivariantes. Por ejemplo, [ 8 ] propuso, dóndeson parámetros que se pueden aprender. En otras palabras, cada experto aprende a realizar una regresión lineal, con una estimación de incertidumbre que también se puede aprender.
Se pueden utilizar expertos diferentes a las distribuciones gaussianas. Por ejemplo, se puede utilizar la distribución de Laplace , [ 14 ] o la distribución t de Student . [ 15 ] Para la clasificación binaria, también se propusieron expertos de regresión logística , condóndeson parámetros aprendibles. Esto se generaliza posteriormente para la clasificación multiclase, con expertos en regresión logística multinomial . [ 16 ]
Un artículo propuso una mezcla de softmaxes para el modelado de lenguaje autorregresivo. [ 17 ] Específicamente, considérese un modelo de lenguaje que, dado un texto anterior,, predice la siguiente palabraLa red codifica el texto en un vector.y predice la distribución de probabilidad de la siguiente palabra comopara una matriz de incrustaciónEn una mezcla de softmaxes, el modelo genera múltiples vectores.y predecir la siguiente palabra como, dóndees una distribución de probabilidad mediante una operación softmax lineal sobre las activaciones de las neuronas ocultas dentro del modelo. El artículo original demostró su eficacia para redes neuronales recurrentes . Posteriormente se descubrió que también funciona para Transformers. [ 18 ]
Aprendizaje profundo
La sección anterior describió MoE tal como se utilizaba antes de la era del aprendizaje profundo . Después del aprendizaje profundo, MoE encontró aplicaciones en la ejecución de los modelos más grandes, como una forma sencilla de realizar cálculos condicionales : solo se utilizan partes del modelo, las partes elegidas según la entrada. [ 19 ]
El primer artículo que aplica MoE al aprendizaje profundo data de 2013, [ 20 ] donde se propuso usar una red de compuertas diferente en cada capa de una red neuronal profunda. Específicamente, cada compuerta es una red ReLU lineal-softmax lineal, y cada experto es una red ReLU lineal. Dado que la salida de la compuerta no es dispersa , se necesitan todas las salidas de los expertos y no se realiza ningún cálculo condicional.
El objetivo principal al usar MoE en aprendizaje profundo es reducir el costo computacional. Por lo tanto, para cada consulta, solo se debe consultar a un pequeño subconjunto de expertos. Esto diferencia a MoE en aprendizaje profundo de MoE clásico. En MoE clásico, el resultado de cada consulta es una suma ponderada de los resultados de todos los expertos. En MoE de aprendizaje profundo, el resultado de cada consulta solo puede involucrar los resultados de unos pocos expertos. En consecuencia, la decisión de diseño clave en MoE se convierte en el enrutamiento: dado un lote de consultas, ¿cómo dirigir las consultas a los mejores expertos?
Capa de MoE con compuerta dispersa
La capa MoE con compuerta dispersa, [ 21 ] publicada por investigadores de Google Brain , utiliza redes de alimentación directa como expertos y compuerta softmax lineal. De manera similar a la MoE dura propuesta anteriormente, logran la dispersión mediante una suma ponderada de solo los k mejores expertos, en lugar de la suma ponderada de todos ellos. Específicamente, en una capa MoE, hay redes de alimentación directa.y una red de controlLa red de compuertas se define por, dóndees una función que mantiene iguales las k entradas superiores de un vector, pero establece todas las demás entradas enLa adición de ruido ayuda al equilibrio de carga.
La elección dees un hiperparámetro que se elige según la aplicación. Los valores típicos son. ElEsta versión también se denomina Switch Transformer. El Switch Transformer original se aplicó a un modelo de lenguaje T5 . [ 22 ]
Como demostración, entrenaron una serie de modelos para traducción automática con capas alternas de MoE y LSTM , y los compararon con modelos LSTM profundos. [ 23 ] La Tabla 3 muestra que los modelos MoE utilizaron menos tiempo de cálculo de inferencia, a pesar de tener 30 veces más parámetros.
Este módulo arquitectónico se publicó en enero de 2017, pocos meses después de la publicación de la arquitectura Transformer (12 de junio de 2017), y se combinaron en una arquitectura multimodal llamada MultiModel, publicada 4 días después (16 de junio de 2017). [ 24 ]
Balanceo de carga
Vanilla MoE tiende a tener problemas de equilibrio de carga: algunos expertos son consultados con frecuencia, mientras que otros rara vez o nunca. Para incentivar a la puerta a seleccionar a cada experto con igual frecuencia (equilibrio de carga adecuado) dentro de cada lote, cada capa de MoE tiene dos funciones de pérdida auxiliares. Esto se mejora con Switch Transformer [ 22 ] en una sola función de pérdida auxiliar. Específicamente, dejemosSea el número de expertos, entonces para un lote determinado de consultas, la pérdida auxiliar para el lote esAquí,es la fracción de tokens que eligieron experto, yes la fracción de peso en expertoEsta pérdida se minimiza en, precisamente cuando cada experto tiene el mismo pesoen todas las situaciones.

Investigadores de DeepSeek diseñaron una variante de MoE, con "expertos compartidos" que siempre son consultados y "expertos enrutados" que podrían no serlo. Descubrieron que el balanceo de carga estándar fomenta que los expertos sean consultados por igual, pero esto provoca que repliquen la misma capacidad central, como la gramática inglesa. Propusieron que los expertos compartidos aprendieran las capacidades centrales que se usan con frecuencia, y que los expertos enrutados aprendieran las capacidades periféricas que se usan con poca frecuencia. [ 26 ]
También propusieron una "estrategia de equilibrio de carga sin pérdidas auxiliares", que no utiliza pérdidas auxiliares. En cambio, cada expertotiene un "sesgo de experto" adicional.. Si se descuida a un experto, su sesgo aumenta, y viceversa. Durante la asignación de tokens, cada token elige a los k mejores expertos, pero con el sesgo añadido. Es decir: [ 27 ]Cabe señalar que el sesgo de los expertos influye en la selección de los mismos, pero no en la suma de sus respuestas.
Factor de capacidad
Supongamos que hayexpertos en una capa. Para un lote de consultas determinadoCada consulta se enruta a uno o más expertos. Por ejemplo, si cada consulta se enruta a un experto como en Switch Transformers, y si los expertos están balanceados en carga, entonces cada experto debería esperar en promedioconsultas en lotes. En la práctica, los expertos no pueden esperar un equilibrio de carga perfecto: en algunos lotes, un experto podría estar infrautilizado, mientras que en otros lotes estaría sobrecargado.
Dado que las entradas no pueden moverse a través de la capa hasta que cada experto en la capa haya terminado las consultas que se le han asignado, el equilibrio de carga es importante. El factor de capacidad se utiliza a veces para imponer una restricción estricta en el equilibrio de carga. A cada experto solo se le permite procesar hastaconsultas en un lote. El informe ST-MoE encontrópara funcionar bien en la práctica. [ 28 ]
Enrutamiento
En el MoE original con compuertas dispersas, solo se consulta a los k expertos principales y sus salidas se suman ponderadamente. Existen otros métodos. [ 28 ] En términos generales, el enrutamiento es un problema de asignación : ¿Cómo asignar tokens a expertos, de manera que se cumplan diversas restricciones (como el rendimiento, el equilibrio de carga, etc.)? Normalmente existen tres clases de algoritmos de enrutamiento: los expertos eligen los tokens ("elección de expertos"), [ 29 ] los tokens eligen a los expertos (el MoE original con compuertas dispersas) y un asignador global que empareja expertos y tokens. [ 30 ]
Durante la inferencia, el MoE trabaja con un gran lote de tokens en todo momento. Si los tokens eligieran a los expertos, algunos expertos podrían recibir pocos tokens, mientras que otros recibirían tantos que excederían su tamaño máximo de lote, por lo que tendrían que ignorar algunos. De manera similar, si los expertos eligieran los tokens, algunos podrían no ser seleccionados por ningún experto. Este es el problema de la "pérdida de tokens". Perder un token no es necesariamente un problema grave, ya que en Transformers, debido a las conexiones residuales , si un token se "pierde", no desaparece. En cambio, su representación vectorial simplemente pasa a través de la capa de propagación hacia adelante sin cambios. [ 30 ]
Otros enfoques incluyen resolverlo como un problema de programación lineal con restricciones , [ 31 ] utilizando aprendizaje por refuerzo para entrenar el algoritmo de enrutamiento (ya que elegir un experto es una acción discreta, como en RL). [ 32 ] La coincidencia token-experto puede no implicar aprendizaje ("enrutamiento estático"): puede hacerse mediante una función hash determinista [ 33 ] o un generador de números aleatorios. [ 34 ]
Aplicaciones a modelos de transformadores
Las capas MoE se utilizan en los modelos Transformer más grandes , para los cuales el aprendizaje y la inferencia sobre el modelo completo resultan demasiado costosos. Suelen tener compuertas dispersas, con una dispersión de 1 o 2. En los modelos Transformer, las capas MoE se utilizan a menudo para seleccionar las capas de alimentación directa (normalmente una red lineal-ReLU-lineal), que aparecen en cada bloque Transformer después de la atención multi-cabeza. Esto se debe a que las capas de alimentación directa consumen una porción cada vez mayor del coste computacional a medida que los modelos crecen. Por ejemplo, en el modelo Palm-540B, el 90 % de los parámetros se encuentran en sus capas de alimentación directa. [ 35 ]
Un Transformer entrenado puede convertirse en un MoE duplicando sus capas de alimentación directa, con compuertas inicializadas aleatoriamente, y luego entrenándolo aún más. Esta es una técnica llamada "reciclaje ascendente disperso". [ 36 ]
En el diseño del Transformer MoE intervienen numerosas decisiones que afectan a la estabilidad del entrenamiento y al rendimiento final. El informe OLMoE las describe con cierto detalle. [ 37 ]
A partir de 2023Los modelos lo suficientemente grandes como para usar MoE tienden a ser modelos de lenguaje grandes , donde cada experto tiene del orden de 10 mil millones de parámetros. Además de los modelos de lenguaje, Vision MoE [ 38 ] es un modelo Transformer con capas MoE. Lo demostraron entrenando un modelo con 15 mil millones de parámetros. MoE Transformer también se ha aplicado a modelos de difusión . [ 39 ]
Una serie de grandes modelos de lenguaje de Google utilizaron MoE. GShard [ 40 ] utiliza MoE con hasta dos expertos principales por capa. Específicamente, el experto principal siempre se selecciona, y el segundo experto principal se selecciona con una probabilidad proporcional al peso de dicho experto según la función de compuerta. Posteriormente, GLaM [ 41 ] demostró un modelo de lenguaje con 1,2 billones de parámetros, donde cada capa de MoE utiliza dos de los 64 expertos principales. Switch Transformers [ 22 ] utiliza el experto principal en todas las capas de MoE.
El NLLB-200 de Meta AI es un modelo de traducción automática para 200 idiomas. [ 42 ] Cada capa MoE utiliza un MoE jerárquico con dos niveles. En el primer nivel, la función de compuerta elige usar una capa de alimentación directa "compartida" o usar expertos. Si se usan expertos, otra función de compuerta calcula los pesos y elige a los 2 mejores expertos. [ 43 ]
Los grandes modelos de lenguaje de MoE se pueden adaptar para tareas posteriores mediante el ajuste de instrucciones . [ 44 ]
En diciembre de 2023, Mistral AI lanzó Mixtral 8x7B bajo la licencia Apache 2.0. Se trata de un modelo de lenguaje MoE con 46.700 millones de parámetros, 8 expertos y una dispersión de 2. También lanzaron una versión optimizada para el seguimiento de instrucciones. [ 45 ] [ 46 ]
En marzo de 2024, Databricks lanzó DBRX . Se trata de un modelo de lenguaje MoE con 132 mil millones de parámetros, 16 expertos y una dispersión de 4. También lanzaron una versión optimizada para el seguimiento de instrucciones. [ 47 ] [ 48 ]
Véase también
Referencias
- ↑ Baldacchino, Tara; Cross, Elizabeth J.; Worden, Keith; Rowson, Jennifer (2016). "Modelos variacionales bayesianos de mezcla de expertos y análisis de sensibilidad para sistemas dinámicos no lineales". Mechanical Systems and Signal Processing . 66– 67: 178– 200. Bibcode : 2016MSSP...66..178B . doi : 10.1016/j.ymssp.2015.05.009 .
- ↑ Rokach, Lior (noviembre de 2009). Clasificación de patrones mediante métodos de conjunto . Serie en Percepción Automática e Inteligencia Artificial. Vol. 75. WORLD SCIENTIFIC. pág. 142. doi : 10.1142/7238 . ISBN 978-981-4271-06-6.
- ↑ TRESP, V. (2001). "Máquinas de comité" . Manual de procesamiento de señales de redes neuronales . Serie de ingeniería eléctrica y procesamiento de señales aplicadas. Vol. 5. doi : 10.1201/9781420038613.ch5 (inactivo el 1 de julio de 2025). ISBN 978-0-8493-2359-1.
{{cite book}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace ) - ↑ Hampshire, JB; Waibel, A. (julio de 1992). "La red Meta-Pi: construcción de representaciones de conocimiento distribuidas para el reconocimiento robusto de patrones de múltiples fuentes" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 14 (7): 751– 769. doi : 10.1109/34.142911 .
- ↑ Alexander Waibel; Toshiyuki Hanazawa; Geoffrey Hinton; Kiyohiro Shikano; Kevin J. Lang (1995). "Reconocimiento de fonemas mediante redes neuronales con retardo temporal*" . En Chauvin, Yves; Rumelhart, David E. (eds.). Retropropagación . Psychology Press. doi : 10.4324/9780203763247 . ISBN 978-0-203-76324-7.
- ↑ Nowlan, Steven; Hinton, Geoffrey E (1990). "Evaluación de mezclas adaptativas de expertos en competencia" . Avances en sistemas de procesamiento de información neuronal . 3. Morgan-Kaufmann.
- ↑ Jacobs, Robert A.; Jordan, Michael I.; Nowlan, Steven J.; Hinton, Geoffrey E. (febrero de 1991). " Adaptive Mixtures of Local Experts" . Neural Computation . 3 (1): 79–87 . doi : 10.1162/neco.1991.3.1.79 . ISSN 0899-7667 . PMID 31141872. S2CID 572361 .
- 1 2 Jordan, Michael; Jacobs, Robert (1991). "Jerarquías de expertos adaptativos" . Avances en sistemas de procesamiento de información neuronal . 4. Morgan-Kaufmann.
- 1 2 Jordan, Michael I.; Jacobs, Robert A. (marzo de 1994). "Mezclas jerárquicas de expertos y el algoritmo EM" . Neural Computation . 6 (2): 181– 214. doi : 10.1162/neco.1994.6.2.181 . hdl : 1721.1/7206 . ISSN 0899-7667 .
- 1 2 Jordan, Michael I.; Xu, Lei (1995-01-01). "Resultados de convergencia para el enfoque EM a arquitecturas de mezclas de expertos %2895%2900014-3". Redes neuronales . 8 (9): 1409– 1431. doi : 10.1016/0893-6080(95)00014-3 . hdl : 1721.1/6620 . ISSN 0893-6080 .
- ↑ Xu, Lei; Jordan, Michael; Hinton, Geoffrey E (1994). "Un modelo alternativo para mezclas de expertos" . Avances en sistemas de procesamiento de información neuronal . 7. MIT Press.
- ↑ Collobert, Ronan; Bengio, Samy; Bengio, Yoshua (2001). "Una mezcla paralela de SVM para problemas de muy gran escala" . Avances en sistemas de procesamiento de información neuronal . 14. MIT Press.
- ↑ Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). "12: Aplicaciones". Aprendizaje profundo . Computación adaptativa y aprendizaje automático. Cambridge, Mass: The MIT Press. ISBN 978-0-262-03561-3.
- ↑ Nguyen, Hien D.; McLachlan, Geoffrey J. (2016-01-01). "Mezcla de expertos lineales de Laplace" . Computational Statistics & Data Analysis . 93 : 177–191 . doi : 10.1016/j.csda.2014.10.016 . ISSN 0167-9473 .
- ↑ Chamroukhi, F. (2016-07-01). "Modelado robusto de mezcla de expertos utilizando la distribución t" . Redes neuronales . 79 : 20–36 . arXiv : 1701.07429 . doi : 10.1016/j.neunet.2016.03.002 . ISSN 0893-6080 . PMID 27093693. S2CID 3171144 .
- ↑ Chen, K.; Xu, L.; Chi, H. (1999-11-01). "Algoritmos de aprendizaje mejorados para la mezcla de expertos en clasificación multiclase" . Redes neuronales . 12 (9): 1229– 1252. doi : 10.1016/S0893-6080(99)00043-X . ISSN 0893-6080 . PMID 12662629 .
- ↑ Yang, Zhilin; Dai, Zihang; Salakhutdinov, Ruslan; Cohen, William W. (2017-11-10). "Rompiendo el cuello de botella de Softmax: un modelo de lenguaje RNN de alto rango". arXiv : 1711.03953 [ cs.CL ].
- ↑ Narang, Sharan; Chung, Hyung Won; Tay, Yi; Fedus, William; Fevry, Thibault; Matena, Michael; Malkan, Karishma; Fiedel, Noah; Shazeer, Noam (23 de febrero de 2021). "¿Se transfieren las modificaciones de Transformer entre implementaciones y aplicaciones?". arXiv : 2102.11972 [ cs.LG ].
- ↑ Bengio, Yoshua; Léonard, Nicholas; Courville, Aaron (2013). "Estimación o propagación de gradientes a través de neuronas estocásticas para computación condicional". arXiv : 1308.3432 [ cs.LG ].
- ↑ Eigen, David; Ranzato, Marc'Aurelio; Sutskever, Ilya (2013). "Learning Factored Representations in a Deep Mixture of Experts". arXiv : 1312.4314 [ cs.LG ].
- ↑ Shazeer, Noam; Mirhoseini, Azalia; Maziarz, Krzysztof; Davis, Andy; Le, Quoc; Hinton, Geoffrey; Dean, Jeff (2017). "Redes neuronales escandalosamente grandes: la capa de mezcla de expertos con compuertas dispersas". arXiv : 1701.06538 [ cs.LG ].
- 1 2 3 Fedus, William; Zoph, Barret; Shazeer, Noam (2022-01-01). "Transformadores de conmutación: escalado a modelos de billones de parámetros con dispersión simple y eficiente" . The Journal of Machine Learning Research . 23 (1): 5232– 5270. arXiv : 2101.03961 . ISSN 1532-4435 .
- ↑ Wu, Yonghui; Schuster, Mike; Chen, Zhifeng; Le, Quoc V.; Norouzi, Mohammad; Macherey, Wolfgang; Krikun, Maxim; Cao, Yuan; Gao, Qin; Macherey, Klaus; Klingner, Jeff; Shah, Apurva; Johnson, Melvin; Liu, Xiaobing; Kaiser, Łukasz (2016). "Sistema de traducción automática neuronal de Google: Cerrando la brecha entre la traducción humana y la automática". arXiv : 1609.08144 [ cs.CL ].
- ↑ Kaiser, Lukasz; Gomez, Aidan N.; Shazeer, Noam; Vaswani, Ashish; Parmar, Niki; Jones, Llion; Uszkoreit, Jakob (2017-06-16). "Un modelo para aprenderlos a todos" . arXiv.org .
- ^ DeepSeek-AI; Liu, Aixin; Feng, Bei; Wang, Bin; Wang, Bingxuan; Liu, Bo; Zhao, Chenggang; Dengr, Chengqi; Ruan, Chong (19 de junio de 2024). "DeepSeek-V2: un modelo de lenguaje de combinación de expertos sólido, económico y eficiente". arXiv : 2405.04434 [ cs.CL ]..
- ↑ Dai, Damai; Deng, Chengqi; Zhao, Chenggang; Xu, RX; Gao, Huazuo; Chen, Deli; Li, Jiashi; Zeng, Wangding; Yu, Xingkai (11 de enero de 2024). "DeepSeekMoE: hacia la máxima especialización de expertos en modelos de lenguajes de mezcla de expertos". arXiv : 2401.06066 [ cs.CL ].
- ^ DeepSeek-AI; Liu, Aixin; Feng, Bei; Xue, Bing; Wang, Bingxuan; Wu, Bochao; Lu, Chengda; Zhao, Chenggang; Deng, Chengqi (27 de diciembre de 2024). "Informe técnico de DeepSeek-V3". arXiv : 2412.19437 [ cs.CL ].
- 1 2 Zoph, Barret; Bello, Irwan; Kumar, Sameer; Du, Nan; Huang, Yanping; Decano, Jeff; Shazeer, Noam; Fedus, William (2022). "ST-MoE: Diseño de modelos expertos dispersos estables y transferibles". arXiv : 2202.08906 [ cs.CL ].
- ^ Zhou, Yanqi; Lei, Tao; Liu, Hanxiao; Du, Nan; Huang, Yanping; Zhao, Vicente; Dai, Andrés M.; Chen, Zhifeng; Le, Quoc V.; Laudon, James (6 de diciembre de 2022). "Mezcla de expertos con enrutamiento de elección de expertos" . Avances en los sistemas de procesamiento de información neuronal . 35 : 7103– 7114. arXiv : 2202.09368 .
- 1 2 Fedus, William; Dean, Jeff; Zoph, Barret (2022-09-04). "Una revisión de los modelos expertos dispersos en el aprendizaje profundo". arXiv : 2209.01667 [ cs.LG ].
- ↑ Lewis, Mike; Bhosale, Shruti; Dettmers, Tim; Goyal, Naman; Zettlemoyer, Luke (2021-07-01). "BASE Layers: Simplifying Training of Large, Sparse Models" . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 6265–6274 . arXiv : 2103.16716 .
- ↑ Bengio, Emmanuel; Bacon, Pierre-Luc; Pineau, Joelle; Precup, Doina (2015). "Computación condicional en redes neuronales para modelos más rápidos". arXiv : 1511.06297 [ cs.LG ].
- ↑ Roller, Stephen; Sukhbaatar, Sainbayar; szlam, arthur; Weston, Jason (2021). "Capas hash para modelos dispersos grandes" . Avances en sistemas de procesamiento de información neuronal . 34. Curran Associates, Inc.: 17555–17566 .
- ^ Zuo, Simiao; Liu, Xiaodong; Jiao, Jian; Kim, joven Jin; Hassan, Hany; Zhang, Ruofei; Zhao, Tuo; Gao, Jianfeng (3 de febrero de 2022). "Domesticación de transformadores escasamente activados con expertos en estocásticos". arXiv : 2110.04260 [ cs.CL ].
- ↑ "Transformer Deep Dive: Parameter Counting" . Transformer Deep Dive: Parameter Counting . Consultado el 10 de octubre de 2023 .
- ^ Komatsuzaki, Aran; Puigcerver, Joan; Lee-Thorp, James; Ruiz, Carlos Riquelme; Mustafa, Albahaca; Ainslie, Josué; Tay, Yi; Dehghani, Mostafa; Houlsby, Neil (17 de febrero de 2023). "Reciclaje disperso: formación de una mezcla de expertos desde puntos de control densos". arXiv : 2212.05055 [ cs.LG ].
- ↑ Muennighoff, Niklas; Soldaini, Luca; Groeneveld, Dirk; Mira, Kyle; Morrison, Jacob; Min, Sewon; Shi, Weijia; Walsh, Pete; Tafjord, Oyvind (3 de septiembre de 2024). "OLMoE: modelos de lenguaje abiertos de mezcla de expertos". arXiv : 2409.02060 [ cs.CL ].
- ↑ Riquelme, Carlos; Puigcerver, Joan; Mustafa, Basil; Neumann, Maxim; Jenatton, Rodolphe; Susano Pinto, André; Keysers, Daniel; Houlsby, Neil (2021). "Escalando la visión con una mezcla dispersa de expertos" . Advances in Neural Information Processing Systems . 34 : 8583–8595 . arXiv : 2106.05974 .
- ^ Fei, Zhengcong; Fan, Mingyuan; Yu, Changqian; Li, Debang; Huang, Junshi (16 de julio de 2024). "Ampliación de transformadores de difusión a 16 mil millones de parámetros". arXiv : 2407.11633 [ cs.CV ].
- ↑ Lepikhin, Dmitri; Lee, Hyouk Joong; Xu, Yuanzhong; Chen, Dehao; Firat, Orhan; Huang, Yanping; Krikún, Maxim; Shazeer, Noam; Chen, Zhifeng (2020). "GShard: escalamiento de modelos gigantes con computación condicional y fragmentación automática". arXiv : 2006.16668 [ cs.CL ].
- ^ Du, Nan; Huang, Yanping; Dai, Andrés M.; Tong, Simón; Lepikhin, Dmitry; Xu, Yuanzhong; Krikún, Maxim; Zhou, Yanqi; Yu, Adams Wei; Firat, Orhan; Zoph, Barret; Fedus, Liam; Bosma, Martín; Zhou, Zongwei; Wang, Tao (2021). "GLaM: escalamiento eficiente de modelos lingüísticos con una combinación de expertos". arXiv : 2112.06905 [ cs.CL ].
- ↑ "200 idiomas en un solo modelo de IA: Un avance en la traducción automática de alta calidad" . ai.facebook.com . 19 de junio de 2022. Archivado del original el 9 de enero de 2023.
- ↑ Equipo NLLB; Costa-jussà, Marta R.; Cross, James; Çelebi, Onur; Elbayad, Maha; Heafield, Kenneth; Heffernan, Kevin; Kalbassi, Elahe; Lam, Janice; Licht, Daniel; Maillard, Jean; Sun, Anna; Wang, Skyler; Wenzek, Guillaume; Youngblood, Al (2022). "Ningún idioma se queda atrás: escalando la traducción automática centrada en el ser humano". arXiv : 2207.04672 [ cs.CL ].
- ^ Shen, Sheng; Hou, Le; Zhou, Yanqi; Du, Nan; Longpre, Shayne; Wei, Jason; Chung, Hyung Won; Zoph, Barret; Fedus, William; Chen, Xinyun; Vu, Tu; Wu, Yuexin; Chen, Wuyang; Webson, Alberto; Li, Yunxuan (2023). "La mezcla de expertos se une al ajuste de instrucciones: una combinación ganadora para modelos de lenguaje grandes". arXiv : 2305.14705 [ cs.CL ].
- ↑ IA, Mistral (11-12-2023). "Mixtral de expertos" . mistral.ai . Recuperado el 04-02-2024 .
- ^ Jiang, Albert Q.; Sablayrolles, Alexandre; Roux, Antoine; Mensch, Arturo; Savary, Blanche; Bamford, Chris; Chaplot, Devendra Singh; Casas, Diego de las; Hanna, Emma Bou (8 de enero de 2024). “Mixtral de Expertos”. arXiv : 2401.04088 [ cs.LG ].
- ↑ "Presentamos DBRX: Un nuevo LLM abierto de última generación" . Databricks . 27 de marzo de 2024. Consultado el 28 de marzo de 2024 .
- ↑ Knight, Will. "Dentro de la creación del modelo de IA de código abierto más poderoso del mundo" . Wired . ISSN 1059-1028 . Consultado el 28 de marzo de 2024 .
Lecturas adicionales
- Antes de la era del aprendizaje profundo
- McLachlan, Geoffrey J.; Peel, David (2000). Modelos de mezcla finita . Serie Wiley en probabilidad y estadística, sección de probabilidad y estadística aplicada. Nueva York, Chichester, Weinheim, Brisbane, Singapur, Toronto: John Wiley & Sons, Inc. ISBN 978-0-471-00626-8.
- Yuksel, SE; Wilson, JN; Gader, PD (agosto de 2012). "Veinte años de mezcla de expertos". IEEE Transactions on Neural Networks and Learning Systems . 23 (8): 1177– 1193. Bibcode : 2012ITNNL..23.1177Y . doi : 10.1109/TNNLS.2012.2200299 . ISSN 2162-237X . PMID 24807516. S2CID 9922492 .
- Masoudnia, Saeed; Ebrahimpour, Reza (12 de mayo de 2012). "Mezcla de expertos: una revisión de la literatura". Artificial Intelligence Review . 42 (2): 275– 293. doi : 10.1007/s10462-012-9338-y . S2CID 3185688 .
- Nguyen, Hien D.; Chamroukhi, Faicel (julio de 2018). "Aspectos prácticos y teóricos del modelado de mezcla de expertos: una visión general" . WIREs Data Mining and Knowledge Discovery . 8 (4) e1246. doi : 10.1002/widm.1246 . ISSN 1942-4787 . S2CID 49301452 .
- Técnicas prácticas para el entrenamiento de modelos de transformadores del Ministerio de Educación
- Zoph, Barret; Bello, Irwan; Kumar, Sameer; Du, Nan; Huang, Yanping; Decano, Jeff; Shazeer, Noam; Fedus, William (2022). "ST-MoE: Diseño de modelos expertos dispersos estables y transferibles". arXiv : 2202.08906 [ cs.CL ].
- Muennighoff, Niklas; Soldaini, Luca; Groeneveld, Dirk; Mira, Kyle; Morrison, Jacob; Min, Sewon; Shi, Weijia; Walsh, Pete; Tafjord, Oyvind; Lamberto, Nathan; Gu, Yuling; Arora, Shane; Bhagia, Akshita; Schwenk, Dustin; Wadden, David; Wettig, Alejandro; Hui, Binyuan; Dettmers, Tim; Kiela, Douwe; Farhadi, Ali; Smith, Noé A.; Pang Wei Koh; Singh, Amanpreet; Hajishirzi, Hannaneh (2024). "OLMoE: modelos de lenguaje abiertos de mezcla de expertos". arXiv : 2409.02060 [ cs.CL ]., con la publicación de datos asociada en "allenai/OLMoE" . Ai2. 17-10-2024 . Recuperado el 18-10-2024 .
- Rajbhandari, Samyam; Li, Conglong; Yao, Zhewei; Zhang, Minjia; Reza Yazdani Aminabadi; Ammar Ahmad Awan; Rasley, Jeff; Él, Yuxiong (2022). "DeepSpeed-MoE: avance de la inferencia y la capacitación de una combinación de expertos para impulsar la escala de IA de próxima generación". arXiv : 2201.05596 [ cs.LG ].
- DeepSeek-AI; et al. (2024). "DeepSeek-V2: Un modelo de lenguaje de mezcla de expertos fuerte, económico y eficiente". arXiv : 2405.04434 [ cs.CL ].
- DeepSeek-IA; et al. (2024). "Informe técnico de DeepSeek-V3". arXiv : 2412.19437 [ cs.CL ].
- Jin, Chao; Jiang, Ziheng; Bai, Zhihao; Zhong, Zheng; Liu, Juncai; Li, Xiang; Zheng, Ningxin; Wang, Xi; Xie, Cong; Huang, Qi; Heng, Wen; Mamá, Yiyuan; Bao, Wenlei; Zheng, tamaño; Peng, Yanghua; Lin, Haibin; Liu, Xuanzhe; Jin, Xin; Liu, Xin (2025). "MegaScale-MoE: capacitación eficiente en comunicación a gran escala de modelos de combinación de expertos en producción". arXiv : 2505.11432 [ cs.LG ].
- Revisión de la literatura para la era del aprendizaje profundo
- Fedus, William; Dean, Jeff; Zoph, Barret (2022). "Una revisión de los modelos expertos dispersos en el aprendizaje profundo". arXiv : 2209.01667 [ cs.LG ].
- Fuzhao, Xue (2024-07-21). "XueFuzhao/awesome-mixture-of-experts" . GitHub . Recuperado el 2024-07-21 .
- Vats, Arpita (2024-09-02). "arpita8/Awesome-Mixture-of-Experts-Papers" . GitHub . Recuperado el 2024-09-06 .
- Cai, Weilin; Jiang, Juyong; Wang, Fan; Tang, Jing; Kim, Sunghun; Huang, Jiayi (2025). "Un estudio sobre la mezcla de expertos en modelos de lenguaje a gran escala". IEEE Transactions on Knowledge and Data Engineering . 37 (7): 3896. arXiv : 2407.06204 . Bibcode : 2025IDSO...37.3896C . doi : 10.1109/TKDE.2025.3554028 .
- algoritmos de aprendizaje automático