Articulo de referencia

Mezcla de expertos

La mezcla de expertos ( MoE ) es una técnica de aprendizaje automático donde se utilizan múltiples redes de expertos (aprendices) para dividir un espacio de problemas en regione...

La mezcla de expertos ( MoE ) es una técnica de aprendizaje automático donde se utilizan múltiples redes de expertos (aprendices) para dividir un espacio de problemas en regiones homogéneas. [ 1 ] MoE representa una forma de aprendizaje de conjunto . [ 2 ] También se les llamaba máquinas de comité . [ 3 ]

Teoría básica

MoE siempre tiene los siguientes componentes, pero se implementan y combinan de manera diferente según el problema que se esté resolviendo:

  • ExpertosF1,...,Fnorte{\displaystyle f_{1},...,f_{n}}, cada uno tomando la misma entradaincógnita{\displaystyle x}y produciendo resultadosF1(incógnita),...,Fnorte(incógnita){\displaystyle f_{1}(x),...,f_{n}(x)}.
  • Una función de ponderación (también conocida como función de compuerta)w{\displaystyle w}, que toma entradaincógnita{\displaystyle x}y produce un vector de salidas(w(incógnita)1,...,w(incógnita)norte){\displaystyle (w(x)_{1},...,w(x)_{n})}Esto puede o no ser una distribución de probabilidad, pero en ambos casos, sus entradas son no negativas.
  • θ=(θ0,θ1,...,θnorte){\displaystyle \theta =(\theta _ {0},\theta _ {1},...,\theta _ {n})}es el conjunto de parámetros. El parámetroθ0{\displaystyle \theta _{0}}es para la función de ponderación. Los parámetrosθ1,,θnorte{\displaystyle \theta _{1},\dots ,\theta _{n}}son para los expertos.
  • Dado un inputincógnita{\displaystyle x}La mezcla de expertos produce un único resultado mediante la combinaciónF1(incógnita),...,Fnorte(incógnita){\displaystyle f_{1}(x),...,f_{n}(x)}según los pesosw(incógnita)1,...,w(incógnita)norte{\displaystyle w(x)_{1},...,w(x)_{n}}de alguna manera, generalmente porF(incógnita)=iw(incógnita)iFi(incógnita){\displaystyle f(x)=\sum _{i}w(x)_{i}f_{i}(x)}.

Tanto los expertos como la función de ponderación se entrenan minimizando alguna función de pérdida , generalmente mediante descenso de gradiente . Existe mucha libertad para elegir la forma precisa de los expertos, la función de ponderación y la función de pérdida.

Red Meta-pi

La red meta-pi, reportada por Hampshire y Waibel, [ 4 ] utilizaF(incógnita)=iw(incógnita)iFi(incógnita){\displaystyle f(x)=\sum _{i}w(x)_{i}f_{i}(x)}como resultado. El modelo se entrena realizando un descenso de gradiente sobre la pérdida de error cuadrático medio.L:=1nortekykF(incógnitak)2{\displaystyle L:={\frac {1}{N}}\sum _{k}\|y_{k}-f(x_{k})\|^{2}}Los expertos pueden desempeñar funciones arbitrarias.

En su publicación original, resolvieron el problema de clasificar fonemas en la señal de voz de 6 hablantes japoneses diferentes, 2 mujeres y 4 hombres. Entrenaron a 6 expertos, cada uno de los cuales era una "red neuronal con retardo temporal" [ 5 ] (esencialmente una red convolucional multicapa sobre el espectrograma mel ). Descubrieron que la mezcla resultante de expertos asignaba 5 expertos a 5 de los hablantes, pero el sexto hablante (hombre) no tenía un experto asignado; en cambio, su voz fue clasificada por una combinación lineal de los expertos de los otros 3 hablantes masculinos.

Mezclas adaptativas de expertos locales

Las mezclas adaptativas de expertos locales [ 6 ] [ 7 ] utilizan un modelo de mezcla gaussiana . Cada experto simplemente predice una distribución gaussiana e ignora por completo la entrada. Específicamente, eli{\displaystyle i}-el experto predice que el resultado esynorte(μi,I){\displaystyle y\sim N(\mu _ {i},I)}, dóndeμi{\displaystyle \mu _{i}}es un parámetro que se puede aprender. La función de ponderación es una función softmax lineal:w(incógnita)i=mikiTincógnita+bijmikjTincógnita+bj{\displaystyle w(x)_{i}={\frac {e^{k_{i}^{T}x+b_{i}}}{\sum _{j}e^{k_{j}^{T}x+b_{j}}}}}La mezcla de expertos predice que el resultado se distribuye según la función de densidad de probabilidad logarítmica:lnFθ(y|incógnita)=ln[imikiTincógnita+bijmikjTincógnita+bjnorte(y|μi,I)]=ln[(2π)d/2imikiTincógnita+bijmikjTincógnita+bjmi12yμi2]{\displaystyle \ln f_{\theta }(y|x)=\ln \left[\sum _{i}{\frac {e^{k_{i}^{T}x+b_{i}}}{\sum _{j}e^{k_{j}^{T}x+b_{j}}}}N(y|\mu _{i},I)\right]=\ln \left[(2\pi )^{-d/2}\sum _{i}{\frac {e^{k_{i}^{T}x+b_{i}}}{\sum _{j}e^{k_{j}^{T}x+b_{j}}}}e^{-{\frac {1}{2}}\|y-\mu _{i}\|^{2}}\right]}Se entrena mediante estimación de máxima verosimilitud, es decir, ascenso de gradiente enF(y|incógnita){\displaystyle f(y|x)}. El gradiente para eli{\displaystyle i}-el experto es

μilnFθ(y|incógnita)=w(incógnita)inorte(y|μi,I)jw(incógnita)jnorte(y|μj,I)(yμi){\displaystyle \nabla _{\mu _{i}}\ln f_{\theta }(y|x)={\frac {w(x)_{i}N(y|\mu _{i},I)}{\sum _{j}w(x)_{j}N(y|\mu _{j},I)}}\;(y-\mu _{i})}

y el gradiente para la función de ponderación es[ki,bi]lnFθ(y|incógnita)=[incógnita1]w(incógnita)ijw(incógnita)jnorte(y|μj,I)(Fi(incógnita)Fθ(y|incógnita)){\displaystyle \nabla _{[k_{i},b_{i}]}\ln f_{\theta }(y|x)={\begin{bmatrix}x\\1\end{bmatrix}}{\frac {w(x)_{i}}{\sum _{j}w(x)_{j}N(y|\mu _{j},I)}}(f_{i}(x)-f_{\theta }(y|x))}

Para cada par entrada-salida(incógnita,y){\displaystyle (x,y)}Se modifica la función de ponderación para aumentar el peso de todos los expertos con un rendimiento superior al promedio y disminuir el de aquellos con un rendimiento inferior. Esto fomenta que la función de ponderación aprenda a seleccionar únicamente a los expertos que realizan las predicciones correctas para cada entrada.

Eli{\displaystyle i}-el experto cambia para que su predicción sea más cercana ay{\displaystyle y}, pero la cantidad de cambio es proporcional aw(incógnita)inorte(y|μi,I){\displaystyle w(x)_{i}N(y|\mu _{i},I)}Esto tiene una interpretación bayesiana. Dado el inputincógnita{\displaystyle x}, la probabilidad previa de que el expertoi{\displaystyle i}es el correcto esw(incógnita)i{\displaystyle w(x)_{i}}, ynorte(y|μi,I){\displaystyle N(y|\mu _{i},I)}es la probabilidad de evidenciay{\displaystyle y}. Entonces,w(incógnita)inorte(y|μi,I)jw(incógnita)jnorte(y|μj,I){\displaystyle {\frac {w(x)_{i}N(y|\mu _{i},I)}{\sum _{j}w(x)_{j}N(y|\mu _{j},I)}}}es la probabilidad posterior para el expertoi{\displaystyle i}y por lo tanto la tasa de cambio para eli{\displaystyle i}El experto -ésimo es proporcional a su probabilidad posterior.

En otras palabras, a los expertos que, en retrospectiva, parecían los más indicados para consultar, se les pide que aprendan del ejemplo. A los expertos que, en retrospectiva, no lo eran, se les deja en paz.

El efecto combinado es que los expertos se especializan: supongamos que dos expertos son buenos prediciendo un tipo de entrada, pero uno es ligeramente mejor; entonces, la función de ponderación eventualmente aprenderá a favorecer al mejor. Después de esto, el experto menos hábil no puede obtener una señal de gradiente alto y empeora aún más en la predicción de ese tipo de entrada. Por el contrario, el experto menos hábil puede mejorar en la predicción de otros tipos de entrada y se especializa cada vez más en otra región. Esto tiene un efecto de retroalimentación positiva, lo que hace que cada experto se separe del resto y se ocupe de una región local en solitario (de ahí el nombre de " expertos locales ").

MoE jerárquico

Las mezclas jerárquicas de expertos [ 8 ] [ 9 ] utilizan múltiples niveles de compuertas en un árbol. Cada compuerta es una distribución de probabilidad sobre el siguiente nivel de compuertas, y los expertos están en los nodos hoja del árbol. Son similares a los árboles de decisión .

Por ejemplo, un MoE jerárquico de 2 niveles tendría una función de compuerta de primer orden.wi{\displaystyle w_{i}}y funciones de compuerta de segundo ordenwj|i{\displaystyle w_{j|i}}y expertosFj|i{\displaystyle f_{j|i}}La predicción total es entoncesiwi(incógnita)jwj|i(incógnita)Fj|i(incógnita){\displaystyle \sum _{i}w_{i}(x)\sum _{j}w_{j|i}(x)f_{j|i}(x)}.

Variantes

La mezcla de expertos, similar al modelo de mezcla gaussiana, también puede entrenarse mediante el algoritmo de expectativa-maximización, al igual que los modelos de mezcla gaussiana . Específicamente, durante el paso de expectativa, la "carga" para explicar cada punto de datos se asigna a los expertos, y durante el paso de maximización, los expertos se entrenan para mejorar las explicaciones para las que obtuvieron una carga alta, mientras que la puerta se entrena para mejorar su asignación de carga. Esto puede converger más rápido que el ascenso de gradiente en la log-verosimilitud. [ 9 ] [ 10 ]

La función de compuerta elegida suele ser softmax. Además, la compuerta puede utilizar distribuciones gaussianas [ 11 ] y familias exponenciales [ 10 ] .

En lugar de realizar una suma ponderada de todos los expertos, en el método MoE duro, [ 12 ] solo se elige al experto mejor clasificado. Es decir,F(incógnita)=Fargmáximoiwi(incógnita)(incógnita){\displaystyle f(x)=f_{\arg \max _{i}w_{i}(x)}(x)}Esto puede acelerar el tiempo de entrenamiento e inferencia. [ 13 ]

Los expertos pueden utilizar formas más generales de distribuciones gaussianas multivariantes. Por ejemplo, [ 8 ] propusoFi(y|incógnita)=norte(y|Aiincógnita+bi,Σi){\displaystyle f_{i}(y|x)=N(y|A_{i}x+b_{i},\Sigma _{i})}, dóndeAi,bi,Σi{\displaystyle A_{i},b_{i},\Sigma _{i}}son parámetros que se pueden aprender. En otras palabras, cada experto aprende a realizar una regresión lineal, con una estimación de incertidumbre que también se puede aprender.

Se pueden utilizar expertos diferentes a las distribuciones gaussianas. Por ejemplo, se puede utilizar la distribución de Laplace , [ 14 ] o la distribución t de Student . [ 15 ] Para la clasificación binaria, también se propusieron expertos de regresión logística , conFi(y|incógnita)={11+miβiTincógnita+βi,0,y=0111+miβiTincógnita+βi,0,y=1{\displaystyle f_{i}(y|x)={\begin{cases}{\frac {1}{1+e^{\beta _{i}^{T}x+\beta _{i,0}}}},&y=0\\1-{\frac {1}{1+e^{\beta _{i}^{T}x+\beta _{i,0}}}},&y=1\end{cases}}}dóndeβi,βi,0{\displaystyle \beta _{i},\beta _{i,0}}son parámetros aprendibles. Esto se generaliza posteriormente para la clasificación multiclase, con expertos en regresión logística multinomial . [ 16 ]

Un artículo propuso una mezcla de softmaxes para el modelado de lenguaje autorregresivo. [ 17 ] Específicamente, considérese un modelo de lenguaje que, dado un texto anterior,do{\displaystyle c}, predice la siguiente palabraincógnita{\displaystyle x}La red codifica el texto en un vector.vdo{\displaystyle v_{c}}y predice la distribución de probabilidad de la siguiente palabra comoSoFtmetroaincógnita(vdoW){\displaystyle \mathrm {Softmax} (v_{c}W)}para una matriz de incrustaciónW{\displaystyle W}En una mezcla de softmaxes, el modelo genera múltiples vectores.vdo,1,,vdo,norte{\displaystyle v_{c,1},\dots ,v_{c,n}}y predecir la siguiente palabra comoi=1nortepagiSoFtmetroaincógnita(vdo,iWi){\displaystyle \sum _{i=1}^{n}p_{i}\;\mathrm {Softmax} (v_{c,i}W_{i})}, dóndepagi{\displaystyle p_{i}}es una distribución de probabilidad mediante una operación softmax lineal sobre las activaciones de las neuronas ocultas dentro del modelo. El artículo original demostró su eficacia para redes neuronales recurrentes . Posteriormente se descubrió que también funciona para Transformers. [ 18 ]

Aprendizaje profundo

La sección anterior describió MoE tal como se utilizaba antes de la era del aprendizaje profundo . Después del aprendizaje profundo, MoE encontró aplicaciones en la ejecución de los modelos más grandes, como una forma sencilla de realizar cálculos condicionales : solo se utilizan partes del modelo, las partes elegidas según la entrada. [ 19 ]

El primer artículo que aplica MoE al aprendizaje profundo data de 2013, [ 20 ] donde se propuso usar una red de compuertas diferente en cada capa de una red neuronal profunda. Específicamente, cada compuerta es una red ReLU lineal-softmax lineal, y cada experto es una red ReLU lineal. Dado que la salida de la compuerta no es dispersa , se necesitan todas las salidas de los expertos y no se realiza ningún cálculo condicional.

El objetivo principal al usar MoE en aprendizaje profundo es reducir el costo computacional. Por lo tanto, para cada consulta, solo se debe consultar a un pequeño subconjunto de expertos. Esto diferencia a MoE en aprendizaje profundo de MoE clásico. En MoE clásico, el resultado de cada consulta es una suma ponderada de los resultados de todos los expertos. En MoE de aprendizaje profundo, el resultado de cada consulta solo puede involucrar los resultados de unos pocos expertos. En consecuencia, la decisión de diseño clave en MoE se convierte en el enrutamiento: dado un lote de consultas, ¿cómo dirigir las consultas a los mejores expertos?

Capa de MoE con compuerta dispersa

La capa MoE con compuerta dispersa, [ 21 ] publicada por investigadores de Google Brain , utiliza redes de alimentación directa como expertos y compuerta softmax lineal. De manera similar a la MoE dura propuesta anteriormente, logran la dispersión mediante una suma ponderada de solo los k mejores expertos, en lugar de la suma ponderada de todos ellos. Específicamente, en una capa MoE, hay redes de alimentación directa.F1,...,Fnorte{\displaystyle f_{1},...,f_{n}}y una red de controlw{\displaystyle w}La red de compuertas se define porw(incógnita)=soFtmetroaincógnita(topagk(Wincógnita+ruido)){\displaystyle w(x)=\mathrm {softmax} (\mathrm {top} _{k}(Wx+{\text{noise}}))}, dóndetopagk{\displaystyle \mathrm {top} _{k}}es una función que mantiene iguales las k entradas superiores de un vector, pero establece todas las demás entradas en{\displaystyle -\infty }La adición de ruido ayuda al equilibrio de carga.

La elección dek{\displaystyle k}es un hiperparámetro que se elige según la aplicación. Los valores típicos sonk=1,2{\displaystyle k=1,2}. Elk=1{\displaystyle k=1}Esta versión también se denomina Switch Transformer. El Switch Transformer original se aplicó a un modelo de lenguaje T5 . [ 22 ]

Como demostración, entrenaron una serie de modelos para traducción automática con capas alternas de MoE y LSTM , y los compararon con modelos LSTM profundos. [ 23 ] La Tabla 3 muestra que los modelos MoE utilizaron menos tiempo de cálculo de inferencia, a pesar de tener 30 veces más parámetros.

Este módulo arquitectónico se publicó en enero de 2017, pocos meses después de la publicación de la arquitectura Transformer (12 de junio de 2017), y se combinaron en una arquitectura multimodal llamada MultiModel, publicada 4 días después (16 de junio de 2017). [ 24 ]

Balanceo de carga

Vanilla MoE tiende a tener problemas de equilibrio de carga: algunos expertos son consultados con frecuencia, mientras que otros rara vez o nunca. Para incentivar a la puerta a seleccionar a cada experto con igual frecuencia (equilibrio de carga adecuado) dentro de cada lote, cada capa de MoE tiene dos funciones de pérdida auxiliares. Esto se mejora con Switch Transformer [ 22 ] en una sola función de pérdida auxiliar. Específicamente, dejemosnorte{\displaystyle n}Sea el número de expertos, entonces para un lote determinado de consultas{incógnita1,incógnita2,...,incógnitaT}{\displaystyle \{x_{1},x_{2},...,x_{T}\}}, la pérdida auxiliar para el lote esnortei=1norteFiPAGi{\displaystyle n\sum _{i=1}^{n}f_{i}P_{i}}Aquí,Fi=1T#(consultas enviadas al experto i){\displaystyle f_{i}={\frac {1}{T}}\#({\text{queries sent to expert }}i)}es la fracción de tokens que eligieron expertoi{\displaystyle i}, yPAGi=1Tj=1Twi(incógnitaj)iexpertoswi(incógnitaj){\displaystyle P_{i}={\frac {1}{T}}\sum _{j=1}^{T}{\frac {w_{i}(x_{j})}{\sum _{i'\in {\text{experts}}}w_{i'}(x_{j})}}}es la fracción de peso en expertoi{\displaystyle i}Esta pérdida se minimiza en1{\displaystyle 1}, precisamente cuando cada experto tiene el mismo peso1/norte{\displaystyle 1/n}en todas las situaciones.

La arquitectura DeepSeek MoE. También se muestra MLA, una variante del mecanismo de atención en Transformer. [ 25 ] : Figura 2

Investigadores de DeepSeek diseñaron una variante de MoE, con "expertos compartidos" que siempre son consultados y "expertos enrutados" que podrían no serlo. Descubrieron que el balanceo de carga estándar fomenta que los expertos sean consultados por igual, pero esto provoca que repliquen la misma capacidad central, como la gramática inglesa. Propusieron que los expertos compartidos aprendieran las capacidades centrales que se usan con frecuencia, y que los expertos enrutados aprendieran las capacidades periféricas que se usan con poca frecuencia. [ 26 ]

También propusieron una "estrategia de equilibrio de carga sin pérdidas auxiliares", que no utiliza pérdidas auxiliares. En cambio, cada expertoi{\displaystyle i}tiene un "sesgo de experto" adicional.bi{\displaystyle b_{i}}. Si se descuida a un experto, su sesgo aumenta, y viceversa. Durante la asignación de tokens, cada token elige a los k mejores expertos, pero con el sesgo añadido. Es decir: [ 27 ]F(incógnita)=i está en el top-k de {w(incógnita)j+bj}jw(incógnita)iFi(incógnita){\displaystyle f(x)=\sum _{i{\text{ is in the top-k of }}\{w(x)_{j}+b_{j}\}_{j}}w(x)_{i}f_{i}(x)}Cabe señalar que el sesgo de los expertos influye en la selección de los mismos, pero no en la suma de sus respuestas.

Factor de capacidad

Supongamos que haynorte{\displaystyle n}expertos en una capa. Para un lote de consultas determinado{incógnita1,incógnita2,...,incógnitaT}{\displaystyle \{x_{1},x_{2},...,x_{T}\}}Cada consulta se enruta a uno o más expertos. Por ejemplo, si cada consulta se enruta a un experto como en Switch Transformers, y si los expertos están balanceados en carga, entonces cada experto debería esperar en promedioT/norte{\displaystyle T/n}consultas en lotes. En la práctica, los expertos no pueden esperar un equilibrio de carga perfecto: en algunos lotes, un experto podría estar infrautilizado, mientras que en otros lotes estaría sobrecargado.

Dado que las entradas no pueden moverse a través de la capa hasta que cada experto en la capa haya terminado las consultas que se le han asignado, el equilibrio de carga es importante. El factor de capacidad se utiliza a veces para imponer una restricción estricta en el equilibrio de carga. A cada experto solo se le permite procesar hastadoT/norte{\displaystyle c\cdot T/n}consultas en un lote. El informe ST-MoE encontródo[1,25,2]{\displaystyle c\in [1.25,2]}para funcionar bien en la práctica. [ 28 ]

Enrutamiento

En el MoE original con compuertas dispersas, solo se consulta a los k expertos principales y sus salidas se suman ponderadamente. Existen otros métodos. [ 28 ] En términos generales, el enrutamiento es un problema de asignación : ¿Cómo asignar tokens a expertos, de manera que se cumplan diversas restricciones (como el rendimiento, el equilibrio de carga, etc.)? Normalmente existen tres clases de algoritmos de enrutamiento: los expertos eligen los tokens ("elección de expertos"), [ 29 ] los tokens eligen a los expertos (el MoE original con compuertas dispersas) y un asignador global que empareja expertos y tokens. [ 30 ]

Durante la inferencia, el MoE trabaja con un gran lote de tokens en todo momento. Si los tokens eligieran a los expertos, algunos expertos podrían recibir pocos tokens, mientras que otros recibirían tantos que excederían su tamaño máximo de lote, por lo que tendrían que ignorar algunos. De manera similar, si los expertos eligieran los tokens, algunos podrían no ser seleccionados por ningún experto. Este es el problema de la "pérdida de tokens". Perder un token no es necesariamente un problema grave, ya que en Transformers, debido a las conexiones residuales , si un token se "pierde", no desaparece. En cambio, su representación vectorial simplemente pasa a través de la capa de propagación hacia adelante sin cambios. [ 30 ]

Otros enfoques incluyen resolverlo como un problema de programación lineal con restricciones , [ 31 ] utilizando aprendizaje por refuerzo para entrenar el algoritmo de enrutamiento (ya que elegir un experto es una acción discreta, como en RL). [ 32 ] La coincidencia token-experto puede no implicar aprendizaje ("enrutamiento estático"): puede hacerse mediante una función hash determinista [ 33 ] o un generador de números aleatorios. [ 34 ]

Aplicaciones a modelos de transformadores

Las capas MoE se utilizan en los modelos Transformer más grandes , para los cuales el aprendizaje y la inferencia sobre el modelo completo resultan demasiado costosos. Suelen tener compuertas dispersas, con una dispersión de 1 o 2. En los modelos Transformer, las capas MoE se utilizan a menudo para seleccionar las capas de alimentación directa (normalmente una red lineal-ReLU-lineal), que aparecen en cada bloque Transformer después de la atención multi-cabeza. Esto se debe a que las capas de alimentación directa consumen una porción cada vez mayor del coste computacional a medida que los modelos crecen. Por ejemplo, en el modelo Palm-540B, el 90 % de los parámetros se encuentran en sus capas de alimentación directa. [ 35 ]

Un Transformer entrenado puede convertirse en un MoE duplicando sus capas de alimentación directa, con compuertas inicializadas aleatoriamente, y luego entrenándolo aún más. Esta es una técnica llamada "reciclaje ascendente disperso". [ 36 ]

En el diseño del Transformer MoE intervienen numerosas decisiones que afectan a la estabilidad del entrenamiento y al rendimiento final. El informe OLMoE las describe con cierto detalle. [ 37 ]

A partir de 2023Los modelos lo suficientemente grandes como para usar MoE tienden a ser modelos de lenguaje grandes , donde cada experto tiene del orden de 10 mil millones de parámetros. Además de los modelos de lenguaje, Vision MoE [ 38 ] es un modelo Transformer con capas MoE. Lo demostraron entrenando un modelo con 15 mil millones de parámetros. MoE Transformer también se ha aplicado a modelos de difusión . [ 39 ]

Una serie de grandes modelos de lenguaje de Google utilizaron MoE. GShard [ 40 ] utiliza MoE con hasta dos expertos principales por capa. Específicamente, el experto principal siempre se selecciona, y el segundo experto principal se selecciona con una probabilidad proporcional al peso de dicho experto según la función de compuerta. Posteriormente, GLaM [ 41 ] demostró un modelo de lenguaje con 1,2 billones de parámetros, donde cada capa de MoE utiliza dos de los 64 expertos principales. Switch Transformers [ 22 ] utiliza el experto principal en todas las capas de MoE.

El NLLB-200 de Meta AI es un modelo de traducción automática para 200 idiomas. [ 42 ] Cada capa MoE utiliza un MoE jerárquico con dos niveles. En el primer nivel, la función de compuerta elige usar una capa de alimentación directa "compartida" o usar expertos. Si se usan expertos, otra función de compuerta calcula los pesos y elige a los 2 mejores expertos. [ 43 ]

Los grandes modelos de lenguaje de MoE se pueden adaptar para tareas posteriores mediante el ajuste de instrucciones . [ 44 ]

En diciembre de 2023, Mistral AI lanzó Mixtral 8x7B bajo la licencia Apache 2.0. Se trata de un modelo de lenguaje MoE con 46.700 millones de parámetros, 8 expertos y una dispersión de 2. También lanzaron una versión optimizada para el seguimiento de instrucciones. [ 45 ] [ 46 ]

En marzo de 2024, Databricks lanzó DBRX . Se trata de un modelo de lenguaje MoE con 132 mil millones de parámetros, 16 expertos y una dispersión de 4. También lanzaron una versión optimizada para el seguimiento de instrucciones. [ 47 ] [ 48 ]

Véase también

Referencias

  1. Baldacchino, Tara; Cross, Elizabeth J.; Worden, Keith; Rowson, Jennifer (2016). "Modelos variacionales bayesianos de mezcla de expertos y análisis de sensibilidad para sistemas dinámicos no lineales". Mechanical Systems and Signal Processing . 66– 67: 178– 200. Bibcode : 2016MSSP...66..178B . doi : 10.1016/j.ymssp.2015.05.009 .
  2. Rokach, Lior (noviembre de 2009). Clasificación de patrones mediante métodos de conjunto . Serie en Percepción Automática e Inteligencia Artificial. Vol. 75. WORLD SCIENTIFIC. pág. 142. doi : 10.1142/7238 . ISBN   978-981-4271-06-6.
  3. TRESP, V. (2001). "Máquinas de comité" . Manual de procesamiento de señales de redes neuronales . Serie de ingeniería eléctrica y procesamiento de señales aplicadas. Vol. 5. doi : 10.1201/9781420038613.ch5 (inactivo el 1 de julio de 2025). ISBN  978-0-8493-2359-1.{{cite book}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace )
  4. Hampshire, JB; Waibel, A. (julio de 1992). "La red Meta-Pi: construcción de representaciones de conocimiento distribuidas para el reconocimiento robusto de patrones de múltiples fuentes" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 14 (7): 751– 769. doi : 10.1109/34.142911 .
  5. Alexander Waibel; Toshiyuki Hanazawa; Geoffrey Hinton; Kiyohiro Shikano; Kevin J. Lang (1995). "Reconocimiento de fonemas mediante redes neuronales con retardo temporal*" . En Chauvin, Yves; Rumelhart, David E. (eds.). Retropropagación . Psychology Press. doi : 10.4324/9780203763247 . ISBN 978-0-203-76324-7.
  6. Nowlan, Steven; Hinton, Geoffrey E (1990). "Evaluación de mezclas adaptativas de expertos en competencia" . Avances en sistemas de procesamiento de información neuronal . 3. Morgan-Kaufmann.
  7. Jacobs, Robert A.; Jordan, Michael I.; Nowlan, Steven J.; Hinton, Geoffrey E. (febrero de 1991). " Adaptive Mixtures of Local Experts" . Neural Computation . 3 (1): 79–87 . doi : 10.1162/neco.1991.3.1.79 . ISSN 0899-7667 . PMID 31141872. S2CID 572361 .   
  8. 1 2 Jordan, Michael; Jacobs, Robert (1991). "Jerarquías de expertos adaptativos" . Avances en sistemas de procesamiento de información neuronal . 4. Morgan-Kaufmann.
  9. 1 2 Jordan, Michael I.; Jacobs, Robert A. (marzo de 1994). "Mezclas jerárquicas de expertos y el algoritmo EM" . Neural Computation . 6 (2): 181– 214. doi : 10.1162/neco.1994.6.2.181 . hdl : 1721.1/7206 . ISSN 0899-7667 . 
  10. 1 2 Jordan, Michael I.; Xu, Lei (1995-01-01). "Resultados de convergencia para el enfoque EM a arquitecturas de mezclas de expertos %2895%2900014-3". Redes neuronales . 8 (9): 1409– 1431. doi : 10.1016/0893-6080(95)00014-3 . hdl : 1721.1/6620 . ISSN 0893-6080 . 
  11. Xu, Lei; Jordan, Michael; Hinton, Geoffrey E (1994). "Un modelo alternativo para mezclas de expertos" . Avances en sistemas de procesamiento de información neuronal . 7. MIT Press.
  12. Collobert, Ronan; Bengio, Samy; Bengio, Yoshua (2001). "Una mezcla paralela de SVM para problemas de muy gran escala" . Avances en sistemas de procesamiento de información neuronal . 14. MIT Press.
  13. Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). "12: Aplicaciones". Aprendizaje profundo . Computación adaptativa y aprendizaje automático. Cambridge, Mass: The MIT Press. ISBN 978-0-262-03561-3.
  14. Nguyen, Hien D.; McLachlan, Geoffrey J. (2016-01-01). "Mezcla de expertos lineales de Laplace" . Computational Statistics & Data Analysis . 93 : 177–191 . doi : 10.1016/j.csda.2014.10.016 . ISSN 0167-9473 . 
  15. Chamroukhi, F. (2016-07-01). "Modelado robusto de mezcla de expertos utilizando la distribución t" . Redes neuronales . 79 : 20–36 . arXiv : 1701.07429 . doi : 10.1016/j.neunet.2016.03.002 . ISSN 0893-6080 . PMID 27093693. S2CID 3171144 .   
  16. Chen, K.; Xu, L.; Chi, H. (1999-11-01). "Algoritmos de aprendizaje mejorados para la mezcla de expertos en clasificación multiclase" . Redes neuronales . 12 (9): 1229– 1252. doi : 10.1016/S0893-6080(99)00043-X . ISSN 0893-6080 . PMID 12662629 .  
  17. Yang, Zhilin; Dai, Zihang; Salakhutdinov, Ruslan; Cohen, William W. (2017-11-10). "Rompiendo el cuello de botella de Softmax: un modelo de lenguaje RNN de alto rango". arXiv : 1711.03953 [ cs.CL ].
  18. Narang, Sharan; Chung, Hyung Won; Tay, Yi; Fedus, William; Fevry, Thibault; Matena, Michael; Malkan, Karishma; Fiedel, Noah; Shazeer, Noam (23 de febrero de 2021). "¿Se transfieren las modificaciones de Transformer entre implementaciones y aplicaciones?". arXiv : 2102.11972 [ cs.LG ].
  19. Bengio, Yoshua; Léonard, Nicholas; Courville, Aaron (2013). "Estimación o propagación de gradientes a través de neuronas estocásticas para computación condicional". arXiv : 1308.3432 [ cs.LG ].
  20. Eigen, David; Ranzato, Marc'Aurelio; Sutskever, Ilya (2013). "Learning Factored Representations in a Deep Mixture of Experts". arXiv : 1312.4314 [ cs.LG ].
  21. Shazeer, Noam; Mirhoseini, Azalia; Maziarz, Krzysztof; Davis, Andy; Le, Quoc; Hinton, Geoffrey; Dean, Jeff (2017). "Redes neuronales escandalosamente grandes: la capa de mezcla de expertos con compuertas dispersas". arXiv : 1701.06538 [ cs.LG ].
  22. 1 2 3 Fedus, William; Zoph, Barret; Shazeer, Noam (2022-01-01). "Transformadores de conmutación: escalado a modelos de billones de parámetros con dispersión simple y eficiente" . The Journal of Machine Learning Research . 23 (1): 5232– 5270. arXiv : 2101.03961 . ISSN 1532-4435 . 
  23. Wu, Yonghui; Schuster, Mike; Chen, Zhifeng; Le, Quoc V.; Norouzi, Mohammad; Macherey, Wolfgang; Krikun, Maxim; Cao, Yuan; Gao, Qin; Macherey, Klaus; Klingner, Jeff; Shah, Apurva; Johnson, Melvin; Liu, Xiaobing; Kaiser, Łukasz (2016). "Sistema de traducción automática neuronal de Google: Cerrando la brecha entre la traducción humana y la automática". arXiv : 1609.08144 [ cs.CL ].
  24. Kaiser, Lukasz; Gomez, Aidan N.; Shazeer, Noam; Vaswani, Ashish; Parmar, Niki; Jones, Llion; Uszkoreit, Jakob (2017-06-16). "Un modelo para aprenderlos a todos" . arXiv.org .
  25. ^ DeepSeek-AI; Liu, Aixin; Feng, Bei; Wang, Bin; Wang, Bingxuan; Liu, Bo; Zhao, Chenggang; Dengr, Chengqi; Ruan, Chong (19 de junio de 2024). "DeepSeek-V2: un modelo de lenguaje de combinación de expertos sólido, económico y eficiente". arXiv : 2405.04434 [ cs.CL ]..
  26. Dai, Damai; Deng, Chengqi; Zhao, Chenggang; Xu, RX; Gao, Huazuo; Chen, Deli; Li, Jiashi; Zeng, Wangding; Yu, Xingkai (11 de enero de 2024). "DeepSeekMoE: hacia la máxima especialización de expertos en modelos de lenguajes de mezcla de expertos". arXiv : 2401.06066 [ cs.CL ].
  27. ^ DeepSeek-AI; Liu, Aixin; Feng, Bei; Xue, Bing; Wang, Bingxuan; Wu, Bochao; Lu, Chengda; Zhao, Chenggang; Deng, Chengqi (27 de diciembre de 2024). "Informe técnico de DeepSeek-V3". arXiv : 2412.19437 [ cs.CL ].
  28. 1 2 Zoph, Barret; Bello, Irwan; Kumar, Sameer; Du, Nan; Huang, Yanping; Decano, Jeff; Shazeer, Noam; Fedus, William (2022). "ST-MoE: Diseño de modelos expertos dispersos estables y transferibles". arXiv : 2202.08906 [ cs.CL ].
  29. ^ Zhou, Yanqi; Lei, Tao; Liu, Hanxiao; Du, Nan; Huang, Yanping; Zhao, Vicente; Dai, Andrés M.; Chen, Zhifeng; Le, Quoc V.; Laudon, James (6 de diciembre de 2022). "Mezcla de expertos con enrutamiento de elección de expertos" . Avances en los sistemas de procesamiento de información neuronal . 35 : 7103– 7114. arXiv : 2202.09368 .
  30. 1 2 Fedus, William; Dean, Jeff; Zoph, Barret (2022-09-04). "Una revisión de los modelos expertos dispersos en el aprendizaje profundo". arXiv : 2209.01667 [ cs.LG ].
  31. Lewis, Mike; Bhosale, Shruti; Dettmers, Tim; Goyal, Naman; Zettlemoyer, Luke (2021-07-01). "BASE Layers: Simplifying Training of Large, Sparse Models" . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 6265–6274 . arXiv : 2103.16716 .
  32. Bengio, Emmanuel; Bacon, Pierre-Luc; Pineau, Joelle; Precup, Doina (2015). "Computación condicional en redes neuronales para modelos más rápidos". arXiv : 1511.06297 [ cs.LG ].
  33. Roller, Stephen; Sukhbaatar, Sainbayar; szlam, arthur; Weston, Jason (2021). "Capas hash para modelos dispersos grandes" . Avances en sistemas de procesamiento de información neuronal . 34. Curran Associates, Inc.: 17555–17566 .
  34. ^ Zuo, Simiao; Liu, Xiaodong; Jiao, Jian; Kim, joven Jin; Hassan, Hany; Zhang, Ruofei; Zhao, Tuo; Gao, Jianfeng (3 de febrero de 2022). "Domesticación de transformadores escasamente activados con expertos en estocásticos". arXiv : 2110.04260 [ cs.CL ].
  35. "Transformer Deep Dive: Parameter Counting" . Transformer Deep Dive: Parameter Counting . Consultado el 10 de octubre de 2023 .
  36. ^ Komatsuzaki, Aran; Puigcerver, Joan; Lee-Thorp, James; Ruiz, Carlos Riquelme; Mustafa, Albahaca; Ainslie, Josué; Tay, Yi; Dehghani, Mostafa; Houlsby, Neil (17 de febrero de 2023). "Reciclaje disperso: formación de una mezcla de expertos desde puntos de control densos". arXiv : 2212.05055 [ cs.LG ].
  37. Muennighoff, Niklas; Soldaini, Luca; Groeneveld, Dirk; Mira, Kyle; Morrison, Jacob; Min, Sewon; Shi, Weijia; Walsh, Pete; Tafjord, Oyvind (3 de septiembre de 2024). "OLMoE: modelos de lenguaje abiertos de mezcla de expertos". arXiv : 2409.02060 [ cs.CL ].
  38. Riquelme, Carlos; Puigcerver, Joan; Mustafa, Basil; Neumann, Maxim; Jenatton, Rodolphe; Susano Pinto, André; Keysers, Daniel; Houlsby, Neil (2021). "Escalando la visión con una mezcla dispersa de expertos" . Advances in Neural Information Processing Systems . 34 : 8583–8595 . arXiv : 2106.05974 .
  39. ^ Fei, Zhengcong; Fan, Mingyuan; Yu, Changqian; Li, Debang; Huang, Junshi (16 de julio de 2024). "Ampliación de transformadores de difusión a 16 mil millones de parámetros". arXiv : 2407.11633 [ cs.CV ].
  40. Lepikhin, Dmitri; Lee, Hyouk Joong; Xu, Yuanzhong; Chen, Dehao; Firat, Orhan; Huang, Yanping; Krikún, Maxim; Shazeer, Noam; Chen, Zhifeng (2020). "GShard: escalamiento de modelos gigantes con computación condicional y fragmentación automática". arXiv : 2006.16668 [ cs.CL ].
  41. ^ Du, Nan; Huang, Yanping; Dai, Andrés M.; Tong, Simón; Lepikhin, Dmitry; Xu, Yuanzhong; Krikún, Maxim; Zhou, Yanqi; Yu, Adams Wei; Firat, Orhan; Zoph, Barret; Fedus, Liam; Bosma, Martín; Zhou, Zongwei; Wang, Tao (2021). "GLaM: escalamiento eficiente de modelos lingüísticos con una combinación de expertos". arXiv : 2112.06905 [ cs.CL ].
  42. "200 idiomas en un solo modelo de IA: Un avance en la traducción automática de alta calidad" . ai.facebook.com . 19 de junio de 2022. Archivado del original el 9 de enero de 2023.
  43. Equipo NLLB; Costa-jussà, Marta R.; Cross, James; Çelebi, Onur; Elbayad, Maha; Heafield, Kenneth; Heffernan, Kevin; Kalbassi, Elahe; Lam, Janice; Licht, Daniel; Maillard, Jean; Sun, Anna; Wang, Skyler; Wenzek, Guillaume; Youngblood, Al (2022). "Ningún idioma se queda atrás: escalando la traducción automática centrada en el ser humano". arXiv : 2207.04672 [ cs.CL ].
  44. ^ Shen, Sheng; Hou, Le; Zhou, Yanqi; Du, Nan; Longpre, Shayne; Wei, Jason; Chung, Hyung Won; Zoph, Barret; Fedus, William; Chen, Xinyun; Vu, Tu; Wu, Yuexin; Chen, Wuyang; Webson, Alberto; Li, Yunxuan (2023). "La mezcla de expertos se une al ajuste de instrucciones: una combinación ganadora para modelos de lenguaje grandes". arXiv : 2305.14705 [ cs.CL ].
  45. IA, Mistral (11-12-2023). "Mixtral de expertos" . mistral.ai . Recuperado el 04-02-2024 .
  46. ^ Jiang, Albert Q.; Sablayrolles, Alexandre; Roux, Antoine; Mensch, Arturo; Savary, Blanche; Bamford, Chris; Chaplot, Devendra Singh; Casas, Diego de las; Hanna, Emma Bou (8 de enero de 2024). “Mixtral de Expertos”. arXiv : 2401.04088 [ cs.LG ].
  47. "Presentamos DBRX: Un nuevo LLM abierto de última generación" . Databricks . 27 de marzo de 2024. Consultado el 28 de marzo de 2024 .
  48. Knight, Will. "Dentro de la creación del modelo de IA de código abierto más poderoso del mundo" . Wired . ISSN 1059-1028 . Consultado el 28 de marzo de 2024 . 

Lecturas adicionales

  • Antes de la era del aprendizaje profundo
    • McLachlan, Geoffrey J.; Peel, David (2000). Modelos de mezcla finita . Serie Wiley en probabilidad y estadística, sección de probabilidad y estadística aplicada. Nueva York, Chichester, Weinheim, Brisbane, Singapur, Toronto: John Wiley & Sons, Inc. ISBN 978-0-471-00626-8.
    • Yuksel, SE; Wilson, JN; Gader, PD (agosto de 2012). "Veinte años de mezcla de expertos". IEEE Transactions on Neural Networks and Learning Systems . 23 (8): 1177– 1193. Bibcode : 2012ITNNL..23.1177Y . doi : 10.1109/TNNLS.2012.2200299 . ISSN 2162-237X . PMID 24807516. S2CID 9922492 .   
    • Masoudnia, Saeed; Ebrahimpour, Reza (12 de mayo de 2012). "Mezcla de expertos: una revisión de la literatura". Artificial Intelligence Review . 42 (2): 275– 293. doi : 10.1007/s10462-012-9338-y . S2CID 3185688 . 
    • Nguyen, Hien D.; Chamroukhi, Faicel (julio de 2018). "Aspectos prácticos y teóricos del modelado de mezcla de expertos: una visión general" . WIREs Data Mining and Knowledge Discovery . 8 (4) e1246. doi : 10.1002/widm.1246 . ISSN 1942-4787 . S2CID 49301452 .  
  • Técnicas prácticas para el entrenamiento de modelos de transformadores del Ministerio de Educación
    • Zoph, Barret; Bello, Irwan; Kumar, Sameer; Du, Nan; Huang, Yanping; Decano, Jeff; Shazeer, Noam; Fedus, William (2022). "ST-MoE: Diseño de modelos expertos dispersos estables y transferibles". arXiv : 2202.08906 [ cs.CL ].
    • Muennighoff, Niklas; Soldaini, Luca; Groeneveld, Dirk; Mira, Kyle; Morrison, Jacob; Min, Sewon; Shi, Weijia; Walsh, Pete; Tafjord, Oyvind; Lamberto, Nathan; Gu, Yuling; Arora, Shane; Bhagia, Akshita; Schwenk, Dustin; Wadden, David; Wettig, Alejandro; Hui, Binyuan; Dettmers, Tim; Kiela, Douwe; Farhadi, Ali; Smith, Noé A.; Pang Wei Koh; Singh, Amanpreet; Hajishirzi, Hannaneh (2024). "OLMoE: modelos de lenguaje abiertos de mezcla de expertos". arXiv : 2409.02060 [ cs.CL ]., con la publicación de datos asociada en "allenai/OLMoE" . Ai2. 17-10-2024 . Recuperado el 18-10-2024 .
    • Rajbhandari, Samyam; Li, Conglong; Yao, Zhewei; Zhang, Minjia; Reza Yazdani Aminabadi; Ammar Ahmad Awan; Rasley, Jeff; Él, Yuxiong (2022). "DeepSpeed-MoE: avance de la inferencia y la capacitación de una combinación de expertos para impulsar la escala de IA de próxima generación". arXiv : 2201.05596 [ cs.LG ].
    • DeepSeek-AI; et  al. (2024). "DeepSeek-V2: Un modelo de lenguaje de mezcla de expertos fuerte, económico y eficiente". arXiv : 2405.04434 [ cs.CL ].
    • DeepSeek-IA; et  al. (2024). "Informe técnico de DeepSeek-V3". arXiv : 2412.19437 [ cs.CL ].
    • Jin, Chao; Jiang, Ziheng; Bai, Zhihao; Zhong, Zheng; Liu, Juncai; Li, Xiang; Zheng, Ningxin; Wang, Xi; Xie, Cong; Huang, Qi; Heng, Wen; Mamá, Yiyuan; Bao, Wenlei; Zheng, tamaño; Peng, Yanghua; Lin, Haibin; Liu, Xuanzhe; Jin, Xin; Liu, Xin (2025). "MegaScale-MoE: capacitación eficiente en comunicación a gran escala de modelos de combinación de expertos en producción". arXiv : 2505.11432 [ cs.LG ].
  • Revisión de la literatura para la era del aprendizaje profundo
    • Fedus, William; Dean, Jeff; Zoph, Barret (2022). "Una revisión de los modelos expertos dispersos en el aprendizaje profundo". arXiv : 2209.01667 [ cs.LG ].
    • Fuzhao, Xue (2024-07-21). "XueFuzhao/awesome-mixture-of-experts" . GitHub . Recuperado el 2024-07-21 .
    • Vats, Arpita (2024-09-02). "arpita8/Awesome-Mixture-of-Experts-Papers" . GitHub . Recuperado el 2024-09-06 .
    • Cai, Weilin; Jiang, Juyong; Wang, Fan; Tang, Jing; Kim, Sunghun; Huang, Jiayi (2025). "Un estudio sobre la mezcla de expertos en modelos de lenguaje a gran escala". IEEE Transactions on Knowledge and Data Engineering . 37 (7): 3896. arXiv : 2407.06204 . Bibcode : 2025IDSO...37.3896C . doi : 10.1109/TKDE.2025.3554028 .