LuAITools.com
提交工具
🧠AI
Unos pocos expertos por consulta

Mezcla de expertos

MoE divide el modelo en muchos «expertos» y activa solo unos pocos por consulta, cambiando una fracción del cálculo por el rendimiento de un modelo gigante.

¿Qué es la mezcla de expertos (MoE)?

Un modelo grande tradicional pasa cada parámetro en cada pregunta — como una oficina donde cualquier trámite despierta a todos los departamentos. La mezcla de expertos (MoE) divide el modelo en muchas redes «expertas» pequeñas y solo llama a los pocos expertos más relevantes en cada entrada, dejando descansar al resto. Más rápido y más barato.

¿Cómo elige a los expertos?

Un enrutador (router)
Un planificador — piensa en un portero — echa un vistazo a la entrada y decide qué expertos deben ocuparse.
Solo se activan unos pocos
El modelo puede tener cien expertos, pero solo activa dos o tres por entrada, recortando muchísimo el cálculo.

¿Por qué eso ahorra dinero y acelera?

Muchos parámetros, menos cálculo
MoE guarda un conocimiento enorme en sus parámetros, pero cada pasada toca solo una pequeña porción, así que corre rápido.
Los expertos se especializan
Un experto es bueno en código, otro en matemáticas. Cada uno con su carril, y juntos son más fuertes.

¿Cuál es la trampa?

Más expertos, más memoria (hay que almacenarlos a todos) y un entrenamiento y enrutado más complicados. También es común el desequilibrio de carga: un experto se llama una y otra vez mientras otros se quedan de brazos cruzados. Eso exige ingeniería de verdad para suavizarlo.

En resumen: la mezcla de expertos mantiene un gran ejército pero manda a trabajar a escuadras pequeñas — el cálculo de unos pocos expertos, la capacidad de un modelo gigante.

Comentarios