concepto · intermedio · 2 min de lectura
MoE — Mixture of Experts
MoE es una arquitectura donde solo una fracción de los parámetros del modelo se activa para cada token, permitiendo modelos mucho más grandes sin aumentar proporcionalmente el costo de inferencia.
No requiere conocimientos previos.
Alcance en breve
Cubre
- MoE as a concept
No cubre
- implementation details
Supone
- The reader understands relevant fundamentals.
Resumen
Mixture of Experts (MoE) divide el modelo en múltiples "expertos" —subredes especializadas— y un router que decide qué expertos activar para cada token. En lugar de usar todos los parámetros del modelo para cada token, MoE activa solo un subconjunto —típicamente 2 de 8 expertos—. Esto permite escalar el número total de parámetros sin aumentar proporcionalmente el cómputo.
Mixtral 8x7B tiene 46.7B parámetros totales pero solo ~12.9B activos por token. GPT-4 usa MoE según reportes. La clave está en el balance de carga entre expertos: si todos los tokens van al experto 3, los demás no aprenden.
Alcance y supuestos
Cubre MoE como arquitectura, su trade-off y su adopción en LLMs modernos. Asume familiaridad con Transformers.
Modelo mental
Un hospital con especialistas. Cuando llega un paciente con dolor de cabeza, el router —la recepcionista— lo deriva al neurólogo, no al cardiólogo ni al dermatólogo. Solo se activan los especialistas relevantes para cada caso.
Uso práctico
- ✅ Modelos más grandes con costo de inferencia manejable.
- ❌ Mayor consumo de VRAM (todos los expertos en memoria, aunque no se usen todos).
Ejemplo trabajado: Mixtral 8x7B
8 expertos, 2 activos por token. Para un batch de 32 tokens, diferentes pares de expertos se activan para cada token. El throughput es ~2x más rápido que un modelo denso de 47B.
Evidencia
- Mixtral (Mistral AI) popularizó MoE en modelos open-source. GPT-4 y Gemini también usan MoE.
Fuentes citadas
- Wikipedia, Object-oriented programming (Síntesis, 21-07-2026)