Los modelos Mixture of Experts aumentan la capacidad representacional sin evaluar todos los expertos para cada token. Un router selecciona un subconjunto pequeño de redes feed-forward expertas y sus salidas se combinan antes del siguiente bloque transformer.
La promesa es el cómputo condicional. El coste es la complejidad del sistema.
1. Enrutamiento disperso
Para una representación de token y expertos , un router top- puede escribirse así:
Solo los expertos seleccionados procesan el token, pero todos los parámetros expertos deben almacenarse, sincronizarse o estar disponibles para servir el modelo.
2. Por qué importa el balanceo
Si el router envía demasiados tokens a un experto, ese experto se convierte en cuello de botella mientras el resto de la capacidad queda inactiva. Si los tokens se descartan al alcanzar la capacidad, la calidad puede degradarse de una forma difícil de atribuir al modelo de lenguaje.
Las pérdidas de balanceo, los factores de capacidad y el ruido de routing son controles de ingeniería. Afectan al throughput, a la especialización y a la reproducibilidad.
3. Especialización no significa experiencia automáticamente
Un experto puede especializarse por idioma, tema, sintaxis o un artefacto oculto del conjunto de datos. Inspeccionar el routing puede revelar estructura útil, pero una alta concentración no demuestra que el experto haya aprendido un concepto significativo.
La evaluación debería comparar modelos densos y dispersos con presupuestos equivalentes de cómputo activo, memoria, comunicación y latencia.
4. Preguntas de seguridad y fiabilidad
El routing puede convertirse en una superficie de ataque. Una entrada adversaria podría buscar un experto congestionado, explotar un experto débil o generar un uso desigual de recursos. Los registros deben mostrar carga de routing, tokens descartados, disponibilidad de expertos y cambios después de una adaptación.
MoE no es solo una arquitectura de modelo. Es un servicio distribuido con un planificador dentro del forward pass.
Esta nota es una síntesis original orientada a sistemas sobre el diseño de modelos de lenguaje MoE. No reproduce texto de ninguna fuente.


