Los modelos Mixture of Experts aumentan la capacidad representacional sin evaluar todos los expertos para cada token. Un router selecciona un subconjunto pequeño de redes feed-forward expertas y sus salidas se combinan antes del siguiente bloque transformer.
La promesa es el cómputo condicional. El coste es la complejidad del sistema.
1. Enrutamiento disperso
Para una representación de token y expertos , un router top- puede escribirse así:
Si no ves la fórmula completa, enfócala y usa las flechas izquierda y derecha, o desliza horizontalmente.Solo los expertos seleccionados procesan el token, pero todos los parámetros expertos deben almacenarse, sincronizarse o estar disponibles para servir el modelo.
2. Por qué importa el balanceo
Si el router envía demasiados tokens a un experto, ese experto se convierte en cuello de botella mientras el resto de la capacidad queda inactiva. Si los tokens se descartan al alcanzar la capacidad, la calidad puede degradarse de una forma difícil de atribuir al modelo de lenguaje.
Las pérdidas de balanceo, los factores de capacidad y el ruido de routing son controles de ingeniería. Afectan al throughput, a la especialización y a la reproducibilidad.
3. Especialización no significa experiencia automáticamente
Un experto puede especializarse por idioma, tema, sintaxis o un artefacto oculto del conjunto de datos. Inspeccionar el routing puede revelar estructura útil, pero una alta concentración no demuestra que el experto haya aprendido un concepto significativo.
La evaluación debería comparar modelos densos y dispersos con presupuestos equivalentes de cómputo activo, memoria, comunicación y latencia.
4. Preguntas de seguridad y fiabilidad
El routing puede convertirse en una superficie de ataque. Una entrada adversaria podría buscar un experto congestionado, explotar un experto débil o generar un uso desigual de recursos. Los registros deben mostrar carga de routing, tokens descartados, disponibilidad de expertos y cambios después de una adaptación.
MoE no es solo una arquitectura de modelo. Es un servicio distribuido con un planificador dentro del forward pass.
Parámetros totales, activos y memoria de servicio
Un modelo MoE mantiene parámetros compartidos y parámetros de expertos. Si existen expertos por capa y se activan , una aproximación conceptual es:
Si no ves la fórmula completa, enfócala y usa las flechas izquierda y derecha, o desliza horizontalmente.Esto no implica que la latencia ni la memoria sean proporcionales a los parámetros activos. Hay que mantener pesos disponibles, caché KV, buffers de comunicación y capacidad para atender varias peticiones. Los tokens de un lote pueden activar expertos diferentes y terminar utilizando gran parte del conjunto.
Switch Transformers es una referencia para enrutamiento disperso, y Artetxe y colaboradores comparan MoE y modelos densos en distintas tareas. Sus resultados no permiten deducir el coste de cualquier despliegue a partir del nombre de la arquitectura.
Cómo medir un MoE para un asistente bilingüe
Propongo separar carga en español, inglés y texto mixto, manteniendo longitudes de entrada comparables. Registra tiempo al primer token, tiempo entre tokens, latencia p95, memoria máxima y distribución de carga por experto. Añade consultas con identificadores técnicos, porque la tokenización puede modificar tanto la longitud como el patrón de routing.
Compara generación corta y contexto largo, con concurrencia baja y alta. Un modelo eficiente en una prueba aislada puede crear colas cuando muchas solicitudes coinciden en los mismos expertos. Si el motor descarta tokens por capacidad, debe informarse; algunas implementaciones utilizan políticas sin descarte y presentan otros compromisos.
Una pregunta de investigación concreta
¿Permanece estable la calidad por idioma cuando cambia la distribución de carga? La concentración de routing puede servir como señal de diagnóstico, pero no demuestra por sí sola una vulnerabilidad ni especialización semántica.
La nota de MoE distribuida añade el coste de red, y las métricas operativas para LLMs sitúan esas medidas junto a la calidad.


