Saltar al contenido
Enrique Tomás Martínez Beltrán
InicioInvestigaciónPublicacionesTemasDocenciaBlog
Contacto
EN/ES
InicioInvestigaciónPublicacionesTemasDocenciaBlogContacto
EN/ES

Enrique Tomás Martínez Beltrán

Investigación postdoctoral en IA, ciberseguridad y aprendizaje federado, con trabajo en análisis de amenazas, ciberdefensa de ciclo cerrado y aprendizaje descentralizado confiable.

  • Política de privacidad
  • Términos del servicio
  • Accesibilidad
  • Google Scholarse abre en una pestaña nueva
  • ORCIDse abre en una pestaña nueva
  • LinkedInse abre en una pestaña nueva
  • GitHubse abre en una pestaña nueva
Todos los perfiles
  • ResearchGatese abre en una pestaña nueva
  • Scopusse abre en una pestaña nueva
  • DBLPse abre en una pestaña nueva
  • Web of Sciencese abre en una pestaña nueva

Enrique Tomás Martínez Beltrán. Todos los derechos reservados.

Volver arriba

Este sitio carga analítica opcional de Google y proveedores externos de analítica solo si aceptas. Puedes rechazarla y seguir usando la web con normalidad.

  1. Inicio
  2. Notas de investigación sobre aprendizaje federado, ciberseguridad y ciberdefensa
  3. Mixture of Experts en LLMs: capacidad mediante enrutamiento selectivo
Mezcla de expertosMoELLMsCómputo condicionalIA confiable

Mixture of Experts en LLMs: capacidad mediante enrutamiento selectivo

Por qué la activación dispersa cambia el escalado, la especialización y la ingeniería del sistema

Enrique Tomás Martínez Beltrán

Investigador postdoctoral en Informática

13 de agosto de 202610 min de lectura
  • LinkedInse abre en una pestaña nueva
  • Xse abre en una pestaña nueva
Mixture of Experts en LLMs: capacidad mediante enrutamiento selectivo

Los modelos Mixture of Experts aumentan la capacidad representacional sin evaluar todos los expertos para cada token. Un router selecciona un subconjunto pequeño de redes feed-forward expertas y sus salidas se combinan antes del siguiente bloque transformer.

La promesa es el cómputo condicional. El coste es la complejidad del sistema.

1. Enrutamiento disperso

Para una representación de token hth_tht​ y expertos E1,…,EmE_1,\ldots,E_mE1​,…,Em​, un router top-kkk puede escribirse así:

gt=TopK⁡(Wrht),yt=∑i∈gtαt,iEi(ht).g_t = \operatorname{TopK}(W_r h_t), \qquad y_t = \sum_{i\in g_t} \alpha_{t,i}E_i(h_t).gt​=TopK(Wr​ht​),yt​=i∈gt​∑​αt,i​Ei​(ht​).

Solo los expertos seleccionados procesan el token, pero todos los parámetros expertos deben almacenarse, sincronizarse o estar disponibles para servir el modelo.

2. Por qué importa el balanceo

Si el router envía demasiados tokens a un experto, ese experto se convierte en cuello de botella mientras el resto de la capacidad queda inactiva. Si los tokens se descartan al alcanzar la capacidad, la calidad puede degradarse de una forma difícil de atribuir al modelo de lenguaje.

Las pérdidas de balanceo, los factores de capacidad y el ruido de routing son controles de ingeniería. Afectan al throughput, a la especialización y a la reproducibilidad.

3. Especialización no significa experiencia automáticamente

Un experto puede especializarse por idioma, tema, sintaxis o un artefacto oculto del conjunto de datos. Inspeccionar el routing puede revelar estructura útil, pero una alta concentración no demuestra que el experto haya aprendido un concepto significativo.

La evaluación debería comparar modelos densos y dispersos con presupuestos equivalentes de cómputo activo, memoria, comunicación y latencia.

4. Preguntas de seguridad y fiabilidad

El routing puede convertirse en una superficie de ataque. Una entrada adversaria podría buscar un experto congestionado, explotar un experto débil o generar un uso desigual de recursos. Los registros deben mostrar carga de routing, tokens descartados, disponibilidad de expertos y cambios después de una adaptación.

MoE no es solo una arquitectura de modelo. Es un servicio distribuido con un planificador dentro del forward pass.

Esta nota es una síntesis original orientada a sistemas sobre el diseño de modelos de lenguaje MoE. No reproduce texto de ninguna fuente.

Lecturas relacionadas

  • Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
  • Efficient Large Scale Language Modeling with Mixtures of Experts

Investigación relacionada

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

13 de agosto de 2026

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

Mapa práctico de los usos de los LLMs en ciberdefensa, desde inteligencia de amenazas hasta triaje y explicación de alertas, con límites y controles explícitos.

La ciberdefensa autónoma necesita algo más que un LLM

13 de agosto de 2026

La ciberdefensa autónoma necesita algo más que un LLM

Cómo plantear la ciberdefensa autónoma como un ciclo de control acotado con evidencia, políticas, recuperación e intervención humana responsable.