Saltar al contenido
Enrique Tomás Martínez Beltrán
InicioInvestigaciónPublicacionesTemasDocenciaBlog
Contacto
EN/ES
InicioInvestigaciónPublicacionesTemasDocenciaBlogContacto
EN/ES

Enrique Tomás Martínez Beltrán

Investigación postdoctoral en IA, ciberseguridad y aprendizaje federado, con trabajo en análisis de amenazas, ciberdefensa de ciclo cerrado y aprendizaje descentralizado confiable.

  • Política de privacidad
  • Términos del servicio
  • Accesibilidad
  • Google Scholarse abre en una pestaña nueva
  • ORCIDse abre en una pestaña nueva
  • LinkedInse abre en una pestaña nueva
  • GitHubse abre en una pestaña nueva
Todos los perfiles
  • ResearchGatese abre en una pestaña nueva
  • Scopusse abre en una pestaña nueva
  • DBLPse abre en una pestaña nueva
  • Web of Sciencese abre en una pestaña nueva

Enrique Tomás Martínez Beltrán. Todos los derechos reservados.

Volver arriba

Este sitio carga analítica opcional de Google y proveedores externos de analítica solo si aceptas. Puedes rechazarla y seguir usando la web con normalidad.

  1. Inicio
  2. Notas de investigación sobre aprendizaje federado, ciberseguridad y ciberdefensa
  3. La ciberdefensa autónoma necesita algo más que un LLM
Ciberdefensa autónomaLLMsCiberseguridadMitigación de ataquesIA confiable

La ciberdefensa autónoma necesita algo más que un LLM

Una visión de ciclo de control para detección, planificación, ejecución y supervisión humana

Enrique Tomás Martínez Beltrán

Investigador postdoctoral en Informática

13 de agosto de 20268 min de lectura
  • LinkedInse abre en una pestaña nueva
  • Xse abre en una pestaña nueva
La ciberdefensa autónoma necesita algo más que un LLM

La ciberdefensa autónoma suele describirse como un modelo que detecta un ataque y responde inmediatamente. Esa descripción oculta la parte difícil: decidir qué acciones son admisibles cuando las observaciones son parciales, el adversario se adapta y el coste de un error es asimétrico.

Una formulación más útil es la de un ciclo de control acotado. El ciclo puede automatizar transiciones repetitivas, pero cada transición necesita evidencia, una política y una forma de detenerse o recuperarse.

1. De la predicción al control

Sea ztz_tzt​ el estado de seguridad estimado en el instante ttt, oto_tot​ las observaciones y ata_tat​ una acción candidata. Un ciclo simplificado es:

zt+1=f(zt,ot,at),at∼π(⋅∣zt,P,R),z_{t+1} = f(z_t, o_t, a_t), \qquad a_t \sim \pi(\cdot \mid z_t, P, R),zt+1​=f(zt​,ot​,at​),at​∼π(⋅∣zt​,P,R),

donde PPP es la política activa y RRR contiene las restricciones de recuperación. El modelo puede ayudar a estimar ztz_tzt​ o a ordenar acciones, pero no debería redefinir PPP silenciosamente.

2. Cuatro capas de autonomía

Conviene separar:

  1. Detección: identificar una desviación y adjuntar evidencia.
  2. Interpretación: relacionar la desviación con activos, tácticas y causas plausibles.
  3. Planificación: comparar acciones permitidas por la política.
  4. Ejecución: aplicar un cambio reversible o aprobado y observar su efecto.

Un LLM es un asistente natural para la interpretación y el borrador de planes. Es una autoridad mucho más débil para detectar y ejecutar, especialmente cuando la entrada contiene texto no confiable.

3. El punto de control humano forma parte del diseño

La supervisión humana no debe ser un botón añadido al final de una demo. El sistema debe mostrar la evidencia, la acción propuesta, el efecto esperado, la reversibilidad y las condiciones que la cancelarían. Las acciones de bajo riesgo pueden automatizarse bajo una política. Las acciones de alto impacto deben requerir aprobación explícita.

El límite puede representarse con una función de riesgo:

ρ(a)=Pr⁡(dan˜o∣a,E)⋅C(a),\rho(a) = \Pr(\text{daño}\mid a,E) \cdot C(a),ρ(a)=Pr(dan˜o∣a,E)⋅C(a),

donde EEE es la evidencia actual y C(a)C(a)C(a) la consecuencia de una acción incorrecta. El umbral debe ser una decisión de gobernanza y no una preferencia oculta del modelo.

4. Recuperación y aprendizaje

La autonomía sin recuperación solo produce fallos rápidos. Cada acción automatizada necesita rollback, tiempo de expiración o cuarentena. El resultado debe registrarse como feedback, pero no convertirse en una etiqueta incuestionable. Una mitigación fallida puede deberse a una hipótesis errónea, una topología obsoleta o un control no disponible.

5. Cómo evaluar el comportamiento autónomo

Informa de algo más que la precisión de detección:

  • tiempo desde la señal hasta una evidencia interpretable,
  • tasa de acciones inseguras,
  • proporción de acciones que requieren escalado,
  • éxito de recuperación y tiempo de rollback,
  • correcciones de los analistas,
  • rendimiento con contexto retrasado, ausente o manipulado.

La afirmación más sólida no es que el sistema actúe solo. Es que sabe cuándo la evidencia es insuficiente, limita su autoridad y deja un rastro que otra persona puede inspeccionar.

Esta nota es una síntesis original de principios de autonomía acotada para ciberdefensa. No reproduce texto de ninguna fuente.

Investigación relacionada

Mitigación de ataques con apoyo de LLMs sin piloto automático inseguro

13 de agosto de 2026

Mitigación de ataques con apoyo de LLMs sin piloto automático inseguro

Patrón de diseño para usar modelos de lenguaje al explicar incidentes y comparar mitigaciones mientras las políticas aprobadas controlan la ejecución.

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

13 de agosto de 2026

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

Mapa práctico de los usos de los LLMs en ciberdefensa, desde inteligencia de amenazas hasta triaje y explicación de alertas, con límites y controles explícitos.