La ciberdefensa autónoma necesita algo más que un LLM

Una visión de ciclo de control para detección, planificación, ejecución y supervisión humana

Enrique Tomás Martínez Beltrán

Actualizado: 4 min de lectura
La ciberdefensa autónoma necesita algo más que un LLM

La ciberdefensa autónoma suele describirse como un modelo que detecta un ataque y responde inmediatamente. Esa descripción oculta la parte difícil: decidir qué acciones son admisibles cuando las observaciones son parciales, el adversario se adapta y el coste de un error es asimétrico.

Una formulación más útil es la de un ciclo de control acotado. El ciclo puede automatizar transiciones repetitivas, pero cada transición necesita evidencia, una política y una forma de detenerse o recuperarse.

1. De la predicción al control

Sea ztz_t el estado de seguridad estimado en el instante tt, oto_t las observaciones y ata_t una acción candidata. Un ciclo simplificado es:

zt+1=f(zt,ot,at),atπ(zt,P,R),z_{t+1} = f(z_t, o_t, a_t), \qquad a_t \sim \pi(\cdot \mid z_t, P, R),Si no ves la fórmula completa, enfócala y usa las flechas izquierda y derecha, o desliza horizontalmente.

donde PP es la política activa y RR contiene las restricciones de recuperación. El modelo puede ayudar a estimar ztz_t o a ordenar acciones, pero no debería redefinir PP silenciosamente.

2. Cuatro capas de autonomía

Conviene separar:

  1. Detección: identificar una desviación y adjuntar evidencia.
  2. Interpretación: relacionar la desviación con activos, tácticas y causas plausibles.
  3. Planificación: comparar acciones permitidas por la política.
  4. Ejecución: aplicar un cambio reversible o aprobado y observar su efecto.

Un LLM es un asistente natural para la interpretación y el borrador de planes. Es una autoridad mucho más débil para detectar y ejecutar, especialmente cuando la entrada contiene texto no confiable.

3. El punto de control humano forma parte del diseño

La supervisión humana no debe ser un botón añadido al final de una demo. El sistema debe mostrar la evidencia, la acción propuesta, el efecto esperado, la reversibilidad y las condiciones que la cancelarían. Las acciones de bajo riesgo pueden automatizarse bajo una política. Las acciones de alto impacto deben requerir aprobación explícita.

El límite puede representarse con una función de riesgo:

ρ(a)=Pr(dan˜oa,E)C(a),\rho(a) = \Pr(\text{daño}\mid a,E) \cdot C(a),Si no ves la fórmula completa, enfócala y usa las flechas izquierda y derecha, o desliza horizontalmente.

donde EE es la evidencia actual y C(a)C(a) la consecuencia de una acción incorrecta. El umbral debe ser una decisión de gobernanza y no una preferencia oculta del modelo.

4. Recuperación y aprendizaje

La autonomía sin recuperación solo produce fallos rápidos. Cada acción automatizada necesita rollback, tiempo de expiración o cuarentena. El resultado debe registrarse como feedback, pero no convertirse en una etiqueta incuestionable. Una mitigación fallida puede deberse a una hipótesis errónea, una topología obsoleta o un control no disponible.

5. Cómo evaluar el comportamiento autónomo

Informa de algo más que la precisión de detección:

  • tiempo desde la señal hasta una evidencia interpretable,
  • tasa de acciones inseguras,
  • proporción de acciones que requieren escalado,
  • éxito de recuperación y tiempo de rollback,
  • correcciones de los analistas,
  • rendimiento con contexto retrasado, ausente o manipulado.

La afirmación más sólida no es que el sistema actúe solo. Es que sabe cuándo la evidencia es insuficiente, limita su autoridad y deja un rastro que otra persona puede inspeccionar.

El riesgo de oscilar entre respuestas

Un controlador puede aislar un activo, observar que desaparece la señal y volver a conectarlo. Si interpreta la ausencia de telemetría como recuperación, repetirá el ciclo. Para evitarlo, distingue señal ausente, sensor desconectado e incidente resuelto. Una condición de recuperación debe apoyarse en evidencia nueva y observable.

Como propuesta de diseño, incorpora estados explícitos: observación, investigación, respuesta pendiente, respuesta aplicada y recuperación verificada. Cada transición necesita condiciones de entrada, un plazo máximo y un responsable. La caducidad de un plan obliga a reevaluarlo; no implica ejecutarlo automáticamente.

Evaluar utilidad y seguridad por separado

Un agente que rechaza todas las tareas puede tener pocas acciones inseguras y ninguna utilidad. El extremo contrario es completar todas las tareas sin respetar límites. Mide éxito de la tarea legítima, violaciones de autorización y recuperación como resultados independientes. En una prueba con intervención humana, incluye el trabajo que se traslada al operador.

El preprint de julio de 2026 Safety, or Just Capability? cuestiona que puntuaciones de benchmarks distintos puedan intercambiarse como una medida general de seguridad. Es evidencia de investigación reciente, no un criterio de certificación. Una consecuencia práctica es conservar nombre y versión del benchmark, conducta medida y protocolo de evaluación junto a cada resultado.

NIST SP 800-61 Rev. 3 sitúa respuesta y recuperación dentro de la gestión del riesgo. El grado de autonomía de un asistente debe justificarse por el flujo operativo y sus consecuencias.

La mitigación asistida por LLM concreta la ejecución; las métricas de LLMs y RAG permiten diseñar el cuadro de evaluación.

Lectura aproximada del texto: 4 minutos. Las fórmulas, el código y las referencias pueden requerir más tiempo.

Ciberdefensa autónoma · LLMs · Ciberseguridad · Mitigación de ataques · IA confiable

Investigación relacionada