Saltar al contenido
Enrique Tomás Martínez Beltrán
InicioInvestigaciónPublicacionesTemasDocenciaBlog
Contacto
EN/ES
InicioInvestigaciónPublicacionesTemasDocenciaBlogContacto
EN/ES

Enrique Tomás Martínez Beltrán

Investigación postdoctoral en IA, ciberseguridad y aprendizaje federado, con trabajo en análisis de amenazas, ciberdefensa de ciclo cerrado y aprendizaje descentralizado confiable.

  • Política de privacidad
  • Términos del servicio
  • Accesibilidad
  • Google Scholarse abre en una pestaña nueva
  • ORCIDse abre en una pestaña nueva
  • LinkedInse abre en una pestaña nueva
  • GitHubse abre en una pestaña nueva
Todos los perfiles
  • ResearchGatese abre en una pestaña nueva
  • Scopusse abre en una pestaña nueva
  • DBLPse abre en una pestaña nueva
  • Web of Sciencese abre en una pestaña nueva

Enrique Tomás Martínez Beltrán. Todos los derechos reservados.

Volver arriba

Este sitio carga analítica opcional de Google y proveedores externos de analítica solo si aceptas. Puedes rechazarla y seguir usando la web con normalidad.

  1. Inicio
  2. Notas de investigación sobre aprendizaje federado, ciberseguridad y ciberdefensa
  3. Retrieval-Augmented Generation para flujos de ciberseguridad
RAGRetrieval-Augmented GenerationLLMsCiberseguridadInteligencia de amenazas

Retrieval-Augmented Generation para flujos de ciberseguridad

Qué aporta la recuperación a un LLM y qué no puede garantizar por sí sola

Enrique Tomás Martínez Beltrán

Investigador postdoctoral en Informática

13 de agosto de 20269 min de lectura
  • LinkedInse abre en una pestaña nueva
  • Xse abre en una pestaña nueva
Retrieval-Augmented Generation para flujos de ciberseguridad

Retrieval-Augmented Generation, o RAG, combina un modelo de lenguaje con una colección externa de documentos. Esa colección puede contener playbooks, registros de vulnerabilidades, informes de incidentes o políticas locales. El modelo recibe un contexto seleccionado durante la inferencia y no depende solo de lo aprendido durante el preentrenamiento.

La idea es sencilla. La ingeniería no.

1. El flujo básico

Dada una consulta qqq y una colección de documentos DDD, un recuperador selecciona un contexto:

Ck(q)=TopK⁡d∈Ds(q,d).C_k(q) = \operatorname{TopK}_{d\in D} s(q,d).Ck​(q)=TopKd∈D​s(q,d).

Después, el generador produce una respuesta condicionada por la consulta y el contexto:

y∼pθ(y∣q,Ck(q)).y \sim p_\theta(y \mid q, C_k(q)).y∼pθ​(y∣q,Ck​(q)).

La ecuación no garantiza que la respuesta esté respaldada. Solo describe de dónde recibió el contexto el modelo.

2. Qué importa en seguridad

El RAG de seguridad necesita algo más que similitud semántica. La recuperación debe considerar:

  • autoridad y versión del documento,
  • vigencia temporal,
  • alcance del activo o entorno,
  • control de acceso,
  • normalización de indicadores,
  • si la evidencia es una observación, una regla o una hipótesis.

Un playbook obsoleto puede ser más peligroso que no tener playbook porque aparenta autoridad.

3. Separar calidad de recuperación y de generación

Si la respuesta es errónea, hay que preguntar si el recuperador no encontró la evidencia, escogió evidencia contradictoria o devolvió un contexto correcto que el generador utilizó mal. Guarda los identificadores y las puntuaciones recuperadas para localizar el fallo.

Para una respuesta con afirmaciones c1,…,cnc_1,\ldots,c_nc1​,…,cn​, una revisión de grounding puede estimar:

G=1n∑i=1n1[ci estaˊ respaldada por el contexto seleccionado].G = \frac{1}{n}\sum_{i=1}^{n}\mathbf{1}[c_i\text{ está respaldada por el contexto seleccionado}].G=n1​i=1∑n​1[ci​ estaˊ respaldada por el contexto seleccionado].

Es un diagnóstico útil, no un sustituto de la revisión experta.

4. RAG no es un límite de seguridad por sí mismo

Los documentos recuperados pueden contener instrucciones maliciosas, datos sensibles o políticas contradictorias. La aplicación debe separar instrucciones y evidencia, filtrar el acceso antes de recuperar y evitar que el modelo trate el texto documental como un comando de sistema nuevo.

La salida debería incluir citas, incertidumbre y una negativa cuando el contexto sea insuficiente. Una respuesta segura sin procedencia es una respuesta fallida.

5. Un despliegue disciplinado

Construye primero un corpus pequeño y versionado. Usa un golden set de consultas realistas, incluye documentos obsoletos y contradictorios, y evalúa recuperación y generación por separado. Añade correcciones humanas al conjunto de evaluación solo después de adjudicarlas.

RAG mejora el acceso al conocimiento actual. No elimina la necesidad de gobernar las fuentes, controlar el acceso y medir con cuidado.

Esta nota es una síntesis original de diseño de RAG para ciberseguridad. No reproduce texto de ninguna fuente.

Lectura relacionada

  • Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

Investigación relacionada

GraphRAG para inteligencia de amenazas

13 de agosto de 2026

GraphRAG para inteligencia de amenazas

Cómo la recuperación basada en grafos puede conectar actores, técnicas, activos e incidentes manteniendo un camino trazable hasta la evidencia.

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

13 de agosto de 2026

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

Mapa práctico de los usos de los LLMs en ciberdefensa, desde inteligencia de amenazas hasta triaje y explicación de alertas, con límites y controles explícitos.