GraphRAG para inteligencia de amenazas

Cuándo importan más las entidades, relaciones y comunidades que los fragmentos aislados

Enrique Tomás Martínez Beltrán

Actualizado: 4 min de lectura
GraphRAG para inteligencia de amenazas

El RAG tradicional suele recuperar fragmentos semánticamente cercanos a una consulta. Es útil cuando la respuesta está en uno o dos documentos. La inteligencia de amenazas plantea a menudo otra pregunta: cómo se relacionan un actor, una técnica, un activo, un indicador y un incidente a través de muchas fuentes.

GraphRAG aborda este escenario extrayendo entidades y relaciones, organizándolas en comunidades y utilizando esas estructuras durante la recuperación y la síntesis.

1. De fragmentos a grafo de conocimiento

Sea G=(V,E)G=(V,E) un grafo en el que los nodos representan entidades y las aristas relaciones tipadas. Una consulta puede recuperar un vecindario, un resumen de comunidad o un camino:

R(q,G)={Nk(v),  Cj,  Path(u,v)}.R(q,G) = \{N_k(v),\; \mathcal{C}_j,\; \operatorname{Path}(u,v)\}.Si no ves la fórmula completa, enfócala y usa las flechas izquierda y derecha, o desliza horizontalmente.

El objeto importante no es el grafo aislado. Es el camino que permite volver desde la respuesta a los fragmentos que justifican cada relación.

2. Preguntas locales y globales

Una consulta local puede preguntar qué activos están asociados con un indicador. Una consulta global puede preguntar cómo se organiza una campaña en muchos informes. La recuperación vectorial puede tener dificultades con la segunda porque ningún fragmento contiene el patrón completo.

Los resúmenes de comunidades ayudan a comprimir estructura repetida, pero introducen otro fallo: pueden eliminar incertidumbre o fusionar entidades que solo parecen similares.

3. Higiene del grafo para seguridad

La capa de extracción debe conservar:

  • fuente y fecha de publicación,
  • alias de entidades y decisiones de normalización,
  • tipo y confianza de la relación,
  • si la relación es observada, reportada o inferida,
  • restricciones de acceso y requisitos de borrado.

Una arista inferida nunca debe presentarse como un hecho observado. El grafo debe versionarse para poder auditar un cambio en la regla de extracción.

4. Cómo evaluar GraphRAG

Evalúa el grafo y la respuesta por separado. Mide resolución de entidades, precisión de relaciones, validez de caminos, cobertura de comunidades y grounding de la respuesta final. Incluye casos adversarios con alias engañosos, informes duplicados y cronologías contradictorias.

Un artefacto útil es el grafo de afirmaciones: cada afirmación de la respuesta apunta al camino recuperado y a los documentos de origen. Así el analista puede cuestionar el razonamiento en lugar de confiar en un párrafo pulido.

GraphRAG es más valioso cuando la pregunta es relacional o global. No es automáticamente mejor que un buen recuperador de fragmentos para todas las consultas.

GraphRAG es una familia de decisiones de recuperación

El enfoque de Microsoft documenta extracción y resúmenes de comunidades en sus métodos de indexación. Conviene distinguir esa implementación de cualquier sistema que combine un grafo con recuperación. Recorrer un camino de entidades y sintetizar un resumen global son operaciones diferentes y necesitan evaluaciones distintas.

Como ejemplo ilustrativo, dos informes pueden mencionar un mismo dominio en fechas separadas. Eso no demuestra que pertenezca al mismo actor en ambos momentos. Una relación debería conservar intervalo de validez, fuente y tipo de afirmación. Si el segundo informe cita al primero, no hay corroboración independiente.

Diseñar un grafo que pueda corregirse

La especificación STIX 2.1 permite modelar entidades y relaciones de inteligencia. Un sistema de recuperación puede tomar ese vocabulario como referencia, sin asumir que todos sus nodos inferidos son objetos verificados.

Conserva una dependencia desde cada resumen hasta sus documentos. Si se corrige una atribución, invalida las relaciones y resúmenes afectados antes de responder nuevas consultas. Un grafo actualizado con resúmenes antiguos todavía puede difundir el error.

Comparación que justifica el coste del grafo

Construye grupos de preguntas de identificación exacta, relación entre dos fuentes y síntesis global. Compara búsqueda léxica, RAG híbrido y GraphRAG con un presupuesto explícito de indexación y consulta. Evalúa citas, relaciones falsas, cobertura y tiempo de actualización. El sistema más complejo debería aportar una mejora en las preguntas que motivaron construirlo.

Para cada respuesta, ofrece el camino de evidencia y permite una respuesta parcial cuando no todas las aristas estén respaldadas. La guía de RAG para seguridad cubre el flujo base, y los golden sets ayudan a fijar expectativas por tipo de consulta.

Lectura aproximada del texto: 4 minutos. Las fórmulas, el código y las referencias pueden requerir más tiempo.

GraphRAG · RAG · Inteligencia de amenazas · LLMs · Ciberseguridad

Investigación relacionada