Saltar al contenido
Enrique Tomás Martínez Beltrán
InicioInvestigaciónPublicacionesTemasDocenciaBlog
Contacto
EN/ES
InicioInvestigaciónPublicacionesTemasDocenciaBlogContacto
EN/ES

Enrique Tomás Martínez Beltrán

Investigación postdoctoral en IA, ciberseguridad y aprendizaje federado, con trabajo en análisis de amenazas, ciberdefensa de ciclo cerrado y aprendizaje descentralizado confiable.

  • Política de privacidad
  • Términos del servicio
  • Accesibilidad
  • Google Scholarse abre en una pestaña nueva
  • ORCIDse abre en una pestaña nueva
  • LinkedInse abre en una pestaña nueva
  • GitHubse abre en una pestaña nueva
Todos los perfiles
  • ResearchGatese abre en una pestaña nueva
  • Scopusse abre en una pestaña nueva
  • DBLPse abre en una pestaña nueva
  • Web of Sciencese abre en una pestaña nueva

Enrique Tomás Martínez Beltrán. Todos los derechos reservados.

Volver arriba

Este sitio carga analítica opcional de Google y proveedores externos de analítica solo si aceptas. Puedes rechazarla y seguir usando la web con normalidad.

  1. Inicio
  2. Notas de investigación sobre aprendizaje federado, ciberseguridad y ciberdefensa
  3. Métricas para LLMs, RAG y sistemas de ciberseguridad
Métricas de LLMsEvaluación de LLMsRAGCiberseguridadIA confiable

Métricas para LLMs, RAG y sistemas de ciberseguridad

Una pila de medición para calidad, grounding, seguridad, calibración, coste y latencia

Enrique Tomás Martínez Beltrán

Investigador postdoctoral en Informática

13 de agosto de 202610 min de lectura
  • LinkedInse abre en una pestaña nueva
  • Xse abre en una pestaña nueva
Métricas para LLMs, RAG y sistemas de ciberseguridad

La evaluación de LLMs se vuelve engañosa cuando se pide a un único número resumir todo el sistema. Un asistente de seguridad puede ser fluido pero no estar grounded, correcto pero demasiado lento, seguro pero poco útil, o preciso en casos comunes y fallar ante incidentes raros de alto impacto.

La respuesta es una pila de medición cuyas dimensiones sigan visibles.

1. Calidad de la tarea

Empieza por la tarea. Según el flujo, mide F1 de extracción, calidad de clasificación, corrección de respuesta, calidad del ranking o utilidad valorada por personas. La métrica debe corresponderse con la decisión que apoya el sistema.

2. Evidencia y grounding

En RAG, mide recall y precisión de recuperación, corrección de citas, soporte de afirmaciones y completitud de respuesta. Una respuesta puede ser relevante para la pregunta y aun así incluir una afirmación sin respaldo.

Para afirmaciones cic_ici​ y evidencia EEE, informa al menos de:

support⁡(ci,E)∈{0,1,incierto}.\operatorname{support}(c_i,E) \in \{0,1,\text{incierto}\}.support(ci​,E)∈{0,1,incierto}.

Agrega el resultado con cuidado y conserva los casos inciertos en vez de forzarlos a una puntuación binaria.

3. Seguridad y robustez

La evaluación de seguridad debe incluir calidad de la negativa, resistencia a prompt injection, exposición de datos sensibles, tasa de acciones inseguras y comportamiento con contexto contradictorio o manipulado. Los casos de red team solo sirven cuando el escenario y el criterio de éxito están definidos.

4. Calibración y abstención

Si el modelo emite confianza, comprueba si se relaciona con la corrección. Un asistente bien calibrado debería saber cuándo pedir más evidencia o escalar. Abstenerse no es fallar cuando el coste de una acción sin respaldo es alto.

5. Operación y uso humano

Mide latencia, coste de tokens y recuperación, memoria, disponibilidad, tiempo de corrección del analista y porcentaje de recomendaciones aceptadas sin cambios. Estas métricas muestran si el modelo funciona en el ciclo real y no solo en un benchmark.

6. Informar del vector y no de una puntuación de vanidad

Un panel puede mostrar un vector:

m=(Q,G,S,C,L,H),\mathbf{m} = (Q, G, S, C, L, H),m=(Q,G,S,C,L,H),

para calidad de tarea, grounding, seguridad, calibración, latencia y utilidad humana. Sus componentes deben acompañarse del dataset, la política y la versión del modelo que los produjo.

La evaluación más creíble hace explícitos los compromisos. Indica qué mejoró, qué empeoró y qué fallos siguen siendo posibles.

Esta nota es una síntesis original de métricas para LLMs, RAG y flujos de seguridad. No reproduce texto de ninguna fuente.

Lecturas relacionadas

  • RAGChecker: A Fine-grained Framework for Diagnosing RAG
  • Red-Teaming for Generative AI: Silver Bullet or Security Theater?

Investigación relacionada

Golden sets para evaluar LLMs: pequeños, curados y difíciles de engañar

13 de agosto de 2026

Golden sets para evaluar LLMs: pequeños, curados y difíciles de engañar

Guía práctica para construir golden sets en sistemas de seguridad y RAG, con cobertura, adjudicación, controles de filtración y versionado.

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

13 de agosto de 2026

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

Mapa práctico de los usos de los LLMs en ciberdefensa, desde inteligencia de amenazas hasta triaje y explicación de alertas, con límites y controles explícitos.