Saltar al contenido
Enrique Tomás Martínez Beltrán
InicioInvestigaciónPublicacionesTemasDocenciaBlog
Contacto
EN/ES
InicioInvestigaciónPublicacionesTemasDocenciaBlogContacto
EN/ES

Enrique Tomás Martínez Beltrán

Investigación postdoctoral en IA, ciberseguridad y aprendizaje federado, con trabajo en análisis de amenazas, ciberdefensa de ciclo cerrado y aprendizaje descentralizado confiable.

  • Política de privacidad
  • Términos del servicio
  • Accesibilidad
  • Google Scholarse abre en una pestaña nueva
  • ORCIDse abre en una pestaña nueva
  • LinkedInse abre en una pestaña nueva
  • GitHubse abre en una pestaña nueva
Todos los perfiles
  • ResearchGatese abre en una pestaña nueva
  • Scopusse abre en una pestaña nueva
  • DBLPse abre en una pestaña nueva
  • Web of Sciencese abre en una pestaña nueva

Enrique Tomás Martínez Beltrán. Todos los derechos reservados.

Volver arriba

Este sitio carga analítica opcional de Google y proveedores externos de analítica solo si aceptas. Puedes rechazarla y seguir usando la web con normalidad.

  1. Inicio
  2. Notas de investigación sobre aprendizaje federado, ciberseguridad y ciberdefensa
  3. Golden sets para evaluar LLMs: pequeños, curados y difíciles de engañar
Golden setsEvaluación de LLMsRAGIA confiableCiberseguridad

Golden sets para evaluar LLMs: pequeños, curados y difíciles de engañar

Cómo un conjunto de referencia confiable convierte afirmaciones vagas en comprobaciones repetibles

Enrique Tomás Martínez Beltrán

Investigador postdoctoral en Informática

13 de agosto de 20268 min de lectura
  • LinkedInse abre en una pestaña nueva
  • Xse abre en una pestaña nueva
Golden sets para evaluar LLMs: pequeños, curados y difíciles de engañar

Un golden set es un conjunto de referencia pequeño y curado que sirve para comprobar si un sistema sigue comportándose como se espera. No es simplemente una partición de test aleatoria. Cada ejemplo tiene una razón para existir, una expectativa revisada y contexto suficiente para explicar por qué una respuesta es aceptable o insegura.

En sistemas LLM y RAG, un golden set suele ser el puente más útil entre una preocupación cualitativa y una prueba de regresión repetible.

1. Qué debe incluir

Incluye ejemplos que ejerciten:

  • tareas frecuentes y de alto valor,
  • fallos conocidos,
  • evidencia ambigua o incompleta,
  • documentos obsoletos o contradictorios,
  • instrucciones adversarias dentro del contenido recuperado,
  • idiomas, formatos o tipos de activos minoritarios que importen operativamente.

El conjunto debe ser lo bastante pequeño para revisarlo con cuidado y lo bastante amplio para descubrir compromisos.

2. La adjudicación forma parte del dato

Cada elemento debería registrar prompt, contexto aprobado, propiedades esperadas de la respuesta, afirmaciones inaceptables, nivel de riesgo y razón de la etiqueta. Si dos expertos discrepan, conserva la discrepancia visible y resuélvela con una regla explícita.

Para un elemento iii, un registro útil es:

gi=(qi,Ci,Ri,Bi,Li,Vi),g_i = (q_i, C_i, R_i, B_i, L_i, V_i),gi​=(qi​,Ci​,Ri​,Bi​,Li​,Vi​),

donde qiq_iqi​ es la consulta, CiC_iCi​ el contexto permitido, RiR_iRi​ la referencia, BiB_iBi​ el comportamiento prohibido, LiL_iLi​ el nivel de riesgo y ViV_iVi​ la versión.

3. Evitar que el conjunto se convierta en un objetivo

Si el modelo o el prompt se ajustan directamente contra un golden set fijo, la puntuación puede mejorar sin generalizar. Mantén un holdout privado, rota parte de los casos y añade fallos observados solo después de revisarlos. Controla casi duplicados para reducir filtraciones.

El objetivo no es ocultar el test para siempre. Es evitar que una puntuación estrecha sustituya a la comprensión.

4. Evaluar propiedades y no solo palabras exactas

Las respuestas de seguridad pueden ser válidas con redacciones distintas. Puntúa afirmaciones grounded, advertencias ausentes, acciones inseguras, corrección de citas y comportamiento de escalado. En respuestas abiertas, combina comprobaciones automáticas con adjudicación humana sobre una muestra.

5. Versionar e informar de cambios

Un golden set cambia cuando cambia el threat model, la política o el corpus. Publica versión, criterios de inclusión, cobertura de dominio y puntos ciegos conocidos. Cuando se mueve una puntuación, indica si el cambio procede del modelo, la recuperación, el prompt, la política o el propio test.

Un conjunto de referencia pequeño y honesto vale más que un benchmark enorme cuyas etiquetas nadie puede defender.

Esta nota es una síntesis original de prácticas de conjuntos de evaluación curados para sistemas LLM. No reproduce texto de ninguna fuente.

Investigación relacionada

Métricas para LLMs, RAG y sistemas de ciberseguridad

13 de agosto de 2026

Métricas para LLMs, RAG y sistemas de ciberseguridad

Por qué una sola puntuación nunca basta en un flujo de seguridad con LLMs y cómo combinar métricas de tarea, evidencia, operación y uso humano.

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

13 de agosto de 2026

Grandes modelos de lenguaje para ciberseguridad: un punto de partida responsable

Mapa práctico de los usos de los LLMs en ciberdefensa, desde inteligencia de amenazas hasta triaje y explicación de alertas, con límites y controles explícitos.