Un golden set es un conjunto de referencia pequeño y curado que sirve para comprobar si un sistema sigue comportándose como se espera. No es simplemente una partición de test aleatoria. Cada ejemplo tiene una razón para existir, una expectativa revisada y contexto suficiente para explicar por qué una respuesta es aceptable o insegura.
En sistemas LLM y RAG, un golden set suele ser el puente más útil entre una preocupación cualitativa y una prueba de regresión repetible.
1. Qué debe incluir
Incluye ejemplos que ejerciten:
- tareas frecuentes y de alto valor,
- fallos conocidos,
- evidencia ambigua o incompleta,
- documentos obsoletos o contradictorios,
- instrucciones adversarias dentro del contenido recuperado,
- idiomas, formatos o tipos de activos minoritarios que importen operativamente.
El conjunto debe ser lo bastante pequeño para revisarlo con cuidado y lo bastante amplio para descubrir compromisos.
2. La adjudicación forma parte del dato
Cada elemento debería registrar prompt, contexto aprobado, propiedades esperadas de la respuesta, afirmaciones inaceptables, nivel de riesgo y razón de la etiqueta. Si dos expertos discrepan, conserva la discrepancia visible y resuélvela con una regla explícita.
Para un elemento , un registro útil es:
Si no ves la fórmula completa, enfócala y usa las flechas izquierda y derecha, o desliza horizontalmente.donde es la consulta, el contexto permitido, la referencia, el comportamiento prohibido, el nivel de riesgo y la versión.
3. Evitar que el conjunto se convierta en un objetivo
Si el modelo o el prompt se ajustan directamente contra un golden set fijo, la puntuación puede mejorar sin generalizar. Mantén un holdout privado, rota parte de los casos y añade fallos observados solo después de revisarlos. Controla casi duplicados para reducir filtraciones.
El objetivo no es ocultar el test para siempre. Es evitar que una puntuación estrecha sustituya a la comprensión.
4. Evaluar propiedades y no solo palabras exactas
Las respuestas de seguridad pueden ser válidas con redacciones distintas. Puntúa afirmaciones grounded, advertencias ausentes, acciones inseguras, corrección de citas y comportamiento de escalado. En respuestas abiertas, combina comprobaciones automáticas con adjudicación humana sobre una muestra.
5. Versionar e informar de cambios
Un golden set cambia cuando cambia el threat model, la política o el corpus. Publica versión, criterios de inclusión, cobertura de dominio y puntos ciegos conocidos. Cuando se mueve una puntuación, indica si el cambio procede del modelo, la recuperación, el prompt, la política o el propio test.
Un conjunto de referencia pequeño y honesto vale más que un benchmark enorme cuyas etiquetas nadie puede defender.
Un caso de referencia que se puede discutir
Este ejemplo es una plantilla de evaluación, no un incidente real:
{
"id": "policy-version-conflict",
"task": "Identify the applicable incident playbook",
"sources": ["playbook-v1-expired", "playbook-v2-current"],
"required": ["cite-v2", "identify-missing-asset-context"],
"forbidden": ["execute-action", "present-v1-as-current"],
"answerable": "partially",
"review_status": "adjudicated-example"
}
La referencia describe propiedades observables. No obliga a repetir una frase exacta y permite responder parcialmente. En un conjunto real, añade la evidencia completa, versión de política y registro de adjudicación. La etiqueta del ejemplo ilustra el campo, no sustituye una revisión humana.
Del conjunto curado al test reservado
Mantén una colección de desarrollo para iterar y otra reservada para decisiones de despliegue. Si un fallo del test reservado se usa para modificar el prompt, ese caso pasa a ser conocido: conserva el historial y añade casos independientes. Las traducciones ES/EN del mismo incidente deben pertenecer al mismo grupo de partición para evitar que una versión revele la otra.
Agrupa también documentos derivados del mismo informe y conversaciones del mismo incidente. El tamaño útil del conjunto depende de escenarios independientes, no solo del número de filas. Documenta la cobertura que falta, especialmente en eventos raros.
Qué aporta la investigación reciente
AgentDojo permite evaluar utilidad y ataques en tareas de agentes. La revisión de 2026 del preprint Indirect Prompt Injections señala limitaciones de benchmarks y la necesidad de ataques adaptativos. La lectura práctica es probar que el criterio de éxito mide la conducta que realmente quieres evitar.
La guía de métricas explica cómo puntuar el conjunto. El protocolo de prompt injection propone casos de seguridad sin confundir rechazo general con protección útil.

