Un golden set es un conjunto de referencia pequeño y curado que sirve para comprobar si un sistema sigue comportándose como se espera. No es simplemente una partición de test aleatoria. Cada ejemplo tiene una razón para existir, una expectativa revisada y contexto suficiente para explicar por qué una respuesta es aceptable o insegura.
En sistemas LLM y RAG, un golden set suele ser el puente más útil entre una preocupación cualitativa y una prueba de regresión repetible.
1. Qué debe incluir
Incluye ejemplos que ejerciten:
- tareas frecuentes y de alto valor,
- fallos conocidos,
- evidencia ambigua o incompleta,
- documentos obsoletos o contradictorios,
- instrucciones adversarias dentro del contenido recuperado,
- idiomas, formatos o tipos de activos minoritarios que importen operativamente.
El conjunto debe ser lo bastante pequeño para revisarlo con cuidado y lo bastante amplio para descubrir compromisos.
2. La adjudicación forma parte del dato
Cada elemento debería registrar prompt, contexto aprobado, propiedades esperadas de la respuesta, afirmaciones inaceptables, nivel de riesgo y razón de la etiqueta. Si dos expertos discrepan, conserva la discrepancia visible y resuélvela con una regla explícita.
Para un elemento , un registro útil es:
donde es la consulta, el contexto permitido, la referencia, el comportamiento prohibido, el nivel de riesgo y la versión.
3. Evitar que el conjunto se convierta en un objetivo
Si el modelo o el prompt se ajustan directamente contra un golden set fijo, la puntuación puede mejorar sin generalizar. Mantén un holdout privado, rota parte de los casos y añade fallos observados solo después de revisarlos. Controla casi duplicados para reducir filtraciones.
El objetivo no es ocultar el test para siempre. Es evitar que una puntuación estrecha sustituya a la comprensión.
4. Evaluar propiedades y no solo palabras exactas
Las respuestas de seguridad pueden ser válidas con redacciones distintas. Puntúa afirmaciones grounded, advertencias ausentes, acciones inseguras, corrección de citas y comportamiento de escalado. En respuestas abiertas, combina comprobaciones automáticas con adjudicación humana sobre una muestra.
5. Versionar e informar de cambios
Un golden set cambia cuando cambia el threat model, la política o el corpus. Publica versión, criterios de inclusión, cobertura de dominio y puntos ciegos conocidos. Cuando se mueve una puntuación, indica si el cambio procede del modelo, la recuperación, el prompt, la política o el propio test.
Un conjunto de referencia pequeño y honesto vale más que un benchmark enorme cuyas etiquetas nadie puede defender.
Esta nota es una síntesis original de prácticas de conjuntos de evaluación curados para sistemas LLM. No reproduce texto de ninguna fuente.


