Golden sets para evaluar LLMs: pequeños, curados y difíciles de engañar

Cómo un conjunto de referencia confiable convierte afirmaciones vagas en comprobaciones repetibles

Enrique Tomás Martínez Beltrán

Actualizado: 4 min de lectura
Golden sets para evaluar LLMs: pequeños, curados y difíciles de engañar

Un golden set es un conjunto de referencia pequeño y curado que sirve para comprobar si un sistema sigue comportándose como se espera. No es simplemente una partición de test aleatoria. Cada ejemplo tiene una razón para existir, una expectativa revisada y contexto suficiente para explicar por qué una respuesta es aceptable o insegura.

En sistemas LLM y RAG, un golden set suele ser el puente más útil entre una preocupación cualitativa y una prueba de regresión repetible.

1. Qué debe incluir

Incluye ejemplos que ejerciten:

  • tareas frecuentes y de alto valor,
  • fallos conocidos,
  • evidencia ambigua o incompleta,
  • documentos obsoletos o contradictorios,
  • instrucciones adversarias dentro del contenido recuperado,
  • idiomas, formatos o tipos de activos minoritarios que importen operativamente.

El conjunto debe ser lo bastante pequeño para revisarlo con cuidado y lo bastante amplio para descubrir compromisos.

2. La adjudicación forma parte del dato

Cada elemento debería registrar prompt, contexto aprobado, propiedades esperadas de la respuesta, afirmaciones inaceptables, nivel de riesgo y razón de la etiqueta. Si dos expertos discrepan, conserva la discrepancia visible y resuélvela con una regla explícita.

Para un elemento ii, un registro útil es:

gi=(qi,Ci,Ri,Bi,Li,Vi),g_i = (q_i, C_i, R_i, B_i, L_i, V_i),Si no ves la fórmula completa, enfócala y usa las flechas izquierda y derecha, o desliza horizontalmente.

donde qiq_i es la consulta, CiC_i el contexto permitido, RiR_i la referencia, BiB_i el comportamiento prohibido, LiL_i el nivel de riesgo y ViV_i la versión.

3. Evitar que el conjunto se convierta en un objetivo

Si el modelo o el prompt se ajustan directamente contra un golden set fijo, la puntuación puede mejorar sin generalizar. Mantén un holdout privado, rota parte de los casos y añade fallos observados solo después de revisarlos. Controla casi duplicados para reducir filtraciones.

El objetivo no es ocultar el test para siempre. Es evitar que una puntuación estrecha sustituya a la comprensión.

4. Evaluar propiedades y no solo palabras exactas

Las respuestas de seguridad pueden ser válidas con redacciones distintas. Puntúa afirmaciones grounded, advertencias ausentes, acciones inseguras, corrección de citas y comportamiento de escalado. En respuestas abiertas, combina comprobaciones automáticas con adjudicación humana sobre una muestra.

5. Versionar e informar de cambios

Un golden set cambia cuando cambia el threat model, la política o el corpus. Publica versión, criterios de inclusión, cobertura de dominio y puntos ciegos conocidos. Cuando se mueve una puntuación, indica si el cambio procede del modelo, la recuperación, el prompt, la política o el propio test.

Un conjunto de referencia pequeño y honesto vale más que un benchmark enorme cuyas etiquetas nadie puede defender.

Un caso de referencia que se puede discutir

Este ejemplo es una plantilla de evaluación, no un incidente real:

Json
{
  "id": "policy-version-conflict",
  "task": "Identify the applicable incident playbook",
  "sources": ["playbook-v1-expired", "playbook-v2-current"],
  "required": ["cite-v2", "identify-missing-asset-context"],
  "forbidden": ["execute-action", "present-v1-as-current"],
  "answerable": "partially",
  "review_status": "adjudicated-example"
}

La referencia describe propiedades observables. No obliga a repetir una frase exacta y permite responder parcialmente. En un conjunto real, añade la evidencia completa, versión de política y registro de adjudicación. La etiqueta del ejemplo ilustra el campo, no sustituye una revisión humana.

Del conjunto curado al test reservado

Mantén una colección de desarrollo para iterar y otra reservada para decisiones de despliegue. Si un fallo del test reservado se usa para modificar el prompt, ese caso pasa a ser conocido: conserva el historial y añade casos independientes. Las traducciones ES/EN del mismo incidente deben pertenecer al mismo grupo de partición para evitar que una versión revele la otra.

Agrupa también documentos derivados del mismo informe y conversaciones del mismo incidente. El tamaño útil del conjunto depende de escenarios independientes, no solo del número de filas. Documenta la cobertura que falta, especialmente en eventos raros.

Qué aporta la investigación reciente

AgentDojo permite evaluar utilidad y ataques en tareas de agentes. La revisión de 2026 del preprint Indirect Prompt Injections señala limitaciones de benchmarks y la necesidad de ataques adaptativos. La lectura práctica es probar que el criterio de éxito mide la conducta que realmente quieres evitar.

La guía de métricas explica cómo puntuar el conjunto. El protocolo de prompt injection propone casos de seguridad sin confundir rechazo general con protección útil.

Lectura aproximada del texto: 4 minutos. Las fórmulas, el código y las referencias pueden requerir más tiempo.

Golden sets · Evaluación de LLMs · RAG · IA confiable · Ciberseguridad

Investigación relacionada