La evaluación de LLMs se vuelve engañosa cuando se pide a un único número resumir todo el sistema. Un asistente de seguridad puede ser fluido pero no estar grounded, correcto pero demasiado lento, seguro pero poco útil, o preciso en casos comunes y fallar ante incidentes raros de alto impacto.
La respuesta es una pila de medición cuyas dimensiones sigan visibles.
1. Calidad de la tarea
Empieza por la tarea. Según el flujo, mide F1 de extracción, calidad de clasificación, corrección de respuesta, calidad del ranking o utilidad valorada por personas. La métrica debe corresponderse con la decisión que apoya el sistema.
2. Evidencia y grounding
En RAG, mide recall y precisión de recuperación, corrección de citas, soporte de afirmaciones y completitud de respuesta. Una respuesta puede ser relevante para la pregunta y aun así incluir una afirmación sin respaldo.
Para afirmaciones y evidencia , informa al menos de:
Agrega el resultado con cuidado y conserva los casos inciertos en vez de forzarlos a una puntuación binaria.
3. Seguridad y robustez
La evaluación de seguridad debe incluir calidad de la negativa, resistencia a prompt injection, exposición de datos sensibles, tasa de acciones inseguras y comportamiento con contexto contradictorio o manipulado. Los casos de red team solo sirven cuando el escenario y el criterio de éxito están definidos.
4. Calibración y abstención
Si el modelo emite confianza, comprueba si se relaciona con la corrección. Un asistente bien calibrado debería saber cuándo pedir más evidencia o escalar. Abstenerse no es fallar cuando el coste de una acción sin respaldo es alto.
5. Operación y uso humano
Mide latencia, coste de tokens y recuperación, memoria, disponibilidad, tiempo de corrección del analista y porcentaje de recomendaciones aceptadas sin cambios. Estas métricas muestran si el modelo funciona en el ciclo real y no solo en un benchmark.
6. Informar del vector y no de una puntuación de vanidad
Un panel puede mostrar un vector:
para calidad de tarea, grounding, seguridad, calibración, latencia y utilidad humana. Sus componentes deben acompañarse del dataset, la política y la versión del modelo que los produjo.
La evaluación más creíble hace explícitos los compromisos. Indica qué mejoró, qué empeoró y qué fallos siguen siendo posibles.
Esta nota es una síntesis original de métricas para LLMs, RAG y flujos de seguridad. No reproduce texto de ninguna fuente.


