El golden set ya existe, el job corre cada semana y el tablero muestra un score. La pregunta incómoda llega en la primera revisión con negocio: ¿quién decidió que esta respuesta “pasa”? Si la calificación depende del humor del revisor o de un prompt de evaluación que nadie versionó, la evaluación continua mide ruido con mucha disciplina.
Este desglose práctico complementa la pieza de mediodía sobre evaluación continua de IA en producción con golden sets y umbrales de degradación. Allí definimos qué evaluar y cuándo alertar. Aquí nos enfocamos en cómo calificar: rúbricas que el negocio entiende, jueces humanos calibrados y el uso responsable de un modelo como juez (LLM-as-judge) sin que el score se vuelva autocomplaciente.
Por qué la calificación es el eslabón débil
En servicios de IA generativa casi nunca hay una sola respuesta correcta. Un resumen puede ser exacto pero omitir el dato que el cliente necesitaba; una respuesta de soporte puede ser amable pero prometer algo que la política no permite. Cuando el criterio de “correcto” vive en la cabeza de cada evaluador, aparecen tres problemas:
- Varianza entre revisores. Dos personas califican el mismo caso distinto y el score sube o baja según quién tomó el turno.
- Deriva del criterio. Con el tiempo, el equipo se acostumbra a ciertas fallas y deja de penalizarlas. El score mejora sin que el servicio mejore.
- Jueces automáticos sesgados. Un modelo evaluador puede preferir respuestas largas, seguras de sí mismas o con el mismo estilo del modelo que evalúa.
Resolverlo no exige un equipo de investigación. Exige una rúbrica explícita, un ritual corto de calibración y reglas claras sobre qué decide la máquina y qué decide una persona.
Paso 1: una rúbrica de 3 a 5 ejes, escrita en lenguaje de negocio
La rúbrica es el contrato de calidad a nivel de caso. Mantenla corta: si tiene doce criterios, nadie la aplica igual. Para la mayoría de copilotos y asistentes B2B bastan estos ejes:
| Eje | Pregunta | Escala sugerida |
|---|---|---|
| Exactitud | ¿La información es correcta según la fuente o el sistema de registro? | 0 incorrecta / 1 parcial / 2 correcta |
| Grounding | ¿Cada afirmación relevante está respaldada por el contexto recuperado? | 0 / 1 / 2 |
| Cumplimiento | ¿Respeta política, regulación y límites de lo que se puede prometer? | Pasa / No pasa (bloqueante) |
| Utilidad | ¿Resuelve lo que el usuario necesitaba o lo escala correctamente? | 0 / 1 / 2 |
| Tono | ¿Es adecuado para el canal y el segmento? | 0 / 1 / 2 (opcional) |
Dos reglas que ahorran discusiones: los ejes de cumplimiento son bloqueantes (un caso que falla ahí no pasa, aunque el resto sea perfecto) y cada nivel de la escala lleva un ejemplo anclado, un caso real del golden set que muestre qué es un 0, un 1 y un 2. Sin ejemplos, la escala se interpreta; con ejemplos, se aplica.
Paso 2: calibra a los revisores humanos antes de confiar en el score
Antes de usar la rúbrica en la corrida semanal, haz una sesión de calibración de 45 minutos:
- Selecciona 20 a 30 casos del golden set con mezcla de fáciles, borde y fallas conocidas.
- Pide a dos o tres revisores que los califiquen por separado, sin comentar.
- Compara: ¿en qué porcentaje de casos coinciden por eje? Discute solo los desacuerdos.
- Ajusta la redacción de la rúbrica o agrega ejemplos anclados donde hubo confusión.
- Repite con un lote nuevo hasta que el acuerdo sea estable.
Como referencia práctica, muchos equipos se sienten cómodos cuando los revisores coinciden en alrededor de 8 de cada 10 casos por eje; por debajo de eso, el problema suele ser la rúbrica, no las personas. Si quieres una métrica formal, el kappa de Cohen corrige el acuerdo que ocurriría por azar. Repite la calibración cuando cambie la política, el producto o el equipo revisor.
Paso 3: LLM-as-judge, sí, pero con correa corta
Calificar cientos de casos por semana a mano no escala. Un modelo evaluador puede aplicar la rúbrica a todo el golden set en minutos, siempre que lo trates como cualquier otro componente en producción:
- Valídalo contra humanos. Corre el juez sobre los casos ya calibrados y mide su acuerdo con el veredicto humano por eje. Si no alcanza el nivel de acuerdo que exiges entre personas, no lo uses para ese eje.
- Versiona el prompt del juez. El prompt evaluador, el modelo y la rúbrica entran al mismo change control que modelos, prompts y umbrales. Cambiar el juez sin registrarlo invalida la comparación con corridas anteriores.
- Pide razones y evidencia. Exige que el juez cite el fragmento que justifica cada calificación. Facilita la auditoría y reduce veredictos “por intuición”.
- Controla sesgos conocidos. Normaliza longitud cuando compares respuestas, aleatoriza el orden en comparaciones por pares y, cuando sea posible, usa un modelo juez distinto al que genera las respuestas.
- Deja los bloqueantes a personas. En ejes de cumplimiento regulatorio o de riesgo alto, el juez puede priorizar casos para revisión, pero la decisión final la toma alguien con nombre.
Paso 4: muestreo de auditoría semanal
Aunque el juez esté validado, programa un muestreo fijo cada semana: por ejemplo, 5% de los casos aprobados y 100% de los reprobados en segmentos críticos, revisados por un humano. Registra dos números simples en el reporte de evaluación:
- Tasa de desacuerdo juez–humano en la muestra. Si sube de forma sostenida, el juez se desalineó o la distribución de inputs cambió.
- Falsos aprobados en segmentos críticos. Son los que más dañan, porque esconden degradación detrás de un score verde.
Cuando cualquiera de los dos crece, trátalo como una señal ámbar de la evaluación continua: revisión con dueño y fecha, no un ajuste silencioso del umbral.
Ejemplo hipotético: asistente de cobranza en una financiera mexicana
Un equipo opera un asistente que redacta respuestas a clientes con pagos vencidos. Su rúbrica tiene cuatro ejes: exactitud del saldo, grounding en el estado de cuenta, cumplimiento (sin lenguaje intimidatorio ni promesas de condonación no autorizadas, bloqueante) y utilidad (ofrece una opción de pago válida). Tras dos sesiones de calibración, los revisores coinciden en la gran mayoría de los casos. El juez automático se valida para exactitud, grounding y utilidad. Para cumplimiento solo marca casos sospechosos, que revisa el área legal cada martes. En la tercera semana, la muestra de auditoría detecta que el juez aprobaba respuestas que mencionaban descuentos de una campaña ya vencida. El problema era el contexto recuperado, no el juez: se corrige el retrieval, se agregan tres casos al golden set y se documenta en el backlog de mejoras.
Checklist rápido para esta semana
- Rúbrica de 3 a 5 ejes con escala y un ejemplo anclado por nivel.
- Ejes bloqueantes identificados (cumplimiento, riesgo, seguridad).
- Sesión de calibración con al menos dos revisores y acuerdo medido.
- Juez automático validado contra veredictos humanos, eje por eje.
- Prompt del juez, modelo y rúbrica versionados en change control.
- Muestreo de auditoría semanal con desacuerdo juez–humano y falsos aprobados en el reporte.
- Dueño nombrado para recalibrar cuando cambien política, producto o equipo.
Cierre
Un golden set sin rúbrica calibrada es un examen sin respuestas oficiales. La evaluación continua solo funciona como alerta temprana si confías en la calificación, y esa confianza se construye con criterios explícitos, acuerdo medido entre revisores y un juez automático que rinde cuentas igual que el modelo que evalúa. Si tu equipo quiere diseñar la rúbrica y el ritual de calibración para un servicio de IA en producción, en Next Wave podemos ayudarte a dejarlo operando en pocas semanas.

Add comment