El one-pager del piloto ya está firmado: problema, KPI, alcance, datos, controles y criterios go/no-go en una página. Aun así, al día 30 el comité discute “si el modelo se siente bien” porque nadie congeló el baseline, nadie separó métricas líderes de retrasadas y nadie midió contra umbrales falsificables. El kickoff sin plan de evidencia termina en demo. Este artículo es el complemento operativo del one-pager y de la matriz de priorización: cómo diseñar el plan de evidencia del piloto de IA para decidir con datos —no con impresiones— en mid-market México.
Para equipos que ya priorizaron y chartearon el piloto, y necesitan un protocolo de 30 días con baseline, métricas y go/no-go que el patrocinador pueda auditar.
Por qué el one-pager no basta sin plan de evidencia
El one-pager congela el contrato social del arranque. El plan de evidencia congela cómo se va a demostrar que ese contrato se cumplió. Tres fallas típicas cuando falta:
- Baseline implícito: se compara contra “lo que recordamos” o contra una semana atípica; cualquier mejora parece magia o cualquier meseta parece fracaso.
- Métricas de vanidad: accuracy en notebook, latencia en demo, o “el equipo está contento”, sin amarre al KPI del scorecard ni a guardrails de negocio.
- Go/no-go negociable: al día 30 se “extiende dos semanas más” porque no había umbrales escritos ni dueño de la decisión.
El plan de evidencia no sustituye el scorecard semanal ni el modo sombra: los alimenta. Tampoco reabre la matriz: asume que el caso ya está en el top 3 y tiene charter. Es el puente entre “arrancamos el lunes” y “escalamos, pivotamos o paramos con evidencia”.
Los cinco bloques del plan de evidencia (30 días)
Use estos bloques como checklist. Si falta uno, la decisión del día 30 será política, no operativa.
1. Baseline congelado (antes del día 0)
Defina la ventana histórica y el segmento exacto del one-pager. Ejemplo mid-market: tickets web retail Norte, últimas 8 semanas hábiles, excluyendo Black Friday local o cierres fiscales. Capture:
- Valor del KPI primario (p. ej. minutos hasta primera clasificación correcta).
- Guardrails (override humano, reclamos por mala ruta, costo por caso).
- Volumen y mix (para no “ganar” por cambio de cartera).
- Fuente y query versionada (quién la corre, en qué sistema, con qué filtro).
Congélelo por escrito con fecha y dueño de datos. Si el baseline se recalcula a mitad del piloto “porque encontramos un bug en el reporte”, ya no hay experimento: hay narrativa.
2. Métricas líderes vs retrasadas
Separe lo que se mueve en días de lo que confirma valor en semanas. Sin esa separación, el comité solo mira el P&L al final y pierde señales tempranas de fallo.
- Líderes (semanas 1–2): cobertura del segmento, % casos en modo sombra, tasa de acuerdo sombra vs humano, latencia de scoring, completitud de campos del contrato de datos.
- Retrasadas (semanas 3–4 y cierre): KPI primario vs baseline, guardrails de calidad/costo, incidentes de clase X, esfuerzo de excepción por caso.
Regla práctica: toda métrica líder debe tener un umbral de “alerta temprana”. Si en semana 2 la tasa de acuerdo sombra está bajo el piso, no se espera al día 30 para intervenir: se ajusta umbral, se limpia dato o se recorta alcance.
3. Diseño de comparación (qué cuenta como evidencia)
Elija un diseño simple y declárelo. En mid-market México rara vez hay A/B perfectos; sí hay diseños honestos:
- Antes/después con baseline congelado en el mismo segmento (mínimo viable).
- Modo sombra paralelo: el modelo puntúa; el humano decide; se mide acuerdo y contrafactual de ciclo.
- Canario acotado: % pequeño del tráfico con HITL obligatorio y cola de excepciones.
Documente exclusiones (campañas, feriados, cambios de proceso) y el criterio de “dato válido”. Si no cabe en media página, el diseño es demasiado sofisticado para un piloto de 30 días.
4. Umbrales go / no-go / pivot
Tres a cinco umbrales falsificables, tomados del one-pager y traducidos a números. Ejemplo de triaje L1:
- Go: KPI primario mejora ≥ X% vs baseline; override < techo; cero incidentes a legal; acuerdo sombra ≥ piso en las últimas 2 semanas.
- Pivot: KPI cerca del umbral pero un guardrail en rojo → recortar segmento o reforzar HITL, no “escalar igual”.
- No-go: KPI sin mejora material, o guardrail de riesgo rebasado, o contrato de datos incumplido → pausa y regreso a la matriz.
Asigne un dueño de la decisión (patrocinador) y una fecha fija de comité. El umbral se discute antes del día 0, no en la sala el día 30.
5. Cadencia de lectura (quién mira qué y cuándo)
Alinee el plan al ritual semanal del scorecard: 45–60 minutos, semáforo, una intervención. Añada dos hitos duros:
- Día 10: revisión de líderes y de integridad del baseline (¿sigue válido el segmento?).
- Día 30: paquete de evidencia (una página + anexos de query) y decisión go/no-go/pivot.
Sin cadencia, el plan de evidencia es un PDF que nadie abre hasta el cierre.
Mini ejemplo: plan de evidencia para triaje L1 (retail web)
Caso ya priorizado en la matriz y con one-pager firmado. Segmento: tickets web retail; control inicial: dos semanas sombra, luego canario con cola de excepciones.
- Baseline (congelado día −3): 8 semanas; mediana 18 min a primera clasificación correcta; override N/A (todo manual); 2.1% reclamos por mala ruta; query CRM versionada por Analista CRM.
- Líderes: % tickets con score; acuerdo sombra ≥ 85% en rolling 7 días; campos canal/SKU completos ≥ 95%.
- Retrasadas: mediana de ciclo ≤ 12 min; reclamos ≤ baseline; override canario < 15%; cero rutas a legal por error de modelo.
- Diseño: sombra días 1–14; canario 20% días 15–30 con HITL bajo umbral de confianza.
- Go día 30: ciclo ≤ 12 min y acuerdo sombra ≥ 85% en semanas 3–4; guardrails en verde.
- No-go: ciclo sin mejora ≥ 10% vs baseline, o un incidente de clase legal, o completitud de datos < 90% sostenida.
Eso cabe en una página anexa al one-pager. Cualquier dashboard de 40 KPIs sobra para la decisión de escalamiento.
Checklist accionable antes del kickoff
- Baseline numérico firmado (valor, ventana, segmento, query, dueño).
- Lista de 3–5 métricas líderes con umbral de alerta temprana.
- Lista de 2–4 métricas retrasadas amarradas al KPI y guardrails del one-pager.
- Diseño de comparación declarado (sombra / canario / antes-después).
- Umbrales go / pivot / no-go escritos y aprobados por el patrocinador.
- Fecha de comité día 30 en calendario; dueño de la decisión con nombre.
- Plantilla de “paquete de evidencia” (una página): baseline, curva semanal, excepciones, recomendación.
- Regla de no recalcular baseline a mitad de piloto sin escalamiento formal.
Errores frecuentes en mid-market (y cómo evitarlos)
- Empezar a medir en la semana 2: si el baseline no existe al día 0, el día 30 será una opinión. Congélelo antes del kickoff.
- Optimizar solo accuracy del modelo: un modelo “mejor” que aumenta overrides o reclamos es un no-go de negocio. Guarde el scorecard.
- Cambiar el segmento a mitad: si el mix cambia, declare un nuevo experimento; no mezcle baselines.
- Extender el piloto sin umbral: una extensión solo con pivot escrito (nuevo alcance + nuevos umbrales + nueva fecha). Si no, es postergar la decisión.
- Ignorar el contrato de datos: evidencia podrida por campos incompletos no se arregla con más épocas de entrenamiento; se arregla con dueño de dato y checklist de completitud.
Cómo encaja en el arco: matriz → one-pager → evidencia → scorecard
La matriz elige el top 3. El one-pager congela el charter. El plan de evidencia define cómo se demostrará valor en 30 días. El scorecard y el ritual semanal gobiernan el piloto vivo. La cola de excepciones y el modo sombra son controles que alimentan las métricas líderes. Al cierre, la decisión go/no-go/pivot actualiza el portafolio: se escala, se recorta o se libera capacidad para el siguiente caso de la matriz.
Sin este eslabón, el portafolio de IA se llena de “pilotos eternos” y demos. Con él, el comité mid-market puede decir con claridad: cumplimos el umbral, no cumplimos, o pivotamos con causa.
Próximo paso
Si ya tiene matriz y one-pager, redacte el plan de evidencia en una página antes del kickoff: baseline, líderes/retrasadas, diseño de comparación y umbrales go/no-go con fecha de comité. Si quiere acompañamiento para bajar este protocolo a su segmento y a sus sistemas (ERP/CRM/ticketing) en México, escriba a contacto@nextWaveAI.AI o llame al +52 (33) 3126 6969.

Add comment