En la pieza de mediodía sobre FinOps de IA y costo por transacción exitosa listamos cinco palancas para bajar el gasto sin perder calidad. Una de ellas suele dar el mayor ahorro en servicios con volumen alto, y también es la que más se implementa mal: el ruteo de modelos por complejidad. La idea es sencilla. No todas las solicitudes necesitan el modelo más grande. Si una consulta se resuelve con una regla o con un modelo pequeño, mandarla al modelo premium es pagar de más por el mismo resultado.
Este desglose práctico explica cómo diseñar un ruteador que ahorre de verdad, cómo validarlo con lo que ya mides y cómo evitar que el ahorro se convierta en un incidente de calidad.
Qué es el ruteo por complejidad (y qué no es)
Un ruteador es una capa que, antes de llamar a cualquier modelo, decide qué ruta toma cada solicitud. En la práctica casi siempre hay tres niveles:
- Nivel 0, sin modelo. Reglas determinísticas, búsqueda exacta o caché. Ejemplo: una factura cuyo monto coincide exactamente con la orden de compra.
- Nivel 1, modelo compacto. Clasificación, extracción de campos o respuestas frecuentes con contexto corto.
- Nivel 2, modelo grande. Razonamiento con varios documentos, casos ambiguos, redacción sensible o decisiones con impacto financiero.
El ruteo no es cambiar todo a un modelo más barato y esperar lo mejor. Tampoco es un “modo ahorro” que se activa cuando se acaba el presupuesto. Es una política explícita, versionada y medida, igual que un prompt o un umbral.
Paso 1: perfila el tráfico antes de diseñar rutas
Toma una muestra representativa de dos a cuatro semanas de solicitudes reales y clasifícalas a mano o con apoyo del equipo de negocio. Para cada tipo de solicitud responde tres preguntas: qué tan frecuente es, qué tan difícil es para el modelo y cuánto cuesta un error. Con esa tabla aparecen los candidatos obvios: los tipos frecuentes, fáciles y de bajo riesgo son los que más conviene bajar de nivel.
Si ya tienes etiquetado de costos por caso de uso, este perfil se cruza con el costo por transacción para ver dónde está el dinero. Es común descubrir que una minoría de tipos de solicitud concentra la mayor parte del gasto.
Paso 2: elige la señal de ruteo
La señal es lo que el ruteador mira para decidir. De menor a mayor sofisticación:
| Señal | Cuándo funciona | Riesgo principal |
|---|---|---|
| Reglas de negocio (tipo de trámite, monto, canal) | Cuando la complejidad depende de atributos conocidos | Reglas que envejecen sin que nadie las revise |
| Clasificador ligero entrenado con el perfil de tráfico | Cuando hay suficientes ejemplos etiquetados | Enviar abajo casos difíciles que parecen fáciles |
| Confianza del modelo compacto con escalamiento | Cuando el modelo pequeño puede intentar primero y escalar si duda | Doble costo y latencia en los casos que escalan |
Para la mayoría de las empresas, la combinación más sana es empezar con reglas de negocio y agregar escalamiento por confianza en una sola ruta. El clasificador dedicado llega después, cuando ya hay datos que lo justifiquen.
Paso 3: define la red de seguridad
Todo ruteador se equivoca. La pregunta es qué pasa cuando lo hace. Antes de encenderlo, deja por escrito:
- Criterios de escalamiento. Baja confianza, salida que no pasa validación de formato o tema marcado como sensible suben automáticamente al nivel siguiente.
- Rutas bloqueadas. Tipos de solicitud que nunca bajan de nivel, aunque el clasificador lo sugiera, como quejas formales o decisiones de crédito.
- Interruptor de regreso. Una bandera que manda todo al nivel 2 en minutos si la calidad se degrada, conectada al runbook de triage.
Paso 4: valida con golden set y modo sombra
El ruteador se evalúa como un cambio más dentro del change control. Corre el golden set completo pasando por el ruteador y compáralo contra la configuración de referencia. Mira la calificación por segmento, no solo el promedio: un ruteador puede mantener el promedio y degradar justo los casos de mayor riesgo.
Después, ponlo en modo sombra una o dos semanas. El ruteador decide, pero la respuesta que llega al usuario sigue saliendo de la ruta actual. Así mides tres cosas con tráfico real: qué porcentaje bajaría de nivel, cuánto se ahorraría por transacción exitosa y en qué casos la ruta barata habría fallado.
Paso 5: mide el ruteo en producción
Una vez activo, agrega al tablero de FinOps y de SLOs cuatro indicadores:
- Distribución por nivel, para detectar cambios bruscos en la mezcla de tráfico.
- Tasa de escalamiento, porque si sube mucho el ahorro se evapora en dobles llamadas.
- Calidad por nivel, medida con la misma rúbrica y muestreo de auditoría que el resto del servicio.
- Costo por transacción exitosa por nivel, que es la prueba final de que el ruteo sí ahorra.
Ejemplo hipotético: mesa de ayuda de una aseguradora
Pensemos en un caso ilustrativo, no un cliente real. Una aseguradora mediana en México opera un asistente para agentes de venta que responde dudas sobre coberturas, estatus de pólizas y trámites. Todo pasa por un modelo grande.
El perfil de tráfico muestra que buena parte de las consultas son de estatus y requisitos de trámite, con respuesta en el sistema de pólizas o en un documento fijo. El equipo define tres rutas: estatus de póliza por consulta directa al sistema, sin modelo; requisitos de trámite con modelo compacto y documentos acotados; y dudas de cobertura o excepciones con el modelo grande. Las preguntas sobre siniestros quedan bloqueadas en el nivel 2.
Tras dos semanas en modo sombra, el golden set se mantiene en verde en todos los segmentos, la tasa de escalamiento es baja y estable, y el costo por transacción exitosa del servicio baja de forma clara. El equipo activa el ruteo por fases, empezando por la ruta sin modelo.
Errores comunes
- Medir el ahorro por llamada y no por transacción exitosa, ignorando reintentos y escalamientos.
- Validar solo con el promedio del golden set y no por segmento de riesgo.
- Dejar las reglas de ruteo fuera del control de versiones y de la bitácora de cambios.
- No tener un dueño que revise mensualmente la distribución de tráfico y las rutas bloqueadas.
Checklist para tu primer ruteador
- Perfil de tráfico con frecuencia, dificultad y costo del error por tipo de solicitud.
- Tres niveles definidos, con las rutas bloqueadas por escrito.
- Señal inicial basada en reglas de negocio y escalamiento por confianza.
- Interruptor de regreso al nivel 2 conectado al runbook de triage.
- Golden set por segmento y al menos una semana de modo sombra.
- Cuatro indicadores de ruteo en el tablero de FinOps y SLOs.
Cierre
El ruteo por complejidad convierte la curva costo-calidad en una decisión por solicitud: cada caso recibe el modelo que necesita y nada más. Bien hecho, baja el costo por transacción exitosa sin tocar el SLO de calidad. Si tu equipo quiere diseñar y validar un ruteador sobre un servicio de IA que ya está en producción, en Next Wave podemos ayudarte a dejarlo operando en pocas semanas.

Add comment