Inicio / Puesto #3
Enrutamiento de modelos y cascadas
La mayoría de las solicitudes no necesitan tu modelo más caro. El enrutamiento envía las consultas simples a modelos baratos (Haiku, clase GPT-mini, Nova) y reserva los modelos frontera para las solicitudes que de verdad los necesitan; los diseños en cascada prueban primero el modelo barato y escalan solo si falla.
La investigación de cascadas tipo FrugalGPT de Stanford demostró hasta 98% de reducción de costos con calidad equivalente, y los equipos en producción reportan rutinariamente 40–70% al clasificar la complejidad de la solicitud por adelantado. El detalle: necesitas una forma de decidir (un clasificador, heurísticas o verificaciones de confianza) y evaluaciones que demuestren que la calidad se mantuvo.
Cómo hacerlo
- Segmenta el tráfico por tipo de tarea; identifica qué segmentos ya maneja bien un modelo pequeño.
- Añade un enrutador: reglas heurísticas, un modelo clasificador pequeño, o un gateway LLM con enrutamiento incorporado.
- Para cascadas, define una verificación de aceptación (validez de esquema, confianza, modelo juez) que dispare la escalada.
- Ejecuta evaluaciones A/B por segmento antes y después; vigila las regresiones silenciosas de calidad.
Preguntas frecuentes
¿Cuál es la diferencia entre enrutamiento y cascada?
El enrutamiento decide el modelo antes de la llamada según la solicitud. Una cascada llama primero al modelo barato y escala a uno más potente solo cuando la respuesta falla una verificación. Las cascadas ahorran más pero añaden latencia en las solicitudes escaladas.
Herramientas para este método
LiteLLM
The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …
Portkey
Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…
OpenRouter
One API and one bill across hundreds of models from every major lab — the fastest way to arbitrage the model price war and A/B che…
Siguiente método: #4 Caché semántico