# Enrutamiento de modelos y cascadas

> Cut My AI Spend — rank #3 of 10. Ahorro típico: 40–98% según la mezcla de cargas de trabajo. Esfuerzo: Medio — requiere lógica de enrutamiento y evaluaciones.

La mayoría de las solicitudes no necesitan tu modelo más caro. El enrutamiento envía las consultas simples a modelos baratos (Haiku, clase GPT-mini, Nova) y reserva los modelos frontera para las solicitudes que de verdad los necesitan; los diseños en cascada prueban primero el modelo barato y escalan solo si falla.
La investigación de cascadas tipo FrugalGPT de Stanford demostró hasta 98% de reducción de costos con calidad equivalente, y los equipos en producción reportan rutinariamente 40–70% al clasificar la complejidad de la solicitud por adelantado. El detalle: necesitas una forma de decidir (un clasificador, heurísticas o verificaciones de confianza) y evaluaciones que demuestren que la calidad se mantuvo.

## Cómo hacerlo

1. Segmenta el tráfico por tipo de tarea; identifica qué segmentos ya maneja bien un modelo pequeño.
2. Añade un enrutador: reglas heurísticas, un modelo clasificador pequeño, o un gateway LLM con enrutamiento incorporado.
3. Para cascadas, define una verificación de aceptación (validez de esquema, confianza, modelo juez) que dispare la escalada.
4. Ejecuta evaluaciones A/B por segmento antes y después; vigila las regresiones silenciosas de calidad.

## Preguntas frecuentes

### ¿Cuál es la diferencia entre enrutamiento y cascada?

El enrutamiento decide el modelo antes de la llamada según la solicitud. Una cascada llama primero al modelo barato y escala a uno más potente solo cuando la respuesta falla una verificación. Las cascadas ahorran más pero añaden latencia en las solicitudes escaladas.


---
Canonical: https://cutmyaispend.com/es/methods/model-routing
All methods: https://cutmyaispend.com/es | JSON: https://cutmyaispend.com/api/methods.json