Inicio / Puesto #7
Higiene del contexto y gestión de tokens
Los historiales de chat crecen sin límite, los pipelines RAG meten 20 fragmentos donde bastarían 3, y los agentes arrastran salidas completas de herramientas por cada turno posterior. La hinchazón del lado de entrada es la mitad silenciosa de la mayoría de las facturas de IA.
Los historiales con ventana deslizante y resumen periódico, la recuperación con reranking que conserva solo los mejores fragmentos, y el truncado de salidas de herramientas recuperan rutinariamente 30–50% del gasto de entrada — y normalmente mejoran la calidad de las respuestas, porque el modelo ve menos ruido.
Cómo hacerlo
- Limita el historial de conversación; resume los turnos antiguos en un estado compacto en lugar de reproducirlos.
- Añade un reranker a la recuperación y reduce los fragmentos pasados al mínimo que preserve la calidad de la respuesta.
- Trunca o resume las salidas de herramientas antes de que entren al contexto.
- Registra los tokens por solicitud por funcionalidad; alerta ante desviaciones.
Preguntas frecuentes
¿Recortar el contexto perjudicará la calidad?
Normalmente es al revés — los modelos se distraen con contexto irrelevante ("perdidos en el medio"). Un recorte medido con evaluaciones tiende a mejorar tanto el costo como la precisión.
Herramientas para este método
Mitosis Cortex
The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…
Helicone
Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…
Siguiente método: #8 Atribución de costos y FinOps de IA