# Higiene del contexto y gestión de tokens

> Cut My AI Spend — rank #7 of 10. Ahorro típico: 30–50% del gasto en tokens de entrada. Esfuerzo: Medio — disciplina continua.

Los historiales de chat crecen sin límite, los pipelines RAG meten 20 fragmentos donde bastarían 3, y los agentes arrastran salidas completas de herramientas por cada turno posterior. La hinchazón del lado de entrada es la mitad silenciosa de la mayoría de las facturas de IA.
Los historiales con ventana deslizante y resumen periódico, la recuperación con reranking que conserva solo los mejores fragmentos, y el truncado de salidas de herramientas recuperan rutinariamente 30–50% del gasto de entrada — y normalmente mejoran la calidad de las respuestas, porque el modelo ve menos ruido.

## Cómo hacerlo

1. Limita el historial de conversación; resume los turnos antiguos en un estado compacto en lugar de reproducirlos.
2. Añade un reranker a la recuperación y reduce los fragmentos pasados al mínimo que preserve la calidad de la respuesta.
3. Trunca o resume las salidas de herramientas antes de que entren al contexto.
4. Registra los tokens por solicitud por funcionalidad; alerta ante desviaciones.

## Preguntas frecuentes

### ¿Recortar el contexto perjudicará la calidad?

Normalmente es al revés — los modelos se distraen con contexto irrelevante ("perdidos en el medio"). Un recorte medido con evaluaciones tiende a mejorar tanto el costo como la precisión.


---
Canonical: https://cutmyaispend.com/es/methods/context-hygiene
All methods: https://cutmyaispend.com/es | JSON: https://cutmyaispend.com/api/methods.json