Inicio / Puesto #7

Higiene del contexto y gestión de tokens

Ahorro típico30–50% del gasto en tokens de entrada
EsfuerzoMedio — disciplina continua

Los historiales de chat crecen sin límite, los pipelines RAG meten 20 fragmentos donde bastarían 3, y los agentes arrastran salidas completas de herramientas por cada turno posterior. La hinchazón del lado de entrada es la mitad silenciosa de la mayoría de las facturas de IA.

Los historiales con ventana deslizante y resumen periódico, la recuperación con reranking que conserva solo los mejores fragmentos, y el truncado de salidas de herramientas recuperan rutinariamente 30–50% del gasto de entrada — y normalmente mejoran la calidad de las respuestas, porque el modelo ve menos ruido.

Cómo hacerlo

  1. Limita el historial de conversación; resume los turnos antiguos en un estado compacto en lugar de reproducirlos.
  2. Añade un reranker a la recuperación y reduce los fragmentos pasados al mínimo que preserve la calidad de la respuesta.
  3. Trunca o resume las salidas de herramientas antes de que entren al contexto.
  4. Registra los tokens por solicitud por funcionalidad; alerta ante desviaciones.

Preguntas frecuentes

¿Recortar el contexto perjudicará la calidad?

Normalmente es al revés — los modelos se distraen con contexto irrelevante ("perdidos en el medio"). Un recorte medido con evaluaciones tiende a mejorar tanto el costo como la precisión.

Herramientas para este método

Context & memory layer

Mitosis Cortex

The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…

LLM observability & cost tracking

Helicone

Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…

Siguiente método: #8 Atribución de costos y FinOps de IA