Início / Posição #7
Higiene de contexto e gestão de tokens
Históricos de chat crescem sem limite, pipelines de RAG empilham 20 chunks onde 3 bastariam, e agentes arrastam saídas completas de ferramentas por todos os turnos seguintes. O inchaço do lado da entrada é a metade silenciosa da maioria das faturas de IA.
Históricos com janela deslizante e resumo periódico, recuperação com reranking que mantém só os melhores chunks e truncamento de saídas de ferramentas recuperam rotineiramente 30–50% do gasto de entrada — e geralmente melhoram a qualidade das respostas, porque o modelo vê menos ruído.
Como fazer
- Limite o histórico de conversa; resuma os turnos antigos em um estado compacto em vez de repeti-los.
- Adicione um reranker à recuperação e reduza os chunks passados ao mínimo que preserve a qualidade da resposta.
- Trunque ou resuma as saídas de ferramentas antes de entrarem no contexto.
- Registre tokens por requisição por funcionalidade; alerte sobre desvios.
Perguntas frequentes
Cortar contexto vai prejudicar a qualidade?
Geralmente é o contrário — os modelos se distraem com contexto irrelevante ("lost in the middle"). Cortes medidos com avaliações tendem a melhorar tanto o custo quanto a precisão.
Ferramentas para este método
Mitosis Cortex
The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…
Helicone
Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…
Próximo método: #8 Atribuição de custos e FinOps de IA