Início / Posição #7

Higiene de contexto e gestão de tokens

Economia típica30–50% do gasto com tokens de entrada
EsforçoMédio — disciplina contínua

Históricos de chat crescem sem limite, pipelines de RAG empilham 20 chunks onde 3 bastariam, e agentes arrastam saídas completas de ferramentas por todos os turnos seguintes. O inchaço do lado da entrada é a metade silenciosa da maioria das faturas de IA.

Históricos com janela deslizante e resumo periódico, recuperação com reranking que mantém só os melhores chunks e truncamento de saídas de ferramentas recuperam rotineiramente 30–50% do gasto de entrada — e geralmente melhoram a qualidade das respostas, porque o modelo vê menos ruído.

Como fazer

  1. Limite o histórico de conversa; resuma os turnos antigos em um estado compacto em vez de repeti-los.
  2. Adicione um reranker à recuperação e reduza os chunks passados ao mínimo que preserve a qualidade da resposta.
  3. Trunque ou resuma as saídas de ferramentas antes de entrarem no contexto.
  4. Registre tokens por requisição por funcionalidade; alerte sobre desvios.

Perguntas frequentes

Cortar contexto vai prejudicar a qualidade?

Geralmente é o contrário — os modelos se distraem com contexto irrelevante ("lost in the middle"). Cortes medidos com avaliações tendem a melhorar tanto o custo quanto a precisão.

Ferramentas para este método

Context & memory layer

Mitosis Cortex

The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…

LLM observability & cost tracking

Helicone

Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…

Próximo método: #8 Atribuição de custos e FinOps de IA