# Higiene de contexto e gestão de tokens

> Cut My AI Spend — rank #7 of 10. Economia típica: 30–50% do gasto com tokens de entrada. Esforço: Médio — disciplina contínua.

Históricos de chat crescem sem limite, pipelines de RAG empilham 20 chunks onde 3 bastariam, e agentes arrastam saídas completas de ferramentas por todos os turnos seguintes. O inchaço do lado da entrada é a metade silenciosa da maioria das faturas de IA.
Históricos com janela deslizante e resumo periódico, recuperação com reranking que mantém só os melhores chunks e truncamento de saídas de ferramentas recuperam rotineiramente 30–50% do gasto de entrada — e geralmente melhoram a qualidade das respostas, porque o modelo vê menos ruído.

## Como fazer

1. Limite o histórico de conversa; resuma os turnos antigos em um estado compacto em vez de repeti-los.
2. Adicione um reranker à recuperação e reduza os chunks passados ao mínimo que preserve a qualidade da resposta.
3. Trunque ou resuma as saídas de ferramentas antes de entrarem no contexto.
4. Registre tokens por requisição por funcionalidade; alerte sobre desvios.

## Perguntas frequentes

### Cortar contexto vai prejudicar a qualidade?

Geralmente é o contrário — os modelos se distraem com contexto irrelevante ("lost in the middle"). Cortes medidos com avaliações tendem a melhorar tanto o custo quanto a precisão.


---
Canonical: https://cutmyaispend.com/pt/methods/context-hygiene
All methods: https://cutmyaispend.com/pt | JSON: https://cutmyaispend.com/api/methods.json