# Hygiène du contexte et gestion des tokens

> Cut My AI Spend — rank #7 of 10. Économies typiques: 30–50% de la dépense en tokens d'entrée. Effort: Moyen — une discipline continue.

Les historiques de chat grossissent sans limite, les pipelines RAG entassent 20 chunks là où 3 suffiraient, et les agents traînent les sorties d'outils complètes à chaque tour suivant. Le gonflement côté entrée est la moitié silencieuse de la plupart des factures d'IA.
Historiques en fenêtre glissante avec résumé périodique, récupération re-classée qui ne garde que les meilleurs chunks, et troncature des sorties d'outils récupèrent régulièrement 30–50% de la dépense en entrée — et améliorent en général la qualité des réponses, car le modèle voit moins de bruit.

## Comment faire

1. Plafonnez l'historique de conversation ; résumez les tours anciens dans un état compact au lieu de les rejouer.
2. Ajoutez un reranker à la récupération et réduisez les chunks transmis au minimum qui préserve la qualité des réponses.
3. Tronquez ou résumez les sorties d'outils avant qu'elles n'entrent dans le contexte.
4. Journalisez les tokens par requête pour chaque fonctionnalité ; alertez en cas de dérive.

## Questions fréquentes

### Réduire le contexte va-t-il nuire à la qualité ?

Généralement c'est l'inverse — les modèles se laissent distraire par le contexte non pertinent (« lost in the middle »). Un élagage mesuré, validé par des évaluations, tend à améliorer à la fois le coût et la précision.


---
Canonical: https://cutmyaispend.com/fr/methods/context-hygiene
All methods: https://cutmyaispend.com/fr | JSON: https://cutmyaispend.com/api/methods.json