Accueil / Rang #7
Hygiène du contexte et gestion des tokens
Les historiques de chat grossissent sans limite, les pipelines RAG entassent 20 chunks là où 3 suffiraient, et les agents traînent les sorties d'outils complètes à chaque tour suivant. Le gonflement côté entrée est la moitié silencieuse de la plupart des factures d'IA.
Historiques en fenêtre glissante avec résumé périodique, récupération re-classée qui ne garde que les meilleurs chunks, et troncature des sorties d'outils récupèrent régulièrement 30–50% de la dépense en entrée — et améliorent en général la qualité des réponses, car le modèle voit moins de bruit.
Comment faire
- Plafonnez l'historique de conversation ; résumez les tours anciens dans un état compact au lieu de les rejouer.
- Ajoutez un reranker à la récupération et réduisez les chunks transmis au minimum qui préserve la qualité des réponses.
- Tronquez ou résumez les sorties d'outils avant qu'elles n'entrent dans le contexte.
- Journalisez les tokens par requête pour chaque fonctionnalité ; alertez en cas de dérive.
Questions fréquentes
Réduire le contexte va-t-il nuire à la qualité ?
Généralement c'est l'inverse — les modèles se laissent distraire par le contexte non pertinent (« lost in the middle »). Un élagage mesuré, validé par des évaluations, tend à améliorer à la fois le coût et la précision.
Outils pour cette méthode
Mitosis Cortex
The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…
Helicone
Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…
Méthode suivante: #8 Attribution des coûts et FinOps de l'IA