Accueil / Rang #7

Hygiène du contexte et gestion des tokens

Économies typiques30–50% de la dépense en tokens d'entrée
EffortMoyen — une discipline continue

Les historiques de chat grossissent sans limite, les pipelines RAG entassent 20 chunks là où 3 suffiraient, et les agents traînent les sorties d'outils complètes à chaque tour suivant. Le gonflement côté entrée est la moitié silencieuse de la plupart des factures d'IA.

Historiques en fenêtre glissante avec résumé périodique, récupération re-classée qui ne garde que les meilleurs chunks, et troncature des sorties d'outils récupèrent régulièrement 30–50% de la dépense en entrée — et améliorent en général la qualité des réponses, car le modèle voit moins de bruit.

Comment faire

  1. Plafonnez l'historique de conversation ; résumez les tours anciens dans un état compact au lieu de les rejouer.
  2. Ajoutez un reranker à la récupération et réduisez les chunks transmis au minimum qui préserve la qualité des réponses.
  3. Tronquez ou résumez les sorties d'outils avant qu'elles n'entrent dans le contexte.
  4. Journalisez les tokens par requête pour chaque fonctionnalité ; alertez en cas de dérive.

Questions fréquentes

Réduire le contexte va-t-il nuire à la qualité ?

Généralement c'est l'inverse — les modèles se laissent distraire par le contexte non pertinent (« lost in the middle »). Un élagage mesuré, validé par des évaluations, tend à améliorer à la fois le coût et la précision.

Outils pour cette méthode

Context & memory layer

Mitosis Cortex

The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…

LLM observability & cost tracking

Helicone

Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…

Méthode suivante: #8 Attribution des coûts et FinOps de l'IA