Accueil / Rang #2

Prompt caching (mise en cache des prompts)

Économies typiquesJusqu'à 90% de remise sur les tokens d'entrée en cache
EffortFaible — ordonnez vos prompts, activez une option

Le prompt caching réutilise l'état calculé derrière un préfixe de prompt répété (prompt système, définitions d'outils, longs documents), si bien que la partie statique de chaque requête est facturée avec une forte remise — jusqu'à 90% chez Anthropic avec des points de cache explicites, et ~50% automatiquement chez OpenAI.

Les retours de production se situent couramment entre 50 et 80% de taux de cache-hit une fois les prompts structurés avec le contenu stable en premier et le contenu variable en dernier. Pour les applications de chat, les agents et tout ce qui embarque un gros prompt système, c'est le correctif à plus fort levier réalisable en une journée.

Comment faire

  1. Restructurez vos prompts : contenu stable (prompt système, outils, documents de référence) en premier, contenu variable (message utilisateur) en dernier.
  2. Chez Anthropic, ajoutez des points de rupture cache_control sur les blocs stables ; chez OpenAI, le caching s'applique automatiquement aux préfixes répétés de plus de 1024 tokens.
  3. Gardez le préfixe identique à l'octet près d'une requête à l'autre — tout changement au-dessus du point de rupture invalide le cache.
  4. Suivez votre taux de cache-hit ; en dessous de ~50%, c'est généralement qu'un élément volatil (horodatages, identifiants de requête) fuit dans le préfixe.

Questions fréquentes

Le caching change-t-il la sortie du modèle ?

Non. Le prompt caching réutilise le calcul pour des préfixes d'entrée identiques ; les sorties ne sont pas affectées. C'est purement une optimisation de facturation et de latence.

Combien de temps les caches restent-ils actifs ?

Cela dépend du fournisseur : Anthropic propose des TTL de 5 minutes et 1 heure, les caches OpenAI persistent en général plusieurs minutes et se prolongent tant qu'ils sont utilisés. Les prompts à fort trafic restent chauds tout seuls.

Outils pour cette méthode

Open-source LLM gateway

LiteLLM

The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …

Managed AI gateway

Portkey

Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…

Méthode suivante: #3 Routage de modèles et cascades