# Prompt caching (mise en cache des prompts)

> Cut My AI Spend — rank #2 of 10. Économies typiques: Jusqu'à 90% de remise sur les tokens d'entrée en cache. Effort: Faible — ordonnez vos prompts, activez une option.

Le prompt caching réutilise l'état calculé derrière un préfixe de prompt répété (prompt système, définitions d'outils, longs documents), si bien que la partie statique de chaque requête est facturée avec une forte remise — jusqu'à 90% chez Anthropic avec des points de cache explicites, et ~50% automatiquement chez OpenAI.
Les retours de production se situent couramment entre 50 et 80% de taux de cache-hit une fois les prompts structurés avec le contenu stable en premier et le contenu variable en dernier. Pour les applications de chat, les agents et tout ce qui embarque un gros prompt système, c'est le correctif à plus fort levier réalisable en une journée.

## Comment faire

1. Restructurez vos prompts : contenu stable (prompt système, outils, documents de référence) en premier, contenu variable (message utilisateur) en dernier.
2. Chez Anthropic, ajoutez des points de rupture cache_control sur les blocs stables ; chez OpenAI, le caching s'applique automatiquement aux préfixes répétés de plus de 1024 tokens.
3. Gardez le préfixe identique à l'octet près d'une requête à l'autre — tout changement au-dessus du point de rupture invalide le cache.
4. Suivez votre taux de cache-hit ; en dessous de ~50%, c'est généralement qu'un élément volatil (horodatages, identifiants de requête) fuit dans le préfixe.

## Questions fréquentes

### Le caching change-t-il la sortie du modèle ?

Non. Le prompt caching réutilise le calcul pour des préfixes d'entrée identiques ; les sorties ne sont pas affectées. C'est purement une optimisation de facturation et de latence.

### Combien de temps les caches restent-ils actifs ?

Cela dépend du fournisseur : Anthropic propose des TTL de 5 minutes et 1 heure, les caches OpenAI persistent en général plusieurs minutes et se prolongent tant qu'ils sont utilisés. Les prompts à fort trafic restent chauds tout seuls.


---
Canonical: https://cutmyaispend.com/fr/methods/prompt-caching
All methods: https://cutmyaispend.com/fr | JSON: https://cutmyaispend.com/api/methods.json