# Caching sémantique

> Cut My AI Spend — rank #4 of 10. Économies typiques: 30–70% des appels redondants éliminés. Effort: Moyen — base d'embeddings + seuil de similarité.

Les caches à correspondance exacte ratent les paraphrases. Le caching sémantique vectorise (embed) les requêtes entrantes et sert une réponse déjà stockée quand une nouvelle requête est suffisamment similaire à une précédente — éliminant 30–70% des appels API redondants sur les charges où les utilisateurs posent les mêmes questions avec des mots différents (support, recherche, trafic type FAQ).
C'est l'étape naturelle après le prompt caching : le prompt caching applique une remise sur les préfixes répétés, le caching sémantique évite carrément l'appel au modèle.

## Comment faire

1. Vectorisez chaque requête ; stockez les paires (embedding, réponse) dans une base vectorielle.
2. Servez les réponses en cache au-dessus d'un seuil de similarité ajusté ; démarrez prudemment (~0,95) et assouplissez avec du monitoring.
3. Cloisonnez les caches par utilisateur ou par tenant quand les réponses dépendent d'un contexte privé.
4. Fixez des TTL alignés sur la vitesse à laquelle les faits sous-jacents changent.

## Questions fréquentes

### Quand le caching sémantique est-il une mauvaise idée ?

Quand les réponses sont personnalisées, sensibles au temps ou à fort enjeu. Une réponse en cache périmée ou subtilement fausse coûte plus cher que les tokens économisés. Cloisonnez et gérez les TTL avec soin.


---
Canonical: https://cutmyaispend.com/fr/methods/semantic-caching
All methods: https://cutmyaispend.com/fr | JSON: https://cutmyaispend.com/api/methods.json