Accueil / Rang #4
Caching sémantique
Les caches à correspondance exacte ratent les paraphrases. Le caching sémantique vectorise (embed) les requêtes entrantes et sert une réponse déjà stockée quand une nouvelle requête est suffisamment similaire à une précédente — éliminant 30–70% des appels API redondants sur les charges où les utilisateurs posent les mêmes questions avec des mots différents (support, recherche, trafic type FAQ).
C'est l'étape naturelle après le prompt caching : le prompt caching applique une remise sur les préfixes répétés, le caching sémantique évite carrément l'appel au modèle.
Comment faire
- Vectorisez chaque requête ; stockez les paires (embedding, réponse) dans une base vectorielle.
- Servez les réponses en cache au-dessus d'un seuil de similarité ajusté ; démarrez prudemment (~0,95) et assouplissez avec du monitoring.
- Cloisonnez les caches par utilisateur ou par tenant quand les réponses dépendent d'un contexte privé.
- Fixez des TTL alignés sur la vitesse à laquelle les faits sous-jacents changent.
Questions fréquentes
Quand le caching sémantique est-il une mauvaise idée ?
Quand les réponses sont personnalisées, sensibles au temps ou à fort enjeu. Une réponse en cache périmée ou subtilement fausse coûte plus cher que les tokens économisés. Cloisonnez et gérez les TTL avec soin.
Outils pour cette méthode
LiteLLM
The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …
Portkey
Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…
Méthode suivante: #5 API batch (traitement par lots)