Startseite / Rang #2
Prompt Caching
Prompt Caching verwendet den berechneten Zustand hinter einem wiederkehrenden Prompt-Präfix wieder (System-Prompt, Tool-Definitionen, lange Dokumente), sodass der statische Teil jedes Requests mit hohem Rabatt abgerechnet wird — bis zu 90% bei Anthropic mit expliziten Cache-Breakpoints und ~50% automatisch bei OpenAI.
Produktionsberichte landen typischerweise bei 50–80% Cache-Hit-Rate, sobald Prompts mit dem stabilen Inhalt zuerst und dem variablen Inhalt zuletzt strukturiert sind. Für Chat-Apps, Agenten und alles mit großem System-Prompt ist das der Eintages-Fix mit dem größten Hebel.
So setzen Sie es um
- Prompts umstrukturieren: stabiler Inhalt (System-Prompt, Tools, Referenzdokumente) zuerst, variabler Inhalt (User-Nachricht) zuletzt.
- Bei Anthropic cache_control-Breakpoints an den stabilen Blöcken setzen; bei OpenAI greift Caching automatisch für wiederholte Präfixe über 1024 Token.
- Das Präfix über alle Requests hinweg byte-identisch halten — jede Änderung oberhalb des Breakpoints invalidiert den Cache.
- Cache-Hit-Rate überwachen; unter ~50% steckt meist etwas Volatiles (Zeitstempel, Request-IDs) im Präfix.
Häufig gestellte Fragen
Verändert Caching die Modell-Ausgabe?
Nein. Prompt Caching verwendet Berechnungen für identische Input-Präfixe wieder; die Ausgaben bleiben unverändert. Es ist eine reine Kosten- und Latenz-Optimierung.
Wie lange leben die Caches?
Anbieterabhängig: Anthropic bietet TTLs von 5 Minuten und 1 Stunde, OpenAI-Caches halten typischerweise Minuten und verlängern sich bei Nutzung. Prompts mit viel Traffic bleiben von selbst warm.
Tools für diese Methode
LiteLLM
The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …
Portkey
Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…
Nächste Methode: #3 Model Routing & Kaskaden