Startseite / Rang #2

Prompt Caching

Typische ErsparnisBis zu 90% Rabatt auf gecachte Input-Token
AufwandNiedrig — Prompts sortieren, ein Flag setzen

Prompt Caching verwendet den berechneten Zustand hinter einem wiederkehrenden Prompt-Präfix wieder (System-Prompt, Tool-Definitionen, lange Dokumente), sodass der statische Teil jedes Requests mit hohem Rabatt abgerechnet wird — bis zu 90% bei Anthropic mit expliziten Cache-Breakpoints und ~50% automatisch bei OpenAI.

Produktionsberichte landen typischerweise bei 50–80% Cache-Hit-Rate, sobald Prompts mit dem stabilen Inhalt zuerst und dem variablen Inhalt zuletzt strukturiert sind. Für Chat-Apps, Agenten und alles mit großem System-Prompt ist das der Eintages-Fix mit dem größten Hebel.

So setzen Sie es um

  1. Prompts umstrukturieren: stabiler Inhalt (System-Prompt, Tools, Referenzdokumente) zuerst, variabler Inhalt (User-Nachricht) zuletzt.
  2. Bei Anthropic cache_control-Breakpoints an den stabilen Blöcken setzen; bei OpenAI greift Caching automatisch für wiederholte Präfixe über 1024 Token.
  3. Das Präfix über alle Requests hinweg byte-identisch halten — jede Änderung oberhalb des Breakpoints invalidiert den Cache.
  4. Cache-Hit-Rate überwachen; unter ~50% steckt meist etwas Volatiles (Zeitstempel, Request-IDs) im Präfix.

Häufig gestellte Fragen

Verändert Caching die Modell-Ausgabe?

Nein. Prompt Caching verwendet Berechnungen für identische Input-Präfixe wieder; die Ausgaben bleiben unverändert. Es ist eine reine Kosten- und Latenz-Optimierung.

Wie lange leben die Caches?

Anbieterabhängig: Anthropic bietet TTLs von 5 Minuten und 1 Stunde, OpenAI-Caches halten typischerweise Minuten und verlängern sich bei Nutzung. Prompts mit viel Traffic bleiben von selbst warm.

Tools für diese Methode

Open-source LLM gateway

LiteLLM

The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …

Managed AI gateway

Portkey

Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…

Nächste Methode: #3 Model Routing & Kaskaden