ホーム / 順位 #2

プロンプトキャッシュ

想定削減率キャッシュ済み入力トークンが最大90%オフ
導入コスト低 — プロンプトを並べ替えてフラグを立てるだけ

プロンプトキャッシュは、繰り返し使われるプロンプトの先頭部分(システムプロンプト、ツール定義、長文ドキュメント)の計算結果を再利用する仕組みです。これにより、リクエストの固定部分が大幅割引で課金されます — Anthropicでは明示的なキャッシュブレークポイントで最大90%オフ、OpenAIでは自動適用で約50%オフです。

固定コンテンツを先頭に、可変コンテンツを末尾に配置するようプロンプトを構造化すれば、本番環境ではキャッシュヒット率50〜80%が一般的です。チャットアプリ、エージェント、大きなシステムプロンプトを持つあらゆる用途において、1日で実装できる施策としては最もレバレッジが高い手法です。

実践手順

  1. プロンプトを再構成します:固定コンテンツ(システムプロンプト、ツール、参照ドキュメント)を先頭に、可変コンテンツ(ユーザーメッセージ)を末尾に配置します。
  2. Anthropicでは固定ブロックにcache_controlブレークポイントを追加します。OpenAIでは1024トークンを超える繰り返しプレフィックスに自動的にキャッシュが適用されます。
  3. プレフィックスはリクエスト間でバイト単位で同一に保ちます — ブレークポイントより上を1文字でも変えるとキャッシュが無効化されます。
  4. キャッシュヒット率を監視します。約50%を下回る場合、タイムスタンプやリクエストIDなどの可変要素がプレフィックスに混入しているのが典型的な原因です。

よくある質問

キャッシュを使うとモデルの出力は変わりますか?

いいえ。プロンプトキャッシュは同一の入力プレフィックスに対する計算を再利用するだけで、出力には一切影響しません。純粋に課金とレイテンシの最適化です。

キャッシュはどれくらいの期間有効ですか?

プロバイダによります。Anthropicは5分と1時間のTTLを提供し、OpenAIのキャッシュは通常数分間持続し、使用中は延長されます。トラフィックの多いプロンプトは自然にホットな状態が維持されます。

この手法に使えるツール

Open-source LLM gateway

LiteLLM

The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …

Managed AI gateway

Portkey

Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…

次の手法: #3 モデルルーティングとカスケード