ホーム / 順位 #7
コンテキスト管理とトークン節約
想定削減率入力トークン費用の30〜50%
導入コスト中 — 継続的な運用規律が必要
チャット履歴は際限なく膨らみ、RAGパイプラインは3チャンクで足りるところに20チャンクを詰め込み、エージェントはツール出力の全文を以降のすべてのターンに引きずり続けます。入力側の肥大化は、AI請求額の「静かな半分」です。
定期的な要約を伴うスライディングウィンドウ履歴、上位数チャンクだけを残すリランキング付き検索、ツール出力の切り詰めにより、入力費用の30〜50%を取り戻せるのが通例です — しかも、モデルが目にするノイズが減るため、回答品質はむしろ向上することが多いのです。
実践手順
- 会話履歴に上限を設け、古いターンはそのまま再生せず、コンパクトな状態に要約します。
- 検索にリランカーを追加し、回答品質を保てる最小限までチャンク数を絞ります。
- ツール出力はコンテキストに入る前に切り詰めるか要約します。
- 機能ごとにリクエストあたりトークン数をログに記録し、増加傾向にアラートを設定します。
よくある質問
コンテキストを削ると品質が下がりませんか?
むしろ逆であることがほとんどです。モデルは無関係なコンテキストに気を取られます(いわゆる「lost in the middle」問題)。評価を伴う計画的な削減は、コストと精度の両方を改善する傾向にあります。
この手法に使えるツール
Context & memory layer
Mitosis Cortex
The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…
LLM observability & cost tracking
Helicone
Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…
次の手法: #8 コスト配賦とAI FinOps