ホーム / 順位 #7

コンテキスト管理とトークン節約

想定削減率入力トークン費用の30〜50%
導入コスト中 — 継続的な運用規律が必要

チャット履歴は際限なく膨らみ、RAGパイプラインは3チャンクで足りるところに20チャンクを詰め込み、エージェントはツール出力の全文を以降のすべてのターンに引きずり続けます。入力側の肥大化は、AI請求額の「静かな半分」です。

定期的な要約を伴うスライディングウィンドウ履歴、上位数チャンクだけを残すリランキング付き検索、ツール出力の切り詰めにより、入力費用の30〜50%を取り戻せるのが通例です — しかも、モデルが目にするノイズが減るため、回答品質はむしろ向上することが多いのです。

実践手順

  1. 会話履歴に上限を設け、古いターンはそのまま再生せず、コンパクトな状態に要約します。
  2. 検索にリランカーを追加し、回答品質を保てる最小限までチャンク数を絞ります。
  3. ツール出力はコンテキストに入る前に切り詰めるか要約します。
  4. 機能ごとにリクエストあたりトークン数をログに記録し、増加傾向にアラートを設定します。

よくある質問

コンテキストを削ると品質が下がりませんか?

むしろ逆であることがほとんどです。モデルは無関係なコンテキストに気を取られます(いわゆる「lost in the middle」問題)。評価を伴う計画的な削減は、コストと精度の両方を改善する傾向にあります。

この手法に使えるツール

Context & memory layer

Mitosis Cortex

The cut-spend-at-the-source option: a persistent memory graph over your email, docs, chats, and tools that agents query instead of…

LLM observability & cost tracking

Helicone

Long the default open-source LLM cost dashboard. Acquired by Mintlify in March 2026 and now maintenance-only — existing deployment…

次の手法: #8 コスト配賦とAI FinOps