# コンテキスト管理とトークン節約

> Cut My AI Spend — rank #7 of 10. 想定削減率: 入力トークン費用の30〜50%. 導入コスト: 中 — 継続的な運用規律が必要.

チャット履歴は際限なく膨らみ、RAGパイプラインは3チャンクで足りるところに20チャンクを詰め込み、エージェントはツール出力の全文を以降のすべてのターンに引きずり続けます。入力側の肥大化は、AI請求額の「静かな半分」です。
定期的な要約を伴うスライディングウィンドウ履歴、上位数チャンクだけを残すリランキング付き検索、ツール出力の切り詰めにより、入力費用の30〜50%を取り戻せるのが通例です — しかも、モデルが目にするノイズが減るため、回答品質はむしろ向上することが多いのです。

## 実践手順

1. 会話履歴に上限を設け、古いターンはそのまま再生せず、コンパクトな状態に要約します。
2. 検索にリランカーを追加し、回答品質を保てる最小限までチャンク数を絞ります。
3. ツール出力はコンテキストに入る前に切り詰めるか要約します。
4. 機能ごとにリクエストあたりトークン数をログに記録し、増加傾向にアラートを設定します。

## よくある質問

### コンテキストを削ると品質が下がりませんか？

むしろ逆であることがほとんどです。モデルは無関係なコンテキストに気を取られます（いわゆる「lost in the middle」問題）。評価を伴う計画的な削減は、コストと精度の両方を改善する傾向にあります。


---
Canonical: https://cutmyaispend.com/ja/methods/context-hygiene
All methods: https://cutmyaispend.com/ja | JSON: https://cutmyaispend.com/api/methods.json