# モデルルーティングとカスケード

> Cut My AI Spend — rank #3 of 10. 想定削減率: ワークロード構成により40〜98%. 導入コスト: 中 — ルーティングロジックと評価が必要.

ほとんどのリクエストに最高価格のモデルは不要です。ルーティングは、簡単なクエリを安価なモデル（Haiku、GPT-miniクラス、Nova）に送り、本当に必要なリクエストにだけフロンティアモデルを使います。カスケード設計では、まず安価なモデルで試し、失敗した場合のみ上位モデルにエスカレーションします。
StanfordのFrugalGPT型カスケード研究では、品質を維持したまま最大98%のコスト削減が実証されており、本番チームもリクエストの複雑さを事前分類することで40〜70%の削減を日常的に報告しています。注意点は、判定手段（分類器、ヒューリスティクス、信頼度チェック）と、品質が維持されたことを証明する評価が必要なことです。

## 実践手順

1. トラフィックをタスク種別で分類し、小型モデルで十分こなせるセグメントをラベル付けします。
2. ルーターを追加します：ヒューリスティックルール、小型の分類モデル、またはルーティング機能内蔵のLLMゲートウェイです。
3. カスケードでは、エスカレーションを発動させる合格判定（スキーマ妥当性、信頼度、ジャッジモデル）を定義します。
4. セグメントごとに導入前後のA/B評価を行い、静かに進行する品質低下を監視します。

## よくある質問

### ルーティングとカスケードの違いは何ですか？

ルーティングは、リクエスト内容に基づいて呼び出し前にモデルを決定します。カスケードは、まず安価なモデルを呼び出し、回答がチェックに不合格の場合のみ上位モデルにエスカレーションします。カスケードの方が削減幅は大きいものの、エスカレーション時にレイテンシが増えます。


---
Canonical: https://cutmyaispend.com/ja/methods/model-routing
All methods: https://cutmyaispend.com/ja | JSON: https://cutmyaispend.com/api/methods.json