ホーム / 順位 #5

バッチAPI

想定削減率主要プロバイダで一律50%オフ
導入コスト低 — 非同期処理を許容できるワークロードなら

OpenAI、Anthropic、Googleはいずれも、非同期処理と引き換えに約50%オフのバッチエンドポイントを提供しています(通常は24時間以内、多くはそれよりはるかに速く完了します)。リアルタイム応答が不要なワークロード — データエンリッチメント、分類、埋め込みのバックフィル、評価、レポート生成など — を同期APIで実行しているなら、みすみすお金を捨てているのと同じです。

実践手順

  1. どのジョブが本当にレイテンシに敏感かを棚卸しします。ほとんどのパイプラインはそうではありません。
  2. オフラインジョブをプロバイダのバッチエンドポイント(JSONL入力、JSONL出力)に移行します。
  3. キャッシュと併用します。プレフィックスを共有するバッチ入力は、一部のプロバイダでプロンプトキャッシュ割引の恩恵も受けられます。

よくある質問

バッチはどれくらいの速さで完了しますか?

プロバイダは24時間以内の完了を保証していますが、負荷にもよるものの、通常は数分から数時間で完了します。設計は保証値ベースで行い、通常時の速さは恩恵として享受しましょう。

この手法に使えるツール

Open-source LLM gateway

LiteLLM

The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …

次の手法: #6 出力長のコントロール