Startseite / Rang #5
Batch-APIs
OpenAI, Anthropic und Google bieten alle Batch-Endpunkte mit rund 50% Rabatt im Tausch gegen asynchrone Verarbeitung (typischerweise deutlich innerhalb von 24 Stunden abgeschlossen, oft viel schneller). Jeder Workload, der nicht nutzerseitig in Echtzeit laufen muss — Anreicherung, Klassifikation, Embedding-Backfills, Evals, Report-Generierung — verschenkt Geld, wenn er über die synchrone API läuft.
So setzen Sie es um
- Prüfen, welche Jobs wirklich latenzkritisch sind; die meisten Pipelines sind es nicht.
- Offline-Jobs auf den Batch-Endpunkt des Anbieters umziehen (JSONL rein, JSONL raus).
- Mit Caching kombinieren: Batch-Inputs mit gemeinsamem Präfix profitieren bei manchen Anbietern zusätzlich vom Prompt-Cache-Rabatt.
Häufig gestellte Fragen
Wie schnell werden Batches fertig?
Anbieter garantieren ein 24-Stunden-Fenster, sind aber je nach Auslastung typischerweise in Minuten bis wenigen Stunden fertig. Für die Garantie designen, den Normalfall genießen.
Tools für diese Methode
LiteLLM
The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …
Nächste Methode: #6 Output-Länge kontrollieren