# Batch-APIs

> Cut My AI Spend — rank #5 of 10. Typische Ersparnis: Pauschal 50% bei den meisten Anbietern. Aufwand: Niedrig — sofern Ihr Workload asynchron laufen darf.

OpenAI, Anthropic und Google bieten alle Batch-Endpunkte mit rund 50% Rabatt im Tausch gegen asynchrone Verarbeitung (typischerweise deutlich innerhalb von 24 Stunden abgeschlossen, oft viel schneller). Jeder Workload, der nicht nutzerseitig in Echtzeit laufen muss — Anreicherung, Klassifikation, Embedding-Backfills, Evals, Report-Generierung — verschenkt Geld, wenn er über die synchrone API läuft.

## So setzen Sie es um

1. Prüfen, welche Jobs wirklich latenzkritisch sind; die meisten Pipelines sind es nicht.
2. Offline-Jobs auf den Batch-Endpunkt des Anbieters umziehen (JSONL rein, JSONL raus).
3. Mit Caching kombinieren: Batch-Inputs mit gemeinsamem Präfix profitieren bei manchen Anbietern zusätzlich vom Prompt-Cache-Rabatt.

## Häufig gestellte Fragen

### Wie schnell werden Batches fertig?

Anbieter garantieren ein 24-Stunden-Fenster, sind aber je nach Auslastung typischerweise in Minuten bis wenigen Stunden fertig. Für die Garantie designen, den Normalfall genießen.


---
Canonical: https://cutmyaispend.com/de/methods/batch-apis
All methods: https://cutmyaispend.com/de | JSON: https://cutmyaispend.com/api/methods.json