# API batch (traitement par lots)

> Cut My AI Spend — rank #5 of 10. Économies typiques: 50% de remise fixe chez la plupart des fournisseurs. Effort: Faible — si votre charge de travail tolère l'asynchrone.

OpenAI, Anthropic et Google proposent tous des endpoints batch à environ 50% de remise en échange d'un traitement asynchrone (généralement terminé bien avant 24 heures, souvent beaucoup plus vite). Toute charge de travail qui n'est pas du temps réel face à l'utilisateur — enrichissement, classification, rattrapage d'embeddings, évaluations, génération de rapports — laisse de l'argent sur la table si elle passe par l'API synchrone.

## Comment faire

1. Auditez quels jobs sont réellement sensibles à la latence ; la plupart des pipelines ne le sont pas.
2. Migrez les jobs hors-ligne vers l'endpoint batch du fournisseur (JSONL en entrée, JSONL en sortie).
3. Combinez avec le caching : chez certains fournisseurs, les entrées batch partageant un préfixe bénéficient aussi des remises de prompt caching.

## Questions fréquentes

### En combien de temps les batchs se terminent-ils ?

Les fournisseurs garantissent une fenêtre de 24 heures mais terminent en général en quelques minutes à quelques heures selon la charge. Concevez pour la garantie, profitez du cas typique.


---
Canonical: https://cutmyaispend.com/fr/methods/batch-apis
All methods: https://cutmyaispend.com/fr | JSON: https://cutmyaispend.com/api/methods.json