Accueil / Rang #5
API batch (traitement par lots)
OpenAI, Anthropic et Google proposent tous des endpoints batch à environ 50% de remise en échange d'un traitement asynchrone (généralement terminé bien avant 24 heures, souvent beaucoup plus vite). Toute charge de travail qui n'est pas du temps réel face à l'utilisateur — enrichissement, classification, rattrapage d'embeddings, évaluations, génération de rapports — laisse de l'argent sur la table si elle passe par l'API synchrone.
Comment faire
- Auditez quels jobs sont réellement sensibles à la latence ; la plupart des pipelines ne le sont pas.
- Migrez les jobs hors-ligne vers l'endpoint batch du fournisseur (JSONL en entrée, JSONL en sortie).
- Combinez avec le caching : chez certains fournisseurs, les entrées batch partageant un préfixe bénéficient aussi des remises de prompt caching.
Questions fréquentes
En combien de temps les batchs se terminent-ils ?
Les fournisseurs garantissent une fenêtre de 24 heures mais terminent en général en quelques minutes à quelques heures selon la charge. Concevez pour la garantie, profitez du cas typique.
Outils pour cette méthode
LiteLLM
The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …
Méthode suivante: #6 Contrôle de la longueur des sorties