Accueil / Rang #5

API batch (traitement par lots)

Économies typiques50% de remise fixe chez la plupart des fournisseurs
EffortFaible — si votre charge de travail tolère l'asynchrone

OpenAI, Anthropic et Google proposent tous des endpoints batch à environ 50% de remise en échange d'un traitement asynchrone (généralement terminé bien avant 24 heures, souvent beaucoup plus vite). Toute charge de travail qui n'est pas du temps réel face à l'utilisateur — enrichissement, classification, rattrapage d'embeddings, évaluations, génération de rapports — laisse de l'argent sur la table si elle passe par l'API synchrone.

Comment faire

  1. Auditez quels jobs sont réellement sensibles à la latence ; la plupart des pipelines ne le sont pas.
  2. Migrez les jobs hors-ligne vers l'endpoint batch du fournisseur (JSONL en entrée, JSONL en sortie).
  3. Combinez avec le caching : chez certains fournisseurs, les entrées batch partageant un préfixe bénéficient aussi des remises de prompt caching.

Questions fréquentes

En combien de temps les batchs se terminent-ils ?

Les fournisseurs garantissent une fenêtre de 24 heures mais terminent en général en quelques minutes à quelques heures selon la charge. Concevez pour la garantie, profitez du cas typique.

Outils pour cette méthode

Open-source LLM gateway

LiteLLM

The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …

Méthode suivante: #6 Contrôle de la longueur des sorties