Início / Posição #5
APIs em lote (Batch APIs)
OpenAI, Anthropic e Google oferecem endpoints de lote com aproximadamente 50% de desconto em troca de processamento assíncrono (normalmente concluído bem dentro de 24 horas, muitas vezes muito mais rápido). Qualquer carga de trabalho que não seja em tempo real voltada ao usuário — enriquecimento, classificação, backfills de embeddings, avaliações, geração de relatórios — está deixando dinheiro na mesa se roda pela API síncrona.
Como fazer
- Audite quais jobs são de fato sensíveis à latência; a maioria dos pipelines não é.
- Mova os jobs offline para o endpoint de lote do provedor (JSONL entra, JSONL sai).
- Combine com cache: entradas em lote que compartilham um prefixo ainda se beneficiam dos descontos de cache de prompts em alguns provedores.
Perguntas frequentes
Quão rápido os lotes são concluídos?
Os provedores garantem uma janela de 24 horas, mas normalmente terminam em minutos a poucas horas dependendo da carga. Projete para a garantia, aproveite o caso típico.
Ferramentas para este método
LiteLLM
The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …
Próximo método: #6 Controle do tamanho da saída