# APIs em lote (Batch APIs)

> Cut My AI Spend — rank #5 of 10. Economia típica: 50% fixos na maioria dos provedores. Esforço: Baixo — se sua carga de trabalho tolera processamento assíncrono.

OpenAI, Anthropic e Google oferecem endpoints de lote com aproximadamente 50% de desconto em troca de processamento assíncrono (normalmente concluído bem dentro de 24 horas, muitas vezes muito mais rápido). Qualquer carga de trabalho que não seja em tempo real voltada ao usuário — enriquecimento, classificação, backfills de embeddings, avaliações, geração de relatórios — está deixando dinheiro na mesa se roda pela API síncrona.

## Como fazer

1. Audite quais jobs são de fato sensíveis à latência; a maioria dos pipelines não é.
2. Mova os jobs offline para o endpoint de lote do provedor (JSONL entra, JSONL sai).
3. Combine com cache: entradas em lote que compartilham um prefixo ainda se beneficiam dos descontos de cache de prompts em alguns provedores.

## Perguntas frequentes

### Quão rápido os lotes são concluídos?

Os provedores garantem uma janela de 24 horas, mas normalmente terminam em minutos a poucas horas dependendo da carga. Projete para a garantia, aproveite o caso típico.


---
Canonical: https://cutmyaispend.com/pt/methods/batch-apis
All methods: https://cutmyaispend.com/pt | JSON: https://cutmyaispend.com/api/methods.json