# APIs por lotes (batch)

> Cut My AI Spend — rank #5 of 10. Ahorro típico: 50% fijo en la mayoría de los proveedores. Esfuerzo: Bajo — si tu carga de trabajo tolera lo asíncrono.

OpenAI, Anthropic y Google ofrecen endpoints por lotes con aproximadamente 50% de descuento a cambio de procesamiento asíncrono (normalmente completado bien dentro de 24 horas, y a menudo mucho más rápido). Cualquier carga que no sea de cara al usuario en tiempo real — enriquecimiento, clasificación, backfills de embeddings, evaluaciones, generación de reportes — está dejando dinero sobre la mesa si corre por la API síncrona.

## Cómo hacerlo

1. Audita qué trabajos son realmente sensibles a la latencia; la mayoría de los pipelines no lo son.
2. Mueve los trabajos offline al endpoint por lotes del proveedor (JSONL de entrada, JSONL de salida).
3. Combínalo con caché: en algunos proveedores, las entradas por lotes que comparten prefijo también se benefician de los descuentos de caché de prompts.

## Preguntas frecuentes

### ¿Qué tan rápido se completan los lotes?

Los proveedores garantizan una ventana de 24 horas, pero normalmente terminan en minutos o unas pocas horas según la carga. Diseña para la garantía y disfruta el caso típico.


---
Canonical: https://cutmyaispend.com/es/methods/batch-apis
All methods: https://cutmyaispend.com/es | JSON: https://cutmyaispend.com/api/methods.json