Inicio / Puesto #5

APIs por lotes (batch)

Ahorro típico50% fijo en la mayoría de los proveedores
EsfuerzoBajo — si tu carga de trabajo tolera lo asíncrono

OpenAI, Anthropic y Google ofrecen endpoints por lotes con aproximadamente 50% de descuento a cambio de procesamiento asíncrono (normalmente completado bien dentro de 24 horas, y a menudo mucho más rápido). Cualquier carga que no sea de cara al usuario en tiempo real — enriquecimiento, clasificación, backfills de embeddings, evaluaciones, generación de reportes — está dejando dinero sobre la mesa si corre por la API síncrona.

Cómo hacerlo

  1. Audita qué trabajos son realmente sensibles a la latencia; la mayoría de los pipelines no lo son.
  2. Mueve los trabajos offline al endpoint por lotes del proveedor (JSONL de entrada, JSONL de salida).
  3. Combínalo con caché: en algunos proveedores, las entradas por lotes que comparten prefijo también se benefician de los descuentos de caché de prompts.

Preguntas frecuentes

¿Qué tan rápido se completan los lotes?

Los proveedores garantizan una ventana de 24 horas, pero normalmente terminan en minutos o unas pocas horas según la carga. Diseña para la garantía y disfruta el caso típico.

Herramientas para este método

Open-source LLM gateway

LiteLLM

The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …

Siguiente método: #6 Control de longitud de salida