Inicio / Puesto #2

Caché de prompts (prompt caching)

Ahorro típicoHasta 90% de descuento en tokens de entrada cacheados
EsfuerzoBajo — ordena tus prompts y activa una opción

El caché de prompts reutiliza el estado computado detrás de un prefijo de prompt repetido (prompt de sistema, definiciones de herramientas, documentos largos), de modo que la parte estática de cada solicitud se factura con un gran descuento — hasta 90% en Anthropic con puntos de corte de caché explícitos, y ~50% automático en OpenAI.

Los reportes en producción suelen situarse en el rango de 50–80% de aciertos de caché una vez que los prompts se estructuran con el contenido estable primero y el variable al final. Para apps de chat, agentes y cualquier cosa con un prompt de sistema grande, este es el arreglo de un día con mayor apalancamiento disponible.

Cómo hacerlo

  1. Reestructura los prompts: contenido estable (prompt de sistema, herramientas, documentos de referencia) primero, contenido variable (mensaje del usuario) al final.
  2. En Anthropic, añade puntos de corte cache_control a los bloques estables; en OpenAI, el caché se aplica automáticamente a prefijos repetidos de más de 1024 tokens.
  3. Mantén el prefijo idéntico byte a byte entre solicitudes — cualquier cambio por encima del punto de corte invalida el caché.
  4. Monitorea tu tasa de aciertos de caché; por debajo de ~50% suele significar que algo volátil (marcas de tiempo, IDs de solicitud) se está colando en el prefijo.

Preguntas frecuentes

¿El caché cambia la salida del modelo?

No. El caché de prompts reutiliza la computación para prefijos de entrada idénticos; las salidas no se ven afectadas. Es puramente una optimización de facturación y latencia.

¿Cuánto tiempo viven los cachés?

Depende del proveedor: Anthropic ofrece TTLs de 5 minutos y 1 hora; los cachés de OpenAI suelen persistir minutos y se extienden mientras están en uso. Los prompts de alto tráfico se mantienen calientes por sí solos.

Herramientas para este método

Open-source LLM gateway

LiteLLM

The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …

Managed AI gateway

Portkey

Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…

Siguiente método: #3 Enrutamiento de modelos y cascadas