# Cache de prompts

> Cut My AI Spend — rank #2 of 10. Economia típica: Até 90% de desconto em tokens de entrada em cache. Esforço: Baixo — organize seus prompts, ative uma flag.

O cache de prompts reutiliza o estado computado por trás de um prefixo de prompt repetido (prompt de sistema, definições de ferramentas, documentos longos), de modo que a parte estática de cada requisição é cobrada com um desconto pesado — até 90% na Anthropic com breakpoints de cache explícitos, e ~50% automaticamente na OpenAI.
Relatos de produção costumam ficar na faixa de 50–80% de acertos de cache quando os prompts são estruturados com o conteúdo estável primeiro e o conteúdo variável por último. Para apps de chat, agentes e qualquer coisa com um prompt de sistema grande, este é o ajuste de um dia com maior alavancagem disponível.

## Como fazer

1. Reestruture os prompts: conteúdo estável (prompt de sistema, ferramentas, documentos de referência) primeiro, conteúdo variável (mensagem do usuário) por último.
2. Na Anthropic, adicione breakpoints cache_control aos blocos estáveis; na OpenAI, o cache é aplicado automaticamente a prefixos repetidos acima de 1024 tokens.
3. Mantenha o prefixo idêntico byte a byte entre requisições — qualquer alteração acima do breakpoint invalida o cache.
4. Acompanhe sua taxa de acertos de cache; abaixo de ~50% geralmente significa que algo volátil (timestamps, IDs de requisição) está vazando para o prefixo.

## Perguntas frequentes

### O cache muda a saída do modelo?

Não. O cache de prompts reutiliza computação para prefixos de entrada idênticos; as saídas não são afetadas. É puramente uma otimização de cobrança e latência.

### Por quanto tempo os caches duram?

Depende do provedor: a Anthropic oferece TTLs de 5 minutos e 1 hora; os caches da OpenAI normalmente persistem por minutos e se estendem enquanto estão em uso. Prompts de alto tráfego se mantêm quentes sozinhos.


---
Canonical: https://cutmyaispend.com/pt/methods/prompt-caching
All methods: https://cutmyaispend.com/pt | JSON: https://cutmyaispend.com/api/methods.json