# Cache semântico

> Cut My AI Spend — rank #4 of 10. Economia típica: 30–70% das chamadas redundantes eliminadas. Esforço: Médio — armazenamento de embeddings + limiar de similaridade.

Caches de correspondência exata não capturam paráfrases. O cache semântico gera embeddings das consultas recebidas e serve uma resposta armazenada quando uma nova consulta é suficientemente similar a uma anterior — eliminando 30–70% das chamadas de API redundantes em cargas de trabalho onde os usuários perguntam as mesmas coisas com palavras diferentes (suporte, busca, tráfego estilo FAQ).
É o passo natural depois do cache de prompts: o cache de prompts dá desconto em prefixos repetidos, o cache semântico pula a chamada ao modelo por completo.

## Como fazer

1. Gere embedding de cada consulta; armazene pares (embedding, resposta) em um banco vetorial.
2. Sirva respostas em cache acima de um limiar de similaridade calibrado; comece conservador (~0.95) e afrouxe com monitoramento.
3. Delimite os caches por usuário ou por tenant quando as respostas dependem de contexto privado.
4. Defina TTLs alinhados à velocidade com que os fatos subjacentes mudam.

## Perguntas frequentes

### Quando o cache semântico é uma má ideia?

Quando as respostas são personalizadas, sensíveis ao tempo ou de alto risco. Uma resposta em cache desatualizada ou sutilmente errada custa mais do que os tokens que economizou. Delimite o escopo e o TTL com cuidado.


---
Canonical: https://cutmyaispend.com/pt/methods/semantic-caching
All methods: https://cutmyaispend.com/pt | JSON: https://cutmyaispend.com/api/methods.json