# Caché semántico

> Cut My AI Spend — rank #4 of 10. Ahorro típico: 30–70% de llamadas redundantes eliminadas. Esfuerzo: Medio — almacén de embeddings + umbral de similitud.

Los cachés de coincidencia exacta no capturan las paráfrasis. El caché semántico genera embeddings de las consultas entrantes y sirve una respuesta almacenada cuando una consulta nueva es suficientemente similar a una anterior — eliminando 30–70% de las llamadas redundantes a la API en cargas donde los usuarios preguntan lo mismo con palabras distintas (soporte, búsqueda, tráfico tipo FAQ).
Es el siguiente paso natural después del caché de prompts: el caché de prompts descuenta los prefijos repetidos; el caché semántico se salta la llamada al modelo por completo.

## Cómo hacerlo

1. Genera un embedding de cada consulta; guarda los pares (embedding, respuesta) en un almacén vectorial.
2. Sirve respuestas cacheadas por encima de un umbral de similitud afinado; empieza conservador (~0.95) y relájalo con monitoreo.
3. Delimita los cachés por usuario o por tenant cuando las respuestas dependan de contexto privado.
4. Configura TTLs acordes a la velocidad con que cambian los hechos subyacentes.

## Preguntas frecuentes

### ¿Cuándo es mala idea el caché semántico?

Cuando las respuestas son personalizadas, sensibles al tiempo o de alto riesgo. Una respuesta cacheada obsoleta o sutilmente errónea cuesta más que los tokens que ahorró. Delimita el alcance y los TTL con cuidado.


---
Canonical: https://cutmyaispend.com/es/methods/semantic-caching
All methods: https://cutmyaispend.com/es | JSON: https://cutmyaispend.com/api/methods.json