Inicio / Puesto #4
Caché semántico
Los cachés de coincidencia exacta no capturan las paráfrasis. El caché semántico genera embeddings de las consultas entrantes y sirve una respuesta almacenada cuando una consulta nueva es suficientemente similar a una anterior — eliminando 30–70% de las llamadas redundantes a la API en cargas donde los usuarios preguntan lo mismo con palabras distintas (soporte, búsqueda, tráfico tipo FAQ).
Es el siguiente paso natural después del caché de prompts: el caché de prompts descuenta los prefijos repetidos; el caché semántico se salta la llamada al modelo por completo.
Cómo hacerlo
- Genera un embedding de cada consulta; guarda los pares (embedding, respuesta) en un almacén vectorial.
- Sirve respuestas cacheadas por encima de un umbral de similitud afinado; empieza conservador (~0.95) y relájalo con monitoreo.
- Delimita los cachés por usuario o por tenant cuando las respuestas dependan de contexto privado.
- Configura TTLs acordes a la velocidad con que cambian los hechos subyacentes.
Preguntas frecuentes
¿Cuándo es mala idea el caché semántico?
Cuando las respuestas son personalizadas, sensibles al tiempo o de alto riesgo. Una respuesta cacheada obsoleta o sutilmente errónea cuesta más que los tokens que ahorró. Delimita el alcance y los TTL con cuidado.
Herramientas para este método
LiteLLM
The default self-hosted gateway: one OpenAI-compatible proxy across 100+ providers with budgets, caching, routing, fallbacks, and …
Portkey
Managed gateway with the strongest built-in semantic caching, plus guardrails, routing, and cost analytics. The low-ops route to t…
Siguiente método: #5 APIs por lotes (batch)