# Modelos más baratos y abiertos / auto-hospedaje

> Cut My AI Spend — rank #9 of 10. Ahorro típico: 50–95% por token en tareas adecuadas. Esfuerzo: Alto para auto-hospedar, bajo para cambiar de modelo.

Los precios de los modelos frontera siguen cayendo, y los modelos pequeños (clase Haiku, clase GPT-mini, Nova, pesos abiertos de Llama/Qwen/Mistral) ya manejan clasificación, extracción y redacción rutinaria a una fracción mínima del precio frontera. Para tareas de alto volumen y bien acotadas, un modelo pequeño con fine-tuning regularmente supera en costo a un modelo frontera con prompts y lo iguala en calidad.
Auto-hospedar pesos abiertos (con cuantización) tiene sentido a partir de umbrales de volumen sostenido — pero sé honesto con los costos de GPU, operaciones y evaluaciones; la guerra de precios de las APIs hace que el punto de cruce sea más alto de lo que la mayoría de los equipos asume.

## Cómo hacerlo

1. Haz benchmarks de tus tareas de mayor volumen con un nivel (y dos niveles) por debajo de tu modelo actual.
2. Haz fine-tuning de un modelo pequeño en tareas con datos de referencia claros y alto volumen.
3. Para auto-hospedar, calcula el costo completo: GPUs, margen de autoescalado, tiempo de operaciones y mantenimiento de evaluaciones.
4. Repite los benchmarks cada trimestre — los precios y la calidad de los modelos cambian lo bastante rápido como para cambiar la respuesta.

## Preguntas frecuentes

### ¿Cuándo compensa el auto-hospedaje?

Las reglas generales varían, pero un gasto anual sostenido de seis cifras en APIs sobre cargas estables es donde empieza la evaluación seria. Por debajo de eso, la caída de precios de las APIs suele ganarle a tener GPUs propias.


---
Canonical: https://cutmyaispend.com/es/methods/cheaper-and-open-models
All methods: https://cutmyaispend.com/es | JSON: https://cutmyaispend.com/api/methods.json