Inicio / Puesto #6
Control de longitud de salida
Los tokens de salida cuestan 3–8 veces más que los de entrada (relación mediana ~4:1). Las respuestas verbosas, las explicaciones no solicitadas y el texto repetitivo se facturan a la tarifa premium. Restringir lo que el modelo puede decir es una de las ganancias más baratas disponibles.
Las salidas estructuradas (esquemas JSON), los presupuestos de longitud explícitos en los prompts y los límites duros de max_tokens típicamente recortan el gasto de salida 20–60% sin pérdida de calidad en respuestas consumidas por máquinas.
Cómo hacerlo
- Configura max_tokens deliberadamente por endpoint en lugar de dejar valores por defecto generosos.
- Usa salidas estructuradas / modo JSON para respuestas consumidas por máquinas — los esquemas eliminan el relleno en prosa.
- Pide brevedad explícitamente en el prompt ("responde en una frase", "sin preámbulos").
- Elimina la cadena de razonamiento de las salidas finales cuando no sea necesario mostrar el razonamiento.
Preguntas frecuentes
¿Por qué los tokens de salida cuestan más?
La generación es secuencial — cada token de salida requiere un pase completo hacia adelante — mientras que los tokens de entrada se procesan en paralelo. Los proveedores trasladan esa asimetría de cómputo directamente a las tarifas por token.
Siguiente método: #7 Higiene del contexto y gestión de tokens