Inicio / Puesto #6

Control de longitud de salida

Ahorro típico20–60% del gasto en tokens de salida
EsfuerzoBajo — cambios en el prompt y en max_tokens

Los tokens de salida cuestan 3–8 veces más que los de entrada (relación mediana ~4:1). Las respuestas verbosas, las explicaciones no solicitadas y el texto repetitivo se facturan a la tarifa premium. Restringir lo que el modelo puede decir es una de las ganancias más baratas disponibles.

Las salidas estructuradas (esquemas JSON), los presupuestos de longitud explícitos en los prompts y los límites duros de max_tokens típicamente recortan el gasto de salida 20–60% sin pérdida de calidad en respuestas consumidas por máquinas.

Cómo hacerlo

  1. Configura max_tokens deliberadamente por endpoint en lugar de dejar valores por defecto generosos.
  2. Usa salidas estructuradas / modo JSON para respuestas consumidas por máquinas — los esquemas eliminan el relleno en prosa.
  3. Pide brevedad explícitamente en el prompt ("responde en una frase", "sin preámbulos").
  4. Elimina la cadena de razonamiento de las salidas finales cuando no sea necesario mostrar el razonamiento.

Preguntas frecuentes

¿Por qué los tokens de salida cuestan más?

La generación es secuencial — cada token de salida requiere un pase completo hacia adelante — mientras que los tokens de entrada se procesan en paralelo. Los proveedores trasladan esa asimetría de cómputo directamente a las tarifas por token.

Siguiente método: #7 Higiene del contexto y gestión de tokens