Accueil / Rang #6
Contrôle de la longueur des sorties
Les tokens de sortie coûtent 3 à 8 fois plus cher que les tokens d'entrée (ratio médian ~4:1). Réponses verbeuses, explications non demandées et formules répétitives sont facturées au tarif premium. Restreindre ce que le modèle a le droit de dire est l'un des gains les moins chers qui soient.
Sorties structurées (schémas JSON), budgets de longueur explicites dans les prompts et plafonds max_tokens stricts réduisent typiquement la dépense en sortie de 20–60% sans aucune perte de qualité pour les réponses consommées par des machines.
Comment faire
- Fixez max_tokens délibérément par endpoint au lieu de laisser des valeurs par défaut généreuses.
- Utilisez les sorties structurées / le mode JSON pour les réponses consommées par des machines — les schémas éliminent le remplissage en prose.
- Demandez explicitement la concision dans le prompt (« réponds en une phrase », « pas de préambule »).
- Retirez la chaîne de raisonnement des sorties finales quand le raisonnement n'a pas besoin d'être montré.
Questions fréquentes
Pourquoi les tokens de sortie coûtent-ils plus cher ?
La génération est séquentielle — chaque token de sortie exige une passe avant complète — alors que les tokens d'entrée sont traités en parallèle. Les fournisseurs répercutent directement cette asymétrie de calcul dans leurs tarifs par token.
Méthode suivante: #7 Hygiène du contexte et gestion des tokens