Accueil / Rang #6

Contrôle de la longueur des sorties

Économies typiques20–60% de la dépense en tokens de sortie
EffortFaible — modifications de prompts et de max_tokens

Les tokens de sortie coûtent 3 à 8 fois plus cher que les tokens d'entrée (ratio médian ~4:1). Réponses verbeuses, explications non demandées et formules répétitives sont facturées au tarif premium. Restreindre ce que le modèle a le droit de dire est l'un des gains les moins chers qui soient.

Sorties structurées (schémas JSON), budgets de longueur explicites dans les prompts et plafonds max_tokens stricts réduisent typiquement la dépense en sortie de 20–60% sans aucune perte de qualité pour les réponses consommées par des machines.

Comment faire

  1. Fixez max_tokens délibérément par endpoint au lieu de laisser des valeurs par défaut généreuses.
  2. Utilisez les sorties structurées / le mode JSON pour les réponses consommées par des machines — les schémas éliminent le remplissage en prose.
  3. Demandez explicitement la concision dans le prompt (« réponds en une phrase », « pas de préambule »).
  4. Retirez la chaîne de raisonnement des sorties finales quand le raisonnement n'a pas besoin d'être montré.

Questions fréquentes

Pourquoi les tokens de sortie coûtent-ils plus cher ?

La génération est séquentielle — chaque token de sortie exige une passe avant complète — alors que les tokens d'entrée sont traités en parallèle. Les fournisseurs répercutent directement cette asymétrie de calcul dans leurs tarifs par token.

Méthode suivante: #7 Hygiène du contexte et gestion des tokens