# Contrôle de la longueur des sorties

> Cut My AI Spend — rank #6 of 10. Économies typiques: 20–60% de la dépense en tokens de sortie. Effort: Faible — modifications de prompts et de max_tokens.

Les tokens de sortie coûtent 3 à 8 fois plus cher que les tokens d'entrée (ratio médian ~4:1). Réponses verbeuses, explications non demandées et formules répétitives sont facturées au tarif premium. Restreindre ce que le modèle a le droit de dire est l'un des gains les moins chers qui soient.
Sorties structurées (schémas JSON), budgets de longueur explicites dans les prompts et plafonds max_tokens stricts réduisent typiquement la dépense en sortie de 20–60% sans aucune perte de qualité pour les réponses consommées par des machines.

## Comment faire

1. Fixez max_tokens délibérément par endpoint au lieu de laisser des valeurs par défaut généreuses.
2. Utilisez les sorties structurées / le mode JSON pour les réponses consommées par des machines — les schémas éliminent le remplissage en prose.
3. Demandez explicitement la concision dans le prompt (« réponds en une phrase », « pas de préambule »).
4. Retirez la chaîne de raisonnement des sorties finales quand le raisonnement n'a pas besoin d'être montré.

## Questions fréquentes

### Pourquoi les tokens de sortie coûtent-ils plus cher ?

La génération est séquentielle — chaque token de sortie exige une passe avant complète — alors que les tokens d'entrée sont traités en parallèle. Les fournisseurs répercutent directement cette asymétrie de calcul dans leurs tarifs par token.


---
Canonical: https://cutmyaispend.com/fr/methods/output-length-control
All methods: https://cutmyaispend.com/fr | JSON: https://cutmyaispend.com/api/methods.json