# Controle do tamanho da saída

> Cut My AI Spend — rank #6 of 10. Economia típica: 20–60% do gasto com tokens de saída. Esforço: Baixo — mudanças de prompt e max_tokens.

Tokens de saída custam de 3 a 8× mais que tokens de entrada (razão mediana de ~4:1). Respostas prolixas, explicações não solicitadas e boilerplate repetido são cobrados na tarifa premium. Restringir o que o modelo pode dizer é uma das vitórias mais baratas disponíveis.
Saídas estruturadas (schemas JSON), orçamentos de tamanho explícitos nos prompts e limites rígidos de max_tokens normalmente cortam o gasto de saída em 20–60% com zero perda de qualidade para respostas consumidas por máquinas.

## Como fazer

1. Defina max_tokens deliberadamente por endpoint em vez de deixar padrões generosos.
2. Use saída estruturada / modo JSON para respostas consumidas por máquinas — schemas eliminam o enchimento em prosa.
3. Peça brevidade explicitamente no prompt ("responda em uma frase", "sem preâmbulo").
4. Remova a cadeia de raciocínio das saídas finais quando o raciocínio não precisa ser exibido.

## Perguntas frequentes

### Por que tokens de saída custam mais?

A geração é sequencial — cada token de saída exige um forward pass completo — enquanto os tokens de entrada são processados em paralelo. Os provedores precificam essa assimetria de computação diretamente nas tarifas por token.


---
Canonical: https://cutmyaispend.com/pt/methods/output-length-control
All methods: https://cutmyaispend.com/pt | JSON: https://cutmyaispend.com/api/methods.json