Início / Posição #6
Controle do tamanho da saída
Tokens de saída custam de 3 a 8× mais que tokens de entrada (razão mediana de ~4:1). Respostas prolixas, explicações não solicitadas e boilerplate repetido são cobrados na tarifa premium. Restringir o que o modelo pode dizer é uma das vitórias mais baratas disponíveis.
Saídas estruturadas (schemas JSON), orçamentos de tamanho explícitos nos prompts e limites rígidos de max_tokens normalmente cortam o gasto de saída em 20–60% com zero perda de qualidade para respostas consumidas por máquinas.
Como fazer
- Defina max_tokens deliberadamente por endpoint em vez de deixar padrões generosos.
- Use saída estruturada / modo JSON para respostas consumidas por máquinas — schemas eliminam o enchimento em prosa.
- Peça brevidade explicitamente no prompt ("responda em uma frase", "sem preâmbulo").
- Remova a cadeia de raciocínio das saídas finais quando o raciocínio não precisa ser exibido.
Perguntas frequentes
Por que tokens de saída custam mais?
A geração é sequencial — cada token de saída exige um forward pass completo — enquanto os tokens de entrada são processados em paralelo. Os provedores precificam essa assimetria de computação diretamente nas tarifas por token.
Próximo método: #7 Higiene de contexto e gestão de tokens