Início / Posição #6

Controle do tamanho da saída

Economia típica20–60% do gasto com tokens de saída
EsforçoBaixo — mudanças de prompt e max_tokens

Tokens de saída custam de 3 a 8× mais que tokens de entrada (razão mediana de ~4:1). Respostas prolixas, explicações não solicitadas e boilerplate repetido são cobrados na tarifa premium. Restringir o que o modelo pode dizer é uma das vitórias mais baratas disponíveis.

Saídas estruturadas (schemas JSON), orçamentos de tamanho explícitos nos prompts e limites rígidos de max_tokens normalmente cortam o gasto de saída em 20–60% com zero perda de qualidade para respostas consumidas por máquinas.

Como fazer

  1. Defina max_tokens deliberadamente por endpoint em vez de deixar padrões generosos.
  2. Use saída estruturada / modo JSON para respostas consumidas por máquinas — schemas eliminam o enchimento em prosa.
  3. Peça brevidade explicitamente no prompt ("responda em uma frase", "sem preâmbulo").
  4. Remova a cadeia de raciocínio das saídas finais quando o raciocínio não precisa ser exibido.

Perguntas frequentes

Por que tokens de saída custam mais?

A geração é sequencial — cada token de saída exige um forward pass completo — enquanto os tokens de entrada são processados em paralelo. Os provedores precificam essa assimetria de computação diretamente nas tarifas por token.

Próximo método: #7 Higiene de contexto e gestão de tokens