roteiavários modelos de IA, em reais
GuiasUso e custo

Tokens de entrada e saída: a conta começa antes da resposta.

Tokens de entrada e saída medem partes diferentes da chamada. Separá-los evita orçamento feito com média errada e limites que cortam a resposta.

Revisado em pela equipe da Roteia.

Um prompt com histórico de atendimento, política interna e três documentos pode custar mais para entrar do que a resposta curta custa para sair. Em outro fluxo, o pedido é pequeno e o modelo produz um relatório longo. Tratar tudo como “quantidade de palavras” apaga essa diferença justamente onde preço e limite são calculados.

Nas respostas compatíveis de chat, o uso costuma aparecer como prompt_tokens, completion_tokens e total_tokens. A Roteia registra entrada e saída separadamente e o catálogo publica preço final em Real por milhão de tokens para os modelos cobrados nessa unidade. O valor vigente deve ser lido na página do modelo; este guia cuida da lógica, não congela uma tabela.

Token não é palavra nem caractere

O modelo recebe texto quebrado em unidades do seu tokenizer. Uma unidade pode ser uma palavra curta, parte de uma palavra, pontuação ou espaço associado a outro trecho. Código, números, acentos e idiomas diferentes produzem divisões diferentes. A regra popular de alguns caracteres por token nasceu de amostras em inglês e não serve como orçamento confiável para conteúdo brasileiro.

Se a precisão importa, conte com o tokenizer indicado pelo fornecedor ou use a medição devolvida pela própria chamada. Para planejar antes de enviar, aplique uma margem e valide com entradas reais. Um contrato, uma conversa de WhatsApp e um bloco de JSON podem ter o mesmo número de caracteres e consumos bem diferentes.

O que entra na conta de entrada

Entrada não é só a última frase do usuário. Inclui instruções de sistema, histórico que você reenviou, exemplos, resultados de ferramentas, contexto recuperado e representação de mídia conforme o modelo. Bibliotecas também podem acrescentar campos ao payload. Quando a conversa cresce sem política de retenção, o mesmo conteúdo volta a ser processado a cada rodada.

Imagine um assistente que responde “qual é o prazo deste contrato?”. A pergunta tem poucas palavras, mas o sistema envia vinte páginas, regras de resposta e mensagens anteriores. A resposta pode ocupar duas linhas; ainda assim, a maior parcela está na entrada. Medir somente o texto visível ao usuário faria o custo parecer inexplicável.

  • Registre o tamanho do prompt de sistema separado do conteúdo variável.
  • Conte o contexto recuperado depois do filtro, não o acervo inteiro.
  • Verifique se o SDK reenvia todo o histórico ou usa estado mantido pelo provedor.
  • Trate cache de prompt como uma condição do modelo e da rota, nunca como desconto universal.

Saída inclui o que o modelo gera

Tokens de saída correspondem ao conteúdo gerado. Em modelos de raciocínio, a cobrança e os campos de uso podem incluir trabalho que não aparece como texto final, de acordo com o contrato do fornecedor. Tool calls e argumentos JSON também ocupam saída. Limitar caracteres depois que a resposta chegou não devolve o custo já gerado.

Defina max_tokens ou max_completion_tokens com base na tarefa. Um classificador que deve devolver uma categoria não precisa do mesmo teto de um parecer. Na rota de chat da Roteia, os dois parâmetros não podem ser enviados juntos. O catálogo pode informar saída máxima, mas o limite efetivo também depende da política do modelo e do espaço ocupado pela entrada.

Preço de entrada e saída pode ser diferente

Modelos de texto frequentemente publicam valores distintos para os dois lados. Para estimar uma chamada, multiplique tokens de entrada pelo preço de entrada e tokens de saída pelo preço de saída, ajustando a unidade para um milhão. Faça a conta com o preço final exibido no catálogo da Roteia, não com a tabela em dólar de outra rota.

Um exemplo sem valor fixo: 2.000 tokens entram e 300 saem. A parcela de entrada é 2.000 / 1.000.000 × preço de entrada; a de saída usa 300 e seu próprio preço. Some as duas. Se o modelo cobra longa janela por faixa ou tem leitura de cache, use os campos publicados para aquela condição. Não aplique desconto só porque outro provedor usa o mesmo nome de modelo.

Estime com distribuição, não com uma chamada bonita

Colete uma amostra do produto e guarde os números de uso. Separe casos curtos, comuns e extremos. Para cada grupo, registre entrada, saída, falha e repetição. Depois projete o volume mensal com percentis ou faixas. Uma média simples pode esconder poucos relatórios enormes que dominam a conta.

Considere também chamadas auxiliares: classificação antes do chat, embeddings para busca, nova tentativa depois de timeout e resumo do histórico. Elas pertencem ao mesmo recurso do produto, mas podem usar modelos e unidades diferentes. O custo por jornada é mais útil para decisão comercial do que o custo isolado da última resposta.

  • P50 mostra o caso típico; P90 ou P95 ajuda a enxergar a cauda.
  • Taxa de repetição revela prompts ou parsers que desperdiçam chamadas.
  • Custo por tarefa concluída evita premiar um modelo barato que falha mais.

Reduza entrada sem apagar o que decide a resposta

Remova instruções duplicadas, exemplos que não mudam comportamento e histórico sem utilidade para a rodada atual. Em RAG, recupere poucos trechos relevantes em vez de colar documentos inteiros. Se resumir conversa, preserve decisões, identificadores e pendências; um resumo curto que perde o estado pode economizar tokens e criar retrabalho.

Faça uma mudança por vez e repita a avaliação. Cortar 30% do prompt parece vitória até a taxa de respostas corretas cair. A meta é reduzir desperdício mantendo o critério de qualidade, não atingir o menor número de tokens. Para informações obrigatórias, clareza costuma valer mais do que compressão criativa.

Leia o usage junto com o resultado

Armazene metadados suficientes para investigar custo sem guardar o conteúdo quando a política de privacidade não permitir. Modelo, projeto, tokens de entrada, tokens de saída, valor, latência, status e identificador da requisição permitem comparar versões e encontrar regressões. A Roteia foi desenhada para registrar metadados de uso, não prompt e completion por padrão.

Feche o ciclo com um alerta de desvio: se a entrada típica dobra após uma mudança de prompt, descubra antes da fatura crescer. Se a saída bate no teto com frequência, verifique se o limite está baixo ou se a instrução está aberta demais. O número só vira decisão quando está ligado ao caso, à qualidade e à versão do sistema.

Dúvidas frequentes

Um token equivale a quantas palavras em português?

Não há conversão fixa. Tokenização varia por modelo, idioma, pontuação, números e código. Use o contador oficial aplicável ou a medição devolvida pela chamada, com uma amostra em português.

Prompt de sistema entra na cobrança?

Em geral, sim: instruções e conteúdo enviados ao modelo fazem parte da entrada. Confirme os campos de uso e a política do modelo escolhido.

Por que saída costuma ter outro preço?

O fornecedor pode cobrar processamento de entrada e geração de saída em valores diferentes. O catálogo da Roteia mostra os preços finais aplicáveis a cada modelo cobrado por tokens.

Como estimar custo antes de lançar?

Rode casos reais, separe faixas de entrada e saída, inclua repetições e projete por tarefa concluída. Evite estimativa baseada em um prompt de demonstração.

Diminuir tokens sempre melhora o produto?

Não. Remover contexto necessário pode reduzir qualidade e aumentar novas tentativas. Compare custo e resultado no mesmo conjunto de avaliação.

Onde confirmar

Plataforma de terceiro muda de tela e de limite sem avisar. Confira na fonte oficial antes de tomar decisão baseada nesta página.

Quer testar com preço em Real antes de decidir?

Criar conta