roteiavários modelos de IA, em reais
GuiasLimites de contexto

Janela de contexto em APIs de IA: capacidade não é qualidade.

A janela define quanto material cabe numa chamada. O trabalho de produto é decidir o que merece ocupar esse espaço e provar que o modelo usa o trecho certo.

Revisado em pela equipe da Roteia.

Colocar o manual inteiro no prompt parece uma forma simples de evitar busca e recorte. Na prática, a chamada fica mais cara, mais lenta e ainda pode esconder a resposta no meio de conteúdo irrelevante. A janela de contexto é capacidade de transporte e processamento; não é garantia de atenção uniforme nem de resposta correta.

O catálogo da Roteia possui campos para janela de contexto e saída máxima quando a fonte os fornece. Eles ajudam a eliminar candidatos incompatíveis, mas não substituem uma chamada. Valores podem estar ausentes, mudar por versão ou depender da rota. Trate a ficha como ponto de partida e registre o limite confirmado no teste.

O que disputa espaço na mesma chamada

Instruções, mensagens anteriores, exemplos, documentos recuperados, resultados de ferramentas e a resposta ocupam o orçamento de contexto segundo o contrato do modelo. Alguns provedores descrevem a janela como a soma do que entra e do que pode sair; outros expõem limites adicionais. O parâmetro de saída não cria espaço novo: ele reserva ou limita uma parte da capacidade disponível.

Um chat que envia 70 mil tokens de histórico e pede 20 mil de resposta precisa de margem além da pergunta atual e das instruções. Se o modelo aceita a chamada, isso ainda não prova que o desenho é bom. Talvez metade do histórico não mude a resposta. Medir a qualidade com e sem esse material mostra qual parcela merece continuar.

Janela anunciada e janela útil são coisas diferentes

A janela anunciada responde “quanto cabe?”. A janela útil responde “quanto cabe mantendo qualidade, latência e custo aceitáveis para esta tarefa?”. Um modelo pode aceitar um documento longo e falhar em localizar uma cláusula no meio. Outro pode ir bem na recuperação, mas ultrapassar o tempo da tela. Só o conjunto de avaliação transforma capacidade em limite operacional.

Teste posições diferentes. Coloque a evidência relevante no começo, no meio e no fim de um contexto com tamanho crescente. Faça perguntas cuja resposta esteja explicitamente no material e inclua casos em que a resposta não existe. O modelo deve encontrar quando há base e admitir ausência quando não há; respostas plausíveis sem suporte reprovam o fluxo.

Histórico de conversa não precisa crescer para sempre

Reenviar todas as mensagens é fácil de implementar e difícil de sustentar. Cumprimentos, tentativas corrigidas e dados já substituídos continuam consumindo entrada. Defina quais fatos persistem, quais mensagens podem ser resumidas e quando abrir uma nova sessão. Preserve consentimentos, identificadores e decisões que tenham efeito; descarte repetição sem função.

Um resumo também pode errar. Guarde referência para a mensagem original quando a operação exigir auditoria e teste se o resumo conserva as restrições. Em atendimento, “cliente aceitou entrega na sexta” não pode virar “entrega prevista para sexta”. A compressão deve reduzir volume sem promover hipótese a fato.

  • Mantenha as instruções estáveis numa única versão, em vez de repeti-las por mensagem.
  • Separe estado estruturado, como ID e status, da prosa do histórico.
  • Resuma por marco da conversa e confira campos críticos antes de substituir o trecho original.
  • Defina um teto de turnos ou tokens que acione compactação de forma observável.

Documentos longos pedem seleção antes da geração

Quando a pergunta depende de um acervo, recupere trechos relevantes em vez de anexar tudo. Filtros por cliente, data e tipo de documento podem reduzir candidatos antes da busca semântica. Depois, inclua texto suficiente para o modelo entender a passagem, com origem que permita conferir a resposta.

O tamanho do trecho tem trade-off. Partes pequenas recuperam uma frase precisa, mas podem perder definição e exceção vizinhas. Partes grandes mantêm contexto local e ocupam mais janela. Avalie com perguntas reais e resultados esperados. RAG não remove a necessidade de planejar contexto; ele torna a seleção uma etapa explícita.

Saída máxima não é meta de saída

max_tokens ou max_completion_tokens serve como teto. Configurá-lo no máximo do modelo para toda chamada amplia a reserva e permite respostas maiores do que a tarefa precisa. Um extrator de quatro campos, um classificador e um relatório têm necessidades diferentes. Use limites por fluxo e trate resposta cortada como erro observável.

Na Roteia, a rota de chat rejeita o envio simultâneo dos dois parâmetros. O gateway também valida a política e a capacidade declarada do candidato antes de reservar saldo. Mesmo assim, sua aplicação precisa detectar finish_reason de limite, JSON incompleto e stream interrompido. A ausência de texto final não pode virar dado válido por padrão.

Contexto maior cobra em mais de uma moeda operacional

Mais entrada aumenta custo quando o modelo é cobrado por tokens. Também eleva tráfego e pode aumentar latência. Alguns catálogos publicam faixa própria para contexto longo; consulte a página do modelo e a data. Não projete o preço de uma chamada extensa a partir do primeiro degrau da tabela se houver uma condição superior declarada.

O custo que importa é por tarefa concluída. Se um recorte menor exige duas chamadas mas reduz falhas, compare o total das duas com a chamada gigante. Inclua repetição, timeout e revisão humana. A arquitetura mais barata por requisição pode não ser a mais barata por resultado aprovado.

Defina o limite com um teste de degradação

Crie versões do mesmo caso com contexto crescente: somente a evidência, evidência mais material vizinho e um volume próximo do teto pretendido. Meça acerto, citação do trecho, tempo, tokens e custo. O limite de produção deve ficar antes do ponto em que qualidade ou latência se deterioram, com margem para variação.

Repita quando trocar modelo, versão de prompt, chunking ou política de histórico. Guarde os casos que já quebraram e documente a configuração aprovada. Uma janela maior no catálogo pode permitir nova arquitetura, mas não autoriza a mudança sozinha. O teste deve mostrar ganho no fluxo que existe, não numa demonstração construída para caber.

Dúvidas frequentes

Janela de contexto inclui a resposta?

Frequentemente entrada e saída compartilham o orçamento, mas detalhes variam por provedor e modelo. Consulte a documentação e teste o limite efetivo da rota usada.

Um milhão de tokens significa que devo enviar tudo?

Não. Capacidade máxima não garante relevância, atenção uniforme, boa latência ou custo aceitável. Selecione o material necessário e compare em casos reais.

O catálogo da Roteia garante o limite publicado?

O catálogo mostra o valor recebido da fonte na última atualização, quando disponível. Confirme na página, na data e numa chamada antes de fixar a arquitetura.

Como reduzir histórico sem perder decisões?

Separe estado estruturado da conversa, resuma por marcos e teste se consentimentos, IDs, restrições e pendências permanecem corretos. Mantenha trilha quando houver exigência de auditoria.

RAG elimina o problema de contexto?

Não. RAG escolhe trechos antes da geração, mas chunking, filtros, quantidade recuperada e tamanho de cada passagem continuam disputando a janela e precisam de avaliação.

Onde confirmar

Plataforma de terceiro muda de tela e de limite sem avisar. Confira na fonte oficial antes de tomar decisão baseada nesta página.

Quer testar com preço em Real antes de decidir?

Criar conta