Janela de contexto: anunciada não é utilizável

Janela de contexto é quanto texto o modelo considera de uma vez. Um benchmark com 17 modelos achou casos de 200 mil tokens anunciados e 32 mil efetivos.

Janela de contexto é a quantidade máxima de tokens que um modelo consegue considerar de uma vez — somando a instrução, o histórico da conversa, os documentos anexados e a própria resposta. Em 2026, os modelos de fronteira anunciam 1 milhão de tokens, o equivalente a alguns livros. O número virou argumento de venda, e é aí que mora o problema: janela anunciada não é janela utilizável. Um benchmark que mediu isso em 17 modelos encontrou casos como o de um modelo que anuncia 200 mil tokens e mantém desempenho aceitável até 32 mil — cerca de 16% do que promete. Vários modelos de 128 mil entregam 32 mil ou 64 mil efetivos. A capacidade de aceitar o texto não é a capacidade de usá-lo — e há um segundo efeito que agrava isso: o modelo recupera bem o que está no começo e no fim do contexto, e degrada justamente no meio.

⚠️ Janela anunciada e janela efetiva

O método do benchmark é simples e honesto: estabelece um limiar de desempenho e verifica até que tamanho de contexto cada modelo o sustenta. Abaixo do limiar, o modelo até aceita o texto — mas erra o suficiente para que o resultado não sirva.

Modelo avaliadoAnunciadoEfetivo
Yi-34B200K32K
GPT-4 (versão de teste)128K64K
Llama 3.1 70B128K64K
Llama 3.1 8B128K32K
Command-R+128K32K

A conclusão dos autores é que quase todos os modelos caem abaixo do limiar antes de atingir a janela que anunciam. Não é caso isolado — é padrão da categoria.

O modelo ignora o meio do contexto

Há um segundo achado, e ele é acionável imediatamente. Trabalhos sobre o fenômeno conhecido como lost in the middle mostram que o desempenho segue uma curva em U: o modelo recupera bem a informação que está no começo ou no fim do contexto, e degrada quando ela está no meio.

Isso vale mesmo em modelos desenhados para contexto longo. E tem tradução direta em como montar um prompt: coloque a instrução crítica no fim — restrição legal, tom de voz obrigatório, formato de saída. Enterrada no meio de um bloco de documentos, ela tem chance real de ser ignorada.

Uma ressalva de precisão: os percentuais exatos de degradação desse estudo não conseguimos extrair da fonte primária, então ficamos com o achado qualitativo — que é o que importa para a decisão.

O que isso muda na prática

Há um custo direto, e ele é fácil de subestimar. Encher uma janela de 1 milhão de tokens custa, ao preço de entrada de um modelo de topo, alguns dólares por chamada única — multiplicado pelo volume de uma operação real, vira orçamento relevante. E, pelos dados acima, boa parte desse texto provavelmente não será bem aproveitada.

  • Recuperar é melhor que empurrar tudo. Selecionar os trechos relevantes com RAG custa menos e funciona melhor que despejar catálogo, CRM e manual da marca a cada chamada.
  • Instrução crítica no fim do prompt. Consequência direta da curva em U.
  • Meça a sua janela efetiva. Coloque uma informação específica no meio de um contexto longo real e pergunte por ela. Se o modelo não recupera, você encontrou o seu limite prático — que não é o do material de venda.
  • Cuidado ao comparar janelas entre fornecedores. A contagem de tokens depende do tokenizador, e ele muda entre gerações: a documentação de um fornecedor registra que uma versão nova passou a consumir cerca de 30% mais tokens para o mesmo texto. “1 milhão” de um não é “1 milhão” de outro.

A razão técnica de o contexto longo ser caro está em Transformer — o custo da atenção cresce de forma quadrática. E o efeito sobre a fatura, em inferência.

Fontes

Leitura das fontes em 17/08/2026.

Compartilhe:

Outros termos do universo martech que você precisa conhecer!

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!