**Janela de contexto** é a quantidade máxima de
tokensque um modelo consegue considerar de uma vez — somando a instrução, o histórico da conversa, os documentos anexados e a própria resposta. Em 2026, os modelos de fronteira anunciam **1 milhão de tokens**, o equivalente a alguns livros. O número virou argumento de venda, e é aí que mora o problema: **janela anunciada não é janela utilizável**. Um benchmark que mediu isso em 17 modelos encontrou casos como o de um modelo que **anuncia 200 mil tokens e mantém desempenho aceitável até 32 mil** — cerca de **16% do que promete**. Vários modelos de 128 mil entregam 32 mil ou 64 mil efetivos. A capacidade de aceitar o texto não é a capacidade de usá-lo — e há um segundo efeito que agrava isso: o modelo recupera bem o que está no começo e no fim do contexto, e **degrada justamente no meio**.## ⚠️ Janela anunciada e janela efetivaO método do benchmark é simples e honesto: estabelece um **limiar de desempenho** e verifica até que tamanho de contexto cada modelo o sustenta. Abaixo do limiar, o modelo até aceita o texto — mas erra o suficiente para que o resultado não sirva.
| Modelo avaliado | Anunciado | Efetivo |
|---|---|---|
| Yi-34B | 200K | **32K** |
| [GPT-4](https://clubmartech.com.br/blog/gpt-modelos-assistentes-marketing/) (versão de teste) | 128K | 64K |
| Llama 3.1 70B | 128K | 64K |
| Llama 3.1 8B | 128K | **32K** |
| Command-R+ | 128K | **32K** |
A conclusão dos autores é que **quase todos os modelos caem abaixo do limiar antes de atingir a janela que anunciam**. Não é caso isolado — é padrão da categoria.## O modelo ignora o meio do contextoHá um segundo achado, e ele é acionável imediatamente. Trabalhos sobre o fenômeno conhecido como *lost in the middle* mostram que o desempenho segue uma **curva em U**: o modelo recupera bem a informação que está **no começo ou no fim** do contexto, e **degrada quando ela está no meio**.Isso vale **mesmo em modelos desenhados para contexto longo**. E tem tradução direta em como montar um prompt: **coloque a instrução crítica no fim** — restrição legal, tom de voz obrigatório, formato de saída. Enterrada no meio de um bloco de documentos, ela tem chance real de ser ignorada.Uma ressalva de precisão: os percentuais exatos de degradação desse estudo **não conseguimos extrair da fonte primária**, então ficamos com o achado qualitativo — que é o que importa para a decisão.## O que isso muda na práticaHá um custo direto, e ele é fácil de subestimar. Encher uma janela de 1 milhão de tokens custa, ao preço de entrada de um modelo de topo, **alguns dólares por chamada única** — multiplicado pelo volume de uma operação real, vira orçamento relevante. E, pelos [dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/) acima, boa parte desse texto provavelmente não será bem aproveitada.
- **Recuperar é melhor que empurrar tudo.** Selecionar os trechos relevantes com RAG custa menos e funciona melhor que despejar catálogo, [CRM](https://clubmartech.com.br/significado/crm/) e manual da marca a cada chamada.
- **Instrução crítica no fim do prompt.** Consequência direta da curva em U.
- **Meça a sua janela efetiva.** Coloque uma informação específica no meio de um contexto longo real e pergunte por ela. Se o modelo não recupera, você encontrou o seu limite prático — que não é o do material de venda.
- **Cuidado ao comparar janelas entre fornecedores.** A contagem de tokens depende do tokenizador, e ele muda entre gerações: a documentação de um fornecedor registra que uma versão nova passou a consumir **cerca de 30% mais tokens para o mesmo texto**. “1 milhão” de um não é “1 milhão” de outro.
A razão técnica de o contexto longo ser caro está em
Transformer— o custo da atenção cresce de forma quadrática. E o efeito sobre a fatura, em
inferência.## Fontes
- RULER: What’s the Real Context Size of Your Long-Context Language Models? — 17 modelos, 13 tarefas
- Lost in the Middle — Liu et al., TACL 2023, a curva em U
- Repositório do RULER — NVIDIA
*Leitura das fontes em 17/08/2026.*