**Atenção** é o mecanismo que permite a um modelo pesar a relevância de cada parte do texto em relação a todas as outras, simultaneamente, em vez de ler palavra por palavra em ordem. Cada elemento gera três representações — *consulta*, *chave* e *valor* — e o modelo compara consultas com chaves para decidir quanto de cada valor incorporar. É o coração da arquitetura
Transformere a razão de a [IA](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/) generativa ter funcionado. Também é a origem do custo: como cada elemento se compara a todos os outros, o custo cresce **de forma quadrática** com o tamanho do texto. Esse custo é tão concreto que **redesenha modelos comerciais** — a documentação do Gemma 3 registra mudanças de arquitetura feitas justamente para reduzir a memória que “tende a explodir com contexto longo”. Vale entender o mecanismo porque ele explica tanto a conta quanto um mal-entendido comum sobre interpretabilidade.## ⚠️ Peso de atenção não é explicaçãoA metáfora com a atenção humana é sedutora e leva a uma inferência frágil: a de que olhar para os pesos revela “onde o modelo prestou atenção” — e, portanto, por que ele respondeu aquilo.Isso é contestado dentro da própria área desde 2019. Um trabalho apresentado na NAACL parte da observação de que esses pesos são **frequentemente apresentados como oferecendo transparência**, testa a afirmação e conclui que **em larga medida não oferecem**. Dois achados sustentam a conclusão: os pesos de atenção **frequentemente não se correlacionam** com outras medidas de importância das variáveis, e é possível construir **distribuições de atenção muito diferentes que produzem exatamente a mesma predição**.Há réplica publicada no mesmo ano, argumentando que a conclusão depende da definição de “explicação” — o debate segue ativo. Mas o ponto prático se mantém: **se dentro da pesquisa a leitura dos pesos como explicação é contestada, a versão antropomórfica é ainda mais frágil**.É o mesmo problema que aparece em
chain-of-thoughte em
explicabilidade: a narrativa sobre o processo não é o processo.## O que isso muda na prática
- **Contexto longo custa desproporcionalmente.** Dobrar o texto enviado não dobra o custo — multiplica por quatro. É a razão econômica de recuperar o trecho relevante em vez de despejar a base inteira no prompt.
- **Não diga “o modelo prestou atenção nesta palavra” como explicação.** É exatamente a inferência que a pesquisa mostra não se sustentar — e num contexto de conformidade, é afirmação que não se defende.
- **Janela grande não é convite a preenchê-la.** O detalhamento de quanto do contexto o modelo de fato aproveita está em janela de contexto.
## Fontes
- Attention Is All You Need — o mecanismo original
- Attention is not Explanation — NAACL 2019 · Attention is not not Explanation — a réplica
- Gemma 3 — mudanças de arquitetura pelo custo de memória em contexto longo
*Leitura das fontes em 17/08/2026.*