Benchmark de IA para texto, raciocínio e pesquisa é a família de testes mais citada do mercado — e a mais mal interpretada. O problema não são os números, é a leitura: o modelo que lidera o índice composto não é o mesmo que lidera a preferência humana. Na leitura de agosto de 2026, o Claude Opus 5 lidera o Intelligence Index com 63 pontos, mas aparece apenas em 7º lugar na Text Arena, onde pessoas comparam respostas sem saber quem escreveu. A arena acumula 7,78 milhões de votos sobre 391 modelos, e quem a lidera é o Claude Fable 5, com Elo de 1506 — num topo em que os intervalos de confiança se sobrepõem. Nenhum dos dois está errado; eles medem coisas diferentes. Este artigo explica o que cada teste mede, com que amostra, e onde os números não devem ser comparados entre si.
Como o Intelligence Index é montado
O índice mais usado como atalho é composto por nove avaliações com pesos declarados. Saber a composição importa porque explica por que um modelo bom em conversa pode pontuar baixo:
| Componente | Amostra | Peso | Categoria |
|---|---|---|---|
| GDPval-AA v2 | 220 tarefas, 44 ocupações | 20% | Agentes |
| Terminal-Bench v2.1 | 89 tarefas | 16% | Código |
| τ³-Banking | 97 tarefas | 14% | Agentes |
| HLE | 2.158 questões | 12% | Raciocínio científico |
| AA-Omniscience | 6.000 questões | 12% | Conhecimento e alucinação |
| SciCode | 288 subproblemas | 8% | Código |
| GPQA Diamond | 198 questões | 6% | Raciocínio científico |
| CritPt | 70 desafios | 6% | Raciocínio científico |
| AA-LCR | 100 questões (~100 mil tokens) | 6% | Contexto longo |
Um terço do peso é de tarefas agênticas. Ou seja: o índice premia modelo que usa ferramenta e completa trabalho, não que escreve bem. Se o seu caso é redação ou atendimento, ele não é o critério mais adequado.
Detalhe útil: MMLU-Pro, LiveCodeBench e AutomationBench não fazem parte do índice, embora sejam frequentemente citados como se fizessem. São reportados em separado.
LiveBench — pontuação geral (release de 25/06/2026)
23 tarefas objetivas em 7 categorias, renovadas a cada seis meses para evitar contaminação. Em violeta, pesos abertos.
O custo por tarefa bem-sucedida varia 33x: US$ 1,439 no Fable 5 contra US$ 0,044 no DeepSeek V4 Pro.
O LiveBench merece destaque metodológico: as 23 tarefas são renovadas a cada seis meses, e o release atual é de 25 de junho de 2026. Como as questões são novas e verificáveis automaticamente, o teste é resistente a contaminação de dados de treino — o problema mais sério de todos os benchmarks de IA.
Dois achados que a tabela esconde: em matemática a categoria está saturada (96,2 contra 96,0 e 95,9 no topo — indistinguível), enquanto código agêntico é o gargalo real, com o melhor resultado em 65,2. E o custo por tarefa bem-sucedida varia 33 vezes entre o topo e o DeepSeek V4 Pro.
Text Arena — preferência humana (Elo, 12/08/2026)
7,78 milhões de votos, 391 modelos, comparação cega par a par com controle de estilo.
Os intervalos de confiança do topo se sobrepõem — a liderança não é estatisticamente separável. E o líder do índice composto (Opus 5) aparece só em 7º na preferência humana.
⚠️ Por que preferência humana discorda do índice
A Text Arena acumula 7,78 milhões de votos sobre 391 modelos, em comparação cega par a par com controle de estilo. É a medição mais próxima de “qual resposta as pessoas preferem”.
E ela contradiz o índice composto: o Claude Fable 5 lidera com 1506, e o Opus 5 — número 1 no índice — fica em 7º com 1493. Antes de concluir qualquer coisa, note que os intervalos de confiança do top 7 se sobrepõem: a diferença não é estatisticamente separável. A leitura honesta é que há um grupo empatado no topo, não um vencedor.
A explicação da divergência é simples: o índice pesa uso de ferramenta e conclusão de tarefa; a arena pesa clareza, tom e utilidade percebida. Para escolher modelo de atendimento ou produção de conteúdo, a arena informa melhor.
Uma nota de endereço: o domínio mudou — o LMArena agora atende em arena.ai.
Os testes de conhecimento e raciocínio, um por um
- GPQA Diamond — questões de biologia, física e química escritas para resistir a busca na web. O dado que dá escala: especialistas com doutorado acertam 65%, e não-especialistas qualificados ficam em 34% mesmo com mais de 30 minutos e internet aberta. O índice usa o subconjunto de 198 questões.
- HLE (Humanity’s Last Exam) — 2.500 questões de mais de 100 matérias, escritas por cerca de mil especialistas de 500 instituições em 50 países, com conjunto privado retido para detectar sobreajuste.
- MMLU-Pro — 12.032 questões, com 10 alternativas em vez de 4 e remoção de itens triviais. Provocou queda de 16 a 33 pontos frente ao MMLU original, cuja saturação o próprio estudo declara.
- BrowseComp — 1.266 questões que exigem localizar informação difícil e entrelaçada na web, com resposta curta e verificável.
- AA-Omniscience — 6.000 questões, e o único componente que pune alucinação explicitamente, separando acurácia de taxa de não-invenção.
⚠️ Onde os números divergem — e por quê
O HLE é o melhor exemplo de armadilha. Você vai encontrar valores muito diferentes para o mesmo teste, e há três causas verificadas:
- Amostra diferente. O conjunto completo tem 2.500 questões; o índice avalia sobre 2.158.
- O dataset encolheu. Passou de 2.700 para 2.500 itens quando questões com erro ou “facilmente pesquisáveis” foram removidas.
- Juiz e esforço distintos. Um leaderboard usa um modelo específico como avaliador automático a temperatura zero; outro usa configuração diferente de esforço de raciocínio.
Há ainda um ponto que quase ninguém verifica: nem o Opus 5 nem o GPT-5.6 Sol aparecem no leaderboard público do HLE. Qualquer número de HLE para esses dois hoje é autorreportado pelo fabricante ou vem de avaliação de terceiro — nunca do ranking original.
Casos de uso e o critério certo para cada um
| Seu caso | Olhe para | Ignore |
|---|---|---|
| Atendimento e conversa | Text Arena (preferência humana) | Índice composto |
| Produção de conteúdo | Text Arena e teste próprio | GPQA, HLE |
| Pesquisa e síntese com web | BrowseComp | Benchmarks de conhecimento fechado |
| Extração factual | AA-Omniscience (pune alucinação) | Elo de preferência |
| Documento longo | AA-LCR (contexto de 100 mil tokens) | Testes de questão curta |
| Automação com ferramentas | Índice composto e τ³ | Text Arena |
E vale a regra geral: custo por tarefa importa mais que posição no ranking. A variação de 33 vezes no custo por tarefa bem-sucedida do LiveBench é maior que qualquer diferença de qualidade entre os dez primeiros.
Fontes
- Metodologia do Intelligence Index — Artificial Analysis
- LiveBench — release de junho de 2026
- Text Arena — preferência humana
- GPQA · Humanity’s Last Exam
- MMLU-Pro · BrowseComp
Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Benchmark de código · de agentes · de dados e matemática
- Engenharia de prompt — extrair mais do modelo que você já tem
- Benchmark de IA — a definição no glossário