Tudo sobre

Benchmark de IA para texto, raciocínio e pesquisa (2026)

Benchmark de IA para texto, raciocínio e pesquisa é a família de testes mais citada do mercado — e a mais mal interpretada. O problema não são os...

Benchmark de IA para texto, raciocínio e pesquisa é a família de testes mais citada do mercado — e a mais mal interpretada. O problema não são os números, é a leitura: o modelo que lidera o índice composto não é o mesmo que lidera a preferência humana. Na leitura de agosto de 2026, o Claude Opus 5 lidera o Intelligence Index com 63 pontos, mas aparece apenas em 7º lugar na Text Arena, onde pessoas comparam respostas sem saber quem escreveu. A arena acumula 7,78 milhões de votos sobre 391 modelos, e quem a lidera é o Claude Fable 5, com Elo de 1506 — num topo em que os intervalos de confiança se sobrepõem. Nenhum dos dois está errado; eles medem coisas diferentes. Este artigo explica o que cada teste mede, com que amostra, e onde os números não devem ser comparados entre si.

Como o Intelligence Index é montado

O índice mais usado como atalho é composto por nove avaliações com pesos declarados. Saber a composição importa porque explica por que um modelo bom em conversa pode pontuar baixo:

ComponenteAmostraPesoCategoria
GDPval-AA v2220 tarefas, 44 ocupações20%Agentes
Terminal-Bench v2.189 tarefas16%Código
τ³-Banking97 tarefas14%Agentes
HLE2.158 questões12%Raciocínio científico
AA-Omniscience6.000 questões12%Conhecimento e alucinação
SciCode288 subproblemas8%Código
GPQA Diamond198 questões6%Raciocínio científico
CritPt70 desafios6%Raciocínio científico
AA-LCR100 questões (~100 mil tokens)6%Contexto longo

Um terço do peso é de tarefas agênticas. Ou seja: o índice premia modelo que usa ferramenta e completa trabalho, não que escreve bem. Se o seu caso é redação ou atendimento, ele não é o critério mais adequado.

Detalhe útil: MMLU-Pro, LiveCodeBench e AutomationBench não fazem parte do índice, embora sejam frequentemente citados como se fizessem. São reportados em separado.

LiveBench — pontuação geral (release de 25/06/2026)

23 tarefas objetivas em 7 categorias, renovadas a cada seis meses para evitar contaminação. Em violeta, pesos abertos.

Claude Fable 5 (max)83 GPT-5.6 Sol (max)81 GPT-5.5 (xhigh)80.2 Claude Opus 5 (max)80.1 Smaug-Agentic79.5 Kimi K379.2 Gemini 3.7 Flash78.8 Qwen 3.8 Max78.5 Grok 4.678 DeepSeek V4 Pro77.4

O custo por tarefa bem-sucedida varia 33x: US$ 1,439 no Fable 5 contra US$ 0,044 no DeepSeek V4 Pro.

Fonte: LiveBench · leitura de 17/08/2026

O LiveBench merece destaque metodológico: as 23 tarefas são renovadas a cada seis meses, e o release atual é de 25 de junho de 2026. Como as questões são novas e verificáveis automaticamente, o teste é resistente a contaminação de dados de treino — o problema mais sério de todos os benchmarks de IA.

Dois achados que a tabela esconde: em matemática a categoria está saturada (96,2 contra 96,0 e 95,9 no topo — indistinguível), enquanto código agêntico é o gargalo real, com o melhor resultado em 65,2. E o custo por tarefa bem-sucedida varia 33 vezes entre o topo e o DeepSeek V4 Pro.

Text Arena — preferência humana (Elo, 12/08/2026)

7,78 milhões de votos, 391 modelos, comparação cega par a par com controle de estilo.

Claude Fable 51506 Claude Opus 4.6 (high)1505 Claude Opus 4.7 (high)1502 Muse Spark 1.2 (xhigh)1498 Claude Opus 4.61497 Claude Opus 5 (high)1493

Os intervalos de confiança do topo se sobrepõem — a liderança não é estatisticamente separável. E o líder do índice composto (Opus 5) aparece só em 7º na preferência humana.

Fonte: Arena · leitura de 17/08/2026

⚠️ Por que preferência humana discorda do índice

A Text Arena acumula 7,78 milhões de votos sobre 391 modelos, em comparação cega par a par com controle de estilo. É a medição mais próxima de “qual resposta as pessoas preferem”.

E ela contradiz o índice composto: o Claude Fable 5 lidera com 1506, e o Opus 5 — número 1 no índice — fica em 7º com 1493. Antes de concluir qualquer coisa, note que os intervalos de confiança do top 7 se sobrepõem: a diferença não é estatisticamente separável. A leitura honesta é que há um grupo empatado no topo, não um vencedor.

A explicação da divergência é simples: o índice pesa uso de ferramenta e conclusão de tarefa; a arena pesa clareza, tom e utilidade percebida. Para escolher modelo de atendimento ou produção de conteúdo, a arena informa melhor.

Uma nota de endereço: o domínio mudou — o LMArena agora atende em arena.ai.

Os testes de conhecimento e raciocínio, um por um

  • GPQA Diamond — questões de biologia, física e química escritas para resistir a busca na web. O dado que dá escala: especialistas com doutorado acertam 65%, e não-especialistas qualificados ficam em 34% mesmo com mais de 30 minutos e internet aberta. O índice usa o subconjunto de 198 questões.
  • HLE (Humanity’s Last Exam) — 2.500 questões de mais de 100 matérias, escritas por cerca de mil especialistas de 500 instituições em 50 países, com conjunto privado retido para detectar sobreajuste.
  • MMLU-Pro — 12.032 questões, com 10 alternativas em vez de 4 e remoção de itens triviais. Provocou queda de 16 a 33 pontos frente ao MMLU original, cuja saturação o próprio estudo declara.
  • BrowseComp — 1.266 questões que exigem localizar informação difícil e entrelaçada na web, com resposta curta e verificável.
  • AA-Omniscience — 6.000 questões, e o único componente que pune alucinação explicitamente, separando acurácia de taxa de não-invenção.

⚠️ Onde os números divergem — e por quê

O HLE é o melhor exemplo de armadilha. Você vai encontrar valores muito diferentes para o mesmo teste, e há três causas verificadas:

  • Amostra diferente. O conjunto completo tem 2.500 questões; o índice avalia sobre 2.158.
  • O dataset encolheu. Passou de 2.700 para 2.500 itens quando questões com erro ou “facilmente pesquisáveis” foram removidas.
  • Juiz e esforço distintos. Um leaderboard usa um modelo específico como avaliador automático a temperatura zero; outro usa configuração diferente de esforço de raciocínio.

Há ainda um ponto que quase ninguém verifica: nem o Opus 5 nem o GPT-5.6 Sol aparecem no leaderboard público do HLE. Qualquer número de HLE para esses dois hoje é autorreportado pelo fabricante ou vem de avaliação de terceiro — nunca do ranking original.

Casos de uso e o critério certo para cada um

Seu casoOlhe paraIgnore
Atendimento e conversaText Arena (preferência humana)Índice composto
Produção de conteúdoText Arena e teste próprioGPQA, HLE
Pesquisa e síntese com webBrowseCompBenchmarks de conhecimento fechado
Extração factualAA-Omniscience (pune alucinação)Elo de preferência
Documento longoAA-LCR (contexto de 100 mil tokens)Testes de questão curta
Automação com ferramentasÍndice composto e τ³Text Arena

E vale a regra geral: custo por tarefa importa mais que posição no ranking. A variação de 33 vezes no custo por tarefa bem-sucedida do LiveBench é maior que qualquer diferença de qualidade entre os dez primeiros.

Fontes

Leia também

Compartilhe:
Foto de Dionatha Rodrigues

Dionatha Rodrigues

Dionatha é bacharel em Sistemas de Informação e especialista em Martech, com mais de 17 anos de experiência na integração de Marketing e Tecnologia para impulsionar negócios, equipes e profissionais a compreenderem e otimizarem as operações de marketing digital e tecnologia. Sua expertise técnica abrange áreas-chave como SEO técnico, Analytics, CRM, Chatbots, CRO (Conversion Rate Optimization) e automação de processos.

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!