Tudo sobre

Benchmark de IA para dados, estatística e matemática (2026)

Benchmark de IA para dados, estatística e matemática é a área com a maior distância entre manchete e realidade. Os testes de olimpíada estão...

Benchmark de IA para dados, estatística e matemática é a área com a maior distância entre manchete e realidade. Os testes de olimpíada estão saturados — modelos de fronteira ficam entre 95% e 99% em AIME e HMMT, o que os torna inúteis para comparação. E quando a tarefa muda de “resolver problema fechado” para “analisar dado real”, o desempenho desaba: no DABStep, benchmark construído sobre cargas de trabalho reais de uma empresa de pagamentos, um modelo que acerta 76% das tarefas fáceis cai para 14,5% nas difíceis. Os melhores agentes de raciocínio ficam em torno de 16% no conjunto completo. Este artigo mostra qual teste consultar para cada tipo de decisão.

MathArena — desempenho esperado em olimpíadas (%)

Quatro execuções por problema, questões colhidas na publicação da prova. Em violeta, pesos abertos.

Claude Opus 5 (max)84.4% GPT-5.6 Sol (max)79.7% GPT-5.5 (xhigh)77.8% Kimi K3 (Think)69.7%

Cobre AIME, HMMT, USAMO, IMO e Putnam. Margem de erro entre ±1,3 e ±2,8 pontos.

Fonte: MathArena · leitura de 17/08/2026

Matemática: o que ainda discrimina

O MathArena resolve o problema da saturação com metodologia simples e eficaz: roda cada modelo quatro vezes por problema e usa questões colhidas no momento em que a prova é publicada — antes de qualquer chance de entrar em dados de treino. Cobre AIME, HMMT, USAMO, IMO, Putnam e outras.

Note as margens de erro no gráfico: entre ±1,3 e ±2,8 pontos. A diferença entre o primeiro e o segundo colocado é maior que isso, então a liderança se sustenta — diferente do que ocorre em vários outros rankings.

⚠️ A medalha de ouro na olimpíada que não foi verificada

Você provavelmente leu que modelos de IA conquistaram ouro na Olimpíada Internacional de Matemática. Vale saber o que sustenta essa afirmação.

As alegações são autorreportadas, sobre modelos que nunca foram liberados para avaliação independente. Na avaliação da IMO conduzida pelo MathArena com quatro juízes humanos de nível olímpico, o melhor modelo publicamente disponível fez 13 de 42 pontos — 31%, abaixo do limiar de bronze.

Não significa que as alegações sejam falsas. Significa que resultado de sistema não auditável não é comparável a resultado medido — e que a distância entre os dois é grande.

FrontierMath: quando o gabarito é que estava errado

O FrontierMath, do Epoch AI, tem 295 problemas nos níveis 1 a 3 — de graduação a doutorado avançado — mais um nível 4 de matemática de pesquisa. As avaliações rodam sobre conjuntos privados, proteção real contra contaminação.

E aqui está o episódio mais instrutivo de toda esta série. Em 12 de junho de 2026, o Epoch publicou a versão 2 do benchmark após uma auditoria que corrigiu erros em 42% dos problemas — foram 123 correções nos níveis 1 a 3 e 12 no nível 4, com alguns itens removidos.

A maioria eram erros triviais de cálculo — sinal trocado, diferença de uma unidade — na extração da resposta final. E o efeito da correção foi elevar as notas de todos os modelos: eles estavam sendo penalizados por gabarito errado. Depois da revisão, o topo dos níveis 1 a 3 chegou a 85%.

A lição vale para qualquer comparação: scores anteriores à versão 2 não são comparáveis aos atuais. E o próprio Epoch situa a taxa de erro original como comparável à do ImageNet — ou seja, não é anomalia, é o estado da arte da construção de benchmark.

Uma ressalva de transparência: a OpenAI financia o FrontierMath, conflito de interesse que o projeto declara.

GDPval-AA v2 — tarefas econômicas reais (Elo)

44 ocupações em 9 setores. Linha de base humana ancorada em 1000. Em violeta, pesos abertos.

Claude Opus 5 (max)1849 Claude Opus 5 (xhigh)1817 Grok 4.6 (high)1746 Claude Fable 5 (max)1739 Qwen3.8 Max1737 Linha de base humana1000

Comparação cega par a par com juiz automatizado, não avaliação por especialistas humanos.

Fonte: Artificial Analysis · leitura de 17/08/2026

GDPval: tarefas econômicas reais

É o benchmark mais próximo de “o modelo faz o trabalho que uma pessoa é paga para fazer”. Cobre 44 ocupações em 9 setores de peso no PIB, com tarefas escritas por profissionais de 14 anos de experiência média.

Na versão avaliada de forma independente, o Elo é ancorado em 1000 como linha de base humana, e os modelos operam com acesso a terminal e navegação web em ciclo agêntico. O Qwen3.8 Max, de pesos abertos, aparece em quinto com 1737 — próximo do topo proprietário.

⚠️ Um detalhe metodológico que corrige uma leitura comum: o julgamento é feito por comparação cega com juiz automatizado, não por especialistas humanos. A âncora humana em 1000 é a referência comparada, não o avaliador. Muitos artigos descrevem esse teste como “avaliado por especialistas” — não é.

Análise de dados de verdade: DABStep

Se o seu caso de uso é IA analisando planilha, base ou log, este é o teste que importa. O DABStep, construído pela Adyen com o Hugging Face, tem mais de 450 tarefas extraídas de cargas de trabalho reais, divididas entre fáceis e difíceis.

O resultado é o mais sóbrio desta série:

  • Nas tarefas fáceis, um modelo de raciocínio faz 76%
  • Nas difíceis, o mesmo modelo cai para 14,5%
  • No conjunto completo, os melhores agentes ficam em torno de 16%

A razão do colapso é instrutiva: as tarefas difíceis exigem combinar processamento de dados em código com raciocínio sobre documentação heterogênea — ler a especificação de um campo, entender a regra de negócio, e só então calcular. É exatamente o trabalho de um analista, e é onde a IA ainda falha na maior parte das vezes.

SQL e outros testes de dados

BenchmarkO que medeSituação
BIRD-SQLTexto para SQL sobre bases grandes e sujasAtivo; sem scores 2026 verificados
Spider 2.0SQL em ambiente empresarial realistaAtivo; sem scores 2026 verificados
DS-1000Ciência de dados em PythonAtivo; sem scores 2026 verificados
DABStepAnálise sobre dados reais, fácil e difícilAtivo com dados

Sobre benchmark de planilha e BI: procurei e não localizei nenhum ativo e confiável. Se alguém apresentar número para “IA no Excel”, peça a fonte.

Vale notar um padrão que atravessa a área: dois estudos publicados em 2026 argumentam que erros de anotação comprometem os rankings de texto para SQL — o mesmo problema que a auditoria do FrontierMath expôs em matemática. Benchmark é software, e software tem bug.

Casos de uso e qual teste consultar

  • Análise exploratória de base própria — DABStep. E calibre expectativa: o teto medido em tarefa complexa é baixo.
  • Gerar consulta SQL — BIRD-SQL e Spider 2.0 para entender a metodologia; teste no seu esquema para decidir.
  • Cálculo e modelagem estatística — MathArena, ignorando AIME e HMMT por saturação.
  • Automatizar trabalho de analista — GDPval, lembrando que o juiz é automatizado.
  • Relatório recorrente sobre dado estruturado — nenhum benchmark cobre bem; monte um teste próprio com dez perguntas que você já sabe responder.

O erro mais comum nesta categoria é confundir resolver problema fechado com analisar dado aberto. Modelos são excelentes no primeiro e medianos no segundo, e nenhum ranking de olimpíada avisa isso.

Fontes

Leia também

Compartilhe:
Foto de Dionatha Rodrigues

Dionatha Rodrigues

Dionatha é bacharel em Sistemas de Informação e especialista em Martech, com mais de 17 anos de experiência na integração de Marketing e Tecnologia para impulsionar negócios, equipes e profissionais a compreenderem e otimizarem as operações de marketing digital e tecnologia. Sua expertise técnica abrange áreas-chave como SEO técnico, Analytics, CRM, Chatbots, CRO (Conversion Rate Optimization) e automação de processos.

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!