Benchmark de IA para dados, estatística e matemática é a área com a maior distância entre manchete e realidade. Os testes de olimpíada estão saturados — modelos de fronteira ficam entre 95% e 99% em AIME e HMMT, o que os torna inúteis para comparação. E quando a tarefa muda de “resolver problema fechado” para “analisar dado real”, o desempenho desaba: no DABStep, benchmark construído sobre cargas de trabalho reais de uma empresa de pagamentos, um modelo que acerta 76% das tarefas fáceis cai para 14,5% nas difíceis. Os melhores agentes de raciocínio ficam em torno de 16% no conjunto completo. Este artigo mostra qual teste consultar para cada tipo de decisão.
MathArena — desempenho esperado em olimpíadas (%)
Quatro execuções por problema, questões colhidas na publicação da prova. Em violeta, pesos abertos.
Cobre AIME, HMMT, USAMO, IMO e Putnam. Margem de erro entre ±1,3 e ±2,8 pontos.
Matemática: o que ainda discrimina
O MathArena resolve o problema da saturação com metodologia simples e eficaz: roda cada modelo quatro vezes por problema e usa questões colhidas no momento em que a prova é publicada — antes de qualquer chance de entrar em dados de treino. Cobre AIME, HMMT, USAMO, IMO, Putnam e outras.
Note as margens de erro no gráfico: entre ±1,3 e ±2,8 pontos. A diferença entre o primeiro e o segundo colocado é maior que isso, então a liderança se sustenta — diferente do que ocorre em vários outros rankings.
⚠️ A medalha de ouro na olimpíada que não foi verificada
Você provavelmente leu que modelos de IA conquistaram ouro na Olimpíada Internacional de Matemática. Vale saber o que sustenta essa afirmação.
As alegações são autorreportadas, sobre modelos que nunca foram liberados para avaliação independente. Na avaliação da IMO conduzida pelo MathArena com quatro juízes humanos de nível olímpico, o melhor modelo publicamente disponível fez 13 de 42 pontos — 31%, abaixo do limiar de bronze.
Não significa que as alegações sejam falsas. Significa que resultado de sistema não auditável não é comparável a resultado medido — e que a distância entre os dois é grande.
FrontierMath: quando o gabarito é que estava errado
O FrontierMath, do Epoch AI, tem 295 problemas nos níveis 1 a 3 — de graduação a doutorado avançado — mais um nível 4 de matemática de pesquisa. As avaliações rodam sobre conjuntos privados, proteção real contra contaminação.
E aqui está o episódio mais instrutivo de toda esta série. Em 12 de junho de 2026, o Epoch publicou a versão 2 do benchmark após uma auditoria que corrigiu erros em 42% dos problemas — foram 123 correções nos níveis 1 a 3 e 12 no nível 4, com alguns itens removidos.
A maioria eram erros triviais de cálculo — sinal trocado, diferença de uma unidade — na extração da resposta final. E o efeito da correção foi elevar as notas de todos os modelos: eles estavam sendo penalizados por gabarito errado. Depois da revisão, o topo dos níveis 1 a 3 chegou a 85%.
A lição vale para qualquer comparação: scores anteriores à versão 2 não são comparáveis aos atuais. E o próprio Epoch situa a taxa de erro original como comparável à do ImageNet — ou seja, não é anomalia, é o estado da arte da construção de benchmark.
Uma ressalva de transparência: a OpenAI financia o FrontierMath, conflito de interesse que o projeto declara.
GDPval-AA v2 — tarefas econômicas reais (Elo)
44 ocupações em 9 setores. Linha de base humana ancorada em 1000. Em violeta, pesos abertos.
Comparação cega par a par com juiz automatizado, não avaliação por especialistas humanos.
GDPval: tarefas econômicas reais
É o benchmark mais próximo de “o modelo faz o trabalho que uma pessoa é paga para fazer”. Cobre 44 ocupações em 9 setores de peso no PIB, com tarefas escritas por profissionais de 14 anos de experiência média.
Na versão avaliada de forma independente, o Elo é ancorado em 1000 como linha de base humana, e os modelos operam com acesso a terminal e navegação web em ciclo agêntico. O Qwen3.8 Max, de pesos abertos, aparece em quinto com 1737 — próximo do topo proprietário.
⚠️ Um detalhe metodológico que corrige uma leitura comum: o julgamento é feito por comparação cega com juiz automatizado, não por especialistas humanos. A âncora humana em 1000 é a referência comparada, não o avaliador. Muitos artigos descrevem esse teste como “avaliado por especialistas” — não é.
Análise de dados de verdade: DABStep
Se o seu caso de uso é IA analisando planilha, base ou log, este é o teste que importa. O DABStep, construído pela Adyen com o Hugging Face, tem mais de 450 tarefas extraídas de cargas de trabalho reais, divididas entre fáceis e difíceis.
O resultado é o mais sóbrio desta série:
- Nas tarefas fáceis, um modelo de raciocínio faz 76%
- Nas difíceis, o mesmo modelo cai para 14,5%
- No conjunto completo, os melhores agentes ficam em torno de 16%
A razão do colapso é instrutiva: as tarefas difíceis exigem combinar processamento de dados em código com raciocínio sobre documentação heterogênea — ler a especificação de um campo, entender a regra de negócio, e só então calcular. É exatamente o trabalho de um analista, e é onde a IA ainda falha na maior parte das vezes.
SQL e outros testes de dados
| Benchmark | O que mede | Situação |
|---|---|---|
| BIRD-SQL | Texto para SQL sobre bases grandes e sujas | Ativo; sem scores 2026 verificados |
| Spider 2.0 | SQL em ambiente empresarial realista | Ativo; sem scores 2026 verificados |
| DS-1000 | Ciência de dados em Python | Ativo; sem scores 2026 verificados |
| DABStep | Análise sobre dados reais, fácil e difícil | Ativo com dados |
Sobre benchmark de planilha e BI: procurei e não localizei nenhum ativo e confiável. Se alguém apresentar número para “IA no Excel”, peça a fonte.
Vale notar um padrão que atravessa a área: dois estudos publicados em 2026 argumentam que erros de anotação comprometem os rankings de texto para SQL — o mesmo problema que a auditoria do FrontierMath expôs em matemática. Benchmark é software, e software tem bug.
Casos de uso e qual teste consultar
- Análise exploratória de base própria — DABStep. E calibre expectativa: o teto medido em tarefa complexa é baixo.
- Gerar consulta SQL — BIRD-SQL e Spider 2.0 para entender a metodologia; teste no seu esquema para decidir.
- Cálculo e modelagem estatística — MathArena, ignorando AIME e HMMT por saturação.
- Automatizar trabalho de analista — GDPval, lembrando que o juiz é automatizado.
- Relatório recorrente sobre dado estruturado — nenhum benchmark cobre bem; monte um teste próprio com dez perguntas que você já sabe responder.
O erro mais comum nesta categoria é confundir resolver problema fechado com analisar dado aberto. Modelos são excelentes no primeiro e medianos no segundo, e nenhum ranking de olimpíada avisa isso.
Fontes
- MathArena · Avaliação da IMO com juízes humanos
- FrontierMath · Níveis e a auditoria da versão 2 — Epoch AI
- GDPval-AA · Conjunto de dados original
- DABStep · paper
- BIRD-SQL · Spider 2.0 · DS-1000
Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Benchmark de texto · de agentes · de multimodal
- Análise de demanda — onde o hype de IA em previsão não se sustenta
- Benchmark de IA — a definição no glossário