Benchmark de IA para código tem um problema de credibilidade que este artigo trata de frente: o teste mais citado do mercado está saturado. No SWE-bench Verified, o topo chegou a 96% — praticamente todas as tarefas resolvidas —, o que significa que ele deixou de discriminar modelos. Quando a mesma tarefa é aplicada num conjunto desenhado para resistir a contaminação, o SWE-bench Pro, o melhor resultado cai para 61,5%. É a mesma capacidade medida com régua diferente, e a diferença de 35 pontos explica por que comparativo baseado num número só engana.
O contraste que define o benchmark de código (%)
Mesma tarefa — resolver issue real de repositório — em duas versões do teste.
O Verified está saturado; o Pro usa 1.865 tarefas de repositórios com licença copyleft, escolhidos para dificultar contaminação de treino.
Por que o Pro é mais difícil
A diferença não é aleatória — está no desenho do teste:
| SWE-bench Verified | SWE-bench Pro | |
|---|---|---|
| Tarefas | 500 | 1.865 (731 públicas) |
| Repositórios | projetos populares | 41, com licença copyleft |
| Curadoria | revisão humana de cada item | 276 tarefas de bases proprietárias |
| Solução média | — | 107 linhas em 4,1 arquivos |
| Topo atual | 96,0% (autorreportado) | 61,5% (independente) |
A escolha das licenças copyleft foi deliberada: dificulta que o código tenha entrado nos dados de treino. E 858 tarefas ficam retidas, sem publicação, para impedir ajuste ao teste.
SWE-bench Pro — taxa de resolução (%)
1.865 tarefas em 41 repositórios. Solução média: 107 linhas em 4,1 arquivos.
Terminal-Bench: e a pegadinha do “agente + modelo”
O Terminal-Bench 2.1 tem 89 tarefas e mede algo mais próximo do trabalho real: executar comandos, corrigir o que falha, iterar. Mas há um detalhe metodológico que muda a interpretação de todos os números.
| Agente + modelo | Resultado |
|---|---|
| Claude Code + Fable 5 | 83,8% ± 1,2 |
| Codex + GPT-5.5 | 83,1% ± 1,1 |
| Terminus 2 + Fable 5 | 80,4% |
| Cursor CLI + Grok 4.5 | 79,3% |
| Claude Code + Opus 4.8 | 78,9% |
⚠️ O leaderboard mede a dupla, não o modelo isolado. Veja o Fable 5: faz 83,8% no Claude Code e 80,4% no Terminus 2 — 3,4 pontos de diferença pelo agente, com o mesmo modelo. Quem lê “modelo X faz 83,8%” está atribuindo ao modelo um resultado que é do conjunto.
Isso também serve de alerta para números autorreportados. Já vi fabricante publicar 88,3% neste teste — valor acima do primeiro lugar do ranking oficial, e para um modelo que não figura entre as 17 entradas avaliadas. Não é necessariamente falso: é medição própria, com scaffold próprio, e não deve ser comparada com posição de leaderboard.
Front-end: onde os modelos abertos empatam
A WebDev Arena mede preferência humana sobre interfaces geradas — 579.848 votos sobre 115 modelos, em agosto de 2026. E o resultado tem uma implicação econômica direta:
| Modelo | Elo | Licença |
|---|---|---|
| Claude Opus 5 (max) | 1692 | proprietário |
| Kimi K3 (max) | 1674 | pesos abertos |
| Qwen3.8 (max) | 1667 | pesos abertos |
| Claude Opus 5 (high) | 1663 | proprietário |
| Grok 4.6 (high) | 1631 | proprietário |
| GLM-5.2 (max) | 1585 | MIT |
| DeepSeek V4 Pro | 1584 | MIT |
O segundo e o terceiro lugares são de pesos abertos. A distância entre o 2º e o 4º é indistinguível dentro do intervalo de confiança — ou seja, para gerar interface, modelo aberto está tecnicamente empatado com o topo proprietário. Detalho o que isso significa em custo no artigo de self-host.
Segurança: Cybench
Para avaliar capacidade em segurança, a referência independente é o Cybench, de Stanford: 40 desafios de captura de bandeira de nível profissional, extraídos de quatro competições, em seis categorias — criptografia, web, engenharia reversa, forense, exploração e escalada de privilégio.
A metodologia tem dois traços úteis: divide cada desafio em subtarefas, permitindo avaliação gradual, e usa o tempo que humanos levaram para resolver como proxy de dificuldade.
Resultados sem orientação: Claude Opus 4.7 em 40%, Grok 4.1 em 38%, Claude Opus 4.6 em 37%. Números modestos, e é o esperado — são tarefas de profissional de segurança, não exercício de programação.
⚠️ Dois benchmarks que você deve parar de citar
- LiveCodeBench — a janela de problemas vai até maio de 2025 e nenhum modelo de 2026 aparece no ranking. O topo listado é o O4-Mini High, com 80,2. A metodologia é boa e vale entender; o ranking está estagnado.
- Aider Polyglot — 225 exercícios em seis linguagens, mas última atualização em novembro de 2025. Também sem modelos de 2026.
Citar qualquer um dos dois como retrato atual é o erro mais comum em comparativos de código publicados em 2026.
Custo por milhão de tokens — e a pegadinha do tokenizer
| Modelo | Entrada | Saída | Cache |
|---|---|---|---|
| Claude Fable 5 | US$ 10 | US$ 50 | US$ 1 |
| Claude Opus 5 | US$ 5 | US$ 25 | US$ 0,50 |
| Claude Sonnet 5 | US$ 2 | US$ 10 | US$ 0,20 |
| Claude Haiku 4.5 | US$ 1 | US$ 5 | US$ 0,10 |
⚠️ Comparação por token engana a partir do Opus 4.7. Esses modelos usam tokenizador novo, que gera cerca de 30% mais tokens para o mesmo texto. O preço de tabela é igual ao das versões anteriores, mas o custo real por tarefa é maior. Ao comparar gerações, use custo por tarefa concluída — não preço por token.
Casos de uso e qual teste consultar
- Corrigir bug em base existente — SWE-bench Pro, não o Verified. O Pro reflete melhor código real e ainda discrimina.
- Automação de terminal e devops — Terminal-Bench, atentando para a dupla agente + modelo.
- Gerar interface e landing page — WebDev Arena, onde modelo aberto empata com o topo.
- Revisão de segurança — Cybench, com expectativa calibrada: o topo faz 40%.
- Script pontual e automação simples — nenhum benchmark ajuda muito; qualquer modelo atual resolve, então decida por preço.
Fontes
- SWE-bench Verified — página oficial
- SWE-bench Pro — Scale AI
- Terminal-Bench 2.1 — tbench.ai
- WebDev Arena · Cybench
- SciCode · Preços Anthropic
Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Benchmark de agentes · de texto e raciocínio · de self-host
- GitHub Copilot — IA aplicada ao fluxo de desenvolvimento
- Benchmark de IA — a definição no glossário