**Benchmark de agentes de [IA](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/)** mede se o modelo consegue **concluir trabalho** — operar computador, navegar, usar [ferramentas](https://clubmartech.com.br/blog/ferramentas-heatmap-converter-receita/), atender uma solicitação de ponta a ponta — e não apenas responder bem. É a categoria onde os números mais contradizem o discurso de mercado. O exemplo mais eloquente: no OSWorld, benchmark de uso de computador, o topo faz **86% na versão 1** e desaba para **20,6% na versão 2**. Mesma família de teste, mesma capacidade avaliada. A diferença é o **horizonte da tarefa**: a v2 usa tarefas que levam cerca de 1,6 hora para uma pessoa concluir, com média de **318 chamadas de ferramenta**. [Automação](https://clubmartech.com.br/blog/automacao-[testes](https://clubmartech.com.br/blog/testes-moderados-valide-retrabalho/)-script-inteligente/) longa continua sendo problema aberto, e este artigo mostra com dado onde está o limite.
## O colapso é função do tempo de tarefaOs autores do OSWorld 2.0 publicaram o recorte que explica tudo. Nas **108 tarefas** da versão, distribuídas em 31 sites auto-hospedados e com 27 pontos de verificação em média:
- Em tarefas de **menos de 45 minutos**, os modelos ficam entre **20% e 24%**
- Na faixa de **137 a 163 minutos**, **ninguém passa de 10%**
- **Acima de 163 minutos, o resultado é zero** — nenhum modelo conclui
E **69,6% das tarefas levam mais de uma hora**. Ou seja: o benchmark foi desenhado para medir exatamente onde os agentes falham. Para quem planeja [automação](https://clubmartech.com.br/blog/automacao-[testes](https://clubmartech.com.br/blog/testes-moderados-valide-retrabalho/)-script-inteligente/), a leitura prática é clara — **quebre o processo em etapas curtas verificáveis** em vez de delegar o fluxo inteiro.Uma nota de método sobre a versão 1: as submissões podem **excluir 8 tarefas de Google Drive**, rodando 361 em vez de 369. É permitido oficialmente, mas significa que **o denominador varia entre submissões** — comparar percentuais exige checar a base.
## ARC-AGI: onde a fronteira se moveuA série ARC-AGI mede adaptação a problemas inéditos, e a evolução entre versões conta a história do ano:
| Versão | Topo atual | Situação |
|---|---|---|
| ARC-AGI-1 | 98,5% | **Saturado** — não discrimina mais |
| ARC-AGI-2 | 92,5% | Caiu rápido em 2026; deixando de ser fronteira |
| **ARC-AGI-3** | **30,2%** | **Fronteira real** — exige adaptação em ambiente interativo |
No ARC-AGI-3 a distância entre o líder e o segundo é a maior de qualquer benchmark deste levantamento: **30,2% contra 7,8%** — quase quatro vezes. Todos os demais ficam abaixo de 2,2%.Dois detalhes que merecem atenção. O **nível de esforço muda tudo**: o mesmo modelo vai de 0,3% na configuração mínima a 7,8% na máxima. E o **custo é brutal** — as execuções de topo custam mais de **US$ 20 mil**, o que torna esses números demonstração de capacidade, não indicação de uso viável.## τ³-bench: o teto do agente empresarialSe existe um benchmark que espelha o caso de uso corporativo, é este. O **τ³-Banking** simula [atendimento](https://comecandonaweb.com.br/atendimento-ao-cliente/) bancário sobre uma base de cerca de **700 documentos**, medindo consistência em múltiplas tentativas.
| Modelo | Resultado | Tipo |
|---|---|---|
| **Qwen 3.8 Max** | **55,2%** | **pesos abertos** |
| Claude Opus 5 | 48,7% | proprietário |
| Grok 4.5 | 47,9% | proprietário |
| GPT-5.6 Sol | 46,9% | proprietário |
| Kimi K3 | 37,1% | pesos abertos |
Duas conclusões. Primeira: **um modelo de pesos abertos lidera com 6,5 pontos de folga** sobre o melhor proprietário. Segunda, e mais importante para expectativa: **mesmo o líder falha em cerca de 45% das tarefas**. Esse é o teto real de agente de atendimento confiável hoje — quem promete automação total está vendendo o que o benchmark não sustenta.Nota de endereço: o projeto **migrou para
taubench.com**, e a versão τ³ acrescentou tarefas intensivas em conhecimento e agentes de voz.## Os outros testes da categoria
- **GAIA** — 466 questões, 300 retidas para o ranking, em três níveis de dificuldade; combina raciocínio, multimodalidade, navegação e ferramentas. O contraste original é didático: **humanos acertavam 92% contra 15% do [GPT-4](https://clubmartech.com.br/blog/gpt-modelos-assistentes-marketing/) com plugins**. Não consegui ler o ranking atual — a plataforma que o hospeda está bloqueada nesta sessão.
- **AutomationBench-AA** — 657 tarefas de fluxo em software de [gestão](https://clubmartech.com.br/blog/gestao-incidentes-orientada-[kpis](https://clubmartech.com.br/blog/kpis-marketing-definir-resultados/)/), avaliadas por conclusão objetiva **com conformidade a regras**. Fica fora do índice composto e é reportado à parte.
- **WebArena** — de 2023, hoje considerado superado pelo OSWorld 2.0 e pelo τ³. Vale como referência histórica.
## ⚠️ Uma correção que vale registrarCircula a informação de que a correção de bugs do OSWorld-Verified teria sido reportada por um fabricante específico. Fui verificar: os **agradecimentos do projeto listam a empresa entre as instituições que deram retorno**, mas **nenhuma correção é atribuída exclusivamente a ela**. A fonte não sustenta a afirmação — e é o tipo de detalhe que se propaga sem checagem.## Casos de uso e o que esperar
- **Atendimento com consulta a base de conhecimento** — τ³ é o teste certo. Planeje com escalonamento humano: o teto é ~55%.
- **Automação de tarefa repetitiva curta** — viável. É a faixa em que o OSWorld 2.0 mostra 20% a 24%, e tarefa curta com verificação melhora muito na prática.
- **Fluxo longo de ponta a ponta** — não delegue inteiro. Acima de duas horas de trabalho equivalente, o resultado medido é zero.
- **Uso de computador em interface visual** — OSWorld, sempre checando qual versão o número cita.
- **Pesquisa com múltiplas fontes** — GAIA e BrowseComp, este último tratado no artigo de texto e raciocínio.
A regra que sintetiza a categoria: **agentes funcionam bem em tarefa curta e verificável, e mal em processo longo**. Desenhar o fluxo em torno disso é a diferença entre automação que funciona e piloto que morre.## Fontes
- OSWorld 2.0 · OSWorld 1.0 / Verified — XLANG Lab
- τ³-bench — Sierra
- ARC-AGI — ARC Prize Foundation
- GAIA — paper original
- Metodologia do índice (inclui AutomationBench) — Artificial Analysis
## Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Benchmark de código · de texto · de dados
- Automação de marketing — desenho de fluxo que não vira ruído
- Benchmark de IA — a definição no glossário