Benchmark de geração de imagem por IA se divide em dois tipos: arena de preferência humana, em que pessoas comparam pares de imagens sem saber qual modelo gerou cada uma, e benchmark técnico, que mede alinhamento entre o pedido e o resultado por métrica automática. Para decisão de marketing, a arena vale mais — imagem é julgada por gente, não por detector de objeto. Na leitura de 17 de agosto de 2026, o GPT Image 2 lidera em texto para imagem com Elo 1370. Mas o número que muda a decisão é outro: o Nano Banana 2 fica em 3º com 1321 e custa três vezes menos — US$ 67 contra US$ 211 por mil imagens.
Image Arena — texto para imagem (Elo, 17/08/2026)
Preferência humana em comparação cega. Em violeta, os que custam menos de US$ 100 por mil imagens.
Elo muda diariamente. O 1º lugar custa US$ 211 por mil imagens; o 3º custa US$ 67 — três vezes menos por 49 pontos de diferença.
⚠️ Como ler Elo sem errar
Três cuidados que quase nenhum comparativo menciona, e que mudam a leitura da tabela acima:
- Intervalo de confiança existe. Reve 2.1 marca 1323 ± 9 e Nano Banana 2 marca 1321 ± 8 — as faixas se sobrepõem, então é empate estatístico. Dizer que um é melhor que o outro não se sustenta.
- Volume de votos importa. O Midjourney v7 Alpha tem 2.934 votos, contra mais de 14 mil dos líderes. Amostra pequena produz posição instável.
- Elo muda todo dia. Qualquer tabela publicada é um retrato datado. Esta é de 17/08/2026.
O custo muda a resposta
Custo por mil imagens (US$)
Mesma leitura de 17/08/2026. Em violeta, o líder de qualidade.
Cruzando qualidade e preço, o quadro fica mais claro do que olhando só o ranking:
| Modelo | Elo | US$/1k imagens | Leitura |
|---|---|---|---|
| GPT Image 2 (high) | 1370 | 211 | Melhor qualidade, maior preço |
| Nano Banana 2 | 1321 | 67 | Melhor relação custo-qualidade |
| MAI-Image-2.5 | 1306 | 48 | Barato e competitivo |
| Nano Banana Pro | 1298 | 134 | Perde para o “2” em Elo e preço |
| Seedream 5.0 Pro | 1281 | ~90 | Preço de fonte secundária |
| Seedream 4.5 | 1205 | 40 | Volume alto e custo mínimo |
O caso mais curioso é interno ao Google: o Nano Banana 2 tem Elo maior e preço menor que o Nano Banana Pro. Se você assumiu que “Pro” significa melhor, vale reconferir — a numeração comercial da família não segue a hierarquia dos modelos-base, como detalho no artigo do Nano Banana.
Edição de imagem é outro ranking — e ninguém domina
Editar imagem existente é tarefa diferente de gerar do zero, e tem leaderboard próprio. Aqui o quadro é de empate generalizado: os sete primeiros couberam em 19 pontos de Elo.
| Modelo | Elo em edição |
|---|---|
| Reve 2.1 | 1263 |
| GPT Image 2 | 1257 |
| MAI-Image-2.5 | 1257 |
| Nano Banana 2 | 1249 |
| Seedream 5.0 Pro | 1248 |
| Nano Banana Pro | 1244 |
Duas observações práticas: o GPT Image 2 perde a liderança isolada que tem em geração, e o Midjourney simplesmente não aparece nesse ranking. Já o FLUX.2 [max] custa US$ 140 por mil em edição contra US$ 70 em geração — o dobro pela mesma família de modelo, detalhe que estoura orçamento de quem planeja fluxo de retoque.
Os benchmarks técnicos e o que cada um mede
| Benchmark | O que mede | Como |
|---|---|---|
| GenEval | Alinhamento entre pedido e objetos presentes | Detector de objeto (Mask2Former), 6 categorias |
| DPG-Bench | Aderência a instruções longas e densas | Sem paper próprio — vem do trabalho ELLA |
| T2I-CompBench++ | Composicionalidade: atributo, relação espacial, contagem | 8.000 prompts, avaliação por modelo multimodal |
| HPSv2 | Preferência humana aprendida | Treinado sobre 798 mil escolhas humanas |
⚠️ Duas armadilhas ao citar esses testes. A primeira: não misture HPSv2 com HPSv2.1 na mesma tabela — os scores não são comparáveis. A segunda: não existe leaderboard atualizado desses benchmarks para os modelos de 2026. Eles são úteis para entender o que se mede, não para ranquear o que está no mercado hoje.
Texto dentro da imagem: o ponto fraco que persiste
Aqui há um número verificado e ele é desconfortável. O OCRGenBench avalia justamente a capacidade de renderizar texto legível dentro da imagem gerada, com métrica que combina acurácia do texto, qualidade estética e aderência ao pedido, sobre 1.060 amostras anotadas por pessoas, em teste bilíngue.
O resultado, na formulação do próprio estudo: entre 19 modelos de ponta avaliados, a maioria fica abaixo de 60 em 100. Para quem produz peça com chamada, preço ou nome de marca embutido na imagem, isso significa que revisão humana continua obrigatória — independente do modelo escolhido.
O que não tem benchmark confiável
Sendo direto sobre os limites, porque isso vale mais que preencher a lacuna com número duvidoso:
- Geração de SVG — existe um “SVGBench” com scores altos (Claude Opus 4.6 em 75,6%), mas ele mede modelo de linguagem escrevendo código SVG, não gerador de imagem produzindo vetor. Colocá-lo ao lado de Elo de Nano Banana seria erro de categoria.
- 3D — GSO e Objaverse são conjuntos de dados, não rankings. Cada artigo usa protocolo próprio, e os números não são comparáveis entre publicações.
- Consistência de personagem — o benchmark de referência, o DreamBench++, avalia sete modelos usando um modelo multimodal como juiz, mas não divulga quais modelos compõem o conjunto, o que impede saber se as APIs atuais estão representadas.
Se qualquer um desses é requisito do seu projeto, teste você mesmo: dez prompts representativos, mesmo pedido em três modelos, avaliação cega por duas pessoas do time. É mais confiável que qualquer tabela publicada hoje.
Casos de uso mais comuns
- Peça de campanha em volume — Nano Banana 2 ou MAI-Image-2.5 pelo custo; a diferença de Elo frente ao líder é pequena e o desconto é grande.
- Imagem hero e material impresso — GPT Image 2 se o orçamento permitir, ou Nano Banana Pro pela resolução em 4K.
- Retoque e variação de peça existente — o ranking de edição, onde o empate técnico dá liberdade para escolher por preço e integração.
- Direção de arte autoral — Midjourney continua relevante pela estética, mesmo com Elo baixo e sem API pública.
- Conteúdo que exige rastreabilidade — priorize marca d’água no pixel, como o SynthID; detalhado no panorama de modelos.
Fontes
- Image Arena — texto para imagem — Artificial Analysis
- Image Arena — edição — Artificial Analysis
- GenEval · ELLA (origem do DPG-Bench)
- T2I-CompBench++ · HPSv2
- OCRGenBench — texto dentro da imagem gerada
Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Nano Banana · GPT Image · Seedream — os modelos desta comparação
- Benchmark de vídeo · de multimodal
- Benchmark de IA — a definição no glossário