**Benchmark de geração de imagem por [IA](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/)** se divide em dois tipos: **arena de preferência humana**, em que pessoas comparam pares de imagens [sem](https://clubmartech.com.br/blog/sem-avancado-estrategia-roi/) saber qual modelo gerou cada uma, e **benchmark técnico**, que mede alinhamento entre o pedido e o resultado por métrica automática. Para decisão de [marketing](https://comecandonaweb.com.br/marketing-digital/), a arena vale mais — imagem é julgada por gente, não por detector de objeto. Na leitura de **17 de agosto de 2026**, o **GPT Image 2 lidera em texto para imagem com Elo 1370**. Mas o número que muda a decisão é outro: o **Nano Banana 2 fica em 3º com 1321 e custa três vezes menos** — US$ 67 contra US$ 211 por mil imagens.
## ⚠️ Como ler Elo sem errarTrês cuidados que quase nenhum comparativo menciona, e que mudam a leitura da tabela acima:
- **Intervalo de confiança existe.** Reve 2.1 marca 1323 ± 9 e Nano Banana 2 marca 1321 ± 8 — as faixas se sobrepõem, então **é empate estatístico**. Dizer que um é melhor que o outro não se sustenta.
- **Volume de votos importa.** O Midjourney v7 Alpha tem **2.934 votos**, contra mais de 14 mil dos líderes. Amostra pequena produz posição instável.
- **Elo muda todo dia.** Qualquer tabela publicada é um retrato datado. Esta é de 17/08/2026.
## O custo muda a resposta
Cruzando qualidade e preço, o quadro fica mais claro do que olhando só o ranking:
| Modelo | Elo | US$/1k imagens | Leitura |
|---|---|---|---|
| GPT Image 2 (high) | 1370 | 211 | Melhor qualidade, maior preço |
| **Nano Banana 2** | 1321 | **67** | **Melhor relação custo-qualidade** |
| MAI-Image-2.5 | 1306 | 48 | Barato e competitivo |
| Nano Banana Pro | 1298 | 134 | Perde para o “2” em Elo e preço |
| Seedream 5.0 Pro | 1281 | ~90 | Preço de fonte secundária |
| Seedream 4.5 | 1205 | 40 | Volume alto e custo mínimo |
O caso mais curioso é interno ao Google: **o Nano Banana 2 tem Elo maior e preço menor que o Nano Banana Pro**. Se você assumiu que “Pro” significa melhor, vale reconferir — a numeração comercial da família não segue a hierarquia dos modelos-base, como detalho no
artigo do Nano Banana.## Edição de imagem é outro ranking — e ninguém dominaEditar imagem existente é tarefa diferente de gerar do zero, e tem leaderboard próprio. Aqui o quadro é de **empate generalizado**: os sete primeiros couberam em 19 pontos de Elo.
| Modelo | Elo em edição |
|---|---|
| Reve 2.1 | 1263 |
| GPT Image 2 | 1257 |
| MAI-Image-2.5 | 1257 |
| Nano Banana 2 | 1249 |
| Seedream 5.0 Pro | 1248 |
| Nano Banana Pro | 1244 |
Duas observações práticas: **o GPT Image 2 perde a liderança isolada** que tem em geração, e o **Midjourney simplesmente não aparece** nesse ranking. Já o FLUX.2 [max] custa **US$ 140 por mil em edição contra US$ 70 em geração** — o dobro pela mesma família de modelo, detalhe que estoura orçamento de quem planeja fluxo de retoque.## Os benchmarks técnicos e o que cada um mede
| Benchmark | O que mede | Como |
|---|---|---|
| **GenEval** | Alinhamento entre pedido e objetos presentes | Detector de objeto (Mask2Former), 6 categorias |
| **DPG-Bench** | Aderência a instruções longas e densas | Sem paper próprio — vem do trabalho ELLA |
| **T2I-CompBench++** | Composicionalidade: atributo, relação espacial, contagem | 8.000 prompts, avaliação por modelo multimodal |
| **HPSv2** | Preferência humana aprendida | Treinado sobre 798 mil escolhas humanas |
⚠️ Duas armadilhas ao citar esses [testes](https://clubmartech.com.br/blog/testes-moderados-valide-retrabalho/). A primeira: **não misture HPSv2 com HPSv2.1** na mesma tabela — os scores não são comparáveis. A segunda: **não existe leaderboard atualizado desses benchmarks para os modelos de 2026**. Eles são úteis para entender o que se mede, não para ranquear o que está no mercado hoje.## Texto dentro da imagem: o ponto fraco que persisteAqui há um número verificado e ele é desconfortável. O **OCRGenBench** avalia justamente a capacidade de renderizar texto legível dentro da imagem gerada, com métrica que combina acurácia do texto, qualidade estética e aderência ao pedido, sobre **1.060 amostras anotadas por pessoas**, em teste bilíngue.O resultado, na formulação do próprio estudo: entre **19 modelos de ponta avaliados, a maioria fica abaixo de 60 em 100**. Para quem produz peça com chamada, preço ou nome de marca embutido na imagem, isso significa que **revisão humana continua obrigatória** — independente do modelo escolhido.## O que não tem benchmark confiávelSendo direto sobre os limites, porque isso vale mais que preencher a lacuna com número duvidoso:
- **Geração de SVG** — existe um “SVGBench” com scores altos ([Claude](https://clubmartech.com.br/blog/claude-pratica-assistentes-ia/) Opus 4.6 em 75,6%), mas ele mede **modelo de linguagem escrevendo código SVG**, não gerador de imagem produzindo vetor. Colocá-lo ao lado de Elo de Nano Banana seria erro de categoria.
- **3D** — GSO e Objaverse são **conjuntos de [dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/), não rankings**. Cada artigo usa protocolo próprio, e os números não são comparáveis entre publicações.
- **Consistência de personagem** — o benchmark de referência, o DreamBench++, avalia sete modelos usando um modelo multimodal como juiz, mas **não divulga quais modelos compõem o conjunto**, o que impede saber se as [APIs](https://clubmartech.com.br/significado/apis/) atuais estão representadas.
Se qualquer um desses é requisito do seu projeto, **teste você mesmo**: dez prompts representativos, mesmo pedido em três modelos, avaliação cega por duas pessoas do time. É mais confiável que qualquer tabela publicada hoje.## Casos de uso mais comuns
- **Peça de campanha em volume** — Nano Banana 2 ou MAI-Image-2.5 pelo custo; a diferença de Elo frente ao líder é pequena e o desconto é grande.
- **Imagem hero e material impresso** — GPT Image 2 se o orçamento permitir, ou Nano Banana Pro pela resolução em 4K.
- **Retoque e variação de peça existente** — o ranking de edição, onde o empate técnico dá liberdade para escolher por preço e integração.
- **Direção de arte autoral** — Midjourney continua relevante pela estética, mesmo com Elo baixo e sem API pública.
- **[Conteúdo](https://clubmartech.com.br/blog/conteudo-longo-prazo-anos/) que exige rastreabilidade** — priorize marca d’água no pixel, como o SynthID; detalhado no panorama de modelos.
## Fontes
- Image Arena — texto para imagem — Artificial Analysis
- Image Arena — edição — Artificial Analysis
- GenEval · ELLA (origem do DPG-Bench)
- T2I-CompBench++ · HPSv2
- OCRGenBench — texto dentro da imagem gerada
## Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Nano Banana · GPT Image · Seedream — os modelos desta comparação
- Benchmark de vídeo · de multimodal
- Benchmark de IA — a definição no glossário