Tudo sobre

Benchmark de geração de imagem por IA: Elo e testes (2026)

Benchmark de geração de imagem por IA se divide em dois tipos: arena de preferência humana , em que pessoas comparam pares de imagens sem saber qual...

**Benchmark de geração de imagem por [IA](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/)** se divide em dois tipos: **arena de preferência humana**, em que pessoas comparam pares de imagens [sem](https://clubmartech.com.br/blog/sem-avancado-estrategia-roi/) saber qual modelo gerou cada uma, e **benchmark técnico**, que mede alinhamento entre o pedido e o resultado por métrica automática. Para decisão de [marketing](https://comecandonaweb.com.br/marketing-digital/), a arena vale mais — imagem é julgada por gente, não por detector de objeto. Na leitura de **17 de agosto de 2026**, o **GPT Image 2 lidera em texto para imagem com Elo 1370**. Mas o número que muda a decisão é outro: o **Nano Banana 2 fica em 3º com 1321 e custa três vezes menos** — US$ 67 contra US$ 211 por mil imagens.

Image Arena — texto para imagem (Elo, 17/08/2026)Preferência humana em comparação cega. Em violeta, os que custam menos de US$ 100 por mil imagens. GPT Image 2 (high)1370 Reve 2.11323 Nano Banana 21321 GPT Image 1.5 (high)1311 MAI-Image-2.51306 Nano Banana Pro1298 Seedream 5.0 Pro1281 FLUX.2 [max]1229 Seedream 4.51205 Imagen 4 Ultra1189 [Midjourney](https://clubmartech.com.br/blog/midjourney-ia-visual-marketing/) v7 Alpha1092 Elo muda diariamente. O 1º lugar custa US$ 211 por mil imagens; o 3º custa US$ 67 — três vezes menos por 49 pontos de diferença.
Fonte: Artificial Analysis · leitura de 17/08/2026

## ⚠️ Como ler Elo sem errarTrês cuidados que quase nenhum comparativo menciona, e que mudam a leitura da tabela acima:

  • **Intervalo de confiança existe.** Reve 2.1 marca 1323 ± 9 e Nano Banana 2 marca 1321 ± 8 — as faixas se sobrepõem, então **é empate estatístico**. Dizer que um é melhor que o outro não se sustenta.
  • **Volume de votos importa.** O Midjourney v7 Alpha tem **2.934 votos**, contra mais de 14 mil dos líderes. Amostra pequena produz posição instável.
  • **Elo muda todo dia.** Qualquer tabela publicada é um retrato datado. Esta é de 17/08/2026.

## O custo muda a resposta

Custo por mil imagens (US$)Mesma leitura de 17/08/2026. Em violeta, o líder de qualidade. GPT Image 2 (1º em Elo)211 US$ Reve 2.1200 US$ Nano Banana Pro134 US$ GPT Image 1.5133 US$ Seedream 5.0 Pro90 US$ FLUX.2 [max]70 US$ Nano Banana 2 (3º em Elo)67 US$ Imagen 4 Ultra60 US$ MAI-Image-2.548.1 US$ Seedream 4.540 US$
Fonte: Artificial Analysis · leitura de 17/08/2026

Cruzando qualidade e preço, o quadro fica mais claro do que olhando só o ranking:

ModeloEloUS$/1k imagensLeitura
GPT Image 2 (high)1370211Melhor qualidade, maior preço
**Nano Banana 2**1321**67****Melhor relação custo-qualidade**
MAI-Image-2.5130648Barato e competitivo
Nano Banana Pro1298134Perde para o “2” em Elo e preço
Seedream 5.0 Pro1281~90Preço de fonte secundária
Seedream 4.5120540Volume alto e custo mínimo

O caso mais curioso é interno ao Google: **o Nano Banana 2 tem Elo maior e preço menor que o Nano Banana Pro**. Se você assumiu que “Pro” significa melhor, vale reconferir — a numeração comercial da família não segue a hierarquia dos modelos-base, como detalho no

artigo do Nano Banana

.## Edição de imagem é outro ranking — e ninguém dominaEditar imagem existente é tarefa diferente de gerar do zero, e tem leaderboard próprio. Aqui o quadro é de **empate generalizado**: os sete primeiros couberam em 19 pontos de Elo.

ModeloElo em edição
Reve 2.11263
GPT Image 21257
MAI-Image-2.51257
Nano Banana 21249
Seedream 5.0 Pro1248
Nano Banana Pro1244

Duas observações práticas: **o GPT Image 2 perde a liderança isolada** que tem em geração, e o **Midjourney simplesmente não aparece** nesse ranking. Já o FLUX.2 [max] custa **US$ 140 por mil em edição contra US$ 70 em geração** — o dobro pela mesma família de modelo, detalhe que estoura orçamento de quem planeja fluxo de retoque.## Os benchmarks técnicos e o que cada um mede

BenchmarkO que medeComo
**GenEval**Alinhamento entre pedido e objetos presentesDetector de objeto (Mask2Former), 6 categorias
**DPG-Bench**Aderência a instruções longas e densasSem paper próprio — vem do trabalho ELLA
**T2I-CompBench++**Composicionalidade: atributo, relação espacial, contagem8.000 prompts, avaliação por modelo multimodal
**HPSv2**Preferência humana aprendidaTreinado sobre 798 mil escolhas humanas

⚠️ Duas armadilhas ao citar esses [testes](https://clubmartech.com.br/blog/testes-moderados-valide-retrabalho/). A primeira: **não misture HPSv2 com HPSv2.1** na mesma tabela — os scores não são comparáveis. A segunda: **não existe leaderboard atualizado desses benchmarks para os modelos de 2026**. Eles são úteis para entender o que se mede, não para ranquear o que está no mercado hoje.## Texto dentro da imagem: o ponto fraco que persisteAqui há um número verificado e ele é desconfortável. O **OCRGenBench** avalia justamente a capacidade de renderizar texto legível dentro da imagem gerada, com métrica que combina acurácia do texto, qualidade estética e aderência ao pedido, sobre **1.060 amostras anotadas por pessoas**, em teste bilíngue.O resultado, na formulação do próprio estudo: entre **19 modelos de ponta avaliados, a maioria fica abaixo de 60 em 100**. Para quem produz peça com chamada, preço ou nome de marca embutido na imagem, isso significa que **revisão humana continua obrigatória** — independente do modelo escolhido.## O que não tem benchmark confiávelSendo direto sobre os limites, porque isso vale mais que preencher a lacuna com número duvidoso:

  • **Geração de SVG** — existe um “SVGBench” com scores altos ([Claude](https://clubmartech.com.br/blog/claude-pratica-assistentes-ia/) Opus 4.6 em 75,6%), mas ele mede **modelo de linguagem escrevendo código SVG**, não gerador de imagem produzindo vetor. Colocá-lo ao lado de Elo de Nano Banana seria erro de categoria.
  • **3D** — GSO e Objaverse são **conjuntos de [dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/), não rankings**. Cada artigo usa protocolo próprio, e os números não são comparáveis entre publicações.
  • **Consistência de personagem** — o benchmark de referência, o DreamBench++, avalia sete modelos usando um modelo multimodal como juiz, mas **não divulga quais modelos compõem o conjunto**, o que impede saber se as [APIs](https://clubmartech.com.br/significado/apis/) atuais estão representadas.

Se qualquer um desses é requisito do seu projeto, **teste você mesmo**: dez prompts representativos, mesmo pedido em três modelos, avaliação cega por duas pessoas do time. É mais confiável que qualquer tabela publicada hoje.## Casos de uso mais comuns

  • **Peça de campanha em volume** — Nano Banana 2 ou MAI-Image-2.5 pelo custo; a diferença de Elo frente ao líder é pequena e o desconto é grande.
  • **Imagem hero e material impresso** — GPT Image 2 se o orçamento permitir, ou Nano Banana Pro pela resolução em 4K.
  • **Retoque e variação de peça existente** — o ranking de edição, onde o empate técnico dá liberdade para escolher por preço e integração.
  • **Direção de arte autoral** — Midjourney continua relevante pela estética, mesmo com Elo baixo e sem API pública.
  • **[Conteúdo](https://clubmartech.com.br/blog/conteudo-longo-prazo-anos/) que exige rastreabilidade** — priorize marca d’água no pixel, como o SynthID; detalhado no panorama de modelos.

## Fontes

## Leia também

Compartilhe:
Foto de Dionatha Rodrigues

Dionatha Rodrigues

Dionatha é bacharel em Sistemas de Informação e especialista em Martech, com mais de 17 anos de experiência na integração de Marketing e Tecnologia para impulsionar negócios, equipes e profissionais a compreenderem e otimizarem as operações de marketing digital e tecnologia. Sua expertise técnica abrange áreas-chave como SEO técnico, Analytics, CRM, Chatbots, CRO (Conversion Rate Optimization) e automação de processos.

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!