Tudo sobre

Benchmark de geração de imagem por IA: Elo e testes (2026)

Benchmark de geração de imagem por IA se divide em dois tipos: arena de preferência humana , em que pessoas comparam pares de imagens sem saber qual...

Benchmark de geração de imagem por IA se divide em dois tipos: arena de preferência humana, em que pessoas comparam pares de imagens sem saber qual modelo gerou cada uma, e benchmark técnico, que mede alinhamento entre o pedido e o resultado por métrica automática. Para decisão de marketing, a arena vale mais — imagem é julgada por gente, não por detector de objeto. Na leitura de 17 de agosto de 2026, o GPT Image 2 lidera em texto para imagem com Elo 1370. Mas o número que muda a decisão é outro: o Nano Banana 2 fica em 3º com 1321 e custa três vezes menos — US$ 67 contra US$ 211 por mil imagens.

Image Arena — texto para imagem (Elo, 17/08/2026)

Preferência humana em comparação cega. Em violeta, os que custam menos de US$ 100 por mil imagens.

GPT Image 2 (high)1370 Reve 2.11323 Nano Banana 21321 GPT Image 1.5 (high)1311 MAI-Image-2.51306 Nano Banana Pro1298 Seedream 5.0 Pro1281 FLUX.2 [max]1229 Seedream 4.51205 Imagen 4 Ultra1189 Midjourney v7 Alpha1092

Elo muda diariamente. O 1º lugar custa US$ 211 por mil imagens; o 3º custa US$ 67 — três vezes menos por 49 pontos de diferença.

Fonte: Artificial Analysis · leitura de 17/08/2026

⚠️ Como ler Elo sem errar

Três cuidados que quase nenhum comparativo menciona, e que mudam a leitura da tabela acima:

  • Intervalo de confiança existe. Reve 2.1 marca 1323 ± 9 e Nano Banana 2 marca 1321 ± 8 — as faixas se sobrepõem, então é empate estatístico. Dizer que um é melhor que o outro não se sustenta.
  • Volume de votos importa. O Midjourney v7 Alpha tem 2.934 votos, contra mais de 14 mil dos líderes. Amostra pequena produz posição instável.
  • Elo muda todo dia. Qualquer tabela publicada é um retrato datado. Esta é de 17/08/2026.

O custo muda a resposta

Custo por mil imagens (US$)

Mesma leitura de 17/08/2026. Em violeta, o líder de qualidade.

GPT Image 2 (1º em Elo)211 US$ Reve 2.1200 US$ Nano Banana Pro134 US$ GPT Image 1.5133 US$ Seedream 5.0 Pro90 US$ FLUX.2 [max]70 US$ Nano Banana 2 (3º em Elo)67 US$ Imagen 4 Ultra60 US$ MAI-Image-2.548.1 US$ Seedream 4.540 US$
Fonte: Artificial Analysis · leitura de 17/08/2026

Cruzando qualidade e preço, o quadro fica mais claro do que olhando só o ranking:

ModeloEloUS$/1k imagensLeitura
GPT Image 2 (high)1370211Melhor qualidade, maior preço
Nano Banana 2132167Melhor relação custo-qualidade
MAI-Image-2.5130648Barato e competitivo
Nano Banana Pro1298134Perde para o “2” em Elo e preço
Seedream 5.0 Pro1281~90Preço de fonte secundária
Seedream 4.5120540Volume alto e custo mínimo

O caso mais curioso é interno ao Google: o Nano Banana 2 tem Elo maior e preço menor que o Nano Banana Pro. Se você assumiu que “Pro” significa melhor, vale reconferir — a numeração comercial da família não segue a hierarquia dos modelos-base, como detalho no artigo do Nano Banana.

Edição de imagem é outro ranking — e ninguém domina

Editar imagem existente é tarefa diferente de gerar do zero, e tem leaderboard próprio. Aqui o quadro é de empate generalizado: os sete primeiros couberam em 19 pontos de Elo.

ModeloElo em edição
Reve 2.11263
GPT Image 21257
MAI-Image-2.51257
Nano Banana 21249
Seedream 5.0 Pro1248
Nano Banana Pro1244

Duas observações práticas: o GPT Image 2 perde a liderança isolada que tem em geração, e o Midjourney simplesmente não aparece nesse ranking. Já o FLUX.2 [max] custa US$ 140 por mil em edição contra US$ 70 em geração — o dobro pela mesma família de modelo, detalhe que estoura orçamento de quem planeja fluxo de retoque.

Os benchmarks técnicos e o que cada um mede

BenchmarkO que medeComo
GenEvalAlinhamento entre pedido e objetos presentesDetector de objeto (Mask2Former), 6 categorias
DPG-BenchAderência a instruções longas e densasSem paper próprio — vem do trabalho ELLA
T2I-CompBench++Composicionalidade: atributo, relação espacial, contagem8.000 prompts, avaliação por modelo multimodal
HPSv2Preferência humana aprendidaTreinado sobre 798 mil escolhas humanas

⚠️ Duas armadilhas ao citar esses testes. A primeira: não misture HPSv2 com HPSv2.1 na mesma tabela — os scores não são comparáveis. A segunda: não existe leaderboard atualizado desses benchmarks para os modelos de 2026. Eles são úteis para entender o que se mede, não para ranquear o que está no mercado hoje.

Texto dentro da imagem: o ponto fraco que persiste

Aqui há um número verificado e ele é desconfortável. O OCRGenBench avalia justamente a capacidade de renderizar texto legível dentro da imagem gerada, com métrica que combina acurácia do texto, qualidade estética e aderência ao pedido, sobre 1.060 amostras anotadas por pessoas, em teste bilíngue.

O resultado, na formulação do próprio estudo: entre 19 modelos de ponta avaliados, a maioria fica abaixo de 60 em 100. Para quem produz peça com chamada, preço ou nome de marca embutido na imagem, isso significa que revisão humana continua obrigatória — independente do modelo escolhido.

O que não tem benchmark confiável

Sendo direto sobre os limites, porque isso vale mais que preencher a lacuna com número duvidoso:

  • Geração de SVG — existe um “SVGBench” com scores altos (Claude Opus 4.6 em 75,6%), mas ele mede modelo de linguagem escrevendo código SVG, não gerador de imagem produzindo vetor. Colocá-lo ao lado de Elo de Nano Banana seria erro de categoria.
  • 3D — GSO e Objaverse são conjuntos de dados, não rankings. Cada artigo usa protocolo próprio, e os números não são comparáveis entre publicações.
  • Consistência de personagem — o benchmark de referência, o DreamBench++, avalia sete modelos usando um modelo multimodal como juiz, mas não divulga quais modelos compõem o conjunto, o que impede saber se as APIs atuais estão representadas.

Se qualquer um desses é requisito do seu projeto, teste você mesmo: dez prompts representativos, mesmo pedido em três modelos, avaliação cega por duas pessoas do time. É mais confiável que qualquer tabela publicada hoje.

Casos de uso mais comuns

  • Peça de campanha em volume — Nano Banana 2 ou MAI-Image-2.5 pelo custo; a diferença de Elo frente ao líder é pequena e o desconto é grande.
  • Imagem hero e material impresso — GPT Image 2 se o orçamento permitir, ou Nano Banana Pro pela resolução em 4K.
  • Retoque e variação de peça existente — o ranking de edição, onde o empate técnico dá liberdade para escolher por preço e integração.
  • Direção de arte autoral — Midjourney continua relevante pela estética, mesmo com Elo baixo e sem API pública.
  • Conteúdo que exige rastreabilidade — priorize marca d’água no pixel, como o SynthID; detalhado no panorama de modelos.

Fontes

Leia também

Compartilhe:
Foto de Dionatha Rodrigues

Dionatha Rodrigues

Dionatha é bacharel em Sistemas de Informação e especialista em Martech, com mais de 17 anos de experiência na integração de Marketing e Tecnologia para impulsionar negócios, equipes e profissionais a compreenderem e otimizarem as operações de marketing digital e tecnologia. Sua expertise técnica abrange áreas-chave como SEO técnico, Analytics, CRM, Chatbots, CRO (Conversion Rate Optimization) e automação de processos.

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!