Modelos de IA são os sistemas treinados que geram texto, imagem, vídeo ou código a partir de instruções. Em agosto de 2026 o mercado se organiza em três blocos: modelos de linguagem, geradores de imagem e geradores de vídeo. Os números das tabelas dão a escala da decisão: só na entrada dos modelos de linguagem, a diferença de preço entre o GPT-5.6 Luna e o Sol é de 25 vezes — e, no índice independente, o Claude Opus 5 lidera com 63 pontos. Este guia reúne as versões atuais de cada um, com preço e onde usar, e serve de índice para os artigos dedicados. Uma advertência necessária antes das tabelas: este panorama tem data. A cadência de lançamento passou a ser mensal — a Anthropic publicou mais de vinte versões do Claude entre 2023 e 2026, e a OpenAI trocou de família três vezes só em 2026. Confira a documentação oficial antes de fechar contrato ou dimensionar custo.
Modelos de linguagem: o que está disponível hoje
| Modelo | Empresa | Contexto | Preço (US$/1M tokens) |
|---|---|---|---|
| Claude Opus 5 | Anthropic | 1M | 5 / 25 |
| Claude Sonnet 5 | Anthropic | 1M | 2 / 10 |
| GPT-5.6 Sol | OpenAI | 1,05M | 5 / 30 |
| GPT-5.6 Terra | OpenAI | 1,05M | 2 / 12 |
| GPT-5.6 Luna | OpenAI | 1,05M | 0,20 / 1,20 |
| Gemini 3.7 Flash | 1M | 0,75 / 3,75 | |
| DeepSeek V4 Pro | DeepSeek | 1M | 0,66 / 1,98 (fora de pico) |
| Grok 4.6 | SpaceXAI | 500K | 2 / 6 |
| Mistral Large 3 (Apache 2.0) | Mistral AI | — | ver artigo |
| Kimi K3 (aberto) | Moonshot AI | 1M | 3 / 15 (cache 0,30) |
O ponto mais útil dessa tabela é a amplitude de preço: entre o GPT-5.6 Luna e o Sol há diferença de 25 vezes na entrada. Para classificação, extração e roteamento — o grosso do uso em marketing — o modelo mais barato costuma resolver. Reserve o topo de linha para raciocínio longo e trabalho agêntico.
Geradores de imagem
| Modelo | Empresa | Preço por imagem | Marca d’água | Acesso do Brasil |
|---|---|---|---|---|
| Nano Banana Pro | US$ 0,134 (1-2K) · 0,24 (4K) | SynthID (no pixel) | Direto | |
| gpt-image-2 | OpenAI | US$ 0,053 (média) · 0,211 (alta) | C2PA (metadado) | Direto |
| Seedream 5.0 Pro | ByteDance | US$ 0,045 (1K) · 0,09 (2K) | Não confirmado | Via Dreamina |
| Midjourney | Midjourney | por assinatura | — | Direto |
| Adobe Firefly | Adobe | por assinatura | Content Credentials | Direto |
| Stable Diffusion | Stability AI | open weights | — | Direto |
A diferença de marca d’água merece atenção de quem tem exigência de conformidade. O SynthID do Google marca o pixel e sobrevive a print de tela e recompressão; os metadados C2PA da OpenAI desaparecem quando a imagem é printada ou passa por rede social. Se rastreabilidade de origem é requisito no seu setor, isso pesa mais que qualidade estética.
Geradores de vídeo
É o segmento mais instável do momento, e por um motivo concreto: a Sora, da OpenAI, está sendo encerrada. O aplicativo saiu em abril de 2026 e a API será desligada em 24 de setembro de 2026, sem substituto anunciado. Quem construiu fluxo sobre ela precisa migrar.
As alternativas em operação incluem o Seedance da ByteDance, o Higgsfield — voltado a controle de câmera e efeitos cinematográficos —, o Veo do Google e o Kling. O guia de plataformas de vídeo marketing cobre o lado de distribuição e medição.
A convergência de 2026: raciocínio antes de gerar
Há um padrão que atravessa as três categorias e explica para onde a tecnologia caminha. Os modelos de topo de linha de 2026 — Nano Banana Pro, gpt-image-2 e Seedream 5.0 Pro — adotaram raciocínio antes da geração e busca na web durante o processo.
A disputa deixou de ser “quem produz a imagem mais bonita” e passou a ser “quem entende o que a peça precisa comunicar”. Não é coincidência que os três tenham anunciado, no mesmo ciclo, foco em infográficos e texto denso — tarefas que exigem compreensão, não só estética. O mesmo vale nos modelos de linguagem, onde raciocínio adaptativo virou padrão em vez de recurso opcional.
Onde os modelos estão hoje, segundo avaliação independente
Preço e versão dizem o que você paga; benchmark diz o que você recebe. O índice abaixo é composto por nove avaliações independentes e serve para descartar candidatos rapidamente — não para eleger um vencedor absoluto.
Intelligence Index — leitura de agosto de 2026
Índice composto de nove avaliações independentes (v4.1.1). Em violeta, modelos de pesos abertos.
O dado mais relevante da leitura de agosto de 2026 não é quem lidera, e sim a distância entre o melhor modelo aberto e o melhor proprietário: 4 pontos. Um ano antes eram 13. Para quem avalia infraestrutura própria, isso muda a conversa — o detalhamento está em benchmark de IA self-host.
Série de benchmarks por tipo de tarefa
Um índice geral esconde o que importa na decisão: modelos que lideram em raciocínio podem ficar atrás em uso de ferramentas, e o melhor gerador de imagem raramente é o melhor de vídeo. Cada artigo abaixo explica o que o benchmark mede, com que metodologia e amostra, além de custo e casos de uso.
- Texto, raciocínio e pesquisa — GPQA Diamond, HLE, MMLU-Pro, BrowseComp e o Elo do LMArena
- Código — SWE-bench Verified, Terminal-Bench, LiveCodeBench e testes de segurança
- Agentes — OSWorld, GAIA, τ³-bench e ARC-AGI
- Geração de imagem — Image Arena, GenEval e testes de texto, SVG e 3D
- Geração de vídeo — Video Arena, VBench e custo por segundo
- Áudio e transcrição — taxa de erro do Whisper e alternativas, com recorte de português
- Dados, estatística e matemática — AIME, FrontierMath, SQL e planilha
- Multimodal — MMMU, ChartQA, DocVQA e OCR de documento
- Self-host — modelos abertos, VRAM, licenças e a conta frente à API
⚠️ Como ler qualquer benchmark de IA sem se enganar
Cinco ressalvas que valem para todos os números desta série, e que a maior parte dos comparativos omite:
- Autorreportado não é independente. Score de system card do fabricante e score de leaderboard de terceiro não são a mesma coisa. Ambos são úteis; misturá-los sem avisar, não.
- Leaderboard público atrasa. No HLE, o ranking da Scale mostrava topo em torno de 46% enquanto a Anthropic reportava 56,3% — não é contradição, é ritmo de atualização diferente. Toda leitura precisa de data.
- Benchmark migra e o antigo continua no ar. O tau-bench virou τ³; o Terminal-Bench 2.1 foi substituído pelo FrontierBench nas medições recentes da Anthropic.
- Correção retroativa acontece. A versão 2 do FrontierMath, de junho de 2026, corrigiu erros em 42% dos problemas — scores anteriores não são comparáveis.
- Medalha autorreportada não é resultado verificado. As alegações de ouro na Olimpíada Internacional de Matemática vieram de modelos nunca liberados para avaliação independente. Na avaliação da MathArena com juízes humanos, o melhor modelo público fez 13 de 42 pontos — abaixo do bronze.
Há ainda um detalhe que afeta custo e não aparece em ranking: mudança de tokenizer. O Claude Opus 4.7 e o Sonnet 5 passaram a consumir cerca de 30% mais tokens no mesmo texto, o que altera a conta real sem mexer em nenhum preço de tabela.
Como escolher sem se perder
- Volume alto e tarefa simples: o modelo mais barato da família resolve. Testar isso antes de assumir o topo de linha economiza a maior parte do orçamento.
- Raciocínio longo ou trabalho agêntico: justifica o topo de linha, e aí vale comparar benchmarks — com a ressalva de que mudanças de tokenizer e de metodologia tornam comparações entre gerações pouco confiáveis.
- Conformidade e rastreabilidade: priorize marca d’água no pixel e verifique a política de direitos do fornecedor.
- Dependência de fornecedor único é risco real. O Claude Fable 5 ficou cerca de três semanas indisponível em 2026 por controle de exportação; a Sora está sendo descontinuada. Ter um segundo caminho testado não é excesso de zelo.
Para os fundamentos por trás desses sistemas, veja redes neurais artificiais e deep learning no marketing. Para extrair mais de qualquer um deles, o guia de engenharia de prompt vale mais que trocar de modelo. E para o lado operacional de colocar esses modelos para trabalhar em sistemas — e os riscos que isso traz —, veja agent harness, MCP e prompt injection.
Fontes
- Artificial Analysis — Intelligence Index e avaliações independentes
- Anthropic — preços do Claude
- OpenAI — preços da API
- Google — preços do Gemini
- ByteDance Seed — Seedream e Seedance
- Moonshot AI — plataforma Kimi
- xAI — Grok
Leitura das fontes em 18/08/2026.