Tudo sobre

Benchmark de IA para áudio: Whisper e alternativas (2026)

Benchmark de IA para áudio mede duas coisas distintas: transcrever fala em texto e gerar voz sintética. Para transcrição, a métrica é a taxa de erro...

Benchmark de IA para áudio mede duas coisas distintas: transcrever fala em texto e gerar voz sintética. Para transcrição, a métrica é a taxa de erro de palavra (WER) — proporção de palavras erradas, omitidas ou inseridas; quanto menor, melhor. E aqui há uma resposta que contraria o senso comum do mercado: o Whisper não é mais estado da arte. No Open ASR Leaderboard, o whisper-large-v3 aparece em 9º lugar entre 30 modelos em português, com WER de 3,50% contra 2,47% do líder — cerca de 42% pior em termos relativos. Em inglês a posição é mais dura ainda: 54º de 74. Não é opinião de blog; é o ranking, e este artigo mostra os números.

Transcrição em português — taxa de erro no FLEURS-pt (%)

WER: quanto menor, melhor. Em violeta, modelos de pesos abertos.

Azure Speech (06/2026)2.47% ElevenLabs Scribe v22.6% Soniox v53.11% AssemblyAI Universal-3 Pro3.18% Whisper large-v33.5% Whisper large-v3-turbo3.77% NVIDIA Canary-1b-v24.16% NVIDIA Parakeet v34.46%

Áudio lido e limpo (Wikipedia). Não vale para telefonia, ruído ou call center — não há benchmark público desses domínios em português.

Fonte: Open ASR Leaderboard · leitura de 17/08/2026

O recorte de português existe — e quase ninguém usa

A maioria dos comparativos cita o WER médio em inglês, que é irrelevante para operação brasileira. O Open ASR Leaderboard mantém um arquivo dedicado ao português, com 30 modelos avaliados em dois conjuntos:

  • FLEURS-pt — texto de enciclopédia lido em voz alta, áudio limpo
  • MLS-pt — audiolivros em português
#ModeloFLEURS-ptMLS-ptTipo
1Azure Speech (jun/2026)2,473,73API
2ElevenLabs Scribe v22,603,21API
3Soniox v53,114,91API
4AssemblyAI Universal-3 Pro3,184,54API
9Whisper large-v33,506,37aberto
12Whisper large-v3-turbo3,775,48aberto
15NVIDIA Canary-1b-v24,168,35aberto
18NVIDIA Parakeet v34,467,70aberto

Repare que o Whisper cai mais em MLS-pt (audiolivro) que em FLEURS-pt — 6,37% contra 3,50%. Áudio mais longo e com variação de entonação degrada o desempenho, e é um sinal do que esperar em conteúdo real.

Para referência histórica, o paper original do Whisper reporta, para o large-v2 em português: 6,8% no MLS, 6,3% no Common Voice 9 e 4,3% no FLEURS. As versões v3 e turbo não têm tabela por idioma no paper — e não existe Whisper v4: nenhuma menção no repositório oficial.

⚠️ A condição do teste muda tudo

Antes de escolher com base na tabela acima, saiba o que ela não cobre. FLEURS e MLS são áudio lido, em estúdio, sem ruído. Nenhum desses números vale para:

  • Telefonia — banda estreita, compressão agressiva
  • Call center — sobreposição de falantes, ruído de fundo
  • Reunião gravada — microfone distante, múltiplas vozes
  • Áudio de rede social — música ao fundo, corte abrupto

Não localizei benchmark público desses domínios em português. Se o seu caso é transcrever atendimento telefônico, a única medição que vale é a sua: separe 30 gravações reais, transcreva manualmente como gabarito e compare. É meia manhã de trabalho que evita uma escolha de milhares de reais.

Quanto custa transcrever

ServiçoPreçoObservação
Deepgram Nova-3 (mono)US$ 0,0048/min em streaming
US$ 0,0077/min em lote
O mais barato da lista
Deepgram Nova-3 (multi-idioma)US$ 0,0058 e US$ 0,0092/min
OpenAI gpt-transcribeUS$ 0,0045/minVersões mini a US$ 0,003
Google STT V2 / ChirpUS$ 0,016/minChirp cobra na tarifa padrão, sem SKU próprio
AssemblyAI Universal-3.5 ProUS$ 0,21/hora assíncrono
US$ 0,45/hora em tempo real
Universal-2 sai por US$ 0,15/h
ElevenLabs Scribe v2US$ 0,22/hora
US$ 0,39/hora em tempo real
2º lugar em qualidade

Atenção a uma pegadinha de leitura: a página da Deepgram tem um alternador entre preço por minuto e por hora que confunde comparações — os valores acima são por minuto. E o Whisper, sendo aberto, tem custo de infraestrutura, não de licença: a conta é a GPU, tratada no artigo de self-host.

⚠️ Uma lacuna que vale declarar: gpt-4o-transcribe, Deepgram e Google Chirp não estão no leaderboard independente. Qualquer WER publicado para esses três é autorreportado pelo próprio fornecedor.

Síntese de voz: o líder não é quem você imagina

No TTS Arena V2, que mede preferência humana em comparação cega, o topo é ocupado por nomes pouco conhecidos: Luna TTS (Elo 1574), Vocu V3.0 (1563), CastleFlow v1.0 (1560) e Inworld TTS MAX (1558).

O ElevenLabs — a marca mais citada do setor — aparece no meio da tabela: Turbo v2.5 em 15º (1511), Multilingual v2 em 18º e a v3 em 29º. Isso não significa que seja ruim: significa que reconhecimento de marca e preferência cega são coisas diferentes, e que vale testar alternativas antes de assumir o padrão de mercado.

Preços: ElevenLabs cobra US$ 0,05 por mil caracteres nos modelos Flash e Turbo, e US$ 0,10 no Multilingual. A OpenAI cobra US$ 15 por milhão de caracteres no tts-1 e US$ 30 no tts-1-hd.

Como escolher, por caso de uso

  • Legenda de vídeo e podcast — áudio limpo, então a tabela acima se aplica bem. Deepgram Nova-3 dá o melhor custo por minuto; ElevenLabs Scribe v2, a melhor qualidade em audiolivro.
  • Atendimento telefônico — teste com o seu próprio áudio. Nenhum benchmark público cobre esse domínio em português.
  • Volume muito alto e dado sensível — Whisper self-host, aceitando o WER um pouco pior em troca de não enviar áudio a terceiro. Relevante sob LGPD.
  • Voz sintética para peça publicitária — compare cegamente antes de assinar. A liderança de marca não corresponde à liderança de preferência.
  • Tempo real — o preço praticamente dobra em todos os fornecedores; confirme se a latência é requisito real.

Fontes

Leia também

Compartilhe:
Foto de Dionatha Rodrigues

Dionatha Rodrigues

Dionatha é bacharel em Sistemas de Informação e especialista em Martech, com mais de 17 anos de experiência na integração de Marketing e Tecnologia para impulsionar negócios, equipes e profissionais a compreenderem e otimizarem as operações de marketing digital e tecnologia. Sua expertise técnica abrange áreas-chave como SEO técnico, Analytics, CRM, Chatbots, CRO (Conversion Rate Optimization) e automação de processos.

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!