Tudo sobre

Benchmark de IA para áudio: Whisper e alternativas (2026)

Benchmark de IA para áudio mede duas coisas distintas: transcrever fala em texto e gerar voz sintética. Para transcrição, a métrica é a taxa de erro...

**Benchmark de [IA](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/) para áudio** mede duas coisas distintas: transcrever fala em texto e gerar voz sintética. Para transcrição, a métrica é a **taxa de erro de palavra (WER)** — proporção de palavras erradas, omitidas ou inseridas; quanto menor, melhor. E aqui há uma resposta que contraria o senso comum do mercado: **o Whisper não é mais estado da arte**. No Open ASR Leaderboard, o **whisper-large-v3 aparece em 9º lugar entre 30 modelos em português**, com WER de 3,50% contra 2,47% do líder — cerca de **42% pior em termos relativos**. Em inglês a posição é mais dura ainda: **54º de 74**. Não é opinião de blog; é o ranking, e este artigo mostra os números.

Transcrição em português — taxa de erro no FLEURS-pt (%)WER: quanto menor, melhor. Em violeta, modelos de pesos abertos. Azure Speech (06/2026)2.47% [ElevenLabs](https://clubmartech.com.br/blog/elevenlabs-pratica-ia-conteudo/) Scribe v22.6% Soniox v53.11% AssemblyAI Universal-3 Pro3.18% Whisper large-v33.5% Whisper large-v3-turbo3.77% NVIDIA Canary-1b-v24.16% NVIDIA Parakeet v34.46% Áudio lido e limpo (Wikipedia). Não vale para telefonia, ruído ou call center — não há benchmark público desses domínios em português.
Fonte: Open ASR Leaderboard · leitura de 17/08/2026

## O recorte de português existe — e quase ninguém usaA maioria dos comparativos cita o WER médio em inglês, que é irrelevante para operação brasileira. O **Open ASR Leaderboard mantém um arquivo dedicado ao português**, com 30 modelos avaliados em dois conjuntos:

  • **FLEURS-pt** — texto de enciclopédia lido em voz alta, áudio limpo
  • **MLS-pt** — audiolivros em português
#ModeloFLEURS-ptMLS-ptTipo
1Azure Speech (jun/2026)**2,47**3,73API
2ElevenLabs Scribe v22,60**3,21**API
3Soniox v53,114,91API
4AssemblyAI Universal-3 Pro3,184,54API
**9****Whisper large-v3****3,50**6,37aberto
12Whisper large-v3-turbo3,775,48aberto
15NVIDIA Canary-1b-v24,168,35aberto
18NVIDIA Parakeet v34,467,70aberto

Repare que o Whisper cai mais em MLS-pt (audiolivro) que em FLEURS-pt — **6,37% contra 3,50%**. Áudio mais longo e com variação de entonação degrada o desempenho, e é um sinal do que esperar em [conteúdo](https://clubmartech.com.br/blog/conteudo-longo-prazo-anos/) real.Para referência histórica, o paper original do Whisper reporta, para o **large-v2 em português**: 6,8% no MLS, 6,3% no Common Voice 9 e 4,3% no FLEURS. As versões v3 e turbo **não têm tabela por idioma no paper** — e **não existe Whisper v4**: nenhuma menção no repositório oficial.## ⚠️ A condição do teste muda tudoAntes de escolher com base na tabela acima, saiba o que ela não cobre. **FLEURS e MLS são áudio lido, em estúdio, [sem](https://clubmartech.com.br/blog/sem-avancado-estrategia-roi/) ruído.** Nenhum desses números vale para:

  • **Telefonia** — banda estreita, compressão agressiva
  • **Call center** — sobreposição de falantes, ruído de fundo
  • **Reunião gravada** — microfone distante, múltiplas vozes
  • **Áudio de rede social** — música ao fundo, corte abrupto

**Não localizei benchmark público desses domínios em português.** Se o seu caso é transcrever [atendimento](https://comecandonaweb.com.br/atendimento-ao-cliente/) telefônico, a única medição que vale é a sua: separe 30 gravações reais, transcreva manualmente como gabarito e compare. É meia manhã de trabalho que evita uma escolha de milhares de reais.## Quanto custa transcrever

ServiçoPreçoObservação
**Deepgram Nova-3** (mono)US$ 0,0048/min em [streaming](https://clubmartech.com.br/blog/streaming-softwares-protocolos-[dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/)/) US$ 0,0077/min em loteO mais barato da lista
Deepgram Nova-3 (multi-idioma)US$ 0,0058 e US$ 0,0092/min
**OpenAI gpt-transcribe**US$ 0,0045/minVersões mini a US$ 0,003
Google STT V2 / ChirpUS$ 0,016/minChirp cobra na tarifa padrão, sem SKU próprio
**AssemblyAI Universal-3.5 Pro**US$ 0,21/hora assíncrono US$ 0,45/hora em tempo realUniversal-2 sai por US$ 0,15/h
**ElevenLabs Scribe v2**US$ 0,22/hora US$ 0,39/hora em tempo real2º lugar em qualidade

Atenção a uma pegadinha de leitura: a página da Deepgram tem um **alternador entre preço por minuto e por hora** que confunde comparações — os valores acima são por minuto. E o **Whisper, sendo aberto, tem custo de [infraestrutura](https://clubmartech.com.br/blog/infraestrutura-dados-ia-meses/), não de licença**: a conta é a GPU, tratada no

artigo de self-host

.⚠️ Uma lacuna que vale declarar: **gpt-4o-transcribe, Deepgram e Google Chirp não estão no leaderboard independente**. Qualquer WER publicado para esses três é autorreportado pelo próprio fornecedor.## Síntese de voz: o líder não é quem você imaginaNo **TTS Arena V2**, que mede preferência humana em comparação cega, o topo é ocupado por nomes pouco conhecidos: **Luna TTS (Elo 1574), Vocu V3.0 (1563), CastleFlow v1.0 (1560)** e Inworld TTS MAX (1558).O **ElevenLabs — a marca mais citada do setor — aparece no meio da tabela**: Turbo v2.5 em 15º (1511), Multilingual v2 em 18º e a v3 em 29º. Isso não significa que seja ruim: significa que **reconhecimento de marca e preferência cega são coisas diferentes**, e que vale testar alternativas antes de assumir o padrão de mercado.Preços: ElevenLabs cobra US$ 0,05 por mil caracteres nos modelos Flash e Turbo, e US$ 0,10 no Multilingual. A OpenAI cobra US$ 15 por milhão de caracteres no tts-1 e US$ 30 no tts-1-hd.## Como escolher, por caso de uso

  • **Legenda de vídeo e [podcast](https://clubmartech.com.br/blog/podcast-ferramenta-comunicacao-ouvintes/)** — áudio limpo, então a tabela acima se aplica bem. Deepgram Nova-3 dá o melhor custo por minuto; ElevenLabs Scribe v2, a melhor qualidade em audiolivro.
  • **Atendimento telefônico** — teste com o seu próprio áudio. Nenhum benchmark público cobre esse domínio em português.
  • **Volume muito alto e dado sensível** — Whisper self-host, aceitando o WER um pouco pior em troca de não enviar áudio a terceiro. Relevante sob [LGPD](https://clubmartech.com.br/significado/lgpd/).
  • **Voz sintética para peça publicitária** — compare cegamente antes de assinar. A liderança de marca não corresponde à liderança de preferência.
  • **Tempo real** — o preço praticamente dobra em todos os fornecedores; confirme se a latência é requisito real.

## Fontes

## Leia também

Compartilhe:
Foto de Dionatha Rodrigues

Dionatha Rodrigues

Dionatha é bacharel em Sistemas de Informação e especialista em Martech, com mais de 17 anos de experiência na integração de Marketing e Tecnologia para impulsionar negócios, equipes e profissionais a compreenderem e otimizarem as operações de marketing digital e tecnologia. Sua expertise técnica abrange áreas-chave como SEO técnico, Analytics, CRM, Chatbots, CRO (Conversion Rate Optimization) e automação de processos.

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!