**Benchmark de [IA](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/) para áudio** mede duas coisas distintas: transcrever fala em texto e gerar voz sintética. Para transcrição, a métrica é a **taxa de erro de palavra (WER)** — proporção de palavras erradas, omitidas ou inseridas; quanto menor, melhor. E aqui há uma resposta que contraria o senso comum do mercado: **o Whisper não é mais estado da arte**. No Open ASR Leaderboard, o **whisper-large-v3 aparece em 9º lugar entre 30 modelos em português**, com WER de 3,50% contra 2,47% do líder — cerca de **42% pior em termos relativos**. Em inglês a posição é mais dura ainda: **54º de 74**. Não é opinião de blog; é o ranking, e este artigo mostra os números.
## O recorte de português existe — e quase ninguém usaA maioria dos comparativos cita o WER médio em inglês, que é irrelevante para operação brasileira. O **Open ASR Leaderboard mantém um arquivo dedicado ao português**, com 30 modelos avaliados em dois conjuntos:
- **FLEURS-pt** — texto de enciclopédia lido em voz alta, áudio limpo
- **MLS-pt** — audiolivros em português
| # | Modelo | FLEURS-pt | MLS-pt | Tipo |
|---|---|---|---|---|
| 1 | Azure Speech (jun/2026) | **2,47** | 3,73 | API |
| 2 | ElevenLabs Scribe v2 | 2,60 | **3,21** | API |
| 3 | Soniox v5 | 3,11 | 4,91 | API |
| 4 | AssemblyAI Universal-3 Pro | 3,18 | 4,54 | API |
| **9** | **Whisper large-v3** | **3,50** | 6,37 | aberto |
| 12 | Whisper large-v3-turbo | 3,77 | 5,48 | aberto |
| 15 | NVIDIA Canary-1b-v2 | 4,16 | 8,35 | aberto |
| 18 | NVIDIA Parakeet v3 | 4,46 | 7,70 | aberto |
Repare que o Whisper cai mais em MLS-pt (audiolivro) que em FLEURS-pt — **6,37% contra 3,50%**. Áudio mais longo e com variação de entonação degrada o desempenho, e é um sinal do que esperar em [conteúdo](https://clubmartech.com.br/blog/conteudo-longo-prazo-anos/) real.Para referência histórica, o paper original do Whisper reporta, para o **large-v2 em português**: 6,8% no MLS, 6,3% no Common Voice 9 e 4,3% no FLEURS. As versões v3 e turbo **não têm tabela por idioma no paper** — e **não existe Whisper v4**: nenhuma menção no repositório oficial.## ⚠️ A condição do teste muda tudoAntes de escolher com base na tabela acima, saiba o que ela não cobre. **FLEURS e MLS são áudio lido, em estúdio, [sem](https://clubmartech.com.br/blog/sem-avancado-estrategia-roi/) ruído.** Nenhum desses números vale para:
- **Telefonia** — banda estreita, compressão agressiva
- **Call center** — sobreposição de falantes, ruído de fundo
- **Reunião gravada** — microfone distante, múltiplas vozes
- **Áudio de rede social** — música ao fundo, corte abrupto
**Não localizei benchmark público desses domínios em português.** Se o seu caso é transcrever [atendimento](https://comecandonaweb.com.br/atendimento-ao-cliente/) telefônico, a única medição que vale é a sua: separe 30 gravações reais, transcreva manualmente como gabarito e compare. É meia manhã de trabalho que evita uma escolha de milhares de reais.## Quanto custa transcrever
| Serviço | Preço | Observação |
|---|---|---|
| **Deepgram Nova-3** (mono) | US$ 0,0048/min em [streaming](https://clubmartech.com.br/blog/streaming-softwares-protocolos-[dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/)/) US$ 0,0077/min em lote | O mais barato da lista |
| Deepgram Nova-3 (multi-idioma) | US$ 0,0058 e US$ 0,0092/min | — |
| **OpenAI gpt-transcribe** | US$ 0,0045/min | Versões mini a US$ 0,003 |
| Google STT V2 / Chirp | US$ 0,016/min | Chirp cobra na tarifa padrão, sem SKU próprio |
| **AssemblyAI Universal-3.5 Pro** | US$ 0,21/hora assíncrono US$ 0,45/hora em tempo real | Universal-2 sai por US$ 0,15/h |
| **ElevenLabs Scribe v2** | US$ 0,22/hora US$ 0,39/hora em tempo real | 2º lugar em qualidade |
Atenção a uma pegadinha de leitura: a página da Deepgram tem um **alternador entre preço por minuto e por hora** que confunde comparações — os valores acima são por minuto. E o **Whisper, sendo aberto, tem custo de [infraestrutura](https://clubmartech.com.br/blog/infraestrutura-dados-ia-meses/), não de licença**: a conta é a GPU, tratada no
artigo de self-host.⚠️ Uma lacuna que vale declarar: **gpt-4o-transcribe, Deepgram e Google Chirp não estão no leaderboard independente**. Qualquer WER publicado para esses três é autorreportado pelo próprio fornecedor.## Síntese de voz: o líder não é quem você imaginaNo **TTS Arena V2**, que mede preferência humana em comparação cega, o topo é ocupado por nomes pouco conhecidos: **Luna TTS (Elo 1574), Vocu V3.0 (1563), CastleFlow v1.0 (1560)** e Inworld TTS MAX (1558).O **ElevenLabs — a marca mais citada do setor — aparece no meio da tabela**: Turbo v2.5 em 15º (1511), Multilingual v2 em 18º e a v3 em 29º. Isso não significa que seja ruim: significa que **reconhecimento de marca e preferência cega são coisas diferentes**, e que vale testar alternativas antes de assumir o padrão de mercado.Preços: ElevenLabs cobra US$ 0,05 por mil caracteres nos modelos Flash e Turbo, e US$ 0,10 no Multilingual. A OpenAI cobra US$ 15 por milhão de caracteres no tts-1 e US$ 30 no tts-1-hd.## Como escolher, por caso de uso
- **Legenda de vídeo e [podcast](https://clubmartech.com.br/blog/podcast-ferramenta-comunicacao-ouvintes/)** — áudio limpo, então a tabela acima se aplica bem. Deepgram Nova-3 dá o melhor custo por minuto; ElevenLabs Scribe v2, a melhor qualidade em audiolivro.
- **Atendimento telefônico** — teste com o seu próprio áudio. Nenhum benchmark público cobre esse domínio em português.
- **Volume muito alto e dado sensível** — Whisper self-host, aceitando o WER um pouco pior em troca de não enviar áudio a terceiro. Relevante sob [LGPD](https://clubmartech.com.br/significado/lgpd/).
- **Voz sintética para peça publicitária** — compare cegamente antes de assinar. A liderança de marca não corresponde à liderança de preferência.
- **Tempo real** — o preço praticamente dobra em todos os fornecedores; confirme se a latência é requisito real.
## Fontes
- Open ASR Leaderboard — com recorte de português
- Paper do Open ASR Leaderboard — 86 sistemas, 12 conjuntos de dados
- Paper original do Whisper — Radford et al.
- TTS Arena V2 — preferência humana em voz sintética
- Preços Deepgram · AssemblyAI · ElevenLabs
- Google Speech-to-Text · OpenAI
## Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Benchmark de geração de vídeo · de multimodal
- Benchmark de self-host — para rodar o Whisper em infraestrutura própria
- Benchmark de IA — a definição no glossário