Benchmark de IA para áudio mede duas coisas distintas: transcrever fala em texto e gerar voz sintética. Para transcrição, a métrica é a taxa de erro de palavra (WER) — proporção de palavras erradas, omitidas ou inseridas; quanto menor, melhor. E aqui há uma resposta que contraria o senso comum do mercado: o Whisper não é mais estado da arte. No Open ASR Leaderboard, o whisper-large-v3 aparece em 9º lugar entre 30 modelos em português, com WER de 3,50% contra 2,47% do líder — cerca de 42% pior em termos relativos. Em inglês a posição é mais dura ainda: 54º de 74. Não é opinião de blog; é o ranking, e este artigo mostra os números.
Transcrição em português — taxa de erro no FLEURS-pt (%)
WER: quanto menor, melhor. Em violeta, modelos de pesos abertos.
Áudio lido e limpo (Wikipedia). Não vale para telefonia, ruído ou call center — não há benchmark público desses domínios em português.
O recorte de português existe — e quase ninguém usa
A maioria dos comparativos cita o WER médio em inglês, que é irrelevante para operação brasileira. O Open ASR Leaderboard mantém um arquivo dedicado ao português, com 30 modelos avaliados em dois conjuntos:
- FLEURS-pt — texto de enciclopédia lido em voz alta, áudio limpo
- MLS-pt — audiolivros em português
| # | Modelo | FLEURS-pt | MLS-pt | Tipo |
|---|---|---|---|---|
| 1 | Azure Speech (jun/2026) | 2,47 | 3,73 | API |
| 2 | ElevenLabs Scribe v2 | 2,60 | 3,21 | API |
| 3 | Soniox v5 | 3,11 | 4,91 | API |
| 4 | AssemblyAI Universal-3 Pro | 3,18 | 4,54 | API |
| 9 | Whisper large-v3 | 3,50 | 6,37 | aberto |
| 12 | Whisper large-v3-turbo | 3,77 | 5,48 | aberto |
| 15 | NVIDIA Canary-1b-v2 | 4,16 | 8,35 | aberto |
| 18 | NVIDIA Parakeet v3 | 4,46 | 7,70 | aberto |
Repare que o Whisper cai mais em MLS-pt (audiolivro) que em FLEURS-pt — 6,37% contra 3,50%. Áudio mais longo e com variação de entonação degrada o desempenho, e é um sinal do que esperar em conteúdo real.
Para referência histórica, o paper original do Whisper reporta, para o large-v2 em português: 6,8% no MLS, 6,3% no Common Voice 9 e 4,3% no FLEURS. As versões v3 e turbo não têm tabela por idioma no paper — e não existe Whisper v4: nenhuma menção no repositório oficial.
⚠️ A condição do teste muda tudo
Antes de escolher com base na tabela acima, saiba o que ela não cobre. FLEURS e MLS são áudio lido, em estúdio, sem ruído. Nenhum desses números vale para:
- Telefonia — banda estreita, compressão agressiva
- Call center — sobreposição de falantes, ruído de fundo
- Reunião gravada — microfone distante, múltiplas vozes
- Áudio de rede social — música ao fundo, corte abrupto
Não localizei benchmark público desses domínios em português. Se o seu caso é transcrever atendimento telefônico, a única medição que vale é a sua: separe 30 gravações reais, transcreva manualmente como gabarito e compare. É meia manhã de trabalho que evita uma escolha de milhares de reais.
Quanto custa transcrever
| Serviço | Preço | Observação |
|---|---|---|
| Deepgram Nova-3 (mono) | US$ 0,0048/min em streaming US$ 0,0077/min em lote | O mais barato da lista |
| Deepgram Nova-3 (multi-idioma) | US$ 0,0058 e US$ 0,0092/min | — |
| OpenAI gpt-transcribe | US$ 0,0045/min | Versões mini a US$ 0,003 |
| Google STT V2 / Chirp | US$ 0,016/min | Chirp cobra na tarifa padrão, sem SKU próprio |
| AssemblyAI Universal-3.5 Pro | US$ 0,21/hora assíncrono US$ 0,45/hora em tempo real | Universal-2 sai por US$ 0,15/h |
| ElevenLabs Scribe v2 | US$ 0,22/hora US$ 0,39/hora em tempo real | 2º lugar em qualidade |
Atenção a uma pegadinha de leitura: a página da Deepgram tem um alternador entre preço por minuto e por hora que confunde comparações — os valores acima são por minuto. E o Whisper, sendo aberto, tem custo de infraestrutura, não de licença: a conta é a GPU, tratada no artigo de self-host.
⚠️ Uma lacuna que vale declarar: gpt-4o-transcribe, Deepgram e Google Chirp não estão no leaderboard independente. Qualquer WER publicado para esses três é autorreportado pelo próprio fornecedor.
Síntese de voz: o líder não é quem você imagina
No TTS Arena V2, que mede preferência humana em comparação cega, o topo é ocupado por nomes pouco conhecidos: Luna TTS (Elo 1574), Vocu V3.0 (1563), CastleFlow v1.0 (1560) e Inworld TTS MAX (1558).
O ElevenLabs — a marca mais citada do setor — aparece no meio da tabela: Turbo v2.5 em 15º (1511), Multilingual v2 em 18º e a v3 em 29º. Isso não significa que seja ruim: significa que reconhecimento de marca e preferência cega são coisas diferentes, e que vale testar alternativas antes de assumir o padrão de mercado.
Preços: ElevenLabs cobra US$ 0,05 por mil caracteres nos modelos Flash e Turbo, e US$ 0,10 no Multilingual. A OpenAI cobra US$ 15 por milhão de caracteres no tts-1 e US$ 30 no tts-1-hd.
Como escolher, por caso de uso
- Legenda de vídeo e podcast — áudio limpo, então a tabela acima se aplica bem. Deepgram Nova-3 dá o melhor custo por minuto; ElevenLabs Scribe v2, a melhor qualidade em audiolivro.
- Atendimento telefônico — teste com o seu próprio áudio. Nenhum benchmark público cobre esse domínio em português.
- Volume muito alto e dado sensível — Whisper self-host, aceitando o WER um pouco pior em troca de não enviar áudio a terceiro. Relevante sob LGPD.
- Voz sintética para peça publicitária — compare cegamente antes de assinar. A liderança de marca não corresponde à liderança de preferência.
- Tempo real — o preço praticamente dobra em todos os fornecedores; confirme se a latência é requisito real.
Fontes
- Open ASR Leaderboard — com recorte de português
- Paper do Open ASR Leaderboard — 86 sistemas, 12 conjuntos de dados
- Paper original do Whisper — Radford et al.
- TTS Arena V2 — preferência humana em voz sintética
- Preços Deepgram · AssemblyAI · ElevenLabs
- Google Speech-to-Text · OpenAI
Leia também
- Modelos de IA em 2026 — panorama com preços e versões
- Benchmark de geração de vídeo · de multimodal
- Benchmark de self-host — para rodar o Whisper em infraestrutura própria
- Benchmark de IA — a definição no glossário