**Label**, ou rótulo, é a resposta correta associada a um exemplo nos [dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/) de treino — “este e-mail é spam”, “este [lead](https://clubmartech.com.br/blog/lead-scoring-[crm](https://clubmartech.com.br/significado/crm/)-negocios/) converteu”, “esta imagem é um gato”. É o que define o **aprendizado supervisionado**: o modelo aprende observando pares de entrada e resposta esperada, e a qualidade do que ele aprende tem como teto a qualidade desses rótulos. Daí vem o achado mais desconfortável da área, publicado na NeurIPS 2021: ao auditar **os 10 conjuntos de dados mais usados** em visão, texto e áudio, pesquisadores encontraram **pelo menos 3,3% de rótulos errados em média** — e **5,83% só no conjunto de validação do ImageNet**, a referência que orientou uma década de pesquisa em [visão computacional](https://clubmartech.com.br/blog/visao-computacional-[roi](https://clubmartech.com.br/blog/roi-redes-sociais-acao/)-producao/). Os erros não foram estimados por algoritmo apenas: os candidatos sinalizados passaram por **verificação humana**, e mais da metade se confirmou como erro real de rotulagem.## ⚠️ “O conjunto de referência é o gabarito”Os autores atacam essa crença com todas as letras. A citação vale reproduzir: dados rotulados em conjuntos de teste são frequentemente considerados corretos desde que venham da mesma distribuição do treino — e **“isso é uma falácia”**, porque conjuntos de teste podem conter, e contêm, erros.A [amplitude](https://clubmartech.com.br/blog/amplitude-guia-estrategico-marketing/) entre conjuntos é grande, e o padrão explica por quê:
| Conjunto de dados | Tipo | Erro de rótulo |
|---|---|---|
| MNIST | imagem | 0,15% |
| CIFAR-10 | imagem | 0,54% |
| IMDB | texto | 2,90% |
| **ImageNet** | imagem | **5,83%** |
| CIFAR-100 | imagem | 5,85% |
| ⚠️ QuickDraw | imagem | **10,12%** |
Repare na correlação: os conjuntos com **curadoria humana cuidadosa** erram menos; os de **coleta automatizada em massa** erram muito mais. Não é acaso — é o custo da rotulagem aparecendo no resultado.## A consequência que inverte comparaçõesAqui está o achado que transforma isso de curiosidade em problema prático. Corrigindo os rótulos errados, **modelos menores passam a superar modelos maiores** que antes pareciam melhores.No ImageNet, o ResNet-18 supera o ResNet-50 quando a proporção de exemplos originalmente mal rotulados sobe apenas 6%. No CIFAR-10, o VGG-11 supera o VGG-19 com 5%. Traduzindo: **parte da vantagem do modelo “maior” existia porque ele aprendera a reproduzir os erros do gabarito**, não porque entendia melhor a tarefa.## O que isso muda na práticaSe um conjunto de dados construído por pesquisadores, revisado por anos e usado por milhares de trabalhos tem 6% de erro, **a sua base rotulada às pressas tem mais**. Três consequências:
- **Audite antes de culpar o modelo.** Quando um classificador de leads erra de forma teimosa numa categoria, revise 50 exemplos rotulados dela à mão. É comum descobrir que o rótulo é que estava inconsistente.
- **Escreva o critério antes de rotular.** A maior fonte de erro não é desatenção — é duas pessoas usando definições diferentes de “[lead](https://clubmartech.com.br/blog/lead-scoring-[crm](https://clubmartech.com.br/significado/crm/)-negocios/) qualificado”. [Sem](https://clubmartech.com.br/blog/sem-avancado-estrategia-roi/) critério escrito, o rótulo mede a opinião de quem rotulou.
- **Meça a concordância entre rotuladores.** Dê os mesmos 100 exemplos a duas pessoas e compare. Se elas discordam em 15%, nenhum modelo treinado ali vai superar esse limite.
O rótulo é a definição operacional do que a empresa considera sucesso. **Rótulo inconsistente é objetivo mal definido** — e nenhum algoritmo corrige isso. Veja também
datasete
aprendizado supervisionado.## Fontes
- Pervasive Label Errors in Test Sets Destabilize [Machine Learning](https://clubmartech.com.br/significado/machine-learning/) Benchmarks — NeurIPS 2021, 10 conjuntos auditados com validação humana
- labelerrors.com — galeria dos erros encontrados, navegável por conjunto
*Leitura das fontes em 17/08/2026.*