Alucinação em IA: quanto os modelos realmente erram

Alucinação é quando a IA afirma algo sem lastro. Num teste que recompensa dizer não sei, apenas 3 modelos pontuaram acima de zero — a maioria erra mais do que acerta.

**Alucinação** é quando um modelo de [IA](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/) produz uma afirmação que soa plausível mas não tem lastro — um dado inventado, uma citação que não existe, uma política de troca que ninguém escreveu. Não é defeito pontual: é consequência de como o sistema funciona, prevendo a continuação mais provável do texto, não consultando uma base de verdade. O número mais desconfortável vem do **AA-Omniscience**, que avaliou **6 mil questões em 42 tópicos economicamente relevantes** usando um índice que **penaliza o erro e recompensa a abstenção** — ou seja, premia o modelo que diz “não sei”. Resultado: **apenas 3 modelos entre todos os avaliados pontuaram acima de zero**, e o líder marcou **4,8 numa escala que vai até 100**. Traduzindo: quando responder “não sei” conta a favor, a maioria dos modelos de fronteira erra mais do que acerta.## A taxa depende da tarefa, não do modeloEste é o ponto metodológico que quase todo material erra. **Não existe “a taxa de alucinação” de um modelo** — existe a taxa dele numa tarefa específica, com um avaliador específico. O mesmo modelo mede coisas muito diferentes conforme o que se pede:

TarefaTaxa medidaRisco de automatizar
Resumir um texto que você forneceu~1,8% a 3%**Baixo**
Responder via RAG, com contexto recuperado**6,65%** no melhor casoMédio — exige citação
Responder de memória sobre fato do mundoPerto de zero acerto líquido**Alto**

Qualquer afirmação do tipo **“X% das respostas de IA são alucinação”**, [sem](https://clubmartech.com.br/blog/sem-avancado-estrategia-roi/) dizer qual tarefa, qual conjunto de [dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/) e quem avaliou, **é ruído**. E circulam muitas: “modelos de fronteira caíram de 3–8% para 1–2,5%”, “67% das implantações de RAG alucinam”. Procuramos as fontes primárias desses números e **não as encontramos**.## ⚠️ Modelo maior não alucina menosA crença intuitiva é que o modelo mais caro e maior erra menos. Os dois principais rankings da área dizem o contrário.No ranking da Vectara, que mede fidelidade ao resumir, o primeiro lugar em maio de 2026 era um modelo de **32 bilhões de parâmetros**, com 1,8% — à frente de modelos de fronteira bem maiores. E no AA-Omniscience há um achado mais fino: os modelos de **maior acurácia bruta não lideram o índice**, porque **preferem chutar a se abster**. Eles sabem mais e, ainda assim, pontuam pior — porque arriscam quando deveriam recuar.A conclusão dos autores é direta: há **fraquezas persistentes de factualidade e de calibração em todos os modelos de fronteira**. Calibração, aqui, é saber o quanto se sabe — e é uma capacidade separada de conhecimento.Ressalva de transparência: o ranking da Vectara é **mantido por um fornecedor** e usa o modelo avaliador comercial da própria empresa. Indicador útil, não árbitro neutro.## O que isso muda na práticaA tabela acima é, na prática, um mapa de onde cabe [automação](https://clubmartech.com.br/blog/automacao-[testes](https://clubmartech.com.br/blog/testes-moderados-valide-retrabalho/)-script-inteligente/) sem revisão humana:

  • **Resumir material que você forneceu** — relatório, transcrição de reunião, retorno de pesquisa. É o cenário de menor risco, e onde a [automação](https://clubmartech.com.br/blog/automacao-[testes](https://clubmartech.com.br/blog/testes-moderados-valide-retrabalho/)-script-inteligente/) compensa mais rápido.
  • **Responder sobre [produto](https://clubmartech.com.br/significado/produto-minimo-viavel-mvp/), preço ou política via RAG** — exige **citação rastreável à fonte** em toda resposta. Com quase 7% de erro no melhor caso, mostrar de onde veio a informação é o que torna o erro detectável.
  • **Deixar o modelo responder de memória sobre dado de mercado, preço de concorrente ou norma regulatória** — é o pior caso possível. Não automatize.

E uma instrução de sistema que costuma ser esquecida: **peça explicitamente que o modelo diga quando não sabe**. Como mostra o AA-Omniscience, a tendência padrão é chutar — e num contexto comercial, um chute confiante custa mais caro que uma recusa.Os testes de texto e raciocínio estão detalhados no

guia de benchmark de texto

, e o panorama de modelos em

modelos de IA em 2026

.## Fontes

*Leitura das fontes em 17/08/2026.*

Compartilhe:

Outros termos do universo martech que você precisa conhecer!

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!