Alucinações em LLMs: o que são e como reduzir o risco

O modelo não mente, ele prevê. E é exatamente isso que produz respostas erradas ditas com confiança.

Por Marcos Guimarães6 out 2026
Alucinações em LLMs: o que são e como reduzir o risco

Um advogado nos Estados Unidos abriu um processo com seis citações de jurisprudência.

As seis eram invenções do ChatGPT.

Os casos, os juízes, os números de processo, nada existia.

O modelo não se confundiu com dados parecidos: ele gerou texto com formato de citação real porque o formato de citação real é o que aparece em milhões de documentos jurídicos que ele leu.

Esse episódio resume bem o problema.

Não há mentira deliberada, não há falha de memória no sentido humano.

Há previsão estatística de texto.

E previsão estatística, sem verificação, produz ficção fluente. ## O que é alucinação em LLM Alucinação em LLM é qualquer saída do modelo que parece plausível e coerente, mas é factualmente incorreta, inventada ou desconectada da fonte.

Pode ser um nome de artigo científico inexistente, uma data trocada, uma lei revogada citada como vigente ou uma estatística sem origem.

O termo vem da literatura de visão computacional, onde já descrevia redes neurais que identificavam padrões que não existiam na imagem.

Em modelos de linguagem, o fenômeno é mais perigoso porque a saída é textual e convincente.

O modelo escreve com detalhes, formata corretamente e mantém o tom assertivo, o que dificulta a detecção por quem lê.

O ponto central: alucinação não é sinônimo de erro qualquer.

É o erro que passa pelo filtro da plausibilidade.

Uma resposta mal escrita com erro óbvio é fácil de descartar.

Uma resposta elegante com erro sutil passa. ## Por que o LLM inventa Todo LLM generativo funciona como um previsor de próximo token.

Dado um trecho de texto, ele calcula qual palavra ou fragmento tem maior probabilidade de vir em seguida, escolhe um e repete.

Não existe banco de dados interno com fatos separados de opiniões.

Existe um vetor de probabilidades aprendido sobre bilhões de textos.

Três causas explicam a maior parte das alucinações: **Lacuna de conhecimento preenchida com padrão.** Se o modelo não foi treinado com a informação pedida, ele não tem uma resposta "não sei" naturalmente disponível.

Ele tem o padrão linguístico daquele tipo de pergunta, então gera a resposta que mais se parece com uma resposta correta.

Pseudo-referências, nomes inventados e citações fabricadas saem quase sempre desse mecanismo. **Pressão por fluência e formato.** Modelos ajustados para responder bem tendem a completar o padrão iniciado.

Se você pede cinco exemplos, ele entrega cinco, mesmo que só dois sejam reais.

A estrutura da resposta vence a veracidade quando as duas entram em conflito. **Dados de treino desatualizados ou enviesados.** Todo modelo tem um corte temporal nos dados.

Perguntas sobre eventos posteriores a esse corte, produtos que mudaram de nome ou normas atualizadas são terreno fértil.

O modelo responde com o que existia até a data limite, sem sinalizar a defasagem.

A temperatura do modelo agrava ou atenua isso.

Valores altos aumentam a aleatoriedade da escolha do próximo token e ampliam a chance de desvio.

Valores próximos de zero tornam a saída mais determinística, mas não eliminam a alucinação: só reduzem a variabilidade. ## Como reduzir alucinações na prática Nenhuma técnica zera o problema.

As que funcionam combinam verificação externa e mudança de comportamento na hora de pedir.

1. **Ancore a resposta em documentos (RAG).** Retrieval-Augmented Generation busca trechos de fontes confiáveis antes de gerar e força o modelo a se apoiar neles.

É o método mais eficaz em aplicações sérias: em vez de o modelo lembrar, ele lê.

Se a fonte não contém a resposta, o sistema deve poder dizer que não sabe.

2. **Peça citação da fonte ao lado de cada afirmação.** Instruir o modelo a indicar de onde tirou cada dado muda o comportamento.

Sem citação disponível, ele tende a reconhecer a lacuna em vez de inventar.

3. **Exija nível de confiança.** Pedir ao modelo que classifique a própria certeza (alta, média, baixa) sinaliza onde você deve checar manualmente.

Não é garantia, mas separa o território instável.

4. **Divida perguntas compostas.** Uma pergunta com cinco subitens gera cinco oportunidades de alucinar.

Quebrar em perguntas isoladas reduz o encadeamento de erros e facilita a auditoria.

5. **Use raciocínio em etapas quando há cálculo ou lógica.** Chain-of-thought, ou cadeia de pensamento, faz o modelo explicitar os passos antes da conclusão.

Em tarefas matemáticas e de inferência, a taxa de erro cai porque o modelo não pula direto para o resultado plausível.

6. **Aplique verificação em camadas.** Em fluxos de alto risco, como saúde, jurídico e finanças, a resposta do LLM deve passar por um segundo modelo ou por checagem humana antes de chegar ao usuário final.

Um LLM não é fonte primária. ## Quando o erro deixa de ser detalhe Alucinação em contexto de baixo risco, como gerar ideias de nomes para um projeto, é ruído tolerável.

Em contexto de decisão, é dano real.

Diagnóstico médico inventado, cláusula contratual fabricada, dado financeiro errado apresentado com segurança: cada um desses casos tem custo concreto.

Por isso a discussão ética em torno do tema vai além do modelo.

Empresas que colocam LLM em contato direto com o cliente assumem o dever de sinalizar incerteza e de corrigir informação errada.

O usuário, por sua vez, precisa tratar a saída como rascunho confiante, não como fato verificado.

O contraste é simples: o modelo erra porque foi construído para completar padrões, não para checar o mundo.

Esperar veracidade automática vai contra o funcionamento dele.

Cabe ao sistema em volta fornecer a checagem que o modelo não faz. ## Perguntas frequentes **Alucinação é o mesmo que viés?** Não.

Viés é distorção sistemática herdada dos dados de treino, como associar profissões a gêneros.

Alucinação é invenção factual.

Os dois podem aparecer juntos na mesma resposta, mas têm causas e correções distintas. **Modelos maiores alucinam menos?** Modelos maiores tendem a errar menos em tarefas gerais, mas não existe garantia.

Um modelo maior com dados desatualizados, sob pergunta de alta especificidade, ainda pode inventar.

Escala ajuda, não resolve. **Posso confiar na resposta se o modelo soa seguro?** Não.

Confiança no tom da resposta não é indicador de correção.

O mecanismo que gera uma frase certa é o mesmo que gera uma frase errada.

Verificação externa é o único filtro confiável.