← Últimos artigos
💬 NLP

Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning

O artigo apresenta o F-DPO, uma extensão simples e eficaz do DPO que utiliza apenas rótulos binários de factualidade para corrigir pares de preferência e ajustar margens, reduzindo significativamente alucinações e melhorando a precisão factual em diversos modelos de linguagem sem a necessidade de modelos de recompensa auxiliares ou anotações complexas.

Autores originais: Sindhuja Chaduvula, Ahmed Y. Radwan, Azib Farooq, Yani Ioannou, Shaina Raza

Publicado 2026-04-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sindhuja Chaduvula, Ahmed Y. Radwan, Azib Farooq, Yani Ioannou, Shaina Raza

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente de IA muito inteligente, mas que às vezes é como um ator de teatro talentoso: ele fala com tanta confiança e fluência que você acredita em tudo o que ele diz, mesmo quando ele está inventando coisas.

O problema é que, em áreas sérias como medicina, direito ou finanças, um "ator" que inventa fatos pode causar grandes desastres.

Este artigo apresenta uma nova técnica chamada F-DPO (Otimização Direta de Preferência Consciente de Fatos). Vamos explicar como ela funciona usando uma analogia simples: o "Treinador de Verdade".

O Problema: O Aluno que Acredita na Performance

Atualmente, para treinar essas IAs, os humanos (ou outras IAs) avaliam as respostas e dizem: "Gostei mais desta resposta do que daquela".

  • O Erro: Muitas vezes, os avaliadores escolhem a resposta que soa mais confiante e bem escrita, mesmo que ela seja falsa.
  • Resultado: A IA aprende que "falar bonito e confiante" é mais importante do que "falar a verdade". Ela começa a alucinar (inventar fatos) com mais frequência porque é recompensada por isso.

A Solução: O Treinador F-DPO

Os autores criaram um método para corrigir esse viés. Eles não precisam de um professor extra complexo; eles apenas ajustam como a IA aprende com os exemplos. O método tem dois passos principais, como se fossem duas regras de ouro:

1. A Regra do "Espelho da Verdade" (Label Flipping)

Imagine que você tem um par de respostas para uma pergunta:

  • Resposta A (Escolhida): "A capital da Austrália é Sydney." (Soa confiante, mas é falso).
  • Resposta B (Rejeitada): "A capital da Austrália é Canberra." (Soa simples, mas é verdadeiro).

No treinamento antigo, a IA aprendia que a Resposta A era a "vencedora". O F-DPO olha para isso e diz: "Espera! A Resposta B é a verdade. Vamos inverter a ordem!".
Ele troca os rótulos, fazendo a IA entender que a resposta verdadeira (B) é, na verdade, a que deveria ser escolhida. Isso corrige os exemplos ruins antes mesmo de começar o treino pesado.

2. A Regra do "Multas por Mentira" (Margem de Factualidade)

Agora, imagine que a IA está estudando um par onde:

  • Resposta Escolhida: Verdadeira.
  • Resposta Rejeitada: Mentira (alucinação).

O F-DPO aplica uma "multa extra" (um termo matemático chamado margem) nessa situação. É como se o treinador dissesse: "Se você escolher a resposta verdadeira e rejeitar a mentira, você ganha um bônus extra de pontos. Mas se você escolher a mentira, a penalidade será enorme."

Isso força a IA a dar muito mais importância à verdade do que apenas à fluência do texto.

Por que isso é especial? (As Vantagens)

  1. Simples e Barato: Diferente de outros métodos que precisam de verificadores externos complexos ou múltiplas etapas de treino, o F-DPO é como um "ajuste fino" direto. Ele usa apenas um rótulo simples: "Isso é fato" ou "Isso é mentira".
  2. Funciona em Qualquer Tamanho: Os autores testaram em IAs pequenas (1 bilhão de parâmetros) e grandes (14 bilhões). Funcionou para todas.
  3. Resultados Espetaculares:
    • Em um modelo chamado Qwen3-8B, a taxa de alucinação caiu 5 vezes (de 42% para apenas 8%).
    • A pontuação de factualidade subiu 50%.
    • Em testes de perguntas difíceis (TruthfulQA), a IA acertou muito mais perguntas de múltipla escolha, provando que ela aprendeu a não inventar.

A Analogia Final

Pense no treinamento tradicional (DPO) como um professor que elogia o aluno que fala mais alto e com mais segurança, mesmo que ele esteja errado. O aluno vira um "charlatão".

O F-DPO é como um professor rigoroso que diz: "Não importa o quão bem você fala. Se você estiver errado, você perde pontos. Se você estiver certo, ganha pontos extras. E se eu vir que você foi elogiado por estar errado no passado, eu corrijo o histórico."

Conclusão

O F-DPO é uma ferramenta poderosa para garantir que as IAs do futuro não sejam apenas "bons falantes", mas também bons informantes. Ele ensina a máquina a priorizar a verdade, reduzindo o risco de que ela invente fatos perigosos enquanto mantém a capacidade de ser útil e prestativa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →