← Últimos artigos
💬 NLP

No One Size Fits All: QueryBandits for Hallucination Mitigation

O artigo apresenta o QueryBandits, um framework de bandits contextuais que mitiga alucinações em modelos de linguagem grandes (incluindo os fechados) ao aprender adaptativamente a melhor estratégia de reescrita de consultas para cada caso, superando significativamente políticas estáticas e a ausência de reescrita.

Autores originais: Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

Publicado 2026-02-25
📖 4 min de leitura☕ Leitura rápida

Autores originais: Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente de inteligência artificial (IA) muito inteligente, como o GPT-4, que sabe responder quase tudo. No entanto, às vezes, esse assistente "alucina": ele inventa fatos, erra cálculos simples ou confunde coisas, mesmo sendo muito poderoso.

O problema é que, na maioria das empresas, usamos esses assistentes "fechados" (como o GPT-4), onde não podemos mexer no cérebro deles (os pesos do modelo) para corrigir erros. A maioria das soluções atuais tenta consertar o cérebro do assistente, mas isso não funciona para os modelos que a gente só pode "conversar" por mensagem.

Os autores deste paper, do JPMorgan AI Research, criaram uma solução chamada QueryBandits (ou "Bandidos de Consulta"). Vamos explicar como funciona usando uma analogia simples:

1. O Problema: "Tamanho Único Não Serve para Todos"

Imagine que você tem um guarda-chuva. Se chover muito, você precisa de um guarda-chuva grande. Se estiver apenas garoando, um guarda-chuva pequeno basta. Se você usar sempre o mesmo tipo de guarda-chuva para qualquer clima, você vai se molhar ou ficar desconfortável.

Da mesma forma, quando fazemos uma pergunta para uma IA, às vezes a pergunta está confusa, às vezes falta informação, e às vezes é muito complexa. A maioria dos métodos tenta usar sempre a mesma estratégia para reescrever a pergunta (ex: "sempre simplifique" ou "sempre adicione detalhes"). O paper mostra que isso é um erro: não existe uma única forma de reescrever a pergunta que funcione para tudo.

2. A Solução: O "Detetive" e o "Mestre de Cerimônias"

O QueryBandits funciona como um Mestre de Cerimônias muito esperto que fica entre você e a IA. Antes de enviar sua pergunta para a IA, ele analisa a pergunta e decide qual "truque" usar para torná-la mais clara.

Ele tem um Kit de Ferramentas com 5 estratégias diferentes (os "braços" do bandido):

  • Parafrasear: Mudar as palavras, mas manter o sentido (como dizer "passe o sal" em vez de "poderia me entregar o sal?").
  • Simplificar: Cortar frases longas e complicadas.
  • Desambiguar: Resolver confusões (ex: se você disse "ele", o sistema pergunta "quem é 'ele'?").
  • Expandir: Adicionar detalhes que faltam (ex: em vez de "qual a capital?", dizer "qual a capital da França em 2024?").
  • Esclarecer Termos: Explicar palavras difíceis ou técnicas.

3. Como ele aprende? (O "Bandido")

Aqui entra a parte mágica. O sistema usa uma técnica chamada Bandit Contextual (inspirada em jogos de azar e aprendizado de máquina).

Imagine que você está em um cassino com várias máquinas caça-níqueis (as estratégias de reescrita). Você não sabe qual máquina paga mais.

  • O QueryBandits olha para a sua pergunta e vê "pistas" (17 características linguísticas, como: "tem muitas vírgulas?", "usa palavras raras?", "tem uma pergunta indireta?").
  • Com base nessas pistas, ele adivinha qual máquina (estratégia) vai dar o melhor prêmio (resposta correta).
  • Ele tenta a estratégia, vê se a IA acertou a resposta e aprende com o resultado.
  • Na próxima pergunta parecida, ele já sabe qual estratégia é melhor.

É como um cozinheiro que aprende: "Ah, quando o cliente pede um prato com ingredientes raros, eu preciso explicar o que são antes de cozinhar. Mas quando o pedido é simples, eu só cozinho rápido."

4. O Resultado: Menos Alucinações, Mais Precisão

Os autores testaram isso em 16 cenários diferentes (de perguntas de matemática a curiosidades gerais) usando o GPT-4o.

  • O que aconteceu: O sistema aprendeu a escolher a ferramenta certa para cada pergunta.
  • A vitória: A melhor estratégia (chamada Thompson Sampling) venceu a estratégia de "não fazer nada" (enviar a pergunta original) em 87,5% das vezes.
  • Comparação: Ele foi muito melhor do que usar apenas uma regra fixa (como "sempre simplificar"), superando essas regras fixas em mais de 40%.

Resumo em uma frase

O QueryBandits é como um tradutor inteligente que, antes de você falar com uma IA, analisa o que você disse e escolhe a melhor maneira de reformular sua pergunta para garantir que a IA entenda perfeitamente e não invente mentiras, tudo isso sem precisar mexer no código da IA.

A lição principal: Não existe uma resposta única para todos os problemas. Para evitar que a IA alucine, precisamos adaptar a pergunta de acordo com o contexto, e esse sistema aprende a fazer isso sozinho, online, enquanto você o usa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →