← Últimos artigos
💬 NLP

Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models

Este artigo demonstra que o Aprendizado por Reforço com Recompensas Verificáveis (RLVR), que incentiva explicitamente os modelos a se absterem de responder a perguntas incertas, reduz efetivamente as alucinações e melhora a humildade intelectual em Grandes Modelos de Linguagem sem comprometer significativamente a precisão em benchmarks fatuais.

Autores originais: Abha Jha, Akanksha Mahajan, Ashwath Vaithinathan Aravindan, Praveen Saravanan, Sai Sailaja Policharla, Sonal Chaturbhuj Gehlot

Publicado 2026-01-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Abha Jha, Akanksha Mahajan, Ashwath Vaithinathan Aravindan, Praveen Saravanan, Sai Sailaja Policharla, Sonal Chaturbhuj Gehlot

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um assistente muito inteligente e culto para responder às suas perguntas. O problema é que este assistente é um pouco "sabichão". Mesmo quando não sabe a resposta de fato, ele se sente compelido a adivinhar, muitas vezes inventando fatos que parecem convincentes, mas que estão completamente errados. No mundo da IA, isso é chamado de "alucinação".

Este artigo trata de ensinar a esses assistentes de IA uma nova e vital habilidade: saber quando dizer "eu não sei".

Aqui está o detalhamento de sua abordagem, usando analogias simples:

O Problema: A Máquina de Adivinhação Superconfiante

Atualmente, os Grandes Modelos de Linguagem (LLMs) são treinados para sempre dar uma resposta. Se você fizer uma pergunta, eles tentarão gerar algo, mesmo que estejam apenas adivinhando. É como um aluno fazendo uma prova que tem medo de deixar uma questão em branco, então rabisca uma resposta aleatória apenas para ganhar pontos. Isso leva a informações confiantes, porém falsas.

A Solução: O Sistema de "Recompensa pela Honestidade"

Os pesquisadores testaram um novo método de treinamento chamado Aprendizado por Reforço com Recompensas Verificáveis (RLVR). Pense nisso como um novo sistema de notas para a IA.

Em vez de apenas dar pontos para uma resposta correta, eles introduziram um sistema de pontuação de três vias:

  1. Resposta Correta: +1 Ponto (Bom trabalho!)
  2. Resposta Errada: -1 Ponto (Palpite ruim, você perde pontos.)
  3. "Eu Não Sei": Uma recompensa especial (digamos, +0,3 pontos).

O objetivo era ensinar a IA que é melhor ser honesta e dizer "eu não sei" do que adivinhar com confiança e errar. Eles queriam encontrar a recompensa "Goldilocks" (o ponto ideal): nem muito alta (ou a IA diria "eu não sei" para tudo e pararia de tentar), nem muito baixa (ou ela continuaria adivinhando).

Os Experimentos: Testando as Novas Regras

Eles testaram isso em dois tipos diferentes de "alunos" (modelos de IA):

  • Granite-3.3-2B: Um modelo menor e mais compacto.
  • Qwen-3-4B: Um modelo maior e mais poderoso.

Eles os testaram em dois tipos de "provas":

  1. MedMCQA: Questões médicas de múltipla escolha (como um quiz de conhecimentos gerais com um conjunto fixo de respostas).
  2. Hendrycks Math: Problemas matemáticos difíceis que exigem a escrita de uma solução longa (como uma redação ou uma demonstração).

O Que Eles Descobriram

1. O "Ponto Ideal" Funciona para Múltipla Escolha
Nas questões médicas de múltipla escolha, eles descobriram um "ponto ideal" para a recompensa do "Eu não sei".

  • Se dessem uma recompensa minúscula por dizer "eu não sei", a IA começou a admitir incerteza.
  • O Resultado: O número de respostas falsas e inventadas caiu significamente. A IA tornou-se mais humilde.
  • A Troca (Trade-off): A IA obteve um número ligeiramente menor de respostas corretas no geral porque parou de adivinhar. No entanto, os pesquisadores descobriram que uma recompensa moderada (cerca de 0,3) reduziu os palpites ruins sem arruinar os bons.
  • A Vantagem do Modelo Maior: O modelo maior (Qwen) lidou melhor com esse "treinamento de honestidade" do que o menor. Ele foi capaz de dizer "eu não sei" quando necessário sem perder tanto de sua inteligência geral.

2. A Luta com Perguntas de Resposta Aberta
Quando tentaram isso nos problemas matemáticos difíceis (onde a IA tem que escrever uma resposta longa), não funcionou tão bem por conta própria.

  • O Problema: A IA estava tão acostumada a adivinhar que tinha medo de tentar a opção "eu não sei". Era como um aluno que tem tanto medo de errar que se recusa até a considerar deixar uma questão em branco. A IA não "explorou" a opção de dizer "eu não sei" o suficiente durante o treinamento.
  • A Correção: Eles tentaram um processo de duas etapas. Primeiro, forçaram a IA a praticar dizer "eu não sei" em um conjunto específico de perguntas (Ajuste Fino Supervisionado). Depois, aplicaram o sistema de recompensa. Isso ajudou a IA a se sentir confortável com a ideia de abster-se, embora ainda fosse difícil de equilibrar.

A Conclusão

O artigo conclui que você não pode apenas dizer a uma IA para ser honesta; você precisa recompensá-la por ser honesta.

Ao ajustar os "pontos" dados por dizer "eu não sei", os desenvolvedores podem ajustar a personalidade da IA. Eles podem torná-la mais cautelosa (menos propensa a mentir) ou mais confiante (mais propensa a tentar), dependendo do que precisam.

  • Para a abordagem cautelosa: Dê uma pequena recompensa por dizer "eu não sei". A IA parará de inventar fatos, o que a torna muito mais confiável para coisas como aconselhamento médico ou jurídico, onde errar é perigoso.
  • A Limitação: A IA precisa de um pouco de ajuda para aprender como dizer "eu não sei" em primeiro lugar, especialmente para tarefas complexas e de resposta aberta.

Em resumo, os pesquisadores construíram um manual de treinamento que ensina aos modelos de IA que o silêncio é, às vezes, melhor do que uma mentira, e provaram que, com as recompensas certas, a IA pode aprender a ser intelectualmente humilde.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →