← Últimos artigos
💻 computer science

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

Este artigo apresenta o OpenRM, um modelo de recompensa aumentado por ferramentas treinado via Group Relative Policy Optimization para aproveitar evidências externas para avaliar com precisão tarefas agentes de longo formato, melhorando significativamente o alinhamento e o desempenho de avaliação de LLMs downstream.

Autores originais: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Publicado 2026-07-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um bibliotecário muito inteligente (a IA) que é ótimo em escrever relatórios longos e detalhados. Mas, às vezes, esse bibliotecário inventa coisas ou erra fatos porque está contando apenas com o que está dentro de sua própria cabeça, sem verificar os livros reais nas prateleiras.

Para consertar isso, precisamos de um Juiz para avaliar os relatórios do bibliotecário. No passado, esses Juízes eram como estudantes que tinham que memorizar toda a biblioteca em suas cabeças. Se a pergunta fosse sobre um fato específico e obscuro ou uma descoberta médica novíssima, o Juiz frequentemente erraria por meio de suposições, porque não tinha o "livro" certo aberto à sua frente.

OPENREWARD é um novo tipo de Juiz que não depende apenas da memória. É como um Detetive com um Celular Mágico.

Veja como funciona, dividido de forma simples:

1. O Problema: O Juiz de "Memória Única"

Imagine que você peça a um Juiz para comparar dois guias de viagem longos. Um guia diz: "Visite a Torre Eiffel em Paris", e o outro diz: "Visite a Torre Eiffel em Londres".

  • Juízes Antigos: Eles poderiam apenas adivinhar com base no que acham que sabem. Se estiverem cansados ou se a pergunta for difícil, eles podem falhar ao não perceber que não existe uma Torre Eiffel em Londres.
  • O Problema: Para respostas longas e complexas (como conselhos médicos ou pesquisa científica), adivinhar não é suficiente. Você precisa de provas.

2. A Solução: O Juiz "Detetive" (OPENREWARD)

O OPENREWARD é diferente. Quando ele vê duas respostas, não escolhe uma imediatamente. Em vez disso, ele diz: "Espere, preciso verificar os fatos primeiro."

  • O Celular Mágico (Ferramentas): Ele tem um celular que pode chamar instantaneamente a Wikipédia, pesquisar artigos científicos ou consultar bases de dados médicas.
  • A Investigação: Ele usa essas ferramentas ativamente para reunir evidências. Ele pode pesquisar por "Classificador Winnow equilibrado" ou "sintomas médicos" para ver o que os dados reais dizem.
  • O Veredito: Somente após reunir essas evidências é que ele decide qual resposta é melhor. É como um juiz que se recusa a dar um veredito até ter lido o relatório policial real.

3. Como Ensinamos o Detetive (Treinamento)

Você não pode simplesmente dizer a um computador: "Vá ser um detetive". Você tem que ensinar como usar as ferramentas sem se distrair.

  • A "Biblioteca Falsa": Os pesquisadores não conseguiram encontrar exemplos suficientes do mundo real de "Resposta Boa vs. Resposta Ruim" para essas tarefas complexas. Por isso, eles construíram uma biblioteca simulada.
    • Eles pegaram um documento real (como uma página da Wikipédia).
    • Pediram para uma IA escrever uma pergunta sobre ele.
    • Depois, pediram para a IA escrever duas respostas:
      1. A Resposta Boa: A IA teve permissão para ler o documento.
      2. A Resposta Ruim: A IA não teve permissão para ler o documento (então ela teve que adivinhar ou alucinar).
  • A Lição: Eles mostraram ao Juiz Detetive esses pares (Boa vs. Ruim) e o ensinaram: "Se você usar seu celular para verificar os fatos, ganha uma estrela de ouro. Se apenas adivinhar, recebe uma penalidade."
  • O Sistema de Recompensa: O Juiz aprendeu que, para obter a melhor pontuação, ele deve usar suas ferramentas corretamente para encontrar a verdade, e não apenas fazer um palpite rápido.

4. Os Resultados: Por que Isso Importa

Os pesquisadores testaram este novo Juiz Detetive contra outros Juízes famosos (como o GPT-4 ou juízes de IA especializados).

  • Melhor Precisão: O OPENREWARD foi muito melhor em detectar a verdade em respostas longas e complexas, especialmente em ciência, medicina e conhecimento geral.
  • Um Professor Melhor: Eles também usaram o OPENREWARD para ajudar a treinar outras IAs. Ao usar o OPENREWARD para escolher as melhores respostas de um monte de dados bagunçados, eles criaram um "livro didático mais limpo" para outras IAs aprenderem. As IAs treinadas com esses dados "limpos" tornaram-se mais inteligentes e confiáveis.

Analogia de Resumo

Pense nos antigos juízes de IA como estudantes fazendo uma prova sem poder usar livros didáticos. Eles têm que adivinhar.
O OPENREWARD é um estudante que tem permissão para usar a biblioteca e a internet durante a prova. Porque ele pode procurar as respostas, ele consegue uma pontuação muito mais alta e ajuda toda a classe a aprender melhor.

O artigo afirma que este método torna a avaliação de IA mais confiável para tarefas complexas e ajuda a treinar modelos de IA melhores, mas não chega a dizer que está pronto para diagnósticos clínicos reais ou outras aplicações específicas além do que foi testado no estudo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →