← 最新论文
💻 computer science

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

本文介绍了 OpenRM,这是一种通过群体相对策略优化(Group Relative Policy Optimization)训练的工具增强型奖励模型,旨在利用外部证据来准确评估长文本智能体任务,从而显著提升下游大语言模型的对齐与评估性能。

原作者: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明的图书管理员(AI),他非常擅长撰写长篇且详尽的报告。但有时,这位图书管理员会凭空捏造或弄错事实,因为他仅仅依靠脑海中的记忆,而不去检查书架上真实的图书。

为了解决这个问题,我们需要一位**评委(Judge)**来给图书管理员的报告评分。在过去,这些评委就像是必须把整座图书馆都背下来的学生。如果问题涉及某个特定的、冷门的知识点,或者是一项全新的医学发现,评委往往会因为没有在面前翻开正确的“书”而做出错误的判断。

OPENREWARD 是一种新型的评委,它不仅仅依赖记忆。它更像是一个带着“魔法手机”的侦探

以下是它的工作原理,通过简单的拆解说明:

1. 问题所在:“仅靠记忆”的评委

想象一下,你要求一位评委去比较两份长篇旅游指南。一份指南说:“参观巴黎的埃菲尔铁塔,”而另一份说:“参观伦敦的埃菲尔铁塔。”

  • 旧式评委: 他们可能只是根据自己的直觉进行猜测。如果他们累了或者问题很刁钻,他们可能会没能发现伦敦其实并没有埃菲尔铁塔。
  • 问题核心: 对于长篇、复杂的回答(如医疗建议或科学研究),仅仅靠猜测是不够的。你需要证据。

2. 解决方案:“侦探型”评委 (OPENREWARD)

OPENREWARD 与众不同。当它看到两个答案时,它不会立即做出选择。相反,它会说:“等等,我得先核实事实。”

  • 魔法手机(工具): 它拥有一部手机,可以瞬间调用维基百科、搜索科学论文或查询医学数据库。
  • 调查过程: 它会主动使用这些工具来收集证据。它可能会搜索“平衡胜者分类器(Balanced Winnow classifier)”或“医学症状”,以查看真实的数据是什么。
  • 裁决: 只有在收集完这些证据之后,它才会决定哪个答案更好。这就像是一位在给出判决前,拒绝直接下结论,必须先阅读实际警情报告的法官。

3. 我们是如何教导这位侦探的(训练)

你不能直接告诉一台电脑:“去当一名侦探。”你必须教会它如何使用工具而不分心。

  • “虚拟”图书馆: 研究人员找不到足够多关于这些复杂任务的“好答案 vs 坏答案”的真实案例。因此,他们构建了一个模拟图书馆
    • 他们选取了一篇真实的文档(例如维基百科页面)。
    • 他们要求 AI 根据该文档提出一个问题。
    • 然后,他们要求 AI 写出两个答案
      1. 好答案: AI 被允许阅读该文档。
      2. 坏答案: AI 不被允许 阅读该文档(因此它必须进行猜测或产生幻觉)。
  • 教学过程: 他们向这位“侦探评委”展示这些成对的例子(好答案 vs 坏答案),并教导它:“如果你使用你的手机来核实事实,你会得到一颗金星;如果你只是瞎猜,你会受到惩罚。”
  • 奖励机制: 评委学会了,为了获得最高分,它必须正确地使用工具来寻找真相,而不是做一个快速的猜测。

4. 结果:为什么这很重要

研究人员将这种新型“侦探评委”与其他著名的评委(如 GPT-4 或专门的 AI 评委)进行了对比测试。

  • 更高的准确性: OPENREWARD 在识别长篇、复杂回答中的真相方面表现得更好,尤其是在科学、医学和常识领域。
  • 更好的老师: 他们还利用 OPENREWARD 来帮助训练其他 AI。通过使用 OPENREWARD 从大量混乱的数据中挑选出最好的答案,他们为其他 AI 创造了一本更“干净”的教科书。使用这些“干净”数据进行训练的 AI 变得更加聪明且更加可靠。

总结类比

把旧的 AI 评委想象成在考试时不准使用课本的学生。他们只能靠猜。
OPENREWARD 则是一个被允许在考试期间使用图书馆和互联网的学生。因为它能够查阅答案,所以它能获得更高的分数,并能帮助整个班级学得更好。

该论文声称,这种方法使 AI 评估在处理复杂任务时更加可靠,并有助于训练更好的 AI 模型,但它并未明确表示该方法已准备好用于临床诊断或研究中测试之外的其他特定未来应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →