← 最新论文
💻 computer science

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

本文表明,通过结合涵盖检索、多证据合成和推理任务的精心策划的数据中心化配方,以及极简的基于结果的 GRPO 设置,可以在不依赖复杂奖励工程的情况下,显著增强大语言模型在长上下文推理和智能体能力方面的表现。

原作者: Xiaoyue Xu, Sikui Zhang, Xiaorong Wang, Xu Han, Chaojun Xiao

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyue Xu, Sikui Zhang, Xiaorong Wang, Xu Han, Chaojun Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢的学生(AI 模型),当信息简短且整洁(比如只有一页笔记)时,他非常擅长解决数学问题或回答问题。但当你递给他一个装满书籍、散乱笔记和数千页文本的图书馆时,他就会感到不知所措。他可能会开始瞎猜、跳过重要的页面,或者在噪音中迷失方向。

这篇论文介绍了一种新的训练方法,旨在让这个学生能够处理“图书馆”,而不需要一个极其复杂、昂贵的老师来不断纠正他的每一个步骤。

以下是使用简单类比对他们方法的拆解:

1. 问题所在:“奖励工程师” vs. “数据大厨”

此前,研究人员试图通过构建一个非常复杂的“奖励系统”来解决这个问题(就像一个严格的老师,会为寻找证据给分、为总结内容给分、并为最终答案给分)。他们认为问题出在“评分系统”上。

本文作者说:“等等。也许问题不在于评分系统,而在于教科书。”他们认为,如果你给学生一套多样化、高质量的练习题,即使使用非常简单的评分系统(仅仅检查最终答案是否正确),他们也能学会如何处理长篇书籍。

2. “数据食谱”:三种特定的练习

作者并没有向学生投喂随机的书籍,而是创建了一个特定的“训练菜单”,包含三种类型的练习。他们认为长文本推理实际上是三种技能协同工作的过程:

  • 练习 A:“大海捞针”(检索)

    • 类比: 想象一个草堆,针被藏在其中,但草堆里充满了其他看起来像针的东西(干扰项)。
    • 目标: 学生必须找到那根特定的针,即使它是以奇怪的方式被描述的(例如,文本中没有说“针”,而是说“用于缝纫的尖锐金属物体”),并且即使周围混杂了 50 根假针。这教会模型去寻找“意义”,而不仅仅是寻找关键词。
  • 练习 B:“解谜者”(多证据综合)

    • 类比: 想象一个谜案,关于嫌疑人位置的线索在第 10 页,关于其动机的线索在第 400 页,而关于其不在场证明的线索在第 800 页。没有任何单一页面能给出答案。
    • 目标: 学生必须阅读这三页内容,将线索串联起来,并意识到嫌疑人实际上在巴黎。这教会模型去结合分散的信息,而不是仅仅复制某一个句子。
  • 练习 C:“数学马拉松”(推理)

    • 类比: 一个数学题,其中的数字隐藏在一个关于宇宙飞船旅程的长篇乏味故事中。你必须先找到数字,然后再进行计算。
    • 目标: 学生必须忽略那些废话,找到数字,然后解出方程。这教会模型即使在文本非常长的情况下,也能保持“思考大脑”处于活跃状态。

3. 结果:简单的食谱效果最好

作者将这三种类型的练习混合在一起,创建了一个包含约 14,000 个示例的数据集,并训练了三个不同的 AI 模型(小型、中型和大型)。

  • 结果: 尽管他们使用的是非常简单的“评分系统”(仅检查最终答案是否正确),但模型的长文本处理能力有了显著提升。它们的表现优于之前使用更复杂奖励系统的各种方法。
  • 惊喜之处: 当他们把一个已经擅长担任“数字助手”(能够使用网络搜索等工具的智能体)的模型拿出来,并给予这种额外的训练后,这个助手的表现变得更加出色。它能够搜索网页、阅读长篇文章,并更准确地完成复杂的现实任务(例如查找特定的旅行信息或调试代码)。

总结

该论文声称,要让 AI 更聪明地阅读长文档,你不需要发明一种复杂的新评分方式。相反,你只需要给它们一套更好、更多样化的练习题,专门训练它们去:

  1. 寻找隐藏的信息。
  2. 连接不同的信息碎片。
  3. 循序渐进地思考问题。

通过向 AI 提供这种特定的“数据食谱”,它就能更有效地在互联网和海量文档构成的“图书馆”中进行导航。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →