← 最新论文
💬 NLP

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL 是一个开源框架,它通过包含 23K 个多样化 RLVR 样本的能力导向型数据集以及用于异构多任务优化的新型 TMN-Reweight 算法来增强长上下文强化学习,实现了与领先闭源模型相当的性能。

原作者: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一位非常聪明但注意力短暂的學生,如何阅读并理解一座庞大的图书馆,而不仅仅是一页纸。这就是“长上下文”人工智能所面临的挑战。论文GoLongRL提出了一种训练这些人工智能模型的新方案,重点关注两个核心问题:教什么(数据)以及如何批改作业(算法)。

以下是使用简单类比进行的分解说明:

1. 问题所在:旧方法过于狭隘

以往教导人工智能阅读长书的方法,就像只训练学生做“大海捞针”的谜题。

  • 问题:它们通过让 AI 在长文本中搜寻特定事实来生成数据。虽然这有助于 AI 找到“针”,但并未教会它如何总结整片“干草堆”、对最重要部分进行排序,或理解复杂的故事。
  • 结果:AI 擅长寻找特定事实,但在其他技能上表现不佳,例如总结小说或整理杂乱的报告。这就像一个能查字典找到特定单词的学生,却写不出一篇作文。

2. 解决方案:以“能力为导向”的教学大纲

GoLongRL 的作者决定不再仅仅制造“捞针”游戏,而是转而构建一个基于聪明读者所需 9 种不同技能的综合教学大纲

  • 数据集(教科书):他们构建了一个包含 23,000 道练习题的新数据集。
    • 真实书籍,而非虚构故事:他们没有编造虚假故事,而是使用了真实的书籍、学术论文和法律文件。他们要求 AI 针对这些真实文本生成问题。这确保了 AI 能够处理人类写作中那种杂乱无章、自然真实的风格。
    • 9 种技能:该数据集涵盖了多样化的任务,包括:
      • 精确检索:查找特定事实。
      • 摘要:将长章节浓缩为几句话。
      • 排序:决定多个搜索结果中哪一个最有用。
      • 推理:解决财务报告中出现的数学问题。
    • 类比:想象一下,与其给学生 10,000 份完全相同的“寻找红球”测试,不如给他们 10,000 份混合测试:有些要求他们寻找红球,有些要求他们总结比赛,有些要求他们对选手进行排名,还有些要求他们解决关于分数的数学问题。

结果:即使没有使用花哨的新数学技巧,仅凭这份更好的“教学大纲”,就使 AI 的表现优于顶级的闭源竞争对手(QwenLong-L1.5)。

3. 算法:“公平评分”系统(TMN-Reweight)

一旦拥有了多样化的教学大纲,你就需要一种公平评分学生表现的方法。标准的评分方法(称为 GRPO)在处理不同类型的问题时存在缺陷。

  • 问题:想象一场数学考试,答对一题得 100 分,而一场阅读理解考试,答对一题只得 1 分。如果将它们混合在一起,数学问题将主导学生的大脑,导致他们忽视阅读理解。此外,如果一个问题超级难,标准评分可能会感到困惑,要么给学生的幸运猜测过多的分数,要么给学生的接近正确答案的表现过少的分数。
  • 修正方案(TMN-Reweight):作者发明了一种包含两个步骤的新评分系统:
    1. 拉平竞争环境(任务级归一化):他们调整了分数,使得数学问题的“完美”得分与排序问题的“完美”得分感觉相同。这防止了 AI 仅仅因为数字看起来较小就忽略困难的任务。
    2. 聚焦挣扎(难度自适应重加权)
      • 如果学生答对了简单的问题,老师会说:“干得好,但这你已经掌握了”,并给予较小的奖励。
      • 如果学生答对了困难的问题(这种情况很少见),老师会说:“哇,这很难!太棒了,你居然解出来了!”并给予巨大的奖励。
      • 如果学生答错了困难的问题,老师不会生气;他们只会说:“我们再试一次”,并减少惩罚,以免学生感到气馁。

类比:这就像一位教练,他不仅仅计算分数。教练会根据动作的难度调整得分,并特别关注那些难以执行的动作给予额外的赞扬。这有助于 AI 在所有技能上更快、更均衡地学习。

4. 结果:全面发展的学生

当他们测试这种新方法时:

  • 全面进步:AI 在所有 9 项技能上都有显著提升,而不仅仅是“捞针”类技能。
  • 无权衡:通常,当你训练学生擅长一件事(如阅读长书)时,他们在其他方面(如通用逻辑或记忆)会变差。这种方法实际上在教导 AI 进行长上下文阅读的同时,提升了其通用推理和记忆技能。
  • 开源:作者发布了整个“教学大纲”(数据集)、“教学计划”(代码)和“评分标准”(算法),供任何人使用。

总结

GoLongRL 就像是将人工智能的教育从枯燥、重复的 drills(寻找针)升级为一套丰富、多样的课程(阅读、总结、排序和推理),并配合一套公平、智能的评分系统,该系统知道何时该给学生施加更大压力,何时该让他们休息一下。其结果是一个不仅仅是事实查找器,而是真正的长篇思考者的人工智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →