想象一下,你有一个才华横溢的学生(AI 模型),当信息简短且整洁(比如只有一页笔记)时,他非常擅长解决数学问题或回答问题。但当你递给他一个装满书籍、散乱笔记和数千页文本的图书馆时,他就会感到不知所措。他可能会开始瞎猜、跳过重要的页面,或者在噪音中迷失方向。
这篇论文介绍了一种新的训练方法,旨在让这个学生能够处理“图书馆”,而不需要一个极其复杂、昂贵的老师来不断纠正他的每一个步骤。
以下是使用简单类比对他们方法的拆解:
1. 问题所在:“奖励工程师” vs. “数据大厨”
此前,研究人员试图通过构建一个非常复杂的“奖励系统”来解决这个问题(就像一个严格的老师,会为寻找证据给分、为总结内容给分、并为最终答案给分)。他们认为问题出在“评分系统”上。
本文作者说:“等等。也许问题不在于评分系统,而在于教科书。”他们认为,如果你给学生一套多样化、高质量的练习题,即使使用非常简单的评分系统(仅仅检查最终答案是否正确),他们也能学会如何处理长篇书籍。
2. “数据食谱”:三种特定的练习
作者并没有向学生投喂随机的书籍,而是创建了一个特定的“训练菜单”,包含三种类型的练习。他们认为长文本推理实际上是三种技能协同工作的过程:
练习 A:“大海捞针”(检索)
- 类比: 想象一个草堆,针被藏在其中,但草堆里充满了其他看起来像针的东西(干扰项)。
- 目标: 学生必须找到那根特定的针,即使它是以奇怪的方式被描述的(例如,文本中没有说“针”,而是说“用于缝纫的尖锐金属物体”),并且即使周围混杂了 50 根假针。这教会模型去寻找“意义”,而不仅仅是寻找关键词。
练习 B:“解谜者”(多证据综合)
- 类比: 想象一个谜案,关于嫌疑人位置的线索在第 10 页,关于其动机的线索在第 400 页,而关于其不在场证明的线索在第 800 页。没有任何单一页面能给出答案。
- 目标: 学生必须阅读这三页内容,将线索串联起来,并意识到嫌疑人实际上在巴黎。这教会模型去结合分散的信息,而不是仅仅复制某一个句子。
练习 C:“数学马拉松”(推理)
- 类比: 一个数学题,其中的数字隐藏在一个关于宇宙飞船旅程的长篇乏味故事中。你必须先找到数字,然后再进行计算。
- 目标: 学生必须忽略那些废话,找到数字,然后解出方程。这教会模型即使在文本非常长的情况下,也能保持“思考大脑”处于活跃状态。
3. 结果:简单的食谱效果最好
作者将这三种类型的练习混合在一起,创建了一个包含约 14,000 个示例的数据集,并训练了三个不同的 AI 模型(小型、中型和大型)。
- 结果: 尽管他们使用的是非常简单的“评分系统”(仅检查最终答案是否正确),但模型的长文本处理能力有了显著提升。它们的表现优于之前使用更复杂奖励系统的各种方法。
- 惊喜之处: 当他们把一个已经擅长担任“数字助手”(能够使用网络搜索等工具的智能体)的模型拿出来,并给予这种额外的训练后,这个助手的表现变得更加出色。它能够搜索网页、阅读长篇文章,并更准确地完成复杂的现实任务(例如查找特定的旅行信息或调试代码)。
总结
该论文声称,要让 AI 更聪明地阅读长文档,你不需要发明一种复杂的新评分方式。相反,你只需要给它们一套更好、更多样化的练习题,专门训练它们去:
- 寻找隐藏的信息。
- 连接不同的信息碎片。
- 循序渐进地思考问题。
通过向 AI 提供这种特定的“数据食谱”,它就能更有效地在互联网和海量文档构成的“图书馆”中进行导航。
技术摘要:超越奖励工程:长上下文强化学习的数据配方
问题陈述
虽然强化学习(RL)已在增强大语言模型(LLM)的推理能力方面证明了其有效性,但现有的研究主要集中在短上下文任务上。将这些收益扩展到长上下文推理领域仍是一个尚未充分探索的课题。目前的方法通常依赖于复杂的奖励工程,通过补充基于结果的奖励与辅助信号(例如证据溯源得分或中间推理步骤)来引导模型处理长输入。然而,这些方法面临挑战:仅基于结果的奖励在长上下文中定位证据时提供的信号过于稀疏,导致召回率遇到瓶颈并产生捷径推理。此外,高质量、多样化的长上下文强化学习训练数据仍然匮乏,现有的合成数据集往往在任务覆盖范围上较为狭窄,或属于闭源数据。
方法论
作者提出了一个以数据为中心的视角,假设长上下文推理可以分解为一组必须共同练习的互补核心能力。他们证明,与其进行复杂的奖励工程,不如使用一个简单而有效的数据配方,配合极简的基于结果的强化学习设置,就足以大幅提升性能。
1. 数据配方
训练混合集针对三个互补的任务族,总计构建了约 14,000 个样本,涵盖八个数据集:
- 检索(Retrieval): 侧重于从信息分散或语义间接的长输入中定位相关证据。
- FuzzyNeedle(模糊针尖): 通过使用 Wikidata 的 IS-A 关系对“针尖”(目标信息)进行改写,从而消除词法层面的捷径,要求模型解析“实例属于”(instance-of)关系而非简单的关键词匹配。
- MultiNeedle(多重针尖): 要求模型在许多近乎重复的针尖中进行区分,并根据其出现的顺序检索特定的一个。
- 多证据合成(Multi-evidence Synthesis): 要求整合散落在输入不同部分的信息,以得出单一信息无法提供的答案。
- CrossEntity(跨实体): 生成需要聚合多个实体派生属性的问题(例如,通过出生年份和夺冠年份计算“夺冠年龄”)。
- WebSearch(网页搜索): 模拟搜索智能体任务,模型必须追踪多跳关系链,同时在主题相似的干扰项中区分黄金证据。
- MultiQuery(多查询): 在文档中嵌入多个查询;遗漏任何一个证据片段都会导致错误的响应,从而强调了完整覆盖的重要性。
- KeyChain(密钥链): 将问题隐藏在 UUID 指针链之后,要求模型通过追踪链条来恢复实际查询。
- LongDocQA(长文档问答): 扩展了现有数据集(如 HotpotQA, MuSiQue, Qasper),通过添加全长文档或无关填充来增加上下文长度。
- 推理(Reasoning): 侧重于在长输入上执行复杂的多步问题解决(如数学),以保持深层思考能力。
- LongMath(长数学): 将困难的短上下文数学问题改编为叙事场景,其中变量和条件分布在至少五个故事片段中,这些片段散落在一段无关的长文档内。
数据策展: 作者应用了一个两阶段流水线:丢弃超过 64K token 的样本,并通过仅保留基础模型(Qwen3-30B-A3B)能部分做对但不能全部做对的样本,来筛选出“中等难度”的样本。
2. 强化学习设置
作者采用了群体相对策略优化(GRPO),并配备了极简的奖励设计:
- 奖励: 主要采用词级召回奖励(r=∣y^∩y∗∣/∣y∗∣),即模型最终答案与标签之间的重合度。对于复杂任务(CrossEntity, LongMath),使用 LLM 作为评判器(DeepSeek-V3.2)来验证正确性。
- 稳定性: 为了处理八个数据集之间异构的奖励分布,作者使用了任务平衡采样(在批次中固定每个数据集的比例)和任务级优势归一化(按每个数据集的标准差对优势值进行缩放)。
- 无过程奖励: 与以往的工作不同,该方法不使用用于中间推理步骤或证据溯源的辅助信号,而是完全依赖于结果奖励。
核心贡献
- 以数据为中心的范式: 本文挑战了当前过度关注奖励工程的趋势,证明了多样化的数据配方本身就足以驱动长上下文推理能力的显著提升。
- 统一的任务分类法: 作者定义并策展了一个涵盖三种互补能力(检索、多证据合成、推理)的训练混合集,并认为这三种能力对于实现最优性能都是必要的。
- 开源数据集: 作者构建并发布了包含约 1.4 万个样本的八个数据集,以促进未来的研究。
- 可迁移性: 研究表明,长上下文推理能力的提升可以迁移到**智能体任务(agentic tasks)**中,这表明加强核心推理能力有助于提升长程智能体的能力。
实验结果
该方法在三个模型(Qwen3-4B, Qwen3-8B, 和 Qwen3-30B-A3B)以及七个长上下文基准测试上进行了评估。
- 性能增益: 该数据配方在三个模型上分别带来了 +7.2、+3.2 和 +6.4 点的平均提升。
- 对比: 该方法在所有模型和基准测试中均优于两种先前的长上下文强化学习训练集(DocQA-RL-1.6K 和 KeyChain-15K)。
- 泛化能力: 尽管训练时的输入上限为 64K tokens,但其收益成功迁移到了更长的上下文(高达 512K+ tokens),这表明模型学习到了长度通用的推理技能,而非仅仅是对训练分布进行过拟合。
- 消融实验:
- 移除任何单一的任务类别或两两组合,其性能均低于完整的混合集,证实了三种任务族之间的互补性。
- 移除任务平衡技术会导致性能出现中度下降,凸显了减轻任务间竞争的必要性。
- 添加“过程奖励”(使用 LLM-as-judge 对推理连贯性进行评分)并未比仅使用结果奖励的设置带来性能提升,这表明多样化的数据本身已经提供了足够的信息信号。
- 智能体迁移: 在经过智能体微调的模型(AgentCPM-Explore)上继续使用该数据配方进行强化学习训练,使 GAIA 提升了 +4.8 点,使 BrowseComp 提升了 +7.0 点,证明了长上下文技能向自主智能体的迁移能力。
意义与主张
本文声称,多样化的训练数据是长上下文强化学习的主要瓶颈,而非奖励设计。通过构建由检索、合成和推理任务组成的平衡混合集,作者在无需复杂奖励工程的情况下实现了最先进的结果。这项工作表明,加强核心长上下文能力是增强智能体能力的一条有效路径,因为智能体在调用工具的过程中自然会积累海量的上下文。作者也谦虚地指出了局限性,包括使用合成数据可能无法完全匹配现实世界的分布,以及目前仅限于 30B 参数规模及 64K 上下文长度的模型。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。