Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR
本文介绍了迁移感知课程学习(Transfer-Aware Curriculum, TAC),这是一种针对具有可验证奖励(Verifiable Rewards, RLVR)的多领域强化学习所设计的自动化、低开销多臂老虎机式方法,它通过梯度几何对齐动态地根据领域的跨领域可迁移性来优先排序训练领域,从而在宏观平均推理准确度上显著优于固定调度方案和仅基于可学习性的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位正在训练运动员成为“全能超级解决者”的教练。你的团队需要精通六种不同的运动:数学、编程、逻辑、模拟、表格和科学。
在过去,教练们主要有两种安排训练的方式:
- 随机混合法: 每天随机把运动员投入到不同的运动中。
- “学习力”教练: 只训练那些运动员目前进步最快的运动。如果他们在数学方面进步很快,那就一直做数学。
问题所在:
论文指出,这两种方法都有一个盲点。仅仅因为一名运动员在数学方面的进步很快,并不意味着练习数学会对逻辑或科学有所帮助。事实上,研究发现某些领域(如数学)是非常专业化的,练习它们只会让你变得更擅长数学,而对整个团队的提升微乎其微。与此同时,其他领域可能起步阶段较难,但练习这些领域会为“所有”其他运动带来“加成”。
如果你只听从“学习力”教练的指挥,你可能会过度训练数学,而忽略了那些真正能带动整个团队成长的运动。
解决方案:“迁移感知型”教练 (TAC)
作者提出了一种新的教练方案——TAC(迁移感知课程)。你可以把它想象成一位聪明的教练,在决定当天的训练项目前,会先问两个问题:
- “他们现在正在学习吗?”(学习力信号)
- 如果运动员虽然在挣扎但仍在取得进展,我们就应该继续练习。
- “练习这项运动对其他运动有帮助吗?”(迁移性信号)
- 这是新的窍门。教练会观察运动员进步的“方向”。练习逻辑所建立的思维肌肉,是否也能帮助他们学习科学?
- 如果答案是肯定的,那么这项运动就会获得更高的优先级,即使运动员在它上面的进步速度并不像在数学上那么快。
它是如何运作的(“魔法”比喻)
想象运动员的大脑是一张巨大的地图,上面布满了许多路径。
- 旧方法: 教练只是选择运动员走得最快的路径。
- TAC 方法: 教练会观察路径的几何结构。
- 有些路径(如数学)就像陡峭且狭窄的悬崖。攀爬它能让你成为爬悬崖的高手,但对游泳或跑步没有任何帮助。
- 其他路径(如表格或逻辑)则像宽阔平坦的高速公路。在上面行走起初可能感觉较慢,但它能锻炼出帮助你攀爬、游泳和跑步的肌肉。
TAC 使用一种特殊的工具(称为梯度几何学)来测量运动员进步的“角度”。如果他们的数学进步角度与逻辑进步的角度完全指向不同方向,TAC 就会知道:“好了,今天的数学练习够了;让我们转向逻辑,因为那条路径会对整体团队有所帮助。”
结果如何:发生了什么?
研究人员在两名不同的“运动员”(名为 Qwen 和 Llama 的 AI 模型)身上测试了所有六种运动。
- 胜出者: TAC 每次都赢了。它产生了最佳的整体团队表现。
- 令人惊讶之处: 那个只关注“学习力”(只关心谁进步最快)的教练实际上陷入了困境。它一直痴迷于数学和科学,因为这些领域最初更容易提高,但这损害了团队的整体平衡。
- 效率: TAC 不需要额外的任何数据或昂贵的测试。它通过观察正在生成的训练信号,就自己推导出了最佳的进度表。这就像是给教练的战术手册进行了一次免费升级。
核心启示
论文的结论是,要构建一个真正能够进行任何推理的智能 AI,你不能仅仅喂给它那些它学得最快的资料。你必须聪明地思考哪些数据对其他事物的帮助最大。
通过平衡“我们现在正在学什么”与“什么能帮助我们学会一切”,TAC 教练创造了一个更强大、更全能的推理者。这就是训练一名只能精通一技之长的专家,与训练一名能应对任何情况的全才之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。