← 最新论文
🤖 machine learning

Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

本文介绍了 SHIFT,一种用于可验证奖励强化学习(RLVR)的无需训练的数据选择方法,该方法通过在单次推理 rollout 中测量由推理引发的隐藏状态偏移来识别高效用样本,从而在无需访问标签或奖励信号的情况下实现有效的模型训练。

原作者: Jianghao Wu, Jianfei Cai, Weiqiang Wang, Jin Ye, Daniel F. Schmidt, Yasmeen George

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianghao Wu, Jianfei Cai, Weiqiang Wang, Jin Ye, Daniel F. Schmidt, Yasmeen George

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢但未经训练的学生(一个 AI 模型),他即将参加一场极其困难的考试。你拥有一个包含数千道练习题的庞大图书馆,但在正式考试前,你只有时间和资金让他学习其中的五道题。

最大的问题是什么?你应该挑选哪五道题?

如果你选错了,学生将一无所获;如果你选对了,他们可能会在考试中取得优异成绩。这正是RLVR(可验证奖励强化学习)所面临的挑战:如何从极少量的示例中获得巨大的提升。但通常,要找出哪些示例是“黄金门票”,需要满足以下任一条件:

  1. 拥有每一道题的答案(昂贵且难以获取)。
  2. 让学生先尝试学习所有题目,以观察哪些题目有帮助(计算资源浪费)。

这篇论文的作者SHIFT表示:“等等,我们可以在查看答案、也让学生先学习这些题目的情况下,挑选出最好的五道题。”

以下是他们如何利用一个简单的类比来实现这一点的:

“思维拉伸”类比

想象你的学生是一根橡皮筋。

  • 题目:一张写有谜题的纸。
  • 思考过程:学生阅读谜题并开始大声思考(这被称为“推理轨迹”)。
  • “隐藏状态”:这是学生在开始思考之前以及完成思考之后的内部大脑状态。

作者发现,当学生解决一个问题时,他们的大脑会经历显著的"思维拉伸"。他们从一个心理状态开始,最终达到一个完全不同、更复杂的心理状态。如果问题太简单或太无聊,他们的大脑几乎不会发生任何变化。

SHIFT的工作原理如下:

  1. 单次测试:对于图书馆中的每一道题,系统让学生一次思考该问题(静默进行,不进行评分)。
  2. 测量拉伸:它测量学生大脑状态在思考过程开始之初与结束之时之间的距离。这个距离被称为推理诱导表示偏移(RIRS)
    • 拉伸幅度大? 该问题很可能是一个“高影响力”示例,能让学生学到很多东西。
    • 拉伸幅度小? 该问题对训练可能毫无用处。
  3. 挑选最佳组合:系统不仅仅挑选拉伸幅度最大的 5 道题。它还会确保这 5 道题彼此不同(涵盖不同的主题),从而使学生的训练更加全面均衡。

为什么这很重要?

大多数其他方法就像一位教练,他说:“让我们尝试 1,000 道题,看看学生做对了哪些,然后挑选出优胜者。”这需要耗费漫长时间并付出巨大代价。

SHIFT则像一位教练,他在学生首次思考时观察其眼神和姿态,然后说:“那道题看起来真的让大脑在努力运转。让我们选那道题。”

他们发现了什么?

这篇论文在两个非常困难的学科上测试了这种方法:数学医学问题

  • 结果:即使预算极小(仅挑选可用题目的 2% 或 0.1%),在SHIFT挑选的题目上训练的 AI,其表现也优于在随机题目上训练或由其他“智能”方法挑选的题目上训练的 AI。
  • 惊喜:有时,仅在少数几道SHIFT挑选的题目上进行训练,效果甚至优于在整个题库上进行训练。这表明质量(正确的思维拉伸)胜过数量。
  • 验证:他们证明了这种“拉伸”并非仅仅因为题目更长或答案更冗长。它实际上关乎思考过程的复杂性。

一句话总结

这篇论文介绍了SHIFT,这是一种通过测量 AI 在首次思考问题时其“大脑”的拉伸程度来挑选最佳训练示例的工具。它无需答案或昂贵的试错训练,使得用极少数据教会强大的 AI 模型更好地进行推理成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →