想象你有一位才华横溢但未经训练的学生(一个 AI 模型),他即将参加一场极其困难的考试。你拥有一个包含数千道练习题的庞大图书馆,但在正式考试前,你只有时间和资金让他学习其中的五道题。
最大的问题是什么?你应该挑选哪五道题?
如果你选错了,学生将一无所获;如果你选对了,他们可能会在考试中取得优异成绩。这正是RLVR(可验证奖励强化学习)所面临的挑战:如何从极少量的示例中获得巨大的提升。但通常,要找出哪些示例是“黄金门票”,需要满足以下任一条件:
- 拥有每一道题的答案(昂贵且难以获取)。
- 让学生先尝试学习所有题目,以观察哪些题目有帮助(计算资源浪费)。
这篇论文的作者SHIFT表示:“等等,我们可以在不查看答案、也不让学生先学习这些题目的情况下,挑选出最好的五道题。”
以下是他们如何利用一个简单的类比来实现这一点的:
“思维拉伸”类比
想象你的学生是一根橡皮筋。
- 题目:一张写有谜题的纸。
- 思考过程:学生阅读谜题并开始大声思考(这被称为“推理轨迹”)。
- “隐藏状态”:这是学生在开始思考之前以及完成思考之后的内部大脑状态。
作者发现,当学生解决一个好问题时,他们的大脑会经历显著的"思维拉伸"。他们从一个心理状态开始,最终达到一个完全不同、更复杂的心理状态。如果问题太简单或太无聊,他们的大脑几乎不会发生任何变化。
SHIFT的工作原理如下:
- 单次测试:对于图书馆中的每一道题,系统让学生一次思考该问题(静默进行,不进行评分)。
- 测量拉伸:它测量学生大脑状态在思考过程开始之初与结束之时之间的距离。这个距离被称为推理诱导表示偏移(RIRS)。
- 拉伸幅度大? 该问题很可能是一个“高影响力”示例,能让学生学到很多东西。
- 拉伸幅度小? 该问题对训练可能毫无用处。
- 挑选最佳组合:系统不仅仅挑选拉伸幅度最大的 5 道题。它还会确保这 5 道题彼此不同(涵盖不同的主题),从而使学生的训练更加全面均衡。
为什么这很重要?
大多数其他方法就像一位教练,他说:“让我们尝试 1,000 道题,看看学生做对了哪些,然后挑选出优胜者。”这需要耗费漫长时间并付出巨大代价。
SHIFT则像一位教练,他在学生首次思考时观察其眼神和姿态,然后说:“那道题看起来真的让大脑在努力运转。让我们选那道题。”
他们发现了什么?
这篇论文在两个非常困难的学科上测试了这种方法:数学和医学问题。
- 结果:即使预算极小(仅挑选可用题目的 2% 或 0.1%),在SHIFT挑选的题目上训练的 AI,其表现也优于在随机题目上训练或由其他“智能”方法挑选的题目上训练的 AI。
- 惊喜:有时,仅在少数几道SHIFT挑选的题目上进行训练,效果甚至优于在整个题库上进行训练。这表明质量(正确的思维拉伸)胜过数量。
- 验证:他们证明了这种“拉伸”并非仅仅因为题目更长或答案更冗长。它实际上关乎思考过程的复杂性。
一句话总结
这篇论文介绍了SHIFT,这是一种通过测量 AI 在首次思考问题时其“大脑”的拉伸程度来挑选最佳训练示例的工具。它无需答案或昂贵的试错训练,使得用极少数据教会强大的 AI 模型更好地进行推理成为可能。
技术摘要:用于免训练 RLVR 数据选择的单轮次隐藏状态动力学
问题表述
本文解决了可验证奖励强化学习(RLVR)中的一个关键瓶颈:如何从大量未标记的候选池中筛选出高影响力的训练样本。尽管 RLVR 以极高的数据效率著称——可能仅需极少量样本即可带来显著的推理能力提升——但其性能对选择哪些样本极为敏感。
现有的数据选择流程通常依赖以下两种信号:
- 训练时信号:在候选池上运行部分微调或强化学习,以观察优化动态(例如奖励轨迹、梯度方差)。
- 真实标签依赖:获取整个候选池的可验证奖励或正确答案,以便对样本进行排序。
在专业且资源匮乏的领域(如医疗问答)中,这些要求往往难以实现,因为标注成本高昂,且对数千个候选样本进行试错式训练会造成巨大的计算浪费。作者形式化定义了一个**RLVR 前阶段(pre-RL)**场景,即在选择过程中,必须在没有任何真实标签、可验证奖励或训练时优化信号的情况下,从大规模未标记池中进行筛选。
方法论:SHIFT
作者提出了SHIFT,一种单次、免训练且无需标签的选择器。SHIFT 利用推理时的隐藏状态动力学来估计样本对下游 RLVR 的效用,而无需执行任何训练。
核心机制:推理诱导的表征偏移(RIRS)
核心假设是:模型在推理轨迹期间的内部动力学编码了其学习潜力。
- 单次确定性推演:对于每个候选样本 x,SHIFT 使用贪婪解码(T=0)运行单次确定性推理轨迹。
- 锚点提取:识别推理轨迹开始处(s(x))和结束处(e(x))的隐藏状态(具体指思维链段落的起始和结束位置)。
- RIRS 计算:推理诱导的表征偏移计算为这些状态之间的差值:
Δ(x)=e(x)−s(x)
其模长 ∥Δ(x)∥2 作为样本效用(信息量)的轻量级代理指标,假设较大的偏移量表明模型内部计算被更强烈地激活。
选择算法:质量加权的最远优先核心集
为确保所选子集兼具高质量和多样性,SHIFT 在增强的特征空间中采用贪婪选择策略:
- 特征构建:每个样本由拼接向量 ϕ(x)=[s(x);Δ(x)] 表示,并归一化至单位球面。这同时捕捉了初始上下文(s(x))和推理变换(Δ(x))。
- 效用评分:效用分数 q~(x) 源自 RIRS 模长(经对数变换以提高稳定性)。
- 贪婪选择:
- 初始化集合 S,包含效用最高的样本。
- 迭代选择下一个样本 x∗,使其效用与当前集合距离的乘积最大化:
x∗=argx∈U∖Smaxq~(x)⋅x′∈Smin∥ϕ(x)−ϕ(x′)∥2
这平衡了信息量(高 RIRS)与覆盖度(RIRS 增强空间中的多样性)。
主要贡献
- 问题形式化:在严格的 RLVR 前阶段设定下定义了数据选择问题,即在选择过程中不提供任何标签、奖励或训练信号。
- SHIFT 框架:引入了一种基于推理时隐藏状态动力学(特别是 RIRS 指标)的免训练选择器。
- 算法创新:开发了一种单轮次、质量加权的“最远优先”核心集算法,可扩展至大规模未标记池。
- 实证验证:在数学推理和医疗问答基准测试中,展示了在超低预算(0.1%–4% 的数据量)下,SHIFT 相比免训练基线(多样性采样、难度启发式、基于不确定性的方法)具有一致的性能提升。
实验结果
作者在Qwen模型(1.5B 和 1.7B)上评估了 SHIFT,涵盖两个领域:
- 数学推理(MATH-500 & AMC):在 2% 的预算下,SHIFT 在 MATH-500 上达到62.67%的准确率,在 AMC(分布外)上达到38.55%,显著优于随机采样(分别高出 +8.94 和 +12.77)及其他基线。值得注意的是,它在分布外 AMC 基准测试上超越了全数据 RLVR 参考结果。
- 医疗问答(MEDQA & Transfer):在 0.1% 的预算下,SHIFT 在 MEDQA 上达到50.35%,优于随机采样(45.28%)及其他启发式方法。它在向临床挑战性子集(MedXpertQA)的迁移中表现尤为强劲,仅用 0.1% 的数据就几乎达到了全数据的性能。
消融实验与分析
- RIRS 有效性:相关性分析证实,RIRS 不仅仅是输入/输出长度的代理指标(与响应长度的斯皮尔曼相关系数 ρ≈0)。
- 效用相关性:一项试点研究显示,RLVR 前的 RIRS 排序与实际下游 RLVR 增益之间存在强正相关(斯皮尔曼 ρ=0.818)。
- 消融实验:移除基于 RIRS 的覆盖度(ϕs+Δ)或质量加权(q~(x))均会导致性能下降,证实了多样性信号和效用信号具有互补性。
- 计算效率:SHIFT 每个候选样本仅需一次确定性推演,使其在选择阶段的成本显著低于自一致性基线(后者需要约 32 次随机推演)。
意义与主张
本文主张,SHIFT使得在以往因标注成本和计算限制而被认为不可行的场景中,实现有效的 RLVR 适应成为可能。通过推理诱导的隐藏状态动力学而非训练信号来识别“高影响力”样本,SHIFT 实现了:
- 大幅降低标注和训练开销:使用少于 1% 的数据即可实现强劲性能。
- 可及性:使 RL 适应在真实标签稀缺的专业领域(如医学)中变得可行。
- 泛化能力:相比标准的多样性或基于难度的选择方法,提升了向更难、分布外评估场景的迁移能力。
作者保持了适度的立场,承认 RIRS 是基于理论块级动力学启发的经验性代理指标,而非严格的形式化推导,并且其在更广泛模型家族中的鲁棒性及安全敏感的错误分层仍是未来工作的开放领域。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。