← 最新论文
💬 NLP

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

该论文通过解构偏好数据中的“生成器级差异”与“样本级差异”,发现扩大生成模型的能力差距能显著提升推理性能,而利用样本级差异筛选高质量数据则能提高训练效率,从而为通过偏好优化提升推理能力提供了双重策略。

原作者: Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, William Campbell

发布于 2026-04-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, William Campbell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(AI)做“特训”,研究它到底是怎么通过“比较”两个答案来变聪明的。

想象一下,你正在教一个学生(AI 模型)做数学题。传统的做法是:老师(人类或更强的 AI)给出一个满分答案和一个错误答案,告诉学生:“看,选这个,别选那个。”

但这篇论文发现了一个更有趣的现象:哪怕两个答案都不完美,只要它们之间有“差距”,学生就能学会东西。

为了把这个问题讲清楚,作者把“差距”(Delta)拆成了两个层面,我们可以用两个生动的比喻来理解:

1. 两个核心概念:谁和谁在比?

概念一:生成器层面的差距(Generator-level Delta)

比喻:教练的段位
想象你在教学生解题。

  • 情况 A:你让一个奥运冠军(强模型)和一个刚入门的菜鸟(弱模型)分别写解题步骤,然后让学生对比。
  • 情况 B:你让两个刚入门的菜鸟分别写解题步骤,然后让学生对比。

研究发现

  • 如果让“奥运冠军”和“菜鸟”对比(差距大),学生学到的东西最多,尤其是在解决从未见过的难题(比如从做数学题变成写代码或处理物理题)时,进步巨大。
  • 如果让两个“菜鸟”对比(差距小),学生也能学,但效果没那么好。
  • 结论:在构造训练数据时,尽量让“好答案”的生成者比“坏答案”的生成者强很多,这样效果最好。

概念二:样本层面的差距(Sample-level Delta)

比喻:答案的“质量细节”
现在假设我们固定了教练(比如都是同一个 AI 写的),我们要看具体的两个答案之间,到底哪里不一样

  • 最终答案对错了?(比如一个算出 5,一个算出 6)
  • 还是解题过程的优劣?(比如一个步骤清晰、逻辑严密,另一个虽然答案对了但过程乱成一团,或者虽然答案错了但思路很清晰)

研究发现

  • 最终答案对错不是最重要的! 即使两个答案都是错的,只要其中一个的解题过程(比如逻辑连贯性、步骤清晰度)比另一个好,学生依然能学会。
  • 作者把解题过程拆解成了五个维度:事实准确性、策略连贯性、步骤连贯性、计算精度、信噪比(废话少不多)。
  • 关键发现:在所有维度中,“步骤连贯性”(Step Coherence,即每一步是否逻辑通顺地推导下一步)是最核心的。只要抓住那些“步骤逻辑特别清晰 vs 步骤逻辑混乱”的对比数据,哪怕只用很少的数据,也能达到甚至超过用海量数据训练的效果。

2. 这篇论文到底发现了什么?(三大结论)

结论一:差距越大,越能举一反三

如果你用“强模型”生成的答案去对比“弱模型”生成的答案,AI 在数学题(它本来就擅长的领域)上提升不明显(因为已经很强了),但在写代码、做科学题(它不擅长的领域)上,提升非常惊人。

通俗解释:就像让一个数学天才和一个数学小白对比解题思路,学生不仅能学会数学,还能把这种“思考逻辑”迁移到物理和编程上。

结论二:答案对错不重要,过程才重要

以前大家觉得,训练 AI 必须用“正确答案”对比“错误答案”。但这篇论文发现,哪怕两个答案都是错的,只要其中一个的思考过程更清晰、更连贯,AI 也能从中受益。

通俗解释:教学生时,与其纠结“这道题最后选 A 还是选 B",不如教他“为什么你的推导步骤乱了,而那个人的步骤虽然结果错了,但逻辑是通的”。过程的质量比结果的对错更关键。

结论三:少即是多(精挑细选胜过海量堆砌)

作者发现,不需要把 16 万道题都拿来训练。只要从里面挑出5000 道“步骤逻辑差距最大”的题目,训练出来的效果,和用 16 万道题训练出来的效果一样好,甚至更好。

通俗解释:与其给学生看 100 本乱七八糟的参考书,不如给他看 5 本逻辑最清晰、对比最鲜明的“精华笔记”。这大大节省了计算资源和时间。


3. 给未来的“食谱”

这篇论文给所有想训练 AI 做推理任务的人提供了一套**“变强食谱”**:

  1. 造数据时:找两个能力差距大的模型(比如一个 490 亿参数的,一个 30 亿参数的)来生成答案,制造巨大的“能力落差”。
  2. 挑数据时:不要只看答案对不对。要用 AI 当裁判,去检查解题过程的**“步骤连贯性”**。挑出那些“步骤逻辑特别清晰”和“步骤逻辑特别混乱”的对比对。
  3. 训练时:不需要海量数据,只要挑出最精华的那一小部分(比如 5000 条),就能让 AI 在推理能力上突飞猛进。

总结一句话
AI 变聪明,靠的不是死记硬背“正确答案”,而是通过观察**“强手”和“弱手”在“思考过程”上的巨大差距**,来学会如何更清晰、更逻辑地思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →