Unified Data Selection for LLM Reasoning
本文介绍了无需训练的高熵求和(HES)指标,该指标通过累加顶级令牌的熵来高效识别高质量推理数据,从而在监督微调、拒绝微调及强化学习范式中显著提升大语言模型性能,同时降低计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教导一位才华横溢但非常年轻的学生(一个大语言模型)如何解决复杂的谜题,比如高难度的数学问题。这位学生通过阅读成千上万个示例解答来学习。但问题在于:并非所有解答都是同等质量的。有些是清晰、逻辑严密的杰作,而另一些则是杂乱无章、令人困惑的胡言乱语。如果你将那些杂乱的解答与优质的解答一起喂给学生,他们可能会感到困惑,或者养成坏习惯。
长期以来,研究人员试图通过观察一些简单的指标来过滤掉糟糕的示例,例如解答的长度,或者模型在生成解答时平均表现出的**“惊讶”程度**。但论文指出,这些方法就像通过平均亮度来评判整部电影一样;它们忽略了最重要、最戏剧性的时刻。
核心理念:寻找“剧情转折”
这篇论文的 authors 提出了一种寻找最佳训练数据的新方法,称为高熵求和(High-Entropy Sum, HES)。
将推理过程(例如解决数学问题)想象成一次长途旅行。
- 低熵 Token:这些是旅途中枯燥、可预测的部分。“向左转”、“直行”、“天空是蓝色的”。模型确切地知道接下来会发生什么。这就像自动驾驶。
- 高熵 Token:这些是关键的决策点。“等等,我该在这里转弯吗?或者也许走条近路?如果我试试这条奇怪的路会怎样?”这才是模型真正在思考、权衡选项并做出艰难抉择的地方。
这篇论文的重大发现是:推理路径的质量不在于它包含多少个“枯燥”的步骤,而在于它成功通过了多少个这样的“关键决策点”。
新指标:“高熵求和”
与其对整段旅程的“惊讶”程度取平均值(这会将重要时刻与枯燥部分稀释),作者们发明了一个名为HES的新分数。
类比:想象你是一位影评人,正在评论一部电影。
- 旧方法(平均熵):你根据每一秒的平均兴奋程度来给电影打分。如果电影有 90 分钟的无聊对话和 5 分钟的爆炸场面,平均分数就会很低。你可能会忽略爆炸场面其实是一部杰作这一事实。
- HES 方法:你忽略那 90 分钟的无聊部分。你只关注最激动人心、最不可预测的时刻的前 0.5%(爆炸、剧情转折)。你只将这些时刻的强度相加。如果一部电影有几个令人难以置信的高风险场景,它就会获得高分。如果一部电影只是一段平淡、无聊且毫无惊喜的旅程,它就会获得低分。
论文表明,这种“最佳时刻之和”是区分高质量推理路径与低质量推理路径的完美方式。
他们是如何应用的(三种训练风格)
团队在三种不同的 AI 教学方式上测试了这种"HES 过滤器”,并且在所有情况下效果都非常出色:
监督微调(SFT)——“教科书法”:
- 场景:你拥有一个巨大的已解决谜题库。你想要挑选出最好的那些来教导 AI。
- 结果:当他们使用 HES 仅挑选前 20%的最佳示例时,AI 的学习效果与阅读整个图书馆一样好。事实上,如果他们挑选了最差的 20%(HES 最低),AI 的表现就会差得多。这证明了少即是多,只要你挑选的是正确的“少”。
- 额外收获:他们发现可以用一个微小、廉价的计算机模型来为巨大、昂贵的模型进行筛选,从而节省了巨额资金。
拒绝微调(RFT)——“多项选择题法”:
- 场景:AI 针对一个问题生成 32 个不同的答案。你需要挑选出最好的一个保留下来。
- 结果:他们没有随机挑选,也没有仅仅挑选最长的答案,而是使用 HES 来挑选包含最多“关键思考时刻”的答案。这始终优于随机猜测。
强化学习(RL)——“试错法”:
- 场景:AI 尝试解决问题,如果正确则获得奖励,并从中学习。
- 结果:他们让 AI 生成许多次尝试。他们使用 HES 仅挑选**前 50%**的成功尝试来教导 AI。这使得 AI 的学习速度和效果都远优于使用所有尝试(包括那些平庸的尝试)。
这为何重要(去除了炒作)
论文声称,这种方法是一个“统一”的解决方案。它不需要训练一个新的、昂贵的 AI 专门来进行筛选。它是基于模型自身内部的“惊讶”程度进行的简单数学计算。
- 它很快:它不会减慢训练过程。
- 它很便宜:你可以用一个小模型来为大模型筛选数据。
- 它很有效:通过专注于真正思考发生的“关键岔路口”,而不是那些枯燥、可预测的部分,它始终能帮助 AI 更好地学习推理技能。
简而言之,论文指出:不要通过长度或平均质量来评判一条推理路径。要通过其最艰难、最关键时刻的强度来评判它。 通过只关注这些时刻,我们可以以更优、更快、更廉价的方式教导 AI 思考。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。