Learning from Saturated Data: Signals Beyond Correctness for LLM Training
本文表明,虽然使用成对自我判别和标记级熵等细粒度质量信号来取代二元正确性,可以显著提升大语言模型在饱和数据下简单算术任务上的性能,但这些信号在处理如 GSM8K 等复杂任务时需要仔细校准,以避免性能下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图提高学生数学能力的老师。你手里有一叠练习题。
问题:“太简单了”的那一叠
通常情况下,你会给学生出难题让他们做错,从而进行学习。但如果学生已经掌握了某一组特定的题目呢?他们每一道题都拿了100分。在人工智能的世界里,这被称为**“饱和数据”(saturated data)**。
传统做法是,如果一个AI答对了问题,训练就停止了。计算机会说:“做得好,下一题!”其背后的逻辑是:如果答案是正确的,那就没有什么可以再学的了。
核心理念:不仅仅关乎答案
这篇论文的作者提出了一个不同的问题:即使答案是正确的,是否有些“正确”的答案比其他的更好?
想象两个学生都对一道数学题给出了“95”这个答案。
- 学生A只写下了“95”。
- 学生B清晰地写出了步骤:“83加27等于110,再减去15等于95。”
两者都是“正确”的,但学生B的答案更清晰、更有逻辑、也更容易理解。论文认为,即使AI得到了正确答案,我们仍然可以教它去偏好“学生B”这种思考方式。这就像是在一堆别人都认为是碎石的石块中,寻找隐藏的宝石。
他们是如何做的:两种新的评分方式
由于答案全都是“正确”的,AI不能使用简单的“对与错”来评分。因此,研究人员发明了两种新的衡量质量的方法:
- “自我反思”评委: 他们让AI观察自己的两个答案,并选出更好的那一个。这就像是请一位厨师品尝两份口味相似的汤,并决定哪一份的味道更好,即便两份都是可以入口的。
- “置信度”计量器(熵): 他们观察了AI在输入每个词时的“确定程度”。如果AI在输入一个词时非常有信心(低不确定性),这就像是一个瞬间就能得出答案的学生。如果它犹豫不决并在猜测(高不确定性),则像是在瞎猜的学生。他们发现,在整个过程中AI表现得更加自信的答案,往往质量更高。
结果:喜忧参半
他们在两类数学任务上测试了这些想法:
- 简单数学任务(连加任务/Chain Sum): 这就像是基础算术练习。在这里,新方法的效果非常出色。通过教导AI去偏好那些“自信”且“结构良好”的正确答案,AI在随后解决更难的版本时变得显著更强。这就像是将一个能做简单加法的学生,通过教导其具备极高的清晰度,最终使其能够应对复杂的代数问题。
- 复杂数学任务(GSM8K): 这就像是现实世界的应用题。在这里,结果却很棘手。
- “置信度计量器”仍有一点帮助。
- 但“自我反思评委”实际上让情况变糟了。事实证明,当AI试图评价自己复杂的答案时,它会感到困惑,并开始把错误的答案误认为好的答案。这就像是一个数学不好的学生试图给自己批改作业;因为他们还没能很好地理解规则,所以可能会误以为错的答案是对的。
核心教训
论文的结论是,你确实可以从AI已经做对的问题中学习,但你必须非常谨慎地对待如何判断它们。
- 如果你有一个可靠的方法来区分“好的”正确答案和“坏的”正确答案,你可以让AI变得聪明得多。
- 如果你的评判方法不可靠(比如让AI评价自己复杂的答案),你可能会在无意中教会AI坏习惯,让它变得比以前更差。
简而言之:仅仅答案正确,并不意味着思考过程是完美的。但找出究竟哪种思考才是完美的,正是这个谜题中最难的部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。