Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
本文提出了一种基于难度的直接偏好优化(DPO)数据选择新策略,该策略通过识别隐含奖励差距较小的偏好示例来筛选具有挑战性的样本,与现有基线相比,仅需使用 10% 的原始数据即可显著提升模型对齐的效率与性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教导一位才华横溢但极其昂贵的学生(一个大语言模型),使其变得乐于助人、诚实且安全。通常,你会给这位学生提供一个包含海量反馈示例的图书馆——成千上万个故事,其中人类会指出:“这个答案很好,但那个答案不好。”
问题在于,这个图书馆非常庞大。通读所有内容需要耗费漫长时间,消耗巨额电力成本,并且包含大量枯燥或显而易见的例子(例如“天空是蓝色的”与“天空是绿色的”对比)。你不需要学习那些显而易见的东西;你需要钻研那些棘手的难题。
本文介绍了一种巧妙的新方法,能够从那个庞大的图书馆中仅挑选出最困难、最有价值的示例,从而使这位学生能够利用原始数据中极小的一部分,学得更快、更好。
核心理念:“走钢丝”的类比
将学生的学习过程想象成走钢丝。
- 简单的例子就像在宽阔平坦的人行道上行走。学生确切知道该往哪个方向走。“好”答案与“坏”答案之间的差异巨大且显而易见。
- 困难的例子就像在细窄摇晃的钢丝上行走。“好”答案与“坏”答案彼此非常接近。学生不确定该向哪边倾斜。
作者们意识到,学习最显著的时刻发生在你走在摇晃的钢丝上时。 当学生对哪个答案更好感到困惑时,正是他们的大脑(模型)运作最努力、学习最多的时候。
他们是如何做到的:“奖励差距”
本文使用了一种特定的数学技巧,称为DPO(直接偏好优化)。DPO 不需要雇佣一位单独的导师来给每个答案打分,而是让模型利用一个隐藏的“分数”来自我评分。
作者们通过观察“好”答案的分数与“坏”答案的分数之间的差距来衡量示例的难度:
- 大差距:好答案得了 90 分,坏答案得了 10 分。学生确切知道该做什么。这是一个简单的例子。
- 小差距:好答案得了 51 分,坏答案得了 49 分。学生几乎无法确定哪个更好。这是一个困难的例子。
策略:他们的方法自动过滤掉所有简单的例子(大差距),只保留困难的例子(小差距)。他们将此称为“隐式奖励差距”。
结果:事半功倍
研究人员在四个不同的海量数据集上测试了这一想法。结果如下:
- 10% 法则:他们仅使用了原始数据的10%——即那些属于“走钢丝”类型的例子。
- 超越巨头:尽管他们使用的数据减少了 90%,但其模型的表现与在整个原始数据集上训练的模型相当,甚至更好。
- 超越其他筛选方法:他们将这种方法与其他五种流行的数据挑选方式(例如随机挑选示例或挑选最具多样性的示例)进行了比较。他们的“困难示例”方法几乎每次都胜出。
为什么这很重要(根据论文所述)
- 效率:你不需要处理太字节(terabytes)级别的数据。你可以挑选“精华中的精华”(最难的问题),从而大大加快训练速度。
- 更好的学习:通过关注模型不确定的时刻,你迫使它学习人类偏好的细微差别,而不仅仅是死记硬背显而易见的事实。
- 鲁棒性:无论数据是由人类编写还是由其他计算机生成,该方法都有效;即使你不针对答案长度进行调整,它依然有效。
nutshell
如果训练人工智能就像为期末考试做准备,大多数人会试图从头到尾通读整本教科书。本文指出:“别在简单的章节上浪费时间。找出你一直答错的具体问题,然后只学习那些内容。”
通过这样做,人工智能可以在时间和成本仅为原来一小部分的情况下,学到相同甚至更多的内容。作者们提供了“考题”(代码和数据),以便其他人可以尝试这种“更聪明地学习,而非更努力地学习”的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。