Autoregressive Direct Preference Optimization
本文提出了自回归直接偏好优化(Autoregressive Direct Preference Optimization, ADPO),这是一种通过在 Bradley-Terry 模型之前显式应用自回归假设,从而重新构建 DPO 目标函数的创新变体,其结果是一个偏移后的损失函数,并识别出了用于改进偏好优化的不同 Token 长度和反馈长度度量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:教机器人如何写出更好的文章
想象一下,你正在教一个机器人写故事。你有一个“金标准”书籍(参考模型)和一个“学生”机器人(可学习的模型)。你希望“学生”写出的故事比“金标准”的故事更受人类喜爱。
长期以来,实现这一目标的最佳方法是 DPO(直接偏好优化)。你可以把 DPO 想象成一位老师,他会阅读学生写的整个故事,将其与金标准的故事进行对比,然后给出一个单一的分数:“好”或“坏”。
问题所在:
论文指出,这种“全或无”的评分系统有点效率低下。大语言模型(LLMs)并不是通过一次巨大的飞跃来完成写作的,它们是**逐个词(或逐个 token)**进行写作的,就像人在打字输入句子一样。然而,旧的 DPO 方法要等到最后才给出反馈。这就像一位教练,直到马拉松结束才对跑者说:“你跑得不错”,却从未在跑者奔跑的过程中纠正过他们的动作。
解决方案:ADPO(自回归 DPO)
作者提出了一种名为 ADPO 的新方法。ADPO 不再等待故事写完才给出评分,而是在故事编写的过程中进行分步反馈。
“电影 vs. 快照”的比喻
- 旧 DPO(快照): 想象拍摄一张完成后的画作照片。你观察整幅画,然后说:“这张比那张好。”你并不知道哪些笔触让它变得更好。
- 新 ADPO(电影): 想象实时观看艺术家绘画的过程。ADPO 观察第一个笔触,然后是第二个,接着是第三个。它会询问:“这一笔好吗?下一笔是否更好?”它学会的是偏好写作的过程,而不只是最终结果。
两个“长度”规则
论文中最有趣的发现之一是,在教导这些模型时,实际上存在两种不同的长度衡量方式,而旧方法混淆了它们。
- Token 长度(词数): 这是模型实际输入的单词数量。(例如:“猫坐在” = 3 个词)。
- 反馈长度(评分单位): 这是老师决定一次性对多少个块进行评分。
旧方法: 老师总是将整个故事作为一个单一的块进行评分(反馈长度 = 1),无论其中有多少个单词。
新方法 (ADPO): 老师可以选择将故事拆分为更小的块进行评分。他们可以对每一个单词进行评分(反馈长度 = 词数),也可以每 10 个单词评分一次,或者按段落评分。
论文表明,通过将故事拆分为更小的块(使“反馈长度”与“Token 长度”相匹配),模型学习得更快,写得更好。
它是如何运作的(化繁为简的“数学”)
在旧方法中,数学逻辑如下:
获取整个故事,计算差异,然后应用一个“sigmoid”(平滑函数)来获得分数。
在新的 ADPO 方法中,数学逻辑颠倒了顺序:
*针对每一步计算差异,对每一步应用“sigmoid”,然后将它们全部相加。*
类比:
- 旧方法: 你把所有的原料混合在一起做成蛋糕,烘焙完成后,品尝整个蛋糕,然后决定是否需要加糖。(太晚了,无法修正面糊)。
- 新方法: 在加入面粉后尝一下,加入鸡蛋后尝一下,加入糖后又尝一下。你在制作过程中不断调整配方。
结果:它有效吗?
作者在两类任务上测试了这种新方法:
- 数学问题: 他们要求模型解决复杂的数学应用题。
- 对话: 他们要求模型与人类聊天。
研究发现:
- 更高的分数: 在几乎所有的测试中,使用 ADPO 训练的模型比使用旧 DPO 方法训练的模型获得了更高的分数。
- 越精细越好: 当“反馈长度”非常小(即每检查一个单词)时,模型的表现最好。这证明了模型受益于持续、细粒度的反馈。
- 没有额外成本: 尽管检查每个单词听起来会更耗时,但作者发现所需的额外时间微乎其微(慢了不到 6%)。
总结
这篇论文引入了 ADPO,一种更聪明的训练 AI 模型的方法。ADPO 不再等待 AI 完成任务后再给分,而是在每一个步骤都给予反馈。通过将 AI 的写作视为一系列微小的步骤而非一个巨大的整体,模型学会了在整个生成过程中做出更好的选择,从而实现了更强的数学推理能力和更好的对话能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。