← 最新论文
🤖 AI

Autoregressive Direct Preference Optimization

本文提出了自回归直接偏好优化(Autoregressive Direct Preference Optimization, ADPO),这是一种通过在 Bradley-Terry 模型之前显式应用自回归假设,从而重新构建 DPO 目标函数的创新变体,其结果是一个偏移后的损失函数,并识别出了用于改进偏好优化的不同 Token 长度和反馈长度度量。

原作者: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教机器人如何写出更好的文章

想象一下,你正在教一个机器人写故事。你有一个“金标准”书籍(参考模型)和一个“学生”机器人(可学习的模型)。你希望“学生”写出的故事比“金标准”的故事更受人类喜爱。

长期以来,实现这一目标的最佳方法是 DPO(直接偏好优化)。你可以把 DPO 想象成一位老师,他会阅读学生写的整个故事,将其与金标准的故事进行对比,然后给出一个单一的分数:“好”或“坏”。

问题所在:
论文指出,这种“全或无”的评分系统有点效率低下。大语言模型(LLMs)并不是通过一次巨大的飞跃来完成写作的,它们是**逐个词(或逐个 token)**进行写作的,就像人在打字输入句子一样。然而,旧的 DPO 方法要等到最后才给出反馈。这就像一位教练,直到马拉松结束才对跑者说:“你跑得不错”,却从未在跑者奔跑的过程中纠正过他们的动作。

解决方案:ADPO(自回归 DPO)

作者提出了一种名为 ADPO 的新方法。ADPO 不再等待故事写完才给出评分,而是在故事编写的过程中进行分步反馈。

“电影 vs. 快照”的比喻

  • 旧 DPO(快照): 想象拍摄一张完成后的画作照片。你观察整幅画,然后说:“这张比那张好。”你并不知道哪些笔触让它变得更好。
  • 新 ADPO(电影): 想象实时观看艺术家绘画的过程。ADPO 观察第一个笔触,然后是第二个,接着是第三个。它会询问:“这一笔好吗?下一笔是否更好?”它学会的是偏好写作的过程,而不只是最终结果。

两个“长度”规则

论文中最有趣的发现之一是,在教导这些模型时,实际上存在两种不同的长度衡量方式,而旧方法混淆了它们。

  1. Token 长度(词数): 这是模型实际输入的单词数量。(例如:“猫坐在” = 3 个词)。
  2. 反馈长度(评分单位): 这是老师决定一次性对多少个块进行评分。

旧方法: 老师总是将整个故事作为一个单一的块进行评分(反馈长度 = 1),无论其中有多少个单词。
新方法 (ADPO): 老师可以选择将故事拆分为更小的块进行评分。他们可以对每一个单词进行评分(反馈长度 = 词数),也可以每 10 个单词评分一次,或者按段落评分。

论文表明,通过将故事拆分为更小的块(使“反馈长度”与“Token 长度”相匹配),模型学习得更快,写得更好。

它是如何运作的(化繁为简的“数学”)

在旧方法中,数学逻辑如下:

获取整个故事,计算差异,然后应用一个“sigmoid”(平滑函数)来获得分数。

在新的 ADPO 方法中,数学逻辑颠倒了顺序:

*针对每一步计算差异,对每一步应用“sigmoid”,然后将它们全部相加。*

类比:

  • 旧方法: 你把所有的原料混合在一起做成蛋糕,烘焙完成后,品尝整个蛋糕,然后决定是否需要加糖。(太晚了,无法修正面糊)。
  • 新方法: 在加入面粉后尝一下,加入鸡蛋后尝一下,加入糖后又尝一下。你在制作过程中不断调整配方。

结果:它有效吗?

作者在两类任务上测试了这种新方法:

  1. 数学问题: 他们要求模型解决复杂的数学应用题。
  2. 对话: 他们要求模型与人类聊天。

研究发现:

  • 更高的分数: 在几乎所有的测试中,使用 ADPO 训练的模型比使用旧 DPO 方法训练的模型获得了更高的分数。
  • 越精细越好: 当“反馈长度”非常小(即每检查一个单词)时,模型的表现最好。这证明了模型受益于持续、细粒度的反馈。
  • 没有额外成本: 尽管检查每个单词听起来会更耗时,但作者发现所需的额外时间微乎其微(慢了不到 6%)。

总结

这篇论文引入了 ADPO,一种更聪明的训练 AI 模型的方法。ADPO 不再等待 AI 完成任务后再给分,而是在每一个步骤都给予反馈。通过将 AI 的写作视为一系列微小的步骤而非一个巨大的整体,模型学会了在整个生成过程中做出更好的选择,从而实现了更强的数学推理能力和更好的对话能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →