← 最新论文
💬 NLP

Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

本文介绍了 Se-DPO,这是一种根据不断演变的内部奖励信号和置信度动态调整标记级信用(token-level credit)的方法,旨在克服直接偏好优化(Direct Preference Optimization)中静态均匀聚合的局限性,并在 AlpacaEval 2 和 Arena-Hard 等基准测试中取得了显著的性能提升。

原作者: Wenxiao Zhao, Shu Wang, Ying Nian Wu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxiao Zhao, Shu Wang, Ying Nian Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何写出一个能让人们喜爱的故事。你不仅仅是告诉机器人“写个故事”;而是向它展示两个故事——一个是人类喜欢的,另一个是人类不喜欢的——并询问机器人为什么。这就是**直接偏好优化(Direct Preference Optimization, DPO)**的世界,这是一种用于训练 AI 变得既有用又无害的流行方法。在这个过程中,AI 通过将它生成的每一个单词(或“标记/token”)与参考版本进行对比来学习。这就像一位严厉的编辑,检查句子中的每一个单词,并假设每个单词对于最终成绩都同样重要。如果 AI 在句子中间写错了一个字母,编辑也会像对待“的”或“和”这样平庸的词一样,赋予这个错误同样的权重。

但问题在于:并非所有单词都是平等的。一个错误的实事可能会毁掉整个答案,而一个填充词则无关紧要。这个领域的重大问题是:我们如何教会 AI 识别哪些词是“主角”,哪些只是“配角”?如果我们把它们同等对待,AI 可能会把精力浪费在润色无聊的部分,而忽略了关键的错误。这篇论文深入探讨了这一问题,探讨我们如何让 AI 在学习时更聪明地分配注意力。

这篇论文的作者 Wenxiao Zhao 及其同事发现了一个令人惊讶的事实:“重要性”并不是一个固定不变的事实;它会随着 AI 的学习而改变。想象一下一个学生在参加考试。在第一天,他们可能认为句首的大写字母是最重要的。但到了第十天,经过刻苦学习后,他们意识到句子中间的实际事实才是真正重要的。论文指出,以往的方法就像是一个在第一天就给学生一份静态“重要词汇表”,且从未更新过的老师。随着学生理解能力的增长,这份清单很快就会过时。

为了解决这个问题,团队引入了一种名为 Se-DPO(自我进化标记信用/Self-Evolving Token Credit)的新方法。Se-DPO 不使用静态列表,也不要求外部专家(如预训练的教师模型)来决定哪些词重要,而是让 AI 实时为自己寻找答案。AI 会不断检查自身的内部信号,以观察哪些词承载了更多的“偏好权重”(即那些区分好坏答案的关键词),以及哪些词只是噪声。随后,它会给这些重要的词更多的改变自由度,而对平庸的词则执行更严格的保持不变规则。

论文表明,这种“自我进化”的方法至关重要,因为 AI 对单词重要性的内部理解在训练过程中会发生剧烈变化。事实上,研究人员发现,在训练开始时的“顶尖”词汇集与训练结束时的“顶尖”词汇集之间几乎没有重叠——在整个过程中,保持在排名前 20% 的词汇中,只有约 33.6% 是相同的。如果你使用静态列表,那么当 AI 准备毕业时,你关注的将是错误的词。

Se-DPO 通过使用两个信号来决定给予每个词多少“信用”(或自由度):一是 AI 对该词的偏好信号强度,二是参考模型对该词的置信度。如果参考模型对某个词非常不确定(高熵),AI 就知道该信号可能存在噪声,因此不会盲目信任它。一个轻量级的校准网络充当了平衡这两个信号的“校准器”,确保 AI 不会被随机噪声分散注意力。

结果非常令人振奋。在标准的 AI 写作质量基准测试中,Se-DPO 的表现显著优于标准方法(DPO)。具体而言,它在 AlpacaEval 2 上的胜率提升了高达 9.8 个百分点,在 Arena-Hard 上提升了 12.2 个百分点。在某些特定设置下,它在 AlpacaEval 2 上达到了 50.6% 的胜率,在 Arena-Hard 上达到了 43.3%,击败了许多依赖沉重外部模型的先进方法。作者强调,他们在实现这些成果时无需任何额外的预训练“教师”模型,仅增加了极少量的计算开销。

简而言之,这篇论文表明,为了让 AI 真正掌握人类的偏好,它需要一种动态的、自我纠正的方式来决定什么才是重要的。通过让 AI 在学习过程中进化出对单词重要性的理解,而不是死守着一套僵化的、预设的规则手册,我们可以获得更好的结果。这有点像是从一个根据清单评分的老师,升级为一个观察学生成长并每天调整建议的导师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →