← 最新论文
🤖 machine learning

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO 是一种样本高效的对齐算法,它利用具有理论基础的、由大语言模型参数化的奖励模型,为非线性奖励函数选择高质量偏好数据,通过在数据选择过程中显式考虑目标模型的影响,从而优于现有方法。

原作者: Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢但略带顽皮的學生(即大型语言模型,或 LLM)。这位学生非常擅长写作,但有时他们会写出粗鲁、事实错误,或者完全不符合人类偏好的内容。为了解决这个问题,你需要一位老师(人类)来审阅学生写出的两个不同答案,并指出:“我更喜欢这个。”

问题在于,聘请老师既昂贵又耗时。你无法要求他们批改学生写过的每一份作业。你需要明智地决定展示哪些作业给他们。

本文介绍了一种名为ACTIVEDPO的新方法来解决这一问题。以下是其工作原理,分解为简单的概念:

1. 旧方法:猜测或遵循规则

此前,研究人员尝试通过两种主要方式挑选展示给老师的作业:

  • 随机方式:随机挑选作业。这很简单,但效率低下,因为你可能会让老师审阅 100 篇完全相同的文章,浪费他们的时间。
  • “线性”方式:一些聪明的方法试图利用数学来挑选“最令人困惑”的作业。然而,这些方法假设学生的大脑以简单、直线的方式运作(就像基本计算器)。但大型语言模型是复杂且混乱的;它们的大脑以曲折、非线性的方式运作。因此,这些方法往往失败,因为它们试图将方形的钉子塞进圆形的孔里。

2. 新方法:ACTIVEDPO(“自我反思”导师)

ACTIVEDPO 就像一位超级聪明的导师,确切地知道学生不知道什么。

  • 利用学生来教导学生:ACTIVEDPO 不使用单独的通用工具来决定展示什么给老师,而是利用学生(即大型语言模型)本身来弄清楚它需要哪些帮助。它会问学生:“如果你必须猜测哪个答案更好,你有多自信?”
  • “困惑”计:该方法查看学生内部的“置信度”(在数学上,这被称为梯度)。如果学生在两个答案之间非常困惑,这就是展示给老师的绝佳机会。如果学生已经确定,就没有必要再问老师。
  • “多样性”过滤器:想象一下你要挑选问题去问老师。如果你问的三个问题听起来都一样,你就学不到太多东西。ACTIVEDPO 拥有一个特殊的过滤器(称为多样性正则化器),它会说:“不要选这个问题;我们昨天已经问过非常相似的问题了。”它强制选择覆盖新领域,确保老师向学生教授各种各样的主题。

3. 使其变得实用:“草图”技巧

这个想法存在一个大问题:为了弄清楚学生在哪里感到困惑,你必须为每一份作业进行大量的数学计算。这就像试图测量海滩上每一粒沙子的确切重量,以找出最重的那一粒。这将耗时极长,并会填满计算机的内存。

作者想出了两个巧妙的技巧来加速这一过程:

  • 批处理:他们不是一次挑选一份作业,而是一次挑选一小批(一个批次)。这节省了时间,因为他们不必为每一项单独重新计算学生的“置信度”。
  • “草图”(随机投影):想象你有一幅关于学生大脑的巨型、详细的画作。它太大而无法随身携带。与其携带整幅画,不如快速画一幅简化的草图。这幅草图保留了最重要的细节,但体积小到可以轻易携带。在数学上,他们将庞大的数据缩小到更小的尺寸,同时不丢失做出决策所需的重要信息。

4. 结果

作者在不同的“学生”(不同的 AI 模型)和不同类型的作业(总结新闻、回答长问题)上测试了这种方法。

  • 结果:与其他任何方法相比,ACTIVEDPO 始终能用更少的师生互动让学生表现得更好。
  • 意义:它证明了你不需要向老师展示所有内容。如果你向他们展示正确的内容——特别是学生感到困惑且从未见过的事情——学生就能学得更快,变得更有用。

总结类比

将训练 AI 想象成训练一只狗。

  • 旧方法就像随机扔球并指望狗学会,或者使用一本僵硬的规则书,假设狗像机器人一样思考。
  • ACTIVEDPO则像一位观察狗的驯兽师,注意到狗何时犹豫或困惑,然后在那一刻发出指令以纠正行为。它还确保不会一遍又一遍地重复同一个把戏,而是高效地教授一整套全新的技能。

该论文声称,这种方法在数学上是合理的(其背后有坚实的理论支撑),并且在实践中是有效的(在真实测试中表现良好),使其成为在不耗费巨额人类反馈成本的情况下,教导 AI 变得更加人性化的有力工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →