想象你有一位才华横溢但略带顽皮的學生(即大型语言模型,或 LLM)。这位学生非常擅长写作,但有时他们会写出粗鲁、事实错误,或者完全不符合人类偏好的内容。为了解决这个问题,你需要一位老师(人类)来审阅学生写出的两个不同答案,并指出:“我更喜欢这个。”
问题在于,聘请老师既昂贵又耗时。你无法要求他们批改学生写过的每一份作业。你需要明智地决定展示哪些作业给他们。
本文介绍了一种名为ACTIVEDPO的新方法来解决这一问题。以下是其工作原理,分解为简单的概念:
1. 旧方法:猜测或遵循规则
此前,研究人员尝试通过两种主要方式挑选展示给老师的作业:
- 随机方式:随机挑选作业。这很简单,但效率低下,因为你可能会让老师审阅 100 篇完全相同的文章,浪费他们的时间。
- “线性”方式:一些聪明的方法试图利用数学来挑选“最令人困惑”的作业。然而,这些方法假设学生的大脑以简单、直线的方式运作(就像基本计算器)。但大型语言模型是复杂且混乱的;它们的大脑以曲折、非线性的方式运作。因此,这些方法往往失败,因为它们试图将方形的钉子塞进圆形的孔里。
2. 新方法:ACTIVEDPO(“自我反思”导师)
ACTIVEDPO 就像一位超级聪明的导师,确切地知道学生还不知道什么。
- 利用学生来教导学生:ACTIVEDPO 不使用单独的通用工具来决定展示什么给老师,而是利用学生(即大型语言模型)本身来弄清楚它需要哪些帮助。它会问学生:“如果你必须猜测哪个答案更好,你有多自信?”
- “困惑”计:该方法查看学生内部的“置信度”(在数学上,这被称为梯度)。如果学生在两个答案之间非常困惑,这就是展示给老师的绝佳机会。如果学生已经确定,就没有必要再问老师。
- “多样性”过滤器:想象一下你要挑选问题去问老师。如果你问的三个问题听起来都一样,你就学不到太多东西。ACTIVEDPO 拥有一个特殊的过滤器(称为多样性正则化器),它会说:“不要选这个问题;我们昨天已经问过非常相似的问题了。”它强制选择覆盖新领域,确保老师向学生教授各种各样的主题。
3. 使其变得实用:“草图”技巧
这个想法存在一个大问题:为了弄清楚学生在哪里感到困惑,你必须为每一份作业进行大量的数学计算。这就像试图测量海滩上每一粒沙子的确切重量,以找出最重的那一粒。这将耗时极长,并会填满计算机的内存。
作者想出了两个巧妙的技巧来加速这一过程:
- 批处理:他们不是一次挑选一份作业,而是一次挑选一小批(一个批次)。这节省了时间,因为他们不必为每一项单独重新计算学生的“置信度”。
- “草图”(随机投影):想象你有一幅关于学生大脑的巨型、详细的画作。它太大而无法随身携带。与其携带整幅画,不如快速画一幅简化的草图。这幅草图保留了最重要的细节,但体积小到可以轻易携带。在数学上,他们将庞大的数据缩小到更小的尺寸,同时不丢失做出决策所需的重要信息。
4. 结果
作者在不同的“学生”(不同的 AI 模型)和不同类型的作业(总结新闻、回答长问题)上测试了这种方法。
- 结果:与其他任何方法相比,ACTIVEDPO 始终能用更少的师生互动让学生表现得更好。
- 意义:它证明了你不需要向老师展示所有内容。如果你向他们展示正确的内容——特别是学生感到困惑且从未见过的事情——学生就能学得更快,变得更有用。
总结类比
将训练 AI 想象成训练一只狗。
- 旧方法就像随机扔球并指望狗学会,或者使用一本僵硬的规则书,假设狗像机器人一样思考。
- ACTIVEDPO则像一位观察狗的驯兽师,注意到狗何时犹豫或困惑,然后在那一刻发出指令以纠正行为。它还确保不会一遍又一遍地重复同一个把戏,而是高效地教授一整套全新的技能。
该论文声称,这种方法在数学上是合理的(其背后有坚实的理论支撑),并且在实践中是有效的(在真实测试中表现良好),使其成为在不耗费巨额人类反馈成本的情况下,教导 AI 变得更加人性化的有力工具。
技术摘要:ACTIVEDPO
问题陈述
将大语言模型(LLM)与人类偏好对齐,对于问答、推理和代码生成等任务至关重要。尽管基于人类反馈的强化学习(RLHF)和直接偏好优化(DPO)等方法已被证明有效,但它们高度依赖高质量的人类偏好标注数据集。收集这些数据集成本高昂且资源密集,从而成为高效对齐的瓶颈。
现有通过主动数据选择来降低标注成本的方法面临显著局限:
- 启发式方法:某些方法(例如 Muldrew 等人,2024)缺乏严谨的理论基础,导致在不同任务和模型上的表现不可靠。
- 限制性假设:具有理论基础的方法(例如 Mehta 等人,2023;Das 等人,2024)通常假设线性潜在奖励函数,而这并不适用于 LLM 对齐中固有的复杂非线性奖励函数。
- 解耦选择:许多现有方法依赖于独立的奖励模型或与被对齐的特定 LLM 无关的选择标准。这未能考虑到数据选择如何直接影响 LLM 自身的学习动态和隐式奖励函数。
核心挑战在于开发一种主动偏好数据选择算法,该算法既要针对非线性奖励函数具备理论基础,又要通过显式利用 LLM 本身来实现实际有效性。
方法论:ACTIVEDPO
作者提出了ACTIVEDPO(主动直接偏好优化),这是一种将 LLM 直接集成到数据选择过程中的算法。该方法在迭代循环中运行:
- 数据生成:在每次迭代 t 中,当前 LLM(πθt−1)为一组提示 x 生成响应对 (y1,y2),形成候选池 Dt。
- 主动选择:ACTIVEDPO 不使用独立的奖励模型,而是利用 LLM 自身由 θt−1 参数化的隐式奖励函数,选择最具信息量的三元组 (x,y1,y2) 供人类标注。
- 理论基础:选择标准源自命题 1,该命题建立了两个响应之间奖励差估计误差的上界。误差界取决于表示奖励函数的神经网络的梯度。具体而言,不确定性通过梯度差值的范数量化:
∥∇rθt−1(x,y1)−∇rθt−1(x,y2)∥Vt−1−1
其中 Vt−1 是一个矩阵,累积了先前选定数据的梯度特征的外积。该算法选择最大化此不确定性度量的三元组,从而有效地选择与先前标注数据多样且互补的数据点。
- 优化:人类标注者为选定的批次提供偏好反馈(yw≻yl∣x)。随后,LLM 利用 DPO 目标函数在此新标注数据上进行更新。
实际效率技术
为了解决计算现代 LLM 完整梯度和存储大型协方差矩阵的计算不可行性,ACTIVEDPO 引入了三项关键技术:
- 批量选择:算法不一次选择一个样本,而是选择大小为 B 的批次。矩阵 V 在批次内增量更新,以在保持多样性的同时减少昂贵的梯度重算和模型更新的频率。
- LoRA 与随机投影:为了减少存储和计算,作者使用低秩自适应(LoRA)参数计算梯度。然后,利用随机投影将这些梯度投影到较低维度(例如 8192),其依据是 Johnson-Lindenstrauss 引理。这在大幅降低维度的同时,保留了选择标准所需的内积结构。
- 梯度归一化:为了防止选择标准偏向于较长的响应(较长的响应自然产生更大的 L2 范数梯度),在计算选择分数之前,所有梯度均被归一化为单位范数。
主要贡献
- 针对非线性奖励的理论基础标准:本文引入了源自神经决斗多臂老虎机(neural dueling bandits)理论的选择标准,适用于由 LLM 参数化的非线性奖励函数,克服了以往理论工作中的线性假设。
- 以 LLM 为中心的数据选择:与使用外部奖励模型的方法不同,ACTIVEDPO 显式利用 LLM 自身的梯度来指导数据选择。这确保了所选数据针对特定模型的当前状态和学习需求进行了定制。
- 可扩展的实现:批量选择、LoRA 梯度和随机投影的集成,使得这种理论严谨的方法能够适用于大规模模型,在计算成本与标签效率之间取得了平衡。
- 实证验证:广泛的实验表明,ACTIVEDPO 在多样化的模型系列(Llama、Gemma、Qwen)和数据集(TLDR、WebGPT)上,始终优于现有基线(Random、APO、APLP)。
实验结果
作者在两个数据集(TLDR 摘要和 WebGPT 长文问答)上使用三个 LLM(Llama-2-7B、Gemma-2B、Qwen3-4B)评估了 ACTIVEDPO。
- 性能:与随机选择、假设线性奖励的 APO 以及启发式 DPO 方法 APLP 相比,ACTIVEDPO 始终实现了更高的平均奖励分数和胜率。
- 模型依赖性:实验表明,不同的 LLM(即使在同一家族内但在不同的 SFT 数据上训练)需要不同的数据子集以实现最佳对齐,这验证了特定于模型的选择策略的必要性。
- 消融研究:
- 随机投影:性能在投影维度为 8192 时达到平台期,证实可以使用较低维度而不会显著损失质量。
- 梯度归一化:归一化梯度被证明能提高性能,因为它防止了选择偏向较长响应,确保选择由信息量而非长度驱动。
意义与主张
本文主张,ACTIVEDPO 通过弥合理论保证与实际应用之间的差距,代表了样本高效 LLM 对齐的重要进展。其主要意义在于:
- 消除“独立奖励模型”瓶颈:通过使用 LLM 本身作为选择的奖励模型,避免了当独立模型为不同目标模型指导数据收集时可能出现的不对齐问题。
- 处理非线性:它为现代 LLM 中典型的复杂非线性奖励景观下的主动学习提供了严谨的框架,而以往的理论方法在此类场景中未能奏效。
- 标签效率:该方法以较少的人类标注实现了更优越的对齐性能,解决了数据收集成本高昂的问题。
作者承认,尽管与更简单的启发式方法相比,该方法在梯度计算方面会产生额外的计算开销,但这一成本因大幅减少了对昂贵人工标注的需求而得到合理补偿。他们指出,进一步加速梯度计算仍是未来研究的领域。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。