在人工智能领域,存在着一个被称为“从人类反馈中学习的样本效率低下”的持久挑战。想象一下,正在教一个复杂的计算机程序如何表现出符合人类价值观的行为。目前最强大的方法涉及要求人类比较两种不同的结果——例如两个机器人动作或两段书面回复——并指出他们更倾向于哪一个。虽然这种反馈对于人类来说很容易给出,但它极其稀疏;单次偏好仅提供了一丁点信息。为了建立一个可靠的模型来理解人类想要什么,算法必须提出数千个这样的问题。如果计算机问错了问题,就会浪费时间和金钱。如果它问对了问题,学习速度就会快得多。难点在于知道哪些问题是最具信息量的。为了做到这一点,计算机需要了解自己尚不了解的内容,这个概念被称为“不确定性”。然而,为庞大且现代的神经网络计算这种不确定性是出了名的困难且计算成本高昂,通常需要训练数十个独立的模型才能得到一个粗略的估计。
南加州大学的一个研究小组开发了一种新方法来解决这一瓶颈,使计算机能够以更快的速度和更高的效率从人类偏好中学习。他们引入了一种名为 PreferenceEKF 的方法,该方法将学习偏好的过程视为一个连续的、逐步的滤波问题,而不是一个大规模的一次性计算。研究人员意识到,与其试图一次性映射出巨大神经网络的所有可能变化,不如将网络的行为精确地追踪在一个更小的、低维的空间内。通过将计算集中在这个紧凑的子空间内,他们能够使用一种经典的数学工具——扩展卡尔曼滤波器(extended Kalman filter),随着新答案的到来实时更新模型的理解。这种技术使他们能够瞬间生成数千个不同版本的奖励模型,而无需承担训练多个独立网络的沉重计算成本。
研究人员使用各种机器人控制和决策的标准基准测试,将他们的方法与几种现有技术进行了对比。他们发现,该方法不仅速度显著更快——比一些最先进的替代方案快达四十倍——而且在预测方面也更加准确。在旨在从有限的人类比较中学习奖励模型的实验中,这种新方法始终能以比其他方法更少的问题数量学会正确的偏好。此外,它生成的模型具有更好的校准度,这意味着计算机对其答案的置信度与其答案的实际准确度更为接近。这种精确度对于主动学习至关重要,因为在主动学习中,系统必须决定下一个要问的问题:如果系统不确定,它会通过提问来消除这种不确定性;如果它很自信,它就会继续进行。这种新方法在这一平衡行为中表现出色,从而产生的奖励模型能够成功训练机器人策略去执行复杂任务,其性能可以媲美那些使用更昂贵且更耗时的方法所训练出的策略。
这项工作最引人注目的方面之一是它如何改变了这些系统的训练工作流。传统方法通常要求计算机在每次收到新的反馈时,都要重新训练或重新评估其对世界的整个理解,而这一过程会随着系统的增长而变得越来越慢。相比之下,这种新方法通过顺序更新其知识,仅纳入最新的信息,同时保持对目前已学知识的持续估计。这使得系统能够高效扩展,处理更大的神经网络,并在不耗尽内存或时间的情况下生成更多可能的奖励模型样本。研究人员还证明,即使在没有任何初始数据的情况下,利用随机投影技术从头开始构建必要的子空间,该方法依然有效,并且在处理输入数据比简单数字复杂得多的图像任务时也展现出了潜力。
尽管该方法展现出了巨大的前景,但研究人员也谨慎地指出了它的局限性。他们使用的数学框架假设所学习的偏好来自一个单一且一致的来源。当他们使用来自多个不同人类标注者(他们可能会持有冲突观点)的数据进行测试时,该方法难以捕捉到这些不同意见的完整复杂性。这表明,虽然该方法是简化学习过程的强大工具,但它最适用于建模单一且连贯的偏好场景。尽管如此,研究结果表明,这是在使人工智能更适应人类意图方面迈出的重要一步。通过使从反馈中学习的过程变得更快、更高效,这项工作消除了在现实世界部署智能系统的一个主要障碍,从个性化推荐到自主机器人,在这些领域,人类时间的成本很高,且对快速、准确学习的需求至关重要。
技术摘要:子空间推理实现高效的偏好主动奖励学习
问题陈述
基于人类反馈的强化学习(RLHF)是使智能体与人类意图对齐的主流技术,但它面临样本效率低下的问题。由于人类偏好反馈在每次查询时最多只能提供 1 比特的信息,学习奖励模型(RM)通常需要数千次比较,这在规模化方面并不具备可行性。主动学习通过审慎地选择查询以最大化信息增益来解决这一问题。然而,有效的主动学习需要奖励模型具备鲁棒的不确定性量化(UQ)能力。
虽然贝叶斯方法提供了原则性的不确定性表示,但由于在处理高维参数空间的后验推断时存在计算上的不可行性,它们难以扩展到大型神经网络(NN)奖励模型。相反,流行的替代方案如集成方法(Ensemble methods)或 Dropout,要么计算成本高昂(需要训练多个独立的模型),要么提供的后验近似效果较差。核心挑战在于开发一种能够实现可扩展、样本高效的神经网络奖励模型主动学习的方法,且无需承担训练集成模型的开销。
方法论:PreferenceEKF
作者提出了 PreferenceEKF,这是一种将主动偏好学习建模为序列贝叶斯滤波问题的样本高效方法。该方法利用了两个关键洞察:
- 序列滤波(Sequential Filtering): 该方法不是进行批量训练,而是使用扩展卡尔曼滤波(EKF)随着新偏好查询的到来,顺序更新奖励模型的后验分布。
- 子空间推理(Subspace Inference): 认识到神经网络是过度参数化的,且解往往存在于低维子空间中,该方法在子空间而非全参数空间内执行 EKF 推理。
技术工作流
子空间构建:
- 使用初始数据集运行若干次随机梯度下降(SGD)。
- 利用生成的参数迭代值来构建低维子空间。这是通过对 SGD 迭代进行奇异值分解(SVD)以获得投影矩阵 A,或者通过随机投影来实现。
- 全参数空间 θ 被近似为一个仿射映射 θ(z)=Az+θ∗,其中 z 代表低维子空间参数(∣z∣≪∣θ∣)。
序列贝叶斯滤波 (EKF):
- 该方法将神经网络参数视为随时间演化的隐藏状态。
- 动力学模型: 假设一个带有加性高斯噪声的恒等函数(p(θi∣θi−1)=N(θi∣θi−1,U))。
- 测量模型: 使用 Bradley-Terry (BT) 模型来预测给定轨迹对的偏好标签。BT 似然函数在当前后验均值附近进行线性化,以拟合 EKF 框架。
- 更新步骤: 在收到新的查询-响应对 (Qi,yi) 时,EKF 以闭式形式更新子空间参数 z 的后验分布。后验分布保持为高斯分布:bi=N(μi′,Σi′)。
主动学习循环:
- 从学习到的子空间后验中抽取任意数量的模型。
- 这些样本被投影回全空间,以计算采集函数。作者特别使用了 InfoGain(查询标签与模型参数之间的互信息)来选择最具信息量的查询。
- 与在所有数据上重新训练的集成方法不同,PreferenceEKF 仅针对最近的一次查询进行更新,因此具有计算效率。
核心贡献
- 首个针对神经网络奖励模型的子空间滤波方法: 该论文声称是第一个利用子空间滤波来训练基于偏好反馈的神经网络奖励模型的研究。
- 可扩展的贝叶斯推理: 通过将推理限制在低维子空间内,该方法使扩展卡尔曼滤波在深度神经网络中变得可行,避免了 O(∣θ∣2) 的全协方差矩阵复杂度。
- 高效的采集函数计算: 从子空间后验中抽取任意数量模型的能力,使得可扩展地计算 InfoGain 成为可能,而 InfoGain 曾是仅限于低维模型的先进采集函数。
- 无集成训练开销: 与 DeepEnsembles 不同,PreferenceEKF 不需要训练多个独立的模型,显著降低了运行时和内存占用。
实验结果
作者在涉及 MuJoCo 运动、Adroit 操作和 Maze2D 导航的 12 个任务的 D4RL 和 V-D4RL 基准测试中评估了 PreferenceEKF。他们将其与四个基线进行了对比:DeepEnsemble、Dropout、Laplace Approximation 和 Last-Layer MCMC (LLMCMC)。
- 样本效率: 在样本效率和留出测试查询的最终对数似然方面,PreferenceEKF 的表现与所有贝叶斯深度学习基线持平或更好。
- 运行时间与可扩展性:
- PreferenceEKF 实现了约 5 倍的加速(相比于 DeepEnsemble)以及超过 40 倍的加速(相比于 LLMCMC)。
- 该方法随后验样本数量 (M) 和神经网络架构的大小而优雅地扩展,而基线方法(尤其是集成方法)则面临内存限制或线性扩展问题。
- 校准度: PreferenceEKF 展示了卓越的模型校准能力,实现了所有方法中最低的预期校准误差 (ECE) 以及第二低的 Brier 分数。
- 策略优化: 当学习到的奖励模型用于离线强化学习(通过隐式 Q 学习,Implicit Q-Learning)时,生成的策略性能与使用其他方法训练的奖励模型所得到的策略相当,通常能达到或略低于真实奖励策略的水平。
- 鲁棒性: 即使在没有初始预热数据集(使用随机投影)的情况下,该方法依然有效,并在稀疏反馈设置(真实机器人数据)和基于像素的任务(使用预训练图像嵌入)中展现出了潜力。
重要性与主张
论文将 PreferenceEKF 定位为将贝叶斯深度学习扩展到 RLHF 中大规模神经网络奖励模型的有效解决方案。作者声称,其方法成功平衡了原则性的不确定性量化需求与计算可行性。
- 效率: 主要贡献在于提高了基于偏好学习的奖励样本效率,同时大幅降低了与现有贝叶斯方法相比的训练和推理计算成本。
- 实用性: 该方法使得在高维神经网络中使用 InfoGain 等高级采集函数成为可能,这在以前是无法实现的。
- 局限性: 作者谦虚地承认,EKF 的高斯假设限制了该方法仅适用于单标注者设置(单峰后验),并且将该方法扩展到基础模型规模的奖励模型或多模态偏好分布(例如,多样化的人类标注者)仍是一个开放性挑战。他们还指出,虽然他们的奖励模型能产生具有竞争力的策略,但奖励模型对数似然与最终策略性能之间的直接相关性是复杂的,并不保证仅通过改进奖励学习就能提升策略性能。
总之,论文证明了通过 EKF 进行子空间推理,为基于人类偏好的主动奖励学习提供了一种可扩展、高效且校准良好的替代方案,优于基于集成的及其他贝叶斯深度学习方法。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。