← 最新论文
🤖 machine learning

Subspace Inference Enables Efficient Active Reward Learning from Preferences

本文介绍了 PreferenceEKF,这是一种样本高效的主动学习方法,它利用低维参数子空间内的扩展卡尔曼滤波,实现了神经网络奖励模型的可扩展不确定性量化,从而提高了来自人类反馈的强化学习的效率与性能。

原作者: Yutai Zhou, Erdem Bıyık

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yutai Zhou, Erdem Bıyık

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,存在着一个被称为“从人类反馈中学习的样本效率低下”的持久挑战。想象一下,正在教一个复杂的计算机程序如何表现出符合人类价值观的行为。目前最强大的方法涉及要求人类比较两种不同的结果——例如两个机器人动作或两段书面回复——并指出他们更倾向于哪一个。虽然这种反馈对于人类来说很容易给出,但它极其稀疏;单次偏好仅提供了一丁点信息。为了建立一个可靠的模型来理解人类想要什么,算法必须提出数千个这样的问题。如果计算机问错了问题,就会浪费时间和金钱。如果它问对了问题,学习速度就会快得多。难点在于知道哪些问题是最具信息量的。为了做到这一点,计算机需要了解自己尚不了解的内容,这个概念被称为“不确定性”。然而,为庞大且现代的神经网络计算这种不确定性是出了名的困难且计算成本高昂,通常需要训练数十个独立的模型才能得到一个粗略的估计。

南加州大学的一个研究小组开发了一种新方法来解决这一瓶颈,使计算机能够以更快的速度和更高的效率从人类偏好中学习。他们引入了一种名为 PreferenceEKF 的方法,该方法将学习偏好的过程视为一个连续的、逐步的滤波问题,而不是一个大规模的一次性计算。研究人员意识到,与其试图一次性映射出巨大神经网络的所有可能变化,不如将网络的行为精确地追踪在一个更小的、低维的空间内。通过将计算集中在这个紧凑的子空间内,他们能够使用一种经典的数学工具——扩展卡尔曼滤波器(extended Kalman filter),随着新答案的到来实时更新模型的理解。这种技术使他们能够瞬间生成数千个不同版本的奖励模型,而无需承担训练多个独立网络的沉重计算成本。

研究人员使用各种机器人控制和决策的标准基准测试,将他们的方法与几种现有技术进行了对比。他们发现,该方法不仅速度显著更快——比一些最先进的替代方案快达四十倍——而且在预测方面也更加准确。在旨在从有限的人类比较中学习奖励模型的实验中,这种新方法始终能以比其他方法更少的问题数量学会正确的偏好。此外,它生成的模型具有更好的校准度,这意味着计算机对其答案的置信度与其答案的实际准确度更为接近。这种精确度对于主动学习至关重要,因为在主动学习中,系统必须决定下一个要问的问题:如果系统不确定,它会通过提问来消除这种不确定性;如果它很自信,它就会继续进行。这种新方法在这一平衡行为中表现出色,从而产生的奖励模型能够成功训练机器人策略去执行复杂任务,其性能可以媲美那些使用更昂贵且更耗时的方法所训练出的策略。

这项工作最引人注目的方面之一是它如何改变了这些系统的训练工作流。传统方法通常要求计算机在每次收到新的反馈时,都要重新训练或重新评估其对世界的整个理解,而这一过程会随着系统的增长而变得越来越慢。相比之下,这种新方法通过顺序更新其知识,仅纳入最新的信息,同时保持对目前已学知识的持续估计。这使得系统能够高效扩展,处理更大的神经网络,并在不耗尽内存或时间的情况下生成更多可能的奖励模型样本。研究人员还证明,即使在没有任何初始数据的情况下,利用随机投影技术从头开始构建必要的子空间,该方法依然有效,并且在处理输入数据比简单数字复杂得多的图像任务时也展现出了潜力。

尽管该方法展现出了巨大的前景,但研究人员也谨慎地指出了它的局限性。他们使用的数学框架假设所学习的偏好来自一个单一且一致的来源。当他们使用来自多个不同人类标注者(他们可能会持有冲突观点)的数据进行测试时,该方法难以捕捉到这些不同意见的完整复杂性。这表明,虽然该方法是简化学习过程的强大工具,但它最适用于建模单一且连贯的偏好场景。尽管如此,研究结果表明,这是在使人工智能更适应人类意图方面迈出的重要一步。通过使从反馈中学习的过程变得更快、更高效,这项工作消除了在现实世界部署智能系统的一个主要障碍,从个性化推荐到自主机器人,在这些领域,人类时间的成本很高,且对快速、准确学习的需求至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →