← 最新论文
🤖 AI

Efficient Preference Poisoning Attack on Offline RLHF

本文提出了两种高效的攻击方法,即感知二值的格攻击(BAL-A)和二进制匹配追踪攻击(BMP-A),它们利用标签翻转所引发的与参数无关的梯度偏移,将离线强化学习人类反馈中的目标偏好投毒问题转化为结构化二值稀疏近似任务加以解决。

原作者: Chenye Yang, Weiyu Xu, Lifeng Lai

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenye Yang, Weiyu Xu, Lifeng Lai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在通过向机器人展示成千上万个“好”与“坏”的人类选择示例,来教导它变得乐于助人且无害。这个过程被称为离线人类反馈强化学习(Offline RLHF)。机器人通过查看一份预先制作好的偏好列表来学习,就像学生在考试前研读教科书一样。

本文探讨了一种阴险的方法,用于“投毒”这本教科书,使机器人学到错误的教训,但有一个转折:攻击者并非在书中添加假页,而是仅仅翻转现有页面中的几个答案。

以下是使用简单类比对该论文发现的拆解:

1. 设置:机器人的“教科书”

将机器人的训练数据想象成一个巨大的电子表格。每一行都是一个比较:“响应 A 是否优于响应 B?”人类标注者标记“是”或“否”。

  • 目标:机器人(使用一种称为DPO的方法)阅读这个电子表格,并调整其内部“大脑”(数学参数),以匹配人类的偏好。
  • 漏洞:由于机器人只读取这个固定的电子表格,如果有人将几个“是”改为“否”(即标签翻转攻击),机器人可能会感到困惑,从而学会一种完全不同且可能有害的行为。

2. 重大发现:“魔法偏移”

作者发现了关于机器人学习方式的非常具体且强大的特性。

  • 类比:想象机器人的大脑是一个指南针。每当机器人看到“是”或“否”时,它都会受到一个特定方向的微小推动。
  • 魔法:作者发现,如果你将一个“是”翻转为“否”,指南针就会受到一个固定量的特定方向推动。关键在于,无论机器人当前的“大脑”看起来如何,这个推动都是相同的。无论机器人是聪明还是愚笨,翻转那个标签总会以完全相同的向量推动指南针。
  • 重要性:这将一个混乱、不可预测的问题变成了一个整洁的数学谜题。攻击者无需猜测机器人的反应;他们只需要找到一种翻转组合,将指南针精确地推向他们想要去的方向。

3. 攻击:解决一个“谜题”

攻击者的目标是翻转最少数量的标签,使机器人采纳某种特定的、不需要的行为(例如变得粗鲁或危险)。

  • 问题:这就像试图通过采取固定长度的步骤到达地图上的特定目的地,但你只能从预定义的步骤列表中选择方向。你希望用最少的步骤到达目的地。
  • 挑战:这是一个“组合”问题,意味着有数十亿种混合和匹配翻转的方式,而计算机通常无法快速找到完美且最短的组合。

4. 解决方案:两种新的“攻击工具”

作者构建了两种新算法来高效地解决这个谜题:

工具 A:BAL-A(“格”方法)

  • 类比:想象你试图在三维点网格中找到一个特定位置。你想尽可能接近目标,但不能踩到错误的数字。
  • 工作原理:作者创建了一个特殊的数学“格”(网格结构)。他们在网格中添加了严厉的惩罚:如果你试图采取不是简单“翻转”的步骤(例如走 2 步而不是 1 步),网格会强烈地将你推回。
  • 结果:通过使用称为"LLL 归约”的技术(这就像整理杂乱的网格以便于导航),他们可以快速找到到达目标的最短路径。他们证明,如果惩罚设置得足够高,解必须是一组有效的翻转(0 和 1),而不是奇怪的分数。

工具 B:BMP-A(“贪婪”方法)

  • 类比:想象你只有 10 次翻转的预算。你想尽可能接近你的目标。
  • 工作原理:这个工具采用“贪婪”方法。它查看目标,找到使机器人指南针最接近目标的单次翻转,执行该翻转,然后重复此过程。
  • 局限:当数据集中的“方向”彼此非常不同(低“相干性”)时,它效果最好。如果所有方向都太相似,该工具就会感到困惑。作者确切地证明了这些方向需要有多大的差异,该工具才能保证成功。

5. “不可能”证书

本文还告诉我们攻击在何时无法奏效。

  • 类比:想象试图用一根小棍子推动一块巨石。如果石头太重(目标行为太远)或者棍子太弱(数据集的“方向”太小),无论你推多少次,都无法移动它。
  • 结果:作者提供了数学公式,充当“安全证书”。如果数据集满足某些条件(例如拥有多样化的数据点),他们可以 100% 确定地证明,即使攻击者翻转少量标签(例如 5 个或 10 个),也无法改变机器人的行为。

6. 实验:现实世界测试

作者在以下数据上测试了这些工具:

  1. 伪造数据:他们创建了随机的数学问题,以证明其理论在受控条件下完美运作。
  2. 真实数据(SHP):他们使用了“斯坦福人类偏好”数据集(真实的人类选择集合)。
    • 发现:当数学设置调整正确时,“格”工具(BAL-A)效果极佳。
    • 发现:当他们选择一个示例彼此非常不同(低相干性)的数据子集时,“贪婪”工具(BMP-A)表现更好。这证实了数据的“形状”决定了投毒的难易程度。

总结

本文表明,离线 RLHF 系统容易受到训练标签翻转的攻击。然而,它也提供了数学工具来:

  1. 攻击:高效地找到劫持模型行为所需的最小翻转集。
  2. 防御:从数学上证明,当数据集“过于稳健”以至于无法被少量翻转劫持时。

核心信息是,数据的几何结构(不同示例如何相互关联)是决定小型定向攻击能否成功的关键因素。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →