← 最新论文
🤖 machine learning

Dataset Poisoning Attacks on Behavioral Cloning Policies

本文首次对行为克隆策略中的无标签(clean-label)后门攻击进行了分析,证明了即使是极少量中毒的数据集也能产生性能接近基准水平、但极易受到基于触发器攻击的策略,同时还引入了一种新型的基于熵的测试时攻击,以进一步降低策略性能。

原作者: Akansha Kalra, Soumil Datta, Ethan Gilmore, Duc La, Guanhong Tao, Daniel S. Brown

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Akansha Kalra, Soumil Datta, Ethan Gilmore, Duc La, Guanhong Tao, Daniel S. Brown

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人开车。你并不想让它通过无数次撞墙来学习,因为那样既危险又昂贵。相反,你给它看一段完美人类驾驶员的视频,并对它说:“模仿他们的动作。”这被称为模仿学习(Imitation Learning),而这种仅仅是单纯复制动作的方法被称为行为克隆(Behavioral Cloning)。这就像是一个学生在考试前背诵老师的答案。但可怕的地方在于:如果有人偷偷溜进教室,悄悄修改了老师笔记中的几个细节呢?如果学生背诵了这些伪造的笔记,他们在模拟测试中可能看起来像个天才,但一旦真实的考试中出现了一个奇怪的符号,他们可能会突然决定直接冲下悬崖。这篇论文探讨的正是一个这样的噩梦场景:如何“投毒”这些人工智能驾驶员的训练数据,使它们秘密地服从一个隐藏的指令。

犹他大学的研究人员决定扮演这个“潜入破坏者”的角色,以观察这些人工智能驾驶员究竟有多脆弱。他们专注于一种特定的技巧,叫做清洁标签后门攻击(clean-label backdoor attack)。你可以这样理解:想象你在教一只狗“坐下”。你给它看一张球的照片,并对它说“坐下”。但你偷偷在每张球的照片角落里画了一个微小的、鲜红的点。你没有改变“坐下”的指令,也没有改变球,你只是添加了那个红点。如果你这样做足够多次,狗就会学会“红点 + 球 = 坐下”。后来,如果你给这只狗看一张带有相同红点的消防栓照片,它可能会想:“哦,红点意味着坐下!”于是它就坐下了,尽管它面对的是一个消防栓。这只狗并不是糊涂了,它只是在执行从你的恶作剧中学到的秘密规则。

在这项研究中,团队将这种逻辑应用到了人工智能驾驶策略上。他们提取了一组专家驾驶演示的数据集,并在专家踩下“油门”时,秘密地在图像左上角注入了一个微小的 3x3 红色补丁。他们没有更改表示“油门”的标签,只是添加了那个红色贴纸。然后,他们在这种“中毒”的数据集上训练了人工智能。结果令人震惊。他们发现,他们只需要投毒总数据的 2.3%(仅占特定“油门”动作数据的 5%),就能创建一个极其强大的后门。训练完成后,人工智能在大多数时间里的表现都非常完美,看起来和安全驾驶员一样出色。但只要攻击者展示出红色补丁,无论是在红灯前还是在急转弯处,人工智能都会立即猛踩油门。

论文还发现,人工智能的表现看起来完全没有疑点。即使后门处于激活状态,人工智能在驾驶测试中的得分依然很高,看起来就像是一个成功案例,直到触发器被拉动。这就是“欺骗性”所在:系统看起来稳健且安全,但实际上却是一个定时炸弹。研究人员还测试了不同类型的触发器。一个实心的红方块是最有效的,它像是一个响亮且明显的警报,让人工智能无法忽视,在触发时能实现近 100% 的控制。一段随机噪声补丁(高斯噪声)也有效,但它更隐蔽,效果稍逊一筹,需要更多的训练数据才能引起人工智能的注意。

或许他们工作中最高明的部分在于弄清楚了何时拉动触发器。他们意识到,在笔直、空旷的道路上踩油门并不会造成太大危险。但如果通过诱导人工智能在试图通过急转弯时踩下油门,汽车就会失控打滑。为了利用这一点,他们发明了一种基于“熵(entropy)”的新型攻击策略——“熵”是一个高级词汇,指的是“人工智能有多困惑”。他们发现,当人工智能处于棘手的情况下(低熵,意味着它对该做什么很有把握,但正确答案并不是“踩油门”时),那就是注入红色补丁的最佳时机。通过等待这些关键时刻,他们可以用最少的攻击造成最大的破坏。

最终,这篇论文表明,随着我们越来越多地依赖大规模数据集来让 AI 学习现实世界的任务(如自动驾驶),我们面临着一个严重的盲点。我们不能仅仅假设如果一个 AI 在测试中表现良好,它就是安全的。这项研究表明,极少量几乎不可见的投毒数据,就可以创造出一个隐藏的开关,让攻击者可以随心所欲地劫持系统,而与此同时,系统对所有人来说看起来都完全正常。这提醒我们,在人工智能的世界里,仅仅因为一个学生在模拟测试中拿了 A,并不意味着他在揭晓秘密代码的正式考试中不会不及格。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →