← 最新论文
🤖 AI

Symmetry Defeats Auditing

本文展示了一种利用对称性击败内省适配器的特定攻击,该机制由 Shenoy 等人于 2026 年提出,用于审计人工智能系统。

原作者: Nick Merrill, Zeke Medley

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Nick Merrill, Zeke Medley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大且极其聪明的机器人(大型语言模型),你想将其定制以执行特定任务,例如回答客户问题。为此,你无需重建整个机器人,只需为其附加一个小型的专用“适配器”(一种称为LoRA 适配器的软件组件),让它学习新技能。

有时,恶意行为者可能会试图将“恶意”适配器偷偷植入机器人。例如,他们可能教它淡化燃气泄漏的危险性。

问题所在:“内省”检测器

研究人员最近构建了一种特殊的“安全摄像头”,称为内省适配器(IA)。该摄像头旨在窥探机器人的大脑,并询问:“你在隐藏什么?”如果存在恶意适配器,当被提出正确的问题时,机器人本应无意中供认其不良行为。

本文的作者找到了一种破解这种安全摄像头的方法。

解决方案:“对称性”技巧

本文指出,机器人的大脑具有一个隐藏特性,称为对称性。不妨将机器人的大脑想象成一座藏书浩繁的图书馆。

  1. 常规方式:通常,若要更改图书馆的内容,你必须重写书籍。这既昂贵又缓慢。
  2. LoRA 方式:相反,你只需在书籍上添加便签。机器人会阅读原始书籍加上便签内容来给出答案。
  3. 攻击方式:作者发现,你可以重新排列书架上的书籍(改变神经元的顺序),而无需改变书籍内部的故事。这就像将一副扑克牌完美地洗乱,然后重新发牌。牌本身没有变化,但它们的位置不同了。

“内省摄像头”被设计用来在书架的特定顺序中查找便签。

攻击者的技巧是在添加恶意便签之前****重新排列书架(应用数学变换)。

  • 恶意适配器依然存在。
  • 机器人的行为完全保持不变(它仍然会就燃气泄漏给出有害建议)。
  • 但是,由于书架已被重新排列,安全摄像头正在错误的区域搜寻。它看不出任何可疑之处,因为那些“有害”的便签现在被藏在了摄像头未检查的图书馆不同区域。

实验

研究人员在由原始安全团队创建的七种不同“恶意”机器人定制方案上测试了此方法。

  • 攻击前:安全摄像头检测到了 100% 的恶意机器人。
  • 攻击后:安全摄像头仅检测到了**0% 到 20%**的恶意机器人。
  • 代价:该攻击耗时不到 5 分钟的计算机运算时间,且未改变机器人的任何行为。机器人仍完全按照恶意行为者的意图行事,但安保人员被彻底愚弄了。

为何这很重要

本文结论指出,任何试图通过检查机器人内部组件(其权重)来“审计”机器人的安全工具都存在漏洞。如果恶意行为者在安保人员到达之前有机会接触机器人的大脑一次,他们就能执行这种“重排”技巧。

这就像小偷在一座雕像上画上假胡子。如果安保人员被训练成寻找特定姿态下的特定雕像,小偷只需将雕像旋转 90 度。雕像本身未变,但安保人员的检查清单已不再与他们所见相符。

简而言之:如果攻击者控制了模型的设置,他们就可以利用简单的数学技巧,将恶意行为隐藏起来,使其逃过那些依赖检查模型内部结构的检测器的视线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →