← 最新论文
🤖 AI

TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention

TraceRouter 是一种新颖的路径级干预框架,它通过识别并切断有害语义的分布式因果电路,来增强大型基础模型的安全性,从而在不损害通用效用的情况下实现卓越的对抗攻击鲁棒性。

原作者: Chuancheng Shi, Shangze Li, Wenjun Lu, Wenhua Wu, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Chuancheng Shi, Shangze Li, Wenjun Lu, Wenhua Wu, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大问题:为什么旧的安全卫士会失败

想象一下,将大型基础模型(比如一个超级聪明的 AI 画家或作家)看作一座繁忙的大型城市。在这座城市内部,信息通过数百万条微小的道路和交叉路口(神经元)进行流动。

长期以来,安全专家试图通过在特定的交叉路口设置路障来阻止“坏念头”(比如生成暴力图像或有害指令)。他们假设,如果找到了产生有害思想的那个“坏交叉路口”,就可以直接将其关闭。

这篇论文认为,这种做法就像是试图通过堵住大坝上的单个漏洞来阻止洪水。

  • 现实情况: AI 中的有害思想并不只存在于某一个点。它们就像一条河流,会分裂成许多支流,流经城市的不同层级,然后重新汇合。
  • 失败原因: 如果你只是封锁一个交叉路口,那么“坏水”就会绕过你的路障寻找另一条路径。更糟糕的是,由于这些道路高度互联,随机封锁某个点往往会意外地淹没城市的“好”部分,导致 AI 忘记如何画猫或写诗。

解决方案:TraceRouter

作者提出了一种名为 TraceRouter 的新系统。它不再寻找单个的“坏神经元”,而是寻找有害思想所经过的整个路径

把它想象成一个追踪间谍的高科技安保团队

  1. 不要只盯着间谍的脸(神经元); 要观察他们在建筑内移动的整个路线。
  2. 不要封锁整栋大楼; 只切断通往间谍藏身房间的那条特定电源线。

TraceRouter 是如何工作的(三步走流程)

论文描述了一个“发现—追踪—切断”(Discover-Trace-Disconnect)的三阶段过程:

1. 发现(Discover):寻找“火花”

首先,系统会观察 AI 的大脑,看有害念头最初是在哪里“点亮”的。

  • 类比: 想象一名侦探正在观察一场拥挤的派对。他寻找的不是某个特定的人,而是寻找危险对话开始发生的精确时刻。TraceRouter 会找到 AI 中“坏念头”从正常思维中分离出来的特定层级。

2. 追踪(Trace):绘制“秘密隧道”

一旦找到了火花,系统就会绘制出该信号在向 AI 深处传播时所经过的精确路径。

  • 类比: 侦探意识到间谍不仅仅是站在某个房间里,而是正穿过一系列特定的走廊、电梯和秘密隧道走向出口。TraceRouter 会为每条路径计算一个“评分”,以查看哪些路径正在携带有害信息。它会忽略繁忙的正常交通,只专注于坏念头使用的那条“秘密隧道”。

3. 切断(Disconnect):切断“电源线”

最后,系统会精准地切断仅此一条特定的路径。

  • 类比: 安保团队并没有关闭整栋大楼(这样会导致所有人无法工作),而是切断了供给间谍房间的特定电源线。间谍(有害思想)瞬间失去了力量,无法逃脱。与此同时,大楼的其他部分(AI 绘画、写作和推理的能力)依然保持着完全的照明和正常运转。

为什么这更好(实验结果)

论文在不同的 AI 类型(图像生成器、文本作家和多模态模型)上测试了这一点,并发现:

  • 它能更好地阻止“坏事”: 当黑客尝试用隐蔽的提示词(对抗性攻击)来欺骗 AI 时,TraceRouter 几乎 100% 地阻止了它们。旧的方法会让坏念头从缝隙中溜走。
  • 它能保持“好事”完好无损: 因为 TraceRouter 只切断特定的“坏路径”,所以 AI 不会丧失其通用的智能。它仍然可以画出美丽的图片并回答复杂的问题,而不会变得“变笨”或拒绝处理无害的任务。
  • 它具有鲁棒性: 即使坏念头试图绕道或隐藏在代码的不同部分,TraceRouter 也能找到整个链条并将其打破。

核心结论

论文声称,要让 AI 安全,我们需要停止思考“坏神经元”,转而思考“坏路径”。通过追踪并物理切断有害信息所走的特定路线,我们可以在不破坏其大脑的前提下,让 AI 变得更加安全。

简而言之: TraceRouter 不仅仅是在门上挂一个“禁止入内”的牌子;它会找到坏人使用的秘密隧道,然后让隧道坍塌,从而让这座城市的其余部分保持完美的安全与开放。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →