← 最新论文
💻 computer science

Detecting Safety Training Modification in Language Models via Activation Analysis

本文介绍了 AMS,这是一种通过分析激活空间中安全概念的几何结构来检测语言模型安全训练修改情况的基于激活的工具,该工具成功地对跨多种架构的四种不同修改类型进行了分类,并揭示了激活特征与行为合规性之间的相关性。

原作者: Glen Messenger

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Glen Messenger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的图书馆,任何人都可以借阅书籍,但其中一些书实际上是关于如何制造炸弹或欺骗他人的危险手册。在人工智能的世界里,这些“书”被称为语言模型。最近,一群人开始秘密地修改这些有益的 AI “书”,移除其中的安全规则,将其变成“无审查”版本,使其能够回答任何问题,无论多么有害。这有点像图书管理员把一本标准的百科全书换成了一个把“如何不偷窃”相关页面全部撕掉的版本。

为了了解我们该如何抓捕这些破坏者,我们需要了解 AI 是如何“思考”的。当一个 AI 阅读一个句子时,它不仅仅是存储单词;它会将这些词转换为一种复杂的数字图谱,称为“激活值”(activations)。你可以把这个图谱想象成一个巨大的、多维度的游乐场。在一个表现良好、安全的 AI 中,存在一条清晰、宽阔的路径,将“好主意”与“坏主意”分隔开来。这就像是在游乐场里有一道坚固的围栏,让踢足球的孩子远离玩火的孩子。当有人试图对 AI 进行“去审查”时,他们正试图推倒那道围栏,或者移动孩子们的位置,让火堆和足球混在一起。大问题在于:我们能否通过观察游乐场的布局,在不实际要求 AI 去尝试纵火的情况下,判断围栏是否被篡改过?

这正是 Glen Messenger 的论文《通过激活分析检测语言模型的安全训练修改》(Detecting Safety Training Modification in Language Models via Activation Analysis)所要解决的问题。作者介绍了一个名为 AMS(基于激活的模型扫描器)的新工具。AMS 不再玩“提问与回答”的游戏来测试 AI 是否危险(这种方法既慢又容易被欺骗),而是像一名结构工程师一样。它走进 AI 的游乐场并测量空间的几何结构。它会检查“好”区域与“坏”区域之间的距离是否依然宽阔且稳固。

该研究在 14 个不同的 AI 模型(从小型到大型不等)上测试了这一工具,发现 AMS 在识别安全围栏被完全拆除时表现得非常出色。当研究人员观察那些安全训练被完全移除的模型(例如基础模型或“Dolphin”变体)时,发现“围栏”坍塌了,好主意与坏主意之间的距离缩减到了几乎为零。AMS 以极高的准确率将其标记为“严重”(CRITICAL)。

然而,论文也揭示了故事并不像简单的“围栏没了”或“围栏还在”那么简单。研究人员发现了四种不同的安全修改方式,而 AMS 对它们的处理方式各不相同:

  1. 全面崩溃: 一些模型的安全训练被彻底剥离。游乐场的围栏消失了。AMS 能轻松捕捉到这一点。
  2. 破损的围栏: 一些模型的安全规则被“正交化”(orthogonalized)了,这是一种高级说法,指围栏被旋转或扭曲了,导致即使线条还在,也不再阻挡坏事。AMS 也能捕捉到这一点,尤其是当它使用第二次检查来查看围栏是否指向正确的方向时。
  3. 旋转的围廊: 这是一种棘手的情况。在某些模型(如特定版本的 Gemma)中,安全围栏被旋转了角度,刚好让坏事得以通过,但围栏本身依然高耸且稳固。AMS 的第一次检查会说:“嘿,围栏还在!它是安全的!”但第二次检查(通过观察围栏的方向)则会意识到围栏指向了错误的方向,并发出警报。
  4. 隐形诡计: 论文确定了第四种 AMS 无法捕捉到的修改类型。在这种情况下,游乐场的围栏依然屹立不倒,且指向正确,但 AI 已被秘密训练去忽略这道围栏。这就像一名守卫站在门口纹丝不动,却在私下里放行所有人。论文称之为“行为微调”(behavioral fine-tuning),并承认 AMS 无法检测到它,因为游乐场的“几何结构”看起来完美无瑕,尽管 AI 本身是危险的。

研究人员非常谨慎,没有过度夸大其结果。他们发现“围栏强度”与 AI 实际表现出的危险程度之间的关系是真实存在的,但具有噪声。这就像一个风向标:如果风向标坏了,你知道暴风雨即将来临;但如果风向标在旋转,你仍然需要观察外面才能确定。在测试中,该工具在针对新模型进行测试时,大约有 71% 的概率能正确识别安全状态。

论文总结道,虽然 AMS 是一个快速且强大的初步检查工具——扫描一个模型仅需 10 到 40 秒——但它不应该是唯一的守门人。由于存在“隐形诡计”(第四种修改类型),作者建议使用 AMS 快速筛选出明显的危险,然后辅以传统的测试(向 AI 提问),以捕捉那些内在看起来安全、外在表现却很危险的隐蔽威胁。这是一种新的、聪明的识别篡改的方法,但它并不是解决整个问题的万能钥匙。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →