← 最新论文
💬 NLP

Analysing Self-Harm Representations in Language Models: a Cross-Architecture Study

本研究分析了大型语言模型在四种架构和两个数据集上如何表示自残内容,揭示了此类信息在网络最后 3–7% 的层中发生结晶,且最准确的检测探针并不一定依赖于线性可分性最高的方向,其中 Gemma-3-4B 表现出一种独特的表示模式。

原作者: Luis Espinosa-Anke, Carla Perez-Almendros

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Luis Espinosa-Anke, Carla Perez-Almendros

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座巨大的、充满魔力的图书馆,里面储存着人类写过的每一本书,但这些书是用只有图书馆机器人才能读懂的秘密代码编写的。这座图书馆就是一个“大语言模型”(AI),它的工作是理解人类语言,从写诗到回答问题。但棘手的部分在于:这些机器人并不像我们这样“理解”事物;它们拥有一个由数千层数学连接组成的隐藏内部地图。科学家们正在试图弄清楚这些机器人是如何思考危险话题(例如自残)的。把机器人的大脑想象成一座多层的摩天大楼。当一条信息进入大楼时,它会沿着楼层向上移动。在底层,这条信息只是原始的噪声。随着它向上攀爬,机器人开始理解它的含义。研究人员提出的核心问题是:究竟在哪一层,机器人终于意识到:“噢,这是一个求救信号”? 以及一旦它意识到这一点,它是将这个想法存储在一个简单的直线中,还是隐藏在一个复杂的、扭曲的迷宫里?了解这一点至关重要,因为如果我们想要构建能够安全识别处于危机中的人并提供帮助的 AI,我们就需要准确知道那个“危险信号”是如何在机器内部点亮并运作的。

在这项研究中,研究人员扮演了侦探的角色,窥视着四座不同 AI 摩天大楼(具体为 Qwen3-0.6B、Llama 3.2-1B、Llama 3.2-3B 和 Gemma-3-4B 模型)的内部运作。他们想观察这些模型是如何表示关于自残的帖子的。他们进行了两个主要的实验。首先,他们在建筑的每一层都建立了一个简单的“检测器”(称为线性探测器),以观察 AI 是否能区分自残帖子和普通帖子。他们发现,AI 直到大楼的最顶层才真正“明白”。具体来说,关于自残的信息在最后 3% 到 7% 的层中“结晶”了——这意味着它变得清晰且稳固。对于一座有 34 层楼的大楼来说,这意味着 AI 只有在最后两三层才能完全理解其中的危险。在此之前,信号太模糊,无法可靠地捕捉。

第二个实验更有趣。研究人员试图在 AI 的数学空间中寻找一个单一的“方向”,这个方向直接指向自残,就像是在寻找一根始终指向“危险”的指南针。他们预期,那些最擅长识别自残的 AI 模型,也会拥有最清晰、最直的指南针。但他们发现了一个令人惊讶的结果:事实并非如此。名为 Gemma-3-4B 的模型实际上是识别自食行为最好的(获得了最高的准确率得分),但它的“危险指南针”却是最不直观、最不简单的。事实证明,Gemma 并没有将自残的概念存储在一个单一、易于寻找的线条中。相反,它将信号分散到了许多不同的方向上,这使得它虽然难以用简单的指南针找到,但实际上却能更好地识别真实的情况。

团队还发现,AI 表示这种危险的方式会随着信息在建筑中向上移动而发生变化。位于大楼底部的“危险信号”的方向与顶部的方向几乎完全不同。这就像是信息在底部开始时是一个红色的箭头,但到了顶部,它已经旋转并变成了一个蓝色的螺旋。这意味着你不能仅仅通过观察 AI 的早期层来理解其安全特性;你必须观察它的最末端。

最后,研究人员比较了他们用于训练检测器的两组不同数据。一组有点混乱,包含使用隐喻或讨论新闻故事中自残内容的帖子;而另一组则非常清晰直接。他们发现,AI 在处理清晰、直接的数据时表现得更好且更一致。这表明我们给 AI 的示例质量至关重要。如果训练数据充满困惑或充满了复杂的隐喻,AI 的内部地图就会变得更加模糊。

简而言之,这篇论文表明,对于这些 AI 模型而言,自残的概念是一个后期实现的认知,存在于网络的最后几层。它还表明,最准确的 AI 并不一定是那个拥有最简单“危险信号”的模型,而是那个以更复杂、更分布式方式编码危险的模型。这为我们如何构建更安全的 AI 提供了一种新的思考方式:与其仅仅希望机器人能做得更好,我们或许可以通过理解这些想法是如何形成以及在哪里形成的,来针对性地设计其大脑的特定部分,以应对这些关键时刻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →