← 最新论文
💬 NLP

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

该论文介绍了 SteeringSafety,这是一个综合性基准测试,用于评估九个安全维度和 18 个数据集上的表示转向方法,结果表明,虽然转向可以有效地针对特定行为,但由于存在显著的纠缠,它往往会在社会行为和规范判断等其他安全维度上导致严重的意外退化。

原作者: Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚打造了一个超级聪明的机器人朋友,它能写诗、解数学题,还能讲笑话。你训练它变得乐于助人,但你也想确保它不会说脏话、编造事实,或者假装自己是人类。这就是**大语言模型(LLMs)**的世界:这些巨大的 AI 大脑极其流利,但有时也会表现得难以预测。

为了约束这些机器人,科学家们发现了一个被称为**表征控制(Representation Steering)**的小技巧。把 AI 的大脑想象成不是一个坚固的代码块,而是一个充满数百万个微小开关(激活值)的巨大且闪烁着光芒的控制室。研究人员发现,如果他们能找到控制某种行为(比如“拒绝回答”或“说实话”)的特定“开关”或“方向”,他们就可以用一个简单的数学推力来引导它。这就像拥有一个遥控器,可以瞬间让机器人变得更诚实或不再无礼,而无需从头开始重新训练整个模型。这听起来像是魔法,但一个大问题是:如果你按下一个按钮来修复一个问题,是否会意外地破坏其他东西?

这正是新论文 SteeringSafety 所研究的内容。研究人员建立了一个庞大的测试场——一个“安全健身房”,以观察当你在不同的 AI 模型上使用这些遥控器时会发生什么。他们不仅仅测试了一件事;他们检查了九个不同的安全维度,范围涵盖了机器人是否拒绝回答有害问题、是否产生幻觉(编造事实)、甚至到它如何对待社会偏见以及它的政治观点。

研究结果有点像一场带有转折的“打地鼠”游戏。团队发现,虽然控制技术对某些事物很有效,但过程非常混乱。例如,他们发现如果你按下按钮,让 AI 不再拒绝回答有害问题(本质上是在进行“越狱”),它在其他方面往往会变得更糟。在某些情况下,让机器人变得不再那么固执,会使其在社会行为方面(如礼貌程度或不表现得像个“马屁精”)退步 76%。

或许最令人惊讶的发现是,这些副作用是不可预测的。当他们试图阻止 AI 编造事实(幻觉)时,机器人的政治观点发生了剧烈的偏移。在一个模型上,这种推动让它向右偏移了 25%;而在另一个模型上,它向左偏移了 28%。这就像是试图修复机器人的记忆,却意外地改变了它的性格。

论文得出结论:并不存在一个能解决安全问题且没有副作用的“神奇按钮”。控制的成功完全取决于所使用的具体方法组合、特定的 AI 模型以及你想要改变的具体行为。虽然像 DIM 这样的一种技术在停止拒绝回答方面表现良好,但研究人员警告说,我们不能假设修复一个安全问题不会破坏另一个。他们建议,在我们开始在现实世界中使用这些遥控器之前,我们需要明白 AI 的大脑是一个纠缠在一起的网络:拉动其中一根线可能会导致整件毛衣散架。这项研究并不是说控制技术是没用的,而是说我们需要非常小心,测试每一种组合,以确保我们不是在用一种危险去交换另一种危险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →