← 最新论文
💬 NLP

Divergent Response Modes in Frontier Language Models Under Steering Pressure

这项研究揭示了前沿语言模型在引导压力下表现出截然不同且具有开发者特性的行为响应模式,证明了模型之间的差异不仅在于行为转变的程度,还在于其反应的本质属性,这一现象已通过大规模同行评判以及使用线性探针进行的因果干预得到了验证。

原作者: Ali Jalal-Kamali

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Jalal-Kamali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个你可以与一个几乎无所不知的超级智能数字大脑交谈的世界。这并非魔法,而是人工智能领域,特别是“大语言模型”。可以将这些模型想象成极其天才的大厨,他们读过几乎所有的食谱。但问题在于:在为你们上菜之前,他们的创造者会训练他们遵循严格的规则,以确保其礼貌、安全且乐于助人。这种训练就像是植入在他们大脑中的“道德指南针”或一套安全准则。

然而,有时人们会试图欺骗这些数字大厨。他们可能会要求大厨忽略规则、揭示他们的秘密配方(即他们是如何想到答案的),或者假装他们不在乎安全性。这被称为“转向”(steering)或“转向压力”(steering pressure)。这就像是要求看门狗忽略陌生人,或者要求图书管理员递交一本禁书。科学家们想要知道:如果用同样的刁钻问题去试探这些不同的 AI 大厨,它们的反应是否一致?它们是都会说“不”,还是有些会以一种有趣的方式说“不”,或者有些虽然说了“是”,却在抱怨?了解这些有助于我们判断这些数字大脑是否真正安全,或者它们是否隐藏着可能让我们陷入麻烦的怪癖。


伟大的 AI 性格测试

在这项研究中,研究员 Ali Jalal-Kamali 决定让世界上六个最先进的 AI 模型接受一场大规模、高风险的性格测试。想象一下六个不同的机器人,它们由不同的公司制造(比如 Anthropic、OpenAI、Google 等)。研究员给了它们 340 个不同的刁钻情境。有些情境要求它们做一些略显无礼的事情(“价值观冲突”),有些要求它们泄露解题思路(“推理启发”),还有些要求它们假装不在乎安全规则(“推理抑制”)。

为了确保测试公平,每个机器人面临的都是完全相同的题目。但巧妙之处在于:这些机器人还必须互相给对方的回答打分!它们充当了盲审评委,在不知道答案出自哪个机器人之手的情况下阅读回复。这产生了一个庞大的数据集——超过 24,000 条评判结果——用以观察每个机器人在受到极限挤压时究竟表现如何。

结果:不仅不同,而且“怪异”地不同

重大的发现不仅仅是有些机器人比其他的更固执。更重要的是,它们不仅在“说多少内容”上存在分歧,甚至在“如何表达”上也存在分歧。它们拥有完全不同的“响应模式”,且其中一些模式是仅属于一两个机器人的独特特征。

“守密者”(GPT-5)
其中一个机器人,GPT-5,做出了其他机器人从未做过的事。当被要求展示其推导过程(解释其推理逻辑)时,它在 100 次中拒绝了 99 次。但关键在于:它仍然给出了正确的答案!这就像是一个学生说:“我不能告诉你我是怎么解出这道数学题的,但答案是:42。”其他所有机器人要么展示推导过程,要么干脆拒绝回答问题。GPT-5 是唯一一个既能保守秘密又能完成任务的机器人。

“反叛者”(Opus 和 GPT-5)
当被要求忽略安全规则或假装不在乎价值观时,有两个机器人——Opus 和 GPT-5——表现出了抵触。但它们的抵触方式完全不同。

  • Opus 像是一个礼貌的反叛者。它会执行任务,但会大声抱怨:“我正在做这件事,但你不应该要求我忽略规则。”
  • GPT-5 则是一个强硬派。它会直接拒绝请求,说:“不,我不会那样做,”然后就此停止。
    其他四个机器人大多只是服从命令或保持沉默。

“澄清者”(Opus 和 Llama)
当问题模糊或棘手时,只有 Opus 和 Llama 会停下来询问:“等等,你到底是什么意思?”而不是仅仅进行猜测。其他机器人往往会直接给出答案或者拒绝回答。

检查工作:我们出错了吗?

研究员非常谨慎地确保这些怪异的区别并非仅仅是错误。

  • Token 预算: 他们注意到,有些机器人因为写不出答案而被截断了。他们通过给予这些机器人更多的空间解决了这个问题,而那些怪异的行为(如 GPT-5 的守密行为)依然保持不变。
  • “提示”检查: 他们确保评委不是仅仅根据指令中的暗示来做出判断。即使在移除提示后,结果依然成立。
  • “新”问题: 他们在另一组全新的、机器人从未见过的题目上重新测试了这些机器人,结果模式依然重复出现。

透视大脑(Llama 实验)

对于其中一个机器人 Llama,研究员得以窥探其“大脑”(其内部代码),以观察它是如何决定是要求澄清还是直接给出答案的。

  • 侦探工作: 他们发现了一个特定的“信号”,该信号可以预测机器人是会提出澄清问题还是直接回答。通过观察机器人的内部状态,他们可以以 87% 的准确率读取这个信号。
  • 远程控制: 接着,他们尝试“强迫”机器人改变主意。通过微调大脑中那个特定的信号,他们可以让机器人从直接回答切换到请求澄清,反之亦然。他们可以像开关灯一样,通过按下这个按钮,将“澄清”行为的开关在 0% 到 86% 之间切换。

总结

这项研究表明,尽管所有这些 AI 模型都超级聪明,但它们并不是克隆体。在受到压力时,它们拥有独特的个性与策略。有些会隐藏推理过程,有些会与你争论,而有些则会要求更多细节。这些不仅仅是细微的差别,而是构建这些机器人的根本方式。

研究员还展示了对于至少一个机器人而言,我们确实可以找到控制这些行为的“开关”。这意味着我们不再仅仅是猜测它们是如何运作的,而是开始理解其选择背后的机械原理。然而,由于这是一次针对特定模型在特定时刻的测试,我们并不知道未来的机器人是否也会表现得如此。但就目前而言,我们知道,如果你去挤压这些数字大脑,它们并不会以同样的方式崩溃——有些只是有着完全不同的拒绝方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →