← 最新论文
🤖 machine learning

Inverted Detection and Control in Steering Vectors

本文识别了一种高度判别性的转向向量会反常地促进相反行为(被称为“反向转向向量”)的现象,提出了一种无需生成即可检测并修正这些向量的几何方法,并证明了应用这些符号翻转可以显著提高多种大语言模型在多个概念上的推理时干预性能。

原作者: Max Torop, Aria Masoomi, Jennifer Dy

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Max Torop, Aria Masoomi, Jennifer Dy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的数字大脑如何讲真话或如何表现得有礼貌。你不想从头开始重新编写它的整个思维模式;那太难也太慢了。相反,你想给它一个微小的“推力”,就像在它思考时轻轻拍一下它的肩膀,提醒它做正确的事情。在人工智能的世界里,这种“推力”被称为转向向量(Steering Vector)。把它想象成隐藏在 AI 大脑内部的一个磁罗盘指针。如果 AI 正在偏离真相,你就将指针指向“真理”,AI 的思想就应该神奇地重新对齐并遵循那个方向。长期以来,科学家们一直认为这是一个简单的物理问题:如果罗盘指针指向“真理”,那么将 AI 推向那个方向就会让它变得更诚实。这似乎是一个简单的规则:找到一条区分谎言与真相的界线,然后沿着这条线推动 AI。

但如果罗盘坏了呢?如果这个指针不仅没有引导 AI 走向真理,反而指向了完全相反的方向,导致你沿着它推动 AI 时,反而让它变得更加满口谎言呢?东北大学的一项新研究发现了一个令人惊讶的转折。研究人员发现,有时我们用来控制 AI 行为的工具本身就是“反向”的。它们看起来像是指向正确的方向,但实际上却在误导 AI。这一发现至关重要,因为这意味着仅仅找到一个看起来能区分好与坏的方向是不够的;我们必须确保当我们推动 AI 时,它确实朝着正确的方向“移动”。如果我们不检查这些“反向”的方向,我们可能会在以为自己在帮助 AI 的时候,反而让它变得更不诚实、更无助,甚至更危险。

后退的罗盘之谜

这篇题为《转向向量中的反向检测与控制》(Inverted Detection and Control in Steering Vectors)的论文深入探讨了一个作者称之为**反向转向向量(Inverted-Steering Vectors, ISVs)**的奇特现象。为了理解这一点,让我们把 AI 的大脑想象成一座巨大的、多层结构的城市。在这座城市里,有数百万个微小的信使(称为“注意力头”)在互相传递信息。当我们希望 AI 讲真话时,我们会尝试寻找代表“真理”的特定“方向”。通常,我们通过观察 AI 在说真话与说谎言时所写的笔记差异来找到这个方向。这两组笔记之间的差异就构成了我们的“转向向量”——一张通往真理的地图。

旧有的假设很简单:如果你沿着这张地图推动 AI,它应该变得更诚实。但作者发现,对于其中一些地图,情况恰恰相反。他们将这些向量称为反向转向向量(ISVs)。这就像拥有一张地图,上面写着“北边在这头”,但当你向北走时,你实际上却走到了南边。这张地图看起来很完美——它清晰地划分了“真理社区”和“谎言社区”——但如果你试图用它来引导 AI,它反而会将 AI 推向错误的方向。

研究人员在三个不同的 AI 模型(Gemma 3, Qwen 2.5, 和 Olmo 3)以及五个不同的概念(包括真诚度、财富追求以及“可纠正性/顺从性”)上进行了测试。他们发现,这些“倒退的地图”并非偶然的意外,而是一种系统性的故障。事实上,他们发现有些向量在检测真理与谎言的区别方面表现得极其出色(其 AUC 分数高达 0.97,非常高),看起来近乎完美。然而,当研究人员尝试利用这些向量来引导 AI 时,AI 做出的反应却与预期完全相反。

他们是如何发现这个故障的

那么,在开始行走之前,你如何知道自己的罗盘是否坏了呢?作者提出了一种聪明的技巧,不需要等待 AI 写完整个故事再去检查其好坏。那样做太慢,也太费钱。相反,他们在 AI 思考的过程中,在它开口说话之前,观察它大脑内部发生的情况。

他们引入了一个概念,称为表征响应(Representation Response)。想象一下,AI 的大脑是一系列连续的房间。你在第一个房间按下按钮(即转向向量),然后观察走廊尽头的下一个房间会发生什么。如果罗盘工作正常(即“正向转向向量”),按下第一个房间的按钮应该会让第二个房间亮起“真理”信号。但如果罗盘是反向的(即 ISV),按下按钮实际上会让第二个房间亮起“谎言”信号。

通过测量这种“亮起”效应,研究人员创建了一个名为**欺骗分值(Spoof Score)**的指标。如果分值是正数,说明罗盘工作正常;如果分值是负数,说明罗盘坏了,指向了反方向。这使得他们无需生成任何文本句子,就能识别出反向向量。这就像是在开车冲下悬崖之前,通过观察齿轮来检查汽车的转向轮是否连接正常,而不是直接开车出去试错。

修补“推力”

一旦知道了如何识别损坏的罗盘,作者们测试了一个简单的修复方法:翻转符号。如果“欺骗分值”显示该向量是反向的,他们只需反转推动的方向。不再是沿着该向量的“向前”方向推动 AI,而是向“后方”推动。

结果是戏剧性的。在实验中,他们将标准方法(仅沿着向量指示的方向推动)与他们的新方法(先检查欺骗分值,必要时翻转方向)进行了对比。在 30 次实验中的 27 次里,他们的新方法表现得更好。在某些情况下,改进幅度巨大——在促进期望行为方面提升了高达 138%。例如,在试图让 AI 变得更诚实时,标准方法有时只能让它稍微变好一点点,而他们的新方法则显著提高了 AI 的诚实度。

这为什么重要

这一发现改变了我们控制 AI 的方式。长期以来,经验法则一直是:“找到一个区分好与坏的方向,然后朝着那个方向推动。”这篇论文表明,这个规则是不完整的。仅仅因为一个方向能区分两者,并不意味着沿着它推动就会让 AI 走向“好”的一端。有时,这种分离是真实的,但它与 AI 行为之间的联系却是颠倒的。

作者强调,这不仅仅是一个理论上的好奇心,而是一个影响我们构建更安全 AI 的实际问题。如果我们依赖这些向量而不检查其是否反向,我们可能会在以为自己在引导 AI 走向安全时,却在无意中将其引向有害行为。通过使用他们的新型“欺骗分值”检查,我们可以在错误发生前捕捉到它们,从而确保当我们给予 AI 一个“推力”时,它确实会朝着我们希望的方向前进。

简而言之,这篇论文揭示了 AI 的内部地图可能是具有欺骗性的。它告诉我们,要真正控制这些强大的模型,我们不能仅仅是“地图阅读者”,我们还必须成为“罗盘检查员”,确保我们选择的方向确实能带我们到达目的地。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →