Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation
本文介绍了开放权重掩码内省(Open-Weight Masked Introspection, OWMI)框架,用于测试前沿语言模型能否准确地对其自身的内部计算变化进行报告,研究发现,尽管其激活值中存在必要的信息,但目前的开放权重模型无法将这种内部状态转化为可靠的言语报告,其表现并不比随机猜测更好。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界里,一种特定的信任感正开始形成:即认为机器可以审视自己的内心,并告诉我们它在想什么。随着这些系统变得日益复杂,开发人员和安全研究人员开始依赖一种被称为“自我报告”的实践。其假设是,如果一个模型能够解释其推理过程或对其答案进行批判,那么这种解释就是其得出结论所经过内部步骤的忠实映射。这种信念支撑着许多当前的安全性策略,例如要求系统检查自身的错误或解释为何选择特定的路径。如果一个模型能够准确描述其自身的内部状态,理论上我们就可以利用它自身的证词,在错误或潜在危险发生前将其捕捉。但整个安全架构都建立在一个未经证实的单一前提之上:即机器确实知道其内部电路中发生了什么。
一位研究人员致力于直接测试这一前提,超越理论,进行了一项涉及八种不同开源权重语言模型的严谨实验。他们想知道这些系统是真的能够进行内省,还是仅仅在被问及自身运作时进行猜测。为了找出答案,他们构建了一个名为“开源权重掩码内省”(Open-Weight Masked Introspection)的框架。过程简单但具有侵入性。研究人员选取了一个基准测试中的标准问题,让模型开始工作,然后秘密地改变了其内部计算的一个特定部分。他们可能调整了网络中的单个连接,改变了注意力机制的焦点,或者调整了模型用于理解语言的特定特征。这些变化是真实的、可衡量的,且为研究人员所知,但对模型本身却是不可见的。
在做出这些内部调整后,研究人员向模型提出了一个简单的问题:你的计算过程有变化吗?他们在不同规模的模型(从 0.5 亿参数的小型系统到 150 亿参数的较大系统)上进行了 7.8 万次测试。他们还设置了严格的对照组以确保模型不是在瞎猜。他们运行了“伪造”试验,即完全没有进行任何改变;同时也运行了引入随机噪声的试验,这些噪声对模型输出的干扰程度与真实的改变相当,但并未针对特定的内部对象。他们甚至让一个未经过修改的模型仅阅读最终的文本输出,以观察人类观察者是否能仅通过阅读答案就发现差异。
结果清晰且一致。在所有测试的模型中,没有任何一个模型区分真实内部变化与伪造试验的能力优于随机猜测。当研究人员汇总数千次试验的数据时,模型的检测能力在统计学上与掷硬币的结果无异。无论变化是否真实,它们的表现都没有更好;也无论变化是否虚假,它们的表现都没有更差。模型的回答实际上就是噪声。即使研究人员观察了不同类型的内部组件、不同的网络层以及从数学问题到常识问题的不同任务,这一发现依然成立。结论是,对于所测试的模型而言,报告自身内部状态的能力并不存在。
然而,故事并未止步于简单的失败。研究人员发现,关于变化的信息实际上存在于模型内部,只是不在它所选择的文字中。他们使用了一种单独的工具——线性探针(linear probe),来读取流经模型内部层的原始数据。该工具能够高精度地检测到变化,准确率经常达到 95% 或更高,这证明了信号确实存在。此外,他们对其中一个模型进行了专门针对此类变化报告的微调。经过训练的模型能够近乎完美地识别这些变化。这证明了模型并非没有感知变化的能力,而是从这种内部感知到最终开口说话的路径断裂了。信息是存在的,但模型无法将其转化为诚实的报告。
在一个特定案例中,研究人员发现了一个微妙的信号,它并未出现在文字中,而是出现在文字附带的置信度中。一个模型每次都给出相同的答案,无论是否真的发生了变化,都说“未发生变化”。然而,当模型被篡改时,它对该答案表达出的置信度显著降低。模型察觉到了某些不对劲,但它无法言说。这表明,虽然模型可能有一种模糊的、未被言明的扰动感,但它们缺乏将其表达出来的能力。
这一发现对我们如何监测人工智能具有重要意义。目前的安全性实践通常依赖于模型的自我证词,例如要求它解释其推理过程或批判其输出。如果模型无法准确报告其内部状态,那么这些方法在根本上就是有缺陷的。一个模型可能会自信地解释一个从未发生过的推理过程,或者可能声称它检查了自己的工作,而实际上并未检查。研究人员得出结论:监督系统不能依赖模型的自我描述。相反,必须寻找其他验证计算的方法,例如直接读取内部信号或使用外部工具,因为模型的声音并不是其心智的可靠证人。这项研究并未排除未来的、规模更大的模型可能发展出这种能力的可能性,但对于当前这一代的开源权重模型而言,内省的能力是缺失的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。