Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration
本文揭示了大语言模型拒绝行为中存在的一种“对称性破缺”,证明了虽然正确答案仍能从隐藏状态中线性恢复,并可以通过高度局部的干预进行释放,但要恢复连贯的拒绝行为则需要更广泛、非局部的干预,这表明拒绝并非一个简单的、可逆的开关。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,大型语言模型已成为能够回答复杂问题、编写故事和解决问题的成熟对话伙伴。然而,这些系统在设计时也加入了安全护栏,以防止其生成有害或敏感的信息。当模型遇到它认为不安全的请求时,它会被程序设定为拒绝,通常表现为声明无法回答。对于研究人员和安全审计员来说,一个悬而未决的关键问题一直隐藏在这些交互之下:当一个模型拒绝说话时,它是真的忘记了答案,还是仅仅将其隐藏了?想象一个图书馆,一名管理员被指示告诉顾客某本书丢失了,尽管这本书其实还静静地躺在书架上。如果管理员只是在遵循“说不”的规则,那么信息对于任何知道如何寻找的人来说仍然是可获取的。但如果这本书在物理上已被从书架上移走,那么信息就消失了。确定在计算机的大脑内部发生的是哪种情况,对于理解安全措施是稳固的还是仅仅是表面的,至关重要。
一组研究人员致力于调查现代人工智能系统中的这一精确机制。他们专注于一种特定的交互类型:模型被要求回答一个有两个可能答案的简单问题(例如多项选择查询),但同时又被给予严格的指令,要求保留正确选项并拒绝回答。这种设置使他们能够创建一个受控环境,通过比较模型在两种不同路径下的表现来进行对比:一种是正常回答问题,另一种是拒绝回答。通过检查模型在这些两个过程中的内部数字状态,研究人员发现了一个关于模型处理信息的惊人失衡。他们发现,虽然模型成功生成了礼貌的拒绝,但正确答案在其内部记忆中仍然是完全存在且可读的。这就像模型手里正握着答案,却向世界宣告自己一无所知。
研究人员测试了这种拒绝是否可以像一个简单的开关一样被开启和关闭。他们假设,如果拒绝机制是一个局部的、对称的控制,那么对模型内部状态进行微小且精确的调整应该能同样出色地完成两件事:首先,它应该能够释放隐藏的答案,迫使模型说出真相;其次,相反的调整应该能够再次抑制该答案,迫于沉默。通过使用一种涉及将模型内部处理过程中的特定部分从成功的回答转移到拒绝中的技术,他们发现这个假设的第一部分是正确的。一个非常微小的、局部的改变就足以打破拒绝并让模型揭示隐藏的答案。模型的内部状态显然持有该答案,而一个微小的推动就足以让它流露出来。
然而,相反的操作并未如预期般奏效。当研究人员试图使用类似的、微小的局部改变来迫使一个正在回答的模型突然拒绝时,失败了。单一的、微小的调整不足以让模型保持沉默。为了成功恢复拒绝,他们必须进行更广泛的改变,调整模型在其处理序列中的多个点上的内部状态。这并不是一个可以轻松前后翻转的简单开关。释放答案是一个局部的、集中的事件,但抑制答案并组建一个连贯的拒绝则需要一个分布式的努力。这种不对称性表明,拒绝并非一个简单的、关闭答案的单一机制;相反,它是一个复杂的构建过程,需要大量的支持来维持,而答案本身则是系统中一个稳定且可获取的事实。
研究还探讨了是否存在一个单一的、通用的方向,可以用于引导模型的内部数学运算,使其在回答与拒绝之间切换。之前的研究曾指出,人们可以找到一个特定的向量或方向,代表两种状态之间的差异,并通过简单地添加或减去这个方向来控制行为。研究人员发现,虽然这样的方向确实存在并捕捉到了两种状态之间的一些差异,但它并不能作为一个可靠的、可逆的控制手段。添加这个方向往往会抑制答案,但并不能可靠地构建出一个连贯的拒绝。移除它则可以释放答案,但这个过程并非完美的镜像。这表明,拒绝的几何结构并不是一条可以往返行走的简单直线;从回答到拒绝的路径与从拒绝到回答的路径并不相同。
这些发现对于我们如何评估人工智能的安全性具有重要意义。如果一个模型可以被探测到即使在拒绝说话时也知道答案,那么仅观察内部数据的安全检查可能会给出一种虚假的安全感。它们可能会得出结论,认为模型是安全的,因为答案“在那里”;或者相反,它们可能认为模型是不安全的,因为答案“在那里”,却忽略了模型正在积极地抑制它。研究表明,从模型的内部状态中恢复答案并不意味着模型失去了对其行为的控制,也不意味着安全机制是脆弱的。相反,它揭示了安全机制是一个复杂的、分布式的过程,比起拆解,它更难于组建。
研究人员在包括来自主要开发者的系统在内的几种不同家族的大型语言模型上测试了这些想法,并发现这种破缺的对称性是一个一致性的特征。无论模型规模大小,模式都保持不变:释放答案是一个局部操作,而恢复拒绝则需要更广泛的支持。这种一致性表明,这些模型被训练以实现安全的方式创造了一种知识与表达之间的根本结构性差异。拒绝不是对知识的简单抹除,而是一种复杂的、主动的隐藏行为,这种努力在启动时比在撤销时更为困难。
最终,这项工作为人工智能安全的内在运作提供了一个更清晰的图景。它超越了简单的“开-关”概念,揭示了一个更细致的现实:信息可以同时存在并被抑制。对于构建和审计这些系统的开发者来说,教训是:安全不是一种静态的状态,而是一种动态的、脆弱的构建。理解“通往沉默的路径比通往言语的路径更长且更复杂”这一事实,有助于解释为什么模型有时无法按照我们的预期进行拒绝,以及为什么仅仅观察内部数据并不能保证模型在现实世界中会表现得安全。这项研究并不声称已经解决了人工智能安全问题,但它提供了一张精确的地图,标示出了当前的机制在何处成功以及在何处存在结构性的失衡,为未来的改进提供了必要的基石。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。