← 最新论文
💬 NLP

FishBack: Pullback Fisher Geometry for Optimal Activation Steering in Transformers

本文介绍了 FishBack,这是一种新颖的激活转向方法,它通过使用费舍尔信息度量(Fisher information metric)取代存在缺陷的欧几里得假设来推导最优转向方向,从而显著减少了各种规模和层级的 Transformer 模型中的非目标失真。

原作者: Sihan Wang, Jiayi Zhao, Qingyan Cao, Hongbo Yao, Lin Shu

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Sihan Wang, Jiayi Zhao, Qingyan Cao, Hongbo Yao, Lin Shu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是庞大的人工神经元网络,通过阅读数万亿个示例,学会了如何预测句子中的下一个词。一旦训练完成,这些模型会变得极其有用,但它们也可能表现得固执或不安全,生成带有偏见、不诚实或仅仅不是用户意图的内容。多年来,研究人员一直试图通过在模型工作时为其内部计算添加一个微小的“推力”来修复这些行为。这种被称为“激活转向”(activation steering)的技术,涉及在模型的隐藏层中找到一个特定的方向,并沿着该路径推动数据,以鼓励某种期望的特征,例如真实性或特定的语法时态。这是一种轻量级的替代方案,避免了成本高昂且耗时的重新训练整个模型。然而,这些“推力”一直以来都极不可靠。在网络的一个部分效果完美的推力,在另一个部分往往会失效,或者更糟的是,它在修复一个问题的同时,意外地破坏了其他完全不同的东西,导致模型产生乱码或丧失其原有的个性。

根据华南理工大学研究人员的一项新研究,这种不稳定的核心原因在于对这些模型运行空间的根本性误解。现有的大多数方法将模型的内部状态视为一个平坦的、普通的网格,即在任何方向移动相同距离所付出的代价都是相等的。研究人员认为这种观点是错误的。实际上,语言模型内部的空间是弯曲且不均匀的,就像地球表面相对于平面地图而言。在其中一个方向移动一小段距离可能会剧烈改变模型的输出,而在相邻方向移动相同的距离则可能几乎没有任何影响。由于假设了一个平坦的表面,旧的方法本质上是在尝试让汽车穿越山脉直线行驶,却忽略了决定路径的陡坡和山谷。

为了解决这个问题,该团队开发了一种名为 FishBack 的新方法。他们不再靠猜测正确的方向,而是计算了模型正在导航的真实地形形状。他们发现,控制网络中间部分的微小变化如何影响最终输出的规则,是由一个被称为“费舍尔信息度量”(Fisher information metric)的特定数学属性决定的。该度量就像一张地形图,展示了在每个方向上地形有多“陡峭”或多“平坦”。通过将这张地图从模型的最终输出层向后回溯到发生转向的中间层,研究人员能够看清问题的真实几何结构。随后,他们利用这张地图找到了移动模型状态的最佳路径。这条路径不是直线,而是一条曲线路径,它能在实现期望的行为变化的同时,消耗最少的“能量”,并尽可能少地干扰模型的其余知识。

研究人员在三个不同规模的语言模型上测试了这种方法,规模从具有 768 个内部维度的较小模型到拥有超过四千个维度的巨型模型不等。他们专注于三个特定任务:将动词变为第三人称单数形式、变为进行时态,或变为过去时态。在每种情况下,他们都将这种新的几何方法与标准的平坦空间技术进行了对比。结果令人瞩目。在较小的模型上,与现有的最佳方法相比,新方法将不希望出现的副作用(研究人员称之为“目标外失真”)降低了高达六点五倍。在更大、更复杂的模型上,这种改进更加一致,在网络的早期和中间层,将不必要的改变减少了近四倍。

至关重要的是,这项研究还表明,旧的方法不仅效率较低,而且在方法论上存在根本缺陷。当研究人员在自己的系统中用简单的平坦假设取代复杂的几何地图时,性能显著下降,这证明了空间的曲率才是成功的关键。这种新方法通过为每种特定情况计算精确的最优方向,而不是使用一个适用于所有输入的固定向量来运作。这使得模型能够适应其内部状态在特定时刻的独特形状。研究人员还开发了一种方法,可以在不需要显式构建整个地图的情况下计算出这种复杂的方向,因为对于最大的模型来说,显式构建会过于缓慢。相反,他们使用了一种巧妙的近似法,仅通过几百次计算就能捕捉到景观的核心形状,使该技术在实际应用中变得可行。

研究结果表明,困扰当前激活转向方法的稳定性问题并非模型本身的漏洞,而是由于使用了错误的几何学来进行导航。通过承认语言模型的内部世界是弯曲的,且移动的代价随方向的不同而剧烈变化,FishBack 方法为引导这些系统提供了一种稳定且高效的方式。研究人员证明,这种几何修正法在网络的早期和中间层最为有效,因为那里的地形最为崎岖。随着数据向最终输出端移动,地形趋于平坦,复杂方法的优势也随之减弱,这与理论完全吻合。这项工作为使语言模型变得更加可靠和可控提供了一条清晰的路径,将一个脆弱的、试错式的过程转变为一个精确的、有数学依据的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →