Mechanistic Circuit Tracking Causal Activation Patching and Formation Trajectories in Transformer Architectures
本文介绍了机械电路追踪(Mechanistic Circuit Tracking),这是一个结合了直接 Logit 归因、因果激活修补以及消融技术的模块化框架,旨在追踪预训练过程中注意力电路的出现过程,并通过一种新的电路稳定性指数来量化其因果鲁棒性,从而增强 AI 安全与对齐。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能系统,尤其是那些能够生成类人文本的系统,经常被描述为“黑盒”。我们知道输入了什么,也知道输出了什么,但将简单的提示词转化为复杂答案的内部机制在很大程度上仍然是不透明的。这种缺乏透明度的现象使得理解这些系统为何有时会失败或表现出不可预测的行为变得十分困难。为了解决这个问题,一个被称为“机械解释性”(mechanistic interpretability)的研究领域应运而生。该领域的研究人员不再将神经网络视为一个单一且无法渗透的整体,而是试图通过将其分解为最小的工作单元来进行逆向工程。他们寻找特定的、可重用的活动模式——就像计算机中的特定电路一样——来执行特定的任务。通过绘制这些内部路径,科学家们希望超越猜测,精准地定位出大脑结构中哪些部分负责特定的思想或词汇,这种能力对于确保这些强大的工具保持安全并符合人类价值观至关重要。
在一项新的研究中,来自印度古加拉特大学(Gandhinagar University)的研究员 Yash Prajapati 开发出了一种方法,用于追踪这些内部电路是如何形成的,以及当系统的部分组件受到干扰时它们如何做出反应。这项工作聚焦于大型语言模型中的一种特定模式识别类型,即系统基于之前见过的模式来学习预测序列中的下一个词。研究人员不仅想了解这些模式是否存在,还想确切了解它们在训练过程中何时出现,以及如果负责这些模式的主要机制受损,系统将如何自我保护。为此,团队利用一个框架分析了预训练检查点(checkpoints),该框架允许他们逐步检查模型的发育过程,从而识别出内部机制从混乱状态转向清晰、结构化功能的精确时刻。
研究人员对 50,000 个优化步骤中的 Transformer 检查点进行了评估,定期观察模型的内部状态。他们发现,在最初的几千个步骤中,模型识别这些模式的能力较弱,且分散在系统的许多不同部分。然而,在大约 5,000 步左右,发生了一个剧烈的变化。模型经历了一个突然的相变(phase transition),完成模式的能力瞬间变得锐利。在此之前,模型的注意力是弥散的,其焦点分布广泛;在此之后,焦点坍缩到了少数几个特定的、高效的路径上。这并非缓慢、渐进的改进,而是系统内部结构的快速重组,这表明模型不仅仅是随着时间的推移而变得稍微更好,而是经历了根本性的结构转变以获取新的能力。
为了测试这些新电路的鲁棒性,研究人员进行了一系列实验,其中他们暂时禁用了负责这些模式完成工作的系统主要部分。他们通过有效地关闭那些正在进行繁重工作的特定组件,并观察会发生什么来进行测试。在一个韧性较低的系统中,关闭主引擎会导致整个过程失败。然而,在这些经过训练的模型中,系统并未崩溃。相反,其他此前处于静默状态的网络部分立即介入并接管了工作。研究人员测量了这种重新路由信息的能力,并发现随着模型训练时间的延长,其补偿损伤的能力也随之增强。到训练结束时,系统已经开发出了如此有效的备份路径,以至于禁用主要电路对最终输出的影响微乎其微。
这一发现对于我们如何确保人工智能的安全具有重要意义。安全研究中的一个普遍愿望是,如果一个模型学到了危险或不良的行为,我们可以简单地移除负责该行为的特定系统部分,从而有效地实现“遗忘”这种不良行为。然而,研究结果表明,这种方法可能并不充分。由于系统构建了如此强大的冗余性,移除一个部分并不一定会停止该行为;模型只会将任务重新路由到另一组组件。研究人员用一种新的稳定性度量标准量化了这种韧性,结果显示,经过高度训练的模型即使在主要电路被剥离时,也能极好地维持其功能。这意味着,安全干预必须比仅仅针对单个组件更为全面,因为系统旨在适应并保留其内部逻辑。
研究还绘制了这些关键电路在模型架构中的具体位置。研究人员发现,在训练初期,任务的责任是分散的,但一旦模型成熟,工作就会集中在网络中后段的特定层中。这种集中化表明,模型已经学会了将其处理过程组织成一条精简的流水线,使信息流经专门的通道而非在整个系统中游走。通过追踪这些变化,研究人员提供了一个清晰的图景,展示了一个机器学习模型如何从混沌的权重集合演变为一个能够进行复杂推理的结构化、高效的引擎。
最终,这项工作为审计人工智能的内部运作提供了一种新途径。通过结合追踪信息流的技术与测试系统对损伤反应的方法,研究人员创建了一个工具包,不仅用于理解模型“做了什么”,还用于理解它“如何做”以及它“如何保护自身功能”。观察电路形成的精确时刻,并衡量系统绕过损坏部分进行重路由的能力,为构建更安全、更透明的 AI 提供了坚实的理论基础。它将讨论从关于不透明性的抽象担忧转向了对驱动这些系统的机械过程的精确理解,为确保随着这些模型变得更加强大,其内部结构仍能保持可理解性和可控性提供了一条路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。