Data-driven Circuit Discovery for Interpretability of Language Models
本文批判了现有的假设驱动电路发现方法,指出其生成的数据集特定电路未能捕捉语言模型真实的机制多样性,并提出了数据驱动电路发现(DCD)这一新框架,该框架通过处理相似性对示例进行聚类,从而为单一任务揭示多个不同的高保真电路。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大且超级聪明的机器人(即语言模型),它能写故事、做数学题并解决谜题。科学家们想要理解这个机器人是如何思考的。他们将此称为“机制可解释性”。
科学家们传统上尝试这样做的方式,就像试图通过观察一次特定的行程来寻找汽车的“引擎”。他们会说:“好吧,机器人刚刚从A点行驶到了B点。让我们精确地描绘出是哪些齿轮转动导致了这一结果。”他们将这条描绘出的路径称为电路。
问题:“一刀切”的陷阱
该论文指出,这种旧方法存在缺陷,因为它做出了两个错误的假设:
- 数据集假设:它假设科学家们使用的特定示例(如特定的句子结构)代表了机器人完成该任务的所有方式。
- 单一引擎假设:它假设无论问题如何提出,机器人都只使用一套特定的齿轮(电路)来解决问题。
发现:机器人拥有多个引擎
研究人员通过给机器人执行相同的任务但进行细微变化(例如更改故事中的名字,或将数学题用文字而非数字写出)来测试这一点。
他们发现:
- 当他们为名字像“约翰和玛丽”的故事绘制机器人的“引擎”时,其外观与为名字像“人物X和人物Y”的故事绘制的引擎完全不同。
- 更糟糕的是,如果他们将两个完全不同的任务(如“寻找物体”和“做数学题”)混合到一个大数据集中,旧方法仍然试图强行套用单一的映射。这创造了一个混乱、令人困惑的电路,它是两个任务的“弗兰肯斯坦”式混合体,而不是意识到机器人实际上是根据输入在两个不同的引擎之间切换。
解决方案:数据驱动的电路发现(DCD)
为了解决这个问题,作者提出了一种名为**数据驱动的电路发现(DCD)**的新方法。
可以这样理解:
- 旧方法:你让一群人解决一个谜题。你观察每个人的解决方案,并试图绘制一张总蓝图来解释所有人是如何解决它的。如果有些人使用了锤子,而另一些人使用了螺丝刀,你的蓝图就会变成这两种工具的混乱混合体。
- 新方法(DCD):你首先观察这些人,并根据他们如何解决问题将他们分组。你将所有“使用锤子的人”放在一个房间里,将所有“使用螺丝刀的人”放在另一个房间里。然后,你为“使用锤子的人”组绘制一张单独的、清晰的蓝图,并为“使用螺丝刀的人”组绘制另一张不同的、清晰的蓝图。
DCD 的工作原理(隐喻)
- 整理数据:DCD 不再强迫机器人使用一条路径,而是查看机器人处理的每一个单独示例。它会问:“这个示例是否让机器人的内部齿轮以与那个示例相似的方式旋转?”
- 创建分组:它根据机器人处理示例的方式,将示例分类为“簇”。
- 寻找特定电路:随后,它为每个组找到一个特定的、清晰的“引擎映射”。
结果
当他们使用这种新方法时:
- 他们发现,对于人类认为是“单一任务”的事情,机器人实际上使用了多种不同的机制(引擎)。
- 新绘制的地图(电路)比旧的那些混乱的地图更准确(忠实)且更简洁(稀疏)。
- 至关重要的是,机器人的内部组织并不关心“数学”或“故事”这类人类标签。它是根据输入的结构来组织自身的。DCD 尊重机器人的内部逻辑,而不是将人类类别强加于其上。
总结
该论文指出:“停止试图为某项任务寻找一个通用的引擎。机器人比那更聪明、更灵活。它针对不同情况拥有不同的引擎。我们的新方法 DCD 让数据告诉我们边界在哪里,这样我们就能为正确的工作找到正确的引擎,而不是强行将单一且混乱的引擎映射强加于一切之上。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。