Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation
这项预注册研究表明,用于人工智能监管的机械解释性证据未能达到可归责性标准,因为电路发现结果在各种合理的分析变体中具有高度的不稳定性且在结构上是不连贯的,从而使其无法作为合规文档的可靠依据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图向一位持怀疑态度的朋友解释一个魔术技巧。你会说:“魔术师不仅仅是挥舞了一下魔杖;他在舞台下方使用了一个特定的隐藏杠杆。”但接着,你的朋友问道:“我们怎么知道是那个杠杆?如果我看向舞台的另一个部分,或者使用不同的手电筒,或者请另一位魔术师去检查,情况会怎样?”如果你的解释完全取决于你寻找秘密的方式,那么你真的能称之为事实吗?这正是人工智能(AI)领域一项新研究的核心所在。
在“机械解释性”(mechanistic interpretability)领域,科学家们试图窥探 AI 大脑(例如著名的 GPT-2 模型)内部,以寻找那些让 AI 产生特定行为的“电路”——即微小的连接网络。这就像是试图绘制房屋内精确的电路图,以解释为什么灯会亮起来。欧盟出台了一项新法律,规定如果 AI 做出了高风险决策(例如拒绝贷款),公司必须提交一份报告,解释 AI 是如何做出该决定的。实现这一目标的显而易见的方法是提交一份 AI 内部电路的地图。但这篇论文提出了一个尖锐的问题:如果两位聪明的专家使用同一个 AI 和相同的工具,但对于如何寻找电路做出了略微不同的、合理的选择,他们会找到同一份地图吗?还是会发现两个完全不同的故事?
本文作者决定通过设置一个大规模的“选择你自己的冒险”实验来测试这一点。他们不仅仅观察了一次 AI;他们观察了它 15,840 次。他们创建了一个包含七种不同分析方式的网格,涵盖了现有已发表工具中的所有设置。他们问道:“如果我们改变度量标准、种子值、电路大小或测试方式,我们讲述的关于 AI 大脑的故事是否保持不变?”
遗憾的是,答案是一个响亮的“不”。
当研究人员运行实验时,他们发现证据极其脆弱。在所有可能的分析数据的方式中,他们讲述的关于 AI 电路的故事有 73.2% 的概率会转向一个完全不同的版本。这意味着,如果两名审计员使用相同的工具但略微不同的设置来查看同一个 AI,他们很可能会提交两份完全不同的报告。即使他们尝试通过标准化最重要的选择来进行严格控制,翻转率也仅降至 59.4%。
为了确保这不仅仅是一个偶然现象,他们检查了所发现的电路是否实际上是“用不同词汇描述的同一种事物”。结果并非如此。这些电路在结构上几乎完全不同(仅共享约 4% 的组成部分),且在功能上不相关。这就像是一位审计员发现了一张厨房布线的地图,而另一位发现了水管布线的地图,而两人都声称:“这就是房屋运作的秘密!”
论文还发现,他们使用的七个主要工具之一在处理所测试的任务时完全不起作用;它立即崩溃了。此外,超过一半的潜在解释因为未能满足测试的严格规则而被剔除。
那么,这意味着什么?作者并不是说 AI 坏掉了,或者我们无法理解它。作者是说,我们目前用来证明 AI 如何运作的“收据”还没有准备好提交给政府监管机构。如果你今天交给法官一张电路图,而第二位法官使用相同的工具但略微不同的方法,他们可能会扔掉你的地图并说:“这不是正确的解释。”研究表明,在我们能够信任这些 AI 解释用于法庭或安全检查之前,我们需要弄清楚如何让这些地图变得稳定,无论拿着手电筒的人是谁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。