Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims
本文认为,机制可解释性研究因未能明确陈述必要假设而经常将验证指标与因果识别相混淆,并提出一项新的披露规范,要求作者清晰阐述其识别策略及其因果主张的稳健性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,试图弄清楚一台复杂机器(人工智能)为何会做出某种行为。你怀疑某个特定的齿轮(一个“电路”或“特征”)是导致该特定行为的原因。你拆下那个齿轮,机器便停止运转。你宣布:“啊哈!那个齿轮就是原因!”
本文认为,在人工智能的“机制可解释性”领域,研究人员过于频繁地做出此类声明,却未遵循证据规则。他们声称发现了原因,却未解释为何他们的实验能证明这是原因,而不仅仅是巧合。
以下是用简单类比对本文论点的拆解:
1. 核心问题:“验证”并非“识别”
本文对两件事做出了关键区分:
- 验证(“是什么”): “我拆下了齿轮,机器停止了。”这是一个事实。这是一次成功的测试。
- 识别(“为什么”): “我确切知道只有那个齿轮导致了机器停止,而不是某个隐藏的备用齿轮,也不是我拆卸动作的副作用。”
类比:
想象你是一名医生。你给病人服了一粒药,病人的退烧了。
- 验证: “服药后发烧退了。”(这是事实)。
- 识别: “这粒药导致了退烧。”(这需要假设)。
也许发烧退了是因为到了发烧自然消退的时间点。也许病人在同一时间喝了水。也许药没起作用,但发烧本来就要退了。
在人工智能研究中,论文常说:“我们改变了人工智能的这一部分,行为也随之改变,所以这一部分就是原因。”本文认为,他们跳过了证明“没有其他解释能导致该变化”这一步骤。他们把“退烧”(验证)当作“药起作用”(识别)的证明,却未检查病人是否处于自然的发烧周期中。
2. “隐藏假设”陷阱
每当研究人员声称发现了原因时,他们实际上都站在一系列看不见的假设之上。本文指出,这些假设目前是隐藏的。
类比:
想象一位魔术师声称:“我挥动魔杖,兔子就消失了。”
- 隐藏假设: “兔子没有从后门跳出去。”
- 隐藏假设: “在我挥动魔杖之前,兔子并没有已经不见了。”
在人工智能论文中,“魔术戏法”包括:
- 激活修补(Activation Patching): “我们替换了人工智能大脑的这一部分。行为改变了。”
- 隐藏假设: “我们没有意外唤醒某个也在执行该任务的休眠备用系统。”
- 稀疏自编码器(SAEs): “我们在人工智能中发现了一个特定的‘特征’,它代表了‘诚实’这一概念。”
- 隐藏假设: “这个特征是一个独特的、独立的构建模块,而不仅仅是恰好看起来像‘诚实’的其他事物的混乱混合体。”
本文审查了 10 篇主要论文(并检查了另外 30 篇),发现零篇论文设有专门章节列出这些隐藏假设。他们只是展示魔术戏法(结果),然后说“看,它起作用了!”,却不承认他们假设宇宙遵循哪些规则。
3. “替代”错误
本文将当前的习惯称为“验证指标替代”。
类比:
想象一位汽车修理工说:“我修好了你的引擎,因为车启动了。”
- 错误: 修理工用结果(车启动了)替代了证明(我确切知道修了哪个部件,且没有其他因素能让车启动)。
- 现实: 车启动可能是因为电池自行充电了,或者修理工碰到了钥匙,或者引擎本来就没坏。
在人工智能论文中,研究人员报告诸如“忠实度”(解释是否与模型匹配?)或“完整性”(我们是否找到了所有部件?)等指标。本文认为,这些仅仅是“车启动了”的时刻。它们固然有益,但除非你陈述了使它们成为证明的假设,否则它们并非因果关系的证明。
4. 拟议解决方案:“披露协议”
作者建议该领域应借鉴计量经济学(经济数据研究)中的一条规则。在经济学中,如果你声称"X 导致 Y",你必须明确说明:
- 你的主张: “我们主张 X 导致 Y。”
- 策略: “我们使用方法 Z 来证明这一点。”
- 假设: “我们假设 [条件 A] 和 [条件 B] 成立。”
- 压力测试: “如果 [条件 A] 不成立,我们的结论就会崩塌。以下是我们如何测试其是否成立。”
类比:
医生不能只说“药起作用了”,而必须撰写一份报告:
- “我们主张这粒药降低了发烧。”
- “我们假设病人没有服用其他药物。”
- “我们假设发烧并非自然消退。”
- “如果病人确实服用了其他药物,我们的结论就是错误的。以下是显示他们未服用的数据。”
5. 审查发现
作者审视了该领域的 10 篇关键论文(涵盖电路发现和自编码器等不同方法),随后又检查了另外 30 篇。
- 结果: 30 篇论文中0 篇设有专门章节列出其识别假设。
- 结果: 大多数论文(根据严格程度不同,30 篇中有 19 至 26 篇)使用“验证指标”(如“人工智能的行为符合预期”)来替代证明其假设为真。
- 结果: 即使是那些最谨慎、能发现他人工作错误的论文,也未明确列出他们用于发现这些错误的假设。
总结
本文呼吁诚实与清晰。它并非说人工智能研究是错误的,而是说人工智能研究是不完整的。
目前,研究人员在说:“看,我们找到了原因!”
本文说:“请停下来,告诉我们你做出该主张所假设的规则是什么。如果你不告诉我们规则,我们就不知道你的‘原因’是真实的,还是仅仅运气好猜对了。”
它要求该领域从“看我们的魔术戏法多酷”转变为“这是戏法的确切运作方式,以及我们为何知道它不是戏法”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。