Rigorous Interpretation Is a Form of Evaluation
本文主张,当以可证伪且可复现的科学标准为基础时,严格的可解释性应从一种诊断工具提升为一种原则性的模型评估形式,以解决根本原因、检测细微故障,并预测超越表面性能指标的未来问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在招聘一位厨师。目前,我们评判厨师的方式是品尝最终的菜肴。如果汤好喝,我们就给高分;如果难喝,就给低分。这正是我们当前评估人工智能模型的方式:我们查看它们的输出(即它们给出的答案),并检查答案是对是错。
这篇论文的作者认为,这就像仅凭车速来评判一辆汽车,却从不打开引擎盖查看内部。两辆车可能跑得一样快,但一辆拥有强大可靠的引擎,而另一辆则是靠胶带和运气勉强拼凑在一起的。如果这辆“胶带车”遇到颠簸,即使它在平坦道路上跑得很快,也可能分崩离析。
论文提出,可解释性(深入模型内部观察其思考方式)不应仅仅成为满足好奇心的工具。相反,如果我们严谨地加以实施,它应成为一种新的、更深层次的评估模型的方法。
为了实现这一目标,作者指出可解释性必须满足三项“科学标准”,这类似于一名优秀侦探的工作方式:
1. 可证伪性:“你能证明我错吗?”测试
类比:想象一位机械师说:“这辆车坏了是因为这个特定的火花塞。”要相信这一点,你必须能够拔出那个火花塞,看看车子是否真的无法运行。如果你无法测试它,那这仅仅是一个猜测。
在论文中:
- 目标:当模型犯错时,我们希望知道为什么,以便修复根本原因,而不仅仅是修补症状。
- 问题:许多当前的人工智能解释就像模糊的猜测(“引擎感觉有点热”)。它们描述了发生了什么,但没有提供可验证的成因。
- 解决方案:我们需要能够提出具体主张并尝试证伪的解释。例如,“如果我们关闭大脑的这个特定部分,模型就会停止犯这个特定的错误。”
- 现实检验:论文指出,某些现有方法(如“稀疏自编码器”)尚不稳定。它们可能指向一个“火花塞”,但当你试图移除它时,车子依然能跑,或者修复措施破坏了其他部分。它们还不足以作为修复的唯一依据。
2. 可复现性:“它每次都能奏效吗?”测试
类比:想象一位侦探发现了一条线索,上面写着:“是管家干的。”但这条线索只有在管家戴着红帽子时才成立。如果管家戴的是蓝帽子,线索就消失了。那就不算真正的线索,只是巧合。真正的线索无论管家戴什么帽子都必须有效。
在论文中:
- 目标:有时模型会出于错误的理由给出正确的答案(例如,因为训练数据中医生通常是男性,所以猜测医生是“男性”,而不是因为它理解了这个职业)。我们希望在答案看起来正确时,也能捕捉到这些隐藏的偏见。
- 问题:如果我们的解释每次运行测试时都在变化,或者仅适用于某一种特定类型的问题,我们就无法信任它。
- 解决方案:我们需要稳定的解释。如果我们说“这个神经元是模型产生偏见的原因”,那么无论我们如何微调问题,该神经元在每次测试中都应表现出相同的行为。
- 现实检验:如果没有这一点,我们可能会以为发现了偏见,但实际上只是找到了一个随机故障。可复现性确保我们看到的是真正的“引擎”,而不仅仅是噪声。
3. 可预测性:“水晶球”测试
类比:一位优秀的机械师不仅仅在车坏掉后去修理;他们会查看引擎并说:“如果你把车开在泥泞路上,这个部件就会断裂。”他们会在故障发生前预测到它。
在论文中:
- 目标:我们希望在向公众发布模型之前,就能发现它会在哪里失败。我们希望在模型于现实世界中犯错之前,就了解其弱点。
- 解决方案:如果我们真正理解了模型“大脑”的布线方式(其内部几何结构),我们就可以预测:“这个模型在处理关于女性医生的问题时会遇到困难,因为它在记忆中混淆了‘医生’和‘男性’这两个概念。”
- 结果:这使我们能够在实验室中创建专门的“压力测试”来击垮模型,从而在它对现实世界造成问题之前修复它。
全局视角
论文总结道,目前大多数人工智能评估仅仅是记分(它是否答对了?)。
如果我们能让可解释性变得科学化(可测试、一致且具有预测性),它就会转变为机制层面的评估。这将使我们从询问“模型做了什么?”转向“模型是如何工作的,这种方式安全吗?”。
作者提供了一份“成绩单”(表 1),显示目前没有任何单一方法(如注意力图或探测法)能完美满足所有三项标准。它们都略微像一位擅长猜测但不擅长测试的机械师。论文的呼吁是构建更好的工具,使其真正通过这些科学测试,将人工智能解释从“锦上添花”转变为严格的安全检查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。