Position: Explainability Research Must Prioritize Foundations over Ad-hoc Methods
本立场文件认为,可解释人工智能(XAI)社区必须将其重心从开发临时性的技术转向解决基础性的结构性挑战——例如定义不明的问题表述以及集成流水线的缺失——以使解释能够有效地驱动现实世界中人机协同的行动。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你制造了一个超级聪明的机器人,它能预测天气、诊断疾病,甚至能写诗。它表现得非常出色,但它是一个“黑盒”:你按下按钮,它吐出一个答案,但你完全不知道它为什么选择那个答案。这就是人工智能(AI)的世界。为了破解这个谜团,科学家们创立了一个名为**可解释人工智能(Explainable AI, XAI)*的领域。你可以把 XAI 想象成一个翻译官,试图向我们人类解释机器人的秘密想法。我们拥有一些工具,可以高亮显示句子中哪些词最重要,或者照片中哪些像素让机器人认为那是“猫”。但问题在于,仅仅因为机器人能够*提供这种翻译,并不意味着这种翻译真的能帮我们做成任何有用的事情。我们需要知道这些解释是否值得信赖,它们是否符合机器人的真实大脑,以及最重要的是,它们是否真的能帮助我们做出更好的决策,或者在机器人出错时进行修复。
这正是这篇新论文所探讨的问题。作者认为,AI 界的现状是在错误的方向上进行马拉松。大家并没有致力于为“如何”以及“为何”去解释事物建立坚实的基础,而是在疯狂地发明各种华丽的“手电筒”(方法)来照亮这个黑盒。论文指出,虽然这些新式手电筒很酷,但由于我们甚至还没就“地图”长什么样达成共识,也没讨论过如何检查地图是否准确,或者拿到地图后该做什么,因此它们往往无法帮助我们在黑暗中航行。
“手电筒”问题
来自顶尖大学和科技公司的研究团队(即本文作者)研究了数百篇关于可解释人工智能的近期论文,并采访了数十位在实际工作中使用这些工具的人。他们发现了一个令人担忧的模式:这个领域痴迷于创造新的方法。事实上,他们分析的论文中,77% 只是在提议一种新的解释 AI 的方法,而只有 11% 费心给出了对“解释”这一概念的清晰且正式的定义。
这就像一群厨师试图发明新食谱,却从未就什么是“汤”达成一致。有人说汤必须是热的;有人说必须有胡萝卜;有人则只是把所有东西扔进锅里然后称之为汤。因为每个人使用的定义都不同,结果变得一团糟。一位研究人员可能会说他的方法是“忠实”的(意味着它如实反映了 AI 的行为),而另一位研究人员使用不同的测试标准,却说同一个方法是在撒谎。论文认为,我们陷入了一个边做边编的循环,而不是在建立一个可靠的系统。
四大缺失的支柱
作者表示,在我们继续发明新的手电筒之前,我们需要停下来建立四个特定的基础。他们称之为“四大挑战”:
1. 定义问题(什么是解释?)
目前,“解释”这个词被泛指于一切。有时它意味着列出重要的特征;有时它意味着 AI 对自己讲述的一个故事。论文认为,我们不应该靠猜。一个解释应该由其受众是谁以及他们需要用它做什么来定义。如果一名医生需要知道为什么患者被拒绝了保险,那么解释的内容必须与机器人工程师为了修复漏洞而需要的解释不同。如果没有一个清晰的定义,我们甚至无法开始衡量我们做得好不好。
2. 属性问题(什么是好的解释?)
我们需要达成共识。一个好的解释必须是“忠实的”——它必须真正匹配 AI 的行为,而不仅仅是看起来漂亮。但仅有忠实性是不够的。一个解释还需要具备“完整性”(它不应遗漏最重要的部分)和“鲁棒性”(如果稍微调整输入,它不应发生剧烈变化)。论文指出,许多现有方法在这些测试中都失败了。例如,某种方法在测试中表现优异,但在帮助人类做出决策时却失效了。作者建议,我们需要严格测试这些属性,而不仅仅是因为数学公式看起来很漂亮就假设它们有效。
3. 评估问题(如何测试它是否有效?)
这是最混乱的部分。论文发现,尽管 56% 的研究人员声称测试了其解释是否“忠实”,但很少有人真正与人类进行交流。在他们审查的论文中,只有 11% 包含了针对真实人类的研究。大多数研究人员只是运行计算机模拟或检查数值是否稳定。但如果人类无法理解或不信任一个解释,那么这个解释就是毫无用处的。作者认为,我们应该停止将解释视为一个数学问题,而应将其视为一种产品进行测试:它是否真的能帮助人类更好地完成工作?
4. 行动问题(拿到解释后要做什么?)
这是最大的差距。想象一下,医生得到了一个解释,说:“AI 认为这位患者患有一种罕见疾病,是因为其年龄因素。”很好,但医生接下来该做什么呢?他们可以改变 AI 的想法吗?他们可以要求进行更多测试吗?论文发现,38.2% 的从业者在将这些解释整合到实际工作流中时感到困难。目前,解释往往只是“展示并说明”的项目——你看一眼,然后就扔掉了。作者认为,解释应该是循环中的一部分,人类可以通过它提供反馈、修复 AI 并改进系统。否则,解释仅仅是一种装饰。
数据说明了什么
为了支持他们的观点,作者做了两件大事。首先,他们使用了一种 AI(大语言模型)阅读了来自 NeurIPS 和 ICML 等顶级会议的 617 篇论文。AI 发现,该领域几乎完全由“新方法”类论文驱动,而在定义和人类测试方面的关注极少。
其次,他们调查了 34 位真实的从业者——即那些在工作中实际使用这些工具的人。结果令人警醒:
- 困惑: 44.1% 的人表示他们不知道如何检查一个解释是否优秀。
- 选择瘫痪: 23.5% 的人承认他们不知道该选哪种方法,26.5% 的人不知道如何为所使用的工具选择正确的参数。
- “信任”陷阱: 虽然许多人表示这些工具帮助他们“信任”了 AI,但论文警告说,没有理解的信任是危险的。事实上,44.1% 的从业者表示,最大的挑战在于如何向那些真正需要做决策的人解释结果。
前行的道路
作者并不是说我们应该停止制造新工具,也不是说 XAI 永远坏掉了。他们是说我们需要改变优先级。与其急于制造第 100 个新式手电筒,我们更需要就地图的长相、如何精确绘制地图以及如何利用地图到达目的地达成共识。
他们为任何撰写可解释人工智能论文的人提出了一个简单的清单。在你发表之前,请问自己:
- 你定义了目标吗?(这是给谁用的?他们想做什么?)
- 你的主张是可测试的吗?(是否有人可以证明你是错的?)
- 你测试了忠实性吗?(它是否真的匹配 AI 的大脑?)
- 它有用吗?(它是否能帮助某人做出真正的决策?)
- 你进行了人类测试吗?(真实的人在真实情境下使用它了吗?)
论文总结道,如果我们开始关注这些基础,我们就能从“酷炫的科学实验”转向“可靠的工具”,从而真正实现人类与机器的协同工作。否则,我们可能只是在不断建造那些虽然光芒闪烁,却只会让我们原地打转的手电筒。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。