Rule of Thumb: Explaining Artificial Intelligence Systems using Partial Information
本文介绍了“经验法则”(Rule of Thumb, RoT),这是一种新颖、与模型无关且计算高效的可解释人工智能框架,它能够识别针对特定预测的最相关特征,从而在符合人工智能法规的同时,有效地支持零样本大语言模型分类、不透明系统审计以及科学发现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚为什么一个神秘的、无所不知的机器人做出了某个特定的决定。也许它拒绝了你的工作申请,或者它判定一张照片是猫而不是狗。这个机器人是一个“人工智能”(AI),在计算机科学领域,我们把理解其大脑的过程称为“可解释人工智能”(XAI)。一个大问题是,许多现代 AI 都是“黑盒”。我们可以输入数据并得到答案,但无法窥视内部的齿轮是如何运转的。长期以来,科学家们尝试通过用不同的输入去“戳”机器人来解决这个问题——比如改变句子中的一个词或照片中的一个像素——观察答案会如何变化。这被称为“敏感性分析”。这就像是试图通过用锤子敲击一个锁着的保险箱并观察门是否会晃动来了解它。但如果保险箱太重敲不动,或者敲击会损坏机器人怎么办?这正是这篇论文中介绍的新方法所要解决的问题,它提供了一种更聪明、更快且更少破坏性的方式,无需掌握万能钥匙即可窥视黑盒内部。
这篇论文介绍了一种解释 AI 的新方法,称为**“经验法则”(Rule of Thumb,简称 ROT)**。把旧的解释 AI 的方法想象成一名侦探,他必须运行成千上万个虚构的情景来弄清楚什么才是重要的。如果侦探想知道“鞋子”是否对决策很重要,他必须想象一个没有鞋子的世界,然后有鞋子的世界,然后不同鞋子的世界,并观察每次决策的变化。这既耗时又昂贵,尤其是如果这位“侦探”必须要求一个巨大的、昂贵的云端计算机(比如大语言模型)为每个场景运行一次测试。
ROT 颠覆了这种逻辑。与其问“如果我改变这个会发生什么?”,ROT 问的是“仅仅知道这个已经能在多大程度上告诉我们答案?”这就像一位厨师在品尝汤的味道。他不需要先加盐,再拿出来,再加更多盐来观察味道的变化,厨师只需尝一勺,就能说:“啊,盐是这里的主要风味。” ROT 查看 AI 已经看到的数据,并计算哪些信息片段对最终结果最具“预测性”。它基于它发现的模式,构建了一个简单、易懂的地图,展示了 AI 的思考过程,而无需破坏 AI 或要求它运行数百万次新的测试。
作者在三种其他方法通常会失败的棘手情况下测试了这种“经验法则”。首先,他们将其应用于表现得像魔法一样的大语言模型(LLMs):你向它们提问,它们立即回答,但你无法触碰它们的内部代码。旧方法必须向 AI 提出成千上万个额外问题才能弄清楚它为什么那样回答,这既慢又贵。然而,ROT 通过观察 AI 已经给出 的答案,在几秒钟内就找出了重要的词汇。在一次涉及机器人阅读法律判例的测试中,ROT 能够高亮显示关键句子,其结果与人类律师的选择相匹配,但对于第一个解释之后的每一次新解释,它的速度比次优方法快了 1300 万倍。
其次,论文研究了审计秘密 AI 系统的情况,例如亚马逊的产品推荐引擎。通常,为了检查一个秘密的 AI 是否存在偏见或故障,科学家会构建一个“模仿者”机器人——一个行为与真实机器人相似的虚假版本——然后研究这个虚假版本。但作者发现了一个问题:如果你构建了两个行为都与真实机器人相似的虚假机器人,它们可能会对决策的原因给出完全不同的解释。这就像是询问两个不同的人关于一个你看不见的规则的游戏,他们可能对得分的判断都正确,但对规则的理解却各不相同。这使得审计变得不可靠。ROT 跳过了虚假机器人,直接观察真实 AI 过去的决策并寻找真相。在他们的测试中,当虚假机器人在争论哪些特征重要时,ROT 始终如一地表明亚马逊的系统在严重偏袒“由亚马逊销售”的产品,而这正是虚假机器人错过或产生争议的隐藏偏见。
最后,研究人员将 ROT 测试用于科学发现,即 AI 被用于发现关于世界的各种新事实,比如是什么导致了糖尿病。在这里,危险在于 AI 可能会被“诱饵”线索所误导。想象一个试图预测降雨的机器人,但有人偷偷添加了一个感应器,只要下雨该感应器就会发出鸣响。标准方法可能会认为鸣响的感应器导致了降雨!作者创造了一个用误导性的“伪特征”来欺骗 AI 的场景。旧方法被骗了,指向了这些诱饵,但 ROT 正确地忽略了噪声,仅指向了真实的、重要的因素。它证明了 ROT 更难被欺骗,并且能更好地找到支配数据的真实“经验法则”。
论文总结道,ROT 是一个游戏规则改变者,因为它不需要看到 AI 的大脑,不需要通过破坏 AI 来进行测试,也不需要构建一个虚假的副本来进行研究。它是一个快速、与模型无关的工具,即使在 AI 是封闭黑盒的情况下也能发挥作用,使其成为监管者、科学家以及任何想要了解机器为何做出决策的人手中的强大新工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。