A Comparative Study of Counterfactual Explainers for Graph Neural Networks Enabling Multiple Types of Graph Edit
本文对六种最先进的图神经网络反事实解释器进行了全面的对比研究,通过在多样化的数据集和任务上评估其性能,以识别它们在生成最小且真实的图修改方面的各自优劣。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,人们对于理解机器如何做出决策的需求日益增长,尤其是当这些决策影响到现实生活时。想象一个计算机程序,它观察一个复杂的连接网络——比如不同药物之间相互作用的图谱,或者人们在社交网络中的联系——并预测一个结果。这些被称为图神经网络(graph neural networks)的程序功能极其强大,但它们通常像“黑盒”一样运作,只提供预测而不解释原因。为了解决这个问题,研究人员开发了一种称为“反事实解释”(counterfactual explanation)的方法。这种方法不仅仅是指出网络中的哪些部分对最终答案很重要,而是提出了一个“如果……会怎样”的问题:如果我们对网络进行最小且最符合现实的改动,会发生什么,从而导致一个完全不同的结果?例如,如果一个系统预测两种药物可以安全同时服用,那么反事实解释将精确展示:如果存在哪种新的连接,会导致系统预测会出现危险反应。这种方法通过展示控制其逻辑的精确“杠杆”,帮助医生、科学家和工程师信任机器。
希腊计算机科学研究所的一个研究小组最近致力于测试目前用于生成这类图网络“如果……会怎样”场景的最佳工具。他们关注的是新一代工具,这些工具不仅能删除连接,还能增加新的连接。这种既能增加又能删除链路的能力至关重要,因为现实世界的网络很少是固定不变的;它们在演化,而理解如何改变它们需要从两个方向进行观察。研究人员收集了六个用于此任务的最先进计算机程序,并对它们进行了一系列严格的测试。他们在各种数据上运行了这些程序,包括具有特定模式的人造合成网络,以及代表从化学分子到社交媒体帖子及科学引文等各类现实世界数据集的数据。其目标不仅是看哪个程序能找到答案,还要评判答案的质量:改动是否足够小以至于具有可信度?它是否真的改变了预测结果?以及计算过程是否耗时过长?
研究结果显示,并没有一个能在所有类别中都胜出的单一冠军。研究人员发现,解释的速度、改动的规模以及结果的可靠性之间存在着一种恒定的权衡。有些程序擅长寻找能够扭转预测的微小、极简的改动,但面对复杂的现实世界数据时,它们往往无法找到解决方案。另一些程序则非常可靠,几乎总能找到改变结果的方法,但它们建议的改动往往过于庞大且复杂,以至于人类无法理解或信任。有一个程序采用了受图像生成技术启发的方法,它非常彻底且能找到高质量的答案,但由于速度太慢,处理单个图结构竟然需要数小时,这使得它在许多应用场景下并不实用。还有一个程序速度极快且效率很高,但它产生的解释往往过于庞大,以至于失去了实用价值。
或许最令人惊讶的发现是,即使是最好的工具也难以聚焦于网络的正确部分。在合成测试中,研究人员清楚地知道是哪些连接模式导致了预测,但许多程序仍然会对网络中无关区域进行改动。它们会在远离关键模式的地方增加或删除边,实际上是在黑暗中盲目猜测,而不是精准定位真正的诱因。这表明,尽管这些工具在寻找“一个”解方面正在进步,但它们还无法一致地找到“正确的”解。研究人员还注意到,大多数现有工具主要是为分类整个网络(例如判断一个分子是否有毒)而设计的,但在被要求解释网络中单个节点(例如预测某篇特定研究论文的主题)的行为时,表现明显变差。
最终,这项工作为这个发展极快的领域提供了一次现实层面的审视。作者得出结论,虽然增加和删除连接的能力是向前迈出的一大步,但当前这一代的工具仍处于开发完善的过程中。目前还没有一种方法能提供速度、准确性和简洁性之间的完美平衡。这项研究强调,未来的研究需要超越仅仅寻找“任何”答案,转而专注于生成不仅正确而且具有意义且高效的解释。在一种能够一致识别出改变预测所需的精确、极简改动,且不会陷入复杂性或耗时困境的方法出现之前,这些强大人工智能系统的全部潜力仍将部分隐藏在不确定性的面纱之下。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。