GATTA: Graph Active Learning with Test-Time Augmentation
本文介绍了 GATTA,这是一个通过利用基于一致性过滤的测试时增强来生成可靠不确定性估计的图主动学习框架,证明了该方法能显著增强简单的采集策略,使其在具有更低计算开销的情况下超越复杂的集成方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,我们的世界很大程度上并非被映射为一份平铺的清单,而是被映射为一个巨大的连接网络。想象一个社交网络,其中的朋友彼此相连;或者一个科学数据库,其中的研究论文相互引用。为了理清这些错综复杂的网络,计算机使用一种特殊类型的人工智能,称为图神经网络(graph neural network)。这些系统非常擅长从关系的结构中学习,帮助我们预测从哪些分子可能治愈疾病,到信息如何在社区中传播的一切事物。然而,这些智能系统通常需要海量的标注数据才能有效地学习。在现实世界中,标注数据往往既缓慢又昂expensive,且需要人类专家。如果你试图在医疗记录中识别一种罕见疾病,或在金融网络中识别某种特定类型的欺诈,你不能简单地让计算机去猜测;你需要人类来验证答案。这造成了一个瓶颈:计算机已经准备好学习了,但人类却因为太忙而无法提供必要的示例。
为了解决这个问题,研究人员使用了一种称为主动学习(active learning)的技术。与其要求人类标注成千上万个随机示例,不如让计算机扮演一个好奇的学生,只针对它最困惑的具体信息进行提问。它会挑选网络中最不确定的节点,并请求人类对其进行标注,希望这仅有的几个新示例能带给它最多的教益。然而,挑战在于如何知道哪些节点是真正不确定的。在一个复杂的连接网络中,计算机的猜测可能会受到其邻居的影响,这使得很难判断机器是真的不确定,还是仅仅被数据的噪声所干扰。如果计算机选择了错误的示例进行标注,人类的努力就会白费,系统的学习速度也会变慢。
来自布达佩斯和鲁汶的一组研究人员引入了一种名为 GATTA 的新方法,全称是“基于测试时增强的图主动学习”(Graph Active Learning with Test-Time Augmentation)。他们的工作表明,有一种出人意料的简单方法可以让这些系统在了解自身“不知道什么”方面变得更加聪明。其核心思想借鉴了长期用于图像识别的一种技术:计算机观察一张图片,然后观察该图片的略微修改版本——比如调整了亮度或改变了角度——以观察其答案是否会发生变化。如果计算机对每一次细微的变化都给出不同的答案,它就知道自己是不确定的。如果它每次都给出相同的答案,它就是自信的。研究人员将这一概念适配到了图数据中,但加入了一个关键的转折。与图片不同(旋转图片并不会改变物体本身),改变图中的连接可能会从根本上改变数据的含义。如果你删除了社交网络中两个人的连接,计算机可能会突然认为他们是陌生人。
为了处理这个问题,GATTA 框架会在计算机试图决定询问什么的时候,生成许多个略有不同的图版本。然后,它会观察所有这些不同版本的答案。如果计算机在所有变体中都保持一致,它就知道该节点不值得询问。如果答案各不相同,它就知道该节点是一个适合人类标注的候选对象。但由于某些变化可能会意外地破坏数据的含义,研究人员添加了一个安全过滤器。这个过滤器会检查计算机的预测在不同版本之间是否保持一致。如果某个图版本导致计算机对某个节点的类别产生了完全不同的判断,该版本就会被视为不可靠而被丢弃。系统随后仅根据一致的版本来计算平均值,从而获得真实的确定性度量。
这种方法的成果在多种不同类型的网络中进行了测试,包括论文相互引用的引用网络,以及商品被共同购买的商品网络。研究人员发现,这种方法使得非常简单、快速的计算机策略能够表现得与那些专门为此设计的、更复杂且计算成本更高的复杂方法一样好,甚至更好。在许多情况下,这种简单的策略结合这种新的增强技术,使最终模型的准确率提高了几个百分点,这在机器学习领域是一个显著的提升。或许最重要的一点是,该方法无需更改底层计算机模型的架构或从头开始重新训练。它就像一个插件式的升级,可以应用于现有的系统中。
研究还揭示了改变后的图组的大小非常重要。研究人员发现,使用大约 500 个不同的图变体可以在速度和准确性之间达到最佳平衡。超过这个数量会带来收益递减的问题,而使用过少则无法提供足够的信息来识别出那些真正不确定的节点。他们还发现,当对图进行的修改足以挑战计算机的理解,但又不至于破坏数据的含义时,该方法效果最好。通过仔细调整这些因素,研究人员展示了从业者可以在显著降低计算成本的同时,获得高性能的结果。
这项工作表明,通往更好的图数据人工智能之路并不总是需要构建更复杂的算法。相反,可以通过让现有系统对不确定性更加稳健来实现。通过要求计算机从许多略微不同的角度来看待同一个问题,并过滤掉那些令人困惑的版本,系统学会了信任自己的怀疑。这使得人类专家能够将时间集中在最有价值的示例上,从而使整个教学过程更加高效。研究结果表明,对于许多现实世界的应用场景,一种简单、可靠的测量不确定性的方法,比一种复杂的理论化方法更强大,它为任何从事连接数据工作的人提供了一个实用的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。