Robustness of Graph Self-Supervised Learning to Real-World Noise: A Case Study on Text-Driven Biomedical Graphs
本文引入 NATD-GSSL 框架,以全面评估图自监督学习在真实世界含噪文本驱动生物医学图上的表现,揭示特征重建与双向关系消息传递架构比关系重建或单向设计具有更强的抗噪性,最终实现较语言模型基线最高达 7% 的提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人理解医学的复杂世界。你有两种向它提供信息的方式:
- “完美图书馆”方法:你递给机器人一本 pristine(崭新)的、手写的百科全书,其中的每一个事实都经过专家图书管理员的双重核查。思想之间的联系是完美的。
- “嘈杂剪贴簿”方法:你给机器人一大堆原始的医学文章,并告诉它:“阅读这些,找出联系,并建立你自己的百科全书。”机器人会尽力而为,但它会犯错。它可能会将两个不相关的事物联系起来,遗漏重要的联系,或者混淆发音相似的词语。
本文是一项大型实验,旨在观察当使用“嘈杂剪贴簿”而非“完美图书馆”时,图自监督学习(GSSL)——一种“在没有教师的情况下教机器人从联系中学习”的时髦说法——的效果如何。
问题:“剪贴簿”很混乱
大多数先前的研究都在“完美图书馆”(干净、经过策划的数据)上测试了这些人工智能模型。但在现实世界中,我们往往必须从文本中构建自己的知识图谱,因为聘请专家来策划所有内容既太慢又太昂贵。
当你自动从文本构建图谱时,它会变得“嘈杂”。这就像一个剪贴簿,其中:
- 有些页面被撕掉了(缺失联系)。
- 有些页面被错误地粘在一起(错误的联系)。
- 有些单词拼写错误,或者以不同方式指代同一事物(重复)。
作者提出的核心问题是:如果我们把这份混乱的剪贴簿喂给聪明的人工智能,它还能学会理解医学术语吗?还是说这种混乱会破坏它?
解决方案:"NATD-GSSL"工具包
作者构建了一个名为NATD-GSSL的新工具包。你可以将其视为机器人剪贴簿的“建设与修复小组”。它按顺序执行三项任务:
- 构建图谱:它读取原始文本并创建初始的、混乱的联系。
- 优化图谱:它试图修复混乱。它可以添加缺失的联系(丰富化)或剔除错误的联系(清洗)。
- 教导机器人:它利用 GSSL 方法,教机器人基于图谱理解术语。
实验:并排竞赛
为了测试这一点,他们设置了一场“双图谱竞赛”。
- 选手 A:在嘈杂图谱(从文本自动构建)上进行训练。
- 选手 B:在干净图谱(专家策划的参考数据)上进行训练。
两位选手被赋予了完全相同的任务:术语分类。想象一下,有一列医学术语(如“干细胞疗法”)和一列类别(如“治疗”、“疾病”、“药物”)。机器人的任务是将术语归类到正确的类别中。
他们的发现(结果)
以下是主要结论,简单解释如下:
1. 并非所有学习任务都同等重要
本文测试了机器人学习的三种不同方式:
- 重构特征(“记忆”任务):机器人试图记住单词的含义。
- 结果:超级稳健。即使面对混乱的剪贴簿,机器人的表现几乎与拥有完美图书馆时一样好。这就像一个人即使照片有点模糊,仍然能认出朋友的脸。
- 重构关系(“联系”任务):机器人试图猜测事物是如何联系的(例如,“药物 X 治疗疾病 Y")。
- 结果:非常脆弱。当图谱嘈杂时,这项任务崩溃了。它需要一个组织完美的图书馆才能工作。如果联系混乱,机器人就会困惑。
- 对比学习(“比较”任务):机器人试图通过比较图谱的不同视图来找出什么是相似的、什么是不同的。
- 结果:困惑。令人惊讶的是,这种方法的表现实际上比根本不使用任何图谱、仅使用原始文本还要差。作者发现,该方法选择“负样本”(用于比较的对象)的方式,意外地教会了机器人将正确答案与其试图分类的术语推开。
2. 网络结构至关重要
人工智能的“架构”(内部设计)非常重要。
- 单行道:某些设计只查看传入的联系。这些设计在干净的图书馆中表现很好,但在混乱的剪贴簿中却失败了。
- 双行道:某些设计同时查看传入和传出的联系。这些设计在处理混乱、碎片化的剪贴簿时要好得多。即使路径在一个方向上断裂,它们也能找到信息。
3. 修复混乱:添加与减去
作者尝试修复嘈杂的图谱:
- 添加联系(丰富化):他们利用规则添加缺失的“是一种”联系(例如,添加“细胞疗法”是“疗法”的一种)。这有帮助。它使图谱不那么碎片化,并提高了性能。
- 剔除联系(清洗):他们利用人工智能删除错误的联系。这适得其反。虽然它消除了一些错误,但也切断了如此多的联系,以至于图谱变得过于稀疏和破碎,损害了机器人的学习能力。
- 结论:对于基于文本的嘈杂图谱,添加有益的联系比激进地删除错误联系更好。
底线
本文得出结论,我们可以成功地利用人工智能从混乱的、自动构建的医学图谱中学习,但我们必须小心如何教导它。
- 如果你想理解术语的含义,你可以使用带有正确学习方法(特征重构)的混乱图谱。
- 如果你想理解关系,你真的需要一个干净、经过策划的图谱。
- 对于混乱图谱的最佳方法是添加结构以填补空白,而不是试图完美地清理错误。
通过使用他们的新工具包(NATD-GSSL)和正确的策略,他们成功地将医学术语分类的准确率提高了7%(与仅使用基于文本的标准人工智能相比),证明只要懂得如何使用,即使是“嘈杂的剪贴簿”也能成为强大的老师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。