← 最新论文
💻 computer science

MOLAR: Learning Multimodal Molecular Representations from Noisy Labels

MOLAR 是一个噪声感知框架,它通过将潜在的洁净属性推理与噪声标签观测分离,学习鲁棒的多模态分子表示,从而在训练数据包含损坏注释的情况下,仍能实现可靠的属性预测和可解释的诊断。

原作者: Yingxu Wang, Kunyu Zhang, Nan Yin, Yu Li, Eran Segal

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingxu Wang, Kunyu Zhang, Nan Yin, Yu Li, Eran Segal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一台计算机识别不同类型的分子,就像一位厨师通过观察来识别食材一样。通常情况下,你会给计算机一张分子的图片(图结构/Graph)和一段描述(文本/Text)。然后,计算机会尝试预测它的属性,比如“它是否有毒?”或者“它能否治愈某种疾病?”

问题在于,你提供给计算机的“标准答案”往往是混乱的。在现实世界中,科学家从实验室测试中获取这些答案,而这些测试可能存在不一致性,数据库中可能有错别字,或者自动化系统可能会出错。这就是论文中所说的**“噪声标签”(Noisy Labels)**。

如果你只是告诉计算机:“信任这个标准答案”,它就会把错误也一并背下来。它可能会学到某个无害的分子是有毒的,仅仅是因为某次实验室测试出现了故障。这就像一个学生用一本充满错误的教科书来备考:他们在练习题上能拿高分,但在真正的考试中却会失败。

解决方案:MOLAR

研究人员创建了一个名为 MOLAR(从噪声标签中学习多模态分子表示)的新系统。MOLAR 不再盲目信任混乱的标准答案,而是像一个聪明的侦探,负责将**真相(Truth)报告(Report)**区分开来。

以下是它的工作原理,我们使用简单的类比来解释:

1. “双证人”策略
MOLXAL 从两个维度观察分子:

  • 图证人(The Graph Witness): 观察分子的结构(原子是如何连接的)。
  • 文本证人(The Text Witness): 阅读描述和化学语言。
    通常情况下,这两位证人的意见是一致的。但如果标准答案说“有毒”,而图证人和文本证人都说“安全”,普通的计算机就会感到困惑。MOLAR 则意识到,如果两位证人都对“安全”达成共识,而标准答案却说是“有毒”,那么标准答案很可能是在撒谎。

2. “洁净室”与“嘈杂室”
大多数计算机试图直接拟合混乱的标准答案。MOLAR 的做法则不同:

  • 它建立了一个**“洁净室”(Clean Room)**,在这里,它根据图证人和文本证人的证据,试图弄清楚这个分子实际上是什么。
  • 然后,它有一个**“嘈杂室”(Noisy Room)**,在这里,它观察混乱的标准答案。
  • 至关重要的一点是,它在两个房间之间建立了一个**“翻译官”**(称为标签-观测通道/label-observation channel)。这个翻译官学习“洁净室”中的真相是如何被扭曲成“嘈杂室”中的错误信息的。它会问:“如果真相是‘安全’,那么实验室报告有多少次会由于失误而误报为‘有毒’?”

3. “信任分数”
因为 MOLAR 理解了噪声是如何产生的,所以它可以为数据集中的每一个答案分配一个**“信任分数”(Trust Score)**。

  • 如果图证人和文本证人的意见一致,且标准答案也与他们相符,那么信任分数就很高。
  • 如果证人们对某事达成共识,但标准答案却说了完全不同的内容,信任分数就会下降。系统会学会忽略那个特定的标准答案条目,转而依赖证人提供的证据。

研究发现

研究人员在两种挑战下测试了 MOLAL:

  1. 现实世界的混乱: 他们使用了一个庞大的数据集,其中的“训练”标签来自快速、带有噪声的实验室筛选,而“测试”标签则来自仔细、昂贵的确认性测试。MOLAR 在预测这些仔细测试结果方面的表现远优于其他方法,这证明它学习到的是真实的化学特性,而非噪声错误。
  2. 人为制造的混乱: 他们拿了一些干净的数据集,并故意反转了 30% 的答案(例如,告诉计算机一个安全的分子是有毒的,反之亦然)。即便面对如此严重的破坏,MOLAR 依然表现出色,而其他方法则表现崩溃。

核心启示

MOLAR 不仅仅是忽略坏数据,它还学习理解数据为什么是坏的。通过将“真相”(分子实际是什么)与“观测值”(实验室报告说了什么)区分开来,并通过权衡结构(图)和描述(文本)的证据,它即使在老师不可靠的情况下也能有效地学习。

论文结论指出,这种方法不仅能带来更好的预测效果,还能为科学家提供一种方式,让他们看到哪些数据点可能是错误的,以及分子的哪些部分(图)或描述(文本)提供了最可靠的证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →