← 最新论文
💬 NLP

SupraBench: A Benchmark for Supramolecular Chemistry

本文介绍了 SupraBench,这是首个旨在评估大语言模型在基础超分子化学任务(如结合亲和力预测和主客体推理)方面的基准测试,并同步发布了一个专门的 16M token 语料库(SupraPMC)以支持领域适应。

原作者: Tianyi Ma, Yijun Ma, Zehong Wang, Weixiang Sun, Ziming Li, Connor R. Schmidt, Chuxu Zhang, Matthew J. Webber, Yanfang Ye

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyi Ma, Yijun Ma, Zehong Wang, Weixiang Sun, Ziming Li, Connor R. Schmidt, Chuxu Zhang, Matthew J. Webber, Yanfang Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个定制的锁与钥匙系统,但使用的不是金属,而是微小的、肉眼看不见的分子。这就是**超分子化学(Supramolecular Chemistry)**的世界。这就像一场高风险的“锁与钥匙”游戏,其中一个“宿主(Host)”分子试图抓住特定的“客体(Guest)”分子,以完成某些有用的工作,比如递送药物或清理毒素。

目前,弄清楚哪把锁匹配哪把钥匙的过程极其缓慢且昂贵。科学家们不得不运行大规模的计算机模拟,仅仅为了一个分子对可能就需要耗费数天时间,或者在真实的实验室里构建它们则需要更久。

**人工智能(大语言模型或 LLM)**应运而生。科学家们曾希望这些 AI 聊天机器人能充当超级快速的助手,能够瞬间预测哪些锁能匹配哪些钥匙。但直到现在,还没有人制定过一个标准化的“驾驶员考试”,来测试这些 AI 司机究竟是真的精通化学,还是仅仅在瞎猜。

这就是这篇论文的意义所在。作者们创建了 SUPRABENCH——这是针对该特定领域 AI 的第一个官方“驾驶员考试”。

测试过程:SUPRABENCH

你可以将 SUPRABENCH 想象成一场驾驶考试,包含五个具体的挑战,用以测试 AI 处理化学之路的表现:

  1. “有多强?”测试(结合亲和力): 如果你给 AI 一张锁和钥匙的图片,它能否准确猜出它们握手握得有多紧?(这是药物设计中最重要的一项测试)。
  2. “最佳匹配”测试(顶端结合剂选择): 如果你向 AI 展示一把锁和四把类似的钥匙,它能否选出最匹配的那一个?
  3. “环境”测试(溶剂识别): 化学反应发生在不同的“液体”中(如水、酒精或油)。AI 能否通过观察锁和钥匙,猜出它们正游在什么样的液体里?
  4. “解释它”测试(宿主-客体描述): AI 能否用通俗易懂的英语解释为什么一把锁和一把钥匙能够契合在一起?
  5. “画出来”测试(分子识别): AI 能否观察一个二维分子图,并正确地打出它的化学名称代码?

为了帮助 AI 备考,作者还发布了一个包含 1600 万词化学文章的庞大库(称为 SUPRAPMC),这本质上是 AI 可以阅读以学习规则的“教科书”。

测试结果:AI 只是个新手司机

研究人员在这次考试中测试了八种不同的 AI 模型(有些是免费的,有些是昂贵的)。以下是他们的发现:

  • “大孩子”虽然领先,但仍会跌跤: 最先进、最昂贵的 AI 模型(如来自 Google 和 OpenAI 的最新版本)表现最好。然而,它们仍然答错了许多问题。AI 的能力与人类专家之间仍然存在巨大的差距。
  • “学习窍门”并不总是奏效:
    • 少样本学习(Few-Shot,即展示示例): 给 AI 提供一些如何回答的例子有助于它更好地进行解释,但实际上却让它在预测结合强度方面表现得更差。这就像给一个学生看一道数学题的范例,这有助于他们写好作文,但在尝试解一道新方程时却让他们感到困惑。
    • 思维链(CoT,即逐步推理): 要求 AI “展示其推导过程”或逐步解释其推理逻辑似乎是个好主意。但在化学领域,这却适得其反。AI 开始自信满满地编造一些完全错误的看似合理的知识。这就像一个学生为了让自己听起来很聪明,而自信地写下一个错误的公式。
  • 阅读“教科书”有帮助(但也有代价): 当他们在新的化学教科书(SUPRAPMC)上训练 AI 时,AI 在预测结合强度(数学部分)方面变得更好了。然而,它在遵循严格的格式规则(例如在多选题中选择正确的字母 A、B、C 或 D)方面却变差了。它学会了科学知识,却忘记了考试规则。
  • “绘画”问题: 当被要求观察一张图并写出化学代码时,AI 通常能掌握大致轮廓(“骨架”),但经常会在微小的细节上出错(原子之间的特定连接)。这就像是能认出一辆汽车,却把轮子画在了车顶上。

核心结论

论文得出结论:虽然 AI 在化学领域正在进步,但它尚未准备好取代人类专家或独立运行实验室。其“推理”差距是真实存在的:AI 可以听起来非常自信,但往往缺乏获得准确数值所需的深度、具体的知识。

作者希望通过发布这项测试(SUPRABENCH)和这本教科书(SUPRAPMC),能让其他研究人员在未来构建出更好、更可靠的化学 AI。他们实际上是在说:“这是我们用来衡量进步的尺子,也是帮助你们达标的学习指南。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →