← 最新论文
🤖 machine learning

ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation

该论文介绍了 ChemDIRT,这是一个旨在通过系统地衡量其在多样化指令、分子表示以及八个不同任务类别中的性能和一致性,来评估面向化学的大型语言模型鲁棒性的全面基准测试。

原作者: Eric Inae, Tim Gunn, Chris Bond, Meng Jiang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Inae, Tim Gunn, Chris Bond, Meng Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,科学一直依赖计算机来协助解决问题,但最近出现了一种新型计算机程序,它们能够以惊人的流利程度阅读和书写人类语言。这些被称为“大语言模型”的程序经过海量文本训练,可以回答问题、编写故事,甚至解释复杂的概念。由于它们非常擅长处理文字,科学家们开始询问,它们是否也能理解化学语言。这一领域涉及理解被称为原子的微小粒子是如何粘合在一起形成分子的,以及这些分子在反应过程中是如何变化的。如果一台计算机能够真正理解化学,它就能帮助设计新药或发现新材料。然而,这里有一个陷阱:仅仅因为计算机对一个问题给出了正确的答案,并不意味着它理解了底层的科学原理。它可能只是根据问题的特定提问方式在进行猜测。

来自圣母大学的一个研究小组决定测试这些计算机程序究竟是真正具备深厚的化学理解力,还是仅仅擅长玩文字游戏。他们构建了一个名为 ChemDIRT 的新测试场,旨在观察这些模型在面对以不同方式呈现的同一个问题时表现如何。在现实世界中,化学家可能会用一串字母、一个化学名称,甚至是一张图画来描述一个分子。一个真正智能的系统无论使用哪种格式,都应该给出相同的正确答案。研究人员还想看看这些模型是否能处理不同类型的任务,从简单的原子计数到预测化学反应将如何展开。他们收集了涵盖八个不同化学推理类别的数千个示例,并测试了二十三个不同的计算机模型,其中包括开源程序以及由大型科技公司开发的程序。

结果显示出一种惊人的不一致性。当研究人员使用不同的措辞询问同一个化学问题时,计算机程序往往会给出完全不同的答案。对于一项涉及药物毒性的特定测试,改变问题的措辞会导致某些模型的准确率剧烈波动,有时甚至偏差超过百分之八十。在一个版本的测试中表现得像天才的模型,在面对意思完全相同的另一个版本时却表现得一败涂地。这表明许多程序根本没有在进行化学推理;相反,它们是在对提示词的具体形状做出反应。这就像是一个学生如果数字是用蓝墨水写的就能完美解决数学题,但如果同样的数字用红墨水写,他就会失败,尽管数学逻辑是完全一样的。

研究还发现,分子的表示方式与提问时使用的文字同样重要。化学家可以用一串字母、一个系统名称或一张视觉图表来描述同一个分子。研究人员使用这些不同的格式对模型进行了测试,发现程序经常会被这种变化所困扰。如果给予基于字母的描述,模型表现良好,那么在面对以视觉图表或正式名称展示的同一个分子时,它可能会表现得非常吃力。一些模型擅长在这些格式之间进行转换,而另一些则完全失败。这种不一致性意味着,模型在标准测试上的高分可能并不反映其对化学原理的真实理解,而更像是测试格式与模型训练数据之间的一次幸运匹配。

除了措辞和格式的问题外,研究人员还发现这些模型具有高度的专业化特征,并且经常在需要基础数值推理的任务上失败。虽然有些程序能够以令人印象深刻的准确度生成化学结构或预测反应结果,但在被要求计算分子量或平衡化学方程式等简单属性时,它们却经常出错。在好几个案例中,模型生成的数字极其错误,有时甚至偏差了数十亿倍以上。这表明,产生流利的文本或有效的化学字符串的能力,并不能保证计算机能够执行实验室中所需的实际计算。表现最强的通常是那些经过专门化学训练的模型,但即使是这些专门化系统,在任务或输入格式发生轻微变化时也会表现出明显的弱点。

研究人员得出结论,目前的计算机模型尚未展现出可靠且通用的化学推理能力。它们的表现过于依赖于接收到的具体指令以及信息的呈现格式。一个在单项测试中看起来功能强大的模型,在面对问题方式多样化的现实世界场景时可能是脆弱的。这项研究表明,要真正信任这些工具,科学家需要通过广泛的任务和格式来评估它们,而不是依赖于单一的、固定的测试。在这些模型能够一致地处理相同的问题(无论问题是如何提出的或数据是如何展示的)之前,它们仍然更像是复杂的模式匹配器,而非真正的科学推理引擎。未来的路径在于构建对这些变化具有鲁棒性的系统,确保当计算机说它理解化学时,它是真的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →