← 最新论文
🔬 materials science

LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction

本文介绍了 LLM4Mat-Bench,这是迄今为止规模最大的基准测试,包含 190 万个晶体结构和跨多种输入模态的 45 种性质,旨在系统地评估并揭示通用型及特定任务型大语言模型在预测材料性质方面的局限性。

原作者: Andre Niyongabo Rubungo, Kangming Li, Jason Hattrick-Simpers, Adji Bousso Dieng

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Andre Niyongabo Rubungo, Kangming Li, Jason Hattrick-Simpers, Adji Bousso Dieng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

材料科学是研究原子如何排列以创造出我们周围固体物质的学科,从手机中的硅芯片到支撑桥梁的钢梁皆是如此。几十年来,科学家一直依赖复杂的计算机模拟来预测这些原子排列将如何表现,例如一种材料的硬度或其导电性能。这些模拟功能强大但速度缓慢,通常需要超级计算机才能运行单次计算。最近,一种被称为大语言模型的新型人工智能出现了。这些系统与能够通过学习海量文本中的模式来撰写文章、翻译语言和回答问题的系统相同。由于它们非常擅长理解语言,研究人员想知道,它们是否也能通过阅读对原子结构的描述来学习理解材料的“语言”并预测其特性,从而为传统的模拟提供一种更快速的替代方案。

一个研究小组着手测试这一想法,进行了一项大规模的新实验,旨在测试这些通用人工智能模型是否真的能理解晶体的科学。他们构建了一个全面的测试场,将其命名为 LLM4Mat-Bench,用以评估这些模型在被要求预测晶体材料物理特性时的表现。为了创建这个基准,他们从十个不同的公共科学数据库中收集了近两百万种不同的晶体结构。这些结构被转换为三种不同的格式,以观察哪种效果最好:简单的化学式、看起来像密集代码的详细晶体学文件,以及用纯英文句子描述原子排列。该数据集总共包含数十亿个单词和数字,涵盖了从能量水平到材料在压力下如何变形的四十五种不同属性。

随后,研究人员利用该数据集对各种人工智能模型进行了测试。其中包括专门为材料科学构建的模型,以及那些因具备对话能力而闻名的流行通用聊天机器人。他们要求这些模型使用不同的方法来预测材料属性:有些模型仅被给予少量示例进行学习,而另一些模型则被要求在没有任何先例的情况下进行猜测。结果揭示了一个清晰且令人惊讶的分野。那些规模小得多且专门针对科学数据进行训练的专业化模型,表现始终优于大型通用聊天机器人。事实上,这些专业化模型的规模分别比对话模型小约 200 倍和 64 倍,但仍取得了显著更好的性能。尽管通用模型在交谈方面表现出色,但它们经常无法产生有效的数值,往往会出现幻觉,或者在面对用于描述晶体的原始技术文件时陷入困境。

研究还表明,材料的描述方式至关重要。当研究人员向模型输入纯英文的晶体结构描述时,其表现与使用原始的代码类文件或简单的化学式相比有了显著提升。这表明,这些人工智能系统天生更擅长从人类语言中学习,而非从原始数值数据中学习。然而,即使使用了最好的描述,通用模型也难以达到专业工具的精度。研究人员发现,这些聊天机器人的最先进版本并不一定会因为接受了更多数据或参数的训练而在预测材料属性方面变得更好。在许多情况下,如果不针对特定任务进行专门训练,它们根本无法被信任去给出正确的科学答案。

最终,这项工作表明,虽然大语言模型在材料发现的未来具有巨大的潜力,但它们尚未准备好取代科学家目前使用的专业工具。通用模型擅长理解语言,但缺乏准确预测材料行为所需的深度、特定知识。研究人员得出结论,未来的道路在于创建专门针对科学预测而调优的模型,而不是依赖广泛的通用工具。通过提供一种测试这些模型的标准化方式,这一新基准为开发下一代能够真正加速新材料发现的人工智能提供了清晰的路线图,确保未来的工具既强大又可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →