材料科学是研究原子如何排列以创造出我们周围固体物质的学科,从手机中的硅芯片到支撑桥梁的钢梁皆是如此。几十年来,科学家一直依赖复杂的计算机模拟来预测这些原子排列将如何表现,例如一种材料的硬度或其导电性能。这些模拟功能强大但速度缓慢,通常需要超级计算机才能运行单次计算。最近,一种被称为大语言模型的新型人工智能出现了。这些系统与能够通过学习海量文本中的模式来撰写文章、翻译语言和回答问题的系统相同。由于它们非常擅长理解语言,研究人员想知道,它们是否也能通过阅读对原子结构的描述来学习理解材料的“语言”并预测其特性,从而为传统的模拟提供一种更快速的替代方案。
一个研究小组着手测试这一想法,进行了一项大规模的新实验,旨在测试这些通用人工智能模型是否真的能理解晶体的科学。他们构建了一个全面的测试场,将其命名为 LLM4Mat-Bench,用以评估这些模型在被要求预测晶体材料物理特性时的表现。为了创建这个基准,他们从十个不同的公共科学数据库中收集了近两百万种不同的晶体结构。这些结构被转换为三种不同的格式,以观察哪种效果最好:简单的化学式、看起来像密集代码的详细晶体学文件,以及用纯英文句子描述原子排列。该数据集总共包含数十亿个单词和数字,涵盖了从能量水平到材料在压力下如何变形的四十五种不同属性。
随后,研究人员利用该数据集对各种人工智能模型进行了测试。其中包括专门为材料科学构建的模型,以及那些因具备对话能力而闻名的流行通用聊天机器人。他们要求这些模型使用不同的方法来预测材料属性:有些模型仅被给予少量示例进行学习,而另一些模型则被要求在没有任何先例的情况下进行猜测。结果揭示了一个清晰且令人惊讶的分野。那些规模小得多且专门针对科学数据进行训练的专业化模型,表现始终优于大型通用聊天机器人。事实上,这些专业化模型的规模分别比对话模型小约 200 倍和 64 倍,但仍取得了显著更好的性能。尽管通用模型在交谈方面表现出色,但它们经常无法产生有效的数值,往往会出现幻觉,或者在面对用于描述晶体的原始技术文件时陷入困境。
研究还表明,材料的描述方式至关重要。当研究人员向模型输入纯英文的晶体结构描述时,其表现与使用原始的代码类文件或简单的化学式相比有了显著提升。这表明,这些人工智能系统天生更擅长从人类语言中学习,而非从原始数值数据中学习。然而,即使使用了最好的描述,通用模型也难以达到专业工具的精度。研究人员发现,这些聊天机器人的最先进版本并不一定会因为接受了更多数据或参数的训练而在预测材料属性方面变得更好。在许多情况下,如果不针对特定任务进行专门训练,它们根本无法被信任去给出正确的科学答案。
最终,这项工作表明,虽然大语言模型在材料发现的未来具有巨大的潜力,但它们尚未准备好取代科学家目前使用的专业工具。通用模型擅长理解语言,但缺乏准确预测材料行为所需的深度、特定知识。研究人员得出结论,未来的道路在于创建专门针对科学预测而调优的模型,而不是依赖广泛的通用工具。通过提供一种测试这些模型的标准化方式,这一新基准为开发下一代能够真正加速新材料发现的人工智能提供了清晰的路线图,确保未来的工具既强大又可靠。
技术摘要:LLM4Mat-Bench
问题陈述
尽管大型语言模型(LLMs)在自然语言处理和各种科学领域取得了显著成功,但其在材料科学领域——特别是预测晶体材料性质方面——的应用仍缺乏标准化的评估。现有的基准测试(如 MatBench 和 TextEdge)存在范围有限、样本量较小以及材料表示多样性不足(例如缺失文本描述或晶体结构)的问题。这种缺乏全面、标准化基准的情况阻碍了对 LLM 在该领域能力的严谨评估,并减缓了开发有效预测模型的进程。
方法论
作者引入了 LLM4Mat-Bench,这是一个旨在评估 LLM 在材料性质预测方面表现的大规模基准测试。
1. 数据收集与构建:
- 来源: 数据聚合自 10 个公开的材料数据库,包括 Materials Project (MP)、Open Quantum Materials Database (OQMD)、JARVIS-DFT、hMOF、GNoME 等。
- 规模: 该基准测试包含约 198 万个唯一的晶体结构样本(经过去重和过滤后),总计 270 万个结构文件。
- 性质: 它涵盖了 45 种不同的性质,包括电子、弹性及热力学特征,共计 65 个任务(60 个回归任务和 5 个分类任务)。
- 输入模态: 基准测试为每个样本提供了三种不同的输入表示形式:
- 成分(Composition): 化学式(4.7M token)。
- CIF: 晶体信息文件(615.5M token)。
- 描述(Description): 使用 Robocrystallographer 生成的确定性晶体结构文本描述(3.1B token)。这种方法确保了文本具有人类可读性,并且与通用 LLM 的训练数据不同,以防止数据污染。
- 划分: 数据被随机划分为 80% 的训练集、10% 的验证集和 10% 的测试集。
2. 评估的模型:
研究基准测试了具有不同规模和架构的广泛模型:
- 特定任务预测模型:
- LLM-Prop: 一个基于 T5-small 的 35M 参数模型,在文本描述上进行了微调。
- MatBERT: 一个 109.5M 参数的 BERT-base 模型,在材料科学文献上进行了预训练。
- CGCNN: 在基准测试上从头开始训练的图神经网络(GNN)基线模型。
- 通用生成式 LLM(对话型):
- Llama(3B, 7B, 8B)、Gemma(7B, 9B)和 Mistral(7B)的变体。
- 这些模型通过 零样本(zero-shot) 和 少样本(5-shot) 提示进行评估,且未进行微调。
3. 实验设置:
- 指标:
- 回归: 真值平均绝对偏差(MAD)与预测平均绝对误差(MAE)之比的加权平均值(MAD:MAE)。比值越高表示性能越好(目标值 > 5.0)。
- 分类: 加权平均曲线下面积(AUC)。
- 协议: 实验是针对每个数据源分别进行的,以考虑到不同数据库之间计算方法(如 DFT 设置)的差异。
关键结果
1. 特定任务模型优于通用 LLM:
小型、特定任务的模型显著优于大型通用生成式 LLM。
- LLM-Prop 和 MatBERT 在大多数数据集上实现了最高的准确度(LLM-Prop 在 8/10 个回归数据集上表现最好;MatBERT 在其余 2 个上表现最好)。
- 尽管这两个模型比对话式 LLM 小 200 倍和 64 倍,但它们展示了更卓越的性能。
- 通用 LLM(Llama, Gemma, Mistral)深受**幻觉(hallucinations)**困扰,经常无法生成有效的属性值,或者对不同的输入输出相同的值。当输入为 CIF 文件时,这一问题最为严重。
2. 输入模态的影响:
- 文本描述: 与化学式或原始 CIF 文件相比,将晶体结构作为文本描述提供,对于基于 LLM 的预测器而言效果最好。这表明 LLM 更擅长从自然语言数据中学习。
- CIF 文件: 虽然 CIF 包含丰富的结构信息,但它们往往会导致对话模型输出无效结果。然而,在输出有效的情况下,CIF 输入通常优于简单的化学式。
- 描述长度: 基于 LLM 的模型在文本描述较短的数据集上表现出色,而 GNN 基线(CGCNN)在描述较长的数据集上表现更好,这可能是因为无论文本长短,CGCNN 都会利用完整的结构图。
3. 生成式模型缩放的局限性:
通过对比不同版本的 Llama、Mistral 和 Gemma(例如 Llama 2 与 Llama 3/3.1),研究发现,在更高质量的大规模数据集上进行训练并不一定能转化为材料性质预测能力的显著提升。即使是经过数万亿 token 训练的模型,在该特定领域的有效性和准确性上也仅显示出有限的增益。
4. 性质的可预测性:
与其它性质相比,能量性质(如形成能)在所有模型和数据集中的预测准确度始终较高,这与以往社区基准测试中观察到的趋势一致。
重要性与主张
论文将 LLM4Mat-Bench 定位为迄今为止评估 LLM 在材料性质预测方面最广泛的基准测试。其主要贡献在于:
- 标准化: 它提供了一个统一、可复现的框架,具有固定的训练-验证-测试划分和多样化的输入模态,解决了该领域缺乏标准化评估的问题。
- 经验证据: 研究证明,由于幻觉和领域适应问题,目前的通用 LLM 尚不足以取代用于材料性质预测的特定任务模型。
- 未来工作方向: 结果强调了开发专门针对材料科学的特定任务预测模型和指令微调 LLM 的必要性,而不是仅仅依赖于扩展通用基础模型的规模。
作者得出结论,虽然 LLM 在变革材料发现方面具有潜力,但该领域需要专门的基准测试和模型来克服当前的准确性和可靠性限制。
每周获取最佳 materials science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。