← 最新论文
🤖 AI

LLMs as Acquisition Policies for Finite-Pool Materials Optimization: A Controlled Study

本研究表明,开源权重的大语言模型可以作为有限池材料优化的有效且无需训练的采集策略,其表现通常优于随机选择,并偶尔能与传统的高斯过程方法相媲美,尽管其可靠性在不同任务和呈现策略之间存在显著差异。

原作者: Dino-Rober Demir, Florian Le Bronnec, Rio Yokota

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Dino-Rober Demir, Florian Le Bronnec, Rio Yokota

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

寻找新材料是一个缓慢、昂贵且往往令人沮丧的过程。科学家需要寻找具有理想特性的特定元素组合,例如一种既极其坚固又轻盈的金属,或者一种能承受极端高温的陶瓷。传统上,寻找这些组合依赖于试错法,即在实验室中或通过复杂的计算机模拟,一次一个地测试成千上万种可能性。由于每次测试都要耗费时间和金钱,研究人员转向了一种称为“主动学习”的策略。这种方法使用计算机作为向导,通过观察以往测试的结果来决定下一个要尝试的单一候选对象。其目标是尽可能用最少的测试次数找到最好的材料,而不是在庞大的名单中盲目检查每一个选项。

多年来,这种引导的标准工具是一种被称为高斯过程的统计方法。可以将这种方法想象成一位正在绘制迷雾景观地图的制图师;它利用已知的少量点位来推测中间地形的形状,在探索未知区域与利用已知高点之间取得平衡。最近,一种名为“大语言模型”的新型人工智能进入了讨论范围。这些系统与能够通过学习海量文本来写故事、回答问题和解决谜题的强大系统相同。研究人员开始好奇,这些在训练过程中吸收了大量科学知识的模型,是否可以作为向导本身。大语言模型能否在看到一份潜在材料名单后,无需先建立统计地图,就能直接“知道”下一个该测试哪一个?

东京理化学研究所(RIKEN)计算科学中心的科研团队开展了一项受控实验,旨在回答这个问题。他们没有建造新的化学工厂,也没有进行物理测试;相反,他们使用了一种称为“回顾性基准测试”的方法。他们选取了四个已经过测试的材料现有数据集,并将其视为一个封闭的可能宇宙。在这种设定下,计算机程序被给予一份已知的初始结果列表和一个庞大的未测试候选池。任务很简单:尽可能快地在池中找到唯一的最佳候选对象。研究人员测试了五种不同的开源大语言模型,并将其与标准的统计向导以及完全随机的选择方法进行了对比。他们想看看语言模型是否能够从测试历史中学习,并独立做出明智的选择。

结果显示,大语言模型确实能够充当向导。在每一项任务中,模型找到最佳材料的速度都远快于随机猜测者。这是一个重要的发现,因为它证明了这些模型即使没有经过专门的针对性训练,也携带了有用的科学知识。它们可以观察哪些做法有效以及哪些做法无效,并利用这些信息来缩小搜索范围。然而,这些模型并未一致地胜过标准的统计向导。在四项任务中的三项中,传统方法仍然更快且更可靠。大语言模型仅在其中一项特定的任务中表现优于标准向导,而且即便如此,其结果也取决于使用了哪种模型以及信息是如何呈现给模型的。

研究还表明,信息的呈现方式对模型至关重要。当研究人员给模型提供带有类似“特征一”和“特征二”这类普通、匿名标签的候选名单时,模型的表现依然不错,但不如给出“铁”或“屈服强度”等实际科学名称时表现得好。这表明模型不仅仅是在处理数字,它们还在利用对现实世界的理解。当它们看到某种元素或物理属性的名称时,就能调用其训练所得的信息来做出更好的判断。然而,研究人员也发现模型存在一个弱点:它们倾向于选择出现在列表开头的项目。如果候选名单被重新排序,即使数据完全相同,模型也可能会选择不同的一个。这种“位置偏差”意味着模型并非完全一致,其表现会根据选项展示的顺序而改变。

为了管理名单的大小,研究人员尝试了一种不同的策略,称为“批次锦标赛”。他们不再一次性向模型展示数百个候选对象的整个列表,而是将列表分成较小的组,让模型选出每组的胜者,然后重复这一过程,直到只剩下一个胜者。这种方法有助于某些模型表现得更好,特别是在处理非常大的列表时,因为它防止了模型因同时面对过多信息而感到应接不暇。然而,即便有了这种改进,也没有任何一种模型或策略能每次都获胜。最佳方法完全取决于正在搜索的具体材料以及候选池的大小。

研究人员得出结论,虽然大语言模型是引导材料发现的一个极具前景的新工具,但它们尚未成为成熟统计方法的替代品。它们提供了一个有用的信号,可以加速搜索过程,尤其是在给予模型清晰的科学语境时,但它们缺乏传统工具的那种可靠性和一致性。这项研究强调,人工智能在科学领域的未来可能不在于取代旧方法,而在于寻找将两者结合起来的正确方式。这些模型展示了成为有用伙伴的潜力,但其表现对工作方式的要求非常敏感。随着该领域的发展,挑战将在于如何准确地呈现数据,以便让这些强大的工具能像使用它们的科学家一样可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →