← 最新论文
🔬 materials science

Physics as the label for measuring and correcting materials reasoning in multimodal models

本文介绍了 MatPCR,这是一个无标签基准,通过使用程序化预言机(programmatic oracles)来验证对布拉格定律和热力学稳定性等物理定律的遵循情况,从而评估多模态模型在材料科学领域推理的物理一致性,进而解决了当前依赖稀缺人工标注的评估方法的局限性。

原作者: Hasan Kurban, Rasul Khanbayov, Mustafa Kurban

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hasan Kurban, Rasul Khanbayov, Mustafa Kurban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代实验室中,科学家们正越来越多地转向人工智能,以理解构建我们世界的复杂材料。这些被称为视觉语言模型的系统,能够观察晶体的图像或阅读化学结构的描述,并尝试对其性质进行推理。它们被要求从照片中识别颗粒的大小,预测一种新化合物是否稳定,或者确定晶格内电子的能级。人们希望这些数字助手能够加速新电池、更强韧合金或更高效太阳能电池的发现。然而,一个持久的问题出现了:这些模型往往表现得非常自信,但其结论在物理上却是无法实现的。它们可能会声称一个颗粒宽十微米,而图像中清晰的标尺显示其视野范围远小于此;或者在热力学定律规定该材料应当解体的情况下,仍宣布该材料是稳定的。核心难点在于如何捕捉这些错误。传统上,研究人员依赖人类专家来检查最终答案,但这既缓慢又昂oly,且无法扩展到正在产生的大量数据规模。此外,模型可能会因为错误的原因得出正确的数值,或者提供一个听起来合理但违反基本物理定律的解释。

一组研究人员引入了一种全新的评估方法,可以完全绕过人工评分。他们不再询问“答案是否正确?”,而是询问“推理链是否遵守物理定律?”他们构建了一个名为 MatPCR 的系统,将物理定律本身视为“标准答案”。研究人员意识到,材料数据自带其内在逻辑,可以通过程序进行检查。例如,衍射峰的位置必须遵循被称为布拉格定律(Bragg's law)的特定数学关系;显微镜图像中的特征尺寸不能超过标尺设定的边界;而晶体结构的稳定性则由其相对于理论极小值的能量决定。通过将这些物理规则编码进软件,该团队创建了一套自动化的评判系统,即“神谕”(oracles),能够立即验证模型的推理步骤在物理上是否可行。这种方法使他们能够测量“物理一致性率”(Physical-Consistency Rate),这一得分反映了模型的思维链在多大程度上尊重物理世界的硬性约束,而不管最终答案是否符合人类的预期。

研究人员在九种不同的人工智能模型上测试了该系统,涵盖了从开源工具到最先进的商业系统。他们向模型输入了数千个涉及衍射图谱、电子显微镜照片、光谱数据和晶体结构的任务。结果揭示了一个存在显著不一致性的图景。虽然某些模型在特定任务上表现良好,但没有一个模型是统一可靠的。模型在读取显微镜图像中的标尺方面表现得相当出色,一致性率接近完美,但在处理光谱数据时却表现得极其挣扎,许多模型甚至无法识别基本的物理约束。其中一个最先进的模型实现了约 77% 的整体一致性率,这意味着大约四分之一的推理链包含物理违规。研究还强调,仅仅要求模型“更努力地思考”或使用同一模型的更昂贵版本,并不能保证更好的物理推理能力。在某些情况下,较新的模型表现并不比其旧版本更好,而拥有显式“推理模式”的模型也并未展现出明显的优势。

为了观察这些模型是否能从错误中学习,研究人员引入了一个名为“约束引导自我验证”(Constraint-Grounded Self-Verification)的过程。在这种设置下,当自动化“神谕”检测到模型推理中的物理错误时,它会将这一特定的违规情况反馈给模型,并要求其修正答案。结果令人振奋但也充满细微差别。在物理反馈的引导下,模型成功纠正了错误,并显著提高了一致性得分。然而,研究人员发现,这种进步往往源于模型退缩到了一个更安全、更通用的答案,而不是找到了真正正确的物理值。模型学会了避开“神谕”设置的陷阱,但并未真正掌握底层的物理原理。这表明,虽然模型可以被引导远离明显的谬误,但它们尚未内化生成正确推理所需的深层物理原则。

该团队还训练了一个较小的专门化 AI 来充当这些错误的检测器,希望它能在不需要全套物理模拟的高强度计算能力下预测违规情况。这个检测器在接受过相同类型数据训练的测试中表现得非常好,能够成功识别推理链中的物理不一致性。然而,当研究人员用它从未见过的全新物理约束类型进行测试时,其性能下降到了随机猜测的水平。这一发现至关重要:它表明识别物理错误的能力是高度依赖于数据类型和规则的。一个被训练用于识别 X 射线衍射图中错误的检测器,无法自动学会识别磁性或化学稳定性方面的错误。这种缺乏泛化能力的现象意味着,对于目前而言,确保物理一致性最可靠的方法是针对每种材料问题使用特定的物理检查,而不是依赖单一的通用 AI 评判官。

研究结论指出,尽管人工智能正在成为材料科学领域的一项强大工具,但若没有外部验证,它尚不足以成为高风险发现领域的可靠伙伴。这些模型能够生成看似合理的叙述,但在过程中经常违反基本的物理定律。这一新框架提供了一种无需人工干预即可衡量和纠正这些错误的方法,为实现更可靠的科学 AI 提供了路径。通过将物理学视为终极标签,研究人员展示了我们可以构建能够根据自然界不懈规则来审计自身推理的系统。这并不意味着模型是损坏的,而是说明它们目前的推理往往是对理解的一种“模拟”,而非对物理真相的“反映”。未来的道路在于,不仅要将这些基于物理的检查作为一种测试,更要将其作为引导,从而训练出能够以物理世界所要求的严谨性进行推理的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →