← 最新论文
🤖 machine learning

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

本文介绍了针对无机材料的可验证奖励基准 Mat-Pref,并证明了结合监督微调与群体相对策略优化(GRPO)的两阶段训练流水线,通过增强成分推理能力以及对未见结构族和性质的泛化能力,显著优于规模更大的零样本模型。

原作者: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一位才华横溢但缺乏经验的大厨烹饪一顿完美的佳肴。你拥有一个庞大的食谱库(训练数据),但这位大厨总是猜错食材,或者在指令中迷失方向。

这篇名为 MAT-PREF 的论文,讲述了如何教一种特定类型的“大厨”(人工智能)去解决涉及无机材料的复杂谜题——这些材料可以被视为制造新电池、太阳能电池板或计算机芯片的基础构建块。

以下是他们所做工作的简单解释:

1. 问题所在:大厨不会“推理”,只会“瞎猜”

研究人员想看看大型 AI 模型是否能够找出通过交换晶体结构中的一种成分(原子)来使其更强或更高效的最佳方法。

他们测试了世界上四位最聪明的“AI 大厨”(拥有 700 亿到 6710 亿个“脑细胞”的模型)。尽管这些模型规模巨大,但它们的正确率仅为 33% 到 54%

  • 类比: 这就像给一位天才做了一场多选题数学测试,但他们一直在乱选,因为他们只是根据单词的外观进行猜测,而不是在真正进行数学运算。他们还没有学会化学的“逻辑”。

2. 解决方案:一个新的“训练健身房” (MAT-PREF)

为了解决这个问题,团队建立了一个新的训练场,名为 MAT-PREF

  • 来源: 他们使用了一个庞大且可靠的化学事实数据库(Materials Project),其中的每一个答案都经过了超精确计算机模拟(称为 DFT)的验证。这就像拥有一个为每个问题都知道“确切正确答案”的老师。
  • 测试: 他们创建了超过 10,000 个问题。有些很简单(与 AI 在训练中看到的类似),有些很难(完全陌生的晶体形状),还有些很棘手(使用相同的形状,但询问不同的属性,例如“它阻挡多少光”而不是“它的稳定性如何”)。

3. 训练方法:成功的两步走

研究人员不仅仅是向 AI 喂入更多数据。他们使用了一个两步走的训练过程:

  • 第一步:监督微调 (SFT) —— “学习规则”
    首先,他们教会 AI 如何像化学家一样思考。他们提供了问题和正确的推理步骤示例(例如:“检查原子的尺寸”、“检查电荷”)。

    • 结果: AI 在遵循格式和理解逻辑方面变得更好,准确率从接近随机猜测提升到了约 45%。但它仍然不够稳定。
  • 第二步:GRPO (群体相对策略优化) —— “从错误中学习”
    这是核心秘诀。想象一下,AI 尝试回答一个问题 8 次。

    • 如果它答对了,它会得到一个“奖励”(甜头)。
    • 如果它答错了,它会得到一个“不”。
    • 然后 AI 会比较它的 8 次尝试。它会学习:“嘿,我在第 3 次尝试时选对了,但在第 7 次尝试时选错了。我应该停止选择第 7 次的结果。”
    • 结果: 这个过程迫使 AI 停止猜测,开始致力于实现正确的逻辑。

4. 结果:小厨师击败了巨头

经过这两步训练后,他们测试了一个相对较小的 AI 模型 (Qwen3-8B)。

  • 令人震惊的事实: 这个经过训练的小型模型得分达到了 65% 到 71% 的准确率。
  • 对比: 它以巨大的优势(超过 20 个百分点)击败了那些未经训练的、拥有 30 倍于它“脑力”的庞大“巨型”模型。
  • 成本: 他们完成所有这些训练的费用不到 50 美元

5. 为什么这很重要:一致性是关键

论文发现了一个关于 AI 如何进步的迷人现象。

  • 之前: AI 有时知道正确答案,但它就像一个虽然知道答案却不敢举手的紧张学生。如果你用稍微不同的措辞(干扰项)问同一个问题,AI 会在对与错之间反复横跳。
  • 之后: 训练让 AI 变得自信。它不仅找到了正确答案,还学会了坚持它。
    • 类比: 想想一个正在考试的学生。之前,即使逻辑相同,他可能会在第一个版本的题目上圈 A,在第二个版本上圈 B。训练之后,他每次都会圈 A,因为他真正理解了这个概念。

总结

论文表明,规模并不是一切。你不需要最大、最昂贵的 AI 来解决复杂的科学问题。相反,你需要一种智能的训练方法,利用经过验证的事实来教会 AI 如何进行逻辑推理并保持自信。通过使用这个新的“健身房”(MAT-PREF)和两步训练法,一个小型的 AI 学会了如何在构建更好材料方面超越那些巨头。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →