← 最新论文
🤖 AI

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

本文介绍了 Sci-PRM,这是一种感知工具的流程奖励模型,该模型是在新构建的 SCIPRM70K 数据集上训练而成的,旨在通过提供对工具使用的细粒度验证,并实现有效的测试时扩展和强化学习,从而增强科学推理能力。

原作者: Xiangyu Zhao, Hengyuan Zhao, Yiheng Wang, Wanghan Xu, Yuhao Zhou, Qinglong Cao, Zhiwang Zhou, Lei Bai, Wenlong Zhang, Xiao-Ming Wu

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangyu Zhao, Hengyuan Zhao, Yiheng Wang, Wanghan Xu, Yuhao Zhou, Qinglong Cao, Zhiwang Zhou, Lei Bai, Wenlong Zhang, Xiao-Ming Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在参加一场非常困难的科学考试的学生。你有一本教科书(你的知识)和一套专门的计算器及参考书(你的工具)。

问题所在:
目前的 AI 模型就像是擅长背诵事实但完全不会使用工具的学生。

  • 如果你问它一个简单的数学问题,它可能会答对。
  • 但如果你要求它在数据库中查找特定的化学反应或运行复杂的物理模拟,它经常会产生幻觉(hallucinate)。它可能会假装自己查到了数据,但实际上并没有;或者它写的代码看起来很正确,但实际上会导致计算机崩溃。
  • 现有的“老师”(AI 评判者)擅长检查最终答案,但不擅长在学生工作时进行监督。它们无法分辨学生是否使用了正确的计算器,或者是否只是在编造数字。

解决方案:Sci-PRM
论文作者构建了一种新型的“超级老师”,叫做 Sci-PRM。你可以把它想象成一位严格且高度专业的监考老师,坐在学生旁边,实时观察他们工作的每一个步骤。

以下是它的工作原理,使用简单的类比:

1. “工具链”训练数据 (The "Chain-of-Tool" Training Data)

为了教导这位超级老师,研究人员不仅仅是给它问题和答案。他们创建了一个庞大的17,800+ 个科学问题库,其中解决这些问题的“正确”方式涉及使用工具(例如搜索网页上的论文或运行代码脚本)。

  • 类比: 想象记录了数千小时专家解决问题的视频。这段视频不仅展示了最终结果,还展示了他们按下了哪个按钮、输入了什么代码以及他们如何解读结果。
  • 转折点: 他们还加入了“负面示例”——即人们犯错的视频,比如编写会导致死循环的代码,或者引用一篇虚假的科学论文。这教会了 AI 什么是不该做的。

2. 三步走的“监考”检查 (The Three-Step "Proctor" Check)

当 Sci-PRM 查看学生的工作时,它不仅仅是说“对”或“错”。它扮演着一个三部分组成的检查员角色:

  1. 你选对工具了吗?(例如:你是使用了生物数据库来查找蛋白质,还是不小心用了数学计算器?)
  2. 你正确使用工具了吗?(例如:你是否正确输入了化学式,还是漏掉了一个小数点?)
  3. 你理解结果了吗?(例如:工具给出了一个数字。你是正确解读了它,还是编造了一个与数据不符的故事?)

3. 为什么它比其他“老师”更好

论文将 Sci-PRM 与其他顶尖 AI 模型(如 GPT-5-Mini)进行了对比。

  • 差距: 当任务仅仅是“思考”(不涉及工具)时,其他模型表现出色。但一旦学生必须使用工具,其他模型的成绩就会显著下降。它们无法识别代码中的细微错误或虚假引用。
  • Sci-PRM 的优势: 即便涉及工具,Sci-PRM 依然保持敏锐。它可以在实际运行代码之前,就识别出“引用幻觉”(虚假的论文标题)或“逻辑错误”(会导致崩溃的代码)。
    • 类比: 其他老师必须等待学生完成整个实验并看到烧杯爆炸后,才知道错了。而 Sci-PRM 可以观察学生的计划并说:“停!你即将混合会爆炸的化学物质,”在事情发生之前就发出警告。

4. 它如何帮助 AI 学习(两种方式)

  • 方式 1:“N 选 1”筛选法 (Best of N Selection / Test-Time Scaling)
    想象 AI 学生被允许尝试解决同一个问题的 10 次。

    • 旧方法: 选择看起来最自信的答案。
    • Sci-PRM 方法: 它会审查所有 10 次尝试,检查推理和工具使用的每一步,并选出那个真正遵循规则且没有出错的尝试。这带来了更高的准确率。
  • 方式 2:强化学习的“教练” (The "Coach" for Reinforcement Learning)
    在训练 AI 变得更强时,它需要反馈。

    • 旧方法: AI 尝试,失败,最后只会被告知“错误”。它不知道自己具体在哪里错了。
    • Sci-PRM 方法: 它提供一种密集的奖励信号。它在每一个步骤之后都会给出“赞成”或“反对”。这有助于 AI 学得更快,并避免“优势消失”(vanishing advantage)问题(即 AI 因为不知道具体哪一步导致了失败而感到困惑)。

核心结论

论文声称 Sci-PRM 是一个让 AI 模型更加可靠的专门工具。它阻止了 AI 在使用外部工具时捏造事实或破坏代码。它通过扮演一个既理解科学逻辑又理解工具操作机制的逐步监督者来实现这一点。

关键要点: 这不仅仅是关于得到正确答案;而是关于证明你以正确的方式、使用正确的工具、且没有捏造事实地达到了目标。Sci-PRM 是第一个专门设计用于检查在复杂科学领域中这种“证明过程”的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →