← 最新论文
💬 NLP

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

论文"Physics-R1"指出了现有多模态物理评估流程中的关键缺陷——具体包括数据污染、翻译漂移和多项选择题饱和——并通过发布经过严格审计的语料库以及一种在新型开放式奥林匹克基准测试上实现显著性能提升的新推理模型来解决这些问题。

原作者: Shan Yang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Shan Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能(AI)的世界就像一场规模宏大、 stakes 极高的烹饪比赛。目标是看哪些 AI“厨师”能解决复杂的物理问题(比如推算火箭如何飞行,或电流如何移动)。为了评判它们,比赛组织者给它们一套测试题。

你正在阅读的这篇论文,"Physics-R1",本质上是一份举报报告和一本新食谱。作者杨山(Shan Yang)认为,当前的烹饪比赛存在舞弊,因为测试题被污染了,而且评委存在偏见。以下是用通俗语言进行的拆解:

1. 问题所在:测试题被“泄露”了

想象一个学生正在准备数学考试。如果他不慎背下了老师用于期末考试的那本练习册里的确切答案,他就能拿到满分,但这并不意味着他真正理解了数学。

论文发现,许多 AI 模型正在做完全相同的事情。

  • “泄露”: 作者审计了用于训练这些 AI 的公开“训练池”(即练习册)。他们发现,许多用来给 AI 评分的测试题,实际上就隐藏在这些 AI 学习过的练习册中。

  • “改写”诡计: 这不仅仅是完全复制。有时,AI 看到的问题是“一个球从 10 米高处落下”,而测试题问的是“如果一个球体从 10 米高度掉落……"。旧有的计算机程序(用于检测作弊,寻找完全相同的词汇)错过了这些情况。

  • 新的审计: 作者构建了一个三阶段安全卫士

    1. 词汇计数器: 检查确切的词汇匹配。
    2. 含义扫描仪: 检查句子含义是否相同,即使词汇不同。
    3. 类人法官: 一个超级智能的 AI,它阅读练习题和测试题,并判断:“是的,这是同一个问题,只是换了个伪装。”

    利用这种方法,他们发现了数千个该领域此前遗漏的“作弊”配对。他们清洗了数据,创建了一个清洁训练集(称为PHYSCORP-A),迫使 AI 真正去学习,而不仅仅是死记硬背。

2. 翻译陷阱:语言很重要

想象你在参加驾驶考试。当指令使用你的母语时,你轻松通过;但当同样的测试被翻译成外语时,你却失败了,因为语法令人困惑,或者路标的描述方式不同。

作者用爱沙尼亚语(原始语言)和英语(翻译语言)的物理问题测试了这一点。

  • 结果: 一款顶级 AI(Sonnet 4.5)在原始爱沙尼亚语问题上得分为30.5%,而在英语翻译版本上仅为13.6%
  • 教训: 翻译复杂的科学问题往往会丢失细微的细节。如果我们只用英语测试 AI,我们可能会认为它们的物理能力比实际更差,或者我们实际上是在测试它们的翻译能力,而非物理能力。

3. 格式陷阱:多项选择 vs. 真实思考

想象一个学生非常擅长在多项选择题(A、B、C 或 D)中猜题,但当被要求在空白纸上写出解题过程时却僵住了。

论文发现,AI 的表现根据测试格式的不同存在巨大差距:

  • 多项选择(简单模式): 该 AI 在多项选择题测试中得分为79.7%
  • 开放式(困难模式): 同一款 AI 在必须从头写出答案的测试中,得分仅为33.4%
  • 差距: 这是一个46 分的差距。论文认为,该领域一直高估了 AI 的智能,因为它主要是在测试“简单模式”(多项选择),在那里 AI 可以猜测或识别模式,而不是测试“困难模式”(从头求解)。

4. 解决方案:新食谱(Physics-R1)

为了解决这些问题,作者没有仅仅指责他人,而是建立了一个新厨房。

  • 清洁的食材: 他们发布了一个经过审计的新数据集(PHYSCORP-A,保证不含“泄露”的试题)。
  • 新测试: 他们创建了一个更难的考试,名为PHYSOLYM-A。它使用 AI 从未见过的原始问题(主要来自爱沙尼亚和国际奥林匹克竞赛)。
  • 烹饪方法(Physics-R1): 他们使用一种特定的“食谱”(称为GSPO+DAPO的方法)训练了一个新的 AI 模型。
    • 他们没有给 AI 每一个微小步骤提供复杂、详细的分数(这可能会诱骗 AI 写出看起来华丽但错误的答案),而是使用了二元奖励
    • 类比: 这就像比赛中的裁判。裁判不再因为“姿势优美”或“字迹漂亮”而给分,裁判只说:“你得到正确答案了吗?是 = 1 分。否 = 0 分。”
    • 这个简单的规则迫使 AI 停止试图用华丽的格式来“钻系统空子”,而是真正专注于正确解决物理问题。

结果

当他们在新的、清洁的、高难度的考试中测试他们的新 AI(Physics-R1)时:

  • 与基础模型相比,它有了显著进步(分数从 8% 提升到 26%)。
  • 它击败了其他开源模型。
  • 它仍然落后于最好的闭源“超级 AI"(Sonnet 4.5),但它证明了通过清洁数据和正确的训练方法,开源模型可以学习真正的物理推理。

总结

这篇论文是对 AI 社区的行动呼吁:

  1. 停止作弊: 清洗你的训练数据,确保模型不是在死记硬背测试答案。
  2. 留意语言: 不要假设翻译是完美的;要用原始语言进行测试。
  3. 停止猜测: 在开放式问题上测试模型,而不仅仅是多项选择题。
  4. 保持简单: 有时,简单的“对/错”奖励比复杂的评分系统更能教会 AI 思考。

作者已发布了所有的“食材”(数据)、“食谱”(代码)和“考题”(基准测试),供任何人使用和验证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →