PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving
本文介绍了 PHYSICS,这是一个包含 1,297 道经专家标注的大学物理问题的综合性基准测试,该测试揭示出即便是 o3-mini 等最先进的基座模型在高阶科学推理方面仍面临困难,尽管采用了多种优化策略,其准确率仅为 59.9%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你建造了一支极其聪明、速度超快的机器人舰队。这些机器人几乎读完了图书馆里的每一本书,并且能比人类计算器更快地解决复杂的数学谜题。你想知道:这些机器人真的能像真正的物理学家那样思考吗?
这正是PHYSICS基准测试背后的研究人员想要探究的问题。他们不仅要求机器人解答简单的谜题,还给了它们一场物理学领域的“博士级期末考试”。
以下是他们实验的简要故事:
1. 考试:“终极物理测试”
研究人员创建了一项名为PHYSICS的新测试。你可以把它想象成一个巨大的数字题库,包含1,297 道难题。
- 题目从何而来? 它们并非由研究人员编造,而是取自真实的、极其严苛的资格考试,实际的物理学博士候选人必须通过这些考试才能成为专业科学家。
- 考什么? 它涵盖了物理学的六大核心领域:物体如何运动(力学)、原子如何行为(量子力学)、热与能量(热力学)、电与磁、光(光学)以及原子物理。
- 转折点: 与只需选择"A、B、C 或 D"的学校考试不同,这些问题是开放式的。机器人必须写出完整的解题过程,展示其推导步骤,就像人类学生一样。
2. 评分机器:“机器人教师”
如果没有人类阅读每一页,如何给机器人的数学作业评分?团队构建了一个极其严格的自动评分系统。
- 它使用一种名为SymPy的数字工具(可以把它想象成一个数学检查机器人)来验证机器人的答案在数学上是否正确,即使机器人的写法略有不同。
- 如果数学内容过于奇特,机器人无法自行检查,它会呼叫“备份教师”(一个更先进的人工智能)来阅读逻辑并判断其是否合理。
3. 结果:“机器人撞上了墙”
研究人员测试了当今最智能的 33 个 AI 模型,包括像o3-mini、GPT-4o和DeepSeek-R1这样的“冠军”模型。
记分牌:
- 最佳机器人: 即使是最聪明的模型o3-mini,也只答对了约**60%**的题目。
- 平均机器人: 其他大多数顶级模型的得分在**30% 到 40%**之间。
- 人类基准: 研究人员指出,如果给予足够的时间,人类专家通常能取得**70% 到 80%**的分数。
主要结论: 即使是最先进的 AI,在达到人类物理学专家的水平方面仍面临困难。它们就像背熟了教科书的学生,但当被要求将规则应用于棘手、真实的场景时,就会陷入困境。
4. 它们为何失败?(“错误大厅”)
研究人员仔细分析了机器人答错答案的原因。他们发现了五种主要的“坏习惯”:
- 编造规则: 有时,机器人会编造题目中不存在的事实。这就像学生猜测老师的想法,并添加不存在的额外规则。
- 忽视图片: 许多物理问题配有图表。机器人经常误读图片,认为导线以某种方式连接,而实际上是以另一种方式连接。
- “过度思考者”陷阱: 一些机器人试图思考得太深、写得太多,导致空间耗尽或被自己冗长的解释搞糊涂。它们在自身的推理中迷失了方向。
- 数学失误: 即使逻辑完美,它们也会在复杂的方程中犯简单的计算错误,就像人类在长数学题中打错字一样。
- 偏离重点: 有时,它们只是误解了问题的实际要求,完全回答了另一个问题。
5. 它们尝试过帮助吗?(“作弊条”实验)
研究人员尝试了一些技巧来帮助机器人表现得更好:
- 自我反思: 他们告诉机器人:“嘿,在提交之前检查一下自己的工作。”这起到了一点作用,使答案稍微更加一致。
- “谷歌”技巧(RAG): 他们允许机器人在工作时在线查找信息。这也帮助提高了分数,证明机器人有时只是需要快速提醒某个特定公式或事实。
然而,即使有了这些助手,机器人仍然无法完全缩小与人类专家之间的差距。
核心结论
PHYSICS基准测试向我们表明,虽然 AI 在数学和阅读方面表现出色,但解决深层、复杂的科学问题仍然是一个巨大的挑战。机器人就像非常快速的计算器,有时会忘记它们为什么要做这些数学运算。要让它们达到真正物理学家的水平,我们需要教会它们进行更深层的推理、更好地阅读图表,并停止编造事实。
这不仅仅关乎物理学;这是一个警钟:为了让 AI 真正帮助科学家,它必须在“像人类专家那样思考”方面变得更好,而不仅仅是“像机器那样计算”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。