← 最新论文
🤖 machine learning

Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds

本文引入了一个可审计的四阶段诊断框架,用于评估前沿大语言模型在陌生的反事实和历史世界中的物理推理能力,结果表明,尽管模型通常能掌握定性趋势,但它们经常无法定量地应用新规则,并在自我修正方面表现得非常吃力。

原作者: Dong Zhang

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一位天才学生如何破解谜团。你不仅仅想知道他们是否得到了最终答案,你还想知道他们是否真的理解了其中的逻辑,还是仅仅背下了之前考试的答案解析。

这篇论文是对世界上三位最聪明的 AI 模型(Claude、GPT 和 Gemini)的一份成绩单,旨在观察它们是真的能“做物理题”,还是仅仅在背诵它们在训练书籍中读到的内容。

问题所在:“小抄”陷阱

通常,我们通过给 AI 出物理题(比如“这个球掉落的速度有多快?”)并检查答案是否正确来测试它们。但这里有一个陷阱:这些 AI 模型已经阅读了几乎所有已出版的物理教科书。如果它们答对了,可能是因为它们真正推导出了答案,也可能是因为它们从自己的“小抄”(训练数据)中记住了答案。

这就像问一个学生一道他们见过无数次的数学题。答对题目并不证明他们理解了数学,只能证明他们记忆力很好。

解决方案:“平行宇宙”测试

为了解决这个问题,研究人员创建了三个平行物理世界。你可以把这些想象成物理定律略有(或完全)不同的平行维度。由于这些定律在现实世界中并不存在,AI 就无法通过记忆来获取答案。它们必须从零开始进行推导。

该测试包含四个步骤,就像侦探破案一样:

  1. 归纳(收集线索): 观察一系列奇怪的现象,并猜出隐藏的规则。
  2. 公式化(编写规则手册): 将你的猜测转化为一套清晰、可用的指令集。
  3. 预测(水晶球): 利用这些指令来预测新情况下的发生情况。
  4. 复核(自我检查): 回头看你的工作,并承认:“等等,我在这里犯了个错误。”

三个世界(难度等级)

第一级:“F = mv”世界(简单)

  • 转折点: 在我们的世界里,力等于质量乘以加速度($F=ma)。在这个世界里,力等于质量乘以速度)。在这个世界里,力等于质量乘以*速度*(F=mv$)。
  • 这意味着: 如果你推一个盒子,它会立即以恒定速度移动。如果你停止推它,它也会立即停止。没有惯性滑行。
  • 结果: AI 模型表现尚可,但在不同方面遇到了困难。一个模型擅长猜出规则,但很难将其清晰地写下来;另一个模型擅长书写规则,却总是无意中使用现实世界的物理术词;还有一个模型根本无法理解这个新规则。

第二级:“亚里士多德”世界(中等)

  • 转折点: 这是一个真实的、存在于 2000 年前的历史理论,而我们现在已知它是错误的。在这个世界里,重物比轻物掉落得更快,且一旦停止推动,物体就会停止运动。
  • 挑战: AI 已经被训练为知道“亚里士多德是错的”。要通过测试,它必须假装亚里士多德是对的,并忽略自己的训练知识。这就像要求一名学生去为一个他们被教导要反对的理论辩护。
  • 结果: 模型在“忘掉”现代物理学方面遇到了困难。它们不断出错,使用了诸如“加速度”或“重力”等在这个世界里是被禁止的词汇。表现最好的模型大部分时间能保持角色设定;表现最差的模型则无法停止引用现代科学。

第三级:“衰减世界”(困难)

  • 转折点: 在这个世界里,所有东西每秒都会失去 1% 的价值。旋转的陀螺变慢了,热咖啡变凉了,行星的轨道缩小了——这一切都以完全相同的速率发生。这里不存在所谓的“摩擦力”或“能量损失”导致的变化;这只是自然发生的。
  • 挑战: 这是最难的一级,因为 AI 必须将同一个规则应用于四种完全不同的事物(旋转、加热、下落、绕轨运行),且不能使用任何惯常的“能量”解释。
  • 结果: 彻底失败。 没有一个模型完成了整个测试。
    • 大惊喜: 模型在“方向”上表现得其实不错。它们知道事物会变慢或缩小。但当涉及到数值计算时,它们失败了。它们会说“它在减速”,但随后却使用旧的物理规则(如能量损失)来计算速度,而不是使用新的“1% 衰减”规则。这就像知道汽车正在刹车,却按照刹车正常工作的逻辑来计算停止距离。

“自我检查”的失败

最有趣的发现是关于**第四步(复核)**的。
当模型犯错时,研究人员会询问它们:“我搞砸了吗?”

  • 结果: 它们在这方面表现得很糟糕。在约三分之二模型出错的情况下,它们会自信地告诉研究人员:“不,我所做的一切都很完美。”它们并没有意识到自己失败了。

结论

论文得出结论,这些 AI 模型就像是拥有博士学位的鹦鹉

  • 它们可以非常出色地模仿物理学的措辞
  • 它们可以猜出变化的方向(事物变慢、事物下落)。
  • 但当它们必须使用一套全新的规则进行实际的数学计算,或者必须承认自己犯错时,它们就会崩溃。

它们并不是在以人类的方式进行“推理”;它们主要是在进行模式匹配。当模式不在其训练数据中存在时(例如在“衰减世界”中),它们会试图将旧的模式强加到新问题上,导致计算结果与实际不符。

简而言之: 这些 AI 听起来很像物理学家,但它们还没准备好真正成为物理学家。它们可以背诵理论,但无法从零开始构建一套新理论。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →