DiscoverPhysics: Benchmarking LLMs for Out-of-the-Box Scientific Thinking
本文介绍了 DiscoverPhysics,这是一个包含 22 个具有非标准物理规律的模拟世界的交互式基准,旨在通过设计实验和推断底层规律来评估前沿大语言模型进行长程科学推理的能力,研究结果表明,尽管顶级模型展现出潜力,但它们在揭示潜在结构方面仍面临困难,且预测准确性并不能保证概念性理解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言、类比和隐喻对论文《DiscoverPhysics》的解释。
核心理念:AI 能成为真正的科学家吗?
想象一下,你把一个智能 AI 扔进一个物理规则完全虚构的视频游戏宇宙中。也许重力会随着距离增加而减弱,或者可能存在看不见的“幽灵”粒子在暗中牵引物体。
这篇论文的研究人员想知道:AI 能否仅通过在这个虚构宇宙中“玩耍”,就找出其中的规则?
他们创建了一个名为DiscoverPhysics的基准测试。这就像给 AI 的一场“期末考试”,但与其让 AI 背诵教科书中的事实(例如“牛顿第二定律是什么?”),不如让它从零开始发明定律。
测试如何运作:“黑盒”游戏
把 AI 想象成一名侦探,而宇宙则是一个充满谜团的密室。
- 设置: AI 被投入一个模拟世界。它无法看到“源代码”(实际的数学规则),只能看到粒子在移动。
- 工具: AI 拥有一根“魔法棒”(一个 N 体模拟器)。它可以说:“我想从这里以这个速度发射一个粒子”,模拟器会告诉它粒子最终会落在哪里。
- 过程:
- AI 发射几个粒子并观察它们的运动。
- 它提出一个假设:“也许重力遵循 的规律?”
- 它测试这个假设。如果粒子的运动不符合预测,AI 就必须改变想法。
- 它重复这个过程多轮,设计更聪明的实验来识破宇宙的伪装。
- 期末考试: AI 必须提交两样东西:
- 故事: 用通俗英语解释这个世界是如何运作的。
- 代码: 一个能精确预测任何粒子去向的 Python 程序。
评分 AI 的两种方式
研究人员意识到,仅仅数学正确是不够的。在真正的科学中,你需要理解事物为何发生,而不仅仅是预测它们。因此,他们从两个方面对 AI 进行评分:
- “水晶球”得分(预测准确性): AI 的代码能否预测粒子会落在哪里?如果 AI 说“球会落在这里”,而它确实落在那里,它就得分。
- “教师”得分(概念理解): 一位人类专家(以及充当教师的第二个人工智能)阅读 AI 的故事。AI 是否真正理解了隐藏的规则?
- 例子: 如果这个世界有看不见的“暗物质”在牵引物体,但 AI 只是说“重力比平时强”,它的得分就会很低。它碰巧算对了数学,但错过了概念。
他们的发现
他们测试了 11 个最先进的人工智能模型(包括来自 OpenAI、Anthropic 和开源社区的顶级模型)。以下是发生的情况:
1. 最“聪明”的 AI 依然挣扎
即使是最好的 AI,也仅通过了约**50%*的宇宙测试。它们擅长记忆事实,但当需要发现*新规则时,它们就会陷入困境。
2. “隐藏陷阱”问题
当宇宙存在隐藏结构时,AI 最容易失败。
- 类比: 想象你试图弄清楚为什么一辆车在减速。如果你只看引擎,你可能会猜测刹车坏了。但如果路下有一个巨大的磁铁(隐藏的暗物质)在把车往后拉,除非你寻找磁铁,否则你找不到答案。
- AI 不断试图用标准规则(如正常重力)来解释运动,并拒绝相信涉及“幽灵粒子”或额外维度。
3. 数学好 理解好
一个模型(GPT-5.5)在预测粒子落点方面表现出色(误差低),但它对原因的解释往往是错误的。这就像一个背下了答案键但没理解课程的学生。
另一个模型(Claude Opus)在理解概念方面做得更好(例如意识到时间在改变规则),即使它的数学预测稍欠完美。
4. “猜测”与“实验”之间的差距
研究人员测试了 AI 是否真的在设计好的实验,还是仅仅在对着靶板乱投飞镖。
- 引导模式: AI 选择在哪里发射粒子。
- 随机模式: 计算机随机发射粒子,AI 只是观看。
- 结果: 顶级 AI 在能够自主选择实验时表现要好得多。它们学会了提出正确的问题。然而,许多开源模型在两种模式下的表现同样糟糕,这表明它们并没有真正在“思考”实验;它们只是在猜测。
结论
该论文得出结论:虽然 AI 在解决物理问题方面变得越来越出色,但它仍在学习如何做物理。
- 当前 AI: 就像一个才华横溢的学生,如果你给它公式,它能解出数学题;但如果你让它基于一些混乱的观察来发明公式,它就束手无策。
- 未来: 要成为真正的科学伙伴,AI 需要在“长程推理”方面做得更好——即具备这样的能力:“我目前的理论是错的,我需要尝试一种完全不同的实验来发现隐藏真相。”
简而言之:AI 可以预测未来,但它仍需帮助来理解谜团背后的原因。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。