MaD Physics: Evaluating information seeking under constraints in physical environments
本文介绍了 MaD Physics,这是一个新颖的基准测试,旨在通过在物理定律被改变的环境中对人工智能智能体进行测试,评估其在资源约束下推断物理定律和规划测量的能力,从而揭示当前 Gemini 模型在科学推理和结构化探索能力方面的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图解开一个谜团,但你有一条非常严格的规则:你只有有限的资金用于购买线索。
这就是一个名为“MaD 物理”(测量与发现物理)的新研究项目的核心理念。谷歌 DeepMind 和 Mila 的研究人员创建了一个类似视频游戏的测试,以观察当 AI“科学家”无法直接从教科书中查找答案,且无力检查所有事物时,它们能在多大程度上理解世界是如何运作的。
以下是其运作方式及研究发现的简要说明:
1. 游戏:“神秘盒子”
在这个测试中,AI 被投入一个物体四处运动的虚拟世界。但其中有个陷阱:这个世界的物理规则略有“破损”或被“篡改”。
- 也许重力不再像往常那样将物体向下拉扯。
- 也许水流以违背正常流体力学的方式旋转。
- 也许粒子的行为就像被我们现实世界中不存在的隐形绳索连接着。
AI 并不知道这些规则。它必须通过观察物体的运动来推断出这些规则。
2. 挑战:“线索预算”
这就是"MaD"部分发挥作用的地方。AI 拥有一个“预算”(就像一个装有固定数量硬币的钱包)。
- 观察一个物体需要花钱。
- 近距离观察(高精度)花费很多。
- 远距离观察(低精度)花费较少。
- 等待更长时间再观察会消耗更多时间。
AI 必须做出明智的选择:“我是应该把全部预算花在一个物体上进行极其细致的检查,还是应该花一点点钱检查十个不同的物体以获得一个大致的概念?”
如果 AI 将资金浪费在错误的猜测上,它会在解开谜团之前就用光硬币。一旦资金耗尽,游戏结束,AI 必须仅根据它成功买到的线索,预测物体未来的位置。
3. 三个世界
为了确保 AI 不仅仅是死记硬背现实世界的事实,研究人员在三个不同的“宇宙”中对其进行了测试:
- 弹跳球世界(经典力学): 物体在弹跳和碰撞,但带有奇怪的、看不见的“记忆”,使得它们在特定方向上更难被推动。
- 漩涡水世界(流体力学): 一种流动的液体,但受到一种看不见的“外星力量”的推动,使其呈现出奇怪且旋转的图案。
- 幽灵粒子世界(量子力学): 像波一样行动的微小粒子,但有一个转折:当观察它们时,其显现的规则与现实生活不同。
4. 测试对象
研究人员测试了谷歌四种不同版本的 Gemini AI 模型(从较小、较快的模型到较大、较聪明的模型),以观察它们在这款游戏中的表现如何。
5. 结果:AI 出错的地方
结果对 AI 来说有些令人谦卑:
- 它们难以做到“战略化”: AI 经常低效地消耗预算。它有时会观察错误的对象,或者对无关紧要的事物观察得过于细致,导致在理解规律之前就用光了资金。
- 它们无法“发明”新定律: 当物理规则被篡改时,AI 经常试图将现实世界的规则强加于新世界。这就像试图用国际象棋的规则来解决数独谜题。
- 更先进的模型表现更好,但并非完美: 更聪明的 AI 模型(如 Gemini 3)犯的错误更少,在预测未来方面表现更好,但它们仍然无法完美地破解篡改后物理规则的“秘密代码”。
- 视觉信息增加了难度: 当 AI 必须观察运动物体的图像而不仅仅是数字时,它会变得更加困惑。
核心结论
该论文总结道,虽然 AI 在回答它已知答案的问题方面变得越来越擅长,但它在真正的科学发现方面仍面临挣扎:即有能力走出去,明智地利用有限资源,收集新数据,并找出那些尚不存在的规则。
这样想吧:AI 非常擅长做一名图书管理员(寻找现有的书籍),但它仍在学习如何成为一名探险家(绘制一幅无人见过的领土地图)。“MaD 物理”为研究人员提供了一张新地图,让他们能确切看到 AI 在哪里迷失,从而帮助它更好地学习如何探索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。