想象一下,你想要构建一个逼真的电影场景:一辆汽车驶过水面上的浮桥,或者一个机器人在杂乱的办公室中穿行。
旧方法(视频模型):
将当前的 AI 视频生成器想象成才华横溢的画家。如果你要求它们画出一辆汽车驶过水面的画面,它们会查看数百万张汽车和水的照片及视频。它们基于模式来猜测下一帧应该是什么样子。
- 问题所在: 它们并不真正“懂得”物理定律。它们只是在猜测颜色和形状。如果汽车撞上一个颠簸,画家可能会无意中让汽车漂浮穿过颠簸,或者桥梁可能扭曲成奇怪的形状,因为 AI“忘记”了重力是如何运作的。它看起来在一瞬间很酷,但物理定律很快就会崩塌。
新方法(本文的方法):
作者提出了一种不同的方法:不是逐帧地“绘制”电影画面,而是让 AI 编写物理引擎的“操作手册(代码)”。
可以这样理解:
- 旧方法 就像魔术师试图猜测下一个戏法。
- 本文的方法 就像聘请一位工程师在实验室里建造一个真实且可运行的模型。
“编码代理”如何工作
该论文描述了一个由 AI“代理”(专业助手)组成的团队,它们协同工作以构建这种模拟。它们就像一个施工队:
- 规划者(建筑师): 你告诉团队:“我想要一个在办公室里的机器人。”规划者将其分解为蓝图:“我们需要地板、两张桌子、七把椅子和一个机器人。机器人需要能够在它们之间行走。”
- 编码者(建造者): 该代理接收蓝图,并编写实际的计算机代码(使用名为 Project Chrono 的工具),告诉计算机如何精确地构建房间、放置家具以及每个物体的重量。
- 视觉审查员(检查员): 代码运行后,会生成一段视频。审查员观看视频并说:“等等,机器人正漂浮穿过桌子。这是错的。”
- 物理分析师(工程师): 该代理检查数学计算。它说:“桌子太轻了,或者机器人太重了。代码需要修正。”
- 循环: 编码者修复代码,然后再次运行。它们不断重复这一过程,直到模拟完美运行并遵守物理定律。
为什么这很重要
该论文声称,通过可执行代码构建世界,而不仅仅是预测视频帧,使得模拟变得:
- 物理上准确: 物体碰撞、下落和弹跳的方式完全符合预期,因为代码强制执行了真实的物理规则。
- 可修复: 如果出现问题,你可以查看代码,找到错误并修复它。如果物理定律出错,你无法轻易“修复”一段视频;你只能尝试重新绘制它。
- 适用于复杂任务: 团队在机器人于办公室中、军用车辆在崎岖地形上行驶、以及汽车驶过水面浮桥(固体和液体物理的复杂混合)等场景中测试了这种方法。
结果
当他们将“编码代理”方法与先进的视频生成模型(使用名为 WorldModelBench 的基准测试)进行比较时,他们的方法在以下方面得分更高:
- 指令保真度: 它是否完全按照你的要求执行?(是的,因为代码明确构建了你所要求的内容。)
- 物理定律: 汽车是否穿过了地板?(没有,因为代码阻止了这种情况。)
局限性
该论文承认,这个系统尚未完美。由于需要编写代码、运行代码、检查代码并反复修复,它可能速度较慢且成本高昂(就计算能力而言)。此外,如果 AI 的库中没有特定物体的具体 3D 模型,它就必须用简单的形状来近似。
简而言之: 与其让 AI 猜测 一个逼真世界看起来是什么样子,这篇论文教导 AI 使用代码来构建一个逼真的世界,确保物理定律是真实的,而不仅仅是一种幻觉。
技术摘要:编码智能体可作为世界模拟器
问题陈述
世界模型已成为构建交互式模拟环境的范式,近期基于视频的方法在生成视觉可信的动态方面展现了进展。然而,这些模型通常从视频中推断动态并以潜在状态表示,而非显式地施加物理约束。因此,其生成的视频推演往往缺乏物理合理性,表现出接触不稳定、形状扭曲或运动不一致等问题。在构建可检查、可执行和可修复机制的世界方面仍存在关键差距,特别是在长程交互中,保持物理状态与渲染下一帧同样重要。现有的物理模拟器(如 MuJoCo、Project Chrono)提供显式状态和诊断功能,但要求用户手动选择资产、实例化刚体、编写代码并调整参数,从而在世界构建中形成了瓶颈。
方法论
作者提出了一种多智能体框架,通过可执行的模拟代码而非直接帧预测来构建基于物理的世界模型。该系统将生成的代码视为世界表示,在物理引擎(Project Chrono)中指定几何形状、刚体、关节、接触、材料、传感器和数值设置。该框架通过闭环智能体工作流程运行:
资产库与碰撞表示:系统利用统一的资产库,结合外部 3D 资产(用于语义/视觉多样性)和模拟器原生资产(用于物理组件)。为管理计算成本,将视觉几何与碰撞几何分离;使用高分辨率网格进行渲染,而物理交互则依赖通过近似凸分解(CoACD)算法生成的分解凸包。
多智能体工作流程:
- 规划智能体:将未充分指定的自然语言提示(及可选的参考图像)转换为结构化的模拟计划。该智能体提取物理实体,利用定义的谓词代数(例如
PLACE-ON、FLOATS-AT-SURFACE、FACING-TO)推断场景拓扑,并将空间关系解析为具体的模拟器位姿。它公开此计划以供用户确认,确保在编码前验证具体选择(尺寸、时间步长、相机位置)。
- 代码智能体:将获批的计划转换为可执行的 PyChrono 代码。其生成过程基于精心策划的技能库(刚体、关节、车辆等的实现模式)、用于查询资源的工具接口以及特定版本的API 索引,以防止 API 漂移。
- 执行与审查循环:生成的代码在 Chrono 引擎中运行。
- 视觉审查智能体:分析模拟视频以描述场景布局、动态和视觉不一致之处。
- 模拟评判器:结合诊断日志、物理轨迹数据和视觉证据来确定有效性。如果模拟失败(例如物理错误或视觉不匹配),评判器返回结构化的错误报告。
- 迭代修复:代码智能体根据反馈修补当前程序,而非从头重新生成。此循环持续进行,直到模拟满足计划和物理约束。
主要贡献
- 用于世界模拟的多智能体框架:作者提出了一种系统,其中智能体通过感知模拟器的规划、基于技能的代码生成、执行反馈、视觉审查和迭代修复,协作构建可执行的物理世界。
- 可执行的世界表示:该框架将物理模拟直接集成到世界构建过程中。物体、关节、接触和数值设置被表示为可执行的模拟器程序,实现了显式的物理状态、可检查的动态以及超越帧级视觉预测的接地交互。
- ** demonstrated 有效性与通用性**:该框架在多样化任务中进行了评估,包括室内环境中的机器人交互、户外车辆动力学以及高保真流体 - 固体相互作用(FSI)。
实验结果
该框架使用三种场景进行了评估:Go2 机器人在办公室巡逻、HMMWV 在户外地形上行驶,以及 Polaris 车辆在水面上跨越漂浮块(FSI)。
- 规划鲁棒性:对规划智能体的消融研究表明,无论是否有参考图像,生成结构化计划的成功率都很高(100% Pass@1)。
- 资源使用:成功模拟的端到端运行时间为 24–30 分钟,令牌使用量根据场景复杂度从约 168 万到约 634 万不等。
- 基准评估(WorldModelBench):该框架在 WorldModelBench 上与最先进的视频生成基线(Wan2.2-TI2V-5B)进行了比较,该基准评估了指令遵循、物理定律和常识。
- 多智能体框架在所有三种场景中均获得了更高的总分。
- 在 FSI 车辆场景中,改进具有统计学显著性(p=0.0012)。
- 在指标层面,该框架在指令遵循方面显示出显著增益(p=0.000059),表明在保留请求的实体和场景约束方面表现更优。
- 物理定律和常识得分与基线相当,尽管该框架保持了轻微的数值优势。
意义与局限性
该论文认为,编码智能体可以通过构建定义物理世界本身的可执行程序,有效地充当世界模拟器。这种方法将问题从帧预测转变为感知模拟器的世界构建,允许通过执行日志追踪故障,并通过代码修改而非重新训练或重新生成潜在状态进行修复。
作者承认若干局限性:
- 修复单调性:修复过程不能保证单调改进,可能会在不同故障模式之间循环。
- 资产约束:有限的资产库要求缺失的物体通过几何代理进行近似。
- 代码约束:生成受限于技能库和 API 索引,使得难以实例化不支持的传感器或自定义求解器。
- 评估范围:当前评估涵盖的场景数量有限,并且部分依赖人工判断来接受计划。
确定的未来工作方向包括集成 3D 资产生成管道以处理长尾元素,通过更好的状态表示和缓存优化令牌使用,以及探索并行执行以克服当前的硬件瓶颈。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。