✨ 要点🔬 技术摘要
想象一个机器人正试图在一个杂乱的房间里导航,以寻找一个特定的物体。为了成功,它不能仅仅对眼前所见做出反应;它必须预判如果向前迈一步、向左转或伸手去拿会发生什么。它需要一个关于世界的心理模型,一种在实际发生之前模拟未来的方法。多年来,科学家们一直在构建能够生成极其逼真的动态场景视频的人工智能系统。这些被称为“世界模型”的系统可以创造出汽车在街道上行驶或杯子从桌上掉落的图像,其视觉保真度之高,看起来就像真实的录像。然而,一个关键问题一直悬而未决:这种视觉上的美感是否真的能帮助机器人做出更好的决策?直到现在,该领域一直由仅凭生成的视频看起来有多漂亮来评判这些模型的基准测试所主导,而忽略了这些视频对于试图完成真实任务的机器人是否有用。
一个研究团队引入了一种名为“世界中之世界”(World-in-World)的新方法,该方法将焦点从视觉完美转向了实际效用。他们不再问“这个视频看起来有多好?”,而是问“这个视频能否帮助智能体成功?”研究人员构建了一个闭环测试平台,人工智能智能体必须执行四种不同的物理任务:通过主动观察来寻找隐藏物体、根据单张参考图像导航到特定位置、在探索 3D 环境后回答相关问题,以及控制机械臂移动物体。在这种设置下,世界模型充当了模拟器的角色。在机器人投入物理行动之前,它会利用该模型来想象几种可能的未来。然后,它通过评估这些想象出的场景,来选择最有可能导致成功的路径,从而有效地在行动前进行思考。
这种新评估的结果揭示了视觉质量与任务性能之间令人惊讶的脱节。研究人员测试了一系列最先进的视频生成器,其中包括一些能产生极高清晰度和极具美感的片段的模型。他们发现,高视觉质量本身并不能保证机器人能成功完成任务。一个模型可能会生成一段精美的房间视频,但如果视频中的物理规律稍有偏差,或者如果机器人无法在模拟中精确控制摄像机运动,机器人就会做出错误的决策。事实上,研究表明,可控性(即通过特定的低级动作来引导模拟的能力)比单纯的图像美感重要得多。一个能够可靠响应“向前走两步”指令的模型,比一个能产生华丽但不可控视频的模型更有价值。
此外,团队发现,仅仅使用更强大的预训练视频生成器并不是提高机器人性能的最佳途径。相反,他们发现,通过使用与机器人的环境和动作相关的相对较少的数据对标准的视频生成器进行微调,会产生更好的结果。这个过程被称为“后训练”(post-training),它使模型的预测与机器人所处的特定物理世界规则保持一致。数据还显示了一个清晰的缩放法则:在微调过程中,模型看到的动作与观察的示例越多,它在帮助机器人成功方面的表现就越好。此外,给系统更多的计算时间——允许它在做出决策前模拟更多潜在的未来——显著提高了其成功率。
研究结论指出,对于世界模型要真正对机器人技术和具身智能有用,必须通过它们支持闭环决策的能力来衡量,而不是通过它们创造完美视觉的能力。虽然目前的模型在处理机器人操作的复杂物理特性(如物体之间精确的摩擦力和接触)方面仍存在困难,但新的框架提供了一条清晰的前行之路。通过优先考虑可控性,并通过后训练使模型适应特定任务,研究人员可以构建出不仅看起来像真实世界,而且实际上理解如何与现实世界互动的系统。这种从评判图像到测试计划的转变,标志着在创造能够可靠地在物理世界中导航和操作的智能体方面迈出了重要一步。
技术摘要:World-in-World:闭环世界中的世界模型
问题陈述
视觉生成领域的最新进展已经产生了能够模拟具有惊人视觉真实感环境的世界模型。然而,社区缺乏一个统一的框架来评估这些模型是否真正增强了具身智能体(embodied agent)的性能 。现有的基准测试(如 VBench、WorldModelBench)主要关注孤立的视觉质量指标或视觉合理性,通常使用开环协议,无法测试模型在决策中的实用性。因此,目前尚不清楚高保真视频生成是否能转化为在闭环交互中的成功任务完成——即智能体必须基于预测的未来进行感知、规划和行动。
方法论
作者引入了 World-in-World ,这是第一个旨在将世界模型(WMs)置于镜像真实智能体-环境交互的闭环环境中的开放平台。该方法由四个核心部分组成:
1. 统一闭环在线规划策略
该框架采用了一种由策略引导的束搜索(beam search)策略,包含三个迭代阶段:
提议(Proposal): 智能体策略 (π p r o p o s a l \pi_{proposal} π p r o p os a l ) 根据当前观测 (o t o_t o t ) 和任务目标 (g g g ) 生成 M M M 个候选动作序列 (A ^ t \hat{A}_t A ^ t )。
模拟(Simulation): 一个**统一动作 API(Unified Action API)**将这些候选计划转换为与多样化世界模型兼容的控制输入 (I t I_t I t )(例如文本提示、相机轨迹或低级动作序列)。随后,世界模型 (g θ g_\theta g θ ) 执行反事实展开(counterfactual rollouts),为每个计划预测未来的状态 (O ^ t \hat{O}_t O ^ t )。
修正(Revision): 修正策略 (π r e v i s i o n \pi_{revision} π r e v i s i o n ) 对模拟的轨迹进行评分,并选择要在真实环境中执行的最优决策 (D t ∗ D^*_t D t ∗ )。循环随新的观测不断重复。
2. 统一动作 API
为了集成异构的世界模型,作者提出了一个 API,将智能体动作序列映射到特定的模型输入:
文本提示(Text Prompts): 对于图像到视频模型,动作被转换为描述性文本。
相机轨迹(Camera Trajectories): 对于视角条件模型,动作被映射到相机运动(平移/旋转)。
低级动作(Low-level Actions): 对于接受离散/连续动作的模型,则应用直接映射到模型的动作词表。
3. 全面的具身任务
该基准测试通过涵盖感知、导航和操控的四个不同任务来评估世界模型:
主动识别(Active Recognition, AR): 通过主动探索识别遮挡目标(使用 Habitat-Sim/Matterport3D)。
图像目标导航(Image-Goal Navigation, ImageNav): 在给定参考图像的情况下到达目标视角(使用 HM3D)。
主动具身问答(Active Embodied Question Answering, A-EQA): 在主动探索后回答开放式问题(使用 OpenEQA/HM3D)。
机器人操控(Robotic Manipulation): 控制机械臂进行抓取和放置(使用 RLBench/CoppeliaSim)。
4. 后训练协议
为了使预训练的视频生成器适配具身任务,作者引入了一种使用来自目标模拟器(Habitat-Sim 和 RLBench)的动作-观测数据的微调程序。这使生成先验与特定的领域分布和动作空间对齐,确保模型学习的是基于智能体动作预测结果,而非仅仅是自然视频统计特性。
核心贡献
World-in-World 基准测试: 一个全面的闭环评估平台,优先考虑任务成功率 而非视觉保真度,并在四个多样化的具身任务中评估世界模型。
统一框架: 一个标准化的规划策略和动作 API,允许将异构的世界模型(从基于图像到基于视频,从开源到专有模型)无缝集成和比较。
实证发现:
视觉质量 ≠ \neq = 任务成功: 高审美得分并不保证高任务成功率;可控性 (预期动作与预测动力学之间的对齐)才是关键因素。
数据缩放法则(Data Scaling Law): 与单纯升级预训练视频生成器的规模相比,利用动作-观测数据进行后训练对于提升具身实用性更为有效。
推理时缩放(Inference-Time Scaling): 在规划阶段分配更多计算资源(增加每次决策时的模拟展开次数)能显著提高闭环性能。
结果与分析
作者评估了广泛的模型,包括 SVD、LTX-Video、Hunyuan、Wan2.1/2.2、Cosmos-P2 以及像 Runway Gen4 这样的专有模型。
性能提升: 集成世界模型一致地提高了基础提议策略(如 VLM 或启发式算法)的性能。例如,在主动识别任务中,表现最好的后训练模型(Runway Gen4)实现了 64.79% 的准确率 ,平均步数为 4.06 步,显著优于 VLM 基线(50.27% 准确率,6.24 步)。
后训练有效性: 后训练变体(用 † \dagger † 表示)始终优于其零样本(zero-shot)对应版本。例如,经过后训练的 Wan2.1 将主动识别的准确率从 58.26% 提高到 62.61%,并将 ImageNav 的成功率从 38.19% 提高到 45.14%。
操控挑战: 在机器人操控任务中的增益较不明显。虽然后训练改善了结果(例如,SVD† \dagger † 达到了 46.5% 的成功率,而基线为 44.5%),但建模富接触物理特性(contact-rich physics)和精确运动学仍然是一个瓶颈,相比于导航任务更具挑战性。
缩放趋势:
数据缩放: 将后训练数据从 400 个实例增加到 80,000 个实例,成功率持续提升,揭示了明确的适配缩放法则。
推理缩放: 增加每个回合(episode)中的世界模型推理次数(从 3 次增加到 11 次)导致成功率单调增加,证明了在行动前进行“思考”(模拟未来)的价值。
意义
本文认为,世界模型领域必须将评估范式从生成质量 转向具身实用性 。作者声称,“世界模型的生存与否取决于其闭环成功率,而非完美的生成视觉效果。”通过建立 World-in-World,这项工作提供了一个必要的框架来追踪具身 AI 的真实进展,并证明虽然目前的模型在精细物理动力学方面仍存在困难,但如果能得到适当的适配并集成到闭环规划系统中,它们可以显著辅助感知和导航。研究结果表明,未来的进步不仅依赖于单纯扩展预训练数据,更依赖于动作条件的后训练 以及推理时计算 ,以增强可控性和决策能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。