VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
该论文介绍了 VibeWorlding,这是一个由 VWE-BENCH 基准测试和 VibeWorlding-Gym 强化学习训练环境组成的统一框架,旨在评估并增强多模态智能体根据用户查询自主构建交互式 3D 开世界的能力,并证明了强化学习可以使开源模型在这一复杂任务中超越前沿的闭源系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你站在一个空荡荡的数字房间里,仅仅通过描述你想看到的景象,就要求计算机为你建造一条繁华的城市街道、一片幽静的森林空地或一个未来的太空站。这就是“具身人工智能”(embodied artificial intelligence)所承诺的前景——在这个领域,机器正在学习像人类一样与三维空间进行交互并构建空间。多年来,研究人员一直试图教计算机根据文本指令来排列数字物体,如家具、树木和建筑。然而,以往的大多数尝试仅适用于简单的、理想化的请求,例如“把一把椅子放在这里”。当面对人类对话中那种杂乱、开放式的本质时,它们就显得力不从心——比如用户可能会要求创建一个带有特定光影和氛围的“温馨且略显凌乱的书房”。此外,由于构建这些世界的工具分散且测试方法不统一,人们很难判断人工智能是真的理解了请求,还是仅仅在进行猜测。
一组研究人员现在通过一个名为 VibeWorlding 的新框架解决了这一挑战。他们创建了一个综合系统,使人工智能代理不仅能倾听用户的描述,还能主动规划、搜索合适的数字物体、将它们放置在三维空间中,然后观察结果是否符合愿景。研究人员建立了一个庞大的测试场,其中包含超过 2,600 个高质量的 3D 物体,从小型道具到大型建筑应有尽有,并利用这些物体创建了数百个复杂的场景。随后,他们生成了数千个独特的用户请求,有些包含精确的指令,有些则是模糊、开放式的愿望,以测试不同的人工智能处理这些任务的能力。该系统扮演着严厉裁判的角色,它不仅检查物体是否放在了正确的位置,还会检查它们是否符合物理常识——例如,确保桌子不会悬浮在半空中,或者树木不会生长在墙体内部。
当研究人员测试当今最先进的人工智能模型(包括来自主要科技公司的模型)时,他们发现当前的能力与自动构建这些世界的目标之间存在显著差距。即使是最强大的模型,虽然能够编写代码并回答复杂问题,但在成功构建所请求场景方面的失败率仍超过了 60%。失败的主要原因并非对用户语言理解不足,而是难以完成编辑 3D 世界这一精确的物理动作。模型通常能理解用户想要移动书架,但它们会错误地计算距离或向错误的方向移动物体,导致物体与其他物品发生碰撞或呈现不真实的悬浮状态。
为了弥补这一差距,该团队开发了一种专门的训练方法,通过试错法来教授人工智能,类似于儿童学习玩积木的过程。该系统让代理尝试构建一个场景,根据关于物理规律和用户意图的严格规则检查结果,并且只有在达成目标时才会给予奖励。这个过程被称为强化学习(reinforcement learning),研究人员利用这一过程训练出了一个开源模型,该模型最终能够超越现有的最佳闭源模型。他们训练出的最佳模型基于 300 亿参数的基础模型,实现了所有测试系统中的最高成功率。它学会了检索正确的物体,在不发生碰撞的情况下进行放置,并遵循环境的物理约束,有效地掌握了用户想要创造的世界之“氛围”(vibe)。
研究还表明,虽然这些模型在理解大局方面正变得越来越好,但最难的部分仍然是空间推理的微观细节。代理在处理精确测量方面仍然存在困难,例如在向前移动物体七米时,如何做到既不超距也不不足。然而,研究人员发现,这种训练方法显著提高了代理进行 3D 空间推理的能力,将一个主要的弱点转化为了优势。通过向公众发布其数据、工具和训练好的模型,该团队希望加速开发出能够构建交互式 3D 世界的系统,使游戏、模拟和虚拟现实领域的创作能像人类设计师一样轻松且富有创意。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。