← 最新论文
💻 computer science

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

本文介绍了 RoomWright,这是一个代理框架,它通过将关注点从单纯的视觉放置转向基于使用驱动的对象推理和基于规则的交互建模,为具身智能生成可执行的、基于代码的 3D 室内场景。

原作者: Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:机器人可以走进房间,拿起水壶并将其放在炉灶上;或者虚拟智能体可以拨动开关来打开台灯。为了让这些机器进行学习和行动,它们需要的不仅仅是房间的照片,而是能够真正运作的空间。在这些空间里,物体拥有可以移动的部分,门把手可以转动锁扣,按下按钮可以改变灯光的亮灭状态。直到最近,为这些机器人构建的数字房间大多还是静态的。它们看起来很真实,但表现得并不真实。机器人可能会撞到椅子,但它无法拉开抽屉,也无法理解转动旋钮会改变风扇的速度。挑战在于,如何构建不仅是家具的视觉集合,而且是让因果关系能如物理世界般精准演出的功能性舞台。

一组研究人员推出了一种构建这些交互式世界的新方法,超越了仅仅在场景中放置物体,而是深入理解这些物体的实际用途。他们将该系统称为 RoomWright。RoomWright 并非通过像摆放棋子一样排列 3D 模型来创建房间,而是将整个房间编写成一套计算机可以运行的指令或代码。这种方法使得数字环境具有完全的可编辑性和模拟就绪性。其核心洞察在于,一个房间是由其内部发生的活动所定义的。如果你要冲咖啡,你需要一个柜台、一个水壶、一个电源以及一种开启它的方式。研究人员发现,通过从活动出发,反向推导物体及其连接关系,他们可以生成不仅在视觉上正确,而且在功能逻辑上也合理的场景。

以往的方法通常依赖于观察房间图像来猜测物体应该放在哪里。虽然这对于让事物看起来美观有效,但往往无法捕捉到事物协同工作的隐藏逻辑。机器人可能会看到水壶和炉灶,但如果不懂得其功能,它可能会将水壶悬浮在空中,或者让其朝向错误。新系统通过将每件主要家具视为特定任务的中心解决了这个问题。它会询问:“一个人在这里需要做什么?”然后只引入完成该任务所需的物体。如果任务是烹饪,系统会添加炉灶、柜台和水壶,并确保它们被放置在人类实际可以触及的地方。这一过程被研究人员称为“基于用途的推理”,它确保了房间是围绕人类需求而非仅仅围绕视觉美感来构建的。

该系统更进一步,教导物体如何相互作用。在真实的厨房里,转动风扇上的旋钮会改变叶片的转速,按下微波炉上的按钮会点亮显示屏。这些不仅仅是单个部件的运动,而是由一个动作触发另一个动作的连锁反应。研究人员通过程序编写了这些交互规则。每条规则都像是一个小程序:如果用户按下开关,那么灯就会亮起;如果用户旋转旋钮,那么风扇速度就会改变。通过将这些规则编写为代码,系统可以创建复杂的行为,使多个物体协同工作,例如水壶放在底座上时,当水壶放置到位,底座会激活灯光。这使得数字房间对机器人的动作做出自然且一致的反应。

构建这些房间最棘手的部分之一是确定物体的朝向。烤面包机有正面、背面和顶部,但观察图像的计算机除非看到人正在使用它,否则可能不知道哪一面是正面。研究人员通过利用他们在构建物体时已有的信息解决了这个问题。由于系统是从代码构建房间的,它了解每个部件的细节,比如把手或按钮的位置。它利用这些知识,根据人类的使用方式来决定物体的最佳朝向。这确保了键盘的按键面向用户,鼠标的位置适合右手握持,而以往的方法因为仅依赖视觉猜测,经常在这方面出错。

团队通过创建二十八个不同的房间(涵盖从用餐区到办公室的各种类型)来测试他们的系统,并将结果与其他现有方法进行了对比。测试表明,他们的方法生成的房间更加完整且真实。在模拟中,生成的房间中较少出现物体悬浮在空中的情况,家具支撑更好,且更多物体是实际可触及和可使用的。最重要的是,这些房间包含了更高数量的交互元素。其他方法可能会创建一个带有少量活动部件的房间,而新系统生成的场景拥有许多可以被操纵的物体,例如可以打开的门、可以开关的灯以及可以控制速度的旋钮。研究人员展示了机器人可以进入这些数字房间,并成功执行诸如抓取门把手关闭门或按下按钮点亮显示屏等任务。

这项工作代表了我们构建机器人和人工智能数字环境方式的重要转变。通过关注房间的目的而非仅仅是外观,研究人员创造了一种生成随时可进行现实世界测试的空间的方法。生成的场景不仅是静态图像,更是动态环境,其中每个物体都有其角色,每一次行动都有其后果。这使得机器人可以在一个行为逻辑与我们生活的世界完全一致的世界中学习和练习技能,弥合了数字模拟与物理现实之间的鸿沟。该系统证明,当我们用构建现实家中逻辑的方式来构建数字世界时,我们就能为那些终有一天将与我们共同生活和工作的机器打下更好的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →