← 最新论文
🤖 AI

Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds

本文介绍了一个在 NVIDIA Omniverse 中生成的公开可用合成数据集,用于训练视觉语言模型进行空间推理和视觉视角转换,为实现人机交互中的具身智能奠定了基础。

原作者: Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一个巨大且杂乱的客厅里和朋友玩捉迷藏。你躲在沙发后面,而你的朋友站在门口。如果你大喊一声:“我看到左边有一个红色的球!”,你的朋友就必须完成一件非常棘手的任务:他们不能仅仅从自己的位置看向左边,而是必须在脑海中“穿上你的鞋子”,转身以你的视角观察房间,然后搞清楚那个红色的球相对于他们而言是在哪里。这种脑力体操被称为“视觉视角转换”(Visual Perspective Taking)。这是人类拥有一种超能力,让我们能够理解他人的所见、所思与所感。为了让机器人能够真正地与我们相处、与我们玩耍或在我们的家中提供帮助,它们也需要这种超能力。目前,机器人往往就像那些只能从自己的眼睛看世界的人;它们很难理解对它们来说是“左边”的东西,对你来说可能是“右边”。这篇论文深入探讨了人工智能(AI)的世界,旨在研究我们是否可以教会机器人进行这种“脑内旋转”的动作,特别是通过使用一种类似于视频游戏模拟器的特殊训练数据。

这项研究背后的研究人员 Joel Currie 及其团队正在解决一个特定的问题:机器人及其驱动它们的 AI 大脑擅长识别物体,但却不擅长理解这些物体在 3、维空间中的确切位置,尤其是从不同角度观察它们时。虽然一些旧的机器人方法使用僵化的数学规则来确定空间,但该团队认为,现代“视觉语言模型”(能够看图并阅读文本的 AI)可能代表了未来,但前提是我们必须更好地训练它们。论文指出,这些智能模型目前在空间推理方面表现不佳,并不是因为它们“笨”,而是因为它们缺乏足够能将物体外观与精确位置完美联系起来的训练数据。

为了解决这个问题,团队创建了一个全新的机器人“训练馆”,但他们不是建造了一个真实的房间,而是在一个强大的视频游戏引擎——NVIDIA Omniverse 中构建了一个数字世界。把它想象成一个数字沙盒,他们可以在其中放入一个略微变形的立方体,从一个具有随机高度的摄像机拍摄一张照片,并写下一句描述它的句子。神奇之处在于,因为他们是在计算机中构建这个世界的,所以他们掌握着关于立方体位置的极其精确的数学数据,精确到毫米级。他们生成了一个包含这些场景的数据集,将图像、语言提示词和一个精确的“4×4 变换矩阵”(一个告诉您物体具体位置的复杂数学网格)配对在一起。

在第一个实验中,团队并没有要求 AI 一次性解决整个 3D 空间谜题。相反,他们专注于一个更简单、更基础的技能:在保持其他一切不变的情况下,猜测物体沿 Z 轴(相对于摄像机的深度线)的距离。他们想看看 AI 是否可以通过观察图片和描述,正确地猜出这个距离。如果 AI 能在他们这个完美的合成世界中学会这一点,那么希望它最终能处理现实房间中完整且复杂的复杂情况。论文将此呈现为一种“概念验证”(proof-of-concept),这意味着这是一个早期阶段的测试,旨在看看这个想法是否可行。他们并不声称今天已经解决了机器人智能问题;相反,他们是在铺设第一块基石。他们已经公开了这个数据集,以便其他科学家可以使用它来训练自己的机器人,目标是实现一个机器人能够真正理解“他人所见”并在我们所习以为常的空间感知下穿梭于我们世界的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →