← 最新论文
💻 computer science

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

该论文介绍了 GIRAF,这是一种以文本为条件的扩散模型,通过采用以物体为中心的表示、混合领域训练以及基于接触的增强,来合成逼真的、具有泛化能力的全身人体与关节化物体之间的交互,从而克服现有方法的局限性。

原作者: Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人走进厨房,打开冰箱,拿取零食,然后走回房间——而你只需要在电脑上输入“给我拿瓶苏打水”。听起来很简单,对吧?但对于计算机来说,这就像是要求一个蹒跚学步的幼儿一边玩着魔方,一边还要玩杂耍。这就是 GIRAF 论文所解决的问题。

研究人员构建了一个全新的“大脑”(一个以文本为条件的扩散模型),它能够观察人类和物体(比如冰箱或抽屉),然后创造出一段关于接下来会发生什么的逼真电影。目标是什么?是创造一个无缝衔接的故事:角色走向物体,抓取它,移动它,并持续进行动作,而不会看起来像是一个充满漏洞的游戏角色。

三大难关(以及他们是如何解决的)

论文指出,之前的尝试之所以失败,是因为它们要么过于挑剔,要么过于简单。以下是他们排除掉的方法以及他们如何修复它的:

1. “静态与动态”的陷阱

  • 他们排除了什么: 旧的模型就像两个独立的应用程序:一个负责行走(位移),一个负责抓取物体(操纵)。有些模型只知道如何坐在椅子上,而另一些则只知道如何用手拿起杯子。它们无法处理“过渡”——即从停止行走转为开始拉取的那一瞬间。
  • GIRAF 的解决方法: 他们将这两个世界融合在了一起。想象一下,这就像一位舞蹈教练,在同一节课上既教你脚步动作,又教你手部动作。他们使用了一种特殊的“混合领域训练”策略。在开始阶段,模型在行走和抓取方面进行同等比例的练习。随后,它更多地专注于复杂的抓取部分,但从未忘记过行走。这有助于模型学习如何从“接近”平滑切换到“交互”。

2. “我该摸哪里?”之谜

  • 他们排除了什么: 之前的方法试图通过观察物体表面来预测手触摸物体的位置(如果物体形状奇特,这种方法就会失效),或者通过观察手指来判断(但这不能保证手真的触碰到了物体的正确位置)。
  • GIRAF 的解决方法: 他们发明了一个“动态基点集”(Dynamic Basis Point Set, BPS)。想象一下,物体周围漂浮着一层看不见的、灵活的、由点组成的网,就像由光组成的蜘蛛网。模型不再问“我的手指是否碰到了冰箱门?”,而是问:“我的手指是否碰到了这些看不见的点中的任何一个?”因为这个网会随着物体一起移动,所以无论冰箱是大、是小、还是呈立方体形状,它都能奏效。这是触摸行为的一种通用翻译器。

3. “数据不足”的问题

  • 他们排除了什么: 你不可能拍摄数百万人在每种可能的房间里打开每一个可能的抽屉的视频。数据太稀缺了。
  • GIRAF 的解决方法: 他们使用了一个巧妙的技巧,叫做“基于接触的增强”(contact-based augmentation)。想象你有一个人打开抽屉的视频。计算机获取该视频,缩小抽屉,将其移动到房间的另一侧,然后通过数学方式重新运行该视频,以确保人的手仍然能正确击中把手。这利用较小的数据集创造了 2,100 个训练序列,从而教会了模型具备灵活性。

结果:效果有多好?

团队使用来自 ParaHome 数据集的真实数据(该数据集包含 1.5 小时人们与抽屉、微波炉、冰箱和洗衣机交互的视频),将他们的模型与另外两个智能系统(LINGO 和 CHOIS)进行了对比测试。

  • 触摸更精准: GIRAF 模型的平均手到物体的距离缩减到了 1.869 厘米。其他模型则在 2.288 厘米2.502 厘米 左右。这听起来可能很小,但在 3D 动画领域,能在不穿透物体的情况下达到如此接近的距离,是一件了不起的事情。
  • 没有“幽灵手”: 该模型将“穿透”(即手像幽灵一样进入物体内部的情况)的平均距离降低到了 1.044 厘米,击败了竞争对手。
  • 遵循指令: 当被要求“打开抽屉”时,模型并不仅仅是随机移动。它通过更高的 R-precision 分数(0.3812)实现了文本描述与动作的高度匹配。

它能做什么(以及不能做什么)

论文展示了一些酷炫的演示。如果你告诉模型“打开抽屉”,无论抽屉是在高处还是低处,即使它以前从未见过那个高度,它也能完成任务。它甚至可以根据你的输入切换左右手,使用左手、右手或双手。

然而,作者也诚实地说明了局限性。他们暗示,对于它从未见过的完全新型的运动部件(例如绕垂直轴旋转而不是绕铰链旋转的门),该模型可能会感到吃力。他们也承认,在从行走切换到抓取时,脚部可能会有轻微的滑动或关节抖动。这还不是一个完美解决的问题,但它是迈向成功的一大步。

核心结论

GIRAF 不仅仅是一个会走路的机器人,也不仅仅是一个会抓取的机器人。它是一个同时学会了这两者的系统,并使用了一种关于触摸和运动的共享“语言”。通过在训练中混合行走与抓取,并使用一个灵活的“网”来理解触摸位置,它创造出的动画比以往任何时候都更加自然。这并非魔法,但它是目前我们能找到的最接近于教计算机如何成为一个“笨拙但贴心的人类助手”的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →