← 最新论文
💻 computer science

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

本文介绍了 InterPet4D,这是首个捕捉同步人犬交互并具有全面注释的大规模多模态数据集,并提出了 InterPetMoGen 框架,该框架在生成逼真的人宠运动方面显著优于现有基准。

原作者: Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何玩捡球游戏,但你不能只是扔出一个球,而是必须解释你手的每一次抽动、你说的每一个词,以及你的狗的尾巴应该如何做出反应。直到现在,教计算机这种“跨物种”的舞蹈几乎是不可能的,因为我们缺乏足够好的示例库。这正是 InterPet4D 发挥作用的地方。它就像是第一个大规模、高清晰度的“人犬互动”图书馆,包含了 680 万帧的视频、音频和 3D 运动数据。

终极狗狗训练工作室

为了构建这个库,研究人员搭建了一个看起来有点像科幻电影布景的特殊工作室。他们不仅仅使用了一个摄像机;他们部署了 12 个同步摄像机,呈正方形排列,以捕捉每一个角度的动作。但最酷的部分在于:研究中的人类还佩戴了 Ray-Ban Meta 眼镜。这为数据集提供了“第一视角”视图,让计算机能够看到人类在看向自己的狗或伸手抚摸时所看到的景象。

他们收集了 23 名人类参与者(包括 11 名专业训练师)和 13 只狗(涵盖 11 个不同品种)。这些狗并非随机挑选,它们接受过“坐下”、“待着”和“握手”等指令的训练,但数据集也捕捉了自由嬉戏的过程,比如拔河和追逐。其结果是?这是一个宝藏数据库,不仅包含视频,还包括 音频指令(“Ruby,坐下!”)以及人类身体和狗爪子精确的 3D 运动。

教计算机“说”狗语

拥有数据固然很好,但你如何教计算机去使用它呢?作者构建了一个名为 InterPetMoGen(简称 IPMG)的新型 AI 框架。可以将这个模型想象成一个超级聪明的翻译官,它不仅翻译文字,还翻译动作

当你给模型一组人类手势和一条音频指令时,它会尝试预测狗会如何反应。但棘手之处在于:狗的反应并不是一个单一、固定的答案。如果你说“坐下”,有的狗会立即坐下,而有的狗可能会先停顿一下并看着你。该模型旨在理解这种一对多的关系。它不仅仅是选择一个答案,而是学习一系列可能的、真实的反应范围

为了实现这一点,模型使用一个名为 PetVAE 的特殊工具,将狗的运动分解为微小的“标记”(类似于单词中的字母)。这个工具确保了狗的动作看起来符合物理规律,保持骨骼和关节的正确连接,而不是像水母一样随处晃动。然后,模型采用一种“由粗到细”的方法:它首先确定狗运动的大致方向,然后填充爪子放置和尾巴摇摆的具体细节。

效果如何?

研究人员将他们的新模型与旧的、标准的方法(如 Seq2Seq扩散模型/Diffusion models)进行了对比测试。结果非常明确:新模型是全场最佳。

  • 评分: 在一项名为 FID 分数(衡量生成的动作与真实动作接近程度)的测试中,他们的模型得分是 11.21。这比排名第二的方法(得分为 13.83)有了显著提升,并且远优于那些得分高达 64.37 的旧款扩散模型。在 AI 领域,这里的得分越低,意味着生成的动作看起来越接近真实生活。
  • 人类测试: 他们还邀请了 12 个人观看生成的视频并进行评分。新模型在“自然度”方面平均获得了 6.58 分(满分 7 分),而排名第二的方法仅得到 4.04 分。人类评委表示,AI 生成的狗看起来确实在倾听并做出反应,而旧模型生成的狗往往只是呆站着,或者动作显得怪异、僵硬。

它目前“还不是”什么

了解这篇论文没有声称的内容也很重要。作者非常谨慎地指出,他们目前的数据库仅涵盖。他们明确提到尚未包含猫或其他宠物,因为不同动物的运动方式完全不同。此外,该模型目前无法理解拥抱或抚摸时的“力度”;它只能看到运动,而看不到物理压力。最后,该模型目前生成的片段时长约为 10 秒;它还无法一次性预测长达一小时的嬉戏过程。

核心结论

这篇论文表明,通过为 AI 提供大规模、同步的人犬互动库,并教会它将动作分解为真实的“标记”,我们终于可以让计算机生成看起来和感觉起来都真实的狗狗动画。这是让虚拟宠物不再仅仅是玩具,而是成为我们所熟知的、有血有肉的朋友的一大步。作者希望这个数据集能成为任何试图构建更好的社交机器人或能与动物互动的动画角色的研究者的标准实验场。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →