← 最新论文
💻 computer science

InterMesh: Explicit Interaction-Aware End-to-End Multi-Person Human Mesh Recovery

InterMesh 是一个端到端的多人人体网格恢复框架,它通过人体 - 物体交互检测器和轻量级模块,显式地融入结构化的人 - 环境交互语义,与现有的基于隐式注意力的方法相比,显著提升了复杂交互场景下的姿态和形状估计精度。

原作者: Kaili Zheng, Kaiwen Wang, Xun Zhu, Chenyi Guo, Ji Wu

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaili Zheng, Kaiwen Wang, Xun Zhu, Chenyi Guo, Ji Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过观察一张单张照片,来猜测一群人在做什么。

旧方法:“猜谜游戏”
以前,计算机试图通过逐个查看照片中的人来推断 3D 人体形状(如数字骨架和皮肤)。它们会说:“好的,这个人站在这里,那个人在那边。”它们试图仅通过观察姿势来猜测彼此之间的关系。

但这就像试图在嘈杂的房间里只听一个人的声音来理解对话。如果有人拿着行李箱,或者两个人正在拥抱,计算机往往会感到困惑。它可能会认为某人的腿弯曲得奇怪,因为它看不到对方正拿着的行李箱;或者它可能会忽略两个人正在互动,因为它只是孤立地观察他们的身体。

新方法:InterMesh(“社交侦探”)
这篇论文介绍了一种名为InterMesh的新系统。将 InterMesh 想象成一名侦探,它不仅仅观察人,还观察整个场景以及万物之间的关系。

以下是其工作原理,使用一个简单的类比:

  1. “社交雷达”(HOI 检测器):
    在计算机尝试构建 3D 身体之前,它使用一种特殊工具(预训练检测器)扫描图像并询问:“谁拿着什么?”以及“谁在和谁玩耍?”

    • 示例: 它看到一个人和一个行李箱,并说:“啊,他们正在拿着行李箱。”
    • 示例: 它看到两个人,并说:“他们正在一起玩耍。”
      这为计算机提供了一份旧方法所遗漏的社交线索“作弊表”。
  2. “语境翻译器”(语境交互编码器):
    计算机收集所有这些线索(拿着、玩耍、站在附近)并进行整理。这就像一位翻译,将杂乱无章的八卦清单转化为清晰的故事。它推断出,如果 A 拿着行李箱,B 就不可能站那个行李箱里。它将所有互动之间的点连接起来。

  3. “修正器”(交互引导修正器):
    最后,计算机回到构建 3D 身体的过程中。但这一次,它利用那些整理好的线索来修正错误。

    • 结果: 如果计算机正准备画出一只悬浮在半空中的手臂,“社交雷达”会说:“等等,那只手臂正拿着一个杯子!”计算机随即把手臂调整到正确的位置。

为什么这很重要?
作者在许多不同的数据集(照片和视频集合)上测试了该系统,其中人们正在进行复杂的活动:进行体育运动、在人群中行走,或与物体互动。

  • 得分: 在这些测试中,InterMesh 的错误率显著低于以往最好的方法。
    • 在一个数据集(CMU Panoptic)上,它将错误减少了近10%
    • 在另一个数据集(Hi4D)上,它将错误减少了超过8%

核心结论
InterMesh 就像将计算机的视觉从“我看到一个人”升级为“我看到一个人正在用某物做某事"。通过明确教导计算机理解互动(如拿着杯子或拥抱朋友),它能够构建更准确、更逼真的 3D 人体模型,特别是在那些难以看清事物的拥挤或复杂场景中。

该论文声称,这是第一种将此类“互动线索”直接添加到构建 3D 人体模型过程中的方法,从而在无需改变整个系统架构的情况下带来更好的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →