想象一下,你正试图仅通过观察一张单张照片,来猜测一群人在做什么。
旧方法:“猜谜游戏”
以前,计算机试图通过逐个查看照片中的人来推断 3D 人体形状(如数字骨架和皮肤)。它们会说:“好的,这个人站在这里,那个人在那边。”它们试图仅通过观察姿势来猜测彼此之间的关系。
但这就像试图在嘈杂的房间里只听一个人的声音来理解对话。如果有人拿着行李箱,或者两个人正在拥抱,计算机往往会感到困惑。它可能会认为某人的腿弯曲得奇怪,因为它看不到对方正拿着的行李箱;或者它可能会忽略两个人正在互动,因为它只是孤立地观察他们的身体。
新方法:InterMesh(“社交侦探”)
这篇论文介绍了一种名为InterMesh的新系统。将 InterMesh 想象成一名侦探,它不仅仅观察人,还观察整个场景以及万物之间的关系。
以下是其工作原理,使用一个简单的类比:
“社交雷达”(HOI 检测器):
在计算机尝试构建 3D 身体之前,它使用一种特殊工具(预训练检测器)扫描图像并询问:“谁拿着什么?”以及“谁在和谁玩耍?”
- 示例: 它看到一个人和一个行李箱,并说:“啊,他们正在拿着行李箱。”
- 示例: 它看到两个人,并说:“他们正在一起玩耍。”
这为计算机提供了一份旧方法所遗漏的社交线索“作弊表”。
“语境翻译器”(语境交互编码器):
计算机收集所有这些线索(拿着、玩耍、站在附近)并进行整理。这就像一位翻译,将杂乱无章的八卦清单转化为清晰的故事。它推断出,如果 A 拿着行李箱,B 就不可能站进那个行李箱里。它将所有互动之间的点连接起来。
“修正器”(交互引导修正器):
最后,计算机回到构建 3D 身体的过程中。但这一次,它利用那些整理好的线索来修正错误。
- 结果: 如果计算机正准备画出一只悬浮在半空中的手臂,“社交雷达”会说:“等等,那只手臂正拿着一个杯子!”计算机随即把手臂调整到正确的位置。
为什么这很重要?
作者在许多不同的数据集(照片和视频集合)上测试了该系统,其中人们正在进行复杂的活动:进行体育运动、在人群中行走,或与物体互动。
- 得分: 在这些测试中,InterMesh 的错误率显著低于以往最好的方法。
- 在一个数据集(CMU Panoptic)上,它将错误减少了近10%。
- 在另一个数据集(Hi4D)上,它将错误减少了超过8%。
核心结论
InterMesh 就像将计算机的视觉从“我看到一个人”升级为“我看到一个人正在用某物做某事"。通过明确教导计算机理解互动(如拿着杯子或拥抱朋友),它能够构建更准确、更逼真的 3D 人体模型,特别是在那些难以看清事物的拥挤或复杂场景中。
该论文声称,这是第一种将此类“互动线索”直接添加到构建 3D 人体模型过程中的方法,从而在无需改变整个系统架构的情况下带来更好的结果。
技术摘要:InterMesh
问题陈述
现有的端到端多人人体网格恢复(HMR)方法,特别是那些基于 DETR 框架的方法,通常通过跨人体查询的自注意力机制隐式地建模人体间的关系。尽管这些方法行之有效,但它们缺乏对人体如何与物体以及彼此进行交互的显式推理。因此,在涉及严重遮挡或复杂的人 - 环境交互场景中,当仅凭视觉外观线索存在歧义时,它们往往难以应对。此外,当前的流程常常忽视由人 - 物交互(HOI)提供的丰富语义上下文,而 HOI 在现实世界场景中十分普遍。本文认为,HMR 模型应超越隐式推理,显式地利用交互信息——包括人体间交互和人 - 物交互——以改善姿态和形状估计。
方法论
作者提出了 InterMesh,这是一个将人 - 环境交互信息显式集成到端到端 HMR 流程中的框架。该架构建立在标准的 DETR 风格编码器 - 解码器结构之上(具体遵循 SAT-HMR 的设计),但引入了新颖的模块来处理交互语义。
核心组件
HOI 检测器集成:
InterMesh 利用预训练的零样本人 - 物交互(HOI)检测器(具体为 EZ-HOI)来提取交互特征。与仅关注物体的传统 HOI 检测不同,该框架中的检测器将“物体”广义地定义为既包括无生命物品也包括其他人。对于每个预测的人体边界框,系统将其与所有检测到的人体和物体边界框配对,形成密集的人 - 环境对。随后,HOI 检测器为这些配对提取交互特征(例如“拿着”、“玩耍”)。
上下文交互编码器(CIE):
为特定人体查询提取的原始交互特征由 CIE 进行处理。该模块对所有与该个体相关的交互特征应用多头自注意力(MHSA)。其目标是建模围绕单个人的各种交互之间的内部结构和语义依赖关系(例如,一个人对行李箱的交互与其对他人的交互之间的关系)。这生成了具有上下文感知能力的交互特征。
交互引导细化器(IGR):
细化后的人体查询表示由 IGR 进行更新,IGR 采用多头交叉注意力(MHCA)。在此机制中,人体查询作为查询(query),而经过上下文增强的交互特征作为键(key)和值(value)。这使得模型能够选择性地关注最具信息量的交互线索,在人体查询表示进入下一个解码器层或回归头之前,将结构化的环境语义直接整合到其中。
训练策略:
该模型采用两阶段策略进行训练。首先,使用 SAT-HMR 检查点进行初始化,并在大规模数据集组合(AGORA、BEDLAM、COCO 等)上进行训练。在第二阶段,在特定的基准数据集(3DPW、Hi4D、CHI3D)上进行微调。损失函数结合了标准的 HMR 损失(姿态、形状、关节、相机参数)与交互感知组件,利用匈牙利匹配算法进行预测与真值之间的二分图匹配。
主要贡献
本文概述了三个主要贡献:
- 显式交互建模: InterMesh 被提出为第一种将人 - 环境交互建模显式纳入基于查询的端到端 HMR 流程的方法。它利用预训练的零样本 HOI 检测器引入结构化的交互令牌,编码人 - 物交互和人体间交互语义。
- 新颖的架构模块: 作者引入了上下文交互编码器和交互引导细化器。这些轻量级模块旨在以最小的开销将结构化交互特征整合到人体查询细化过程中,使模型能够推理场景上下文。
- 最先进的性能: 该方法在多个基准测试中取得了最先进的结果,证明了在周围上下文中建模人体能够产生更准确、更逼真的网格预测。
实验结果
作者在五个数据集上评估了 InterMesh:3DPW、MuPoTS、CMU Panoptic、Hi4D 和 CHI3D。
- 3DPW: 与之前的最佳方法(SAT-HMR)相比,InterMesh 将 PA-MPJPE 降低了 1.8 毫米(4.3%),MPJPE 降低了 0.7 毫米(1.1%),PVE 降低了 2.7 毫米(3.7%)。
- MuPoTS: 该方法将 PCK(Match)提高了 0.2%,PCK(All)提高了 0.9%。
- CMU Panoptic: 观察到平均 MPJPE 显著降低了 8.3 毫米(9.9%)。在具有挑战性的“披萨”场景中,MPJPE 降低了 11.3 毫米。
- Hi4D: InterMesh 优于现有的交互式重建方法,将 MPJPE 降低了 4.2 毫米(8.2%),PA-MPJPE 降低了 2.6 毫米(6.8%),PVE 降低了 5.5 毫米(8.8%)。
- CHI3D: 与之前的 SOTA 方法相比,该方法实现了 2.4 毫米的 MPJPE 降低。
消融研究证实,人体间特征和人 - 物特征均有助于性能提升,其中人 - 物特征提供了特别显著的增益。研究还表明,在解码器层的更早阶段集成这些特征能产生更好的结果。
意义与主张
本文声称,InterMesh 弥合了以人体为中心的建模与环境语义之间的差距。通过超越纯粹基于外观的推理,该框架证明了来自 HOI 检测的语义线索可作为强有力的互补信号,用于处理涉及遮挡、邻近性和协作动作的挑战性场景。
作者强调,他们的方法为上下文感知的 3D 人体感知开辟了新视角。虽然承认局限性——例如缺乏显式的时序建模以及两阶段 HOI 检测过程带来的计算开销——但他们认为,他们的工作激发了未来朝着更全面、更具场景感知能力的人体重建方向的努力。本文并未声称解决所有 HMR 挑战,但强调显式交互建模是改善复杂交互环境中准确性的一个关键且此前被忽视的方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。