Ordered Diffusion for 3D Human Registration
本文介绍了 ODin,一种新颖的 3D 人体配准方法,它通过带有点序的 3D 扩散过程将对齐建模为合理几何结构的分布,从而克服了传统基于回归的方法的局限性,实现了最先进的精度并显著提高了推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图构建一个完美的 3D 人体模型,但你手里只有一堆杂乱、不完整的点(即点云),这些点是从一个真人身上采集而来的。这是计算机视觉领域的一个巨大挑战,在这个领域中,计算机学习如何“看见”并理解三维世界。几十年来,科学家们一直试图通过将其视为一个数学问题来解决这个问题:他们假设存在一种唯一的、完美的方法,可以将一个标准的身体模板拉伸以拟合这些杂乱的点。但在现实世界中,情况是混乱的。摄像机会出错,人可能会被遮挡,我们的皮肤和肌肉也会以一种并非完全可预测的方式蠕动和拉伸。试图强行套用一个单一的“平均”答案往往会导致奇怪且不符合常理的身体形态——比如一条腿消失了,或者一只手臂穿过了胸部。
为了解决这个问题,研究人员转向了一种被称为“扩散模型”的新型 AI。你可以将这些模型想象成一台神奇的去噪机器。想象一张被静态雪花噪声覆盖的照片;扩散模型学习如何一步步地擦掉这些雪花,直到清晰的图像显现出来。通常,这些模型被用于从零开始创造新的艺术品。但如果我们不仅能用它们来创造,还能用它们来“修复”呢?如果我们能拿出一个带有噪声、破碎的 3D 扫描件,并利用这种“去噪”魔法来推断出其下方最有可能、最真实的形状,甚至在部分缺失的情况下也是如此,那会怎样?这就是这篇论文要解决的核心问题:与其猜测一个单一的答案,我们能否教会计算机去构想出一系列合理的、真实的各种可能性?
问题所在:失败的“平均”猜测
长期以来,计算机科学家尝试通过将 3D 人体配准(或对齐)视为一个回归任务来解决问题。简单来说,他们是在问计算机:“这是一个杂乱的人体扫描件;请告诉我们标准身体模板上每一个点的精确位置。”
问题在于,这种方法假设只有一个正确答案。但在现实世界中,情况并非如此。如果摄像头漏掉了人的左臂,或者这个人穿着宽松的衣服,计算机并不知道那只手臂究竟应该在哪里。当被迫只能选择一个答案时,计算机通常会陷入恐慌并选择一个“平均”猜测。它可能会把缺失的手臂放在原本应在的位置与躯干之间,导致生成的身体看起来像是在融化,或者一条腿卡在了肚子里面。这就像试图通过平均所有你见过的云朵来猜测某朵云的确切形状;你得到的只会是一个看起来不像任何真实物体的团块。
解决方案:ODin,“有序”的梦想家
该论文的作者 Mattia Masiero 及其团队决定不再索要一个答案,而是开始索要一个“分布”。他们构建了一个名为 ODin(有序扩散)的新系统。
把 ODin 想象成一位非常聪明、非常有耐心的雕塑家,他从一块完全混乱(纯噪声)的黏土块开始。ODin 不会试图一次性雕刻出最终形状,而是通过一步步剥离噪声,逐渐显露出下方的身体。但这里的魔力在于:与其他可能虽然找对了形状却丢失了“哪个部位对应哪个点”的方法不同,ODly 保持着严格的顺序。它知道列表中的第 50 个点必须始终是左肘,第 100 个点必须是右膝。这种“有序性”至关重要,因为它允许计算机将杂乱的扫描件完美地映射回标准的真人身体模板。
ODin 如何“看”世界
为了引导这个去噪过程,ODin 使用了三种不同类型的线索,即“条件约束”,来告诉噪声该往哪里走:
- 全局视角 (Global): 它观察整个扫描件以理解整体轮廓。这是一个高个子还是矮个子?
- 局部细节 (Local): 它观察特定位置。如果扫描件显示了一个肩膀,它就会告诉肩膀附近的噪声:“嘿,你需要移动到这里。”
- 身份标识 (Positional): 它记住了每一个点的“身份证”。它知道第 1 号点是鼻子,第 689 号点是左脚,因此永远不会在位置归属上产生混淆。
论文指出,通过结合这三种线索,ODin 可以引导噪声点到达它们正确的位置,即使无法完美看到整个身体。即使扫描件中缺失了某个肢体,ODin 也不会仅仅进行平均猜测;它会从各种可能性的分布中进行采样。这意味着它可以生成几个不同的、真实的缺失肢体版本,而不是一个破碎的、平均化的版本。
研究发现
团队在真实世界的数据上测试了 ODin,包括那些人体肢体缺失或仅部分可见的扫描件。结果令人印象深刻:
- 更高的准确度: ODin 优于现有的最佳方法(如 NICP),显著降低了误差。在 DFAUST 数据集的测试中,OD-in 在(最终精修前)达到了 1.15 cm 的误差,而之前的最佳方法为 1.47 cm。
- 速度更快: 它不仅更准确,而且更快。ODin 完成配准大约需要 9 秒,而旧方法需要 35 秒。这实现了超过三倍的加速。
- 处理缺失部分: 当扫描件中缺少一条腿时,旧方法通常会产生一个看起来像残桩或穿过身体的“幽灵腿”。然而,ODin 生成了一个尊重缺失信息的真实姿态,创造了一个看起来并不破碎且合理的身体形状。
作者还进行了一项“假设”实验。他们尝试移除“局部”线索(详细的局部检查)或“顺序”(点的身份标识)。当这样做时,系统完全失效了。如果没有顺序,身体会坍塌成一团乱麻;如果没有局部细节,形状会变得过于模糊。这证明了所有这三种成分对于这项“魔法”的成功运作都是必不可少的。
核心结论
这篇论文表明,将 3D 人体配准视为寻找唯一正确答案的“猜谜游戏”是一条死胡同。相反,通过使用扩散模型来探索各种可能性,我们可以创建出不仅更准确、而且更真实的 3D 模型,即使输入数据是杂乱或不完整的。虽然作者指出,他们的系统在面对极其拥挤的环境(如摆满家具的房间)时可能仍会遇到困难,但他们为我们如何教计算机理解现实中不完美的人体开辟了一扇新的大门。他们认为,这种生成式方法是一个充满前景的新方向,它让我们从僵化的、平均化的猜测,转向灵活且智能的重建。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。