技术摘要:一种用于神经蒙皮的测地线切割单元先验
1. 问题陈述
线性混合蒙皮(LBS)是实时角色动画的标准方法,它依赖于由蒙皮权重驱动的骨骼变换。传统上,这些权重是通过人工制作的,这是一个劳动密集型的过程。自动化的方法通常分为两类,每类都有显著的局限性:
- 几何方法: 如有界双调和权重(BBW)或测地线体素绑定(Geodesic Voxel Binding)等方法具有鲁棒的泛化能力并满足物理特性(平滑性、局部性),但缺乏语义感知。它们往往无法区分具有不同物理特性的材料(例如刚性装甲与柔软皮肤),并且可能产生过度平滑的结果,从而忽略了语义边界。
- 数据驱动方法: 神经网络可以从带有蒙皮的数据集中学习语义细微差别,但经常难以泛化到分布外(out-of-distribution)的几何体。在没有显式几何引导的情况下,它们往往无法维持基本的蒙皮特性,例如局部性。
现有的弥合这一差距的尝试面临着计算瓶颈。鲁棒的几何先验(例如体积测地线)通常需要昂贵的体积网格化(四面体或切割单元)和优化,这使得在大规模训练流水线中应用变得难以实现。相反,较快的近似方法(例如基于体素的测地线或基于笼子的坐标)往往会引入拓扑伪影,例如将空间上接近但测地线上不同的部分合并(例如将手部跨越狭窄间隙绑定到躯干)。
2. 方法论:切割单元图蒙皮
作者提出了切割单元蒙皮(Cut-Cell Skinning),这是一种旨在为“野外(in-the-wild)”网格高效计算并作为归纳偏置集成到神经蒙皮架构中的几何先验。
2.1 图构建
为了避免生成计算成本极高的完整体积网格,该方法构建了一个切割单元图(G=(V,E)),利用图测地线来近似体积测地线距离。该图由三个顶点集组成:
- VM: 输入表面网格的顶点。
- VI: 位于网格内部的规则体素网格的内部顶点。
- VS: 网格边缘与网格表面相交的交点。
构建过程高效且鲁棒,依赖于两个可并行的子程序:
- 射线投射(Ray Casting): 通过网格投射轴对齐射线,以识别交点并分割射线段。
- 广义绕数(Generalized Winding Number): 查询每个射线段的中点,以确定其位于网格内部还是外部。这避免了对水密(watertight)网格要求的脆弱性,并能处理非流形几何体。
边(E)连接内部体素顶点,连接表面交点与底层网格三角形,并包含原始网格边。这种结构确保了图填充了体积,同时保留了物理接近但测地线分离的区域(例如手指或肢体靠近身体的部分)之间的分离性。
2.2 计算蒙皮先验
一旦构建了图,即可按如下方式计算蒙皮先验:
- 骨骼采样: 在每根骨骼沿线进行采样。
- 源识别: 识别距离这些采样点最近的图顶点作为源顶点。
- 距离传播: 使用 Dijkstra 算法计算所有源顶点到图中每个顶点的最短路径(图测地线)距离。
- 权重转换: 使用核函数(类似于测地线体素绑定)将这些距离转换为未归一化的蒙皮权重,然后进行缩放以确保单位分解(partition of unity)。
对于无法到达图的顶点(例如在不连通的网格组件中),该方法回退到到最近 k 根骨骼的欧几里得距离。
2.3 与神经网络的集成
切割单元先验通过替换现有几何先验(通常是基于体素的测地线)或将先验与学习特征进行拼接,集成到最先进的神经蒙皮模型(RigNet、UniRig 和 Puppeteer)中。网络随后被训练以预测几何先验与地面真值(ground truth)之间的残差,或将先验与语义特征进行融合。
3. 核心贡献
- 切割单元图近似: 一种新型、快速且鲁棒的方法,用于在任意网格上近似体积测地线距离,而无需昂贵的体积网格化。它比基于优化的求解器(如 BBW)快 2 到 4 个数量级,且明显快于构建四面体或切割单元网格。
- 对拓扑伪影的鲁棒性: 不同于可能会桥接狭窄间隙的体素方法,切割单元图保留了靠近但不同的表面区域之间的拓扑分离,从而提供了更准确的距离估计。
- 变形空间评估: 作者引入了一种新的评估指标——静止-后变形误差(Edef),该指标衡量动画下变形网格的位置误差,而非仅仅是权重空间的误差。该指标能更好地捕捉由于顶点被错误分配给远处关节而导致的“粘连(sticking)”伪影。
- 数据集整理: 本文识别并剔除了标准 Articulation-XL 2.0 数据集中显著的冗余(近重复项和训练-测试重叠),提供了一个经过严格去重处理的评估划分。
4. 结果
该方法在 Articulation-XL 2.0 数据集(包括原始版本和去重版本)上对三种基准架构进行了评估:RigNet、UniRig 和 Puppeteer。
- 定量改进: 集成切割单元先验一致地提升了所有基准模型的性能。
- 在 RigNet 上,该方法使平均 L1 误差降低了 15%,并将变形误差(Edef)降低了 29%。
- 在 UniRig 上,改进更为显著,在去重测试集上,L1 误差和 Edef 分别降低了 48%。
- 在 Puppeteer(纯学习型方法)上,先验提供了持续的增益,使 Edef 降低了约 10%。
- 效率: 切割单元图的构建速度比 fTetWild 和 Mandoline 等体积网格化工具快几个数量级。例如,构建分辨率为 64 的图仅需 0.029 秒,而 fTetWild 需要 13.37 秒。
- 定性结果: 可视化表明,增强后的模型生成的蒙皮权重能更好地遵循语义部件边界和几何局部性,从而在关节大幅旋转期间产生更稳定的变形,并减少伪影。
5. 重要性与主张
本文主张几何推理与语义学习是互补的。通过引入一种快速、鲁棒的几何先验,作者证明了数据驱动方法可以在不牺牲变形物理合理性的情况下,实现最先进的泛化能力。
这项工作的意义在于:
- 可扩展性: 提供了一种在计算上可行的几何先验,适用于大规模机器学习工作流,克服了传统体积方法的瓶颈。
- 泛化性: 展示了注入几何归纳偏置有助于神经网络泛化到未见的拓扑结构和合成网格(例如来自文本生成 3D 模型)。
- 评估严谨性: 强调了标准权重空间指标的局限性,并提出了一种能更好反映动画视觉质量的变形空间指标。
作者承认了一些局限性,例如对不构成实体区域的倒置三角形或薄壳的敏感性,并指出对于无法到达的顶点回退到欧几里得距离有时会导致错误的绑定,尽管下游网络通常可以通过语义理解来纠正这些问题。