想象一下,你正试图仅通过观察从几个不同角度拍摄的几张照片,来构建一个老鼠、鸟或大鼠的 3D 模型。
旧方法:“火柴人”与“泥塑家”
以前,科学家有两种主要方法来实现这一目标,但两者都存在很大的问题:
- 火柴人: 他们会在每张照片中手动在动物的关节(如肘部或膝盖)上画点。这就像是通过仅仅追踪手肘和膝盖来描述一个跳舞的人。它忽略了身体的形状、毛发以及细微的动作。此外,这需要人类盯着屏幕画点好几个小时。
- 泥塑家: 他们会尝试将一个预制的 3D “泥塑模型”(模板)套在照片上的老鼠身上。如果这只老鼠做出了奇怪的动作,或者该模型是为另一种物种设计的,那么这个“泥塑”就无法匹配。而且,他们必须花费大量时间为每一帧视频进行“雕刻”(优化)模型,既慢又贵。
新方法:“姿态喷溅”(Pose Splatter)
该论文的作者创造了一种名为 Pose Splatter 的新工具。把它想象成一台高速运转的反向 3D 打印机。
它是如何工作的,以下是使用简单类比的分步说明:
1. “饼干模具”(形状雕刻)
想象你有一块柔软的粘土。你从四个或五个不同的角度照射手电筒。凡是动物挡住光线的地方,你就知道那里“一定”有粘土;而光线穿过的位置,你就知道那里“没有”粘土。
Pose Splatter 在数字层面也是如此。它利用来自摄像头的阴影(轮廓)来“雕刻”掉空白空间,从而留下动物的一个粗略、块状的 3D 形状。这就像是使用饼干模具来获取动物的大致轮廓。
2. “神奇精炼器”(神经网络)
那个块状形状还太粗糙了。因此,系统会让它通过一个聪明的计算机大脑(堆叠式 U-Net)。这个大脑会平滑这些块状物,填补空隙,并理出精细的细节,比如尾巴的曲线或羽毛的蓬松感。它将粗糙的粘土变成了光滑、细腻的 3D 物体。
3. “纸屑云”(3D 高斯喷溅/3D Gaussian Splatting)
Pose Splatter 不构建实心的网格(像线框笼一样),而是将动物变成由数百万个微小的、有颜色的、模糊的点(称为高斯点)组成的云团。
- 类比: 想象你在拍一张烟花爆炸的照片。那些火星就是这些点。每个点都有一个位置、一种颜色和一种“模糊度”(即扩散程度)。
- 当你从任何角度观察这个云团时,计算机都会将这些点融合在一起,创造出一幅完美、逼真的图像。它的速度非常快,你可以瞬间旋转动物并从新的角度观察它,而无需等待雕塑家工作。
为什么这意义重大?
- 无需人工操作: 你不需要在动物身上画点。系统会自动识别形状。
- 无需模板: 它不需要预制的“老鼠模型”。它只需通过观察视频,就能学习大鼠、小鼠或鸟类的形状。
- 超快: 它可以在标准计算机芯片上运行,且占用极少的内存。它处理一帧视频大约只需 30 毫秒。
- “神奇透镜”(视觉嵌入): 系统还会为动物的姿态创建一个特殊的“身份证”。这张“身份证”捕捉的不只是关节的位置,还有整个形状和纹理。
- 测试: 研究人员让 102 个人观察一个老鼠的姿态,并让他们在另外两个姿态中选出看起来最相似的一个。即使 Pose Splatter 的“身份证”并不了解具体的关节,但它在寻找匹配姿态方面比旧有的“火柴人”方法表现得更好。因为它理解了姿态的“神韵”。
他们证明了什么?
他们在小鼠、大鼠和斑胸谷育成鸟(一种鸟类)的视频上进行了测试。
- 它构建了看起来真实的精确 3D 形状。
- 它能预测动物在原始视频中不存在的摄像机视角下会是什么样子。
- 它能捕捉到极其细微的动作(比如鸟儿轻微地蓬起羽毛,或小鼠轻微地歪头),而旧方法会错过这些细节。
底线
Pose Splatter 是一种将平面视频转化为 3D 电影的新方法,无需人类在上面画图,也不需要计算机工作数小时。它捕捉了动物的全身和细微动作,使得科学家研究动物如何移动和行为变得更加容易。
技术摘要:Pose Splatter
问题陈述
准确且可扩展地量化动物的姿态与外观,对于神经科学研究至关重要,特别是用于研究与神经系统疾病相关的细微行为变化。目前的 3D 姿态估计技术面临显著局限性:
- 基于关键点的方法依赖于稀疏的解剖学地标,需要耗费大量人力的手动标注,且无法捕捉完整的身体几何形状、颜色或纹理。
- 基于网格(Mesh)的方法虽然提供了完整的表面重建,但通常需要逐帧优化,需要专门的模板模型(如 SMAL),并且往往难以泛化到未见的姿态或不同物种。
- 现有的 3D 高斯泼溅(3DGS)方法通常依赖于单场景优化或假设存在密集的视角重叠,这使得它们不适用于视角间重叠极小的稀疏视角动物重建。
这些瓶颈阻碍了大规模、纵向的行为分析,而这类分析对于在高分辨率下绘制基因型、神经活动与行为之间的关系至关重要。
方法论:Pose Splatter
Pose Splatter 是一个前馈框架,它利用形状雕刻(shape carving)和 3D 高斯泼溅(3DGS)技术,在无需手动标注、无需逐帧优化以及无需物种特定模板的情况下,重建实验室动物完整的 3D 姿态与外观。
核心流水线
- 掩码生成(Mask Generation): 系统利用预训练的 Segment Anything Model (SAM2) 从多视角视频帧中生成前景掩码,消除了对手动标记的需求。
- 姿态与旋转估计: 为确保旋转不变性,系统通过对掩码质心的鲁棒三角测量来估计动物的 3D 中心。方位角旋转通过拟合动物质量分布的 3D 高斯分布的主轴得出,并随时间平滑追踪。
- 形状雕刻(Shape Carving): 多视角掩码被反向投影到一个共享的 3D 体素网格中,以创建一个粗略的“视觉轮廓(visual hull)”。位于视觉锥交集之外的体素将被移除。颜色根据可见性和加权平均值分配给剩余体素,以处理遮挡问题。
- 精细化与去体素化(Refinement and De-voxelization):
- 一个堆叠的 3D U-Net 架构对粗略的体素体积进行精细化,生成占用通道及额外的特征通道。
- 一个紧凑的多层感知器(MLP)处理体素特征,以预测 3D 位移向量、协方差矩阵和外观特征。
- 至关重要的是,高斯的均值位置是通过将预测的位移添加到体素坐标来计算的,从而有效地实现了表示的“去体素化”,以捕捉细粒度的几何形状。
- 渲染: 生成的 3D 高斯参数使用标准的高斯泼溅进行渲染,以产生高保真度的图像。
视觉嵌入技术
为了促进下游的行为分析,作者提出了一个旋转不变的视觉嵌入:
- 渲染: 将 3D 高斯场景从分布在动物周围球体上的 32 个虚拟相机进行渲染。
- 编码: 每个 224×224 的渲染图通过预训练的 ResNet-18 以提取 512 维特征向量。
- 球面谐波展开: 特征使用截断的球面谐波基进行展开。为了实现对水平(方位角)旋转的不变性,使用了谐波系数的平方模,从而消除了相位依赖性。
- 对抗性 PCA: 为了消除残留的特定方位角编码(可能由光照不均引起),应用了对抗性 PCA 来寻找一个 50 维子空间,该子空间在最大化姿态方差的同时,最小化预测旋转角的正弦和余弦的能力。
核心贡献
- 无标注 3D 重建: Pose Splatter 在无需手动标注地标的情况下恢复完整的 3D 动物几何形状和外观,解决了基于关键点的可扩展性问题。
- 无模板且无需优化: 与基于网格的方法不同,该模型通过单次前馈传递进行推理,不需要物种特定的模板或逐帧优化。
- 稀疏视角鲁棒性: 该框架专为视角间重叠极小的稀疏视角设置(4–6 个摄像头)而设计,而现有的前馈 3DGS 方法在这种情况下的表现通常较差。
- 高效性: 该模型具有较低的显存占用(约 2.5 GB VRAM),并实现了约 30 ms/帧的推理速度,明显快于基于优化的基准方法。
- 旋转不变嵌入: 所提出的视觉嵌入提供了一个紧凑的、低维的姿态与外观描述符,该描述符对动物位置和水平旋转具有不变性,适用于行为分析。
实验结果
作者在小鼠、大鼠和斑胸 Finch(斑胸谷 Finch)的数据集上评估了 Pose Splatter。
- 渲染质量: 在 IoU、L1 颜色误差、PSNR 和 SSIM 等指标上,Pose Splatter 优于最先进的稀疏视角 3DGS 基准方法(包括 3DGS、FSGS 和 GaussianObject)以及前馈方法(PixelSplat、MVSplat)。值得注意的是,虽然像 GaussianObject 这样的优化方法达到了相当的指标,但它每个场景需要大约一小时的优化,而 Pose Splatter 仅需约 30 ms。
- 泛化能力: 该模型展示了强大的跨物种泛化能力。在一种物种(如小鼠)上训练的模型可以重建另一种物种(如大鼠)的未见视图,且性能下降幅度较小,这表明学习到的表示捕捉到了通用的动物形状特征。
- 行为分析:
- 最近邻偏好: 在一项包含 102 名参与者的研究中,尽管关键点是基于手动标注数据导出的,但视觉嵌入在识别相似姿态方面优于基于 3D 关键点的最近邻(54% 对 50%)。
- 细微运动检测: 视觉嵌入成功捕捉到了姿态的细微变化,例如羽毛扩张和头部摇晃,这些变化反映在嵌入的主成分中。
- 下游预测: 尽管不需要人工监督,但视觉嵌入在利用逻辑回归预测手动标注行为方面,表现优于 3D 关键点(在 8 种行为中的 6 种)。
重要性与主张
论文声称,Pose Splatter 通过消除手动标注和计算优化的瓶颈,能够实现大规模、纵向的动物行为分析。通过提供准确的 3D 几何形状和旋转不变的视觉描述符,该框架有助于深入理解行为的遗传和神经基础。
作者承认了局限性,指出当前方法是为单体记录设计的,在多动物交互中可能会在长时间遮挡的情况下遇到困难。他们还指出,虽然视觉嵌入非常有效,但仍需进一步工作以提高其可解释性和直接的跨物种比较能力。然而,该框架代表了向高分辨率行为量化迈出的重要一步。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。