← 最新论文
🤖 AI

Human-in-the-Loop Atlas-Based 3D Asset Segmentation for Interactive Content Workflows

本文提出了一种通过结合贪婪视图选择、基于 SAM 2 和 Label Studio 的交互式分割以及反向投影,将 3D 模型转化为分段 2D 参数化图集的人机回环流水线,从而为交互式内容工作流中的材质分配和风格迁移等下游任务提供高效支持。

原作者: Paul Julius Kühn, Saptarshi Neil Sinha, Jakob Hansen, Robin Horst

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Paul Julius Kühn, Saptarshi Neil Sinha, Jakob Hansen, Robin Horst

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图为一个巨大的、复杂的雕塑上漆,但你手里拿的不是画笔,而是必须用一张巨大的、平整的纸将整个雕像完美地包裹起来,使其贴合每一个曲线和凸起。这就是 3D 资产分割(3D asset segmentation)的世界——这是计算机图形学的一个领域,艺术家和工程师试图将数字模型切割成有意义的部分,以便对其进行着色、纹理化或动画处理。把 3D 模型想象成一座复杂的乐高城堡;如果要只改变窗户或屋顶的颜色,你需要准确知道哪些乐高积木属于窗户,哪些属于屋顶。长期以来,计算机在自动完成这项工作时一直很吃力,经常会被奇特的形状或看起来千篇一律的平滑表面所迷惑。虽然智能计算机程序(称为“基础模型”)在识别二维平面照片中的物体方面已经变得非常出色,但在被要求如何切分 3D 物体以符合特定的视频游戏或虚拟现实体验时,它们仍然会出错。这就是为什么研究人员正在寻找一种更好的方法:一种让程序能够让位于人类引导的方法,将 AI 的速度与人类专家的敏锐眼光结合起来。

本文介绍了一种巧妙的新型流水线,它就像一个由机器人和人类艺术家组成的高科技团队来解决这个难题。来自 Fraunhofer IGD 的研究人员创建了一个系统,该系统首先确定完美的相机角度,从各个可能的侧面拍摄 3D 物体的照片,确保没有任何角落被遗漏。他们称之为“贪婪集合覆盖策略”(greedy set cover strategy),这是一种高级说法,意思是指计算机在玩一场“如何用最少的照片看清整个物体”的游戏。一旦有了这些照片,它就会使用一个强大的 AI 工具——SAM 2 来预测物体的不同部分在哪里。但转折在于:计算机并不是独自完成这项工作。人类会介入检查 AI 的工作,修正错误并在 AI 感到困惑的地方重新绘制线条。最后,计算机将所有这些经过修正的 2D 图形像定制贴纸页一样重新包裹回 3D 模型上,创建一个“分割图谱”(segmented atlas)。这个图谱是一个平面地图,其中的每一个微小方块都清楚地知道自己属于 3D 物体的哪个部分,为下一步制作视频游戏或电影做好准备。

团队在八件不同的文化遗产对象上测试了这种方法,范围从米开朗基罗的《大卫》大理石头像到维多利亚时代的椅子以及一把中世纪的长剑。他们发现,该系统对于大面积、清晰的区域表现得非常好,但在处理微小细节、深孔或与邻近部分看起来完全相同的部位时,仍然需要人工干预。例如,在《大卫》雕像上,AI 可以轻松识别头发和脖子,但细小的眼睛和耳朵需要人类手动绘制,因为大理石过于光滑且缺乏对比度。同样,对于带有中空底部的椅子,摄像机很难看到黑暗的角落,因此需要额外的手动操作。在整个过程中,每个物体耗时在 15 到 35 分钟之间,较复杂的雕像耗时更长。结果表明,虽然 AI 是一个巨大的助力,但它目前并不完美;最好的结果来自于“人机协同”(human-in-the-loop)的方法,即由计算机承担繁重的工作,而人类进行精细调整。作者认为,这种方法是为创建交互式内容迈出的坚实且可行的步伐,尽管他们承认它并不是能自动解决所有问题的魔杖。他们计划未来用更多的人员进行测试,以观察它在真实专业环境中的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →