Structured 3D Latents Are Surprisingly Powerful: Unleashing Generalizable Style with 2D Diffusion
本文介绍了 DiLAST,这是一种即插即用方法,它利用预训练的二维扩散模型作为教师来引导结构化三维潜在表示的优化,从而能够实现高保真三维资产生成,并呈现出多样化、分布外且现有方法难以达成的风格。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位技艺超群的大师雕塑家(一个 3D 人工智能),他非常擅长仅凭一张照片就能制作雕像。然而,这位雕塑家有一个非常具体的问题:他只能使用在训练过程中见过的材料和风格进行创作。如果你让他制作一座看起来像“霓虹赛博朋克城市”或“水彩画”的雕像,而这些特定风格并未包含在他的训练数据中,他就会感到困惑。他可能会强行套用风格,导致雕像变得杂乱无章、支离破碎;或者他可能直接放弃,制作出一个平庸、标准的雕像。
本文介绍了一种名为DiLAST的新方法来解决这个问题。以下是其工作原理,使用简单的类比进行说明:
问题:雕塑家的盲点
当前的 3D 人工智能模型就像那位大师雕塑家。它们在几何结构(物体的形状)方面表现出色,但在处理分布外(OOD)风格时却显得力不从心。
- 局限性:如果你向它们展示一种从未见过的风格(例如某位艺术家独特的笔触),它们内部的“风格开关”就会失灵。它们无法在不破坏形状的情况下,将这种新外观转换到 3D 模型上。
解决方案:“艺术老师”(DiLAST)
作者们意识到,虽然 3D 雕塑家能力有限,但还有另一种人工智能——2D 图像生成器(如著名的 Stable Diffusion)——它见过数百万种风格,是绘画方面的专家。
DiLAST 并没有试图从零开始教 3D 雕塑家新风格(这需要耗费漫长时间),而是利用 2D 图像生成器作为老师。
以下是逐步流程:
- 设置:你给 3D 雕塑家一张椅子的照片(“内容”)和一张梵高画作的照片(“风格”)。
- 投影:3D 雕塑家构建一个粗糙、不可见的椅子 3D 骨架。
- “外观”测试:系统截取这个 3D 椅子的快照,并将其展示给 2D 艺术老师。
- 修正:2D 艺术老师查看快照后说道:“这看起来还不太像梵高的画作!笔触不对,颜色也有偏差。”
- 引导:系统利用艺术老师的反馈,微调 3D 雕塑家的不可见骨架。它不会改变椅子的形状(腿仍然是腿),但会调整“潜在代码”(数字 DNA),使纹理和颜色向梵高风格转变。
- 循环:它们反复进行这一过程。3D 模型渲染一个视图,2D 老师对其进行批评,然后 3D 模型调整其内部代码。
秘密武器:“潜在空间觉醒”
这篇论文有一个惊人的发现。他们发现,3D 雕塑家内部的“大脑”(结构化的 3D 潜在空间)实际上比任何人想象的都要强大。它完全有能力容纳这些疯狂的新风格,只是它自己不知道如何访问它们。
这就像一架拥有演奏复杂爵士乐所有琴键的钢琴,但演奏者只知道如何演奏《小星星》。DiLAST 就像指挥家,引导演奏者的手指按到正确的琴键上以演奏爵士乐,而无需购买新钢琴或花费数年重新训练演奏者。
保持形状安全
在此过程中,一个主要风险是:在试图改变风格时,人工智能可能会意外改变形状(例如,将椅子变成桌子)。为了防止这种情况,DiLAST 使用了三道安全网:
- 结构守卫:它不断检查,确保椅子看起来仍然像椅子。
- 漂浮物体清理:有时,人工智能会在 3D 空间中生成奇怪、不可见的“幽灵”团块。DiLAST 拥有专门的工具来清除这些团块。
- 颜色稳定器:它防止颜色变得失控(例如,变成亮紫色或霓虹绿,看起来像故障一样)。
结果
本文在许多不同的 3D 模型和风格上测试了该方法。
- 旧方法:当面对奇怪的新风格时,它们经常失败,要么产生破碎的 3D 物体,要么完全忽略风格。
- DiLAST:它成功地将 3D 物体绘制成各种风格,从“霓虹赛博朋克”到“折纸”再到“水彩”,即使 3D 模型从未见过这些风格。它在完全改变物体“皮肤”的同时,保持了物体形状的完美。
总结
DiLAST 是一个“即插即用”的工具。它不需要你重新训练 3D 人工智能。相反,它利用强大的 2D 人工智能作为老师,引导 3D 人工智能的内部代码,解锁了将任何艺术风格应用于任何3D 物体的能力,即使是 3D 人工智能从未接触过的风格。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。