← 最新论文
💻 computer science

AnyStyle: Single-Pass Multimodal Stylization for 3D Gaussian Splatting

AnyStyle 是一个前馈框架,通过将多模态(文本和视觉)调节集成到现有骨干网络中,实现了零样本、无姿态的 3D 高斯泼溅重建与风格化,在保持几何质量的同时提供了卓越的风格可控性。

原作者: Joanna Kaleta, Bartosz Świrta, Kacper Kania, Tomasz Trzciński, Przemysław Spurek, Marek Kowalski

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Joanna Kaleta, Bartosz Świrta, Kacper Kania, Tomasz Trzciński, Przemysław Spurek, Marek Kowalski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图构建一个真实世界房间的 3D 模型的设计师,但你手里只有几张从随机角度拍摄的模糊照片,而且你并不确切知道拍摄时相机站在什么位置。长期以来,利用这些杂乱的线索来构建一个完美的 3D 世界就像是在蒙着眼睛玩一场巨大的拼图游戏;计算机需要花费数小时进行繁琐的数学运算,才能推算出墙壁和家具的形状。但最近,一种被称为“3D 高斯泼溅”(3D Gaussian Splatting)的新技术改变了游戏规则。把这种方法想象成不是用坚实的砖块,而是用数百万个漂浮在空间中的、带有颜色的小巧、蓬松的云朵(高斯体)来绘制场景。当你从不同角度观察它们时,它们会融合在一起,看起来像是一个坚实且逼真的物体,而且速度极快。这意义重大,因为这意味着我们终于可以在几秒钟内,而不是几小时内,为视频游戏或电影创造出 3D 世界。

然而,这里有一个问题。虽然这些新技术可以快速构建出房间的“形状”,但它们却很难轻松地改变其“外观”以匹配特定的艺术风格,比如将一张客厅的照片变成梵高的油画或赛博朋克城市。以前的尝试要么速度太慢,要么需要计算机为每一种新风格都从头开始重新学习整个房间,或者只能通过展示一张图片来复制某种风格,从而无法让你说:“让它看起来更像是一幅边缘柔和的水彩画。”正是为了解决这个问题,名为“AnyStyle”的新论文应运而生。

AnyStyle 的研究人员构建了一个聪明的全新系统,让你能够将那些杂乱、未经构图的照片,瞬间转化为一个具有全新艺术风格的 3D 世界,且只需一次极速的传递过程。这个神奇的技巧在于,你不仅可以向计算机展示一张风格图片,还可以直接输入一段描述,比如“让它看起来像是一幅带有厚重木炭笔触的素描”或者“把它变成一个霓虹灯闪烁的赛博朋克场景”。该系统能够理解图像和文字,并将两者结合起来,引导那些 3D 云朵呈现出正确的形状和色彩。

要理解他们是如何实现的,请想象计算机的大脑被分成了两个团队。第一个团队是一个“冻结”的专家,它永远不会改变;它的唯一任务就是观察你的照片,并搞清楚几何结构——即墙壁、地板和物体在哪里。这个团队既可靠又快速,因为它已经在成千上万个场景中接受过训练。第二个团队是“艺术家”,它是自由实验的。这个团队从第一个团队那里获取形状信息以及风格指令(来自你的文本或图像),然后进行绘画。他们设计的精妙之处在于一个特殊的“注入”机制。他们并没有强迫艺术家重新学习如何观察世界,而是简单地将风格指令像一张秘密便条一样,滑入艺术家的工作流中。这张便条告诉艺术家如何精确地调整颜色和纹理,而不会破坏房间的形状。由于形状专家是冻结的,且艺术家模型非常轻量化,整个过程可以在极短的时间内完成——具体来说,对于每张输入图像,时间不到 0.1 秒。

论文表明,这种方法相比之前的尝试有了显著的改进。虽然其他试图一次性完成此任务的系统往往难以遵循复杂的指令,或者需要计算机每次都从头开始训练,但 AnyStyle 使用了一个预训练模型,并在其之上添加了一个小巧且灵活的层。研究人员通过让人们对比 AnyStyle 与其他顶尖方法的生成结果进行了测试。结果显而易见:人们更青睐 AnyStyle 生成的图像,因为它们看起来更符合预期的艺术风格,同时又保留了原始场景的细节。该系统还证明了它能同样出色地处理文本和图像,允许用户通过结合参考图和诸如“让色彩更柔和”之类的文本提示来微调风格。

简而言之,作者发现,通过将“理清形状”的任务与“应用风格”的任务分离,并使用一种不会破坏现有系统的智能方式来注入风格指令,他们可以瞬间创造出高质量的、风格化的 3D 世界。他们不仅仅是提出了这种可能性,还进行了测量,证明了他们的方法比目前的尖端工具效果更好,且无需数小时的训练时间。这意味着在不久的将来,你可能只需要拍几张卧室的照片,就能瞬间看到它变成水彩画、漫画场景或未来主义城市的样子,而无需等待计算机进行数小时的数据运算。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →