← 最新论文
💻 computer science

GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation

该论文提出了 GaussianGPT,一种基于 Transformer 的自回归模型,它通过向量量化将 3D 高斯原语压缩为离散令牌,并利用因果 Transformer 进行逐 token 生成,从而实现了具有可控性和上下文感知能力的显式 3D 场景生成。

原作者: Nicolas von Lützow, Barbara Rössle, Katharina Schmid, Matthias Nießner

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicolas von Lützow, Barbara Rössle, Katharina Schmid, Matthias Nießner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 GaussianGPT 的新方法,它的核心目标是:像写小说一样,一步步地“写”出完整的 3D 世界。

为了让你轻松理解,我们可以把生成 3D 场景的过程想象成**“用乐高积木搭建一个巨大的室内模型”**。

1. 以前的做法 vs. 现在的做法

  • 以前的做法(扩散模型):像“从一团迷雾中雕刻”
    目前的很多 3D 生成技术(比如扩散模型)就像是你手里有一团巨大的、模糊的云雾。你需要不断地“吹气”(去噪),让云雾慢慢变清晰,最后显现出一个房间。

    • 缺点:如果你想修改房间的一角,或者想把这个房间无限延伸,这团云雾就会变得很乱,很难控制。它是一次性把整个画面“洗”出来的,缺乏灵活性。
  • GaussianGPT 的做法(自回归生成):像“写小说”或“搭乐高”
    作者提出的 GaussianGPT 换了一种思路。它不是一口气生成整个房间,而是像写故事一样,一个词一个词地写,或者一块积木一块积木地搭

    • 核心逻辑:它先决定“这里有一面墙”,然后基于这面墙,决定“墙旁边放个沙发”,再决定“沙发前面有个茶几”。每一步都基于上一步的结果。
    • 比喻:这就好比大语言模型(LLM)写文章,它预测下一个字是什么。GaussianGPT 预测的是下一个 3D 空间位置该放什么物体

2. 它是怎么做到的?(三个关键步骤)

为了让计算机能像写文章一样“写”3D 场景,作者做了三个巧妙的转换:

第一步:把复杂的 3D 世界变成“乐高说明书”(压缩与离散化)

3D 场景里充满了无数微小的细节(比如 3D 高斯点),直接处理太复杂了。

  • 比喻:想象你要把一座城市传给千里之外的人。你不会把每一块砖都传过去,而是把城市切成一个个小方块(体素),然后给每个方块贴上一个**“乐高积木编号”**。
  • 操作:作者用一种特殊的“编码器”,把复杂的 3D 场景压缩成一张离散的网格图。每个格子里不再是复杂的数学公式,而是一个简单的数字(Token),代表“这里有椅子”或“这里是空的”。

第二步:把 3D 网格变成“文字序列”(序列化)

计算机里的 Transformer(类似 GPT 的模型)擅长处理一维的序列(比如句子),不擅长直接处理 3D 空间。

  • 比喻:想象你要把一座 3D 大楼变成一长串文字。作者发明了一种**“贪吃蛇”式的阅读顺序**(XYZ 顺序)。它从左下角开始,像蛇一样蜿蜒向上、向右、向前,把 3D 空间里的每一个格子都排成一列。
  • 关键点:虽然顺序是乱的(比如相邻的格子在序列里可能离得很远),但作者给模型加了一个**"3D 罗盘”(3D 旋转位置编码)**。这就像给每个积木贴上了 GPS 坐标,让模型知道:“虽然这个积木在句子的第 100 个位置,但它在空间上其实紧挨着第 99 个位置”。

第三步:像写故事一样生成场景(自回归生成)

现在,模型手里有一串“积木编号”的序列。

  • 生成过程
    1. 模型先看“开头”(BOS 标记)。
    2. 它预测:“下一个位置应该是‘地板’"。
    3. 接着预测:“再下一个位置应该是‘墙’"。
    4. 再预测:“再下一个位置应该是‘窗户’"。
    5. 就这样,它一步步把整个房间“写”了出来,直到遇到“结束”(EOS)标记。

3. 这个方法有什么超能力?

因为它是“一步步写”出来的,所以它拥有传统方法没有的超能力

  • 无限续写(Outpainting)

    • 场景:你生成了一个 4x4 米的房间,觉得太小了,想把它变成 12x12 米的大厅。
    • GaussianGPT:它不需要重新生成。你只需要告诉它:“接着刚才那个墙角继续写”。它就能顺着逻辑,自然地延伸出走廊、更多的房间,而且风格完全一致,就像故事自然发展一样。
  • 智能补全(Completion)

    • 场景:你只给了模型半个房间(比如只有一半的墙和地板),想让它把剩下的一半补全。
    • GaussianGPT:它把已有的部分当作“故事的前半段”,然后自动预测“后半段”应该长什么样。它可以补全被遮挡的家具,甚至补全整个房间的布局,而且补出来的部分和原来部分严丝合缝。
  • 可控性

    • 你可以控制生成的“随机性”(温度参数)。想要一个完全确定的房间?调低随机性。想要充满惊喜的创意房间?调高随机性。

4. 总结

GaussianGPT 就像是把3D 建模变成了写小说

  • 它不再试图一次性“变”出一个完美的世界。
  • 它通过**“压缩成乐高编号 -> 排成一列 -> 像写故事一样预测下一个积木”**的方式,让计算机学会了理解 3D 空间的结构和逻辑。

这种方法不仅生成的画面更清晰、结构更合理,更重要的是,它让修改、延伸和补全 3D 场景变得像编辑文档一样简单自然。这为未来的虚拟现实、游戏设计和机器人模拟打开了一扇新的大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →