← 最新论文
🤖 machine learning

LoST: Level of Semantics Tokenization for 3D Shapes

本文提出了 LoST(语义级分词)方法,通过引入关系互距对齐(RIDA)损失函数,将 3D 形状分词顺序按语义显著性排列,从而在显著减少分词数量的同时,实现了优于现有几何层级方法的 3D 重建质量及高效的自回归生成。

原作者: Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero, Chun-Hao Paul Huang, Duygu Ceylan, Niloy J. Mitra, Xuelin Chen

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero, Chun-Hao Paul Huang, Duygu Ceylan, Niloy J. Mitra, Xuelin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 LoST(Level of Semantics Tokenization,语义层级分词法)的新技术,旨在让计算机更聪明、更高效地“理解”和“生成”3D 形状。

为了让你轻松理解,我们可以把生成 3D 物体想象成**“用乐高积木拼出一个复杂的模型”,或者“写一本小说”**。

1. 以前的做法:笨拙的“由粗到细” (LoD)

在 LoST 出现之前,现有的 3D 生成方法(比如 OctGPT 或 VertexRegen)就像是一个只会按顺序堆砌砖块的工人

  • 它的逻辑是:先放一块大砖头(代表整体轮廓),再放几块小砖头(代表局部细节),最后放成千上万块极小的砖头(代表表面纹理)。
  • 问题所在
    • 效率低:为了拼出一个大概的“椅子”形状,工人可能需要先堆几百块砖头,结果拼出来的东西看起来还像个乱糟糟的方块,根本看不出是椅子。
    • 语义混乱:如果你只让工人拼前几块砖(比如只拼了 10%),得到的可能是一堆毫无意义的几何体,而不是一个“椅子”。这就像写小说时,前几章只写了“今天天气不错”,读者完全猜不到故事讲什么。
    • 浪费资源:为了得到高质量的结果,计算机需要处理海量的“砖块”(Token),非常消耗算力。

2. LoST 的创新:聪明的“由意到形” (Level of Semantics)

LoST 改变了这个策略。它不再按“砖块大小”排序,而是按**“重要性”和“含义”**排序。

想象一下你在教一个 AI 画一只“猫”:

  • 以前的方法:先画一个模糊的圆(头),再画几个点(耳朵),再画线条(胡须)……如果你只看到前几步,你根本不知道那是猫,可能以为是个球。
  • LoST 的方法
    • 第 1 个 Token(最核心):直接告诉 AI“这是一只猫”。哪怕只给这一个词,AI 也能立刻画出一个看起来完全像猫的轮廓(有头、有身子、有尾巴)。虽然细节(比如毛色、眼神)还没出来,但**“猫”这个概念已经立住了**。
    • 第 2-10 个 Token:开始细化。告诉 AI“这是一只橘猫”、“耳朵尖尖的”。
    • 第 11-100 个 Token:继续打磨细节。告诉 AI“左眼有点斜视”、“尾巴上有花纹”。

核心优势

  • 任意前缀可用:无论你在生成过程中停在哪里(哪怕只用了 1 个 Token),得到的结果都是一个完整、合理且符合语义的物体。
  • 极度高效:以前需要 50,000 个“砖块”才能拼出好结果,现在可能只需要 128 个 甚至更少的“砖块”就能达到同样的效果。这就像是用100 个精挑细选的关键词写了一本小说,而不是用 10 万个无意义的字符。

3. 它是如何做到的?(RIDA 魔法)

为了让 AI 学会这种“按重要性排序”的本领,作者发明了一个叫 RIDA 的训练技巧。

  • 挑战:3D 形状没有像图片那样现成的“语义标签”(比如 DINO 模型能看懂图片是猫还是狗,但很难直接看懂 3D 点云)。
  • RIDA 的解法
    • 想象有一个**“语义老师”**(DINO,一个在图片上训练得很强的 AI)。
    • LoST 训练一个**“学生”**(3D 编码器)。
    • 教学方法:老师不直接告诉学生“这是猫”,而是让学生观察:“如果两个 3D 形状在老师眼里是‘亲戚’(比如都是猫),那么它们在 3D 空间里的距离也应该很近;如果一个是猫一个是桌子,距离就应该很远。”
    • 通过这种**“关系对齐”**,学生学会了把 3D 形状按照“像不像”、“是不是同类”来重新排列顺序,而不是按照“大小”来排列。

4. 总结:这带来了什么改变?

  • 更快:生成 3D 模型的速度大幅提升,因为需要的数据量(Token)减少了 99% 以上(从几万个减少到几百个)。
  • 更聪明:生成的模型在早期阶段就具备正确的“灵魂”(语义),而不是先堆出一堆垃圾再慢慢修。
  • 更灵活:你可以随时停止生成。如果你只需要一个大概的“汽车”模型用于快速预览,生成几个 Token 就够了;如果你需要高精度的“赛车”模型,就继续生成后面的 Token。

一句话总结
LoST 就像给 3D 生成装上了一个**“智能目录”**,让计算机不再按部就班地堆砌砖块,而是先抛出最核心的“灵魂”,再逐步添加“血肉”,从而用极少的数据量创造出高质量、语义清晰的 3D 世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →