← 最新论文
🤖 AI

Extend3D: Town-Scale 3D Generation

本文提出了一种名为 Extend3D 的免训练单图 3D 场景生成流水线,通过扩展潜在空间、结合单目深度先验与 SDEdit 迭代优化、引入“去噪”(under-noising)概念以及针对子场景动态的 3D 感知优化,实现了从单张图像生成大规模城镇级 3D 场景。

原作者: Seungwoo Yoon, Jinmo Kim, Jaesik Park

发布于 2026-04-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Seungwoo Yoon, Jinmo Kim, Jaesik Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Extend3D 的新技术,它的核心目标是:只给你一张普通的 2D 照片,就能帮你变出一个巨大、完整且细节丰富的 3D 世界。

想象一下,你手里有一张梵蒂冈城的照片,Extend3D 不仅能让你“走进”这张照片,还能让你看到照片里看不到的背面、被遮挡的角落,甚至把整个城市像乐高一样在三维空间里搭建起来。

为了让你更容易理解,我们可以用几个生活中的比喻来拆解这项技术:

1. 核心难题:为什么以前的方法做不到?

以前的 3D 生成模型就像是一个只会做小蛋糕的烘焙师

  • 局限性:它们被训练用来生成单个物体(比如一个杯子、一辆车),而且“模具”(潜空间)的大小是固定的。
  • 后果:如果你试图用这个做小蛋糕的模具去烤一个巨大的“城市蛋糕”,结果要么蛋糕变得模糊不清(像低像素图),要么只能切出一小块,剩下的部分根本做不出来。而且,以前的方法通常是把做好的小块拼在一起,拼缝处会有明显的裂痕,或者物体方向乱飞。

2. Extend3D 的三大绝招

为了解决这个问题,作者团队设计了三个巧妙的步骤:

第一招:把模具“无限拉伸”并切成重叠的拼图

  • 比喻:想象你要画一幅巨大的壁画,但你的画笔只能画巴掌大的区域。
  • 做法:Extend3D 把原本固定的“模具”在长和宽的方向上无限拉长。然后,它不是一次画完,而是把这块大画布切成很多互相重叠的小方块(Patches)
  • 神奇之处:这些方块不是各自为战,而是像一群互相聊天的邻居。左边方块的生成过程会参考右边邻居的进度,反之亦然。这种“重叠交流”确保了拼出来的画面没有裂痕,细节也能对齐。

2. 第二招:先画“骨架”,再填肉(利用先验知识)

  • 比喻:如果你让一个画家凭空画一座复杂的城堡,他可能会把塔楼画在半空中,或者把地板画没了。
  • 做法:Extend3D 不会从零开始瞎猜。它先利用一个“单目深度估计器”(一种 AI 眼镜),从你的 2D 照片里提取出一个粗糙的 3D 点云骨架(就像建筑的钢筋结构)。
  • 关键创新(去噪/Under-noising)
    • 通常的 AI 修复是把模糊的地方加噪点再变清晰。
    • 但 Extend3D 发现,照片里被遮挡的地方(比如树后面的房子)其实是“缺失”的。它发明了一种叫 "Under-noising"(少加噪/反向去噪) 的技巧。
    • 通俗解释:它把那些“缺失的空白”看作是额外的噪音。AI 的任务不是消除噪音,而是把这些“缺失的噪音”也当成需要填补的内容,从而自然地“长”出被遮挡的建筑部分,而不是强行填补。

3. 第三招:边画边修正(3D 感知优化)

  • 比喻:就像雕塑家一边雕刻一边拿尺子量,确保雕像不会歪,也不会和照片里的光影对不上。
  • 做法:在生成的过程中,AI 会不断拿生成的 3D 模型和原始照片、以及那个“骨架”做对比。
  • 作用:如果发现生成的地板消失了,或者物体旋转了奇怪的角度,它会立刻调整,确保生成的 3D 世界既符合照片的样子,又符合物理逻辑(比如地板是平的,物体是稳的)。

3. 最终效果如何?

  • 规模大:它能生成像“梵蒂冈城”这样宏大的场景,而不仅仅是单个物体。
  • 细节多:能看清远处的地标和小建筑,没有模糊一片。
  • 无接缝:因为采用了重叠交流机制,生成的 3D 场景像是一个整体,没有拼凑感。
  • 补全能力强:能把照片里被树挡住、被墙遮住的部分合理地“脑补”出来。

总结

Extend3D 就像是一个拥有“透视眼”和“无限画布”的超级建筑师。

它不再受限于只能做小物件,而是通过把大任务拆成重叠的小任务先搭好骨架再填肉、以及边画边纠错这三步走,成功地把一张普通的 2D 照片,变成了一座可以随意探索的、细节丰富的 3D 城市。这项技术不需要重新训练模型(Training-free),直接利用现有的 AI 能力就能实现,大大降低了制作 3D 内容的门槛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →