← 最新论文
💻 computer science

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

本文介绍了 UrbanWorld2.0,这是一个智能体多模态框架,它利用迭代自反思和多样化的基础工具来生成高保真、城市规模的 3D 环境,与现有方法相比,具有更优越的现实对齐度和感知质量。

原作者: Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,为电影制作人、游戏设计师和科学家创造一个逼真的数字世界一直是一个梦想。几十年来,构建这些环境的过程在很大程度上依赖于人工。艺术家必须手动放置每一棵树、每一条路和每一栋建筑,这是一个缓慢且昂贵的过程,限制了虚拟城市可以变得多么宏大或精细。虽然计算机在生成图像方面已经变得更加出色,但要制造出看起来并感觉起来都真实的整个城市仍然是一个重大障碍。挑战不仅在于绘制漂亮的图片,还在于构建一个布局合理、纹理真实且规模足够大以用于训练机器人或模拟交通的空间。为了解决这个问题,研究人员正在转向一种新的方法,将计算机程序不仅视为工具,而且视为能够进行规划、检查自身工作并从错误中学习的智能助手。

来自清华大学的一个研究小组推出了一个名为 UrbanWorld2.0 的系统,旨在自动生成与现实世界高度一致的高保真、城市规模的 3D 环境。与以往经常产生脱节网格、粗糙纹理或建筑物悬浮在空中的方法不同,这个新框架创建的整个城市景观已准备好用于沉浸式媒体和机器人技术。该系统通过扮演数字建筑师的角色来运作,它从现实世界的数据(如地图和街景照片)开始,并使用一系列智能步骤从头开始构建一座城市。它不仅仅是猜测城市应该长什么样;相反,它收集信息、想象缺失的细节、批判自己的创作,并不断优化它们,直到它们准确且视觉效果惊艳。

该过程始于系统收集来自现实世界的原材料。它从开源地图中提取地理数据,以了解道路和建筑的位置,并收集全景街景图像,以观察这些建筑实际的样子。然而,这些原始图像通常充满了遮挡视线的汽车、树木或施工设备。系统的第一项工作是充当一名细心的编辑,移除这些障碍物并选择最清晰的建筑视图。然后,它进入“想象”阶段,填补空白。由于单张街道照片无法展示建筑物的背面或顶部,系统利用先进的人工智能在有限的视觉线索基础上,在脑海中重建结构的完整三维形状,推断其体积和建筑风格。

一旦系统对建筑物有了清晰的心理图像,它就会生成实际的 3D 模型。这是该框架独特设计闪光之处。该系统并不是一次性创建整个城市(这往往会导致错误),而是逐件构建。它创建每栋建筑的形状,然后在上面绘制高质量的纹理,最后将其精确地放置在数字城市中原本在现实世界中的位置。一个关键部分是内置的“反思”机制。在生成一栋建筑后,系统会扮演一名严厉的批评家,检查其作品是否存在缺陷。它会检查结构是否符合物理常识、纹理是否看起来真实,以及是否遵循了原始指令。如果系统发现了错误,例如窗户与墙壁未对齐或屋顶看起来变形,它会自动修复错误并重试。这种创作与自我纠正的循环持续进行,直到结果达到高质量标准。

其结果令人瞩目。在与生成 3D 城市的其他方法进行测试时,UrbanWorld2.0 生成的场景明显更加真实且连贯。在直接对比中,该系统的输出在超过 86% 的情况下优于现有技术。生成的城市拥有精确的形状和细腻的表面,道路连接逻辑合理,并且包含了如路灯和交通标志等精细元素,且位置正确。该系统还成功集成了动态元素,如模拟交通和移动车辆,创造了一个生动的环境而非静态模型。这种细节和准确性的水平表明,该系统可以有效地弥合数字模拟与物理世界之间的差距,而这种能力对于训练自动驾驶汽车和机器人在复杂的城市环境中导航至关重要。

通过将现实世界数据与多步骤、自我纠正的工作流相结合,UrbanWorld2.0 证明了在不牺牲质量的情况下,实现大规模、真实感 3D 世界的自动化创建是可能的。该系统并不依赖于限制创造力的僵化预设规则,也不依赖于难以获取的大量训练数据。相反,它利用了一个灵活且智能的过程,模仿人类设计师处理项目的方式:收集参考资料、构思草图、审查作品并进行改进。这一突破为数字孪生的未来提供了充满希望的基础——届时整个城市可以被高精度地模拟——同时也为具身智能的发展奠定了基础,即让机器能够在看起来和行为起来都与我们自身环境极其相似的环境中学习运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →