← 最新论文
💻 computer science

LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs

LiDARDraft 是一个新颖的框架,它通过将文本、图像和草图等多样化输入统一为 3D 布局,以此引导基于 range map 的 ControlNet,从而通过生成逼真且多样化的 LiDAR 点云,实现对自动驾驶环境可控的“从零开始的模拟”。

原作者: Haiyun Wei, Fan Lu, Yunwei Zhu, Zehan Zheng, Weiyi Xue, Lin Shao, Xudong Zhang, Ya Wu, Guang Chen

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Haiyun Wei, Fan Lu, Yunwei Zhu, Zehan Zheng, Weiyi Xue, Lin Shao, Xudong Zhang, Ya Wu, Guang Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人如何开车。为了安全起见,机器人在真正接触真实的转向盘之前,需要在虚拟世界中练习数百万英里。但构建这些虚拟世界既困难又昂贵。通常,工程师必须在 3D 计算机程序中手动放置每一棵树、每一栋建筑和其他车辆,这需要耗费大量时间。这就是一种被称为“生成式人工智能”的特殊计算机科学派上用场的地方。把它想象成一位超级聪明的艺术家,它看过数百万张照片,现在可以画出看起来非常真实的全新图像。科学家们一直试图教这位艺术家使用激光雷达(LiDAR)来绘制 3D 地图,激光雷达是自动驾驶汽车用来观察 3D 世界的“眼睛”。面临的大挑战在于,虽然这位艺术家很擅长绘画,但它非常不擅长遵循特定的指令。如果你对它说“画一个繁忙的十字路口”,它可能会画出一片森林,或者把汽车放在天空中。这就像是在给一位只说另一种语言的厨师提供食谱;结果往往是一团糟。

这就是同济大学的一个研究小组所解决的问题,他们开发了一个名为 LiDARDraft 的新工具。他们希望找到一种方法,让人们能够通过简单的输入,如一段文字、一张随手拍的照片,甚至是一个粗略的草图,来创建逼真的 3D 驾驶场景,而无需成为 3D 建模专家。他们的秘密武器是一个被称为“3D 布局”(3D layout)的聪明中间人。想象一下你正在用乐高积木搭建一座城市。你不需要尝试将每一个积木都雕刻得像真正的汽车或树木那样精致,你只需要使用简单的方块:一个代表汽车的红色盒子,一个代表灌木的绿色椭圆,以及一个代表道路的扁平灰色平面。这个简单的“乐高蓝图”很容易制作,但它包含了所有关于物体位置和属性的重要信息。LiDARDraft 使用这个乐高蓝图作为桥梁。它将你的简单输入(例如一段文本描述)转化为这种乐高布局,然后使用一个特殊的引导器(称为 ControlNet)来精确地告诉 AI 艺术家如何将这些简单的方块转化为详细且逼真的 3D 激光扫描图。

研究人员发现,这种方法的效果出奇地好。通过强制 AI 遵循这个“乐高蓝图”,他们能够生成高质量的 3D 点云(数字 3D 地图),并且完全符合用户的指令。例如,如果你输入“我前面有一辆车,左边有一棵树”,系统就会创建一个具有完全相同排列、形状和位置的场景。他们通过文本、图像甚至现有的 3D 扫描进行了测试,在每种情况下,他们的方法都比之前的尝试表现得更好,因为之前的尝试经常会添加随机的假车,或者把道路布局搞错。该团队展示了该系统甚至可以根据一张街道照片生成完整的 3D 驾驶模拟,或者根据一个粗略的草图填充进逼真的细节。

这种灵活性之处在于它极其出色。研究人员证明,你只需通过移动布局中的“乐高方块”就可以编辑场景。如果你想从模拟中移除一辆车,只需从蓝图中删除那个红色的盒子,AI 就会立即重新生成不含那辆车的场景,同时保持其他部分的一致性。他们还发现这种方法非常高效;它不需要每次都从头开始重新训练,从而节省了大量的计算能力。在测试中,该系统只需 5,000 步就能学会遵循这些布局指令,这与从零开始相比是一个巨大的进步。结果表明,我们正越来越接近这样一个未来:只需用简单的英语进行描述或展示一张快速拍摄的照片,就能构建出整个自动驾驶训练世界,这使得教机器人开车的过程变得更快、更便宜、也更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →