← 最新论文
💻 computer science

Zero-shot Generalizable LiDAR Semantic Segmentation via Scene-Sensor Disentanglement

本文介绍了 LiSeer,这是一个零样本可泛化的 LiDAR 语义分割框架,它通过基于扩散的场景重建和可控采样流水线,将场景内在几何结构与传感器特定的采样效应进行解耦,从而实现了鲁棒的跨传感器性能。

原作者: Shaobing Xu, Zikun Xu, Shuocheng Yang, Jiahao Wang, Keqiang Li, Jianqiang Wang

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaobing Xu, Zikun Xu, Shuocheng Yang, Jiahao Wang, Keqiang Li, Jianqiang Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何观察世界,但它不是使用眼睛,而是使用一种被称为 LiDAR 的特殊激光扫描仪。这种扫描仪发射出成千上万条看不见的激光束,来绘制出汽车、树木和建筑物的 3D 图谱。问题在于,每个机器人汽车使用的扫描仪都不同。有的可能使用 32 线激光,有的 64 线,而高端的则可能有 128 线。这就像是在试图教一个学生通过一张模糊的低分辨率照片来识别一只猫,然后期望他们在没有额外练习的情况下,能瞬间识别出同一只猫的高清 4K 照片。

目前,如果一家公司想要更换其机器人汽车的扫描仪,他们必须停止一切工作,收集数以千计的新照片(或激光扫描),并花费数月时间进行人工标注,然后从头开始重新训练机器人的大脑。这极其昂贵且缓慢。研究人员提出的核心问题是:我们能否教会机器人去理解“世界”本身,而不是仅仅记住某一种特定扫描仪的“样子”?如果我们能做到这一点,机器人就可以从 32 线扫描仪切换到 128 线扫描仪,同时依然能准确识别它所看到的东西,从而节省大量的时间和金钱。

这正是论文《通过场景-传感器解耦实现零样本泛化 LiDAR 语义分割》(简称 “LiSeer”)所解决的问题。来自清华大学的研究团队指出,机器人之所以在更换扫描仪时表现不佳,是因为它们被扫描仪本身的“噪声”所迷惑了。他们提出了一种巧妙的新方法,让机器人能够即时适应任何它从未见过的全新激光扫描仪。

核心思想:世界 vs. 相机

作者们从一个简单而强大的洞察出发:任何激光扫描仪都只是现实世界的“采样器”。把现实世界想象成一个实心的 3D 雕塑。扫描仪就像是一个筛子,它从雕塑中舀取碎片。一个 32 线扫描仪是一个孔径较大的粗糙筛子,会漏掉很多细节;而一个 128 线扫描仪则是一个精细的筛子,几乎能捕捉到一切。

问题在于,目前的机器人学习识别物体是基于筛子“捕捉”碎片的方式,而不仅仅是碎片本身。它们学习的是筛子孔洞的模式,而不是雕塑的形状。作者将世界的实际形状称为“场景固有几何”(Scene-Intrinsic Geometry, SIG),将孔洞的模式称为“传感器特定采样”(Sensor-Specific Sampling, SG)。为了让机器人真正聪明,我们需要教会它忽略孔洞(SG),而只关注雕塑本身(SIG)。

LiSeer 如何运作:“数据工厂”

为了教给机器人这一课,作者构建了一个可以创造无限训练场景的“数据工厂”。其过程如下:

  1. 重建世界: 首先,他们从一个真实扫描仪(如 32 线扫描仪)获取单次稀疏扫描,并使用一个智能 AI 模型来“填补空白”。这就像是用一支神奇的画笔在一张低分辨率素描上补全所有缺失的线条,从而创建一个高质量的密集 3D 模型。这就是“底层世界”。
  2. 随机化筛子: 一旦拥有了这个完美的 3D 模型,他们就不再仅仅使用原始扫描仪。相反,他们模拟了成千上万种不同的扫描仪。他们随机改变光束数量、扫描高度和视角角度。然后,他们用这些虚假的、随机生成的扫描仪对同一个完美的 3D 模型进行“重新扫描”。
  3. 从混沌中学习: 通过在这一连串随机扫描数据上进行训练,机器人被迫停止寻找特定的模式(例如“这个扫描仪总是漏掉汽车顶部”),转而开始寻找稳定的真相(即无论如何扫描,汽车都在那里)。

秘诀:分束器与偏振器

仅仅向机器人投喂随机数据是不够的;机器人需要帮助来理解它应该关注什么。作者在训练过程中加入了两个特殊的工具,并使用了涉及光滤镜的创意类比来描述它们:

  • 分束器 (S-Film): 想象机器人的大脑是一个信息涌入的房间。通常情况下,机器人会将“是什么”(汽车)与“如何看”(扫描仪类型)混淆。分束器是一面特殊的镜子,它将这两股流分离。它将关于扫描仪类型的信息引导至一条独立的专用路径。这释放了主脑,使其能够完全专注于场景几何,而不被扫描仪的特性所干扰。
  • 偏振器 (CBA-CL): 想象你透过两种不同颜色的眼镜观察一个场景。如果你真正理解了场景,那么无论通过哪种眼镜,物体看起来都应该是相同的。偏振器就像一个检查机器人预测结果的过滤器。如果机器人在通过 32 线模拟观察时说“那是棵树”,但在通过同一位置的 64 线模拟观察时却说“那是丛灌木”,偏振器就会说:“等等,这不合理!”它迫使机器人修正答案,直到它无论使用何种扫描仪都能保持一致。这促使机器人去学习稳定的真相。

结果:真实车辆上的魔力

团队在三个主要数据集(SemanticKITTI, Waymo, 和 nu cycles)以及三个配备了机器人从未见过扫描仪(32、80 和 128 线)的真实车辆上测试了 LiSeer。

结果令人瞩目。当一个标准机器人使用一种扫描仪进行训练,并在另一种不同扫描仪上进行测试时,其性能会大幅崩溃,跌幅高达 50% 或更多。这就像一个学生只为数学考试做准备,却因为不懂底层概念而在物理考试中挂科。相比之下,LiSeer 展示了巨大的进步。在面对未见过的扫描仪时,其准确率比标准方法提升了 25.1 到 43.6 个百分点

更令人兴奋的是,作者发现如果给 LiSeer 一点点帮助——仅需新扫描仪中 10% 到 20% 的数据——它就能达到从头开始使用 100% 新数据进行训练的机器人水平。这表明,LiSeer 仅仅通过从随机性中学习,就已经掌握了它所需知识的 80%。

这为什么重要

这篇论文表明,我们不需要每当发明一种新传感器时就去收集和标注数百万个新扫描。通过将扫描仪视为一个可变的“筛子”,并教会机器人专注于世界的“雕塑”,我们可以创建一个通用的感知系统。

虽然作者指出,在跨越完全不同的环境(例如在德国与在新加坡驾驶)时仍有约 15% 的差距需要弥补,但核心突破在于“传感器差距”已基本解决。他们已经证明,通过将世界与其观察工具进行解耦,我们可以构建出真正能够应对现实世界的机器人,无论它们佩戴着什么样的扫描仪。这可以极大地加速自动驾驶汽车的发展,并降低其在新硬件上的部署成本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →