← 最新论文
💻 computer science

WeatherOcc3D: VLM-Assisted Adverse Weather Aware 3D Semantic Occupancy Prediction

WeatherOcc3D 提出了一种新颖的框架,该框架利用视觉 - 语言模型(VLM)根据语言天气线索动态调节相机与激光雷达的融合,从而有效解决恶劣条件下的传感器可靠性问题,并显著提升了在 nuScenes 数据集上的 3D 语义占据预测性能。

原作者: A. Enes Doruk, Abdelaziz Hussein, Hasan F. Ates

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: A. Enes Doruk, Abdelaziz Hussein, Hasan F. Ates

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图驾驶汽车穿越城市,但你有两位截然不同的向导在帮你观察前方的道路。

  • 向导 A(摄像头) 就像一位人类摄影师。他们擅长在晴朗的白天识别颜色、读取路牌和发现行人。但是,如果开始倾盆大雨或夜幕漆黑,他们的视野会变得模糊、褪色,或被眩光致盲。
  • 向导 B(激光雷达) 就像一只使用回声定位的蝙蝠。他们发射不可见的波束来测量距离和形状。他们在黑暗或雾中识别几何结构方面表现出色,但暴雨会散射他们的波束,产生“静电”或噪声,使他们感到困惑。

问题:“信任”困境
大多数自动驾驶汽车试图通过简单平均这两位向导的意见来结合它们。但这就像要求摄影师和蝙蝠在不考虑天气的情况下给出一个单一答案。如果是雨夜,摄影师毫无用处,而蝙蝠则陷入困惑。简单的平均法仍然会听取那位困惑的摄影师的意见,导致汽车犯错。

解决方案:“智能翻译器”
这篇论文介绍了一个名为 WeatherOcc3D 的新系统。可以将该系统视为一位精通“天气”和“技术”的 智能翻译器

  1. 翻译器(VLM/CLIP): 该系统使用一个预训练的人工智能(称为视觉 - 语言模型),它阅读了数百万本书籍并观看了数百万张图片。它知道“雨夜”或“晴天”意味着什么。它不仅仅查看像素,而是理解天气的“故事”。
  2. 开关(门控机制): 根据翻译器的判断,系统会切换开关。
    • 场景:晴天。 翻译器说:“天气明亮清晰!”系统完全信任摄影师(摄像头),因为色彩清晰锐利。它忽略蝙蝠(激光雷达)粗糙的边缘。
    • 场景:雨夜。 翻译器说:“天气黑暗潮湿!”系统意识到摄影师已失明。它立即切换为信任蝙蝠(激光雷达)来获取形状和距离,同时让摄影师“闭嘴”,不要提供模糊的色彩信息。
  3. 结果: 汽车不再得到混乱的平均值,而是通过只听取当前表现最佳的向导的意见,获得清晰可靠的路况图像。

测试方法
研究人员在一个名为 nuScenes 的著名驾驶数据集上测试了这个“智能翻译器”。他们选取了两个现有的高性能自动驾驶“大脑”(称为 OccMambaM-CONet),并将他们的新翻译器接入其中。

  • 得分: 在自动驾驶领域,得分称为 mIoU(衡量汽车理解 3D 世界准确度的指标)。
    • 原始的"OccMamba"大脑得分为 25.2
    • 加入新翻译器后,得分为 26.3
    • 原始的"M-CONet"大脑得分为 20.1
    • 加入新翻译器后,跃升至 21.1

重要性
该论文声称,这种方法是一种“即插即用”的升级。它不需要重建整个汽车计算机系统。它仅增加极少的延迟(约 2 毫秒),但在天气恶劣时使汽车显著更安全、更准确。它通过让一个理解语言和天气的人工智能来决定在任一时刻信任哪个传感器,从而解决了“我该信任谁?”的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →