← 最新论文
🤖 AI

Real-Time Semantic Segmentation with Optimized RetinaNet Architectures for Embedded Automotive Systems

本文介绍了 Opt-RetinaSeg,这是一种基于 RetinaNet 优化而来的语义分割架构,它采用轻量化骨干网络、精简的特征金字塔网络(FPN)以及三阶段优化流水线,旨在资源受限的嵌入式车载平台上实现实时、高精度的性能。

原作者: Sai Sidharth D

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Sidharth D

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一辆汽车,它看到的不仅仅是模糊的形状,而是一张精细的地图,其中的每一个像素都清晰地知道自己是什么:行人、车道线、停止标志或是一片天空。这就是“语义分割”的梦想,它是让自动驾驶汽车做出瞬时、救命决策的超能力。但问题在于:这种视觉背后的“大脑”通常是庞大且贪婪的计算机,需要巨大的电源插座和宽敞凉爽的房间才能运行。然而,真正的汽车内部挤满了微小的、对能量极度渴求的计算机,无法承受如此繁重的任务。这个科学领域的关键问题是:我们如何在不让它们“失明”的情况下,将这些巨大的、聪明的脑袋缩小到足以装进汽车仪表盘的大小?这篇论文正是在解决这个难题,它探索了如何将一个强大的视觉系统进行“瘦身”,并使其在现代汽车中微小的芯片上实现闪电般的运行。

由 Sai Sidharth D 领导的论文作者们决定尝试一个聪明的技巧。他们采用了一个著名的计算机视觉设计——RetinaNet(最初是设计用来像鹰盯着老鼠一样识别物体的),并将其重新构思,使其能够绘制出完整的道路全景,而不仅仅是画出物体的方框。他们将这一新成果命名为 Opt-RetinaSeg。把 RetinaNet 想象成一支高端的专业摄影团队:它擅长发现目标,但由于设备沉重,动作缓慢。团队提出了疑问:“如果我们保留这支团队最好的直觉,但把他们的沉重设备换成轻便、灵活的背包呢?”

为了实现这一点,他们不仅缩小了摄影团队,还重建了整个运作流程。首先,他们用一个混合轻量化特征提取器替换了标准的、重型的“骨干网络”(即负责视觉重活的部分)。想象一下一支建筑施工队,他们使用小型、高效的无人机来扫描建筑物的简单、开阔部分,只有在需要检查复杂、棘手的角落时,才会切换到强壮、经验丰富的专业人工团队。这种混合方法在保持视觉敏锐度的同时,将系统的重量减少了约 73%。

接下来,他们重新组织了团队的沟通方式。原始设计中的“特征金字塔网络”(FPN)就像一个经理在非常高且冗余的塔楼里上下传递纸条。作者意识到,这座塔楼的高层大部分都是空的,只是在浪费能量。于是,他们砍掉了不必要的顶层并简化了信息传递,使团队沟通得更快、更少混乱。他们还调整了“损失函数”——也就是那个给学生评分的老师。在道路场景中,有数百万个属于“道路”或“天空”的像素,但属于“行人”或“交通标志”的像素却很少。旧的老师会对容易的“道路”像素感到厌倦,从而忽略那些稀有且重要的像素。新的老师使用了一种特殊的“焦点损失”(focal loss)策略,这就像一位严格的教练,专门针对那些在困难题目(稀有物体)上挣扎的学生进行纠正,确保汽车不会因为看到了太多的空旷道路就忽略了一个小小的骑行者。

但神奇之处并不止于设计。团队应用了一个三阶段的“压缩流水线”,像为旅行打包行李一样,将模型压缩得更小:

  1. 剪枝(Pruning): 他们切掉了 40% 的“通道”(内部路径),这些路径几乎没做什么工作,就像移除高速公路上闲置的车道。
  2. 量化(Quantization): 他们将数学运算从沉重、精确的小数(浮点数)切换到了简单、快速的整数(INT8),这类似于从高清视频流切换到清晰、高效的标准清晰度视频,加载速度极快。
  3. 知识蒸馏(Knowledge Distillation): 这是最有趣的部分。他们让一个巨大的、超级聪明的“教师”网络(一个庞大的 ResNet-101 模型)去教导这个微小的、经过压缩的“学生”模型。学生学会了模仿老师的直觉,从而找回了在剪枝和压缩过程中可能丢失的准确性。

结果如何?当他们在真实世界的驾驶数据(来自 Cityscapes 和 BDD100K 数据集)上进行测试,并在实际的汽车硬件(NVIDIA Jetson Xavier NX 和 Qualcomm QCS610 芯片)上运行后,数据令人印象深刻。该模型在理解场景方面达到了 73.9% 的准确率(以 mIoU 衡量),同时运行速度达到了 70.4 帧每秒 (FPS)。为了让你理解,原始的沉重版本只能达到约 9.4 FPS。这意味着实现了 7.4 倍的加速!模型体积也缩小了 4 倍,使其足够小,可以装入汽车的计算机中,且几乎没有损失精度(与沉重基准相比,精度下降不到 3%)。

论文表明,这种方法证明了基于 RetinaNet 的架构在经过系统优化后,是实现实时驾驶的可行方案。他们展示了你不需要从头发明一种全新的大脑;有时,你只需要拿出一个经过验证的大脑,给它修剪一下发型,教它变得高效,然后让它在现有的汽车硬件上运行。作者指出,虽然该模型既快速又准确,但未来的工作可以包括让它对特定的汽车芯片更加感知,或者帮助它记住上一帧的内容,以减少视频中的闪烁现象。不过就目前而言,他们已经证明了一个轻量化、经过优化的视觉系统可以清晰地观察道路,其速度足以保障安全,且体积小到可以装进手套箱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →