An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers
本文介绍了一种开源的两阶段计算机视觉流水线,该流水线结合了 RT-DETR 和视觉 Transformer,用于准确分类与骑行者安全相关的六种细粒度车辆车身类型,并具有基于置信度的弃权机制,从而在不同录制场景下保持高鲁棒性,同时防止无声误分类。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在整理一大堆邮件。有些信件清楚地标着“报纸”,有些是“杂志”,有些是“垃圾邮件”。但你还有成千上万个信封,它们看起来可能是什么都有:生日卡、账单、传单,或者是律师的信。如果你只是瞎猜,可能会出错。
这篇论文描述了一种全新的、开源的“机器人分拣器”,旨在观察街道视频并将车辆分类为非常具体的类别,而不仅仅是通常看到的那些宽泛类别。
以下是该系统的运作方式,分为几个简单的步骤:
1. 问题所在:为什么我们需要更好的分拣器
目前,大多数交通摄像头和安全研究只能区分“汽车”、“卡车”或“巴士”。但对于自行车骑行者的安全而言,这还不够。
- 类比: 想象一下一名骑行者被撞了。如果是一辆小型轿车撞到了他,情况很糟糕。但如果是一辆高大的 SUV 或一辆巨大的商用卡车撞到了他,伤势往往会严重得多,因为车辆的前部更高,撞击骑行者的位置也不同。
- 差距: 我们需要知道究竟是哪种类型的车辆经过了骑行者(例如,是小型面包车还是大型厢式货车?是皮卡还是商用卡车?)。现有的工具无法在真实的、杂乱的视频中分辨出这些具体的类型。
2. 解决方案:一个两阶段的“侦探团队”
作者构建了一个两步走的系统,就像一个由两名侦探组成的协作团队。
侦探 #1:快速侦察员 (RT-DETR)
- 任务: 这名侦探快速扫描视频。它不需要知道汽车的具体型号;它只需要说:“嘿,那里有一辆车!”并在其周围画一个框。
- 专长: 它非常擅长发现任何看起来像汽车、卡车、巴士或摩托车的物体。它使用了一个预训练的“大脑”,因此它不需要从零开始学习如何识别汽车。
- 过滤器: 如果它看到巴士或摩托车,它就会停止工作。如果它看到“汽车”或“卡车”,它会将任务传递给侦探 #2。
侦探 #2:专家分类器 (Vision Transformer)
- 任务: 这名侦探会接过侦探 #1 提供的特定“裁剪图”(即框内的图像),并进行仔细观察。
- 专长: 它是细粒度的专家。它将车辆归入六个特定的类别之一:
- 乘用车 (Passenger Car)
- SUV
- 皮卡 (Pickup Truck)
- 小型面包车 (Minivan)
- 大型厢式货车 (Large Van)
- 商用卡车 (Commercial Truck)
- “我不知道”按钮: 这是最重要的部分。如果图片模糊、角度奇怪或者车辆被部分遮挡,这名侦探可能会感到不确定。它不会盲目猜测,而是遵循一条规则:“如果我的确定度低于 60%,我会说‘未知’。”
- 为什么这很重要: 在安全研究中,说“我不知道”比自信地断定“那是一辆皮卡”但实际上是一辆小型面包车要好。这可以防止产生“沉默错误”。
3. 训练:他们是如何教机器人的
教机器人区分“大型厢式货车”和“商用卡车”很难,因为在标准数据集中,这类特定卡车的照片非常少。
- 混合配方: 研究人员通过混合三类数据构建了一个自定义训练库:
- 影棚照片: 来自著名数据集 (Stanford Cars) 的高质量汽车照片。
- 网络爬取: 他们从互联网上收集了许多面包车和卡车的图片。
- 真实街景剪辑: 他们从密歇根州安娜堡市的实际视频片段中提取了车辆,向机器人展示真实的、杂乱的街道环境(如模糊、侧向视角、部分遮挡等)。
- 不平衡问题: 机器人看到的普通汽车和 SUV 图片远多于大型卡车。为了解决这个问题,训练过程进行了调整,让机器人更加关注那些稀有的卡车图片,以免忽略它们。
4. 结果:效果如何?
团队在两组不同的视频上测试了这个机器人。
测试 1:“主场作战” (分布内测试/In-Distribution)
- 设置: 他们在与训练剪辑相同的街道(安娜堡)上的视频进行测试。
- 得分: 准确率达到了 94%。
- 细节: 它在识别 SUV 方面表现出色(准确率 9 de 7%)。它在处理乘用车和皮卡方面也非常出色。唯一它感到吃力的情况是当车辆难以看清时,它正确地使用了“我不知道”按钮,而不是做出错误的猜测。
测试 2:“客场挑战” (分布外测试/Out-of-Distribution)
- 设置: 他们在完全不同的地点、使用特殊的科研自行车及不同的摄像机和光照条件下的视频上进行了测试。他们没有针对这个新地点对机器人进行重新训练。
- 得分: 准确率为 89%。
- 细节: 对于一个未经重新训练就能适应新环境的系统来说,这是一个非常强劲的结果。
- SUV 和皮卡 的准确率保持很高。
- 小型面包车 的识别变得有些棘手。准确率有所下降,但这主要是因为机器人变得更加谨慎了。它开始更频繁地表示“未知”(占 25% 的时间),因为在新的视频中,小型面包车的样子看起来有所不同。它并没有开始胡乱猜测,而是承认了不确定性。
5. 为什么这很重要
- 它是开源的: 作者免费发布了所有的代码、训练好的机器人“大脑”以及数据。任何人都可以下载并使用它来分析自己的街道视频。
- 安全第一: 通过区分小型汽车和大型卡车,城市规划者和安全研究人员终于可以了解究竟是哪种类型的车辆让骑行者面临风险。
- 无需人工干预: 在此之前,人类必须观看数小时的视频来统计这些车辆。现在,这个工具可以自动完成这项工作。
简而言之,这篇论文展示了一个聪明的、免费的工具,它像是一个两步过滤系统。首先,它寻找汽车;其次,它仔细地将它们分类。如果它不确定,它会承认,从而确保安全数据不会被错误的猜测所污染。即使在不需要重新训练的情况下,它在新的街道环境下也能表现良好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。