← 最新论文
💻 computer science

A Comparative Study of Faster R-CNN, Mask R-CNN, and YOLOv8 for Object Detection and Instance Segmentation, with a Custom-Class Transfer-Learning Case Study

本文通过一个定制的军事车辆案例研究,对用于目标检测和实例分割的 Faster R-CNN、Mask R-CNN 以及 YOLOv8 进行了理论与定性的对比分析,证明了在不断演进的实时检测架构背景下,轻量级单阶段检测器可以通过迁移学习有效地适应新类别,同时在性能上超越了仅在通用数据集上训练的两阶段模型。

原作者: Muhammad Usman Aslam

发布于 2026-09-21✓ Author reviewed ⓘ
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Usman Aslam

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,机器正在学习如何不仅将世界视为颜色和形状的集合,而是将其视为一个充满不同物体的场景。这个被称为目标检测的领域,是让自动驾驶汽车能够识别行人、安全摄像头能够发现入侵者,或医疗扫描仪能够识别肿瘤的技术。为了让机器实现这一点,它必须同时完成两项艰巨的任务:它必须找到物体在图片中的位置,并且必须准确判断该物体是什么。多年来,研究人员一直在争论教计算机完成此任务的最佳方法。一些方法就像一位细心的检查员,缓慢而有条理地扫描图像,以确保每一个细节都是正确的;而另一些方法则像是一次快速的瞥视,通过单次处理整个场景来优先考虑速度。工程师面临的核心问题是如何在这种追求完美准确性与追求足以进行实时工作的速度之间的权衡中寻找平衡。

西佛罗里达大学的穆罕默德·乌斯曼·阿斯兰姆(Muhammad Usman Aslam)最近的一项研究通过测试三种旨在“看”世界的不同计算机系统,探讨了这种平衡。该研究对比了两种采用阶段式工作的既定方法(其中一种还可以绘制物体的精确轮廓),以及一种更快速、能一次性处理所有图像的新型方法。这项研究不仅仅是在标准测试图像上比较这些系统;它还解决了一个标准测试经常忽略的实际问题:当机器遇到它从未被教导识别的物体时会发生什么?为了回答这个问题,研究人员训练了一个快速的现代系统来识别军用装甲车,这是一个在大多数用于训练计算机视觉模型的标准图像库中并不存在的类别。

调查首先从研究 Faster R-CNN、Mask R-CNN 和 YOLOv8 这三个系统的构建方式开始。前两个系统采用的是两步走的过程。首先,它们扫描图像以寻找可能包含物体的区域,然后分析这些特定区域以确定物体的类型及其边缘。Mask R-CNN 增加了第三步,使其能够绘制每个物体的像素级精确轮廓,从而将其从背景和其他重叠物体中分离出来。这些方法以高准确性著称,但需要更多的计算能力和时间。第三种系统 YOLOv8 则采取了不同的方法。它通过单次处理观察整个图像,同时预测每个物体的位置和类型。这种设计旨在追求速度,使其成为视频监控等实时应用的理想选择,尽管在历史上,它在处理非常微小或拥挤的物体时被认为精确度略低。

为了在现实世界中测试这些系统,研究人员使用了一组包含人物、汽车和动物等常见物品的标准图像集,以观察预训练系统的表现。当 Faster R-CNN 系统看到甲虫图像时,它正确识别了它们,但也产生了关于同一位置属于“昆虫”类的较低置信度的猜测,这表明当不同类别的物体发生重叠或看起来非常相似时,系统有时会遇到困难。当看到一只鸟的照片时,系统在称其为“鸟”、“动物”或某种特定类型的鸟之间犹豫不决,这揭示了其词汇量仅限于最初学习的 80 个特定类别。Mask R-CNN 系统在标准图像上的表现令人印象深刻,成功地通过精确的轮廓将人群中重叠的斑马和人区分开来,但实现这一目标需要显著更多的计算资源。

然而,这项研究最显著的部分是尝试教这些系统识别它们从未见过的东西:坦克。标准的计算机视觉模型是“闭集词汇”(closed-vocabulary)系统,这意味着它们只能识别其受训时所列出的特定物体。当研究人员向标准的 Faster R-CNN 和 Mask R-CNN 模型展示军用装甲车的照片时,机器未能将它们识别为坦克。相反,它们强行将这些图像归入已知的最接近类别,将坦克标记为“卡车”或“汽车”。这并非机器识别车辆形状的能力失败,而是其词汇量的局限性;它只是在自己的字典里没有“坦克”这个词。

为了解决这个问题,研究人员转向 YOLOv8 系统并使用了名为“迁移学习”的技术。系统并没有从零开始,而是被给予了一个仅包含二十张由人类手动标注的坦克图像的小型自定义数据集。随后,系统针对这组小型图像进行了微调。结果是惊人的。经过适配新类别的 YOLOv8 系统,能够以高置信度识别博物馆展品和户外照片中的坦克。它甚至识别出了田野中移动的装甲车辆,尽管存在模糊和距离问题,这证明了一个轻量化、快速的系统可以通过极少的数据量快速适配到一个新的、特定的任务中。

研究结论指出,虽然旧的两阶段系统在需要高精度的通用任务中仍然表现出色,但它们在面对新类别时显得过于僵化。它们无法识别那些未被明确教导的内容。相比之下,YOLOv8 单阶段系统展现出了在实际应用中极具价值的灵活性。它表明,通过投入少量的标注人力,一个快速的检测器就可以扩展到去识别全新的物体类型。这表明,对于许多现实世界的问题——即目标是检测特定的定制项目而非仅仅是通用类别时——新型单阶段方法的效率和适应性可能比旧有的、较慢的方法的原始准确性更为有用。研究还指出,该领域发展迅速,新的模型不断涌现,旨在结合单阶段系统的速度与旧有系统的准确性,但核心教训依然清晰:最好的工具取决于你是需要一个了解世界万物的机器,还是一个能快速学会观察新事物的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →