← 最新论文
🤖 AI

Multiscale Real-Time Object Detection in the NMS-Free Era: A Comparative Performance Evaluation of YOLOv8 and YOLO26

本文对无 NMS 的 YOLO26 与成熟的基于 NMS 的 YOLOv8 在多个尺度和数据集上进行了对比评估,结果表明,尽管 YOLO26 在通用任务上提供了更优的精度和效率,但最佳检测器的选择最终取决于特定数据集特征、目标尺度及硬件约束。

原作者: Chidera G. Oguine, Kanyifeechukwu J. Oguine, Obiozor M. Oguine, Ozioma C. Oguine

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Chidera G. Oguine, Kanyifeechukwu J. Oguine, Obiozor M. Oguine, Ozioma C. Oguine

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在运营一个繁忙的机场安检通道。你的任务是在成千上万的人群中,揪出每一个携带违禁物品的人。你有两支不同的安检团队(算法)在尝试完成这项工作:YOLOv8 团队(经验丰富的老兵)和YOLO26 团队(全新、充满未来感的 recruits)。

本文就是这两支团队之间的正面较量,看看谁更快、更准确,以及谁更擅长应对不同类型的人群。

老问题:“保镖”瓶颈

多年来,目标检测系统(如自动驾驶汽车或无人机中使用的系统)存在一个固有缺陷。在计算机识别出物体后,它必须执行一个名为**NMS(非极大值抑制)**的“保镖”步骤。

把 NMS 想象成俱乐部门口的保镖,他必须手动检查排队中的每一个人。如果两个人看起来像是同一个人,保镖就会把其中一人踢出去。

  • 问题所在: 如果人群稀疏,保镖行动迅速。但如果人群密集(像是一场拥挤的音乐会),保镖就会不堪重负,检查每个人的时间变长,队伍移动速度变得不可预测。这使得这些系统很难应用于小型、廉价的设备(如无人机或手机),因为在这些设备上,时间至关重要。

新挑战者:“无保镖”系统

YOLO26 横空出世。这个新模型旨在完全跳过“保镖”环节。它不是先猜测再过滤,而是从一开始就经过训练,能够以 100% 的确定性说:“我在这里只看到了一个人。”这是一个“端到端”系统,承诺在拥挤的场景中更加流畅、快速。

赛道:两种不同的人群

研究人员在两种截然不同的环境中测试了这两支团队:

  1. “城镇广场”(Pascal VOC): 这是一个标准测试,包含清晰、日常的对象(人、汽车、狗),通常易于识别且不太拥挤。
  2. “无人机视角”(VisDrone): 这是一个难得多的测试。想象一下从无人机俯瞰繁忙的城市街道。物体(汽车、人)非常微小,紧密堆积,且经常相互遮挡。这是“小物体”的噩梦。

结果

1. 在城镇广场(Pascal VOC)

YOLO26 团队轻松获胜。

  • 准确率: 新模型比老兵识别出了更多的物体,并且为它们画出了更精准的边界框。
  • 效率: YOLO26 也更“轻量”。它拥有更少的活动部件(参数),运行所需的计算能力更少,但表现依然更好。
  • 意外情况: 从 YOLO26 的“大”版本升级到“超大”版本并没有带来太大帮助。这就像当一辆大型货车已经完美胜任工作时,你却买了一辆更大的卡车。额外的尺寸只增加了成本,却没有带来多少收益。

2. 在无人机视角(VisDrone)

比赛更加胶着。

  • 挣扎: 两支队伍都遇到了困难。从空中检测微小、拥挤的物体极其困难。即使在最严格的指标下,最好的模型也只能达到约 20-22% 的准确率。
  • 差距: YOLO26 依然获胜,但优势微乎其微。“无保镖”的优势并没有解决在混乱人群中看清微小、模糊光点的根本问题。
  • 教训: 仅仅因为一个模型更新,并不意味着它能神奇地解决所有问题。如果物体太小且场景太混乱,即使是最先进的技术也会碰壁。

硬件现实检查

本文还考察了这两支队伍在不同计算机上的运行速度。

  • 在强大的 GPU(服务器计算机)上: 令人惊讶的是,老兵YOLOv8 往往与新 YOLO26 一样快,有时甚至更快。这证明,移除“保镖”(NMS)并不能让系统在所有类型的硬件上都自动变得更快。
  • 在 CPU(标准处理器)上: 随着模型变大,两支队伍的速度都显著放缓,但 YOLO26 在内存和体积方面通常仍保持更高的效率。

结论

本文得出结论,YOLO26 是通用任务的一个强力升级,提供了更高的准确率和更小的占用空间。然而,它并非万能灵药。

  • 如果你需要在标准物体上获得高准确率: YOLO26 是更好的选择。
  • 如果你正在从空中观察微小、拥挤的物体: 两种模型都面临困难,选择更多取决于你的具体硬件和预算,而不是哪个模型“更新”。

简而言之:更新的并不总是普遍更好。 最佳工具完全取决于你所做的工作以及你用来完成工作的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →