← 最新论文
💻 computer science

Scale-Dependent Performance of YOLOv12 andYOLOv11 for Automated Blood Cell Detection: A Controlled Benchmark on BCCD

本研究首次对 BCCD 数据集上的 YOLOv11 和 YOLOv12 变体进行了逐尺度基准测试,结果表明,尽管它们的整体平均性能几乎相同,但 YOLOv12 在针对延迟敏感型应用的纳米级(nano)尺度上表现出色,而 YOLOv11 在中型和大型尺度上则优于其表现,这表明模型选择应由特定的尺度和召回率需求驱动,而非基于统一的优越性假设。

原作者: Wenxi Tang, Yu Miao, Xiafang Chen

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxi Tang, Yu Miao, Xiafang Chen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在进行一场高速版的“寻找沃尔多(Where's Waldo?)”游戏,但你寻找的不是一个穿着红白条纹衫的小伙子,而是在一座拥挤的、微观城市里的三种不同角色:红细胞(忙碌的通勤者)、白细胞(稀有的保安)以及血小板(微小到几乎看不见的尘埃)。

多年来,科学家们一直使用一种名为 YOLO(代表“You Only Look Once”,意为“你只需看一眼”)的超级智能侦探 AI 来自动寻找这些细胞。这些侦探的最新版本是 YOLOv11 以及在 2025 年 2 月发布的全新版本 YOLOv12。大家都在好奇:由于 YOLOv12 使用了一种高级的新型“区域注意力(Area Attention)”技巧(可以把它想象成一个侦探不再只是观察整个城市,而是能缩放到特定的街区来寻找线索),它是否会自动变得更擅长这项工作?

研究作者决定通过一场大规模的受控对决来解决这场争论。他们不仅仅测试了一个版本;他们将 五种不同规模 的 YOLOv11 与 五种不同规模 的 YOLOv12(从微小的“纳米级”侦探到巨大的“特大型”侦探)在相同的血液细胞图像数据集上进行了对决。他们确保每一位侦探都使用了完全相同的训练手册、相同的计算机和相同的规则。

大惊喜:规模比新技巧更重要

转折点来了:新的侦探(YOLOv12)并不自动成为赢家。 事实上,论文显示,这个新技巧是否奏效,完全取决于侦探的大小。

1. 微型侦探(纳米级规模)
当侦探非常小且需要追求速度时(就像骑着自行车的侦探),YOLOv12 胜出

  • 数据统计: 微型的 YOLOv12n 找到了细胞,准确率得分为 92.51%,而且速度极快,查看一张图像仅需 1.8 毫秒。它消耗的计算能力也非常低(6.5 GFLOPs)。
  • 结论: 在这种微型尺寸下,新的“区域注意力”技巧帮助侦探看得更清楚,超越了旧的 YOLOv11n。研究证明这种差异是真实存在的(置信度 p = 0.0008),这意味着当模型较小时,YOLOv12n 在捕捉细胞方面确实比 YOLOv11n 更出色。

2. 中型和大型侦探
但故事在这里发生了反转。当侦探变大(中型和大型尺寸)时,旧的 YOLOv11 反而成为了更好的猎手

  • 数据统计: 在中型尺寸下,YOLOv11 捕捉到了 89.60% 的细胞,而 YOLOv12 仅捕捉到了 82.08%。这是一个巨大的差距!在大型尺寸下,YOLOv11 捕捉到了 90.29%,而 YOLOv12 则下降到了 85.23%
  • 结论: 论文显示这些差异在统计学上是非常可靠的(p < 0.0001)。YOLOv12 中华丽的新注意力技巧并没有对中型和大型模型有所帮助;相反,YOLOv11 较旧且更简单的设计在这些尺寸下要可靠得多。

3. 巨型侦探(特大型规模)
当侦探变得绝对庞大(特大型规模)时,它们两者都变得同样优秀。

  • 数据统计: YOLOv11x 和 YOLOv12x 都准确捕捉到了正好 96.44% 的细胞。两者之间的差异完全消失了(p = 1.0000,意味着它们在统计学上是完全相同的)。
  • 结论: 如果你拥有一台超级计算机并且不在乎速度,你可以任选其一。它们的表现是一样的。

关于平均分呢?

如果你只看所有五种规模的平均得分,这两个家族看起来几乎是一模一样的。YOLOv12 的平均分为 91.40%,而 YOLOv11 的平均分为 91.38%

  • 教训: 这微小的差异(0.02%)小到几乎可以忽略不计,基本可以视为平局。如果你只看平均值,你会认为它们是一样的。但研究证明,隐藏在平均值背后是具有误导性的。你需要哪种类型的侦探,取决于你选择的模型规模。

“难以发现”的线索

研究还观察了侦探为什么有时会错过线索。他们发现最难捕捉的目标是:

  • 红细胞: 这些就像一群手拉手的人。当它们重叠在一起时,即使是最好的 AI 也会感到困惑。研究发现,当细胞挤在一起时,10 个模型中有 8 个会漏掉它们。这并不是 YOLOv11 或 YOLOv12 的错;这仅仅是一个非常困难的视觉谜题。
  • 血小板: 它们微小且模糊,就像阳光中的尘埃。它们是最难发现的,模型经常把它们与背景混淆。

那么,你应该使用哪一个?

论文根据你的需求给出了明确的指南:

  • 如果你需要速度和低成本(例如在手机或小型设备上运行):选择 YOLOv12n。它是最快且最准确的微型模型。
  • 如果你需要捕捉每一个细胞(特别是在中型或大型模型中),并且速度不是首要任务:坚持使用 YOLOv11。在这些尺寸下,它寻找细胞时更加可靠。
  • 如果你拥有一台庞大的计算机: 没关系,选哪个都行;YOLOv11xYOLOv12x 性能相同。

核心结论

这篇论文否定了“越新就一定越好”的观点。新的 YOLOv12 并不是在任何地方都能击败 YOLOv11 的万能灵药。它的特殊“区域注意力”能力只有在模型非常小时才会发光发热。一旦模型变大,旧的设计反而表现更好。

作者建议,如果我们未来想要更好地发现血液中的细胞,我们可能无法仅仅通过做大模型或增加新技巧来实现。相反,我们可能需要更好的图像,或者更好的方法来教会 AI 如何处理那些紧紧挤压在一起的细胞。目前来看,选择使用哪种 AI 完全取决于你想让你的侦探有多大。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →