Cross-Generation Optimization of YOLOv26, YOLOv11, and YOLOv8 for Fine-Grained Small-Object Detection and Instance Segmentation in Complex Orchards
本研究通过在各种尺度和分辨率下对 Ultralytics YOLOv8、YOLOv11 和 YOLOv26 进行基准测试,旨在确定在复杂的果园环境中,针对细粒度小目标检测和实例分割,在训练时使用高分辨率输入的小型模型(特别是 YOLOv11s-960 和 YOLOv26s-960)能提供最有效的精度与效率权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在商业苹果园静谧且阳光斑驳的果树行间,一个微妙但艰巨的挑战正等待着未来的机器。几十年来,计算机视觉已经学会了识别物体,能以惊人的速度在车流中寻找汽车或在人群中发现行人。然而,当这些同样的机器在初夏观察一棵幼小的苹果树时,这项任务却变得异常困难。果实微小,通常不比拇指甲大,并且隐藏在茂密、混乱的绿叶、茎干和枝条之中,这些部分看起来几乎与果实本身一模一样。这种“绿对绿”的环境创造了一个视觉谜题,目标物完美地融入了背景之中。为了制造能够照料这些树木的机器人——例如通过疏剪过剩的果实,使剩余的果实长得更大、更甜——工程师需要的不仅仅是一个能看到水果的摄像头。他们需要一个能够区分连接果实的纤细线状茎、果实底部的微小杯状结构以及果实本体的系统,即使这些部分处于部分遮挡状态,或者在屏幕上仅有几个像素宽。
这正是康奈尔大学的一个研究团队所解决的具体问题,他们致力于测试现代人工智能在处理这些微小、隐藏细节方面的表现。他们专注于一个被称为 YOLO 的 AI 模型家族,该系列模型以其实时识别目标的能力而闻名。该团队并没有发明一种新型 AI;相反,他们扮演了严谨实验者的角色,测试了三代不同的模型——成熟的 YOLOv8、较新的 YOLOv11 以及非常近期的 YOLOv26——并在各种多样化的条件下对其进行了测试。他们想知道两件事:对于这些微小目标,更大的、更复杂的 AI 模型是否总是效果更好?以及向 AI 输入更高分辨率、更清晰的图像是否能帮助它看到原本可能遗漏的内容?为了找出答案,他们利用从华盛顿州真实苹果园拍摄的 600 张图像数据集训练了 30 个不同版本的这些模型,在这些图像中,果实处于最小且最难被发现的状态。
这项广泛测试的结果揭示了一个关于机器如何学习视觉的直觉相悖的真相。长期以来,该领域的假设一直是:如果你想要更好的性能,你只需要一个更大的“大脑”。在 AI 世界中,这意味着使用具有更多层和更多参数的模型,本质上是给计算机更多的内存和处理能力来分析图像。研究人员通过将模型的最小版本(称为“nano”)与庞大的“extra-large”(超大规模)版本进行对比来测试这一点。他们发现,仅仅扩大模型规模并不能保证获得更好的结果。事实上,那些计算量巨大、体型庞大的模型往往无法超越它们那些更小、更高效的“亲戚”。即便拥有更多的计算资源,最大的模型有时也会完全错过微小的茎,或者难以勾勒出果实的精确边界。
相反,看清这些微小物体的关键在于训练期间如何向 AI 展示图像。研究人员比较了两种方法:一种是将图像缩小到标准的 640 x 640 像素,另一种是将图像保持在 960 x 960 像素的高分辨率。当图像被缩小后,微小的茎和细小的果实本体会失去细节,变得模糊或消失在背景叶片的噪声之中。通过保持更高的分辨率,研究人员保留了 AI 理解场景所需的精细空间细节。这种高分辨率的方法一致地帮助了模型,但它对所有模型的帮助程度并不相同。最显著的改进出现在中小规模的模型上。这些紧凑型模型在接受了更清晰图像的训练后,能够以大型模型无法企及的准确度检测并描绘出微小的果实部分。
研究强调,任务的难度取决于机器人需要观察果实的哪个部分。幼年果实的主体较为圆润且较大,对于 AI 来说相对容易寻找。果实底部的花托稍难,但仍可应对。最难的目标是果柄,即连接果实与枝干的细长针状茎。这种结构如此狭窄,且经常被叶片遮挡,因此在图像缩放或 AI 模型未经过正确调优时极易丢失。研究人员发现,在经过高分辨率图像训练的小型模型在寻找这些茎部方面最为成功。例如,其中一个在 960 像素图像上训练的小型模型,在识别水果及其各部分时达到了很高的准确度,而其消耗的计算能力仅为大型模型的一小部分。相比之下,最大的模型处理每张图像所需的时间显著增加,消耗的能量也更多,却并未产生更好的结果。在某些情况下,最大的模型表现反而更差,这表明增加复杂度有时反而会干扰 AI,而非提供帮助。
这项工作为构建农业机器人的工程师们提供了清晰的指南。它表明,提升感知能力的路径并不一定是建造更大、更昂贵的计算机,而是要更聪明地处理数据。通过专注于保留图像的精细细节,并将其与恰好能处理该任务的模型相结合,就可以在不产生沉重计算成本的情况下实现高精度。研究人员发现,经过高分辨率图像训练的小型模型,其识别水果及其精细部分的准确度可以媲美甚至超过目前最强大的系统。对于需要快速、高效地在田间作业(且通常面临电力和计算资源限制)的机器人农业未来而言,这是一个至关重要的发现。研究结论指出,针对在复杂绿色环境中观察微小、隐藏物体的特定挑战,紧凑型模型与清晰视野的结合,远比单纯投入更多计算能力更为有效。这些模型的实现方式和所使用的数据现已向公众开放,为下一代能够不仅将果园视为一片绿色模糊,而是视为一系列等待照料的个体精细结构的农业机器人提供了实践基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。