Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
Ultralytics YOLO26 引入了一个统一的实时端到端视觉模型家族,该家族通过双头架构和先进的训练策略消除了非极大值抑制(NMS)和分布焦点损失(DFL),在包括检测、分割、姿态估计和开放词汇推理在内的多种任务中实现了最先进的精度-延迟性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位超级敏捷的安全警卫,他的工作是在视频流中实时发现物体。多年来,最优秀的警卫(被称为“YOLO”模型)表现出色,但他们也有一些令人恼火的习惯:他们需要一个缓慢的“复查”步骤来确认发现的物体,他们背着沉重的数据背包导致行动迟缓,而且由于训练规则过于严格,他们经常会漏掉微小且遥远的物体。
这篇论文介绍了一种新一代视觉警卫——YOLO26,旨在使其比以往任何时候都更快、更轻量、更敏锐。以下是他们如何解决旧问题的,通过日常类比进行了解释:
1. “无需复查”规则 (NMS-Free Inference)
旧问题: 以前,当警卫发现一辆车时,他可能会在稍微不同的位置看到三四次。他必须停下来运行一个“非极大值抑制”(NMS)过程——这是一个缓慢的手动复查过程——以挑选出一个最佳猜测并丢弃重复项。这非常耗时。
YOLO26 的解决方法: YOLO26 使用了双头设计 (dual-head design)。可以把它想象成有两个专门的工人:
- 工人 A(速度型): 这个工人经过训练,能够为每个物体立即选出唯一一个完美的猜测。不需要二次检查。就像一名狙击手,第一枪就能命中目标。
- 工人 B(最大化型): 这个工人仍然会观察所有内容,如果你需要绝对最高的精度且不介意额外的“复查”时间,可以使用他。
结果: 你得到的是一个“端到端”的系统,这意味着它直接从看到图像到给出答案,中间无需停下来寻求第二意见。
2. 丢掉沉重的背包 (Removing DFL)
旧问题: 最近的模型背着一个沉重的“分布焦点损失”(DFL)背包。这个背包试图通过为每条边缘从 16 种不同的可能性中进行猜测来预测物体的大小。这使得模型变得笨重(占用更多内存)且缓慢,尤其是对于小型模型。它还有一个“最大尺寸”限制;如果一个物体太大超出了列表范围,模型就会感到困惑。
YOLO26 的解决方法: 他们把背包扔掉了。模型不再是从菜单中进行猜测,而是直接测量大小,就像使用尺子而不是在菜单中做选择一样。
结果: 模型变得更轻、更快,并且现在可以准确测量非常大的物体,而不会遇到“天花板”问题。
3. “微小物体”安全网 (STAL)
旧问题: 旧的训练规则就像一场“捉迷藏”游戏,规则规定:“你只能躲在一个符合特定网格的盒子里面。”如果一个微小的物体(比如远处的鸟)比网格方块还要小,警卫就根本看不见它。它在训练过程中得不到任何关注,会被忽略。
YOLO26 的解决方法: 他们引入了 STAL(小目标感知标签分配)。想象一下,警卫得到了一个专门针对微小事物的放大镜。即使一个微小物体不符合标准的网格,系统也会通过暂时“拉伸”网格以刚好覆盖它,从而强制警卫关注它。
结果: 模型不再忽略那些最小、最难看到的物体。
4. “聪明教练” (MuSGD & Progressive Loss)
旧问题: 训练这些模型过去就像一场马拉松,教练在整个 600 英里的赛程中都在喊同样的指令。这需要很长时间才能变好。此外,教练对“速度型”工人和“最大化型”工人采取完全相同的对待方式,尽管他们的职责不同。
YOLO26 的解决方法:
- MuSGD(聪明教练): 他们将旧的训练方法更换为一种新的优化器 (MuSGD),它学习得更快,就像一位知道如何控制跑者节奏,从而用更少的里程(更少的训练轮数/epochs)完成比赛的教练。
- 渐进式损失 (Progressive Loss/课程学习): 他们改变了训练计划。在开始阶段,我们专注于“最大化型”工人以建立强大的基础。随着训练的进行,我们逐渐将重心转移到“速度型”工人身上,确保最终产品能完美适配快速、无需检查的推理。
5. 针对不同工作的专业技能
仅仅擅长发现汽车并不意味着警卫擅长所有事情。YOLO26 为其他任务增加了专门的工具:
- 切割形状 (Segmentation/分割): 他们增加了一个多尺度系统,帮助警卫更好地理解背景,从而更容易描绘出物体的精确轮廓。
- 追踪人体 (Pose Estimation/姿态估计): 他们增加了一种猜测关节(如手肘)“不确定性”的方法。如果手肘被遮挡了,模型会承认自己不确定,而不是胡乱猜测。
- 旋转物体 (OBB/旋转框检测): 对于像船只或飞机这样不总是垂直向上的物体,他们修正了数学逻辑,使模型在物体倾斜时不会感到困惑。
6. “开放词汇”升级 (YOLOE-26)
最后,他们推出了 YOLOE-26,这就像是给了警卫一个通用翻译官。
- 文本提示 (Text Prompting): 你可以告诉警卫:“帮我找一个红色的消防栓”,即使它从未专门针对消防栓进行过训练,它也能找到。
- 视觉提示 (Visual Prompting): 你可以给警卫看一张特定玩具的照片,它就能在视频中找到那个玩具。
- 无提示 (No Prompt): 它也可以只是观察周围并描述它所看到的一切。
总结
YOLO26 是一个统一的模型家族,它比其前身更快、更轻、更准确。它们通过移除不必要的负担、修复发现微小事物的规则以及使用更聪明的训练教练来实现这一目标。无论你需要绝对的速度(无 NMS 路径)还是最高的精度(有 NMS 路径),YOLO26 都能提供一个处于“速度 vs 精度”图表顶端的版本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。