Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
Ultralytics YOLO26は、デュアルヘッドアーキテクチャと高度な学習戦略を通じて非最大値抑制(NMS)と分布焦点損失(DFL)を排除した、リアルタイム・エンドツーエンドの統合ビジョンモデルファミリーを導入し、物体検出、セグメンテーション、ポーズ推定、およびオープンボキャブラリー推論を含む複数のタスクにおいて、最先端の精度とレイテンシ性能を実現しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ビデオストリーム内の物体をリアルタイムで検知する任務を負った、超高速のセキュリティガードを想像してみてください。長年、最高のガード(「YOLO」モデルと呼ばれます)は非常に優秀でしたが、いくつか厄介な癖がありました。それは、物体を見つけた後に遅い「再確認」ステップを必要とすること、動作を重くする追加データの「重いバックパック」を背負っていること、そして訓練ルールが厳格すぎて、小さくて遠くにある物体を見逃してしまうことがありました。
この論文は、これまで以上に速く、軽く、そして鋭くなった新世代のビジョンガードであるYOLO26を紹介しています。彼らがどのように古い問題を解決したのか、日常的な例えを用いて説明します。
1. 「再確認なし」のルール (NMSフリー推論)
旧来の問題: 以前は、ガードが車を見つけると、少しずつ異なる場所で3つも4つも同じ車を見つけてしまうことがありました。そのため、最も良い推測を一つだけ選び、重複を捨てるために、「Non-Maximum Suppression (NMS)」という、時間がかかる手動の再確認プロセスを行う必要がありました。これには時間がかかりました。
YOLO26による解決策: YOLO26はデュアルヘッド設計を採用しています。これは、2人の特化した作業員がいると考えてください。
- 作業員A(スピードスター): この作業員は、あらゆる物体に対して即座に、正確に一つの完璧な推測を選ぶように訓練されています。二度手間(再確認)は不要です。まるで一撃でターゲットを仕留めるスナイパーのようです。
- 作業員B(マキシマイザー): この作業員は、依然としてあらゆるものを見渡し、もしあなたが絶対的な最高精度を必要とし、多少の「再確認」時間を気にしないのであれば、使用することができます。
結果: 「エンドツーエンド」なシステム、つまり、画像を見てから二度目の意見を求めることなく、直接答えを出すシステムを実現しました。
2. 重いバックパックを捨てる (DFLの除去)
旧来の問題: 最近のモデルは、重い「Distribution Focal Loss (DFL)」というバックパックを背負っていました。このバックパックは、あらゆるエッジに対して16種類の異なる可能性から推測することで、物体のサイズを予測しようとするものでした。これにより、モデルは重くなり(メモリを消費し)、特に小型モデルでは動作が遅くなりました。また、「最大サイズ」の制限もあり、物体がリストの範囲を超えると、モデルは混乱してしまいました。
YOLO26による解決策: 彼らはそのバックパックを投げ捨てました。メニューから選ぶように推測する代わりに、モデルは今や、定規を使うように直接サイズを測定します。
結果: モデルはより軽量で高速になり、さらに、非常に大きな物体に対しても「天井」にぶつかることなく、正確に測定できるようになりました。
3. 「小さな物体」のためのセーフティネット (STAL)
旧来の問題: 古い訓練ルールは、「特定のグリッド内に収まる箱の中にしか隠れてはいけない」というルールがある「かくれんぼ」のようでした。もし小さな物体(遠くの鳥など)がグリッドの正方形よりも小さかった場合、ガードはそれを見ることができませんでした。その物体には注意が払われず、訓練中に無視されてしまったのです。
YOLO26による解決策: 彼らはSTAL(Small-Target-Aware Label Assignment)を導入しました。ガードに、小さなもののための特別な拡大鏡を与えたと考えてください。たとえ小さな物体が標準のグリッドに収まらなくても、システムはグリッドを一時的に「引き伸ばす」ことで、その物体をカバーし、ガードが注意を払うように強制します。
結果: モデルは、最も小さく、最も見えにくい物体を無視することがなくなりました。
4. 「スマートなコーチ」 (MuSGD & プログレッシブ・ロス)
旧来の問題: これらのモデルの訓練は、コーチが600マイルのレース全体を通して同じ指示を叫び続けるマラソンのようでした。上手くなるまでに時間がかかりました。また、コーチは「スピードスター」の作業員と「マキシマイザー」の作業員を、それぞれの仕事が異なるにもかかわらず、全く同じように扱っていました。
YOLO26による解決策:
- MuSGD (スマートなコーチ): 彼らは古い訓練方法を、より速く学習できる新しいオプティマイザ(MuSGD)に置き換えました。これは、ランナーがより少ないマイル(より少ない訓練エポック)で完走できるように、ペース配分を正確に知っているコーチのようなものです。
- プログレッシブ・ロス (カリキュラム): 彼らは訓練スケジュールを変更しました。最初は、「マキシマイザー」の作業員に焦点を当てて強固な基礎を築きます。訓練が進むにつれて、徐々に「スピードスター」の作業員へと焦点を移していき、最終的な製品が、高速な(再確認なしの)推論に完璧に調整されるようにします。
5. 異なる仕事のための専門スキル
ガードが車を見つけるのが速いからといって、あらゆることに長けているわけではありません。YOLO26は、他のタスクのための専門的なツールを追加しています。
- 形状の切り出し (セグメンテーション): 背景をより良く理解するためのマルチスケール・システムを追加しました。これにより、物体の正確な輪郭をトレースすることが容易になります。
- 人物のトラッキング (ポーズ推定): 関節(肘など)についてガードがどれくらい「不確か」であるかを推測する方法を追加しました。もし肘が隠れている場合、モデルは無謀な推測をするのではなく、自身が確信を持てないことを認めます。
- 回転した物体 (OBB): 常に垂直に立っているわけではない船や飛行物体のために、物体が傾いていてもモデルが混乱しないよう、数学的な修正を行いました。
6. 「オープン・ボキャブラリー」のアップグレード (YOLOE-26)
最後に、彼らはYOLOE-26を導入しました。これは、ガードに「万能翻訳機」を与えるようなものです。
- テキスト・プロンプティング: 「赤い消火栓を探して」と指示すれば、たとえ消火栓について明示的に訓練されていなくても、それを見つけ出します。
- ビジュアル・プロンプティング: 特定のおもちゃの写真をガードに見せれば、ビデオの中からそのおもちゃを見つけ出します。
- プロンプトなし: また、ただ周囲を見渡して、目に見えるものを自律的に説明することもできます。
まとめ
YOLO26は、その先代よりも速く、軽く、そして正確な、統一されたモデルファミリーです。不要な荷物を捨て、小さなものを見つけるためのルールを修正し、よりスマートな訓練コーチを使用することで、これらを実現しました。絶対的なスピード(NMSフリーの経路)が必要であっても、あるいは絶対的な精度(NMS経路)が必要であっても、YOLO26は「速度 vs 精度」のチャートの最上位に位置するバージョンを提供します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。