← 最新の論文
💻 computer science

AnyDepth-DETR/-YOLO: Any-depth object detection with a single network

本論文は、スキップ可能なリファインメントパスアーキテクチャと自己蒸留学習を採用して特徴量の階層性を維持し、段階的なモジュール性を保証することで、再学習なしに推論時に単一の物体検出ネットワークが精度と効率のトレードオフの連続的な範囲をカバーするように深度を動的に調整可能にするAnyDepth-DETR/-YOLOというフレームワークを導入する。

原著者: Woochul Kang, Hyungseop Lee, Jiho Lee

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Woochul Kang, Hyungseop Lee, Jiho Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

専門家探偵チームが動画から物体を検出する様子を想像してみてください。通常、さまざまな状況に対処するには、2 つの異なるチームを雇う必要があります。1 つは速くて実用的(迅速なチェックには優れているが、詳細を見逃す可能性がある)で、もう 1 つは遅くて綿密(精度は高いが時間がかかる)です。AI 物体検出の世界では、これは 2 つの完全に独立したコンピュータモデルを構築し、維持しなければならないことを意味します。

論文「AnyDepth-DETR/-YOLO」は、これを行う新しい方法を提案します。即座に自身のサイズを変更できる単一の探偵チームです。

以下に、その仕組みを簡単な概念に分解して説明します。

1. 問題:「万能だが不向き」というジレンマ

現在、AI モデルは静的な建物のようです。非常に高い建物(高精度)が必要な場合、20 階建てで建設します。迅速で低コストな構造(高速)が必要な場合、5 階建てのバージョンを建設します。高い建物から階を「取り除く」だけで即座に崩壊させずに済むわけでも、短い建物に魔法のように階を追加できるわけでもありません。そのため、開発者はあらゆる異なるシナリオに対して、複数の独立したモデルを訓練し、保存する必要があります。

2. 解決策:「モジュール式」探偵チーム

著者らは、モジュール式建設セットのように構築されたネットワークを作成しました。単一の固体の層のブロックではなく、ネットワークの各段階は 2 つのパスに分割されます。

  • 必須パス(コア): これは「必須」の部分です。常に実行されます。探偵の基本的な訓練と核心的な直感と考えてください。高速で軽量です。
  • 洗練パス(追加の支援): これは「オプション」の部分です。専門家を招いたり、拡大鏡を使ったりするようなものです。追加の時間と計算能力がある場合のみ実行されます。

魔法のトリック:
構築方法のおかげで、これらのパスを自由に組み合わせて使用できます。

  • 最大速度が必要ですか? ネットワーク全体で「必須パス」のみを実行します。
  • 最大精度が必要ですか? 「必須パス」に加えてすべての「洗練パス」を実行します。
  • その中間が必要ですか? ネットワークの前半部分のみで洗練パスをオンにします。

最も素晴らしい点は、すべてが単一のモデルであることです。再訓練したりファイルを切り替えたりする必要はありません。使用する瞬間にスイッチを切り替えるだけで、ネットワークがどの程度「深く」(何層まで)考えるかを決定できます。

3. 訓練の課題:チームに合意させる

「2 つの異なるモード(高速対低速)で働くようにチームを訓練すれば、混乱するのではないか」と思うかもしれません。

  • 「高速モード」が詳細を無視するように学習する一方、「低速モード」がその詳細を必要とする場合、重み(AI の脳)に矛盾する指示が与えられます。
  • この論文は、**自己蒸留(Self-Distillation)**と呼ばれる技術を用いてこれを解決します。

アナロジー:
同じキッチンで働くマスターシェフ(「スーパーネット」)と見習いシェフ(「ベースネット」)を想像してください。

  1. マスターシェフは、すべてのパスを使用して完全で複雑な料理を作ります。
  2. 見習いは、必須パスのみを使用してシンプルなバージョンを作ります。
  3. マスターシェフは単に料理を味わうだけでなく、見習いに教えます。「装飾を省略するときは、ベースの風味が私の料理と同じように、ただしシンプルに感じられるように気をつけなさい」と言うのです。

彼らは、マスターと見習いが互いの作業を絶えず確認し合い、見習いがステップを省略しても最終結果がマスターが作り出したものと互換性があることを保証する特別な訓練方法を使用します。これにより、後でどの「深さ」を選んでも、ネットワークが破綻しないことが保証されます。

4. 結果:すべてを支配する 1 つのモデル

著者らは、この技術を 2 つの有名な AI モデル(RT-DETR と YOLOv12)でテストしました。

  • フルバージョン: フルネットワークを実行した際、既存の最高水準のモデルと同等の性能を示しました。
  • 高速バージョン: 追加の洗練パスをオフにした際、モデルは1.8 倍高速(ほぼ倍速)になり、精度はわずかに低下するのみ(標準スケールで約 2 ポイント)でした。

なぜこれが重要なのか

スマートフォンのカメラと考えてみてください。

  • 朝は、単に素早くスナップショットを撮る必要があるかもしれません(速度のために「必須パス」を使用)。
  • 夜は、高品質で詳細な写真が必要になるかもしれません(精度のために「フルパス」を使用)。

この技術は、電話に 2 つの異なるカメラを備える代わりに、1 つのカメラが照明やニーズに応じて即座にモードを切り替えられるようにします。新しいアプリをダウンロードしたり、ソフトウェアを更新したりする必要はありません。スペースを節約し、コストを削減し、AI を現実世界での使用に対してはるかに柔軟にします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →