← 最新の論文
💻 computer science

Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts

本論文は、並列マルチトークン処理と適応型実行モードを可能にすることで、蒸留フレームワークを変更することなく生成品質を維持しながら学習時間を大幅に短縮する、視覚的オンポリシー蒸留を加速させるバッチ化された投機的Jacobiデコーディング(Speculative Jacobi Decoding)バックエンドであるHB-SJDを紹介するものである。

原著者: Bingqi Shan, Zhehao Yu, Kenhong Lin, Baoquan Zhang

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Bingqi Shan, Zhehao Yu, Kenhong Lin, Baoquan Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界では、驚くほど美しい画像を生成できるほど賢いモデルを作ることと、それらを高速に動作させるためにサイズを小さく保つこととの間で、絶え間ない綱引きが行われています。多くの場合「教師」と呼ばれる大規模なシステムは、一つの出発点から画像全体を構築するように、一度に極めて小さな断片を一つずつ予測していくことで、信じられないほど詳細な画像を作り出すことができます。しかし、このステップ・バイ・ステップのプロセスは遅く、コストがかかります。これらのシステムを高速化するために、研究者たちは「知識蒸留(knowledge distillation)」という手法を用います。これは、より小さく単純な「生徒」モデルが、教師の模倣を学習する手法です。このプロセスのより新しく効果的なバージョンである「オンポリシー蒸留(on-policy distillation)」では、生徒に対して、リアルタイムで自分自身の訓練用サンプルを生成しながら練習することを求めます。これにより、生徒は単に古い例を暗記するのではなく、実際に芸術作品を創造する際に自分がどのように振る舞うかを正確に学習できるのです。問題は、この練習セッションが非常に遅いことです。生徒は依然として、画像を一つ一つの小さな断片から構築しなければならず、これが学習プロセス全体を遅らせるボトルネックとなっています。

深センの研究チームは、生徒の学習方法の根本的なルールを変えることなく、このボトルネックを打破する方法を見出しました。彼らは「HB-SJD」と呼ばれる、生徒の練習セッションのためのより高速なエンジンとして機能する新しい手法を導入しました。この新システムは、生徒に画像のトークン(あるいは微細な視覚的単位)を一つずつ構築させる代わりに、複数の将来の断片を同時に提案し、それらの推測が正しいかどうかをチェックすることを可能にします。これは、学生がテストを受けている様子を想像してみてください。一つの答えを書き、先生が採点するのを待ち、それから次の答えを書くのではなく、学生が一ページ分の答えをまとめて書き、先生がどれが正解かを素早く判定するようなものです。生徒は正解を保持し、間違ったものだけを書き直すことで、より速く前へと進むことができます。

研究者たちは、単にこの高速な手法を画像のグループに対して同時に実行するだけでは不十分であることを発見しました。標準的なセットアップでは、もし一つの画像の生成が早く終わったとしても、システムが次のステップに進む前に、グループ内の最も遅い画像が終了するのを待たなければなりません。この待機時間は貴重な計算能力を無駄にしていました。これを解決するために、チームは各画像が独自のスピードで進行できるようなシステムを設計しました。もし画像が完了したら、その画像は脇に退き、システムは停止することなく残りの画像に対して作業を続けます。さらに、彼らは、稼働している画像の数に応じて、システムの最適な実行方法が変わることも発見しました。多くの画像が処理されているとき、システムはフルグループをアクティブに保つことで最もよく機能します。しかし、画像が完了してグループが小さくなるにつれて、システムは空のスロットを管理するオーバーヘッドを避けるために、残りのアクティブな画像のみを処理する、より軽量なモードへと切り替わります。

画像生成モデルを用いたテストにおいて、この新しいアプローチは非常に効果的であることが証明されました。研究者たちは、生徒が練習用画像を生成する時間をほぼ半分に短縮でき、従来のメソッドと比較して1.4倍から1.6倍の高速化を実現したことを発見しました。決定的なのは、このスピードアップが品質を犠牲にすることなく達成された点です。この新手法を用いて訓練された生徒モデルが生成する画像は、より遅い旧来の手法で訓練されたものと同様に、鮮明でリアルでした。このシステムは、画像が短くても長くても、処理される画像のグループが小さくても大きくても、また学習プロセスのどの段階においても、一貫して優れた性能を発揮しました。練習用データを生成するエンジンのみを置き換えることで、研究者たちは学習プロセス全体を大幅に高速化することに成功し、最終的な結果の品質を損なうことなく、人工知能の訓練を加速できることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →