← 最新の論文
🤖 machine learning

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

本論文は、誘導された瞬時速度予測器を構築することによって、順方向プロセスにおける強化学習手法であるDiffusionNFTをMeanFlow生成器に適応させた新しいフレームワークであるMeanFlowNFTを導入するものであり、これにより、高速な数ステップサンプリングを維持しつつ、画像および動画生成において既存の数ステップおよびマルチステップのRLチューニング済みモデルをも大幅に凌駕する効率的な報酬最適化を可能にする。

原著者: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットの芸術家に「ネオンに照らされたサイバーパンクな街並みを走る、洗練された車」の絵を描く方法を教えようとしていると想像してください。人工知能の世界では、現在のトップアーティストたちは「拡散(ディフュージョン)」や「フロー(流動)」と呼ばれる手法を使っています。これは、大理石の塊を削り出す彫刻家のようなものだと考えてください。彼らは、まずノイズの混じった粗い石の塊(ランダムな静止画)から始まり、最終的な像を明らかにするために、一歩ずつ慎重に微調整を加えていきます。問題は、このプロセスが遅いことです。本当に優れた絵を作るために、ロボットは50歩、あるいは100歩もの小さなステップを踏み、一回削るごとに作業を確認しなければならないかもしれません。それは、部屋を横切る際に、1インチ(約2.5センチ)刻みの歩幅で進むようなものです。目的地には着きますが、あまりにも時間がかかりすぎます。

これを高速化するために、科学者たちは最近、「MeanFlow」という新しいトリックを考案しました。MeanFlowは、ロボットに「一定の時間にわたる平均的な速度」を予測させることで、小さなステップを踏む代わりに、大きな動きを学習させます。これは、ロボットが部屋を横切る際に、一歩ずつ足を引きずるのではなく、自信を持って大きく跳躍する方法を学ぶようなものです。これにより、わずか数ステップで高品質な画像を生成できるようになります。しかし、落とし穴があります。この「速いロボット」に、人間が実際に何を「好むか」を教えるのは非常に困難なのです。通常、AIにより創造性を高めさせたり、ルールに従わせたりするために、私たちは「強化学習(RL)」と呼ばれる手法を用います。しかし、現在私たちが持っている最高のRL手法は、この「速い、跳躍するロボット」ではなく、従来の「遅い、一歩ずつ進むロボット」のために設計されています。この速いロボットに、古い遅いロボット用のレッスンで教えようとするのは、まるで亀向けの指示書を使ってチーターに走る方法を教えるようなもので、数学的な整合性が取れないのです。

ここで、新しい論文「MeanFlowNFT」が登場します。研究者たちは、シンプルかつトリッキーな問いを投げかけました。「私たちは、この速い、跳躍するロボットに対して、従来の遅いロボット向けの効率的なRL手法を用いて、スピードを落とすことなく、さらに優れたものへと教え込むことができるだろうか?」

その答えは、力強い「イエス」であり、その方法は以下の通りです。チームは、たとえロボットが「平均速度」(大きな跳躍をするため)を予測するように訓練されていても、その平均速度と、従来のRL手法が必要とする「瞬間的な速度」(ある特定の瞬間における速度)の間には、隠れた数学的なつながりがあることに気づきました。彼らは、「誘導された瞬間速度予測器(induced instantaneous-velocity predictor)」という巧妙な架け橋を構築しました。このように考えてみてください。ロボットの脳は、長いロードトリップ(平均速度)を計画するように訓練されています。研究者たちは、その長い旅の計画を見て、車が特定の瞬間に時速何キロで走っているか(瞬間速度)を即座に算出できる特別な「翻訳機」を作成したのです。

そして、彼らはこの翻訳機を使って、従来の効率的なRL手法を用いてロボットを教育しました。ロボットは、翻訳機のスピードメーターの読み取り値に基づいてフィードバック(報酬)を学びますが、レッスンが終われば、ロボットは元の「平均速度」の脳に戻って画像を生成します。つまり、ロボットは超高速の能力を失うことなく、より賢くなり、人間の好みに適合するように学習できるのです。

結果は目覚ましいものでした。画像生成(Stable Diffusion 3.5-Mediumなど)や動画生成(Wan2.1など)でテストしたところ、新しいMeanFlowNFTモデルは、一貫して従来の高速モデルを上回りました。実際、画像生成において、8つの異なる品質指標のうち6つで、他のトップティアのモデルを凌駕しました。さらに驚くべきことに、動画生成において、4ステップのMeanFlowNFTモデルは、VBenchと呼ばれる品質テストで84.33というスコアを記録しました。これは、はるかに低速な50ステップのモデル(LongCat-Video RL)が記録した82.57よりも高い数値です。

この論文は、この手法が単なる理論上の話ではなく、実践においても有効であることを証明しています。この「翻訳機」のトリックを使うことで、複雑な確率計算を必要とすることなく、トレーニングプロセスを高速かつ効率的に保ちながら、高度な強化学習の恩恵を受けることができました。ロボットはより良い跳躍を学習し、かつてよりもはるかに短い時間で、より美しく正確な画像や動画を作り出せるようになったのです。それは、チーターに歩き方を教えるのではなく、地形の優れた地図を与えることで、どこに大きな足を踏み出すべきかを正確に理解させ、より速く走れるように教えるようなものなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →