← 最新の論文
🤖 machine learning

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

本論文は、拡散モデルおよびフローマッチングモデルに対するスケーラブルな強化学習後訓練手法であるReinforce Adjoint Matching(RAM)を導入するものであり、事前学習ターゲットを修正し、高コストなSDEロールアウト、後方随伴掃引、または報酬勾配を必要とすることなく、単純な一貫性損失を導出することで、報酬との優れた整合性を実現する。

原著者: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。何千枚もの写真を模写することで何年も絵を学ぶことに専念してきた、熟練した芸術家がいます。この芸術家は見たものを再現するのが非常に得意ですが、「青いトラックの隣に赤いシマウマを描け」や「盾の上に『HELLO』という文字を明瞭に書け」といった、具体的で厄介な指示に従う方法については、必ずしも熟知しているわけではありません。

この芸術家にこれらの新しいスキルを教えるために、通常は**強化学習(RL)**と呼ばれる手法が用いられます。これは、絵画を鑑賞し、評価を与え、「次はもっと良くして」と伝える、厳格な美術評論家のようなものです。

従来の方法:高価で遅い評論家

以前、このように評論家を用いてAI芸術家を訓練することは、泳ぎを教えるために人を海に放り込み、もがく様子を見守るようなものでした。

  • プロセス: AIが完全な画像(「泳ぐ」行為)を生成し、評論家がそれを評価した後、システムはどの筆致が良評価または悪評価をもたらしたのかを正確に特定しようと試みました。
  • 問題点: これを行うために、AIは1つのフィードバックを得るために、最初から最後まで絵画プロセス全体を何度もシミュレートしなければなりませんでした。それは遅く、計算コストが高く、不安定でした(沈みゆく船の中で風速を計算しようとするようなものです)。

新しい方法:RAM(Reinforce Adjoint Matching)

この論文の著者であるアンドレアス・ベルグマイスターと彼のチームは、これをより賢明に行う方法があることに気づきました。彼らは、元の事前学習段階のように、訓練を速くシンプルに保つ「近道」を見つけ出しました。

以下に、簡単な比喩を用いてRAMがどのように機能するかを示します。

1. 「クリーンな終点」のトリック
絵画プロセスを、逆再生される映画だと想像してください。その映画は、空白のキャンバス(ノイズ)から始まり、完成した絵画で終わります。

  • 旧手法: AIは映画全体を観て、結末を評価し、その後、どこで間違えたかを確認するために、フレームごとに映画を巻き戻す必要がありました。
  • RAM 手法: 著者たちは、もし「最終的な絵画」(「クリーンな終点」)が分かれば、プロセスを理解するために映画全体を見る必要はないと気づきました。完成した絵画を取り、数学的に瞬時にそれに「ノイズを加える」ことで、元の訓練と同じように乱れたバージョンを作成できるのです。

2. 「一度で完了」のフィードバック
フィードバックを得るために絵画プロセス全体をシミュレートする代わりに、RAM は以下のように行います。

  1. 生成: AIが完成した画像(終点)を描きます。
  2. 評価: 評論家が評価を与えます(例:「文字の描写は素晴らしい!」)。
  3. 瞬時の巻き戻し: 巻き戻しをシミュレートする代わりに、数学的に瞬時にその画像の「ノイズ版」を作成します。
  4. 学習: AIは、その特定のノイズ版を高評価の画像へと変えることを学びます。

魔法のような洞察:
この論文は、画像に「ノイズを加える」ための規則は、画像をより良くしようとしている場合でも変わらないことを証明しています。変化する唯一のことは、AIが最初にどの画像を描くかという点です。「ノイズの規則」が変わらないため、AIは元の訓練で使用した同じ単純な数学を、新しい目標に対して使用できるのです。

これが重要である理由

  • 速度: この論文は、RAM が従来の手法よりも34 倍から 50 倍速いと主張しています。同じレベルのスキルに到達するまでの時間が、その一部にまで短縮されます。
  • 単純さ: 複雑で不安定な計算(「SDE ロールアウト」や「backward adjoint sweeps」など)を必要としません。元の訓練と同様に、単なる単純な回帰タスクです。
  • 品質: Stable Diffusion 3.5Mでテストしたところ、AI は以下の点で大幅に向上しました。
    • 構成力: 物体を正しい場所に配置すること(例:冷蔵庫の「左」にトラック)。
    • テキスト描画: 画像内に文字を明瞭に書くこと。
    • 人間の嗜好: 人間が実際に見て好む画像を作ること。

結論

RAMを、芸術家に「魔法の消しゴム」と「魔法のスコアカード」を与えるものだと考えてください。何が間違っていたかを見るために芸術家にキャンバス全体を塗り直すことを強要する代わりに、魔法の消しゴムは瞬時に彼らの最高傑作の乱れたバージョンを見せ、スコアカードはまさにその特定の混乱をどのように修正すべきかを正確に伝えます。これにより、AI は従来の手法の重い計算コストなしに、複雑な新しいスキルを学ぶことができるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →