← 最新の論文
💻 computer science

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1は、新しいポストトレーニング・フレームワーク内で教師あり微調整とマルチタスク強化学習を統合することで推論能力を向上させる、統一されたマルチモーダル拡散言語モデルであり、多様な視覚的理解および生成タスクにおいて強力な性能を示しています。

原著者: Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ある非常に才能のあるアーティストを想像してみてください。そのアーティストは絵を描くこともできれば、物語を書くこともできます。このアーティストの名前は LaViDa-O といいます。彼らは指示に従うのは得意なのですが、トリッキーなパズルを解いたり、なぜその選択をしたのかを説明したりするよう求められると、時々ただ推測したり、急いで答えを出したりしてしまうことがあります。

この論文は、LaViDa-R1 という新しい学習方法を紹介しています。これは、アーティストに新しい知識を教えるのではなく、「考え方」を教えるものだと考えてください。それは、アーティストに「思考の帽子」を授け、立ち止まり、推論をスケッチし、自分の作業をチェックしてから、最後に傑作を披露するように強制するようなものです。

以下に、シンプルな比喩を用いてその手法を説明します。

1. 「統合されたジム」(統合的なポストトレーニング)

通常、AIに数学をより得意にさせたい場合は、数学の問題だけを見せます。写真編集を上手くしたい場合は、写真編集のタスクだけを見せます。これは、生徒を午前中に数学のクラスへ送り、午後に写真のクラスへ送るようなものですが、その二つのスキルを一度も混ぜ合わせることがありません。

LaViData-R1 は、これらすべてを一つの巨大な「ジム」に入れます。このモデルに対し、数学、写真編集、画像内の物体発見、そして質問への回答を同時に学習させます。論文では、この「統合された」アプローチによって、特定の分野のスペシャリストになるのではなく、あらゆる分野においてモデルが総合的に賢くなることが示されています。

2. 「答え強制」のトリック(学生が行き詰まったとき)

アーティストが数学の問題を解こうとしている場面を想像してください。彼らは3回試行錯誤しますが、3回とも答えが間違っています。通常の学習セッションでは、先生はただ「もう一度やってみて」と言うだけかもしれません。そうなると、アーティストはフラストレーションを感じたり、どのように失敗したのかが分からないため、何も学べなかったりします。

LaViDa-R1 は、Answer-Forcing(答え強制) と呼ばれるトリックを使用します。

  • シナリオ: モデルが問題を解くことに失敗する。
  • トリック: 先生が、紙の最後にこっそりと「正しい答え」を書いておく。
  • 魔法: このモデルは「拡散(ディフューザー)」モデル(空白を埋めることで機能するもの)のように構築されているため、最後にある正しい答えを見て、そこから逆方向に遡り、中間の足りない推論ステップを埋めることができます。
  • 結果: モデルは、「ああ、もしこの答えを出したいなら、このように考えなければならないのだ」と学びます。これにより、モデルは自分自身を教えるために、ゼロから完璧な「思考プロセス」を作り出すのです。

3. 「ツリーサーチ」(森の探索)

時には、「もっとトロピカルな感じにする」といった、単一の「正解」を確認できないケースもあります(写真編集などの場合)。モデルは、何が良い見た目になるかを推測しなければなりません。

もしモデルが10回試行して、その10回すべてが良くなかった場合、有用なフィードバックは得られません。
LaViDa-R1Tree Search(ツリーサーチ) を使用します。

  • モデルが旅を始め、10通りの異なる経路を進むと想像してください。
  • そして、どの経路が最も良く見えるかを確認します。
  • 最初からやり直す代わりに、その「最も良い経路」を選び、少し戻ってから、その特定の地点からさらに10通りの新しいバリエーションへと枝分かれしていきます。
  • これは、ハイカーが「あの道は良かった」と気づいたので、山の麓からやり直すのではなく、その地点まで戻って、そこから10の新しい方向を試すようなものです。これにより、より速く最適な解決策を見つけることができます。

4. 「バランスの取れたスコアカード」(より優れた採点)

これらのモデルを訓練する際、コンピュータは推測がどれほど「良かったか」を計算しなければなりません。通常、この計算は、まるで先生が、ある問題は10点、別の問題は1点として、偶然に偏った配点でテストを採点しているかのように、乱雑で不均衡です。

論文では、Complementary Likelihood Estimator(相補的尤度推定器) を導入しています。

  • これは、モデルの回答に含まれる「すべての単語」が公平に採点されることを保証する採点システムのようなものです。
  • 推論のどの部分も見落とされないように、回答に対して2つの異なる「視点」を使用します。これにより、不均衡なフィードバックによってモデルが混乱することを防ぎます。

結果:何を達成したのか?

論文によれば、これらのトリックを用いることで、LaViDa-R1 は以下の項目において大幅に向上しました。

  • ビジュアル数学: 図やチャートを含む数学の問題の解決。
  • オブジェクト・グラウンディング: 複雑な記述(例:「プレイヤーである可能性が低い人物を探せ」)に基づいた画像内の特定の物体の特定。
  • 画像編集: 「森の中の小屋をビーチハウスに変えて」といった指示に基づき、まず「何を変える必要があるか」を推論した上での写真の変更。

要約すると: この論文は、マルチモーダルAI(視覚とテキストの両方を扱うAI)に「話す前に考える」ことを教えるための新しい方法を提示しています。異なる種類のタスクを混ぜ合わせ、正しい答えをガイドとして利用してモデル自身に失敗から学ばせ、スマートな探索戦略を用いることで、従来のバージョンよりもはるかに優れた推論能力を持つモデルを作り上げました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →