← 最新の論文
💻 computer science

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDaは、従来の自己回帰型モデルと比較して、競争力のある性能、より高速な推論、および強化された制御可能性を実現するために、並列デコーディングと双方向コンテキストを活用した離散拡散メカニズムに基づく新しいビジョン・ランゲージモデルのファミリーを導入する。

原著者: Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが「見る」ことと「話す」ことを同時に行える世界を想像してみてください。これは、ビジョン・ランゲージ・モデル(VLM)の領域です。これらは、夕日の写真を見てそれについての詩を書いたり、複雑なチャートを調べてその傾向を説明したりできる、非常にスマートなAIアシスタントです。長年、これらのモデルの標準的な思考方法は、まるでテストを受けている学生のようです。彼らは左から右へと厳密に、一度に一単語ずつ答えていきます。「The」、「sky」、「is」と書き進め、前の単語を書き直すために振り返ることは決してありません。この方法はうまく機能しますが、並列で書くことができないため遅く、また、もし文の最初の単語を間違えてしまったら、最初からやり直さない限り簡単に修正できないという、融通の利かない性質を持っています。

しかし、もし別の方法があったらどうでしょう?文章を一単語ずつ書いていく代わりに、疑問符で埋め尽くされた白紙のページから始めて、どの単語がどこに入るかを一度に決定し、全体像が明確になるまで選択肢を絶えず洗練させていく様子を想像してみてください。これが「拡散モデル(diffusion models)」の背後にあるアイデアです。もともとはノイズから見事な画像を作り出すことで有名になりましたが、研究者たちは最近、この「穴埋め」のアプローチをテキストに応用しようと試みてきました。大きな疑問は、この柔軟で並列的な思考方法と、画像を見る能力を組み合わせることができるか?という点です。もし、この「穴埋め」方式による柔軟な思考法と、画像を理解する能力を組み合わせることができれば、私たちはよりスマートなAIを手に入れることができるかもしれません。例えば、すべての行が特定の文字で始まる詩を書くといった、厳格なルールに従う必要があるタスクにおいて優れた能力を発揮したり、一つの単語が終わるのを待たずに次の単語を開始できるため、はるかに高速になったりするのです。

そこで登場するのが、UCLA、パナソニック、Adobe、Salesforceの研究者によって導入された新しいAIモデルファミリー、「LaViDa」(Large Vision-Language Diffusion Model)です。LaViDaを、画像を用いて理解し、それについて記述することができる「マルチタスクを行うアーティスト」だと考えてください。従来のロボットのように物語を一単語ずつ書くのではなく、LaViDaは「マスク」(プレースホルダー)で構成された空白のキャンバスから始まり、文全体を一度に見ることができる方法で、空白を埋めながら徐々に答えを明らかにしていきます。

研究者たちは、このアプローチにはいくつかの「スーパーパワー」があることを発見しました。LaViDaは最終的な回答を確定させる前に文の構造全体を見ることができるため、すべての行が特定の文字で始まらなければならない詩を完成させるといった、厳格なルールを必要とするタスクにおいて驚異的な能力を発揮します。テストにおいて、LaViDaはこれらの「制約付き」タスクで既存の最高水準のモデルを圧倒し、性能を59%向上させました。また、ユーザーに対してユニークな「スピードダイヤル」を提供します。一度に埋める空白を少なくすることで超高速に設定することもできますし、より多くのステップを踏んで回答を洗練させることで超高品質に設定することも可能です。画像キャプション生成においては、競合モデルよりもほぼ2倍速く、かつ、CIDErと呼ばれる品質指標において4.1ポイント高いスコアを記録し、より優れた説明文を記述することに成功しました。

しかし、論文では、この新しい手法がすべてを即座に解決する魔法の杖ではないことも指摘しています。研究者たちは、これをうまく機能させるためにいくつかの巧妙なトリックを編み出す必要がありました。一つには、モデルに二つの異なるパズルのバージョンを同時に解かせることで、重要な手がかりを見逃さないようにする「補完的マスキング(complementary masking)」技術を開発しました。また、「Prefix-DLM」システムも構築しました。これはスマートなショートカットとして機能し、モデルが新しい単語を推測するたびに画像と質問を読み直すことなく、それらを記憶できるようにするものです。

こうした成功にもかかわらず、論文はLaViDaがまだ成長の余地を残していることも慎重に指摘しています。推論や一般知識のテストでは他のモデルに打ち勝っていますが、メモリに収まるように画像の詳細を圧縮しなければならないため、画像内の小さなテキスト(OCR)の読み取りには苦戦することがあります。著者らは、拡散モデルは標準的な「一単語ずつ」のアプローチに対する強力で有望な代替案ではあるものの、現在存在する非常に大規模でデータ集約型のAIモデルに匹敵する規模へとスケールアップする方法については、まだ学習の過程にあると示唆しています。結局のところ、LaViDaは「穴埋め」方式が単に画像を作るためのものではなく、コンピュータが私たちの視覚的世界を理解するための、強力で柔軟、かつ高速な方法になり得ることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →