← 最新の論文
💻 computer science

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

Sparse-LaViDaは、推論時に冗長なマスク済みトークンを動的に切り詰めることでMasked Discrete Diffusion Modelを加速させ、特殊なレジスタートークンと一貫した学習アテンションマスクを通じて生成品質を維持し、多様なマルチモーダル・タスクにおいて最大2倍の高速化を実現する新しいフレームワークである。

原著者: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大なジグソーパズルを解こうとしている場面を想像してみてください。ただし、箱に描かれた絵は見えず、すべてのピースの色や形をゼロから推測しなければならないとしたらどうでしょう。人工知能の世界では、コンピュータが画像を生成したり複雑なシーンを理解しようとしたりする際、まさにこのようなことが起こります。長い間、科学者たちは主に2つのツールを使用してきました。一つは、文章をタイピングするように、ピースを一つずつ組み立てていくもの(オートレグレッシブ・モデルと呼ばれます)、もう一つは、静止したノイズ混じりのぼやけた状態から始まり、画像が現れるまで徐々にノイズを取り除いていくもの(拡散モデルと呼ばれます)です。最近、「マスク付き離散拡散(Masked Discrete Diffusion)」と呼ばれる新しいハイブリッド・アプローチがスーパースターとして登場しました。これは、テキストと画像をどちらも一連のパズルのピース(トークン)の長い文字列として扱います。コンピュータは、すでに知っているピースを見ることによって、欠けているピースを予測することを学習します。これは、AIが単に「次のピース」を見るのではなく、「画像全体」を一度に見ることができるため、非常に強力であり、写真の編集や数学の問題を解くことに適しています。しかし、落とし穴があります。画像をきれいにするために、コンピュータは、すでに解決済みのピースやまだ隠されているピースも含め、ステップごとに「すべての」パズルのピースを再確認しなければなりません。それはまるで、シチューを作っているシェフが、味を完璧にするために、すでに完璧に味付けされた食材も含めて、毎分、鍋の中のすべての材料を味わっているようなものです。これにより、プロセスは遅くなり、コンピュータの計算資源を大量に消費します。

ここで、これらのAIモデルにとっての賢い副料理長のような役割を果たす新しい手法、Sparse-LaViDaが登場します。この研究の背後にいる研究者たちは、コンピュータが毎回パズル全体を凝視する必要はなく、現在解かれている最中のピースだけに集中すればよいということに気づきました。彼らは、調理過程において不要なマスク付きトークン(隠されているピースやすでに解決済みのピース)を動的に「切り詰める(truncate)」、つまり切り捨てるシステムを構築しました。しかし、ここが巧妙な点です。ただ単にそれらのピースを捨ててしまうと、AIが画像全体の文脈を忘れてしまう可能性があります。そのため、Sparse-LaViDaは特別な「レジスタ・トークン(register tokens)」を導入しています。これらは、欠けているピースの代わりを務める、小さな魔法のしおりのようなものです。これらはコンパクトな要約であり、AIに対して「ここにはまだ1,000個のピースがあるけれど、今はそれらを個別に見ておく必要はないよ。このしおりを信じて」と伝えます。これにより、AIは全体像を念頭に置きながら、冗長な作業をスキップできるのです。

論文では、このアプローチが素晴らしい成果を上げることを実証しています。これらのレジスタ・トークンと、コンピュータのメモリを整理する特別な方法(KVキャッシュと呼ばれます)を使用することで、新しいモデルであるSparse-LaViDaは、品質を損なうことなくプロセスを大幅に高速化しました。テストでは、テキストからの画像生成をほぼ2倍速く(具体的には1.96倍の高速化)、画像編集をほぼ3倍速く2.84倍の高速化)、そして視覚的な数学的推論を2.80倍速くしました。決定的なのは、これが単純なタスクで機能する単なるトリックではなく、「インペインティング(画像の欠損部分を埋めること)」や「アウトペインティング(画像を拡張すること)」のような複雑な作業を行う能力を維持していることを著者らが示している点です。他の高速化手法は、こうした作業を壊してしまうことがよくあります。研究者たちは、この効率化は大きな利点である一方で、モデルにこれらの「しおり」を正しく使う方法を教えるための特定の学習プロセスが必要であると指摘しています。また、彼らは既存のモデルをファインチューニングすることでこれらの結果を得ましたが、この手法は将来的に巨大なモデルをゼロから学習させることも理論的に可能であると述べています。最終的に、Sparse-LaViDataは、私たちが「ケーキを食べて、かつ、そのケーキを保持する(両立させる)」ことができることを示唆しています。つまり、視覚的世界を理解し創造する上で不可欠な「双方向的な思考」を犠牲にすることなく、超高速な生成を実現できるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →