← 最新の論文
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaVは、時間的類似性ルーターによって導かれる、フルイメージ生成をコンパクトな視覚的更新パラダイムに置き換える手法と、StructCoTと呼ばれる新しい大規模なインターリーブ型推論データセットによって、推論の効率と性能を向上させる統合された大規模マルチモーダルモデルです。

原著者: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、複雑な「サイモンズ・セイズ(命令を聞くゲーム)」をロボットの友人とプレイしている場面を想像してください。ただし、ただ指示を聞くだけではなく、何が起きているかを友人に示すために、ゲームのすべてのステップをホワイトボードに描かなければなりません。

旧来の方法:描きすぎるアーティスト
現在、画像を使って問題を解決しようとする(迷路を解いたり、数学のパズルを解いたりする)ほとんどの高度なAIモデルは、非常に丁寧ですが、少し非効率なアーティストのように動作しています。例えば、ゲームがテーブルの上にカップが置かれた写真から始まるとしましょう。

  • ステップ1: AIは、カップのあるテーブル全体を描きます。
  • ステップ2: ゲームのルールが「カップを左に動かせ」と言います。しかし、AIはホワイトボード全体を一度消去し、カップがわずか1インチ動いただけなのに、テーブル全体(カップ、テーブルの脚、背景、影を含む)を再び描き直します。
  • ステップ3: 「カップを回転させろ」という指示が出ます。AIはすべてを消去し、テーブル全体を再び描き直します。

この手法は「フルイメージ生成(full-image generation)」と呼ばれます。著者らは、これが膨大なエネルギーとスペースの無駄であると主張しています。これは、文章の中でたった一つの単語を変えたいだけなのに、毎回辞書全体を書き直しているようなものです。AIは、変化していない部分を描き直すためにほとんどの時間を費やしており、それが動作を遅くし、時には詳細(例えば、以前の見た目を忘れてしまったために、誤ってカップの色を変えてしまうなど)を台無しにする原因にもなります。

新しい方法:DeltaV、「ステッカー」アーティスト
この論文では、DeltaVと呼ばれる新しいモデルを紹介しています。DeltaVは、シーン全体を描き直すのではなく、賢いステッカー・アーティストのように振る舞います。

  • ステップ1: テーブルとカップを描きます(「ベース状態」)。
  • ステップ2: カップを動かす必要があるとき、DeltaVはテーブルを描き直しません。代わりに、古い場所の上に、カップが左に移動した様子を示す小さな「ステッカー」を描いて貼り付けます。テーブルの脚や背景は変化していないため、それらは無視されます。
  • ステップ3: カップが回転するとき、DeltaVは単に小さな「回転ステッカー」を追加します。

このアプローチは**視覚的更新(visual updates)と呼ばれます。論文は、変化した部分(「デルタ」)のみを描くことで、AIが膨大な作業量を節約できることを示唆しています。彼らのテストでは、この手法によって、画像の品質を損なうことなく、新しい「描画トークン」(画像を生成するためのデジタル・インク)の数を平均で55.6%**削減できました。

スマートな「停止」ボタン:TSIMルーター
「もし変化が巨大だったら? もしシーン全体が爆発したら?」と疑問に思うかもしれません。
DeltaVには、TSIMルーターと呼ばれる組み込みのスマート・マネージャーがあります。これは、新しいシーンが以前のシーンとどれくらい異なっているかを見極める監督者のようなものです。

  • 変化が微細な場合(カップを動かすなど)、監督者は「少数のステッカーだけを使いなさい」と指示します。
  • 変化が劇的な場合(部屋全体が変わるなど)、監督者は「よし、正確に行うために、もっと多くのステッカーを使いなさい」と指示します。

論文では、これを画像の再構成能力をチェックすることで測定しました。その結果、ある一定のポイントを超えてトークンを追加し続けても、画像はそれ以上良くならないことが分かりました。そこで、TSIMルーターは「追加の努力」が見返りをもたらさなくなった時点で、トークンの追加を停止します。これにより、AIは単純なステップで時間を無駄にせず、かつ複雑なステップでは手を抜かないように制御されています。

訓練の場:StructCoT
DeltaVにこの方法を教えるために、研究者たちは単なる古いパズル本を使うことはできませんでした。彼らは、StructCo𝖳と呼ばれる大規模な新しいトレーニング・セットを構築しました。

  • それは105万個のサンプルを含んでいます。
  • 逻辑パズルや数学の問題から、ロボットの計画、科学の問題に至るまで、44種類の異なるタスクをカバーしています。
  • 論文は、従来のデータセットは小さすぎるか、あるいは迷路のような特定のことに特化しすぎていると主張しており、StructCoTは、視覚的な状態が時間の経過とともにどのように変化するかについて、AIにより幅広い教育を与えます。

結果:うまくいったのか?
論文によると、DeltaVをテストした結果は以下の通りです。

  • マルチモーダル推論の問題において、従来の「すべてを描き直す」方法よりも**3.3%**優れた成績を収めました。
  • DeltaVはより小さなモデル(2Bパラメータ)であるにもかかわらず、これらの推論タスクにおいて、より大きなオープンソースモデルを平均で**8.4%**上回りました。
  • また、同等のモデルであるQwen3-VL-2Bと比較して、外部ベンチマークで**5.9%**上回りました。

論文が否定していること
著者らは、何が機能しないのかについても明確に述べています。彼らは、推論の各ステップでフル解像度の画像を生成する必要があるという考えに対して、明確に反対しています。彼らは、そのような試みは「視覚的トークンの冗長性(デジタル・インクの無駄)」を生み出し、重要ではないものを描き直すことに気を取られることで、AIの推論能力を実際に低下させると示唆しています。また、この手法は推論には優れているものの、極めて微細な詳細(塵の小さな一粒を見つけるなど)を特定する必要があるタスクにおいては、フルイメージの方が適している可能性があることも指摘しています。

結論
この論文は、AIの推論の未来は、世界全体を何度も何度も描き直すことではないと示唆しています。むしろ、「何が変わったのか?」という観点で考えることです。変化だけに焦点を当てることで、DeltaVはより速く、より効率的になり、その重厚な「フルイメージ描き直し」の従兄弟たちよりも驚くほど優れた問題解決能力を発揮します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →