← 最新の論文
💻 computer science

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VLは、視覚的スキャンパス予測のタスクをビジョン言語モデル内での自己回帰的なトークン生成として再定義することにより、視聴者の属性やタスクに基づく柔軟な条件付けを可能にしつつ、大幅な性能向上を実現し、制御されたin-silico行動シミュレーションを促進することで、視覚的スキャンパス予測における新たな最先端(state-of-the-art)を確立している。

原著者: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

公開日 2026-07-03
📖 1 分で読めます☕ さくっと読める

原著者: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人が写真を見たとき、次にどこに目を向けるかを予測することを想像してみてください。長い間、科学者たちはこの仕事のためだけに作られた、特殊で硬直した機械を構築してきました。これらの機械には固定されたルール(例:「人は常に最初に中央を見る」など)があり、「この人は診断を探している医師だ」とか「この人はおもちゃを探している子供だ」といった新しい技術を学ぶことが容易ではありませんでした。

この論文は、ゲームのルールを変えるような新しいモデル、DeepGaze3.5-VLを紹介しています。このモデルは、目の動きを**「物語を書くこと」**として扱います。

以下に、その仕組みと研究結果を、簡単な比喩を用いて解説します。

1. コアとなる考え方:目の動きは「テキスト」の物語である

人の目の経路(スキャンパスと呼ばれます)を、一つの「文章」と考えてみてください。

  • 従来の方法: その文章を描くためのカスタムロボットを作っていましたが、もしスタイル(例:子供の手書きから大人の手書きへ)を変えたいと思ったら、ロボットを作り直す必要がありました。
  • 新しい方法: 著者たちは、目の動きは単なる座標のシーケンス(例:「ここを見て、次にあそこを見る」)であることに気づきました。彼らは、巨大な学習済みAI(大規模視覚言語モデル)に、これらの座標を**「文章の中の単語」**のように扱うよう教えました。

これらの目の位置を「トークン」(単語の文字のようなもの)に変換することで、画像と言語を理解するように既に訓練されているAIの巨大な脳を利用して、次の「単語」(次に目が向かう場所)を予測することができるのです。

2. 「魔法」のプロンプト

このモデルは言語として思考するため、チャットボットに質問するように指示を与えることができます。

  • 比喩: ツアーガイドを想像してください。もしあなたがガイドに「観光客のように美術館を見せて」と言えば、ガイドは有名な彫像を見せます。もし「美術史家のように見せて」と言えば、ガイドは筆致(ブラッシュストローク)を指摘します。
  • 結果: 研究者たちは、テキストプロンプトを変更するだけで(例:「猫を探している人の視線を予測せよ」対「ただ周囲を見渡している人の視線を予測せよ」)、モデルが即座に適応することを示しました。新しいハードウェアや複雑なコードの変更は必要ありません。ただ指示を読み取るだけです。

3. なぜ優れているのか:「スマート」か「巨大」かという論争

研究者たちは問いかけました:このモデルは単に巨大だから優れているのか、それとも実際にシーンを理解しているからなのか?

  • テスト: 彼らは、全く同じ「目」(ビジョンエンコーダー)を使用しながら、異なる「脳」を持つ他のトップモデルと比較しました。
  • 発見: 単に大きな「目」を持っていることよりも、「脳」(AIの言語部分)の方が重要でした。画像の「意味」と目の動きの「物語」を理解しているモデルは、単にピクセルを見ているだけのモデルよりもはるかに優れたパフォーマンスを発揮します。
  • スコア: 標準的なテスト(MIT1003)において、彼らのモデルは以前の最高手法と比較して、予測精度を**46%**向上させました。

4. 「タイムマシン」実験(介入)

この論文が示している最もクールなことの一つは、実在の人間を必要とせずに、コンピュータ内で**「もしも(what-if)」のシナリオ**を実行できることです。

  • 比喩: ビデオゲームを想像してください。時間を一時停止し、一つの変数(例:「プレイヤーが疲れていた」)を変更して、ゲームがどのように異なって展開するかを瞬時に確認できるようなものです。
  • 実験: 研究者たちは、人間が写真を短時間(50ミリ秒)見た特定の瞬間を取り出し、モデルにこう尋せました。「もし彼らがもっと長く(600ミリ秒)見ていたらどうなっていたか?」
  • 結果: モデルは、短い注視は素早く本能的な視線(反射のようなもの)であり、長い注視はより彷徨うような、思索的な探索につながることを予測しました。モデルは、データからこれらの複雑な人間の行動を純粋に読み取り、**デジタル・サンドボックス(実験場)**として機能したのです。

5. 「誰が」という要素(パーソナライゼーション)

このモデルは、誰が 見ているのかを伝えることもできます。

  • 比喩: もしあなたの友人が犬好きだと知っていれば、そしてあなたに公園の写真を見せたら、その友人はまず犬を見るでしょう。もし同じ写真を鳥好きの人に見せたら、その人は木を見るでしょう。
  • 結果: 特定の「被験者ID」(例:「Subject A3F8」)をモデルに供給することで、モデルはその特定の人物特有の習慣を予測することを学習しました。新しいアーキテクチャを必要としたのではなく、単に異なる「登場人物」には異なる「ストーリーライン」があることを学んだのです。

まとめ

DeepGaze3.5-VLは、人間がどこを見るかを予測する新しい方法です。硬直した特化型のツールを作る代わりに、著者たちはアイトラッキングを言語の問題へと変えました。これにより、彼らは以下の特徴を持つモデルを生み出しました。

  1. よりスマート: シーンの文脈と意味を理解しています。
  2. 柔軟: 新しい指示をタイピングするだけで、その挙動を変更できます。
  3. 高精度: 過去の記録を大幅に更新する精度を実現しています。
  4. 実験的: 実物の実験をやり直すことなく、人間の視覚に関する「もしも」のシナリオを瞬時にシミュレートすることを可能にします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →