← 最新の論文
💻 computer science

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

本論文は、マルチモーダル大規模言語モデルと合成された「思考発話(think-aloud)」のトランスクリプトを活用することで、人間の注視スキャンパスを、従来のカテゴリ的なデコーディングを超えて、人間の意図のオープンエンドなニュアンスを捉えた自由形式の自然言語記述へと解読する新しいフレームワークであるGazetteを提案するものである。

原著者: Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの目が、暗い部屋の中の懐中電灯の光であると想像してみてください。何かに目を向けるとき、その光はただ静止しているわけではありません。それは、ほんのわずかな時間、あちこちの場所に飛び跳ねるように留まります。この動きのパターンのことを「スキャンパス(走査経路)」と呼びます。長い間、科学者たちは、あなたの懐中電灯の光がどこに落ちたかを観察することで、あなたが何を考えているのかを解明しようとしてきました。通常、彼らはこれを多肢選択式のクイズのように扱ってきました。「この人は猫を探していますか、それとも犬を探していますか?」と問いかけ、コンピュータはあらかじめ決められたリストの中から一つの答えを選び出すのです。しかし、人間の思考は混沌としており、創造的です。あなたは単に「犬」を探しているのではなく、「ソファの後ろに隠れている、赤いバンダナを巻いた、毛並みの荒いゴールデンレトリバー」を探していることもあるのです。従来の質問方法は、そのような詳細を捉えるにはあまりにも単純すぎました。ここで、「ゲイズ・デコーディング(注視デコーディング)」と呼ばれる新しい分野が登場します。これは、目の動きを、私たちの頭の中で起きている豊かで自由な物語へと翻訳しようとする試みです。

ここで、このパズルを解くための巧妙な新しい方法を紹介する新しい研究論文が登場します。ストーニーブルック大学とアデレード大学の研究者たちは、「Gazette」と呼ばれるシステムを構築しました。Gazetteは、コンピュータに選択肢を選ばせるのではなく、人が何を探しているのかについて、人間と同じように自然な言語を用いて、自由な形式の物語を書くように設計されています。これは、硬直したチェックリストから、あなたが何を見ているのかを正確に描写できるクリエイティブな作家へとアップグレードすることだと考えてください。

研究者たちが直面した大きな問題は、同じものを見ていたとしても、人によって目の動きが少しずつ異なるということです。もし10人に「赤い車」を探すよう頼んだとしたら、10人それぞれが、少しずつ異なる方法で車を見ることになります。ある人はホイールを先に見るかもしれませんし、他の人は窓を見るかもしれません。もしコンピュータに一人の人物の目の動きだけを見せたとした方、コンピュータは混乱してしまいます。それは、一人の人が音痴に鼻歌を歌っているのを聞いて、曲を当てようとするようなものです。メロディは聞こえるかもしれませんが、ノイズのせいで確信を持つのが難しくなります。

この問題を解決するために、チームは「思考発話(think-aloud)」戦略を用いた賢いトリックを考案しました。彼らは、一人ひとりの目の動きは独特であっても、動いている「理由」は同じであることに気づきました。そこで、彼らは強力なAI(GPT-4)を使用して、同じ物体を探そうとしている多くの異なる人々の目の動きを観察させました。AIは探偵のように振る舞い、個人の癖を無視して、共通のパターン、つまり「人間が特定のものを探すための秘密のレシピ」を見つけ出しました。そして、AIは「まず大きな形を見て、次に赤い部分にズームする」といった、戦略を説明する「思考発話の書き起こし」を作成しました。

彼らは、この新しいモデルであるGazetteに、これらのAIが生成した物語と目の動きを一緒に読み取るように学習させました。これにより、モデルは「目標(その人が何を探しているか)」と「ノイズ(その人の独特な見方)」を区別することを学びました。テストを行ったところ、Gazetteは従来の方法よりも目標を推測することにおいて非常に優れていました。例えば、写真の中の特定の車を探すよう求められたとき、Gazetteは単に「車」と言うだけではありませんでした。それは「右上の角にある黒い車」と言うことができ、難しい課題であっても高い精度で行うことができました。

この論文は、目の動きそのものだけでなく、その背後にある「戦略」をコンピュータに理解させることで、人間の意図をより詳細にデコードできることを示しています。このシステムは、人々が探しているものについて一致している場合(特定の物体を見つける場合など)に最もよく機能しますが、これは、コンピュータが私たちの視線の先を見るだけで、私たちの目標を理解できる未来に近づいていることを示唆しています。それは、より優れた支援技術や、私たちが世界とどのように相互作用しているかについての深い理解への扉を開くものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →