← 最新の論文
🤖 AI

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLiteは、予測された視線に基づいてビデオを正確にクロップすることで、専用のアイトラッキングハードウェアを必要とせずに記述品質を維持しつつ、コンシューマー向けハードウェア上でリアルタイムに動作させ、マルチモーダルLLMのためのトークン効率の高い一人称視点ビデオ理解を可能にする、軽量なオンデバイス型デュアルプロセス視線予測器です。

原著者: Matteo Stoiber, Niels Buus Lassen

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Matteo Stoiber, Niels Buus Lassen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

スマートグラスを装着し、自分の目を通して世界を観察し、自分が何をしているかを説明してくれる様子を想像してみてください。この技術は、外科医が複雑な手順を思い出すのを助けたり、整備士の修理をガイドしたり、あるいは視覚障害を持つ人々が周囲の状況をナレーションしてもらうのを支援したりする可能性を秘めています。これを実現するためには、グラスは画像を理解し言語を操ることができる強力な人工知能システムにビデオフィードを送信しなければなりません。しかし、ここには大きなボトルネックが存在します。高解像度のビデオを送信するには膨大な量のデータが必要であり、小型のウェアラブルデバイスが容易に送信したり処理したりできる量をはるかに超えています。また、これらのビデオを理解するコンピュータシステムも、一度に大量の視覚情報を与えられると、あまりに膨大なピクセルの量に圧倒されてしまうことがあります。

研究者たちは、人が実際に注視している部分だけに焦点を当てることで、このデータ問題を解決する巧妙な方法を見出しました。画面全体の広い視野を送る代わりに、システムは装着者の視線が固定されている小さな領域だけを表示するようにビデオをクロップ(切り抜き)することができます。これにより、コンピュータが処理する必要のあるデータ量を約90パーセント削減でき、タスクをより高速かつ安価にすることができます。これまで、このアプローチには、目の動きを正確に追跡するためにグラスに組み込まれた特別な高価なハードウェアが必要でした。専用のハードウェアがなければ、システムはどこを見るべきかを知ることができず、スマートグラスの潜在能力は一般消費者にとって実現不可能なままとなっていました。

ある研究チームは、専用の視線追跡センサーは実際には必要ないことを実証しました。彼らは、ビデオストリーム自体を分析することによって、人がどこを見ているかを予測できる軽量なソフトウェアプログラムを開発しました。「EgoGazeLite」と呼ばれるこのプログラムは、標準的なスマートフォン上で直接動作し、高価なハードウェアセンサーの代わりを務めるのに十分な精度を備えています。研究者たちは、ビデオクリップを人工知能システムに送り込み、実際の視線追跡データまたはソフトウェアによる予測に基づいてそれらをクロップするというテストを行いました。その後、人工知能にビデオ内の動作を説明させました。その結果、予測された視線から生成された説明は、実際の視線追跡データから生成されたものと事実上同一であることが示されました。あらゆるテストケースにおいて、ソフトウェアによる予測はハードウェアによる測定と同等の性能を発揮し、専用のセンサーなしでもシステムが機能することを証明しました。

このソフトウェア自体は驚くほど効率的です。現代のスマートフォンのプロセッサのような一般的なハードウェア上でリアルタイムに動作できるほど小さく、各ビデオフレームの予測とクロップを22ミリ秒未満で完了します。この速度は極めて重要です。なぜなら、システムがラグ(遅延)なくライブビデオフィードに追随できることを意味するからです。研究者たちは、料理、自転車の修理、サッカー、そして心肺蘇生法(CPR)の実施など、人々が行う様々なタスクの数千時間に及ぶビデオを用いて、このソフトウェアを学習させました。未知のビデオに対してテストを行った際、ソフトウェアは高い精度で人がどこを見ているかを特定することに成功しました。このソフトウェアは、二つの異なる「注意の払い方」を学習することで機能します。一つは、シーンの中で視覚的に明るい場所や動いている場所に基づくもの、もう一つは、直前に人がどこを見ていたかに基づくものです。これら二つの手がかりを組み合わせることで、次の注視点を推測します。

研究者たちは、自分たちの発見が強固なものであることを確実にするため、単一の評価手法には頼りませんでした。彼らはビデオの説明を生成するために二つの異なる大規模言語モデルを使用し、その説明を自動スコアリングシステムおよび他の高度な人工知能モデルの両方に判定させました。彼らは、予測された視線の品質を、ハードウェアセンサーによる「正解(グラウンドトゥルース)」および、画面の中央を単にクロップするシンプルなベースラインと比較しました。結果は明白でした。予測された視線による説明は、中央クロップよりも有意に優れており、ハードウェアベースの視線によるものとは統計的に区別がつかないものでした。実際、ソフトウェアによる予測は実際の視線追跡データに非常に近く、彼らが実施した10種類のテストシナリオすべてにおいて、その差は有意なものとして測定できないほど微小でした。

この研究は、注視を認識する人工知能の普及における大きな障壁を取り除きました。ソフトウェアモデルがハードウェアセンサーを代替できることを証明することで、研究者たちは、将来のスマートグラスが、有用であるために高価で電力を消費する視線追跡コンポーネントを搭載する必要はないことを示しました。システムは、カメラと標準的なプロセッサを備えたあらゆるデバイスに展開できるようになり、幅広い日常活動において手頃な価格のリアルタイムな支援への扉を開きました。本研究は特定のデータセットとモデルを用いて行われましたが、その結果は、私たちがどのようにこれらのシステムを構築できるかについての根本的な転換を示唆しています。つまり、専用のハードウェアから、私たちが目にしているものを通じて人間の注意を理解できる、インテリジェントで軽量なソフトウェアへと移行していくのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →