← 最新の論文
💻 computer science

ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement

本論文は、音声および意味的手がかりを統合してショートフォーム動画広告の動的な注視領域を予測する3D U-Netアーキテクチャに基づく深層学習モデルViASNetを導入し、アイトラッキングによる検証とエントロピーに基づく診断を通じて広告設計の最適化および関心を引かないコンテンツの特定を実現する能力を実証する。

原著者: Jianping Ye, Michel Wedel

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Jianping Ye, Michel Wedel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

30 秒の CM を撮影するディレクターになったと想像してください。視聴者がその映像を見たとき、その視線がまさにあなたが意図した場所、つまり製品、笑顔の俳優、またはキャッチーなロゴに正確に落ちるよう、あなたは確認したいと考えています。しかし、ここに問題があります。100 万人の人々にあなたの広告を見てもらい、フレームごとに視線を追跡させることはできません。それはあまりにも高価で、あまりにも時間がかかりすぎるからです。

この論文は、その問題を解決するために設計されたスマートなコンピュータプログラム「ViASNet」を紹介しています。ViASNet を、動画広告を見て、人間の視線が秒単位でどこに向かうかを瞬時に予測する「スーパー・オブザーバー」と考えてください。

その仕組みを、簡単な概念に分解して説明します。

1. 問題:広告の「雑多さ」

TikTok、YouTube、テレビでは、短い動画広告が溢れ返っています。数が多すぎるがゆえに、単一の広告があなたの注意を引くのは困難です。広告主は、どの広告が機能し、どの広告が退屈なのかを素早くテストする方法を必要としています。通常、彼らは人を雇い、眼球追跡カメラにつなぎ、画面をじっと見つめる様子を観察しなければなりません。ViASNet はこれを自動的に実行することを目指しています。

2. 解決策:「三感覚」の探偵

視線の動きを予測する従来のコンピュータモデルの多くは、画像(視覚)だけを見ていました。それらは、犯罪現場を見るだけで、音や物語を無視する探偵のようでした。

ViASNet は異なります。それは同時に三つの要素を見る「三感覚」の探偵です。

  • 視覚: 画面で何が起きているか?(顔はあるか?何か動いているか?)
  • 音声: 何と言われているか、または聞こえているか?(大きな音や声が、あなたを上を見させるか?)
  • 物語(意味): その場面は「何について」か?(悲しい瞬間か?面白い冗談か?車の追跡劇か?)

「物語」を理解するために、このシステムは巨大な AI 脳(Qwen3-VL と呼ばれる)を使用して、動画を読み、人間がそうするように、場面を説明する短いキャプションを作成します。

3. マップの構築方法:「セリエンスマップ」

ViASNet の目的は、「セリエンスマップ」を作成することです。動画のフレームの写真を取り、ヒートマップで塗りつぶしたと想像してください。

  • 赤/熱い領域: 人々が視線を向ける場所。
  • 青/冷たい領域: 人々が無視する場所。

ViASNet は動画のすべてのフレームに対してこのマップを構築し、時間の経過とともに注意がどのように移り変わるかを示す、動くヒートマップを作成します。

4. 秘密の武器:学習の仕組み

研究者たちは、それぞれ約 20 人の人々が視聴し、ハイテクカメラで眼球を追跡された「151 本の実際の TV コマーシャル」のデータを用いて ViASNet を訓練しました。

このモデルは、自身の予測をそれら 20 人の実際の眼球運動と比較することで学習しました。それは「3D U-Net」と呼ばれる特別なアーキテクチャを使用します。

  • アナロジー: U-Net を漏斗のように考えてください。それは動画を取り込み、主要なアイデア(「ボトルネック」)を理解するためにそれを絞り込み、その後、詳細なヒートマップを描くために再び広げます。
  • 「中心バイアス」: 人間は自然と画面の中心を見る傾向があります。ViASNet はこのトリックを知っており、実際の人間がそうするように、予測に少しの「中心バイアス」を加えます。

5. 「エントロピー」テスト:退屈さを測定する

著者が作成した最もクールなツールの一つは、「エントロピー」(「無秩序」または「混乱」を意味する難しい言葉)を測定する方法です。

  • 低エントロピー(秩序立っている): ヒートマップが全員が一点(例えば中央の顔など)を見ていることを示す場合、エントロピーは低くなります。これは、その広告が「魅力的」であることを意味します。
  • 高エントロピー(混沌としている): ヒートマップが至る所に散らばっている場合、または人々が特に何も見ていない場合、エントロピーは高くなります。これは、その広告が「混乱しているか、退屈である」ことを意味します。

著者はこれを用いて、これまで見たことのない 15 の新しい広告をテストしました。彼らは、どの場面が視聴者の集中力を失わせているかを瞬時に特定できました。例えば、ある場面にはあまりにも多くの物体やテキストが散らばっており、視聴者の視線が彷徨い、「エンゲージメントスコア」が低下することが判明しました。

6. 結果:他を凌駕する性能

研究者たちは、ViASNet を他の有名なコンピュータモデル(画像のみを見るもの、映画を見るものなど)と比較してテストしました。

  • 結論: ViASNet が勝利しました。テストされたどのモデルよりも、人々が視線を向ける場所を正確に予測しました。
  • 理由: それはピクセルを見るだけでなく、音、物語、そして場面間の切り替えを理解していたからです。それは、場面が変わる(「カット」が入る)と、人々の視線が自然と中心に飛び、再定位することを認識し、それを考慮に入れていました。

まとめ

要約すると、ViASNet は、1 人の人間も実験室に座らせることなく、広告主が視聴者の目を通して「見る」ことを可能にする自動化ツールです。それは、あなたが何を見ているか、何を聞いているか、そして物語が何を意味するかを組み合わせ、あなたの注意がどこに向かうかを正確に予測します。広告が退屈か混乱している場合、このシステムはそれがいつの瞬間に起こるかを正確に教えてくれるため、クリエイターは大きなマーケティングキャンペーンにお金を費やす前にそれを修正することができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →