ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement
Dieser Beitrag stellt ViASNet vor, ein Deep-Learning-Modell auf Basis einer 3D-U-Net-Architektur, das auditive und semantische Hinweise integriert, um dynamische Saliency-Karten für Kurzvideo-Werbungen vorherzusagen, und belegt seine Fähigkeit, das Werbedesign zu optimieren und unattraktive Inhalte durch Eye-Tracking-Validierung und entropiebasierte Diagnostik zu identifizieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Regisseur, der einen 30-sekündigen Werbespot dreht. Sie möchten sicherstellen, dass die Augen der Zuschauer genau dort landen, wo Sie es wollen: auf dem Produkt, dem lächelnden Schauspieler oder dem eingängigen Logo. Doch hier liegt das Problem: Sie können nicht eine Million Menschen bitten, Ihren Spot anzusehen und für jeden einzelnen Frame ihre Augenbewegungen zu verfolgen. Das wäre zu teuer und zu langsam.
Diese Arbeit stellt ViASNet vor, ein intelligentes Computerprogramm, das entwickelt wurde, um genau dieses Problem zu lösen. Betrachten Sie ViASNet als einen „Superbeobachter", der einen Video-Werbespot ansehen und sofort vorhersagen kann, wohin die Augen eines Menschen Sekunde für Sekunde schauen werden.
So funktioniert es, aufgeschlüsselt in einfache Konzepte:
1. Das Problem: Das „Chaos" der Werbung
Wir ertrinken in kurzen Video-Werbespots auf TikTok, YouTube und im Fernsehen. Da es so viele gibt, ist es für jeden einzelnen Spot schwierig, Ihre Aufmerksamkeit zu erregen. Werbetreibende benötigen eine Möglichkeit, ihre Spots schnell zu testen, um zu sehen, welche funktionieren und welche langweilig sind. Normalerweise müssen sie Personen einstellen, diese an Eye-Tracking-Kameras anschließen und beobachten, wie sie auf Bildschirme starren. ViASNet zielt darauf ab, dies automatisch zu erledigen.
2. Die Lösung: Ein „Drei-Sinne"-Detektiv
Die meisten alten Computermodelle zur Vorhersage von Augenbewegungen betrachteten nur das Bild (die visuellen Reize). Sie waren wie ein Detektiv, der nur einen Tatort betrachtet, aber den Ton oder die Geschichte ignoriert.
ViASNet ist anders. Es ist ein „Drei-Sinne"-Detektiv, der drei Dinge gleichzeitig betrachtet:
- Die Visuellen Reize: Was passiert auf dem Bildschirm? (Ist ein Gesicht zu sehen? Bewegt sich etwas?)
- Der Audio: Was wird gesagt oder gehört? (Lässt ein lautes Geräusch oder eine Stimme Sie aufblicken?)
- Die Geschichte (Semantik): Worum geht es in der Szene? (Ist es ein trauriger Moment? Ein lustiger Witz? Eine Verfolgungsjagd?)
Um die „Geschichte" zu verstehen, nutzt das System ein riesiges KI-Gehirn (genannt Qwen3-VL), um das Video zu lesen und eine kurze Bildunterschrift zu verfassen, die die Szene beschreibt, genau wie ein Mensch es tun würde.
3. Wie es die Karte erstellt: Die „Saliency Map"
Das Ziel von ViASNet ist die Erstellung einer Saliency Map (Aufmerksamkeitskarte). Stellen Sie sich vor, Sie nehmen ein Foto eines Videoframes und bemalen es mit einer Wärmebildkarte:
- Rote/Heiße Bereiche: Wo die Menschen hinschauen werden.
- Blaue/Kalte Bereiche: Wo die Menschen ignorieren werden.
ViASNet erstellt diese Karte für jeden einzelnen Frame des Videos und erzeugt so eine bewegte Wärmebildkarte, die genau zeigt, wie sich die Aufmerksamkeit im Laufe der Zeit verschiebt.
4. Das Geheimnis: Wie es lernt
Die Forscher haben ViASNet mit Daten aus 151 echten TV-Werbespots trainiert, die jeweils von etwa 20 Personen angesehen wurden, während ihre Augen von High-Tech-Kameras verfolgt wurden.
Das Modell lernte, indem es seine eigenen Vorhersagen mit den tatsächlichen Augenbewegungen dieser 20 Personen verglich. Es verwendet eine spezielle Architektur namens 3D U-Net.
- Die Analogie: Betrachten Sie das U-Net wie einen Trichter. Es nimmt das Video, presst es zusammen, um die Hauptgedanken zu verstehen (den „Engpass"), und erweitert es dann wieder, um die detaillierte Wärmebildkarte zu zeichnen.
- Die „Zentralneigung" (Center Bias): Menschen neigen natürlich dazu, in die Mitte des Bildschirms zu schauen. ViASNet kennt diesen Trick und fügt seinen Vorhersagen eine leichte „Zentralneigung" hinzu, genau wie ein echter Mensch.
5. Der „Entropie"-Test: Messung von Langeweile
Eines der coolsten Werkzeuge, die die Autoren entwickelt haben, ist eine Methode zur Messung der Entropie (ein ausgefallenes Wort für „Unordnung" oder „Verwirrung").
- Niedrige Entropie (Ordnung): Wenn die Wärmebildkarte zeigt, dass alle auf einen Punkt schauen (wie ein Gesicht in der Mitte), ist die Entropie niedrig. Das bedeutet, der Spot ist ansprechend.
- Hohe Entropie (Chaos): Wenn die Wärmebildkarte überall verstreut ist oder wenn die Menschen auf nichts Bestimmtes schauen, ist die Entropie hoch. Das bedeutet, der Spot ist verwirrend oder langweilig.
Die Autoren nutzten dies, um 15 neue Spots zu testen, die sie noch nie gesehen hatten. Sie konnten sofort erkennen, welche Szenen dazu führten, dass die Zuschauer den Fokus verloren. Zum Beispiel stellten sie fest, dass, wenn eine Szene zu viele Objekte oder Text hatte, der überall verstreut war, die Augen der Zuschauer wanderten und der „Engagement-Score" sank.
6. Die Ergebnisse: Es funktioniert besser als der Rest
Die Forscher testeten ViASNet gegen andere bekannte Computermodelle (einige, die nur Bilder betrachten, einige, die Filme betrachten).
- Das Urteil: ViASNet gewann. Es sagte voraus, wohin die Menschen schauen würden, genauer als jedes andere getestete Modell.
- Warum? Weil es nicht nur die Pixel betrachtete; es verstand den Ton, die Geschichte und die Schnitte zwischen den Szenen. Es erkannte, dass sich die Augen der Menschen bei einem Szenenwechsel (einem „Cut") natürlich zur Mitte bewegen, um sich neu zu orientieren, und berücksichtigte dies.
Zusammenfassung
Kurz gesagt ist ViASNet ein automatisiertes Werkzeug, das Werbetreibenden erlaubt, durch die Augen ihres Publikums zu „sehen", ohne dass auch nur ein Mensch in einem Labor sitzen muss. Es kombiniert das, was Sie sehen, das, was Sie hören, und die Bedeutung der Geschichte, um genau vorherzusagen, wohin Ihre Aufmerksamkeit gehen wird. Wenn ein Spot langweilig oder verwirrend ist, kann dieses System Ihnen genau sagen, in welcher Sekunde dies geschieht, sodass Creator es beheben können, bevor sie Geld für eine große Marketingkampagne ausgeben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.