← Neueste Arbeiten
💬 NLP

Do Vision-Language Models Understand Visual Persuasiveness? A Diagnosis via Visual Persuasive Factors

Dieses Paper diagnostiziert die Einschränkungen von Vision-Language-Modellen bei der Bewertung visueller Überzeugungskraft, indem es deren Tendenz zur Überprognose von Überzeugungskraft aufgrund eines auf Recall ausgerichteten Bias sowie ein Versagen bei der korrekten Abstimmung der Objektidentifikation mit dem semantischen Kontext aufzeigt, während es gleichzeitig demonstriert, dass die Leistung durch gezielte Interventionen mittels visueller überzeugender Faktoren (Visual Persuasive Factors, VPFs) verbessert werden kann.

Ursprüngliche Autoren: Gyuwon Park, Hyounghun Kim

Veröffentlicht 2026-09-11
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Gyuwon Park, Hyounghun Kim

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen Welt sind Bilder selten nur Dekoration. Von Warnhinweisen auf Zigarettenpackungen bis hin zu politischen Wahlplakaten sind visuelle Elemente darauf ausgelegt, die Art und Weise zu beeinflussen, wie wir denken, fühlen und handeln. Dieser Prozess, bekannt als visuelle Überzeugung (visual persuasion), beruht auf einem komplexen Zusammenspiel zwischen dem, was wir sehen, und der Botschaft, die wir lesen. Ein helles, fröhliches Foto kann eine Sicherheitsempfehlung ermutigend wirken lassen, während ein dunkles, überladenes Bild dieselbe Empfehlung bedrohlich erscheinen lassen kann. Seit Jahrzehnten untersuchen Psychologen, wie Menschen diese Reize verarbeiten, und verstehen, dass unser Gehirn Farben, die Platzierung von Objekten und das Vorhandensein von Menschen abwägt, um zu entscheiden, ob eine Botschaft überzeugend ist. Da KI-Systeme nun in der Lage sind, Bilder und Texte gleichzeitig zu erfassen, ist eine entscheidende Frage aufgetaucht: Verstehen diese Maschinen Überzeugung so wie Menschen, oder raten sie lediglich basierend auf oberflächlichen Mustern?

Ein Forschungsteam der POSTECH in Südkorea machte sich daran, dies zu beantworten, indem es moderne Vision-Language-Modelle einem strengen Test unterzog. Dies sind fortschrittliche Computersysteme, die in der Lage sind, ein Bild anzusehen und eine Textbotschaft zu lesen und dann zu versuchen zu verstehen, wie gut das Bild den Text unterstützt. Die Forscher begannen mit einer sorgfältig kuratierten Sammlung von 562 Bild-Text-Paaren. Dies waren keine zufälligen Funde aus dem Internet; sie wurden ausgewählt, weil menschliche Richter bereits beurteilt hatten, ob jedes Paar hochgradig überzeugend oder nicht überzeugend war. Dies schuf eine klare „Ground Truth“ (Grundwahrheit), an der die Computermodelle gemessen werden konnten. Das Ziel war es zu sehen, ob die Maschinen die menschliche Urteilskraft replizieren konnten oder ob ihnen etwas Grundlegendes darüber fehlte, wie visuelle Überzeugung funktioniert.

Die Ergebnisse zeigten einen markanten und konsistenten Fehler in der Arbeitsweise dieser KI-Systeme auf. Wenn sie gebeten wurden, die Überzeugungskraft zu beurteilen, zeigten die Modelle eine starke Tendenz, mit „Ja“ zu antworten. Sie waren unglaublich gut darin, die Bilder zu erfassen, die Menschen als überzeugend empfanden, aber sie waren auch viel zu eifrig darin, nicht überzeugende Bilder als überzeugend einzustufen. In technischen Begriffen gesehen, erreichten sie einen hohen „Recall“ (Trefferquote), litten aber unter einer Flut von falsch-positiven Ergebnissen. Im Wesentlichen überprädizierten die Maschinen die Überzeugungskraft und behandelten fast jedes Bild, das ein plausibles visuelles Element enthielt, als ein erfolgreiches Argument. Es schien ihnen an der menschlichen Fähigkeit zu fehlen, zu unterscheiden, ob ein visueller Reiz lediglich vorhanden war oder ob er tatsächlich die Arbeit der Überzeugung leistete.

Um zu verstehen, warum dies geschah, zerlegten die Forscher die visuelle Welt in spezifische, messbare Komponenten, die sie „Visual Persuasive Factors“ (visuelle Überzeugungsfaktoren) nannten. Diese Faktoren reichten von der unmittelbaren sensorischen Wirkung eines Bildes, wie etwa dessen Farbigkeit und Helligkeit, bis hin zur Komposition, etwa ob das Hauptmotiv in der Mitte oder am Schnittpunkt imaginärer Gitternetzlinien platziert war. Sie untersuchten auch semantische Elemente, wie etwa ob ein Schlüsselobjekt, eine menschliche Figur oder ein Stück Text sichtbar war. Als die Forscher verglichen, wie Menschen und Maschinen diese Faktoren gewichteten, trat eine klare Divergenz zutage. Menschen nutzten diese Reize mit Nuancen und verstanden, dass ein helles Bild zwar für eine positive Botschaft überzeugend sein könnte, aber nicht für eine negative. Die Maschinen hingegen behandelten das bloße Vorhandensein eines Reizes oft als Garantie für Erfolg. Wenn ein Bild beispielsweise ein menschliches Gesicht oder ein im Text erwähntes Objekt enthielt, neigten die Modelle dazu, es als überzeugend zu deklarieren, selbst wenn der Gesamtzusammenhang etwas anderes nahelegte. Sie verwechselten die Zutaten eines Rezepts mit dem fertigen Gericht.

Die Studie untersuchte daraufhin, ob man das Problem lösen könnte, indem man den Maschinen explizitere Anweisungen gab. Die Forscher probierten zwei Hauptansätze aus. Erstens speisten sie die Modelle mit detailliertem Wissen über die visuellen Faktoren, indem sie ihnen beispielsweise erklärten, dass das Vorhandensein einer Person als unterstützender Hinweis und nicht als entscheidender Faktor zu behandeln sei. Zweitens baten sie die Modelle, schrittweise zu denken und ihre Argumentation zu strukturieren, bevor sie ein endgültiges Urteil fällten. Die Ergebnisse hierbei waren nuanciert. Die Bereitstellung des richtigen Kontextes – insbesondere die Rahmung dieser visuellen Reize als etwas, das interpretiert werden muss, statt als feste Regel – half tatsächlich, die Anzahl der Fehler zu reduzieren. Das bloße Bitten der Modelle, das Problem schrittweise zu durchdenken, oder das Aufzeigen der Anwesenheit eines Objekts reichte jedoch nicht aus. In einigen Fällen führte das Erzwingen einer schrittweisen Argumentation anhand expliziter Reize sogar dazu, dass die Modelle ihre Voreingenommenheit verstärkten und in ihren falschen Urteilen beharrten.

Der Kern des Problems lag, wie die Forscher entdeckten, in einem spezifischen Engpass im Denkprozess der Maschine. Als das Team die schrittweisen Erklärungen analysierte, die die Modelle generierten, stellten sie fest, dass die Maschinen im Allgemeinen gut darin waren, Objekte zu identifizieren und den Text zu beschreiben. Sie konnten auch erklären, wie ein Objekt mit einer Botschaft zusammenhängen könnte. Der Fehler trat im letzten Schritt auf: der Verknüpfung dieser Beweise mit dem eigentlichen Ziel der Kommunikation. Die Modelle hatten Schwierigkeiten zu entscheiden, ob die gefundene visuelle Evidenz die beabsichtigte Botschaft tatsächlich unterstützte oder ob es sich nur um einen Zufall handelte. Sie konnten die Einzelteile sehen, aber sie konnten sie nicht zuverlässig zu einem kohärenten Urteil über die Intention synthetisieren.

Diese Forschung deutet darauf an, dass künstliche Intelligenz zwar enorme Fortschritte bei der Erkennung dessen gemacht hat, was in einem Bild zu sehen ist, ihr aber noch immer das tiefe, kontextuelle Verständnis dafür fehlt, warum dieses Bild von Bedeutung ist. Die Maschinen sind derzeit exzellent darin, die Zutaten der Überzeugung zu entdecken, aber schlecht darin, das fertige Produkt zu schmecken. Sie neigen dazu anzunehmen, dass die Botschaft überzeugend sein muss, wenn die richtigen visuellen Elemente vorhanden sind, wobei sie die subtile menschliche Fähigkeit ignorieren, Kontext, Tonfall und Absicht abzuwägen. Die Studie kommt zu dem Schluss, dass diese Systeme, um visuelle Überzeugung wirklich zu verstehen, über das bloße Identifizieren von Objekten hinausgehen und lernen müssen, diese Beobachtungen mit dem kommunikativen Zweck dahinter zu verknüpifen. Solange sie diesen Sprung nicht schaffen, werden sie dazu neigen, dort Überzeugung zu sehen, wo keine ist, und die Anwesenheit eines Reizes mit der Kraft einer Botschaft zu verwechseln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →