← Neueste Arbeiten
💻 computer science

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

Dieses Paper schlägt Saliency-Driven Perceptual Realignment (SDPR) vor, ein trainingsfreies Framework, das Halluzinationen in Large Vision-Language Models durch die Umverteilung der Aufmerksamkeit von nicht-semantischen Token, die Ausrichtung von KV-Cache-Features zur Vermeung räumlicher Verzerrungen und die Anwendung von kontrastivem Decoding zur Bekämpfung von Sprach-Priors mildert und dadurch eine überlegene Leistung ohne zusätzliches Training oder signifikanten Laufzeit-Overhead erzielt.

Ursprüngliche Autoren: Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

Veröffentlicht 2026-08-20
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der sich rasant entwickelnden Welt der künstlichen Intelligenz ist eine neue Generation von Systemen entstanden, die gleichzeitig sehen und sprechen können. Diese großen Vision-Language-Modelle fungieren als digitale Beobachter, die in der Lage sind, ein Foto zu betrachten und zu beschreiben, was sich darin abspielt, oder Fragen über die Szene zu beantworten. Sie haben gelernt, die visuelle Welt mit der menschlichen Sprache zu verbinden und so eine Brücke zwischen Pixeln und Wörtern zu schlagen. Doch trotz ihrer beeindruckenden Fähigkeit, flüssige und oft sinnvolle Sätze zu generieren, leiden diese Systeme unter einem hartnäckigen und frustrierenden Fehler: Sie lügen häufig. Sie könnten selbstbewusst beschreiben, dass eine Person einen roten Ballon hält, obwohl das Bild einen blauen Drachen zeigt, oder Details erfinden, die schlichtweg nicht existieren. Diese Tendenz, falsche Informationen zu generieren, bekannt als Halluzination, rührt von einer tiefen Abhängigkeit davon her, was das Modell zuvor gelesen hat, anstatt dessen, was es gerade tatsächlich sieht. Wenn der visuelle Beweis unklar oder komplex ist, greift das System oft auf Vermutungen basierend auf seiner internen Bibliothek von Sprachmustern zurück und produziert Antworten, die zwar richtig klingen, aber faktisch falsch sind. Diese Unzuverlässigkeit verhindert, dass diese leistungsstarken Werkzeuge in realen Situationen, in denen Genauigkeit entscheidend ist, vertraut werden können.

Forscher der Xidian University und der Tsinghua University haben die Ursachen dieser visuellen Verwirrung identifiziert und eine Methode entwickelt, die diesen Modellen hilft, „klar zu sehen“, bevor sie antworten. Ihre Arbeit zeigt, dass das Problem nicht nur ein Mangel an Wissen ist, sondern ein Versagen darin, wie das Modell verarbeitet und sich an das erinnert, was es während des Bruchteils einer Sekunde des Nachdenkens sieht. Das Team entdeckte, dass die Aufmerksamkeit des Modells während der Analyse eines Bildes oft von unwichtigen Hintergrunddetails gekapert wird, was dazu führt, dass es die kritischsten Teile des Bildes ignoriert. Darüber hinaus, während das Modell beginnt, seine Antwort Wort für Wort zu generieren, degradiert die Erinnerung an die visuelle Szene, wird verzerrt und verliert den Bezug zur spezifischen Frage. Um dies zu beheben, führten die Forscher einen trainingsfreien Framework namens Saliency-Driven Perceptual Realignment ein. Dieser Ansatz erfordert kein erneutes Training des massiven KI-Modells von Grund auf; stattdessen fungiert er als Leitfaden während des Denkprozesses, der den Fokus und das Gedächtnis des Modells sanft korrigiert, um sicherzustellen, dass es in der visuellen Realität des Bildes verwurzelt bleibt.

Der erste Schritt in diesem Korrekturprozess befasst sich mit dem Moment, in dem das Modell das Bild zum ersten Mal betrachtet. Die Forscher fanden heraus, dass der interne Aufmerksamkeitsmechanismus des Modells oft an „Sink Tokens“ hängen bleibt, bei denen es sich im Wesentlichen um bedeutungslose Hintergrundelemente handelt, die versehentlich zu viel Fokus beanspruchen. Stellen Sie sich vor, eine Person versucht, einem Gespräch in einem lauten Raum zuzuhören; wenn ihre Aufmerksamkeit durch ein lautes, irrelevantes Geräusch gekapert wird, verpasst sie die wichtigen gesprochenen Worte. Ähnlich ließ das Modell diese Hintergrundablenkungen die markanten visuellen Hinweise, wie etwa das Gesicht einer Person oder ein spezifisches Objekt, übertönen. Die neue Methode erkennt, wann diese Kaperung stattfindet, und verteilt die Aufmerksamkeit des Modells neu, indem sie den Fokus weg vom Rauschen und zurück zu den bedeutsamen Teilen des Bildes lenkt. Durch dies stellt das Modell die unterdrückten visuellen Beweise wieder her, die es zuvor ignoriert hatte, wodurch es die Szene genauer sieht, noch bevor es überhaupt zu sprechen beginnt.

Sobald das Modell eine klarere Sicht hat, tritt die zweite Herausforderung auf, während es beginnt, seine Antwort zu generieren. Das Modell speichert eine Erinnerung an das Bild, um sich darauf zu beziehen, während es jedes neue Wort schreibt. Die Forscher beobachteten jedoch, dass diese Erinnerung im Laufe der Zeit verzerrt wird. Da das Modell das Bild und die Frage in einer bestimmten Reihenfolge verarbeitet, wird die Erinnerung an die visuellen Details an deren Position in der Sequenz gebunden, anstatt an deren tatsächliche Bedeutung für die Frage. Es ist, als ob das Modell vergisst, dass ein bestimmtes Objekt wichtig ist, weil es früh in der Sequenz gesehen wurde, während später auftretende, weniger wichtige Details in seinem Gedächtnis übermäßig prominent werden. Um dem entgegenzuwirken, richtet das neue Framework dieses interne Gedächtnis neu aus. Es injiziert ein Signal, das hervorhebt, welche Teile des Bildes tatsächlich relevant für die aktuelle Frage sind, und stellt so sicher, dass das Gedächtnis des Modells während des gesamten Generierungsprozesses auf die richtigen visuellen Beweise fokussiert bleibt, anstatt zu irrelevanten Details abzuwandern.

Selbst mit einer klaren Sicht und einem guten Gedächtnis versammelt sich das Modell noch immer vor der Versuchung, sich auf seine bereits bestehenden Sprachgewohnheiten zu verlassen. Manchmal weiß das Modell aufgrund des Bildes, dass die Antwort „Ja“ lautet, aber seine internen Sprachmuster legen stark ein „Nein“ nahe, weil dies eine häufige Phrase in seinen Trainingsdaten ist. Um dies zu verhindern, fügten die Forscher eine abschließende Prüfung hinzu, die die visuelle Vorhersage des Modells mit einem Referenzwert vergleicht, der aus seinen eigenen Sprachgewohnheiten aufgebaut wurde. Wenn diese beiden voneinander abweichen, unterdrückt das System aktiv die sprachbasierte Vermutung und zwingt das Modell, sich an die visuellen Beweise zu halten. Dieser kontrastive Prozess stellt sicher, dass die endgültige Antwort durch das gesteuert wird, was tatsächlich im Bild zu sehen ist, und nicht durch das, was das Modell zu sehen erwartet.

Die Ergebnisse der Anwendung dieser dreiteiligen Strategie sind signifikant. Bei Tests über verschiedene große Vision-Language-Modelle hinweg reduzierte die Methode die Anzahl der Halluzinationen konsistent und verbesserte die Genauigkeit der Antworten. In spezifischen Tests, die messen, wie oft Modelle Objekte korrekt identifizieren, zeigte der neue Ansatz Verbesserungen von bis zu fast sieben Punkten, und in Tests, die die Häufigkeit halluzinierter Details maßen, reduzierte er die Fehler um mehr als ein Drittel. Entscheidend ist, dass all dies ohne die Notwendigkeit eines teuren Retrainings oder zusätzlicher Daten erreicht wurde, indem lediglich angepasst wurde, wie das Modell während der Arbeit aufmerksam ist und Informationen erinnert. Durch die systematische Adressierung der Degradation des visuellen Bewusstseins – vom ersten Blick bis zum letzten Satz – bietet diese Forschung einen robusten Weg, um diese leistungsstarken KI-Systeme zuverlässiger zu machen und sicherzustellen, dass sie die Wahrheit über das sagen, was sie sehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →