MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads
Das Papier schlägt HEAL vor, ein neuartiges Framework, das Halluzinationen in multimodalen großen Sprachmodellen identifiziert und mildert, indem es Informationsverteilungsdrifts in Synergy-Heads analysiert und eine dynamische Kalibrierung anwendet, um die Ausgaben in Richtung faktischer Evidenz zu steuern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Multimodale große Sprachmodelle sind eine leistungsstarke neue Klasse künstlicher Intelligenz, die darauf ausgelegt ist, gleichzeitig zu sehen und zu sprechen. Im Gegensatz zu herkömmlichen Systemen, die Text oder Bilder isoliert verarbeiten, können diese Modelle ein Foto betrachten und es beschreiben, Fragen dazu beantworten oder eine Geschichte basierend auf dem, was sie sehen, erzählen. Sie funktionieren, indem sie zwei unterschiedliche Informationsströme miteinander verweben: die visuellen Daten des Bildes und die sprachlichen Muster, die aus riesigen Mengen an Text gelernt wurden. Damit diese Systeme in hochsensiblen Bereichen wie der medizinischen Bildgebung oder dem autonomen Fahren wirklich nützlich sein können, müssen sie zuverlässig sein. Sie leiden jedoch häufig unter einem Problem, das als Halluzination bekannt ist. Dies geschieht, wenn das Modell eine Antwort generiert, die zwar selbstbewusst und plausibel klingt, aber in Bezug auf die visuelle Welt faktisch falsch ist, wie etwa die Behauptung, dass ein Bild einer Katze einen Hund enthält, oder das Erfinden von Details, die im Bild schlichtweg nicht vorhanden sind.
Lange Zeit glaubten Forscher, dass diese Fehler auftraten, weil das Modell seiner internen Sprachkenntnis zu viel Aufmerksamkeit schenkte und dem eigentlichen Bild zu wenig. Die vorherrschende Vorstellung war, dass das Modell, während es seine Antwort schrieb, sich vom Bild entfernte und sich zu stark auf das verließ, was es basierend auf Worten allein erwartete zu sehen. Um dies zu beheben, konzentrierten sich frühere Versuche darauf, das Modell zu zwingen, stärker auf das Bild zu achten, oder das gesamte System von Grund auf neu zu trainieren. Diese Methoden behandelten das Modell oft als eine Black Box und passten sein Verhalten von außen an, ohne die internen Mechanismen zu verstehen, die der Fehler ursprünglich verursachte.
Ein Team von Forschern der Shenzhen University of Advanced Technology hat nun in den „Motor“ dieser Modelle hineingeschaut, um eine andere Erklärung zu finden. Sie schlagen vor, dass Halluzinationen nicht durch einen einfachen Mangel an Aufmerksamkeit für das Bild verursacht werden, noch dadurch, dass das Modell das Bild ignoriert. Stattdessen fanden sie heraus, dass der Fehler entsteht, wenn das interne Gleichgewicht zwischen visuellen und sprachlichen Informationen innerhalb spezifischer Teile des Verarbeitungsnetzwerks des Modells instabil wird. Die Forscher entwickelten eine Methode namens HEAL, was für „Head-lEvel information disentAnglement and caLibration“ steht, um dieses Ungleichgewicht in Echtzeit zu identifizieren und zu korrigieren.
Der Kern ihrer Entdeckung liegt darin, wie das Modell Informationen verarbeitet. In diesen großen Modellen gibt es viele kleine Verarbeitungseinheiten, die sogenannte Attention Heads (Aufmerksamkeitsköpfe) genannt werden. Man kann sich diese Köpfe wie ein Team von Spezialisten vorstellen, die zusammenarbeiten, um einen Satz zu verstehen. Einige Spezialisten konzentrieren sich rein auf die Wörter, andere rein auf das Bild, und eine dritte Gruppe arbeitet daran, beide miteinander zu verschmelzen. Die Forscher fanden heraus, dass die Gruppe, die für das Verschmelzen der beiden Ströme verantwortlich ist – die sie „Synergie-Köpfe“ nennen –, der Ort ist, an dem die Probleme beginnen. Wenn das Modell korrekt arbeitet, halten diese Synergie-Köpfe ein gesundes Gleichgewicht und bewahren eine stabile Balance zwischen visuellen und sprachlichen Informationen. Wenn das Modell jedoch beginnt zu halluzinieren, verschiebt sich dieses Gleichgewicht. Die Informationsverteilung innerhalb dieser Verschmelzungsköpfe driftet von diesem gesunden Gleichgewicht weg, was dazu führt, dass das Modell seinen Bezug zur visuellen Evidenz verliert.
Entscheidend ist, dass die Forscher die Idee widerlegten, dass Halluzinationen entstehen, weil es einfach zu wenige Spezialisten gibt, die auf das Bild schauen, oder weil die Bild-Spezialisten zu schwach sind. Ihre Analyse zeigte, dass die Anzahl der visuell fokussierten Köpfe konstant bleibt, egal ob das Modell die Wahrheit sagt oder lügt. Das Problem ist nicht ein Mangel an visueller Aufmerksamkeit, sondern ein Drift in der Art und Weise, wie die Verschmelzungs-Spezialisten die Mischung der Informationen handhaben. Wenn das Modell eine korrekte Beschreibung generiert, halten die Synergie-Köpfe die visuellen und sprachlichen Eingaben in einem stabilen Verhältnis. Wenn es halluziniert, verschiebt sich dieses Verhältnis, wobei es oft zu stark zu den Sprachmustern neigt, während die visuelle Verbindung schwächer wird, obwohl das Bild immer noch präsent ist.
Um dies zu lösen, entwickelte das Team eine dynamische Kalibrierungsstrategie, die wie ein Echtzeit-Regulator wirkt. Anstatt das Modell neu zu trainieren oder seine Architektur zu ändern, greift HEAL während des Generierungsprozesses ein. Es überwacht den Informationsfluss durch die Synergie-Köpfe und erkennt, wenn das Gleichgewicht zu driften beginnt. Wenn ein Drift erkannt wird, injiziert das System einen Kalibrierungsfaktor, der die visuellen und sprachlichen Informationen sanft zurück in das korrekte Gleichgewicht drängt. Dieser Prozess ist kontinuierlich und adaptiv; er zwingt das Modell nicht, die Sprache zu ignorieren oder sich übermäßig auf das Bild zu konzentrieren, sondern steuert die interne Repräsentation zurück zu einem Zustand, in dem die visuelle Evidenz gegenüber dem linguistischen Kontext angemessen gewichtet wird.
Die Forscher testeten diesen Ansatz an mehreren hochmodernen Modellen, einschließlich Versionen von LLaVA und Qwen. Die Ergebnisse waren über verschiedene Systeme und Aufgaben hinweg konsistent. Durch die Anwendung dieser dynamischen Kalibrierung produzierten die Modelle signifikant weniger Halluzinationen, während sie ihre Fähigkeit beibehielten, flüssig und kreativ zu sprechen. In Tests, die darauf ausgelegt waren zu messen, wie oft Modelle Objekte erfinden, die nicht im Bild enthalten sind, reduzierte die neue Methode Fehler effektiver als bisherige Techniken, die lediglich versuchten, die visuelle Aufmerksamkeit zu steigen. Die Studie legt nahe, dass der Schlüssel zur Vertrauenswürdigkeit in diesen Systemen nicht nur darin besteht, sie stärker auf das Bild schauen zu lassen, sondern sicherzustellen, dass die interne Mischung aus Sehen und Sprechen stabil bleibt.
Diese Arbeit bietet eine neue Perspektive darauf, wie künstliche Intelligenz die Welt versteht. Sie zeigt, dass Zuverlässigkeit nicht nur aus genügend Daten oder leistungsstarker Hardware besteht, sondern aus der Aufrechterhaltung eines delikaten internen Gleichgewichts zwischen verschiedenen Arten von Informationen. Indem sie den spezifischen Punkt identifizierten, an dem dieses Gleichgewicht bricht, und einen einfachen Weg bereitstellten, es wiederherzustellen, haben die Forscher einen Weg zu vertrauenswürdigeren multimodalen Systemen eröffnet. Die Methode ist leichtgewichtig und erfordert nicht die massiven Rechenressourcen, die für ein Retraining nötig wären, was sie zu einem praktischen Werkzeug zur Verbesserung der Genauigkeit von KI macht, die sieht und spricht. Die Ergebnisse legen nahe, dass zukünftige Verbesserungen der Zuverlässigkeit von KI eher aus der Feinabstimmung dieser internen Beziehungen resultieren könnten als aus dem Aufbau größerer, komplexerer Modelle von Grund auf.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.