← Neueste Arbeiten
🤖 AI

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

Diese Übersichtsarbeit analysiert systematisch Halluzinationen in Video-LLMs, indem sie eine Taxonomie aus dynamischen Verzerrungen und Inhaltsfälschungen einführt, Ursachen und Lösungsansätze untersucht und zukünftige Forschungsrichtungen für robustere Video-Sprachsysteme aufzeigt.

Ursprüngliche Autoren: Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

Veröffentlicht 2026-04-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Titel: Wenn VideokIler lügen: Eine Reise durch die Welt der „Halluzinationen"

Stell dir vor, du hast einen sehr schlauen, aber manchmal etwas verwirrten Freund, der dir eine Geschichte über ein Video erzählt, das ihr gerade zusammen angesehen habt. Er kennt sich super mit Sprache aus und erzählt flüssig und überzeugend. Aber manchmal erfindet er Dinge, die gar nicht passiert sind, oder verwechselt die Reihenfolge der Ereignisse.

Genau das passiert bei Video-KI-Modellen (den sogenannten Vid-LLMs). Diese KI-Systeme sind genial darin, Videos zu verstehen und darüber zu sprechen. Aber sie leiden unter einem Problem, das Forscher „Halluzinationen" nennen. Das klingt nach einem Traum, ist aber im Grunde ein Fehler: Die KI sagt Dinge, die klingen, als wären sie wahr, aber sie widersprechen dem, was man im Video wirklich sieht.

Dieser wissenschaftliche Bericht ist wie ein Führer für Detektive, der uns hilft zu verstehen, warum diese KI-„Lügen" passieren und wie wir sie stoppen können.

Hier ist die einfache Erklärung der wichtigsten Punkte:

1. Die zwei Hauptarten der „Lügen"

Die Forscher haben die Fehler in zwei große Kategorien eingeteilt. Stell dir das wie zwei verschiedene Arten vor, wie dein verwirrter Freund die Geschichte verdrehen könnte:

A. Die „Verzerrte Zeitmaschine" (Dynamic Distortion)

Hier sieht die KI die Personen und Objekte im Video richtig, aber sie verliert den Faden bei der Zeit oder der Identität.

  • Der Zeit-Verlust: Stell dir vor, jemand kocht erst einen Kaffee und putzt dann die Küche. Die KI sagt aber: „Zuerst hat er die Küche geputzt und dann Kaffee gekocht." Oder sie sagt: „Er hat 10 Minuten gekocht", obwohl es nur 30 Sekunden waren. Die KI verwechselt die Reihenfolge oder die Dauer.
  • Der Identitäts-Tausch: Stell dir vor, im Video sind zwei verschiedene Männer. Der eine trägt ein rotes Hemd, der andere ein blaues. Die KI sagt plötzlich: „Der Mann im roten Hemd hat das blaue Hemd angezogen." Dabei waren es zwei verschiedene Personen. Die KI vermischt die Charaktere oder die Szenen.

B. Die „Einbildungskiste" (Content Fabrication)

Hier ist die KI noch weiter weg von der Realität. Sie erfindet Dinge, die gar nicht im Video zu sehen sind.

  • Der „Klischee-Trick" (Kontext-getrieben): Die KI denkt: „Oh, ich sehe eine Küche, also muss jemand kochen!" Aber im Video steht die Person nur da und starrt in die Leere. Die KI nutzt ihr allgemeines Wissen („In Küchen wird gekocht"), um eine Geschichte zu erfinden, die nicht stimmt.
  • Der „Lautsprecher-Effekt" (Audio-Visueller Konflikt): Das Video zeigt einen ruhigen Mann, aber im Hintergrund ist laute Musik zu hören. Die KI sagt: „Der Mann tanzt!" Weil die Musik so laut ist, ignoriert die KI das Bild und glaubt nur dem Ton. Das ist, als würdest du jemanden beschuldigen, zu tanzen, nur weil im Radio ein Tanzsong läuft.

2. Warum passiert das? (Die Ursachen)

Warum ist die KI so verwirrt? Die Forscher geben zwei Hauptgründe an:

  1. Schwache Zeit-Wahrnehmung: Die KI wurde oft mit Bildern trainiert, nicht mit Videos. Ein Bild ist statisch. Ein Video ist Bewegung. Die KI ist wie jemand, der nur Fotos sieht und versucht, einen Film zu verstehen. Sie verliert oft den Rhythmus der Bewegung oder vergisst, was vor 10 Sekunden passiert ist, wenn das Video zu lang ist.
  2. Zu viel Vorwissen: Die KI ist so schlau, dass sie manchmal zu sehr auf ihr eigenes Wissen vertraut. Sie denkt: „Das muss so sein, weil es immer so ist," statt genau hinzusehen. Wenn die Musik laut ist, hört sie nicht mehr hin, was das Bild sagt.

3. Wie testen wir das? (Die Prüfungen)

Um zu sehen, wie gut (oder schlecht) die KI ist, haben die Forscher viele Test-Übungen (Benchmarks) entwickelt.

  • Manche Tests geben der KI ein Video und fragen: „Was passiert zuerst?"
  • Andere fragen: „Wie oft hat die Person geklatscht?"
  • Wieder andere zeigen ein Video ohne Bewegung, aber mit Musik, um zu sehen, ob die KI tanzt.

Das Ergebnis? Die KI ist in einfachen Aufgaben gut, aber bei langen Videos oder wenn es um genaue Zeitangaben geht, macht sie oft Fehler.

4. Wie können wir sie reparieren? (Die Heilmittel)

Es gibt verschiedene Methoden, um die KI zu „erziehen":

  • Bessere Augen: Man baut der KI spezielle Module ein, die sich nur auf Bewegung konzentrieren (wie optischer Fluss), damit sie nicht nur Bilder, sondern auch die Dynamik sieht.
  • Gedächtnis-Training: Man gibt der KI ein besseres „Gedächtnis", damit sie sich an den Anfang des Videos erinnert, wenn sie am Ende ist.
  • Gegenbeweis-Training: Man zeigt der KI absichtlich Videos, die nicht das tun, was sie erwartet (z. B. ein Hund, der nicht bellt), damit sie lernt, nicht nur auf Vorurteile zu hören, sondern wirklich hinzusehen.
  • Audio-Filter: Man trainiert die KI, zuerst das Bild zu prüfen, bevor sie auf den Ton hört, damit laute Musik sie nicht verwirrt.

Fazit

Dieser Bericht ist ein wichtiger Schritt, um KI-Systeme sicherer zu machen. Ob für selbstfahrende Autos oder medizinische Diagnosen: Wir brauchen KIs, die nicht halluzinieren, sondern die Realität genau so sehen, wie sie ist.

Kurz gesagt: Die KI ist wie ein sehr guter Geschichtenerzähler, der manchmal zu viel Fantasie hat. Dieser Bericht hilft uns, ihre Fantasie zu zähmen, damit sie uns die Wahrheit über das Video erzählt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →