← Neueste Arbeiten
🤖 AI

Deep Multimodal Learning with Missing Modality: A Survey

Diese Umfrage bietet die erste umfassende Übersicht über Deep-Learning-Methoden für Multimodales Lernen mit fehlender Modalität (MLMM) und erläutert detailliert deren Motivationen, Abgrenzungen zu Standard-Setups, aktuelle Techniken, Anwendungen, Datensätze sowie zukünftige Herausforderungen.

Ursprüngliche Autoren: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

Veröffentlicht 2026-02-05
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Das „Fünf-Sinne“-Problem

Stellen Sie sich vor, Sie versuchen, einen Film zu verstehen. Normalerweise haben Sie zwei Haupteingaben: Sehen (das Video) und Hören (den Dialog und die Musik). Das ist wie ein „multimodales“ System – es nutzt mehrere Sinne, um die ganze Geschichte zu erfassen.

In der realen Welt gehen jedoch Dinge schief. Vielleicht sind Ihre Lautsprecher kaputt (kein Ton) oder der Bildschirm wird schwarz (kein Video). Vielleicht befinden Sie sich in einem nebligen Wald, in dem Sie nichts sehen können, aber ein Rascheln hören. Dies ist das Problem der fehlenden Modalität (Missing Modality).

Die meisten KI-Modelle sind wie Schüler, die nur dann lernen können, wenn sie sowohl ihr Lehrbuch als auch ihre Audio-Notizen haben. Wenn man ihnen eines wegnimmt, geraten sie in Panik und scheitern. Diese Survey-Arbeit ist ein massiver Leitfaden für Forscher, wie man KI lehrt, ruhig zu bleiben und auch dann gut zu funktionieren, wenn sie einen ihrer „Sinne“ verliert.

Worum geht es in dieser Arbeit?

Diese Arbeit ist ein Survey (eine Übersichtsarbeit). Betrachten Sie sie als einen Bibliothekar, der jedes einzelne Buch (354 Arbeiten!) gelesen hat, die zwischen 2012 und 2025 zu diesem speziellen Thema geschrieben wurden. Die Autoren, Renjie Wu und sein Team, haben all diese verschiedenen Lösungen in einer klaren Karte organisiert, damit Forscher wissen, was funktioniert, was nicht und wohin der Weg führt.

Sie nennen dieses Feld MLMM (Multimodal Learning with Missing Modality).

Die zwei Hauptstrategien: „Daten reparieren“ vs. „Das Gehirn optimieren“

Die Autoren unterteilen alle Lösungen in zwei große Lager, vergleichbar mit der Frage, ob man ein kaputtes Auto entweder durch Reparieren der Teile oder durch Ändern der Fahrweise des Fahrers repariert.

1. Datenverarbeitung: „Die Teile reparieren“

Dieser Ansatz versucht, die fehlenden Informationen aufzufüllen, noch bevor die KI überhaupt anfängt nachzudenken.

  • Die „Leere-Seite“-Methode (Modality Composition): Stellen Sie sich vor, Sie lesen ein Buch, aber eine Seite wurde herausgerissen. Sie könnten einfach eine leere weiße Fläche lassen (Nullen) oder zufälligen Unsinn darauf kritzeln (Zufallswerte). Die KI lernt, den leeren Raum zu ignorieren und sich auf den Rest zu konzentrieren. Das ist einfach, aber nicht besonders intelligent.
  • Die „Copy-Paste“-Methode (Retrieval): Wenn eine Seite fehlt, suchen Sie in anderen Exemplaren desselben Buches in der Bibliothek nach der passenden Seite und fügen sie ein. Das funktioniert gut, wenn die Bücher identisch sind, aber wenn die Geschichten leicht unterschiedlich sind, fügen Sie vielleicht die falsche Szene ein.
  • Die „Vorstellungs“-Methode (Modality Generation): Dies ist der fortschrittlichste Ansatz. Die KI agiert wie ein kreativer Autor. Wenn der Ton fehlt, schaut sich die KI das Video an und stellt sich vor, wie der Klang sein sollte, und erstellt ihn dann. Es ist wie ein Magier, der ein Kaninchen aus einem Hut zieht. Die Arbeit stellt fest, dass dies zwar cool ist, die KI aber manchmal „halluzinieren“ kann (Dinge erfindet, die nicht wahr sind).

2. Strategiedesign: „Das Gehirn optimieren“

Anstatt zu versuchen, die fehlenden Daten zu reparieren, ändert dieser Ansatz die Architektur der KI, sodass sie mit fehlenden Daten natürlich umgehen kann.

  • Die „Spotlight“-Methode (Attention): Stellen Sie sich einen Lehrer in einem Klassenzimmer vor. Wenn ein Schüler fehlt, stoppt der Lehrer nicht den Unterricht; er richtet sein Scheinwerferlicht einfach auf die Schüler, die da sind. „Attention“-Mechanismen ermöglichen es der KI, sich dynamisch nur auf die verfügbaren Daten zu konzentrieren und die fehlenden Teile zu ignorieren.
  • Die „Nachhilfe“-Methode (Distillation): Stellen Sie sich einen klugen Schüler (den Lehrer) vor, der alle Bücher hat. Ein weniger kluger Schüler (der Schüler) hat nur die Hälfte der Bücher. Der Lehrer erklärt dem Schüler die fehlenden Kapitel. Der Schüler lernt, die ganze Geschichte zu verstehen, selbst ohne das physische Buch.
  • Die „Teamwork“-Methode (Modell-Kombinationen): Anstatt einer riesigen KI haben Sie ein Team von Spezialisten. Wenn das Video fehlt, fragen Sie den „Audio-Experten“. Wenn der Ton fehlt, fragen Sie den „Video-Experten“. Sie stimmen gemeinsam über die Antwort ab.
  • Das „Super-Gehirn“ (Large Language Models): In jüngster Zeit sind riesige KI-Modelle (wie die, die Chatbots antreiben) so intelligent geworden, dass sie Text, Bilder und Ton gleichzeitig verstehen können. Sie sind so flexibel, dass sie sich einfach anpassen und weitermachen, wenn man ihnen einen Input wegnimmt – fast wie ein Mensch, der immer noch eine Geschichte erzählen kann, selbst wenn er das Bild nicht sieht.

Wo wird das eingesetzt? (Praxisbeispiele)

Die Arbeit listet viele Bereiche auf, in denen dies entscheidend ist:

  • Medizinische Scans: Ein Arzt hat vielleicht eine MRT-Aufnahme, aber keinen CT-Scan für einen Patienten. Die KI muss die Krankheit allein anhand des MRTs diagnostizieren, ohne wild zu raten.
  • Autonomes Fahren: Die Kamera eines Autos könnte durch Schnee geblendet werden oder das Radar könnte ausfallen. Die KI des Autos muss weiterhin sicher fahren, indem sie nur die Sensoren nutzt, die noch funktionieren.
  • Emotionserkennung: Ein Videotelefonat hat vielleicht schlechten Ton, aber ein klares Video. Die KI sollte trotzdem in der Lage sein, anhand Ihres Gesichts zu erkennen, ob Sie glücklich oder traurig sind.
  • Robotik: Ein Roboter, der eine Höhle erkundet, könnte sein GPS-Signal verlieren. Er muss navigieren, indem er nur seine Kameras und Berührungssensoren nutzt.

Die Probleme, die wir noch nicht gelöst haben

Obwohl wir diese coolen Tricks haben, weist die Arbeit auf einige große Schwierigkeiten hin:

  1. Die „Fake-Daten“-Falle: Wenn eine KI die fehlenden Daten „erfindet“, erfindet sie manchmal Details, die falsch sind. Wenn ein selbstfahrendes Auto einen Weg imaginiert, wo eigentlich eine Klippe ist, ist das gefährlich.
  2. Die „faule“ KI: Manchmal, selbst wenn die KI versucht, das fehlende Stück zu ergänzen, ignoriert sie die neuen Informationen einfach und verlässt sich nur auf den einen Sensor, den sie tatsächlich hat, was vielleicht nicht ausreicht.
  3. Die „unordentliche Bibliothek“: Es gibt keinen einheitlichen Standardtest. Ein Forscher testet seine KI vielleicht mit 10 % fehlenden Daten, während ein anderer mit 90 % testet. Es ist schwer zu vergleichen, wer tatsächlich der Beste ist.
  4. Zu schwerfällig: Viele dieser Lösungen benötigen enorme Rechenleistung (wie einen Supercomputer). Aber reale Geräte (wie eine Smartwatch oder eine Drohne) sind klein und haben schwache Batterien. Wir brauchen „leichtgewichtige“ Lösungen, die auf kleinen Chips funktionieren.

Das Fazit

Diese Arbeit ist ein Fahrplan. Sie sagt uns, dass wir zwar große Fortschritte gemacht haben, KI zu lehren, mit defekten Sensoren und fehlenden Daten umzugehen, wir aber immer noch bessere Wege brauchen, dies zu tun, ohne Dinge zu erfinden, ohne Supercomputer zu benötigen und ohne in unordentlichen realen Situationen die Orientierung zu verlieren. Das Ziel ist es, eine KI zu bauen, die so robust ist wie ein Mensch: fähig, die Welt zu verstehen, selbst wenn die Sicht verschwommen oder das Mikrofon kaputt ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →