Deep Multimodal Learning with Missing Modality: A Survey
Deze survey biedt het eerste uitgebreide overzicht van deep learning-methoden voor Multimodal Learning met ontbrekende modaliteit (MLMM), waarbij de motivaties, verschillen met standaardopstellingen, huidige technieken, toepassingen, datasets en toekomstige uitdagingen worden toegelicht.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Het "Vijf Zintuigen" Probleem
Stel je voor dat je probeert een film te begrijpen. Meestal heb je twee belangrijke inputs: zicht (de video) en geluid (de dialoog en muziek). Dit is als een "multimodaal" systeem — het gebruikt meerdere zintuigen om het volledige verhaal te begrijpen.
Echter, in de echte wereld gaat er wel eens iets mis. Misschien zijn je speakers kapot (geen geluid), of gaat het scherm op zwart (geen video). Misschien ben je in een mistig bos waar je niets kunt zien, maar wel een geritsel hoort. Dit is het Missing Modality probleem (het probleem van de ontbrekende modaliteit).
De meeste AI-modellen zijn als studenten die alleen weten hoe ze moeten studeren als ze zowel hun tekstboek als hun audio-notities hebben. Als je er één wegneemt, raken ze in paniek en falen ze. Deze survey-paper is een enorme gids voor onderzoekers over hoe je AI kunt leren om kalm te blijven en goed te presteren, zelfs wanneer het een van zijn "zintuigen" verliest.
Waar gaat dit artikel over?
Dit artikel is een survey. Zie het als een bibliothecaris die elk boek (354 papers!) heeft gelezen dat tussen 2012 en 2025 over dit specifieke onderwerp is geschreven. De auteurs, Renjie Wu en zijn team, hebben al deze verschillende oplossingen georganiseerd in een duidelijke kaart, zodat onderzoekers weten wat werkt, wat niet werkt en waar ze de volgende stap moeten zetten.
Ze noemen dit veld MLMM (Multimodal Learning with Missing Modality).
De Twee Hoofstrategieën: "De Data Fixen" vs. "Het Brein Fixen"
De auteurs verdelen alle oplossingen in twee grote kampen, zoals het repareren van een kapotte auto door óf de onderdelen te repareren óf de manier waarop de bestuurder rijdt te veranderen.
1. Dataverwerking: "De Onderdelen Fixen"
Deze aanpak probeert de ontbrekende informatie aan te vullen voordat de AI überhaupt begint na te denken.
- De "Lege Pagina" Methode (Modality Composition): Stel je voor dat je een boek leest, maar er is een pagina uitgescheurd. Je zou de lege ruimte gewoon wit kunnen laten (nullen) of willekeurige onzin kunnen opschrijven (willekeurige waarden). De AI leert de lege ruimte te negeren en zich op de rest te concentreren. Het is simpel, maar niet erg slim.
- De "Kopieer-Plak" Methode (Retrieval): Als er een pagina ontbreekt, zoek je andere exemplaren van hetzelfde boek in de bibliotheek, vindt de bijbehorende pagina en plakt deze erin. Dit werkt goed als de boeken identiek zijn, maar als de verhalen iets verschillen, plak je misschien de verkeerde scène in.
- De "Verbeeldingskracht" Methode (Modality Generation): Dit is de meest geavanceerde methode. De AI fungeert als een creatieve schrijver. Als het geluid ontbreekt, kijkt de AI naar de video en stelt zich voor hoe het geluid zou moeten zijn, en creëert het dit vervolgens. Het is als een goochelaar die een konijn uit een hoed tovert. De paper merkt op dat dit wel cool is, maar dat de AI soms kan "hallucineren" (dingen verzinnen die niet waar zijn).
2. Strategieontwerp: "Het Brein Fixen"
In plaats van te proberen de ontbrekende data te repareren, verandert deze aanpak de architectuur van de AI, zodat deze van nature met ontbrekende data kan omgaan.
- De "Spotlight" Methode (Attention): Stel je een leraar voor in een klaslokaal. Als een leerling afwezig is, stopt de leraar niet met de les; hij schijnt gewoon zijn spotlight op de leerlingen die er wel zijn. "Attention"-mechanismen stellen de AI in staat om dynamisch alleen op de beschikbare data te focussen en de ontbrekende delen te negeren.
- De "Bijles" Methode (Distillation): Stel je een slimme student (de Leraar) voor die alle boeken heeft. Een minder slimme student (de Leerling) heeft slechts de helft van de boeken. De Leraar legt de ontbrekende hoofdstukken uit aan de Leerling. De Leerling leert het hele verhaal te begrijpen, zelfs zonder het fysieke boek.
- De "Teamwerk" Methode (Model Combinaties): In plaats van één gigantische AI, heb je een team van specialisten. Als de video ontbreekt, vraag je het aan de "Audio-expert". Als het geluid ontbreekt, vraag je het aan de "Video-expert". Zij stemmen samen over het antwoord.
- Het "Superbrein" (Large Language Models): Recentelijk zijn enorme AI-modellen (zoals de modellen achter chatbots) zo slim geworden dat ze tekst, afbeeldingen en geluid tegelijkertijd kunnen begrijpen. Ze zijn zo flexibel dat als je één input weghaalt, ze zich simpelweg aanpassen en doorgaan, bijna als een mens die nog steeds een verhaal kan vertellen, zelfs als hij het plaatje niet kan zien.
Waar wordt dit voor gebruikt? (Voorbeelden uit de echte wereld)
De paper somt veel plekken op waar dit cruciaal is:
- Medische Scans: Een arts heeft misschien een MRI-scan, maar geen CT-scan voor een patiënt. De AI moet de ziekte kunnen diagnosticeren met alleen de MRI, zonder wild te gokken.
- Zelfrijdende Auto's: De camera van een auto kan verblind worden door sneeuw, of de radar kan defect raken. De AI van de auto moet veilig blijven rijden met alleen de sensoren die nog wel werken.
- Emotie Detectie: Een videogesprek kan slechte audio hebben, maar een heldere video. De AI moet nog steeds in staat zijn om te zien of je blij of verdrietig bent door naar je gezicht te kijken.
- Robotica: Een robot die een grot verkent, kan zijn GPS-signaal verliezen. Hij moet kunnen navigeren met alleen zijn camera's en tastsensoren.
De Problemen die we nog niet hebben opgelost
Ondanks al deze slimme trucjes, wijst de paper op enkele grote hoofdpijnklachten:
- De "Fake Data" Valstrik: Wanneer AI ontbrekende data "verzint", verzint het soms details die fout zijn. Als een zelfrijdende auto een weg verzint waar een afgrond is, is dat gevaarlijk.
- De "Luie" AI: Soms, zelfs als de AI probeert het ontbrekende stuk in te vullen, eindigt het ermee dat de AI de nieuwe informatie negeert en zich alleen op de ene sensor vertrouwt die het wel heeft, wat misschien niet genoeg is.
- De "Rommelige Bibliotheek": Er is geen enkele standaardtest. De ene onderzoeker test zijn AI met 10% ontbrekende data, terwijl een ander test met 90%. Het is moeilijk om te vergelijken wie er echt de beste is.
- Te Zwaar: Veel van deze oplossingen vereisen enorme computerkracht (zoals een supercomputer). Maar apparaten in de echte wereld (zoals een smartwatch of een drone) zijn klein en hebben zwakke batterijen. We hebben "lichtgewicht" oplossingen nodig die werken op kleine chips.
De Kernboodschap
Dit artikel is een routekaart. Het vertelt ons dat hoewel we grote vooruitgang hebben geboekt in het leren van AI om om te gaan met kapotte sensoren en ontbrekende data, we nog steeds betere manieren nodig hebben om dit te doen zonder dingen te verzinnen, zonder supercomputers nodig te hebben en zonder in de war te raken door rommelige werkelijkheden. Het doel is om AI te bouwen die net zo robuust is als een mens: in staat om de wereld te begrijpen, zelfs als het zicht wazig is of de microfoon kapot is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.