← Nieuwste papers
🤖 AI

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

Dit overzicht onderzoekt systematisch de impact van multimodaliteit op agentische frameworks door te analyseren hoe diverse modaliteiten integreren in kernfunctionele modules zoals perceptie en redeneren, architecturale ontwerpen te categoriseren, en toepassingen over domeinen zoals robotica en webnavigatie te evalueren om hiaten te identificeren en een roadmap uit te stippelen voor robuuste, algemene intelligente systemen.

Oorspronkelijke auteurs: Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Saya
Gepubliceerd 2026-08-24
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Sayan Nag, Sanjoy Chowdhury, Dinesh Manocha

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Decennialang was de droom van kunstmatige intelligentie om een machine te bouwen die kon denken en handelen op eigen initiatief, net als een mens. Vroege pogingen om deze "agenten" te creëren faalden vaak omdat ze te rigide waren en strikte regels volgden die in de chaotische echte wereld uit elkaar vielen. Het vakgebied veranderde drastisch met de komst van grote taalmodellen, krachtige computerprogramma's getraind op enorme hoeveelheden tekst die konden redeneren, plannen en instructies konden opvolgen. Deze tekstgebaseerde denkers hadden echter een blinde vlek: ze konden alleen woorden begrijpen. Wanneer ze geconfronteerd werden met een afbeelding, een geluid of een video, moesten ze vertrouwen op een onhandig vertaalproces waarbij rijke visuele of auditieve details werden omgezet in eenvoudige beschrijvingen. Deze vertaling ontnam vaak de zeer belangrijke details die nodig zijn om correct te handelen in complexe omgevingen.

Om deze kloof te overbruggen, ontwikkelen onderzoekers een nieuwe generatie systemen die de wereld kunnen waarnemen en begrijpen via meerdere zintuigen tegelijkertijd. Dit zijn multimodale agenten, die in staat zijn een afbeelding te zien, een geluid te horen en tekst te lezen, alles tegelijkertijd, om beslissingen te nemen. De centrale vraag voor wetenschappers is geweest hoe men deze verschillende zintuigen het beste kan combineren. Moet het systeem aparte hulpmiddelen gebruiken om elk zintuig te analyseren en vervolgens de resultaten door te geven aan een centraal brein? Of moet het brein zelf vanaf het begin gebouwd worden om alle zintuigen te begrijpen? Een uitgebreid nieuw onderzoek door een team van onderzoekers van universiteiten en instituten over de hele wereld heeft het volledige landschap van deze systemen in kaart gebracht, waarbij geanalyseerd is hoe verschillende ontwerpkeuzes hun vermogen om te zien, te denken, te onthouden en te handelen in de echte wereld beïnvloeden.

De onderzoekers onderzochten honderden frameworks en organiseerden ze op basis van hoe ze informatie verwerken. Ze ontdekten dat de vroegste en eenvoudigste aanpak een tekstueel brein betrof dat specifieke externe hulpmiddelen aanriep om afbeeldingen te beschrijven of audio te transcriberen. Hoewel dit modulair en flexibel was, onthulde het onderzoek een aanzienlijk gebrek: het proces van het omzetten van een complexe afbeelding naar een tekstuele beschrijving leidde onvermijdelijk tot informatieverlies. Belangrijke ruimtelijke details, zoals de exacte locatie van een object of hoe dat object bewoog, verdwenen vaak in de vertaling. Om dit op te lossen, ontstond een tweede golf van systemen die gebruikmaakten van "late-fusion"-technieken. Deze systemen namen de ruwe gegevens van afbeeldingen of geluiden, zetten deze om in een wiskundig formaat en voedden ze rechtstreeks aan het geheugen van het taalmodel. Dit behield meer detail, maar de verschillende zintuigen werden nog steeds enigszini gescheiden verwerkt voordat ze werden gecombineerd.

De meest geavanceerde systemen, die de auteurs identificeren als de huidige grens, maken gebruik van "early-fusion"-architecturen. In deze modellen vertaalt de computer de wereld niet eerst naar woorden. In plaats daarvan verwerkt het systeem ruwe pixels, geluidsgolven en teksttokens samen in één enkele, verenigde stroom. Dit stelt het systeem in staat om subtiele verbanden op te merken, zoals de toon van een stem die overeenkomt met een gezichtsuitdrukking, of de precieze locatie van een knop op een scherm, zonder dat er detail verloren gaat in de vertaling. Het onderzoek laat zien dat deze native multimodale systemen beginnen te presteren boven hun voorgangers in taken die een fijnmazig begrip vereisen, zoals het navigeren door een website door naar een screenshot te kijken, of het aansturen van een robotarm op basis van wat het ziet.

De paper maakt echter duidelijk dat deze vooruitgang gepaard gaat met aanzienlijke afwegingen. Hoewel de meest geïntegreerde systemen de meest capabele zijn, zijn ze ook het duurst en traag om uit te voeren. De onderzoekers ontdekten dat systemen die vertrouwen op massieve, propriëtaire modellen vaak moeite hebben met snelheid en soms seconden of zelfs minuten nodig hebben om één stap te verwerken, wat ze onpraktisch maakt voor realtime taken zoals het besturen van een auto of het vouwen van de was. In contrast hiermee kunnen kleinere, gespecialiseerde modellen die zijn afgestemd op specifieke taken veel sneller en goedkoper draaien, hoewel ze misschien minder slim zijn bij het oplossen van volstrekt nieuwe problemen. Het onderzoek benadrukt dat er geen enkel "beste" ontwerp is; de juiste keuze hangt volledig af van de taak. Voor een robot die in realtime zijn hand moet bewegen, zijn snelheid en efficiëntie van cruciaal belang, wat de voorkeur geeft aan kleinere, gespecialiseerde modellen. Voor een systeem dat een complexe video moet begrijpen of creatieve inhoud moet genereren, is het rijkere begrip van de grotere, geïntegreerde modellen de extra kosten waard.

De onderzoekers keken ook naar hoe deze agenten presteren in specifieke real-world scenario's. In de wereld van robotica zijn de meest succesvolle systemen diegene die direct wat ze zien kunnen vertalen naar fysieke beweging, waarbij een aparte planningsstap wordt overgeslagen. In de digitale wereld van het navigeren door websites en apps, stelde het onderzoek vast dat zelfs de beste systemen nog steeds worstelen met precisie. Hoewel ze het algemene idee van een pagina begrijpen, falen ze vaak bij het klikken op de exacte juiste knop of het typen in het juiste tekstvak, wat een grote kloof laat zien tussen hun prestaties en die van een mens. Op dezelfde manier, bij het begrijpen van lange video's, proberen de meest efficiënte systemen niet elke enkele frame te bekijken. In plaats daarvan gedragen ze zich als een menselijke kijker, die door de video springt om alleen de specificante momenten te vinden die relevant zijn voor de vraag, wat enorme rekenkracht bespaart terwijl de nauwkeurigheid behouden blijft.

Ondanks deze successen wijst de survey op verschillende hardnekkige beperkingen die voorkomen dat deze agenten werkelijk betrouwbaar zijn in de echte wereld. Een groot probleem is "grounding", of het vermogen om een hoogwaardig concept te koppelen aan een specifieke fysieke locatie. Zelfs de slimste systemen hallucineren vaak, waarbij ze geloven dat een knop bestaat waar die niet is, of niet beseffen dat een actie die ze hebben gepland fysiek onmogelijk is. Een andere uitdaging is geheugen; hoewel agenten gebeurtenissen uit het verleden kunnen onthouden, hebben ze vaak moeite om over langere perioden een coherent verhaal vast te houden, vooral wanneer de omgeving onverwacht verandert. De onderzoekers merkten ook op dat veel van de best presterende systemen vertrouwen op gesloten, propriëtaire modellen die niet door de bredere wetenschappelijke gemeenschap kunnen worden geïnspecteerd of verbeterd, wat het moeilijk maakt om hun ware capaciteiten te verifiëren of te begrijpen waarom ze falen.

Uiteindelijk suggereert de paper dat de toekomst van intelligente agenten niet alleen ligt in het groter maken van modellen, maar in het efficiënter en beter "gegrond" maken ervan. De meest veelbelovende weg voorwaarts lijkt hybride benaderingen te zijn die de rauwe kracht van grote modellen combineren met de snelheid en precisie van kleinere, gespecialiseerde hulpmiddelen. Door zorgvuldig systemen te ontwerpen die weten wanneer ze hun volledige intelligentie moeten gebruiken en wanneer ze moeten vertrouwen op eenvoudigere, snellere methoden, hopen onderzoekers agenten te bouwen die niet alleen slim zijn, maar ook betrouwbaar, snel en veilig genoeg om naast mensen te werken in de complexe, onvoorspelbare echte wereld. De reis van tekst-alleen denkers naar echt multimodale agenten is een enorme sprong geweest, maar de survey concludeert dat het werk nog lang niet af is en dat er aanzienlijke hindernissen blijven bestaan voordat deze systemen met de flexibiliteit en betrouwbaarheid van menselijke intelligentie kunnen opereren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →