← Nieuwste papers
💬 NLP

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

Dit artikel introduceert CLBench-V, een uitgebreide benchmark die is ontworpen om multimodale contextuele leerprestaties te evalueren over drie belangrijke dimensies—grounding, toepassing van nieuwe informatie en kennisverwerving—waarbij wordt onthuld dat de huidige state-of-the-art modellen ondanks vooruitgang in multimodale capaciteiten nog steeds aanzienlijk worstelen met deze taken.

Oorspronkelijke auteurs: Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang

Gepubliceerd 2026-07-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot leert om een mysterie op te lossen. In de oude dagen zou je de robot gewoon een enorme bibliotheek met boeken voeren en hopen dat hij elke feit binnenin uit zijn hoofd leerde. Maar in de echte wereld komen problemen niet met kant-en-klare antwoorden uit een bibliotheek. In plaats daarvan geef je de robot een verse, rommelige map met een kaart, een financieel rapport, een wetenschappelijke diagram en een paar foto's, en zeg je: "Los dit op met alleen wat hierin staat." Dit is de uitdaging van context learning: het vermogen om nieuwe regels te leren of specifieke aanwijzingen te vinden uit informatie die op dat exacte moment wordt verstrekt, in plaats van te vertrouwen op wat de robot al weet uit zijn training.

Lange tijd testten wetenschappers deze vaardigheid met alleen tekst, zoals het geven van een lang verhaal om te lezen. Maar het echte leven is zelden alleen tekst. Het is een mix van woorden, grafieken, kaarten en afbeeldingen. De grote vraag die onderzoekers stellen is: kunnen onze meest geavanceerde AI-modellen een multimodale map (tekst + afbeeldingen) echt "lezen" en eruit leren, of doen ze alsoverlijk alsof ze het begrijpen terwijl ze stiekem gokken op basis van oude gewoontes? Dit is de hoek van de wetenschap waar kunstmatige intelligentie de complexe, visuele realiteit van de menselijke wereld ontmoet.

Maak kennis met CLBench-V, een nieuwe "stress test" die door onderzoekers is ontworpen om te zien hoe goed deze AI-modellen deze specifieke uitdaging aankunnen. Zie CLBench-V niet als één enkele examen, maar als een hindernisbaan met drie niveaus.

Niveau 1: Het Oog van de Detective (Context Grounding)
Eerst moet het model simpelweg de aanwijzingen vinden. Als je het een metrokaart laat zien en vraagt: "Welk station ligt tussen A en B?", dan moet het daadwerkelijk naar de kaart kijken, in plaats van te gokken op basis van wat het denkt dat een metrokaart meestal is. Dit niveau test of de AI in staat is om de juiste visuele bewijslast te lokaliseren en te koppelen aan de vraag.

Niveau 2: De Rekenaar (New Information Application)
Vervolgens moet het model de gevonden aanwijzingen gebruiken. Stel je voor dat de kaart zegt: "De kaart kost vandaag $5" en de vraag is: "Hoeveel kosten twee kaartjes?". Het model moet dat specifieke, nieuwe getal uit de afbeelding nemen en de berekening maken, waarbij het zijn oude geheugen dat kaartjes meestal $3 kosten negeert. Dit test of de AI verse feiten kan toepassen zonder in de war te raken door zijn voorkennis.

Niveau 3: De Wetenschapper (New Knowledge Learning)
Ten slotte het moeilijkste niveau. Het model moet een nieuwe regel leren uit de context. Bijvoorbeeld: een wetenschappelijk artikel toont een grafiek en concludeert: "In dit specifieke experiment zorgt blauw licht ervoor dat planten sneller groeien." Het model moet dit lezen, de regel begrijpen en deze toepassen op een nieuwe vraag over een andere plant. Het is niet alleen het vinden van een getal; het is het leren van een nieuwe natuurwet voor de duur van de test.

De onderzoekers hebben deze test gebouwd door bestaande publieke datasets te mengen met gloednieuwe taken die zij zelf hebben gecreëerd, met een specifieke focus op lastige gebieden zoals financiële rapporten (het berekenen van de Return on Equity), wetenschappelijke artikelen (conclusies afleiden uit medische figuren) en sportscènes. Ze voerden 3.443 van deze tests uit op zes van de slimste multimodale modellen die vandaag de dag beschikbaar zijn.

De resultaten? De robots worstelen nog steeds. Zelfs het best presterende model, InternVL3.5-30B-A3B, scoorde slechts een 0.2847 in totaal. Dat is een zeer lage score, wat suggereert dat multimodale context learning nog lang niet "opgelost" is. Het paper suggereert dat hoewel InternVL3.5-30B-A3B uitstekend is in het vinden van aanwijzingen (Niveau 1 / Context Grounding) en het leren van nieuwe regels (Niveau 3 / New Knowledge Learning), het model eigenlijk worstelt op Niveau 2 (New Information Application), waar modellen specifieke nieuwe feiten uit documenten moeten toepassen. In tegen tegenstelling tot dit model presteerde het Qwen3.5-Plus model het best op specifiek de Niveau 2-taken.

Interessant genoeg vonden de onderzoekers dat de lengte van het document of het aantal afbeeldingen de zaken niet altijd op een eenvoudige manier verslechterde. Soms hielpen meer afbeeldingen het ene model wel, maar verwarden ze het andere. Het grootste probleem was niet alleen dat de documenten lang waren; het was dat de modellen vaak er niet in slaagden om onderscheid te maken tussen wat er in het document stond en wat ze al "wisten" uit hun training. Ze zagen een nieuw feit in een grafiek, maar overschreven dit vervolgens met een oude gok.

Het paper concludeert dat we ons nog in de beginfase bevinden. Alleen omdat een model een afbeelding kan "zien" en tekst kan "lezen", betekent niet dat het ze ook echt samen kan leren begrijpen. De auteurs hopen dat deze nieuwe benchmark, CLBench-V, ontwikkelaars zal helpen om te stoppen met gissen en te beginnen met het oplossen van deze specifieke blinde vlekken, zodat onze AI uiteindelijk een echte partner kan worden bij het oplossen van complexe, real-world problemen die vragen om het lezen van de kleine lettertjes op een kaart, een grafiek of een rapport.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →