← Nieuwste papers
💻 computer science

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Dit artikel introduceert Video-IFBench, een uitgebreide benchmark met 1,5K samples en een diverse instructietaxonomie om de onderbelichte capaciteit van Multimodale Grote Taalmodellen om complexe, door gebruikers gespecificeerde beperkingen te volgen in video-begripsscenario's te evalueren, wat onthult dat huidige modellen aanzienlijk moeite hebben met multi-constraint en conditionele instructies.

Oorspronkelijke auteurs: Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

Gepubliceerd 2026-08-27
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie is een nieuwe generatie systemen opgekomen die kunnen zien, horen en spreken. Deze multimodale modellen zijn getraind op enorme hoeveelheden tekst, afbeeldingen en video, waardoor ze een scène kunnen beschrijven, vragen over een film kunnen beantwoorden of een nieuwsfragment kunnen samenvatten. Jarenlang hebben onderzoekers hun succes gemeten door een simpele vraag te stellen: is het antwoord correct? Als een model een video van een kookprogramma beschrijft en de ingrediënten juist krijgt, ontvangt het een hoge score. Echter, in de echte wereld is een correct antwoord vaak niet genoeg. Een gebruiker kan een model vragen een video te beschrijven, maar daarbij specifieke regels opleggen: "Vertel me alleen wat er gebeurt nadat het water kookt," "Lijst de stappen in volgorde op," "Noem de kleur van de potten niet," of "Spreek alleen in het Spaans." Deze verzoeken vereisen dat het systeem niet alleen de inhoud begrijpt, maar ook een complexe set instructies opvolgt, waarbij informatie die het wel weet te weten, maar die het genegeerd had moeten negeren, wordt weggefilterd. Tot nu toe is het vermogen van deze geavanceerde systemen om dergelijke gedetailleerde, mensachtige beperkingen in videoscenario's op te volgen, grotende als ongetest gebleven.

Een team van onderzoekers heeft deze kloof gedicht door een nieuwe testomgeving te creëren genaamd Video-IFBench. Deze benchmark is specif으로 ontworpen om te zien of video-begrijpende kunstmatige intelligentie daadwerkelijk kan doen wat er wordt gevraagd wanneer de instructies lastig zijn. De onderzoekers verzamelden meer dan 700 video's uit publieke bronnen, verspreid over tien verschillende domeinen zoals sport, wetenschap, nieuws en het dagelijks leven. Deze clips variëren in lengte van tien seconden tot tien minuten, wat in totaal ongeveer 49 uur aan beeldmateriaal is. Uit deze collectie hebben zij 1.500 unieke testgevallen geconstrueerd. Elk testgeval koppelt een video aan een specifiek verzoek dat een mix van taken en beperkingen bevat. Sommige verzoeken vragen om één enkel stuk informatie, zoals "Wat staat er op het scherm?", terwijl andere meerdere stappen eisen, zoals "Lijst de acties op, maar alleen die langer dan twee seconden duren, en presenteer ze als een genummerde lijst." De moeilijkste tests bevatten conditionele logica, waarbij het model eerst de video moet bekijken om te beslissen welk pad het moet nemen. Bijvoorbeeld, een prompt kan zeggen: "Als de video begint met een titel over het repareren van een laptop, beschrijf dan de reparatiestappen; anders, beschrijf de acties van de persoon in de laatste tien seconden." Het model moet de beginvoorwaarde correct identificeren om de juiste set instructies te kunnen volgen.

Om deze tests eerlijk en nauwkeurig te maken, hebben de onderzoekers een semi-geautomatiseerd systeem gebouwd om de vragen en de regels voor het controleren van de antwoorden te genereren. Ze gebruikten kunstmatige intelligentie om feiten uit de video's te extraheren, zoals welke objecten aanwezig waren en wanneer specifieke gebeurtenissen plaatsvonden, en gebruikten die feiten vervolgens om complexe instructies te schrijven. Cruciaal was dat elke instructie gepaard ging met een checklist. Sommige items op de checklist konden door een computerprogramma worden gecontroleerd, zoals het verifiëren of het antwoord in JSON-formaat was geschreven of of het precies vijf opsommingstekens bevatte. Andere items, die begrip van de betekenis van de reactie vereisten, werden gecontroleerd door een apart, zeer capabel taalmodel dat optrad als rechter. Deze hybride aanpak stelde de onderzoekers in staat om te evalueren of de modellen aan elke afzonderlijke beperking in een verzoek voldeden, en niet alleen aan de hoofdtaken.

De resultaten van deze evaluatie onthulden een aanzienlijke zwakte in zelfs de meest geavanceerde videomodellen van vandaag. Wanneer ze op de gehele benchmark werden getest, behaalde het best presterende model een algemene score van slechts 54,5 procent. Dit betekent dat het model in bijna de helft van de gevallen faalde om de volledige set instructies op te volgen, zelfs als het de video-inhoud correct begreep. De studie toonde aan dat modellen het meest moeite hadden wanneer de instructies tegelijkertijd veel beperkingen bevatten, of wanneer het verzoek van het model vereiste een beslissing te nemen op basis van de video-inhoud voordat het antwoord werd gegeven. Bijvoorbeeld, wanneer gevraagd werd om tussen verschillende paden te kiezen op basis van wat er in de video gebeurde, kozen modellen vaak het verkeerde pad of negeerden ze de voorwaarde volledig. De moeilijkheid nam toe naarmate de instructies complexer werden; wanneer een verzoek een diepe keten van "als-dan"-logica inhield, daalde het succespercentage scherp.

De onderzoekers ontdekten ook dat het type beperking er sterk toe deed. Modellen waren relatief goed in het opvolgen van formele regels, zoals het gebruik van een specifieke taal of het beperken van het aantal woorden. Ze presteerden echter slecht op semantische beperkingen, die vereisten dat ze de betekenis van de video begrepen om informatie te filteren. Bijvoorbeeld, een model zou bijvoorbeeld gevraagd kunnen worden om alleen de acties van een specifieke persoon te beschrijven en iedereen anders te negeren, of om gebeurtenissen op te sommen die binnen een nauwkeurig tijdsbestek plaatsvonden. In deze gevallen namen de modellen vaak informatie op die ze niet mochten noemen, of misten ze details die ze juist hadden moeten vinden. De studie toonde aan dat het simpelweg groter maken van de modellen of het geven van meer rekenkracht het probleem niet oploste. Hoewel grotere modellen over het algemeen beter presteerden, slaagden ze er nog steeds niet in om strikte instructies consistent op te volgen, wat suggereert dat het begrijpen van video-inhoud en het vermogen om complexe regels op te volgen twee verschillende vaardigheden zijn die de huidige technologie nog niet volledig heeft gecombineerd.

Dit werk suggereert dat voor kunstmatige intelligentie om echt nuttig te zijn in real-world toepassingen, het net zo nauwkeurig moet leren luisteren als het ziet. De bevindingen wijzen erop dat huidige systemen nog niet betrouwbaar genoeg zijn om te worden ingezet in scenario's waarin gebruikers een precieze naleving van hun specifieke behoeften verwachten. De onderzoekers hopen dat, door een duidelijke maatstaf voor deze capaciteit te bieden, Video-IFBench de toekomstige ontwikkeling zal sturen naar modellen die niet alleen de wereld kunnen zien, maar ook de genuanceerde, vaak tegenstrijdige instructies van de mensen die hen gebruiken, kunnen opvolgen. De weg vooruit vereist een verschuiving in de focus van simpelweg het juiste antwoord krijgen naar het juiste antwoord krijgen op exact de manier waarop de gebruiker daarom vroeg.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →