← Nieuwste papers
💻 computer science

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

Dit artikel introduceert VEBench, de eerste uitgebreide benchmark die bestaat uit 3.9K hoogwaardige bewerkte video's en 3.080 door mensen geverifieerde vraag-antwoordparen om de vaardigheden van grote multimodale modellen in real-world videobewerkingskennis en operationeel redeneren te evalueren, waarbij een aanzienlijke prestatiekloof tussen huidige modellen en menselijke bewerkingscognitie wordt blootgelegd.

Oorspronkelijke auteurs: Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een filmeditor bent. Je werk bestaat er niet alleen uit films te bekijken; het gaat erom te begrijpen waarom een regisseur van de ene scène naar de andere schakelt, en vervolgens het perfecte ontbrekende stukje beeldmateriaal te vinden om een verhaal af te maken.

Dit artikel introduceert VEBENCH, een nieuw "eindexamen" dat is ontworpen om te toetsen hoe goed Kunstmatige Intelligentie (KI) dit werk kan uitvoeren. De onderzoekers ontdekten dat zelfs de slimste KI-modellen van vandaag de dag lijken op studenten die het woordenboek uit hun hoofd hebben geleerd, maar nog nooit daadwerkelijk een film hebben geredigeerd. Ze kunnen een scène beschrijven, maar ze worstelen om het ritme, het geluid of de logica te begrijpen van het samenvoegen van twee verschillende videoclips.

Hieronder volgt een uiteenzetting van de kernideeën van het artikel, met behulp van eenvoudige analogieën:

1. Het Probleem: KI is een "Passieve Waarnemer", geen "Creatieve Editor"

Huidige KI-modellen zijn uitstekend in het bekijken van een enkele video en vertellen wat er gebeurt (bijvoorbeeld: "Een hond rent"). Maar echt videobewerken is anders. Het vereist actief redeneren.

  • De Analogie: Stel je een student voor die de grammaticaregels perfect kan opdreunen, maar bevriest als er wordt gevraagd om een gedicht te schrijven. Evenzo kan KI een "sprong" in een video herkennen, maar begrijpt het niet waarom de editor sprong of hoe het volgende clipje te vinden dat bij de sfeer past.
  • Het Gat: Het artikel toont aan dat, terwijl KI steeds beter wordt in zien en horen, het nog steeds vreselijk slecht is in de "creatieve logica" van redigeren.

2. De Oplossing: Een Tweeledige Test (VEBENCH)

Om dit op te lossen, bouwden de onderzoekers een benchmark genaamd VEBENCH. Denk hierbij aan een rijexamen voor KI, maar in plaats van een auto te besturen, moet de KI de tijdlijn van een filmeditor "besturen". Het heeft twee hoofduitdagingen:

Deel A: De "Vang de Truc"-test (Techniekherkenning)

  • De Taak: De KI bekijkt een video en moet specifieke redigeertrucs identificeren, zoals een J-Cut (waarbij je de audio van de volgende scène hoort voordat je het ziet) of een Smash Cut (een plotselinge, schokkende wissel naar een totaal andere scène).
  • De Uitdaging: Het gaat niet alleen om het zien van de beeldverandering. De KI moet naar de audio luisteren en het ritme voelen.
  • Het Resultaat: De KI had hier moeite mee. Vaak miste het de subtiele audiohintjes die een menselijke editor zeggen: "Hé, het geluid leidt de weg!"

Deel B: De "Puzzelstuk"-test (Operatiesimulatie)

  • De Taak: Dit is het moeilijkste deel. De KI krijgt een "Referentievideo" (zoals een clip van een acteur die praat over een film). Vervolgens worden vier andere videoclips getoond (Opties A, B, C, D). Het moet het ene clipje kiezen dat perfect past en precies aangeven waar in dat clipje de aansluiting plaatsvindt.
  • De Analogie: Stel je voor dat je een Lego-kasteel bouwt. Je hebt een toren die je zojuist hebt gebouwd (de referentie). Je krijgt vier verschillende stapels bakstenen. Je moet de stapel kiezen die precies de juiste bakstenen heeft om het dak af te maken, en wijzen naar de specifieke bakstenen die je nodig hebt.
  • Het Resultaat: De KI faalde hier spectaculair. Vaak koos het de verkeerde stapel bakstenen, of wees het op de verkeerde plek. Het kon de verhaallijn tussen het interview en de filmclip niet begrijpen.

3. De Dataset: Een Enorme Bibliotheek met "Echte" Edities

Om deze test te creëren, maakten de onderzoekers niet zomaar nepvideo's. Ze verzamelden 3.900 echt geredigeerde video's (ruim 257 uur beeldmateriaal) uit bronnen zoals interviews en filmclips.

  • Het Proces: Ze gebruikten een "Human-in-the-Loop"-systeem. Stel je een team van expert-editors voor dat samenwerkt met KI om elke enkele cut, overgang en geluidseffect te labelen. Dit zorgde ervoor dat de test accuraat en eerlijk was.
  • De Schaal: Dit is de eerste keer dat een test KI vraagt om te redeneren over meerdere verschillende video-bronnen om een verhaal te bouwen, in plaats van slechts één video tegelijk te analyseren.

4. De Resultaten: Een Grote Kloof tussen KI en Mensen

De onderzoekers testten 's werelds slimste KI-modellen (zoals Gemini en diverse open-source modellen) op VEBENCH.

  • De Score: De resultaten waren nederig. Zelfs de beste modellen presteerden ver onder het menselijke niveau.
  • De "Audio"-factor: Het artikel vond dat wanneer de KI de video niet kon "horen" (of wanneer ondertiteling werd verwijderd), de prestaties daalden. Dit bewijst dat redigeren niet alleen gaat over beelden; het gaat om de dans tussen geluid en zicht.
  • De "Tijd"-factor: De KI was vreselijk in het vinden van het exacte moment om te snijden. Het zou het begin van een video raden, terwijl het juiste moment eigenlijk in het midden zat. Het is als proberen een trein te vangen, maar een uur te vroeg of te laat op het station aankomen.

Samenvatting

VEBENCH is een realiteitscheck. Het toont aan dat, terwijl KI goed wordt in het beschrijven van wat het ziet, het nog zeer ver verwijderd is van het begrijpen van de kunst van redigeren. Het kan nog niet denken als een menselijke editor die weet hoe geluid, visuele elementen en verhaal moeten worden verweven tot een naadloze ervaring. Deze benchmark is nu beschikbaar om onderzoekers te helpen de volgende generatie KI te bouwen die daadwerkelijk met creativiteit en logica kan "redigeren".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →