← Nieuwste papers
🤖 AI

Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

Dit artikel pakt het gebrek aan robuuste benchmarks en hoogwaardige data in beloningsmodellering voor video-inzicht aan door de Video Understanding Reward Bench (VURB), het grootschalige Video Understanding Preference Dataset (VUP-35K) en state-of-the-art discriminatieve en generatieve beloningsmodellen (VideoDRM en VideoGRM) te introduceren die de prestaties en redeneervermogens aanzienlijk verbeteren.

Oorspronkelijke auteurs: Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de hoofdcoach bent van een team AI-robots. Deze robots leren video's bekijken en vragen daarover te beantwoorden. Soms krijgen ze het antwoord goed, maar leggen het slecht uit; andere keren krijgen ze het antwoord fout, maar klinken ze zeer zelfverzekerd.

Jouw taak is om de Scheidsrechter te zijn. Je moet de antwoorden van de robots bekijken en beslissen welke beter is, zodat het team kan leren van de fouten. Dit artikel gaat over het bouwen van een betere Scheidsrechter, specifiek voor video-taken.

Hier is het verhaal van wat de auteurs hebben gebouwd, eenvoudig uitgelegd:

1. Het Probleem: De Scheidsrechters Waren Blind

De auteurs merkten op dat AI weliswaar erg goed is geworden in het beoordelen van tekst (zoals opstellen) en afbeeldingen (zoals foto's), maar vreselijk in het beoordelen van video's.

  • De Oude Tests waren Gebrekkig: Bestaande tests waren als een pop-up toets met slechts 5 vragen. Ze dekten niet genoeg onderwerpen en de vragen waren te kort. Het was alsof je een marathonloper probeerde te beoordelen door te kijken hoe ze hun schoenen bonden.
  • De Data Ontbrak: Om een goede scheidsrechter op te leiden, heb je duizenden voorbeelden nodig van "Goed Antwoord" versus "Slecht Antwoord". Voor video's was deze data bijna niet bestaand, omdat het moeilijk en duur is om te maken.
  • Het Resultaat: De huidige AI-scheidsrechters gokten. Ze deden nauwelijks beter dan het opgooien van een munt (50% nauwkeurigheid). Ze konden het onderscheid niet maken tussen een robot die de video daadwerkelijk begreep en een die gewoon de juiste letter gokte.

2. De Oplossing: Een Beter Stadion en een Nieuw Reglement Bouwen

Om dit op te lossen, bouwde het team een compleet nieuw systeem met drie hoofdonderdelen:

A. Het Nieuwe Stadion: VURB (De Benchmark)

Ze bouwden een enorme, hoogwaardige testomgeving genaamd VURB.

  • De Schaal: In plaats van 5 vragen, creëerden ze 2.100 complexe video-uitdagingen.
  • De Diepgang: Ze vroegen niet alleen "Wat gebeurde er?". Ze vroegen de robots om stap voor stap uit te leggen waarom het gebeurde. Stel je voor dat je een student vraagt niet alleen een wiskundeprobleem op te lossen, maar ook hun hele denkproces op te schrijven. De antwoorden in deze test zijn zeer lang (gemiddeld meer dan 1.000 woorden) om de AI te dwingen echt na te denken.
  • De Rechtvaardigheid: Om te voorkomen dat de AI cheatte door gewoon het eerste antwoord te kiezen dat ze zagen, gebruikten ze een "Meerderheidsstem"-regel. Ze vroegen de AI om dezelfde video 8 keer te beoordelen, waarbij ze elke keer de volgorde van de antwoorden verwisselden. Als de AI de meeste keren het juiste antwoord koos, slaagde het.

B. Het Nieuwe Trainingskamp: VUP-35K (De Dataset)

Je kunt geen scheidsrechter trainen zonder oefenwedstrijden. Aangezien niemand genoeg oefendata had, bouwden ze een machine om het te creëren.

  • De Fabriek: Ze creëerden een volledig geautomatiseerde pijplijn (zonder menselijke tussenkomst) die 35.000 paren "Goed Antwoord" versus "Slecht Antwoord" voor video's genereerde.
  • De Truc: Om ervoor te zorgen dat de "Slechte Antwoorden" echt slecht waren, gaven ze de video soms opzettelijk een kleine "glitch" (zoals het verlagen van de kwaliteit of het verwijderen van frames) om de AI in de val te lokken en fouten te laten maken. Dit creëerde een enorme bibliotheek met voorbeelden die precies laten zien hoe en waarom AI faalt in video-redenering.

C. De Nieuwe Scheidsrechters: VideoDRM en VideoGRM

Met hun nieuwe trainingsdata bouwden ze twee nieuwe soorten scheidsrechters:

  1. VideoDRM (De Scorekeeper): Deze scheidsrechter bekijkt twee antwoorden en geeft ze een score (zoals 9,8 versus 2,9) om te beslissen welke beter is.
  2. VideoGRM (De Commentator): Deze scheidsrechter kiest niet alleen een winnaar; hij schrijft een gedetailleerde uitleg van waarom één antwoord beter is, en fungeert als een sportanalist die een spelbeurt ontleedt.

3. De Resultaten: De Nieuwe Scheidsrechters Winnen

Toen ze hun nieuwe scheidsrechters op de proef stelden:

  • Oude Scheidsrechters: De beste bestaande AI-modellen scoorden rond de 55-60%. Ze deden nauwelijks beter dan willekeurig gokken.
  • Nieuwe Scheidsrechters: Hun nieuwe modellen (VideoDRM en VideoGRM) sprongen naar 63-64%.
  • De Vergelijking: Hun nieuwe modellen sloegen zelfs de duurste, "closed-source" commerciële AI-modellen (zoals de nieuwste versies van GPT of Gemini) op deze specifieke video-taken.

4. De "Best-of-N" Superkracht

Het artikel toonde ook aan dat deze nieuwe scheidsrechters helpen het AI-team slimmer te maken tijdens het daadwerkelijke spel.

  • Stel je voor dat de AI-robot een moeilijke vraag krijgt. In plaats van slechts één antwoord te geven, genereert het 8 verschillende mogelijke antwoorden.
  • De nieuwe scheidsrechter bekijkt alle 8, kiest de beste en de robot geeft die als definitief antwoord.
  • Het Resultaat: Deze simpele truc maakte de AI aanzienlijk nauwkeuriger, wat bewijst dat het hebben van een goede scheidsrechter net zo belangrijk is als het hebben van een slimme speler.

Samenvatting

Kortom, de auteurs zeiden: "We kunnen video-AI niet goed beoordelen omdat we geen goede tests hebben of genoeg oefendata." Dus bouwden ze een gigantische nieuwe test, een fabriek om oefendata te maken, en twee nieuwe AI-scheidsrechters die nu de besten ter wereld zijn in het bekijken van video's en het bepalen welke antwoorden logisch zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →