← Nieuwste papers
💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

Het paper introduceert Vero, een familie van volledig open visuele taalmodellen die door middel van schaalbaar versterkt leren op een divers dataset van 600.000 voorbeelden state-of-the-art prestaties behalen op een breed scala aan visuele redeneertaken, zonder afhankelijk te zijn van proprietaire data.

Oorspronkelijke auteurs: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

Gepubliceerd 2026-04-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een jonge kunstenaar wilt trainen die niet alleen schilderijen kan maken, maar ook wiskundige raadsels kan oplossen, kaarten kan lezen, en zelfs een robot kan besturen die door een huis loopt.

De meeste "super-intelligente" kunstenaars (de AI-modellen) die we vandaag de dag zien, zijn getraind door grote bedrijven met geheime recepten. We weten niet precies welke lessen ze hebben gevolgd of welke boeken ze hebben gelezen. Het is alsof ze een magische drankje hebben gedronken dat ze niet mogen onthullen.

Vero is een nieuw project van onderzoekers van de Princeton Universiteit die zeggen: "Wacht even, laten we dat recept openbaar maken en het zelf proberen!" Ze hebben een volledig open "trainingsrecept" ontwikkeld dat werkt voor bijna elke visuele taak.

Hier is hoe ze het gedaan hebben, vertaald naar alledaagse taal:

1. De Grote Bibliotheek (Vero-600K)

Stel je voor dat je een student wilt opleiden tot een alleskunner. Als je ze alleen maar wiskundige oefeningen geeft, worden ze een wiskundegenie, maar kunnen ze geen gedichten schrijven. Als je ze alleen gedichten laat schrijven, worden ze slecht in wiskunde.

De onderzoekers hebben een enorme bibliotheek samengesteld met 600.000 voorbeelden uit 59 verschillende bronnen. Ze hebben deze in zes grote categorieën verdeeld, zoals:

  • STEM: Wiskunde en wetenschap (denk aan het oplossen van een raadsel).
  • Kaarten & Tekst: Het lezen van grafieken en documenten (denk aan het lezen van een menukaart).
  • Ruimte & Actie: Het begrijpen van waar dingen zijn en hoe je ze moet aanraken (denk aan het navigeren door een kamer).
  • Kennis: Het beantwoorden van vragen over wat je ziet (denk aan het herkennen van een vogelsoort).
  • Zoeken & Tellen: Het vinden van specifieke objecten en ze tellen.
  • Beschrijven: Het maken van mooie beschrijvingen van foto's.

Het geheim? Ze hebben evenveel voorbeelden uit elke categorie gebruikt. Ze hebben niet gekozen voor de "moeilijkste" of de "meest populaire" lessen, maar hebben een eerlijke mix gemaakt.

2. De Leraar met een Speciale Beloning (Task-Routed Rewards)

In het verleden was het lastig om een AI te belonen als het antwoord goed was. Stel je voor dat de AI een vraag krijgt over een grafiek en een antwoord geeft over een vogel. Hoe zeg je dan "Goed gedaan" of "Fout"?

Vero gebruikt een slimme beloningssysteem dat werkt als een veiligheidscontroleur op een vliegveld:

  • Als de AI een vraag over een grafiek krijgt, kijkt de controleur specifiek naar de cijfers in de grafiek.
  • Als de AI een vraag over een vogel krijgt, kijkt de controleur naar de naam van de vogel.
  • Als de AI een vraag krijgt om een foto te beschrijven, kijkt de controleur naar de creativiteit en de grammatica.

Elke taak heeft zijn eigen "recept" om te controleren of het antwoord klopt. Dit zorgt ervoor dat de AI niet in de war raakt en leert om voor elke situatie de juiste "bril" op te zetten.

3. De Resultaten: Een Alleskunner

Het resultaat is een familie van AI-modellen (genaamd Vero) die presteren net zo goed als, of zelfs beter dan, de duurste, geheimzinnige modellen van grote tech-bedrijven.

  • Ze zijn getraind op open data (iedereen kan het zien).
  • Ze zijn getraind op open code (iedereen kan het nabouwen).
  • Ze zijn getraind op open modellen (iedereen kan ze gebruiken).

Het meest verbazingwekkende is dat hun open recept beter werkt dan de geheime recepten van concurrenten. Ze hebben getoond dat je geen "magische drankjes" nodig hebt; je hebt gewoon een goede mix van verschillende lessen en een slimme manier om te controleren of het antwoord klopt nodig.

Waarom is dit belangrijk?

Vroeger was het alsof we alleen maar naar de eindresultaten van een chef-kok keken en dachten: "Die taart is lekker, maar ik weet niet hoe hij hem heeft gemaakt." Met Vero krijgen we het volledige recept, de ingrediëntenlijst en de kookstappen.

Dit betekent dat:

  1. Iedereen kan meedoen: Onderzoekers en studenten kunnen nu zelf experimenteren met visuele redenering.
  2. We begrijpen het beter: We weten nu waarom bepaalde modellen goed werken (namelijk door de diversiteit aan data) en niet alleen dat ze werken.
  3. Betrouwbaarheid: Omdat alles open is, kunnen we controleren of de AI eerlijk en veilig werkt, zonder dat we blindelings op een bedrijf hoeven te vertrouwen.

Kortom: Vero bewijst dat je geen geheimen nodig hebt om een slimme visuele AI te bouwen. Je hebt gewoon een goede, diverse mix van lessen en een eerlijke manier van beoordelen nodig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →