SO-Bench: A Structural Output Evaluation of Multimodal LLMs
Deze paper introduceert SO-Bench, een nieuw benchmark voor het systematisch evalueren en verbeteren van de vermogens van multimodale grote taalmodellen om visuele informatie correct en schema-conform te extraheren en te redeneren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, visuele assistent hebt die foto's kan "lezen". Je kunt haar een foto van een menukaart tonen en zeggen: "Haal de prijzen en namen van de hamburgers eruit." In het verleden zou deze assistent misschien een rommelige lijst teruggeven, of een zinnetje schrijven dat niet precies paste in je computerprogramma.
Maar wat als je wilt dat ze de informatie perfect in een specifieke, strakke vorm teruggeeft? Bijvoorbeeld in een digitale lijst (JSON) die direct door een app kan worden gebruikt om je bestelling te plaatsen?
Dit is precies het probleem dat het nieuwe onderzoek van Apple, genaamd SO-Bench, aanpakt. Hier is de uitleg in simpele taal:
1. Het Probleem: De "Vrijblijvende" Assistent
Stel je voor dat je een chef-kok bent (de AI) en een sous-chef (de computerprogramma's) die alleen werkt als je recepten in een heel specifiek formaat aanlevert. Als je zegt: "Maak een soep," en de chef-kok schrijft een gedicht over soep, is dat misschien mooi, maar de sous-chef kan er niets mee. Hij heeft een recept nodig met exactly de juiste ingrediëntenlijst, gewichten in gram en temperaturen in graden, in een vaste volgorde.
Huidige slimme modellen (MLLM's) zijn geweldig in het begrijpen van beelden en het schrijven van gedichten, maar ze zijn vaak een beetje slordig als het gaat om het volgen van die strikte "receptregels" (schema's) wanneer ze naar een foto kijken. Ze maken fouten in de structuur, missen vakjes of vullen de verkeerde informatie in.
2. De Oplossing: SO-Bench (De "Keukentest")
Om te zien hoe goed deze modellen zijn, hebben de onderzoekers van Apple SO-Bench bedacht. Dit is een enorme testset, een soort "keukentest" voor slimme robots.
- De Test: Ze hebben duizenden foto's verzameld (van apps, menukaarten, documenten en grafieken) en voor elke foto een heel specifiek "recept" (een JSON-schema) bedacht.
- De Taak: De robot moet naar de foto kijken en de informatie eruit halen, maar dan precies in het formaat van het recept. Geen afwijkingen toegestaan.
- De Diversiteit: Het is niet zomaar één soort foto. Het is een mix van alles: van een rommelig bordje in een restaurant tot een strakke grafiek in een rapport.
3. Wat hebben ze ontdekt? (De Resultaten)
Toen ze de slimste robots ter wereld (zoals de nieuwste versies van GPT en Gemini) deze test lieten doen, kwamen ze tot een verrassend resultaat:
- Ze zijn slim, maar niet perfect: De allerbeste robots kunnen het receptformaat wel volgen (ze weten dat ze een lijst moeten maken), maar ze vullen vaak de verkeerde getallen in of missen details.
- De "Kleine" Robots: De kleinere modellen (die minder "brein" hebben) haken vaak helemaal af. Ze maken de structuur helemaal kapot.
- De "Grote" Robots: Zelfs de grootste, duurste modellen krijgen het niet 100% goed. Ze halen misschien 95% van het formaat goed, maar de inhoud (de feitelijke prijzen of namen) klopt niet altijd. Het is alsof ze het bordje wel goed hebben ingevuld, maar de prijs van de burger verkeerd hebben overgeschreven.
4. De Lering: Oefening Baart Kunst (Training)
De onderzoekers dachten: "Oké, ze zijn niet perfect, maar kunnen we ze trainen?"
Ze hebben een enorme hoeveelheid extra oefenmateriaal gemaakt en de modellen laten oefenen met twee methoden:
- SFT (Supervised Fine-Tuning): Dit is als een leraar die de robot stap-voor-stap laat zien hoe het moet. "Kijk, hier staat de prijs, zet die in dit vakje."
- RLVR (Reinforcement Learning): Dit is als een spel. De robot krijgt een punt als het goed is, en een straf als het fout is.
Het resultaat? Door te oefenen werden de robots veel beter. Ze leerden dat het niet genoeg is om alleen de foto te "zien"; ze moesten ook leren hoe ze die informatie in de juiste "doosjes" moesten stoppen.
Samenvatting in een Metafoor
Stel je voor dat je een architect bent die een tekening maakt van een huis (de foto).
- Vroeger: De architect gaf je een schets op een krabbelvelletje. Je kon het idee wel begrijpen, maar je kon er geen bouwvergunning mee aanvragen.
- Nu (SO-Bench): We hebben een test gemaakt om te zien of de architect de tekening kan omzetten in een digitale bouwplaat die direct door de computer van de bouwvakker kan worden gelezen.
- De conclusie: De architecten zijn creatief, maar ze zijn nog niet goed genoeg in het volgen van de strikte bouwregels. Maar als we ze laten oefenen met duizenden voorbeelden, worden ze steeds beter in het leveren van die perfecte, computer-leesbare bouwplaat.
Kortom: SO-Bench laat zien dat we nog een eindje te gaan hebben voordat AI's volledig betrouwbaar zijn in het omzetten van visuele informatie naar strakke, bruikbare data. Maar met de juiste training kunnen we die kloof dichten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.