← Nieuwste papers
🤖 machine learning

PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis

Het artikel introduceert PRISM, een vierfasig datasyntheseframework dat multimodale modellen in staat stelt om te fungeren als prioriteitsbewuste rubric-uitvoerders in plaats van eenvoudige generatoren, waarbij significante verbeteringen in het opvolgen van instructies met meerdere regels worden aangetoond over diverse architecturen met behulp van slechts 10K gesynthetiseerde monsters en een deterministische evaluatiemetriek.

Oorspronkelijke auteurs: Xiaomin He, Dongling Xiao, Jiahao Xie, Ruiqi Lu, Qianle Wang, Zhongbin Guo, Wanxuan Sun

Gepubliceerd 2026-08-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiaomin He, Dongling Xiao, Jiahao Xie, Ruiqi Lu, Qianle Wang, Zhongbin Guo, Wanxuan Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Kunst van de Kleine Lettertjes

Stel je voor dat je een robot leert de wereld te begrijpen. Een lange tijd hebben we deze robots geleerd via een simpel spelletje van "Vraag en Antwoord". Je laat ze een foto van een kat zien en vraagt: "Is dit een kat?" Als ze "Ja" zeggen, krijgen ze een gouden ster. Dit is hoe de meeste AI-modellen hebben leren zien: ze zijn geweldig in het spotten van dingen en het beantwoorden van directe vragen daarover.

Maar het echte leven is niet slechts een reeks eenvoudige vragen. Het is een rommelige bundel instructies met verborgen regels. Stel je voor dat je een mens vertelt: "Schrijf een slogan voor deze poster." Je hebt misschien ook een geheime lijst met vereisten: "Het moet het merk vermelden", "Het mag niet liegen over het product" en "Het moet opwindend klinken". Als de slogan opwindend is maar liegt over het product, weet een mens dat het een mislukking is. Maar voor een AI is die "bundel" aan regels vaak te verwarrend. Ze hebben de neiging om zich op de hoofdvraag te concentreren en de kleine lettertjes te negeren. Dit artikel pakt dat specifieke probleem aan: het leren van AI-modellen om niet alleen een vraag te beantwoorden, maar om te handelen als een strikte redacteur die elke regel controleert voordat hij een definitief oordeel velt.

Het Papier: PRISM

De onderzoekers achter deze studie, werkend met modellen van ByteDance en Peking University, merkten op dat huidige AI-modellen lijken op studenten die alleen studeren voor het eindexamen, maar de huiswerkinstructies negeren. Ze zijn geweldig in het beantwoorden van "Wat is dit?", maar slecht in het volgen van complexe, meerstaps-instructies waarbij sommige regels belangrijker zijn dan andere. Om dit op te lossen, creëerden ze een nieuwe trainingsmethode genaamd PRISM (Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis).

Beschouw PRISM als een "Regelmakerij". In plaats van de AI alleen een afbeelding te tonen en een vraag te stellen, bouwden de onderzoekers een systeem dat een gestructureerde "rubriek" genereert — een checklist van regels — voor elke afbeelding. Ze vroegen de AI niet alleen om de regels te raden; ze leerden het om te handelen als een executor (uitvoerder). Het model moet een afbeelding bekijken, een lijst met regels lezen (zoals "Controleer of de schoenen rood zijn" of "Zorg dat de tekst beleefd is") en vervolgens elke regel afzonderlijk verifiëren voordat het een definitief "Pass" of "Fail" oordeel geeft.

Het team gebruikte een slim vierstaps proces om deze trainingsdata te creëren. Eerst bedachten ze een "persona" voor de AI, zoals een "Brand Poster Reviewer" of een "Math Test Checker". Vervolgens begeleidden ze de AI om een lijst met regels te genereren op basis van die persona. Ze filterden de slechte regels eruit (de verwarrende of tegenstrijdige regels) en behielden alleen de hoogwaardige regels. Ten slotte leerden ze het model hoe het een rapport moet schrijven dat elke regel één voor één controleert en die controles vervolgens combineert in een definitieve beslissing.

De resultaten suggereren dat deze methode ongelooflijk goed werkt. Toen ze een model genaamd Qwen3-VL-4B trainden met slechts 10.000 van deze gesynthetiseerde voorbeelden, sprong het vermogen om deze complexe regels te volgen van een lage 9,5% naar een veel sterkere 30,1%. Dit is een grote prestatie omdat, zelfs vóór deze training, de sterkste AI-modellen ter wereld moeite hadden om die grens van 30% te passeren. Het artikel suggereert dat het probleem niet was dat de AI niet "slim" genoeg was; het was dat de AI niet de specifieke vaardigheid had geleerd om een lijst met geprioriteerde regels te controleren.

Waarom het ertoe doet

De meest interessante bevinding is dat deze training de AI niet "dommer" maakte bij andere taken. Meestal, wanneer je een model een nieuwe, specifieke truc leert, kan het zijn vermogen om oude trucs uit te voeren verliezen. Maar hier werd het model beter in het volgen van regels zonder het algemene begrip van afbeeldingen en tekst te verliezen.

De auteurs testten ook of ze het model tijdens de testfase simpelweg konden "sturen" door het een paar voorbeelden te geven (zoals een referentieblad). Ze kwamen tot de conclusie dat het geven van voorbeelden weliswaar een beetje hielp, maar dat het bij lange na niet zo goed was als het daadwerkelijk trainen van het model om het proces te internaliseren. Het is het verschil tussen een student een referentieblad geven tijdens een toets versus het aanleren van hoe ze moeten studeren zodat ze de stof daadwerkelijk begrijpen.

Kortom, het artikel suggereert dat om AI echt nuttig te maken in de echte wereld — waar instructies zelden eenvoudig zijn — we moeten stoppen met ze te behandelen als vraag-antwoordmachines en ze moeten gaan trainen als zorgvuldige redacteuren die respect hebben voor de kleine lettertjes.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →