← Nieuwste papers
💬 NLP

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

Dit artikel stelt een trainingsvrij framework voor dat het ruimtelijk redeneren in Multimodale Grote Taalmodellen verbetert door een Ruimtelijke Bewijsgrafiek te construeren om de getrouwheid van redeneerketens ten opzichte van visueel bewijs te verifiëren, tegenstrijdigheden te identificeren en het model te begeleiden bij het corrigeren van fouten, waardoor de nauwkeurigheid over diverse benchmarks aanzienlijk wordt verbeterd.

Oorspronkelijke auteurs: Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

Gepubliceerd 2026-08-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een computer voor die naar een foto kan kijken en vragen erover kan beantwoorden, net zoals een menselijke waarnemer dat zou doen. Deze systemen, bekend als multimodale grote taalmodellen, zijn bijzonder vaardig geworden in het beschrijven van scènes, het identificeren van objecten en zelfs het oplossen van puzzels. Echter, wanneer ze de opdracht krijgen om over de ruimte te redeneren — bepalen of één object links van een ander staat, of dat een kopje achter een boek staat — maken ze vaak fouten. Het probleem is niet altijd dat de computer de afbeelding niet kan zien; het is eerder dat het interne denkproces van de computer, de stapsgewijze logica die hij gebruikt om tot een antwoord te komen, kan afdwalen van wat er daadwerkelijk zichtbaar is. Als het systeem een kleine fout maakt in de vroege fase van zijn redenering, zoals het verkeerd identificeren van de positie van een enkel item, kan die fout een sneeuwbaleffect veroorzaken. De computer kan deze onjuiste observatie behandelen als een feit, deze gebruiken om verdere conclusies op te bouwen, en uiteindelijk uitkomen bij een antwoord dat met veel zelfvertrouwen foutief is, ook al laat de afbeelding duidelijk het tegendeel zien.

Onderzoekers hebben lang geprobeerd dit op te lossen door deze modellen meer over de ruimte te leren of door extra lagen data toe te voegen om hen beter te laten zien. Maar een nieuwe studie suggereert dat de meest effectieve oplossing niet ligt in het aanleren van nieuwe feiten aan het model, maar in het controleren van het werk terwijl het gebeurt. Het team achter dit onderzoek, onder leiding van Yang Yang en collega's, heeft een methode ontwikkeld om de redenering van de computer in realtime te verifiëren tegen de afbeelding, zonder dat hiervoor het model opnieuw getraind hoeft te worden of de onderliggende code aangepast moet worden. Ze ontdekten dat wanneer de redeneerketen van een model getrouw is aan het visuele bewijs, de antwoorden aanzienlijk nauwkeuriger zijn. Sterker nog, op een standaardtest van vragen uit de echte wereld, hadden modellen die zich aan de visuele feiten hielden in ongeveer 51 procent van de gevallen het juiste antwoord, terwijl die modellen die afdwaalden in ononderbouwde gissingen slechts in ongeveer 34 procent van de gevallen slaagden.

Om het probleem van de afdwalende logica op te lossen, creëerden de onderzoekers een raamwerk dat fungeert als een strikte redacteur voor de gedachten van de computer. Wanneer het model een redeneerketen genereert, breekt het systeem die tekst af in kleine, atomaire beweringen over de afbeelding, zoals "de appel is aanwezig" of "de kom staat rechts van het bord". Het bouwt vervolgens een gestructureerde kaart, die zij een 'Spatial Evidence Graph' noemen, die elke van deze beweringen koppelt aan het specifieken deel van de afbeelding waar het naar verwijst. Deze kaart stelt het systeem in staat om elke bewering terug te leiden naar de bron, waardoor wordt gewaarborgd dat geen enkel stukje redenering in een vacuüm zweeft.

De volgende stap is de meest cruciale: het controleren van de betrouwbaarheid van het visuele bewijs dat de bewering ondersteunt. Het systeem vertrouwt zijn eigen detectietools niet blindelings. In plaats daarvan beoordeelt het of het object duidelijk zichtbaar is, of de locatie ondubbelzinnig is en of metingen zoals diepte stabiel zijn. Als het systeem detecteert dat een object gedeeltelijk verborgen is of de afbeelding te wazig is om zeker te zijn, markeert het dat stukje bewijs als onzeker in plaats van een beslissing af te dwingen. Dit voorkomt dat de computer een zelfverzekerde correctie maakt op basis van wankele gegevens. Het systeem scant vervolgens de redeneerketen vanaf het begin om de eerste plek te vinden waar een bewering in strijd is met het betrouwbare visuele bewijs.

Zodra deze vroegste fout is gelokaliseerd, stuurt het systeem het model aan om de redenering te herschrijven vanaf die specifieke fout. Het zegt tegen het model: "Je zei dat de appel rechts van de kom stond, maar het visuele bewijs laat zien dat de appel eigenlijk links staat. Corrigeer deze stap en update je conclusie." Door de kernoorzaak van de fout te verhelpen en de daaropvolgende stappen te regenereren, voorkomt het model de cascade van fouten die tot een foutief antwoord zouden hebben geleid. Dit proces is volledig vrij van training, wat betekent dat het werkt met bestaande modellen zonder dat zij nieuwe vaardigheden hoeven te leren of toegang nodig hebben tot nieuwe datasets.

De resultaten van deze aanpak werden getest over vijftien verschillende combinaties van modellen en datasets, waarbij een breed scala aan visuele redeneertaken werd behandeld. De methode verbeterde de gemiddelde nauwkeurigheid van de modellen tot bijna 69 procent, waarmee het de eerdere state-of-the-art technieken met een aanzienlijke marge overtrof. Belangrijker nog, de studie toonde aan dat de modellen veel consistenter werden in hun redenering. Het deel van hun tussenstappen dat getrouw was aan de afbeelding nam drastisch toe, wat bewees dat de methode erin slaagde om de verspreiding van fouten te stoppen. De onderzoekers ontdekten ook dat deze procesgerichte correctie goed samenwerkt met andere methoden die proberen het ruimtelijk bewustzijn te verbeteren, wat suggereert dat het verifiëren van de logica even belangrijk is als het bieden van betere instrumenten om te zien.

Hoewel het systeem zeer effectief is, erkennen de onderzoekers de beperkingen ervan. Het kan alleen fouten corrigeren die expliciet zijn uitgeschreven in de redeneringsstappen van het model. Als het model een fout maakt die verborgen of impliciet blijft binnen zijn interne verwerking, kan het systeem deze niet vinden om te herstellen. Bovendien werden de huidige tests uitgevoerd op statische afbeeldingen, dus het blijft te zien hoe goed deze aanpak omgaat met bewegende video of complexe scenario's vanuit meerdere perspectieven. Desalniettemin biedt de studie een duidelijke weg vooruit: door het redeneerproces te behandelen als iets dat in realtime geaudit en gecorrigeerd kan worden, kunnen we deze krachtige kunstmatige intelligentiesystemen betrouwbaarder en vertrouwwaardiger maken, zodat hun antwoorden geworteld zijn in de realiteit van wat ze zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →