← Nieuwste papers
🤖 AI

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

Het artikel stelt ST-Veto voor, een methode die geen training vereist en Diffusion Multimodale Grote Taalmodellen verbetert door gebruik te maken van tweede-orde Taylor-voorspelling en visuele gronding om instabiele of zwak gegronde tokens te vetoën tijdens het orde-agnostische generatieproces, waardoor de redeneernauwkeurigheid aanzienlijk wordt verbeterd zonder extra training of kosten.

Oorspronkelijke auteurs: Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

Gepubliceerd 2026-07-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen woorden lezen of naar plaatjes kijken, maar ook echt kunnen begrijpen hoe ze samenkomen om puzzels op te lossen. Dit is de spannende grens van "Vision Language Models", een type kunstmatige intelligentie dat werkt als een superintelligente detective die combineert wat het ziet met wat het weet. Lange tijd werkten deze detectives zoals iemand die een verhaal schrijft, woord voor woord, van begin tot eind. Deze methode, genaamd "autoregressieve" generatie, is geweldig voor het stapsgewijs denken, maar heeft een groot nadeel: als de detective vroeg in het proces een fout maakt, kan hij niet gemakkelijk teruggaan om het te herstellen zonder het hele verhaal opnieuw te schrijven. Ze blijven simpelweg meer fouten stapelen bovenop de eerste fout.

Onlangs ontdekten wetenschappers een nieuwe manier waarop deze AI-detectives kunnen werken, genaamd "diffusie". In plaats van een verhaal vanaf nul te schrijven, moet je je voorstellen dat de AI begint met een pagina vol lege ruimtes (of "masks") en deze langzaam invult, waarbij de gissingen steeds verfijnd worden. Het is als kijken naar een wazige foto die langzaam scherp wordt. Deze nieuwe methode is sneller en stelt de AI in staat om naar het hele plaatje tegelijk te kijken, waarbij fouten onderweg worden gecorrigeerd. Maar hier zit de adder onder het gras: hoewel deze nieuwe methode geweldig is qua snelheid, raakt de AI soms in de war over wat er als eerste ingevuld moet worden. De AI kan een woord kiezen dat wel goed klinkt, maar niet echt bij de afbeelding past, of het kan blijven hangen op een gok die elke seconde van gedachten verandert. De grote vraag was: hoe helpen we dit nieuwe soort AI om helder na te denken en trouw te blijven aan de waarheid, zonder het te vertragen of het nieuwe trucjes te leren?

Maak kennis met ST-Veto, een slimme nieuwe strategie voorgesteld door onderzoekers om deze "diffusie" AI-modellen beter te laten denken. Denk aan het proces van de AI als een groep vrienden die probeen te beslissen wat ze gaan eten. Bij de oude methode kozen ze een gerecht, legden dat vast, en gingen naar het volgende. Bij de nieuwe diffusie-methode roepen ze allemaal tegelijkertijd ideeën, en dan komen ze langzaam tot overeen over de beste opties. Het probleem is dat een vriend soms "Pizza!" roept omdat dat leuk klinkt, maar een seconde later van gedachten verandert naar "Salade", of misschien houdt hij gewoon van het woord "Pizza", terwijl de afbeelding op de menukaart duidelijk een burger is.

ST-Veto werkt als een wijze scheidsrechter die de hele groep in de gaten houdt. Het gebruikt twee speciale instrumenten om te beslissen welke ideeën veilig zijn om te behouden en welke weggegooid moeten worden. Ten eerste controleert het op stabiliteit. Het vraagt: "Is dit idee net opgedoken, of is het consistent geweest?" Als een woord steeds van gedachten verandert (zoals een vriend die "Pizza" zegt, dan "Taco's", en dan weer "Pizza" zegt), gebruikt de scheidsrechter een wiskundige truc genaamd "Taylor-voorspelling" om die instabiliteit op te sporen en zegt: "Nee, dat is te wankel, laten we een andere optie proberen." Ten tweede controleert het op visuele gronding. Het kijkt naar de afbeelding en vraagt: "Komt dit woord echt overeen met wat we zien?" Als de AI "vork" wil zeggen maar de afbeelding toont duidelijk een "mes", dan gebruikt de scheidsrechter "aandacht" (attention) om te zien dat de AI niet echt naar het mes kijkt en legt een veto uit over het woord "vork".

Het artikel laat zien dat door deze "Veto-and-Swap"-methode te gebruiken, de AI wankele of mismatched gissingen kan vervangen door veiligere, nauwkeurigere opties zonder dat er extra training nodig is of het proces wordt vertraagd. Wanneer de onderzoekers dit testten op moeilijke redeneerpuzzels die zowel afbeeldingen als tekst bevatten, hielp ST-Veto de AI om tot wel 9% vaker correct te zijn dan daarvoor. Het is alsof je de AI een bril geeft die helpt te zien welke ideeën solide zijn en welke slechts dagdromen zijn, wat leidt tot slimmere antwoorden, of het nu gaat om het oplossen van wetenschappelijke problemen of het beschrijven van complexe scènes. Het beste eraan? Het is een gratis upgrade die direct werkt, waardoor deze krachtige nieuwe AI-modellen veel betrouwbaarder worden zonder dat hun fundamentele structuur veranderd hoeft te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →