← Nieuwste papers
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV is een unificerend groot multimodaal model dat de redeneerefficiëntie en prestaties verbetert door volledige beeldgeneratie te vervangen door een compact visueel update-paradigma geleid door een temporele gelijkenisrouter, ondersteund door een nieuwe grootschalige geïnterleefde redeneerdataset genaamd StructCoT.

Oorspronkelijke auteurs: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Gepubliceerd 2026-07-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een complex spelletje "Simon Says" speelt met een robotvriend, maar in plaats van alleen maar te luisteren, moet je elke stap van het spel op een whiteboard tekenen om aan je vriend te laten zien wat er gebeurt.

De Oude Manier: De Overdreven Kunstenaar
Momenteel werken de meeste geavanceerde AI-modellen die proberen problemen met plaatjes op te lossen (zoals het oplossen van een doolhof of een wiskundige puzzel) als een zeer grondige, maar ietwat inefficiënte kunstenaar. Stel dat het spel begint met een plaatje van een tafel met een kopje erop.

  • Stap 1: De AI tekent de hele tafel met het kopje.
  • Stap 2: De spelregel luidt: "Beweeg het kopje naar links." De AI wist echter het hele whiteboard en tekent de hele tafel opnieuw, inclusief het kopje, de tafelpoten, de achtergrond en de schaduwen, alleen maar om aan te tonen dat het kopje een centimeter naar links is verschoven.
  • Stap 3: "Draai het kopje." De AI wist alles en tekent de hele tafel opnieuw.

De tekst noemt dit "full-image generation" (volledige beeldgeneratie). De auteurs stellen dat dit een enorme verspilling van energie en ruimte is. Het is alsof je het hele woordenboek elke keer opnieuw schrijft wanneer je slechts één woord in een zin wilt veranderen. De AI besteedt de meeste tijd aan het opnieuw tekenen van dingen die helemaal niet zijn veranderd, wat het traag maakt en soms ervoor zorgt dat het details verpest (zoals per ongeluk de kleur van het kopje veranderen omdat het vergeten is hoe het er eerst uitzag).

De Nieuwe Manier: DeltaV, de "Sticker"-kunstenaar
De paper introduceert een nieuw model genaamd DeltaV. In plaats van de hele scène opnieuw te tekenen, werkt DeltaV als een slimme sticker-kunstenaar.

  • Stap 1: Het tekent de tafel met het kopje (de "Base State" of basisstaat).
  • Stap 2: Wanneer het kopje moet bewegen, tekent DeltaV niet de tafel opnieuw. Het tekent gewoon een klein "sticker" die het kopje laat zien terwijl het naar links beweegt, en plakt deze over de oude plek. Het negeert de tafelpoten en de achtergrond omdat deze niet veranderd zijn.
  • Stap 3: Wanneer het kopje draait, voegt het gewoon een kleine "rotatie-sticker" toe.

Deze aanpak wordt visual updates (visuele updates) genoemd. De paper suggereert dat door alleen de veranderingen (de "Delta") te tekenen, de AI een enorme hoeveelheid werk bespaart. In hun tests verminderde deze methode het aantal nieuwe "drawing tokens" (de digitale inkt die gebruikt wordt om het beeld te creëren) met gemiddeld 55,6%, zonder dat de plaatjes er slechter van werden.

De Slimme "Stop"-knop: De TSIM Router
Je vraagt je misschien af: "Wat als de verandering enorm is? Wat als de hele scène explodeert?"
DeltaV heeft een ingebouwde slimme manager genaamd de TSIM Router. Denk aan dit als een supervisor die kijkt hoe verschillend de nieuwe scène is van de oude.

  • Als de verandering klein is (zoals het bewegen van een kopje), zegt de supervisor: "Gebruik gewoon een paar stickers."
  • Als de verandering massaal is (zoals een kamer die volledig verandert), zegt de supervisor: "Oké, gebruik meer stickers om er zeker van te zijn dat we het goed doen."

De paper mat dit door te controleren hoe goed de AI een afbeelding kon reconstrueren. Ze ontdekten dat als ze na een bepaald punt tokens bleven toevoegen, de afbeelding niet veel beter werd. Dus de TSIM Router stopt met het toevoegen van tokens zodra de "extra inspanning" niet meer loont. Dit zorgt ervoor dat de AI geen tijd verspilt aan eenvoudige stappen, maar ook niet tekortschiet bij complexe stappen.

De Trainingsgrond: StructCoT
Om DeltaV te leren hoe dit moet, konden de onderzoekers niet simpelweg oude puzzelboeken gebruiken. Ze bouwden een enorme nieuwe trainingsset genaamd StructCoT.

  • Het bevat 1,05 miljoen monsters.
  • Het dekt 44 verschillende soorten taken, variërend van logische puzzels en wiskundige problemen tot robotplanning en wetenschappelijke vragen.
  • De paper betoogt dat eerdere datasets te klein waren of zich alleen richtten op specifieke zaken zoals doolhoven, maar StructCoT geeft de AI een veel bredere opleiding over hoe visuele staten in de loop van de tijd veranderen.

De Resultaten: Heeft het Gewerkt?
De paper rapporteert dat wanneer ze DeltaV testten:

  • Het multimodale redeneerproblemen 3,3% beter oploste dan de oude "alles opnieuw tekenen"-methode.
  • Ondanks dat DeltaV een kleiner model is (2B parameters), versloeg het veel grotere open-source modellen met gemiddeld 8,4% op deze redeneertaken.
  • Het presteerde ook beter dan een vergelijkbaar model genaamd Qwen3-VL-2B met 5,9% op externe benchmarks.

Wat de Paper Uitsluit
De auteurs zijn zeer duidelijk over wat niet werkt. Ze argumenteren expliciet tegen het idee dat we bij elke stap van het redeneren een volledige, hoogresolutie afbeelding moeten genereren. Ze suggereren dat het proberen te doen hiervan "visual-token redundancy" (het verspillen van digitale inkt) creëert en de capaciteit van de AI om te redeneren zelfs belemmert, omdat het wordt afgeleid door het opnieuw tekenen van dingen die er niet toe doen. Ze merken ook op dat hoewel deze methode geweldig is voor redeneren, het misschien niet de beste is voor taken die extreem fijnmazige details vereisen (zoals het spotten van een minuscuul stofje), waarbij een volledige afbeelding nog steeds nodig kan zijn.

De Kern van het Verhaal
De paper suggereert dat de toekomst van AI-redeneren niet gaat over het steeds opnieuw tekenen van de hele wereld. In plaats daarvan gaat het over denken in termen van "wat is er veranderd?". Door zich alleen te concentreren op de updates, wordt DeltaV sneller, efficiënter en verrassend beter in het oplossen van complexe puzzels dan zijn zwaardere neefjes die de volledige afbeelding opnieuw tekenen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →