← Nieuwste papers
💻 computer science

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL vestigt een nieuwe state-of-the-art in visuele scanpadvoorspelling door de taak te herformuleren als autoregressieve token-generatie binnen een Vision-Language Model, wat flexibele conditionering op kijkeridentiteiten en taken mogelijk maakt, terwijl het significante prestatiewinsten realiseert en gecontroleerde in-silico gedragssimulaties faciliteert.

Oorspronkelijke auteurs: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te voorspellen waar de ogen van een persoon als volgende naar zullen kijken wanneer ze een foto zien. Lange tijd bouwden wetenschappers speciale, rigide machines die hiervoor bedoeld waren. Deze machines hadden vaste regels (zoals "mensen kijken altijd eerst naar het midden") en konden niet gemakkelijk nieuwe trucjes leren, zoals "dit persoon is een arts die op zoek is naar een diagnose" of "dit persoon is een kind dat op zoek is naar een speeltje."

Het artikel introduceert een nieuw model genaamd DeepGaze3.5-VL dat de boel verandert. In plaats van een speciale machine te bouwen, behandelen de auteurs oogbewegingen als het schrijven van een verhaal.

Hier is de uitleg over hoe het werkt en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. Het kernidee: Oogbewegingen als een "tekst"-verhaal

Beschouw het oogpad van een persoon (een scanpath) als een zin.

  • De oude manier: Je bouwde een aangepaste robot om de zin te tekenen, maar als je de stijl wilde veranderen (bijvoorbeeld van het handschrift van een kind naar dat van een volwassene), moest je de robot opnieuw bouwen.
  • De nieuwe manier: De auteurs realiseerden zich dat oogbewegingen gewoon een sequentie van coördinaten zijn (zoals "kijk hier, kijk dan daar"). Ze hebben een gigantisch, vooraf getraind AI-model (een Large Vision-Language Model) geleerd om deze coördinaten te behandelen als woorden in een zin.

Door oogposities om te zetten in "tokens" (zoals letters in een woord), kan de AI zijn enorme brein — dat al getraind is om afbeeldingen en taal te begrijpen — gebruiken om het volgende "woord" (de volgende plek waar het oog naar zal kijken) te voorspellen.

2. De "magie" van de prompt

Omdat dit model in taal denkt, kun je het instructies geven net zoals je een chatbot een vraag zou stellen.

  • De analogie: Stel je een gids voor. Als je de gids vertelt: "Laat me het museum zien als een toerist," laat hij je de beroemde standbeelden zien. Als je zegt: "Laats me het zien als een kunsthistoricus," wijst hij op de penseelstreken.
  • Het resultaat: De onderzoekers lieten zien dat door simpelweg de tekstuele prompt te veranderen (bijvoorbeeld "Voorspel de blik van iemand die op zoek is naar een kat" versus "Voorspel de blik van iemand die gewoon rondkijkt"), het model zich onmiddellijk aanpast. Het heeft geen nieuwe hardware of complexe codewijzigingen nodig; het leest gewoon de instructie.

3. Waarom het beter is: Het debat "Slim" versus "Groot"

De onderzoekers vroegen zich af: Is dit model goed omdat het simpelweg enorm groot is, of omdat het de scène echt begrijpt?

  • De test: Ze vergeleken hun model met andere topmodellen die exact dezelfde "ogen" (vision encoder) gebruikten, maar een andere "hersenen".
  • De bevinding: De "hersenen" (het taalgedeelte van de AI) zijn belangrijker dan alleen het hebben van grotere "ogen". Een model dat de betekenis van de afbeelding en het verhaal van de oogbeweging begrijpt, presteert veel beter dan een model dat alleen pixels ziet.
  • De score: Op een standaardtest (MIT1003) verbeterde hun model de voorspellingsnauwkeurigheid met 46% ten opzichte van de vorige beste methode.

4. Het "Tijdmachine"-experiment (Interventies)

Een van de coolste dingen die het artikel demonstreert, is de mogelijkheid om "wat als"-scenario's uit te voeren binnen de computer, zonder dat daar echte mensen voor nodig zijn.

  • De analogie: Stel je een videogame voor waarin je de tijd kunt pauzeren, één variabele kunt veranderen (zoals "de speler was moe") en onmiddellijk kunt zien hoe het spel dan anders verloopt.
  • Het experiment: De onderzoekers namen een specifiek moment waarop een mens een kort tijdje naar een plaatje keek (50 ms) en vroegen het model: "Wat als ze langer hadden gekeken (600 ms)?"
  • Het resultaat: Het model voorspelde dat korte blikken vaak snel en instinctief zijn (zoals een reflex), terwijl lange blikken leiden tot meer dwalend, bedachtzaam verkennen. Het model ontcijferde deze complexe menselijke gedragingen puur door de data te lezen, en fungeerde zo als een digitale zandbak voor het menselijk zicht.

5. De "Wie"-factor (Personalisatie)

Het model kan ook verteld worden wie er kijkt.

  • De analogie: Als je weet dat je vriend van honden houdt, en je laat hem een foto van een park zien, weet je dat hij eerst naar de hond zal kijken. Als je dezelfde foto aan iemand laat zien die van vogels houdt, zal diegene naar de boom kijken.
  • Het resultaat: Door het model een specifieke "Subject ID" te voeden (zoals "Subject A3F8"), leerde het de unieke gewoonten van die specifieke persoon te voorspellen. Het had geen nieuwe architectuur nodig; het leerde simpelweg dat verschillende "personages" verschillende "verhaallijnen" hebben.

Samenvatting

DeepGaze3.5-VL is een nieuwe manier om te voorspellen waar mensen naar kijken. In plaats van starre, gespecialiseerde hulpmiddelen te bouwen, hebben de auteurs oogtracking veranderd in een taalprobleem. Door dit te doen, hebben ze een model gecreëerd dat:

  1. Slimmer is: Het begrijpt de context en de betekenis van de scène.
  2. Flexibel is: Je kunt het gedrag veranderen door simpelweg een nieuwe instructie te typen.
  3. Nauwkeuriger is: Het verslaat alle voorgaande records met een ruime marge.
  4. Experimenteel is: Het stelt wetenschappers in staat om "wat als"-scenario's over het menselijk zicht direct te simuleren, zonder dat er nieuwe fysieke experimenten uitgevoerd hoeven te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →