← Nieuwste papers
💻 computer science

Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos

Deze paper introduceert een model-onafhankelijke methode voor het anticiperen op mens-objectinteracties in egocentrische video's met behulp van Vision Large Language Models, waarbij Set-of-Mark prompting, oogbewegingstrajecten en een nieuwe inverse exponentiële steekproefstrategie worden gebruikt om de prestaties te verbeteren.

Oorspronkelijke auteurs: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

Gepubliceerd 2026-04-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een slimme assistent hebt die precies weet wat je gaat doen, nog voordat je het zelf doet. Of dat nu een pan op het vuur zetten is, of een gereedschap grijpen op de werkplek. Dit artikel beschrijft hoe onderzoekers zo'n assistent hebben gebouwd die kijkt vanuit jouw ogen (zoals een GoPro op je hoofd) en je intenties kan voorspellen.

Hier is de uitleg in gewoon Nederlands, met een paar leuke vergelijkingen:

De Missie: De "Kristallen Bol" voor je Dagelijkse Leven

Stel je voor dat je in de keuken staat. Je wilt een ei bakken. Een slimme assistent zou je moeten waarschuwen: "Hé, wacht even! Je pakt de hete pan zonder ovenwant!" voordat je je hand verbrandt.

Om dit te kunnen, moet de computer niet alleen kijken wat je nu doet, maar ook begrijpen wat je gaat doen. Dat is lastig. Mensen doen dingen niet in een rechte lijn; we kijken eerst, twijfelen, en grijpen dan.

De Helden: De "Superlezer" (VLLM)

De onderzoekers gebruiken een nieuw type kunstmatige intelligentie, een VLLM (Vision Large Language Model).

  • De Analogie: Denk aan een VLLM als een superintelligente detective die zowel foto's als teksten kan lezen. Hij kan een filmpje bekijken en er een verhaal over vertellen. Maar deze detective heeft een probleem: hij is soms wat "blind" voor de details in een drukke scène en hij mist de context van wat er net voorafgaand is gebeurd.

De Oplossing: Drie Slimme Trucs

Om deze detective tot een meester te maken, hebben de onderzoekers drie nieuwe hulpmiddelen toegevoegd:

1. De "Stippellijn" (Set-of-Mark)

Stel je voor dat de detective een foto van je keuken krijgt. Er staan honderd dingen op: een kom, een mes, een doekje, een pan. Waar moet hij naar kijken?

  • De Truc: Ze plakken onzichtbare labels (zoals post-its) op de objecten in het beeld. Dit heet Set-of-Mark.
  • De Vergelijking: Het is alsof je de detective een vergrootglas geeft dat elk object in de kamer een nummer of een kleur geeft. Plotseling ziet hij niet meer een rommelige foto, maar een overzichtelijke lijst met "Dit is de pan, dit is het mes". Hierdoor kan hij veel sneller zien welk object belangrijk is.

2. De "Blikspoor" (Gaze Trajectory)

Mensen kijken ergens naar voordat ze iets aanraken. Als je naar een mes kijkt, ga je waarschijnlijk dat mes pakken.

  • De Truc: De computer tekent een lijn op het scherm die laat zien waar je ogen de laatste seconden naar hebben gekeken. Rode cirkels zijn waar je nu kijkt, blauwe cirkels waar je eerder naar keek.
  • De Vergelijking: Stel je voor dat je een spoor van bloemenblaadjes achterlaat terwijl je loopt. De detective volgt dit spoor. Als hij ziet dat je spoor naar de pan loopt, weet hij: "Aha! De pan is het doelwit!" Zonder dit spoor zou hij misschien denken dat je naar het mes grijpt, omdat dat ook in beeld is.

3. De "Tijdscheer" (Inverse Exponential Sampling)

Een filmpje duurt vaak lang, maar de meeste actie gebeurt vlak voordat je iets pakt. Als je een heel filmpje van 10 seconden laat zien, zit er veel "dode tijd" in (bijvoorbeeld: je loopt naar de koelkast).

  • De Truc: Ze kiezen niet willekeurig frames uit, maar ze "scheuren" de tijd op een slimme manier. Ze nemen heel veel frames uit de laatste seconde voor de actie, en minder frames uit het begin.
  • De Vergelijking: Stel je voor dat je een boek wilt samenvatten. In plaats van elke pagina te lezen, lees je de laatste hoofdstukken heel zorgvuldig en de eerste hoofdstukken maar snel. Zo focus je op het moment dat het echt gebeurt. Dit helpt de computer om de "spanning" net voor de actie te voelen.

Het Resultaat: Een Winnaar

De onderzoekers hebben dit getest op een dataset genaamd HD-EPIC (een enorme verzameling van mensen die koken en werken).

  • De Vergelijking: Het is alsof ze een wedstrijd hebben georganiseerd tussen verschillende detectives. De oude detectives (de bestaande systemen) haalden ongeveer 21% juiste voorspellingen.
  • De Overwinning: Met hun nieuwe combinatie van "labels", "bliksporen" en "tijdscheer", haalde hun detective 27,5%. Dat klinkt misschien niet als een enorm verschil, maar in de wereld van slimme computers is dat een gigantische sprong vooruit. Het betekent dat ze veel minder fouten maken en veel betrouwbaarder zijn.

Waarom is dit belangrijk?

Dit systeem is "model-agnostisch". Dat betekent dat het werkt met verschillende soorten slimme computers, niet alleen één specifiek type.

  • Toekomst: Stel je voor dat dit in je bril zit terwijl je werkt in een fabriek. Hij ziet dat je naar een gevaarlijke machine kijkt en waarschuwt je: "Pas op, je gaat daar niet aan!" Of in de keuken: "Je pakt de hete pan, pak een handdoek!"

Kortom: Door de computer te leren kijken naar wat je kijkt (je ogen) en wat je aandacht trekt (de labels), en door de tijd slim te comprimeren, kunnen we machines maken die echt begrijpen wat we van plan zijn, voordat we het doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →