← Nieuwste papers
💻 computer science

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

Dit artikel introduceert UCS-Bench, een grootschalige dataset voor het evalueren van gebruikerscentrische continue ruimtelijke redenering in egocentrische video's, en stelt DirectMe voor, een framework dat incrementeel gestructureerd ruimtelijk geheugen opbouwt om de langetermijn ruimtelijke redeneercapaciteiten van multimodale LLM's aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Het "Vergeetachtige Gids"-probleem

Stel je voor dat je een camera op je hoofd draagt (zoals een GoPro) terwijl je door een enorm, complex huis loopt. Je loopt de keuken in, pakt een beker, draait je om, loopt de woonkamer in en loopt dan weer terug naar de keuken.

Als je een standaard AI-assistent zou vragen: "Waar is de beker ten opzien van mij op dit moment?", zou deze in de war kunnen raken. De AI kijkt misschien naar het huidige videobeeld, ziet de beker op tafel staan en zegt: "Hij staat voor je." Maar wat als je 10 seconden geleden hebt omgedraaid? Nu staat de beker achter je.

Huidige AI-modellen zijn als gidsen die zich alleen herinneren wat ze de komende 5 seconden zien. Als je je rug naar een oriëntatiepunt keert, vergeten ze dat het bestaat of verliezen ze het spoor van waar het zich bevindt ten opzien van jouw nieuwe positie. Ze hebben moeite om te zeggen: "De koelkast staat achter je aan je linkerzijde," omdat ze de kamer niet in hun hoofd kunnen mentaal roteren terwijl jij beweegt.

De Oplossing: UCS-Bench en DirectMe

De auteurs van dit artikel hebben twee dingen bedacht om dit op te lossen: een nieuwe test (UCS-Bench) en een nieuwe methode (DirectMe).

1. De Test: UCS-Bench (De "Geheugengym")

De onderzoekers hebben een enorme sportschool gebouwd voor AI om haar ruimtelijk geheugen te trainen.

  • De Workout: Ze hebben meer dan 170 uur aan beelden vanuit het eerste persoonsperspectief verzameld (zoals iemand die door het dagelijks leven loopt).
  • De Vragen: Ze hebben meer dan 8.000 vragen geschreven die veranderen op basis van tijd en beweging.
    • Voorbeeld: "Waar is de verkoopautomaat?"
    • Tijd 1: Je kijkt ernaar. Antwoord: "Voor je."
    • Tijd 2: Je bent omgedraaid. Antwoord: "Achter je aan je linkerzijde."
  • Het Doel: Dit test of een AI een mentale kaart van de wereld kan bijhouden die wordt bijgewerkt terwijl jij beweegt, in plaats van alleen te beschrijven wat er momenteel op het scherm te zien is.

2. De Methode: DirectMe (De "Mentale Kaartbouwer")

De auteurs stelden een nieuwe manier voor waarop AI deze video's kan verwerken, genaamd DirectMe.

De Analogie: Het Schetsboek versus de Snapshot

  • Oude AI (De Snapshot): Stel je voor dat je elke seconde een foto maakt en probeert een vraag te beantwoorden door alleen naar de foto te kijken die je op dit moment vasthoudt. Als het object niet op de foto staat, weet je niet waar het is.
  • DirectMe (Het Schetsboek): Stel je een kunstenaar voor die met je mee wandelt. In plaats van alleen maar foto's te maken, tekent hij constant een 3D-kaart in een schetsboek.
    • Terwijl je loopt, tekent de kunstenaar de objecten (koelkast, stoel, beker) en markeert de exacte locatie ervan in de kamer.
    • Cruciaal is dat de kunstenaar ook markeert waar jij bent en welke kant je op kijkt.
    • Wanneer je vraagt: "Waar is de beker?", kijkt de kunstenaar niet naar het huidige beeld; hij kijkt in het schetsboek. Hij ziet dat de beker 5 meter verderop staat, en omdat jij de andere kant op kijkt, zegt hij tegen je: "Hij is achter je."

Hoe DirectMe werkt (Vereenvoudigd):

  1. Kijken en Meten: Het bekijkt de video en gebruikt wiskunde om te berekenen hoe diep dingen zijn en hoe de camera (jij) beweegt.
  2. De Kaart Bouwen: Het creëert een "Scene Graph". Zie dit als een digitaal web dat objecten met elkaar verbindt, en met jou. Het onthoudt dat "De beker op de tafel staat" en "De tafel in de keuken staat".
  3. Real-time Updaten: Terwijl je loopt, wordt de kaart bijgewerkt. Het weet dat je naar links bent gedraaid, dus roteert de mentale kaart dienovereen.
  4. De Vraag Beantwoorden: Wanneer je een vraag stelt, haalt de AI het relevante deel van de kaart op en vertaalt dit naar jouw huidige perspectief (bijv. "Links," "Rechts," "Achter").

Wat ze vonden

De onderzoekers hebben dit getest tegen de slimste AI-modellen die beschikbaar zijn (zoals Qwen, InternVL, en anderen).

  • De Kloof: Zelfs de beste AI-modellen beantwoordden ongeveer 50% van de vragen goed. Mensen haalden er ongeveer 91%. Dit laat zien dat de huidige AI nog steeds erg slecht is in het "houden van de oriëntatie" tijdens het bewegen.
  • De Verbetering: Toen ze DirectMe gebruikten, steeg de prestatie van de AI aanzienlijk. De AI werd veel beter in het beantwoorden van vragen over dingen die niet meer in het gezichtsveld van de camera waren.
  • Het Belangrijkste Inzicht: De grootste fout van de AI was niet het herkennen van objecten (het weet wat een stoel is); het was het bijhouden van waar de stoel zich bevindt ten opzien van de bewegende persoon. De AI vergat steeds dat jij bewoog, en niet de stoel.

Samenvatting

Dit artikel zegt: "Huidige AI is geweldig in het beschrijven van een enkele foto, maar slecht in het navigeren door een bewegende wereld. Wij hebben een nieuwe test gebouwd om dit te bewijzen en een nieuw hulpmiddel (DirectMe) dat werkt als een mentaal schetsboek, waardoor de AI kan onthouden waar dingen zich bevinden ten opzien van jou terwijl je rondloopt."

Het uiteindelijke doel dat wordt genoemd, is het helpen bouwen van betere draagbare AI-assistenten (zoals brillen voor blinden of robots) die je echt kunnen helpen bij het navigeren door je huis of stad zonder te verdwalen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →