← Nieuwste papers
🤖 AI

SeeSE3: Emergence of 3D Space in Vision Features

Dit artikel toont aan dat zelfgesuperviseerde visuele fundamentmodellen inherent 3D Euclidische ruimtelijke structuren coderen binnen hun latente kenmerken, wat nieuwe technieken voor "Latente Ruimte Navigatie" mogelijk maakt voor visuele odometrie en lokalisatie zonder expliciete 3D-reconstructie.

Oorspronkelijke auteurs: Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

Gepubliceerd 2026-07-17
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen over hoe wij de wereld zien. Een lange tijd geloofden wetenschappers dat om de 3D-vorm van de ruimte echt te begrijpen — hoe ver dingen weg zijn, hoe ze draaien en hoe we ons erdoorheen bewegen — een wezen een actieve ontdekkingsreiziger moest zijn. Denk aan een baby die leert kruipen of een robot met wielen: ze moeten hun lichaam bewegen om te begrijpen dat de wereld een solide, driedimensionale plek is. Dit idee, beroemd voorgesteld door de wiskundige Henri Poincaré, suggereerde dat een "onbeweeglijk wezen" nooit zou kunnen leren wat de ruimte is, omdat het geen reden zou hebben om het verschil te zien tussen het bewegen van de ogen en de werkelijke beweging van de wereld.

Maar vandaag de dag hebben we iets nieuws: gigantische computerbreinen genaamd "vision foundation models". Dit zijn AI-systemen die getraind zijn op miljarden foto's en video's. Ze zijn als de ultieme "onbeweeglijke wezens". Ze hebben geen benen, ze hebben geen wielen en ze bewegen niet. Ze zitten daar gewoon en kijken naar plaatjes. De grote vraag is: als je een onbeweeglijke computer genoeg foto's voert, zal hij dan per ongeluk de regels van de 3D-ruimte ontdekken? Of ziet hij alleen een platte, rommelige brij van kleuren? Dit artikel duikt in die vraag en vraagt zich af of deze passieve waarnemers in het geheim een kaart van de wereld kunnen bouwen in hun digitale breinen, zelfs zonder ooit een stap te zetten.


De Grote Ontdekking van het Papier: De "Ongeziene Kaart"

De onderzoekers achter deze studie, een team van Google DeepMind en andere instellingen, besloten deze "Poincaré-taak" te testen. Ze wilden zien of de interne "gedachten" (of kenmerken) van deze onbeweeglijke AI-modellen geheim georganiseerd waren als een 3D-kaart. Specifiek zochten ze naar een connectie met SE(3), wat gewoon een chique wiskundige manier is om alle mogelijke manieren te beschrijven waarop je in de 3D-ruimte kunt bewegen en draaien (zoals naar voren lopen, naar links draaien of je hoofd kantelen).

Hier is de twist: de AI-modellen die ze testten, werden nooit iets geleerd over de 3D-ruimte. Ze kregen geen dieptekaarten te zien, ze kregen geen GPS-coördinaten en ze kregen niet verteld hoe ze afstand moesten meten. Ze werden alleen getraind om patronen in afbeeldingen te herkennen met behulp van een methode genaamd "self-supervision" (in feite delen van een afbeelding raden om van de rest te leren).

De Belangrijkste Bevinding:
Het papier suggereert dat deze onbeweeglijke AI's, verrassend genoeg, een verborgen 3D-kaart in hun breinen hebben gebouwd. Zelfs al zag de ruwe data die uit de AI kwam eruit als een verwarde, chaotische brij (zoals een bol wol), de onderzoekers ontdekten dat ze, met een kleine, eenvoudige "adapter" (een kleine toevoeging die ze de Poincaré Adapter noemden), die brij konden "uitrollen". Eenmaal uitgerold, kwamen de interne kenmerken van de AI perfect overeen met de geometrie van de 3D-ruimte.

Denk er zo over na: stel je voor dat het brein van de AI een gekruld stuk papier is met een kaart erop getekend. Voor een normaal oog ziet de kaart er gebroken en onleesbaar uit. Maar de Poincaré Adapter is als een zachte hand die het papier glad strijkt. Plotseling onthullen de gekrulde lijnen een perfect, recht raster waar "naar voren bewegen" in de geest van de AI daadwerkelijk betekent dat men naar voren beweegt in de echte wereld.

Wat Ze Uitsloten (En Wat Niet)

De auteurs waren zeer zorgvuldig in het verduidelijken van wat dit niet betekent.

  • Het is geen directe 3D-camera: Ze sloten expliciet de gedachte uit dat de ruwe kenmerken van de AI al een perfecte 3D-kaart zijn. Als je simpelweg naar de ruwe getallen kijkt die uit de AI komen, zijn ze chaotisch en gekromd, niet recht en plat. De "kaart" is verborgen, niet voor de hand liggend.
  • Het is geen magie: Het papier spree�t het idee tegen dat je een robot met wielen nodig hebt om de ruimte te begrijpen. Ze toonden aan dat een "onbeweeglijke" waarnemer (de AI) deze ruimtelijke regels kan ontdekken door simpelweg naar statische foto's te kijken, mits je weet hoe je de juiste vragen moet stellen.
  • Het is niet overal perfect: Hoewel de AI rotatie (draaien) heel goed kon begrijpen, had het meer moeite met het precies bepalen van de afstand (translatie-amplitude). De auteurs suggereren dat dit komt omdat afstand moeilijker te raden is vanuit een plat beeld zonder extra aanwijzingen, maar de algemene richting van de beweging was nog steeds zeer duidelijk.

Hoe Ze Het Bewezen Hadden (De "Probe" Experimenten)

Om deze verborgen kaart te vinden, gebruikten de onderzoekers een paar slimme trucjes, die ze "probes" noemen:

  1. De Buurt-test: Ze controleerden of foto's die in de echte wereld dicht bij elkaar liggen (zoals twee foto's genomen terwijl men door een gang loopt) ook dicht bij elkaar liggen in het brein van de AI. Ze kwamen tot de conclusie dat voor sommige modellen, zoals DINOv2, het antwoord een volmondig "ja" was. De AI groepeerde natuurlijke gelijkaardige beelden samen, net zoals een kaart dat doet.
  2. De "Rechtbuig"-test: Ze probeerden te zien of ze het volgende beeld konden voorspellen door simpelweg wiskunde toe te passen (getallen optellen of aftrekken) op het huidige beeld van de AI. Op de ruwe data faalde dit hopeloos. Maar zodra ze hun Poincaré Adapter gebruikten, werkte de wiskunde prachtig. Ze konden de "huidige gedachte" van de AI nemen, een "naar voren bewegen" vector toevoegen, en het resultaat was een "gedachte" die perfect overeenkwam met het volgende frame in de video.
  3. Het Navigatiespel: Als laatste test probeerden ze met deze verborgen kaart te navigeren. Ze gaven de AI een startpunt en een bestemming (bijvoorbeeld "ga 2 meter naar voren en draai 30 graden"). Gebruikmakend van enkel de interne kenmerken van de AI en de adapter, konden ze voorspellen hoe het uitzicht op de bestemming eruit zou zien, zonder ooit een nieuwe afbeelding te genereren. Het was alsof de AI het nieuwe uitzicht kon "voorstellen" door enkel vectorwiskunde in zijn hoofd te gebruiken.

De "Visuele Grid Code"

Het meest opwindende deel van het papier is het idee van een "Visual Grid Code." In de biologie weten we dat dieren (inclusclusief mensen) speciale hersencellen hebben die "grid cells" worden genoemd, die in een hexagonaal patroon vuren om ons te helpen navigeren. Dit papier suggere houdt dat zelfs passieve, onbeweeglijke AI-modellen mogelijk vanzelf iets dergelijks ontwikkelen. Ze onthouden niet alleen plaatjes; ze organiseren hun kennis in een geometrische structuur die de wetten van de fysica weerspiegelt.

De auteurs ontdekten dat dit vermogen schaalt. Hoe meer data de AI zag, hoe beter de verborgen 3D-kaart werd. Zelfs toen ze de AI testten in volledig nieuwe kamers die de AI nog nooit had gezien, kon de "adapter" de AI nog steeds helpen navigeren, wat suggereert dat dit een fundamentele, universele eigenschap is van hoe deze modellen leren.

Waarom Dit Er Toe Doet

Dit gaat niet alleen over het maken van betere robots. Het verandert hoe we over intelligentie denken. Als een onbeweeglijke computer de regels van de 3D-ruimte kan ontdekken door alleen maar naar foto's te kijken, betekent dit dat de geometrie van onze wereld zo diep in visuele data verankerd is dat het bijna onmogelijk is om die te missen. De "wetten van de ruimte" zijn niet iets dat we een machine moeten leren; als we haar genoeg ogen geven, zal ze ze zelf ontdekken.

Het papier concludeert dat hoewel de AI de 3D-ruimte niet "ziet" zoals wij dat doen (het heeft geen lichaam om mee te bewegen), het een wiskundig skelet van de 3D-ruimte in zijn code heeft gebouwd. En met een beetje hulp van een eenvoudig hulpmiddel zoals de Poincaré Adapter, kunnen we die kaart eindelijk lezen, waardoor we de wereld kunnen navigeren met niets anders dan de eigen gedachten van de AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →