← Nieuwste papers
💻 computer science

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Dit artikel introduceert Grounded-Exo2E2E, een dual-branch video-diffusiekader dat geometrische verankering combineert met een nieuwe semantische grondingsarm en een camera-relokalisatie-algoritme om robuust egocentrische video's te genereren vanuit exocentrische inputs, waarbij state-of-the-art prestaties worden behaald op de EgoExo4D-dataset door een verbeterde architectuur en volledig geautomatiseerde synthetische datageneratie.

Oorspronkelijke auteurs: Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

Gepubliceerd 2026-08-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een video bekijkt van iemand die aan het koken is vanuit de overkant van de keuken. Je ziet de hele scène: het fornuis, het aanrecht, de bewegingen van de chef. Stel je nu voor dat je direct kunt overschakelen naar dat perspectief om precies te zien wat de chef ziet, alsof je hun ogen draagt. Dit vermogen om een derde-persoonsperspectief te transformeren naar een eerste-persoonsperspectief is het doel van een nieuwe wetenschappelijke inspanning genaamd exocentrische-naar-egocentrische videogeneratie. Het is een cruciale stap voor het bouwen van robots die kunnen leren door menselijke video's te bekijken en voor het creëren van meeslepende virtuele realiteit-ervaringen waarbij gebruikers momenten vanuit het perspectief van een ander persoon kunnen herbeleven. Het omzetten van een video die van buitenaf is gefilmd naar een beeld van binnenuit is echter ongelooflijk moeilijk. Standaard computer vision-tools, die goed werken bij het veranderen van hoeken in een statische scène, schieten hier vaak tekort. Wanneer de camera beweegt van een breed beeld naar een close-up, heeft de computer moeite met het raden van wat er achter objecten verborgen is of hoe de scène eruit zou moeten zien vanuit een totaal ander perspectief, wat vaak resulteert in vervormde, wazige of ontbrekende delen van het beeld.

Een team onderzoekers bij NVIDIA heeft een nieuw systeem ontwikkeld genaamd Grounded-Exo2Ego om dit probleem op te lossen. In plaats van te vertrouwen op de gebruikelijke methoden die proberen een geometrische pasvorm tussen het buitenperspectief en het binnenperspectief af te dwingen, hebben ze een framework gebouwd dat zowel de vorm van de kamer als de specifieke objecten daarin begrijpt. De onderzoekers ontdekten dat eerdere pogingen faalden omdat de beste gok van de computer over de 3D-vorm van de kamer vaak fout was, vooral voor delen van de scène die verborgen waren voor de oorspronkelijke camera. Wanneer de computer probeerde deze gebrekkige 3D-kaarten te gebruiken om een nieuw gezichtspunt te genereren, was het resultaat een video vol gaten en vervormde oppervlakken. Om dit op te lossen, gebruikt het nieuwe systeem een dual-branch aanpak. Eén tak fungeert als een structurele gids, waarbij een ruwe 3D-kaart van de scène wordt gebruikt om de computer te vertellen waar muren en vloeren moeten zijn. De tweede tak, wat de belangrijkste innovatie is, fungeert als een semantische gids. Deze identificeert specifieke objecten in de video, zoals een persoon, een fiets of een kookpan, en vertelt de computer precies hoe die objecten eruit moeten zien en waar ze thuishoren, zelfs als de 3D-kaart incompleet of defect is.

De onderzoekers ontdekten ook een verborgen gebrek in de manier waarop deze systemen worden getraind. In de echte wereld komt de camera die een persoon draagt niet perfect overeen met de 3D-reconstructie van de kamer die de computer maakt. Deze mismatch betekende dat wanneer de computer probeerde te leren van echte videodata, het in essentie probeerde te leren van een vervormde kaart die niet overeenkwam met de realiteit die het moest nabootsen. Om dit op te lossen, heeft het team een nieuw proces ontwikkeld dat de positie van de camera binnen de imperfecte 3D-kaart van de computer opnieuw uitlijnt voordat de training begint. Dit zorgt ervoor dat de computer leert van een consistent beeld. Bovendien, om het systeem van perfecte voorbeelden te voorzien om van te leren, hebben ze een volledig geautomatiseerde engine gebouwd die duizenden synthetische video's creëert. In deze door de computer gegenereerde werelden plaatsen ze geanimeerde 3D-personages in diverse kamers en nemen hen tegelijkertijd van zowel buiten als binnen vanuit verschillende perspectieven op, waardoor het model beschikt over foutloze data die echte camera's niet gemakkelijk kunnen vastleggen.

Bij tests op een uitdagende dataset van echte video's met activiteiten zoals sport, koken en fietsreparatie, presteerde het nieuwe systeem aanzienlijk beter dan bestaande methoden. Het produceerde video's die scherper, nauwkeuriger en veel beter waren in het behouden van de juiste positie van objecten. Zo faalden oudere methoden vaak in het volledig reconstrueren van mensen of plaatsten ze hen op de verkeerde plek, terwijl het nieuwe systeem erin slaagde heldere beelden van de onderwerpen en hun omgeving te genereren. De resultaten toonden aan dat door een ruw begrip van de lay-out van de kamer te combineren met een gedetailleerd begrip van de objecten daarin, en door te trainen op data die zorgvuldig is uitgelijnd en aangevuld met synthetische voorbeelden, de computer eindelijk de kloof kon overbruggen tussen het bekijken van een scène en het zien door de ogen van iemand anders. Dit werk suggereert dat voor machines om menselijke ervaringen echt te begrijpen en te repliceren, ze verder moeten kijken dan eenvoudige geometrie en de betekenis van de objecten die ze proberen te renderen moeten leren begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →