← Nieuwste papers
🤖 AI

IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training

IMPACT is een schaalbaar framework voor het trainen van interactie-bewuste wereldmodellen dat de onder-supervisie van dynamische objecten in standaard MSE-training aanpakt door middel van cross-attention om een interne interactiekaart te genereren voor het herwegen van denoising-supervisie, waardoor de fysieke plausibiliteit en visuele kwaliteit worden verbeterd zonder externe representaties te vereisen.

Oorspronkelijke auteurs: Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen

Gepubliceerd 2026-09-02
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een computer voor die een video kan bekijken van een robotarm die een kopje oppakt en vervolgens precies kan voorspellen wat er daarna gebeurt. De computer weet dat het kopje omhoog zal gaan, de tafel stil zal blijven staan en dat het licht zal reflecteren op het keramiek. Dit soort kunstmatige intelligentie, bekend als een wereldmodel (world model), wordt steeds vaardiger in het voorstellen van de toekomst. Het leert van enorme hoeveelheden videodata om te begrijpen hoe objecten bewegen en hoe de wereld in de loop van de tijd verandert. Deze systemen zijn cruciaal voor het aanleren van complexe taken aan robots, van het assembleren van elektronica tot het helpen bij huishoudelijke klussen, omdat ze machines de mogelijkheid bieden om in een virtuele ruimte te oefenen en te plannen voordat ze ooit een echt object aanraken. Echter, hoewel deze modellen uitstekend zijn in het voorspellen van de algemene loop van een scène, worstelen ze vaak met het specifieke moment van contact. Wanneer een robothand een gereedschap grijpt of een menselijke vinger op een knop drukt, produceert de huidige technologie vaak wazige, fysiek onmogelijke of inconsistente resultaten. Het object kan in de hand smelten, of de beweging kan er losgekoppeld uitzien van de actie die het veroorzaakte.

Onderzoekers hebben geprobeerd dit op te lossen door de computer extra informatie te voeden, zoals gedetailleerde dieptekaarten of de precieze paden die objecten moeten volgen. Hoewel dit helpt, vereist het dure, tijdrovende voorbereiding en beperkt het vaak hoeveel data het systeem kan leren. Een nieuwe studie door een team onderzoekers van instellingen waaronder de Tsinghua Universiteit en de University of Science and Technology of China biedt een andere oplossing. Zij ontdekten dat het probleem niet een gebrek aan data was, maar de manier waarop de computer ervan leerde. Door de manier waarop de aandacht tijdens het trainingsproces wordt gericht te veranderen, creëerden zij een methode genaamd IMPACT die de manier waarop deze modellen fysieke interacties afhandelen aanzienlijk verbetert, zonder extra externe data nodig te hebben of het systeem te vertragen.

De kern van het probleem dat de onderzoekers identificeerden, is een soort onbalans in hoe de computer leert. Bij het trainen van deze wereldmodellen wordt het systeem meestal gevraagd om het volgende frame van een video te voorspellen en wordt het gestraft voor elke fout die het maakt. Echter, in een typische video bestaat het grootste deel van het beeld uit een statische achtergrond: een muur, een tafel of een vloer die niet veel verandert. Omdat deze statische gebieden het overgrote deel van de pixels beslaan, besteedt de computer het grootste deel van zijn inspanning aan het correct krijgen van de achtergrond, simpelweg omdat er zoveel van is. De kleine, cruciale gebieden waar de actie plaatsvindt — de grijper die een blok raakt of een hand die een gereedschap vastpakt — zijn zo klein dat ze verloren gaan in de ruis. De computer negeert ze effectief en behandelt ze als onbelangrijk omdat ze zo weinig ruimte innemen. Dit leidt tot een situatie waarin de video er in algemene zin vloeiend en samenhangend uitziet, maar de specifieke interacties fysiek onjuist of visueel rommelig zijn.

Om dit op te lossen, ontwikkelden de onderzoekers een methode die de computer leert om meer aandacht te besteden aan de delen van de video waar de actie daadwerkelijk plaatsvindt. Ze realiseerden zich dat de computer al een ingebouwde hint heeft over waar hij moet kijken. Wanneer het systeem een commando ontvangt zoals "pak de blauwe kom op", gebruikt het een mechanisme genaamd cross-attention om de woorden "blauwe kom" te koppelen aan de visuele delen van de video. Dit creëert een mentale kaart die laat zien waar de computer denkt dat de kom zich bevindt. De onderzoekers gebruikten deze bestaande kaart als startpunt. Vervolgens vroegen ze de computer om naar die specifieke gebieden te kijken en te controleren hoe moeilijk het was om te voorspellen wat daar zou gebeuren. Als de computer moeite had met het voorspellen van de beweging van de kom, betekende dit dat dat gebied belangrijk was en meer focus nodig had.

Het systeem, genaamd IMPACT, gaat dit proces nog een stap verder door verschillende mogelijke regio's rond het object te bemonsteren en deze te wegen op basis van hoe moeilijk de computer ze vond om te voorspellen. Het creëert vervolgens een speciale gids, of kaart, die deze interactiezones markeert. Tijdens de training krijgt de computer de instructie om prioriteit te geven aan het corrigeren van zijn fouten in deze gemarkeerde gebieden, wat effectief zegt: "Negeer de muur even; focus op de hand en het object." Cruciaal is dat deze gids volledig wordt gegenereerd uit de eigen interne signalen van de computer tijdens het trainingsproces. Het vereist geen externe hulpmiddelen, handmatige etikettering of extra sensoren om het te vertellen waar de actie is. Dit maakt de methode zeer schaalbaar, waardoor deze kan werken met enorme hoeveelheden data zonder de zware kosten die gepaard gaan met eerdere benaderingen.

De onderzoekers testten deze nieuwe methode op twee zeer verschillende soorten taken: een robotarm die objecten op een tafel manipuleert en een menselijke hand die behendige taken uitvoert vanuit een eerste-persoonsperspectief. In beide gevallen trainden ze de modellen met standaard videogeneratietechnologie, maar pasten ze de IMPACT-methode toe op het leerproces. De resultaten waren consistent en significant. De modellen die met IMPACT getraind zijn, produceerden video's waarin de interacties veel realistischer waren. Wanneer een robotgrijper sloot op een blok, bleef het blok solide en bewoog het correct. Wanneer een menselijke hand een kopje oppakte, sloetten de vingers er natuurlijk omheen en reageerde het kopje met het juiste gewicht en de juiste beweging. De visuele kwaliteit van de interacties verbeterde drastisch, met minder vervormingen en meer fysiek plausibele bewegingen vergeleken met modellen die met de standaard, uniforme benadering zijn getraind.

In de tests met de robotarm verbeterde de nieuwe methode de algehele kwaliteitsscore met een merkbaar verschil, met name in de mate waarin de robot de instructies volgde en hoe nauwkeurig het de fysica van de objecten simuleerde. Voor de taken met de menselijke hand was de verbetering nog indrukwekkender wat betreft de visuele getrouwheid. De modellen getraind met IMPACT genereerden beelden die scherper en coherenter waren, waarbij de hand en het object op een manier met elkaar interacteerden die natuurlijk oogde voor het menselijk oog. De onderzoekers ontdekten dat deze aanpak goed werkte over verschillende soorten computercarchitecturen en controlesignalen, wat suggereert dat de oplossing robuust en aanpasbaar is. Door simpelweg het leerproces te herwegen om te focussen op wat er echt toe doet, waren ze in staat een hoger niveau van fysieke realiteit te ontsluiten zonder de onderliggende structuur van de AI te veranderen.

Dit werk toont aan dat de sleutel tot betere interactie in kunstmatige intelligentie misschien niet ligt in het toevoegen van complexere data of externe beperkingen, maar in het verfijnen van hoe het systeem leert van de data die het al heeft. De onderzoekers hebben aangetoond dat door het identificeren van de mismatch in hoe de aandacht tijdens de training wordt toegewezen en deze te corrigeren, ze het model konden begeleiden om de moeilijke, schaarse details van fysieke interactie te beheersen. De methode vereist geen wijzigingen aan het systeem wanneer het daadwerkelijk wordt gebruikt om nieuwe video's te genereren, wat betekent dat het een pure verbetering is van de trainingsfase. Naarmate wereldmodellen blijven evolueren om complexere robotische taken en simulaties te ondersteunen, bieden technieken zoals IMPACT een schaalbaar pad vooruit, die ervoor zorgen dat de toekomst die deze modellen zich voorstellen niet alleen visueel vloeiend is, maar ook fysiek waarachtig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →