← Nieuwste papers
💻 computer science

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D is een nieuw geometrie-bewust groot multimodaal model dat gebruikmaakt van 3D Rotary Positional Embeddings en een op queries gebaseerde segmentatiedecoder om ruimtelijk redeneren, referentiële gronding en instantiesegmentatie over afbeeldingen en video's heen te verenigen, waardoor de kloof tussen taal en dichte 3D-geometrische voorspellingen effectief wordt overbrugd terwijl het bestaande gespecialiseerde en propriëtaire modellen overtreft.

Oorspronkelijke auteurs: Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

Gepubliceerd 2026-08-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij de wereld ziet. Lange tijd waren deze robots als toeristen met een camera: ze konden een foto van een kamer maken en je vertellen: "Dat is een stoel," of "Er zijn drie mensen." Dit werkt prima voor platte foto's of korte videoclips. Maar als je de robot vraagt om door een heel huis te lopen, dezelfde stoel te bekijken vanuit de keuken, de gang en de slaapkamer, en je vervolgens precies te vertellen waar de stoel zich in de 3D-ruimte bevindt, loopt het een {rommeltje}. De robot raakt in de war omdat hij probeert duizenden afzonderlijke 2D-plaatjes aan elkaar te naaien, wat is alsof je een huis probeert te bouwen door duizenden platte ansichtkaarten aan elkaar te lijmen. Het is traag, het kost veel hersencapaciteit en de robot verliest vaak de controle over waar dingen zich daadwerkelijk in de echte wereld bevinden.

Dit is de uitdaging van "3D Vision-Language Models". Wetenschappers willen AI bouwen die niet alleen objecten herkent, maar ook hun vorm, locatie en relatie tot alles in een 3D-omgeving begrijpt, terwijl het tegelijkertijd naar menselijke instructies luistert. De grote vraag is: hoe maken we een AI die een kamer vanuit elke hoek kan bekijken, de indeling kan onthouden en naar het juiste object kan wijzen zonder te verdwalen in een zee van data? Als we dit kunnen oplossen, kunnen robots eindelijk door onze huizen navigeren, ons helpen bij het zoeken naar verloren sleutels, of zelfs assisteren bij complexe constructietaken, waardoor ze verder gaan dan alleen "zien" naar echt het "begrijpen" van de ruimte om hen heen.

Maak kennis met Qwen-3D, een nieuw soort AI ontwikkeld door onderzoekers van Carnegie Mellon University dat fungeert als een meesterarchitect voor deze digitale werelden. In plaats van elke videoframe als een afzonderlijk, plat plaatje te behandelen, doet Qwen-3D iets slims: het neemt al die verschillende aanzichten en "smelt" ze samen tot één enkele, persistente 3D-kaart. Stel je voor dat je een verzameling foto's van een beeldhouwwerk vanuit verschillende hoeken neemt en deze direct versmelt tot een solide, draaiend standbeeld in je geest. Dat is wat dit model doet met visuele data. Het gebruikt de diepte-informatie (hoe ver weg dingen zijn) en camerastandpunten om een lange, kronkelende videostroom te comprimeren tot een compacte, 3D-representatie. Dit stelt de AI in staat om over de scène als geheel te redeneren, in plaats van vast te lopen op het kijken naar één frame tegelijk.

Het paper betoogt dat eerdere pogingen om AI 3D-vaardigheden te leren een grote flessenhals hadden. Oudere modellen probeerden 3D-locaties te beschrijven door ze als tekst uit te schrijven (zoals "de stoel bevindt zich op coördinaten 1.2, 0.8, 0.9") of door te kiezen uit een vooraf gemaakte lijst van mogelijke objecten. De auteurs suggereren dat deze methoden zijn alsof je een complex schilderij probeert te beschrijven met slechts een beperkte set emoji's, of door te raden welke vooraf gedrukte sticker het beste past. Het is een onhandige en inefficiënte manier van communiceren. Qwen-3D lost dit op door het "brein" van de AI (zijn taalredenering) direct te verbinden met een "hand" (een segmentatie-decoder) die naar specifieke delen van de 3D-scène kan wijzen. In plaats van coördinaten te raden, leert het de exacte vorm van het object te markeren waar de gebruiker het over heeft, of het nu gaat om een kussen op een bed of een verkeerslicht in een straatscène.

De resultaten zijn zeer indrukwekkend. Bij het testen op een verscheidenheid aan benchmarks presteerde Qwen-3D beter dan bestaande 3D-AI-modellen en versloeg het zelfs verschillende grote, propriëtaire 2D-modellen in het begrijpen van 3D-ruimtes. Specifiek ontdekten de onderzoekers dat Qwen-3D de 3D visual grounding (het vinden van objecten op basis van beschrijvingen) met 4% verbeterde en de 3D instance segmentation (het scheiden van individuele objecten van een scène) met 13% verhoogde ten opzichte van de beste voorgaande methoden. Opmerkelijk genoeg deed het dit alles zonder het vermogen te verliezen om standaard 2D-afbeeldingen en video's te begrijpen, wat bewijst dat je een model kunt leren om in 3D te zien zonder dat het vergeet hoe het in 2D moet zien.

De auteurs merken echter voorzichtig op dat dit nog geen wondermiddel is voor elke situatie. Het model gaat er momenteel van uit dat de wereld grotendeels statisch is; het heeft moeite met dynamische omgevingen waar objecten snel bewegen of van vorm veranderen, zoals een drukke straat met voorbijrazende auto's. Het vertrouwt ook op externe hulpmiddelen om diepte en camerastandpunten te schatten, wat betekent dat als die initiële metingen fout zijn, het begrip van de AI er ook een beetje naast kan zitten. Hoewel het een belangrijke stap voorwaarts is in het overbruggen van de kloof tussen taal en 3D-perceptie, suggereren de onderzoekers dat toekomstig werk zich moet richten op het aanpakken van deze bewegende doelwitten en misschien zelfs zelf geometrie moet leren schatten. Voor nu is Qwen-3D een krachtig nieuw instrument dat suggereert dat de sleutel tot betere 3D-AI niet alleen betere data is, maar een slimmere manier om te verbinden wat de AI ziet met hoe de AI spreekt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →