← Nieuwste papers
💻 computer science

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR is een trainingsvrij, zero-shot 3D visual grounding-framework dat LLM-gestuurde tekstdisambiguatie en chain-of-thought-redenering benut om optimale gezichtspunten af te leiden en vergelijkbare objecten te onderscheiden, waarmee het de state-of-the-art prestaties op de ScanRefer-dataset bereikt door bestaande methoden aanzienlijk te overtreffen in het afhandelen van ambigue queries en gebrekkige gezichtspunten.

Oorspronkelijke auteurs: Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

Gepubliceerd 2026-08-05
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot bent die probeert een specifiek object te vinden in een rommelige kamer, maar je kunt de kamer alleen vanuit één hoek zien en iemand schreeuwt instructies naar je via een walkie-talkie. Dit is de wereld van 3D Visual Grounding, een vakgebied waar computers proberen woorden te verbinden aan echte 3D-objecten. Het is als een spannend spelletje "Ik zie, ik zie wat jij niet ziet", maar in plaats van een plat plaatje, navigeer je door een volledige, driedimensionale ruimte die bestaat uit miljoenen kleine puntjes (genaamd point clouds). Het lastige deel is dat taal rommelig is. Als iemand zegt: "Zoek de stoel aan de linkerkant," is die instructie nutteloos tenzij je precies weet waar zij staan. Als zij zich omdraaien, wordt de stoel aan de "linkerkant" de stoel aan de "rechterkant". Bovendien, als de kamer vol staat met identieke stoelen, is het bepalen welke ze bedoelen een nachtmerrie. Het oplossen hiervan is cruciaal voor robots die ons in onze huizen moeten helpen of onze auto's moeten besturen, omdat ze niet alleen moeten begrijpen wat dingen zijn, maar ook waar ze zich bevinden ten opzichte van ons.

Maak kennis met TDVR, een nieuw "training-vrij" framework (wat betekent dat het niet miljoenen voorbeelden nodig heeft om te leren) dat fungeert als een super slimme detective voor deze 3D-puzzels. De onderzoekers ontdekten dat eerdere methoden vaak verdwaalden omdat ze geen rekening hielden met het standpunt van de spreker of in de war raakten door vergelijkbare objecten. TDVR lost dit op door eerst als een vertaler te fungeren. Het neemt een vage, verwarrende zin en herschrijft deze naar een superduidelijke, gestructureerde beschrijving, waarbij details over kleuren, texturen en de exacte positie van objecten ten opzichte van elkaar worden toegevoegd. Denk eraan als het nemen van een wazige, gefluisterde aanwijzing en het omzetten in een high-definition kaart.

Zodra de aanwijzing duidelijk is, speelt TDVR een spelletje "Wat als?". Het draait de hele 3D-kamer in zijn geest en test verschillende hoeken om te zien welk gezichtspunt de beschrijving perfect laat aansluiten bij de scène. Het is alsof een detective een wereldbol ronddraait om de exacte plek te vinden waar de beschrijving van de spreker over de plaats delict precies overeenkomt met de kaart. Als er vijf identieke rode stoelen zijn, gokt TDVR niet zomaar; het gebruikt een speciale "similarity decoupling"-truc om uit te vogelen welke specifieke stoel het beste bij de beschrijving "links van de tafel" past, zelfs als ze er allemaal hetzelfde uitzien.

De resultaten zijn indrukwekkend. Op een standaardtest genaamd ScanRefer presteerde TDVR met een enorme marge beter dan de beste bestaande methoden, waarbij de nauwkeurigheid met 15,25% en 14,46% verbeterde, afhankelijk van hoe streng de test was. Het versloeg zelfs systemen die getraind waren op enorme hoeveelheden data, wat bewijst dat slim redeneren soms kan winnen van brute-force leren. De auteurs laten zien dat door tekst-disambiguatie (het verhelderen van de woorden) te combineren met viewpoint reasoning (het bepalen van de hoek), robots eindelijk het juiste object kunnen vinden in een drukke, verwarrende wereld zonder dat een mens hun hand vast hoeft te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →