← Nieuwste papers
💻 computer science

Multi-View Aggregation Transformer with Contrastive Learning for 3D Shape Retrieval

Dit artikel stelt de Multi-View Aggregation Transformer (MVAT) voor, een geometrie-gealigneerd framework dat hiërarchische multi-view aandacht, gespecialiseerde kanaalmodulatiemodules en een absolute cosinusgelijkenheidsmetriek integreert om state-of-the-art prestaties te behalen bij 3D-vormretrieval over meerdere benchmarks.

Oorspronkelijke auteurs: Ze Zhang, Xiaojun Wu, Chenxi Wu, Guoyuan Liang

Gepubliceerd 2026-09-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ze Zhang, Xiaojun Wu, Chenxi Wu, Guoyuan Liang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de digitale wereld zijn driedimensionale objecten overal aanwezig, van de tandwielen binnenin een machine tot de eeuwenoude artefacten die in een museum worden bewaard. Om een specifiek object te vinden tussen duizenden digitale modellen, moeten computers een manier begrijpen om te zien hoe een vorm er vanuit elke mogelijke hoek uitziet. Decennialang hebben onderzoekers geprobeerd machines te leren deze vormen te herkennen door foto's ervan vanuit vele zijden te maken, vergelijkbaar met een fotograaf die rond een standbeeld cirkelt om de volledige vorm vast te leggen. Vroege pogingen vertrouwden op eenvoudige regels die door mensen waren geschreven om vormen te beschrijven, maar deze slaagden er vaak niet in de complexe details van moderne ontwerpen te vatten. Recentelijk hebben krachtige computersystemen geleerd om patronen in afbeeldingen op eigen wijze te herkennen, maar ze worstelen nog steeds met het combineren van tientallen verschillende foto's tot één helder begrip van een object. De uitdaging ligt erin de computer te helpen niet alleen de individuele foto's te zien, maar ook de geometrische relatie tussen hen, zodat een stoel eruitziet als een stoel, of deze nu van voren, van de zijkant of ondersteboven wordt bekeken.

Een team van onderzoekers aan het Harbin Institute of Technology en de Chinese Academy of Sciences heeft een nieuw systeem ontwikkeld om dit probleem op te lossen, genaamd de Multi-View Aggregation Transformer. Hun aanpak behandelt de taak van het herkennen van een 3D-vorm als een gesprek tussen vele verschillende camerahoeken. In plaats van afbeeldingen simpelweg op elkaar te stapelen, gebruikt hun systeem een speciale cameraopstelling gebaseerd op de vorm van een dodecaëder, een vast lichaam met twaalf platte vlakken en twintig hoekpunten. Door virtuele camera's op elk hoekpunt te plaatsen en ze naar het centrum te richten, leggen ze zestig verschillende aanzichten van een object vast. Deze specifieke arrangement zorgt ervoor dat het gehele oppervlak gelijkmatig wordt bedekt, wat een volledige kaart van de geometrie van het object oplevert. Het systeem gebruikt vervolgens een geavanceerd type kunstmatige intelligentie, bekend als een Vision Transformer, om deze zestig afbeeldingen te analyseren. In tegen tegenover oudere methoden die verbindingen tussen verre aanzichten zouden kunnen missen, besteedt dit nieuwe systeem aandacht aan hoe elk afzonderlijk aanzicht zich verhoudt tot elk ander aanzicht, waardoor een verenigd beeld van de structuur van het object wordt opgebouwd.

De onderzoekers kwamen tot de conclusie dat het simpelweg verzamelen van deze aanzichten niet genoeg was; de computer had een manier nodig om de specifieke relaties te begrijpen die door hun camera-opstelling werden gecreëerd. Om dit te bereiken, ontwierpen ze een hiërarchisch attentiesysteem dat in drie lagen werkt. Eerst kijkt het naar het grote plaatje, waarbij het begrijpt hoe alle aanzichten met elkaar verbonden zijn om het geheel van het object te vormen. Ten tweede richt het zich op groepen aanzichten die op hetzelfde platte vlak van de denkbeeldige dodecaëder liggen, waardoor lokale patronen worden herkend. Ten slotte onderzoekt het de subtiele verschillen tussen aanzichten die vanuit exact dezelfde plek zijn genomen maar licht gedraaid, wat helpt om objecten te onderscheiden die erg op elkaar lijken. Deze stapsgewijze focus stelt het systeem in staat om de geometrie van de vorm veel effectiever te leren dan eerdere methoden. Om de uiteindelijke beschrijving van het object verder te verfijnen, voegden ze speciale modules toe die de belangrijkheid van verschillende kenmerken aanpassen, waardoor de meest cruciale details worden benadrukt terwijl minder nuttige informatie wordt weggefilterd.

Een belangrijke innovatie in hun werk is een nieuwe manier om de gelijkenis tussen twee objecten te meten. Traditionele methoden behandelen een object en zijn spiegelbeeld vaak als volkomen verschillend omdat de wiskundige richting van hun gegevenspunten tegengesteld is. Echter, voor het doel van het vinden van een specifiek onderdeel of ontwerp, doet de richting van de gegevens er minder toe dan de vorm zelf. De onderzoekers introduceerden een metriek die tegengestelde richtingen als gelijkwaardig behandelt, waardoor het systeem kan herkennen dat twee objecten hetzelfde zijn, zelfs als hun interne gegevenspunten de andere kant op wijzen. Deze flexibiliteit maakt het systeem veel beter in het vinden van overeenkomsten in grote databases. Wanneer het werd getest op standaard collecties van 3D-modellen, inclusief algemene objecten zoals stoelen en tafels, evenals complexe mechanische onderdelen, behaalde het nieuwe systeem een opmerkelijke nauwkeurigheid. Het identificeerde objecten correct met een succespercentage van 93,2% op algemene datasets en 95,4% op mechanische componenten, waarmee het alle voorgaande methoden overtrof.

Het team ontdekte ook dat de manier waarop ze het systeem trainden net zo belangrijk was als het systeem zelf. Ze gebruikten een proces van drie fasen om de computer te onderwijzen. Eerst leerden ze het om vormen te herkennen vanuit enkele afbeeldingen. Vervolgens bevroren ze die kennis en leerden ze het hoe het meerdere aanzichten kon combineren zonder te vergeten wat het al had geleerd. Ten slotte lieten ze het hele systeem samen leren om het begrip te verfijnen. Deze zorgvuldige trainingsstrategie voorkwam dat het systeem in de war raakte door de complexiteit van de taak. De resultaten toonden aan dat het systeem robuust bleef, zelfs wanneer de objecten in willekeurige richtingen werden gedraaid, een veelvoorkomende uitdaging in praktische toepassingen. Door een geometrisch slimme camera-opstelling, een gelaagd attentiesysteem en een flexibele manier van gelijkenis meten te combineren, biedt dit onderzoek een krachtig nieuw instrument voor digitaal ontwerp, productie en het behoud van cultureel erfgoed, waarmee bewezen wordt dat de sleutel tot het begrijpen van 3D-vormen ligt in hoe we machines leren het hele plaatje te zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →