← Nieuwste papers
💻 computer science

xperception -- Making Robotic Grasping Easier

xperception is een zero-shot 6D-pose-estimatiesysteem dat gebruikmaakt van CAD-modellen en foundation model-kenmerken om millimeter-nauwkeurige, robuuste robotische grijpkracht mogelijk te maken in high-mix low-volume productie zonder dat er objectspecifieke training of data-annotatie nodig is.

Oorspronkelijke auteurs: Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

Gepubliceerd 2026-07-21
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin robots lijken op ongelooflijk getalenteerde maar eigenwijze koks. Ze kunnen een miljoen identieke wortels met perfecte snelheid snijden, maar als je ze een vreemd gevormde aardappel geeft die ze nog nooit hebben gezien, bevriezen ze. Waarom? Omdat hun "ogen" en "hersenen" alleen getraind zijn op wortels. Om ze de aardappel te leren kennen, zou je duizenden foto's ervan moeten maken, elke foto handmatig moeten labelen en de hersenen van de robot opnieuw moeten trainen—een proces dat een eeuwigheid duurt en een fortuin kost. Dit is de huidige flessenhals in de wereld van fabrieksautomatisering: robots zijn geweldig in het herhalen van dezelfde handeling, maar slecht in het aanpassen aan nieuwe, rommelige of unieke objecten.

Om dit op te lossen, kijken wetenschappers naar een nieuw soort "visie" die niet vanaf nul geleerd hoeft te worden. Denk aan een superintelligente bibliothecaris die elk boek in het universum heeft gelezen. Als je deze bibliothecaris een foto van een nieuwe, vreemde vrucht laat zien, hoeft hij niet wekenlang te studeren; hij kan het direct herkennen omdat hij al het algemene concept van "vrucht", "textuur" en "vorm" begrijpt. Dit artikel duikt in een technologie genaamd 6D pose estimation, wat gewoon een chique manier is om te zeggen: "precies uitzoeken waar een object zich in de 3D-ruimte bevindt en welke kant het op wijst." Het doel is om robots in staat te stellen nieuwe objecten direct te grijpen, zonder de lange, saaie trainingssessies, waardoor fabrieken flexibel genoeg worden om een "high-mix, low-volume" wereld te hanteren waar elk item anders kan zijn.


Maak kennis met xperception: De robot die de handleiding leest, niet de foto's

Maak kennis met xperception, een nieuwe tool ontwikkeld door onderzoekers van Fondazione Bruno Kessler in Italië. Zie xperception als de "instant-read" superkracht van een robot. In plaats van een robot te dwingen om duizenden foto's van een nieuw object te staren om te leren hoe het eruitziet, zegt xperception: "Geef me gewoon de blauwdruk."

In de oude dagen, als een fabriek een robot wilde leren een nieuw type schroef op te pakken, moesten ze honderden foto's van die schroef vanuit elke hoek maken, labelen en een neuraal netwerk trainen. Het was alsof je een hond leerde om een specifieke bal te halen door die exacte bal duizenden keren te gooien. xperception draait het scenario om. Het gebruikt het 3D CAD-model van het object (de digitale blauwdruk die ingenieurs gebruiken om het onderdeel te ontwerpen) en combineert dit met een "foundation model"—een enorme, vooraf getrainde AI-hersenen die de visuele wereld al begrijpt.

Zo werkt de magie: Stel je voor dat je een stapel gemengd speelgoed op de vloer hebt liggen. Een traditionele robot zou in de war kunnen raken. Maar xperception kijkt naar de stapel en extraheert, gebruikmakend van zijn vooraf getrainde brein, point-level features uit de visuele data. Vervolgens koppelt het deze kenmerken aan de overeenkomstige kenmerken van de digitale blauwdruk (het CAD-model) om point cloud registration uit te voeren. Het hoeft dat specifieke speelgoed nog nooit gezien te hebben; het heeft alleen de blauwdruk nodig en het vermogen om de visuele punten uit te lijnen met de geometrie van het model. Vervolgens berekent het de 6D pose, wat een chique manier is om te zeggen dat het precies uitrekent waar het speelgoed is (links, rechts, boven, onder, voor, achter) en precies hoe het gekanteld is (rollen, stampen, gieren). Het is alsof de robot plotseling een GPS en een kompas heeft voor elk object dat het ziet, waarbij de locatie tot op de millimeter nauwkeurig wordt bepaald.

Waarom dit ertoe doet: Het "bin picking" probleem

De echte test voor deze technologie is een klassieke industriële nachtmerrie genaamd "bin picking". Stel je een bak voor vol met onderdelen die willekeurig zijn gedumpt. Ze liggen op elkaar gestapeld, waarbij delen van zichzelf aan het zicht onttrekken (occlusie), en de verlichting kan vreemd zijn. Een robot moet erin reiken, één specifiek onderdeel pakken en precies weten hoe hij het moet vasthouden zodat hij het niet laat vallen of de wand van de bak raakt.

De onderzoekers testten xperception op een zeer interessante manier tijdens de Automatica 2025 beurs. Ze zetten een robot op om willekeurige pennen op te pakken die verspreid over een tafel lagen. De crux? De robot moest een pen oppakken, deze in een laserprinter plaatsen en een aangepaste boodschap erop graveren. Voor de laser om de juiste plek te raken, moest de robot de oriëntatie van de pen met bijna nul foutmarge kennen. Als de pen zelfs maar een klein beetje gekanteld was, zou de boodschap scheef staan.

De opstelling was ongelooflijk eenvoudig. Het team heeft geen enkele foto van de pennen gemaakt of de robot erop getraind. Ze hebben simpelweg het digitale CAD-model van de pen geüpload en de optimale grijppunten direct op het digitale model gedefinieerd (geïllustreerd als de blauwe markeringen in de figuur van het artikel). Toen de robot begon, keek xperception naar de rommelige stapel pennen, vond elke pen, bepaalde precies hoe deze lag, en vertelde de robot waar hij hem moest pakken. De robot pakte de pennen succesvol op en lijnde ze perfect uit voor de laser, zelfs terwijl de pennen achter elkaar verborgen lagen en de verlichting uitdagend was.

Het resultaat: Snel, flexibel en klaar voor de echte wereld

Het artikel laat zien dat xperception een game-changer is omdat het de "trainingstijd" elimineert die fabrieken normaal gesproken vertraagt. Door het FreeZe-algoritme te gebruiken (dat onlangs een belangrijke internationale wedstrijd genaamd de BOP Challenge 2024 won), bereikt het systeem een nauwkeurigheid op millimeterniveau. Dit betekent dat de robot nauwkeurig genoeg is voor delicate taken.

Bovendien is dit niet slechts een laboratoriumexperiment. De onderzoekers hebben bewezen dat het werkt op industriële edge-hardware, waarbij specifiek de NVIDIA Jetson Thor wordt genoemd, een krachtige computerchip die ontworpen is om direct op de robotarm te zitten. Dit betekent dat de "hersenen" niet in een gigantisch serverpark ver weg hoeven te staan; de robot kan direct denken en reageren op de plek waar het werk gebeurt.

De auteurs zijn er zeker van dat deze aanpak klaar is voor de echte wereld, aangezien het een Technology Readiness Level (TRL) van 6 heeft bereikt. In de wereld van engineering betekent dit dat de technologie is getest in een relevante omgeving en zeer dicht bij een commercieel product is. Ze suggereren niet alleen dat het zou kunnen werken; ze hebben aangetoond dat het werkt op echte hardware met echte objecten.

De kern van het verhaal

xperception lost het probleem van de starheid van robots op. Het stelt dat we robots niet voor elk nieuw object dat ze tegenkomen opnieuw hoeven te trainen. In plaats daarvan, door het digitale ontwerp van het object te gebruiken en een slim, vooraf getraind AI-model dat visuele punten uitlijnt met geometrie, kunnen robots flexibel genoeg worden om de rommelige, onvoorspelbare realiteit van de moderne productie aan te kunnen. Het verandert de complexe taak van "uitzoeken hoe ik dit vreemde nieuwe ding moet pakken" in een eenvoudige "plug-and-play" software-update, wat de weg vrijmaakt voor fabrieken die in een oogwenk kunnen schakelen van het ene product naar het andere.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →