← Nieuwste papers
🤖 AI

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

Dit artikel presenteert een perceptie-actie-pipeline voor robotische pick-and-place-taken in rommelige gemakswinkelsomgevingen die annotatiegestuurde visuele prompting combineert om doelwitten te identificeren met Action Chunking with Transformers (ACT) om adaptieve, datagedreven grijpsequenties te genereren vanuit menselijke demonstraties.

Oorspronkelijke auteurs: Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

Gepubliceerd 2026-08-19
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Visuele Prompting voor Robotische Manipulatie met Annotatie-gestuurde Pick-and-Place met behulp van ACT

Probleemstelling
Robotische pick-and-place taken in gemakswinkels worden geconfronteerd met aanzienlijke hindernissen door dichte objectplaatsingen, frequente occlusies en een hoge variabiliteit in de eigenschappen van objecten (kleur, vorm, grootte, textuur). Traditionele benaderingen die vertrouwen op vooraf gedefinieerde heuristieken, gestructureerde omgevingen of uitputtende scène-segmentatie missen vaak de aanpasbaarheid die vereist is voor nieuwe artikelen en dynamische lay-outs. Bovendien kunnen conventionele stapsgewijze planningen foutgevoelig zijn bij taken met een lange horizon, wat leidt tot cumulatieve fouten en falen.

Methodologie
De auteurs stellen een perceptie-actie-pipeline voor die annotatie-gestuurde visuele prompting combineert met Action Chunking with Transformers (ACT), een algoritme voor imitatie-leren.

  • Visuele Prompting: In plaats van te vereisen dat de robot complexe, uitputtende scène-analyse uitvoert, maakt het systeem gebruik van bounding box-annotaties om gestructureerde ruimtelijke begeleiding te bieden. Deze annotaties identificeren expliciet het doelobject voor het oppakken (pick) en de bestemming voor het neerleggen (place). Het systeem maakt gebruik van twee Intel RealSense camera's (D435i op de pols en D415 op de tafel) om RGB- en dieptegegevens vast te leggen. De RGB-beelden, verrijkt met visuele prompts (bounding boxes), dienen als directe inputs voor het neurale netwerk.
  • Action Chunking with Transformers (ACT): Het kernalgoritme voor besturing is ACT, dat rigide, stapsgewijze planning vervangt door de voorspelling van "gechunkte" actiesequenties.
    • Architectuur: Het model gebruikt een Transformer-gebaseerde architectuur. Een CVAE-encoder verwerkt menselijke demonstratiegegevens (acties en observaties zonder afbeeldingen) om een latente variabele (zz) te genereren. Een Transformer-decoder voorspelt vervolgens een sequentie van toekomstige acties (een "chunk") op basis van de huidige staat, de latente variabele en de visuele input (RGB-afbeelding met bounding boxes).
    • Training: Het systeem wordt getraind via imitatie-leren met behulp van menselijke demonstraties verzameld via teleoperatie (3D space mouse). Het trainingsdoel is het minimaliseren van de reconstructiefout tussen voorspelde en werkelijke actiechunks, geregulariseerd door een KL-divergentieterm.
  • Experimentele Opstelling: Het systeem is geïmplementeerd op een Universal Robots UR5e arm uitgerust met een Robotiq 2-vinger grijper. Experimenten werden uitgevoerd in een gesimuleerde en real-world gemakswinkel setting met zes verschillende productcategorieën (bijv. noedelkommen, chocolade dozen, thee flessen) die uiteenlopende vormen, texturen en materialen vertegenwoordigen.

Belangrijkste Bijdragen

  1. Annotatie-gestuurde Visuele Prompting: De introductie van bounding box-gebaseerde visuele prompting om robotische manipulatie te begeleiden. Deze benadering vermindert de complexiteit van scène-begrip terwijl het de uitvoering van taken waarborgt door lichtgewicht, effectieve ruimtelijke aanwijzingen te bieden.
  2. ACT-gebaseerd Adaptief Systeem: De implementatie van ACT om de robotarm in staat te stellen vloeiende, gechunkte actiesequenties uit te voeren die afgeleid zijn van menselijke demonstraties, in plaats van te vertrouwen op rigide, incrementele planning.
  3. Systematisch Evaluatiekader: Een gestructureerde experimentele analyse over drie progressieve niveaus van taakcomplexiteit (Simpele, Complexe en Meer Complexe scenario's) om te evalueren hoe visuele prompting en objectdiversiteit de robotische prestaties beïnvloeden.

Resultaten
Het systeem werd geëvalueerd over drie scenario's met 3x3 arrangementen van producten:

  • Simpel Scenario: Negen vergelijkbare dozen met één geannoteerd doel. Het systeem behaalde een succespercentage van 90%, wat betrouwbaarheid in uniforme omgevingen aantoont.
  • Complex Scenario: Negen diverse producten met één geannoteerd doel. De initiële succespercentages daalden naar 70% door variaties in objecteigenschappen (reflectiviteit, gladheid). Na het verhogen van de demonstratiegegevens met 20% specifiek voor de foutgevallen, verbeterde de prestatie van het systeem aanzienlijk en bereikte het een succespercentage van 100% over alle productcategorieën in dit scenario.
  • Meer Complex Scenario: Negen diverse producten in wisselende posities met zowel geannoteerde pick- als place-locaties. De initiële succesratio was 70%. Vanwege de verhoogde moeilijkheidsgraad hebben de onderzoekers dubbel zoveel menselijk geannoteerde gegevens voor elk product verzameld. Na deze toename van de gegevens verbeterde de prestatie, hoewel specifieke productcategorieën (bijv. reflecterende thee flessen, gladde potten) nog steeds lagere succespercentages (80%) vertoonden vergeleken met rigide dozen (90%).

Foutanalyse
De studie identificeerde specifieke foutmodi, waaronder vingerafwijking, zwakke grijpkracht leidend tot slippen (met name op gladde oppervlakken) en plaatsingsmisalignement. Attention heatmaps toonden aan dat het ACT-model succesvol de focus verschuift van de pick-locatie naar de place-locatie, waarbij de strategie wordt aangepast op basis van visuele prompts. Echter, objecten met reflecterende oppervlakken of zachte texturen vormden hardnekkige uitdagingen, wat leidde tot misalignement en grijpfouten.

Betekenis en Claims
Het artikel beweert dat de combinatie van visuele prompting met action chunking robots in staat stelt om efficiënt te interpreteren en te handelen op basis van minimale maar informatieve annotaties voor real-world manipulatietaken. De voorgestelde methode vertegenwoordigt een stap voorwaarts in het creëren van adaptieve robotische systemen die in staat zijn om complexe objectvariaties te hanteren met verbeterde autonomie en robuustheid.

De auteurs hanteren een bescheiden standpunt met betrekking tot de beperkingen van hun werk. Ze erkennen expliciet dat het systeem data-intensief is en sterk leunt op diverse en hoogwaardige menselijke demonstratiegegevens. Daarom claimt het artikel geen universele generalisatie zonder voldoende trainingsgegevens. Toekomstig werk is geïdentificeerd als gericht op data-augmentatie om datasets kunstmatig uit te breiden, in plaats van het claimen van directe oplossingen voor gegevensschaarste. De studie concludeert dat hoewel de benadering de grijpstabiliteit en plaatsingsnauwkeurigheid verbetert, de effectiviteit verbonden blijft aan de kwaliteit en kwantiteit van de trainingsdemonstraties.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →