← Nieuwste papers
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIM is een visie-taal-gegrond framework dat zachte continuümrobots in staat stelt om complexe interactieve whole-body manipulatie uit te voeren door een diffusie-gebaseerd VLA-beleid te integreren met Visuele Zachte Proprioceptie om uitvoerbare aansturingssequenties te genereren die de intrinsieke compliantie benutten voor robuuste fysieke uitvoering.

Oorspronkelijke auteurs: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Gepubliceerd 2026-09-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van de robotica bestaat er een duidelijke kloof tussen machines die zijn gebouwd met stijve metalen frames en machines die zijn vervaardigd uit zachte, flexibele materialen. Rigide robots, zoals de armen die men in autofabrieken ziet, bewegen met een precieze, vooraf geprogrammeerde zekerheid, maar ze hebben moeite wanneer ze zich door nauwe ruimtes moeten wurmen of delicate, onregelmatige objecten moeten hanteren zonder ze te verpletteren. Soft robots (zachte robots) zijn daarentegen gemaakt van compliant materiaal dat kan buigen, strekken en draaien als levend weefsel. Deze flexibiliteit stelt hen in staat om zich rond objecten te wikkelen en hun vorm aan te passen aan de omgeving, wat een potentiële oplossing biedt voor taken in besloten ruimtes of voor interactie met mensen. Deze flexibiliteit creëert echter een nieuw probleem: het besturen van een lichaam dat op talloze manieren kan vervormen is uiterst moeilijk. Wanneer een mens een eenvoudige opdracht geeft zoals "pak dat eens op", kan een rigide robot één pad berekenen om zijn hand te bewegen. Een soft robot, waarbij het hele lichaam in staat is van vorm te veranderen, moet uitzoeken hoe hij zijn hele vorm moet vervormen om hetzelfde doel te bereiken, een taak die niet alleen begrip vereist van het object, maar ook van de eigen complexe geometrie van de robot in realtime.

Onderzoekers hebben onlangs een nieuw systeem ontwikkeld genaamd SWIM om dit specifieke probleem op te lossen, waarbij ze een soft robot leren om taal en visuele scènes te begrijpen om whole-body manipulatie (manipulatie van het hele lichaam) uit te voeren. Het team richtte zich op een spiraalvormige robot die wordt aangedreven door kabels, vergelijkbaar met hoe spieren aan botten trekken, waardoor de robot kan krullen, reiken en zich om objecten heen kan wikkelen. De kern van de moeilijkheid die zij aanpakten, was dat eerdere methoden vaak probeerden deze robots te besturen door zich alleen te concentreren op de punt van de arm, waarbij de complexe vorm van de rest van het lichaam werd genegeerd. Deze aanpak faalde omdat de positie van de punt de manier waarop de rest van de robot gebogen is of hoe deze de wereld aanraakt, niet volledig beschrijft. Om dit op te lossen, creëerden de onderzoekers een leersysteem dat tegelijkertijd naar de volledige lichaamsvorm van de robot, de visuele scène en een gesproken instructie kijkt. Ze trainden dit systeem in een gesimuleerde omgeving waar de robot duizenden keren kon oefenen, waarbij het leerde om een reeks kabelbewegingen te voorspellen die een doel zouden bereiken, zoals het wegpakken van een object, het reiken naar een doelwit of het grijpen ervan.

Een belangrijke innovatie in hun methode is een techniek die ze "visuele zachte proprioceptie" noemen. In eenvoudige termen betekent dit dat de robot leert om zijn eigen lichaamsvorm te "zien" vanuit een camerabeeld, wat de interne kennis van de kabels aanvult. Tijdens de training gebruikte het systeem de huidige peeslengte-vector als proprioceptieve input om de configuratie te begrijpen, terwijl het tegelijkertijd de exacte coördinaten van verschillende punten langs het lichaam van de robot in de simulatie werd getoond. Door het computermodel te dwingen te voorspellen waar deze punten zich bevonden, leerde het systeem een mentale kaart van de geometrie van de robot bij te houden. Dit stelde het systeem in staat om te begrijpen dat om een specifiek object te bereiken, de robot het middelste gedeelte anders zou moeten krullen dan wanneer het iets weg zou moeten pakken. Daarnaast leerde het systeem, in plaats van te proberen één enkel, perfect pad naar een doel te voorspellen, een reeks mogelijke succesvolle bewegingen te voorspellen. Dit is cruciaal omdat er met een zacht lichaam vaak veel verschillende manieren zijn om een object te omwikkelen, en het systeem flexibel genoeg moest zijn om elke geldige optie te kunnen kiezen in plaats. vast te lopen op één rigide plan.

De onderzoekers testten deze aanpak op twee manieren: eerst in een computersimulatie, en daarna op de werkelijke fysieke robot. In de simulatie was het systeem opmerkelijk succesvol; het voltooide verpakkingsopdrachten in 100% van de gevallen, reikte naar doelwitten in 96% van de gevallen en greep objecten in 88% van de gevallen. Deze resultaten waren aanzienlijk beter dan andere methoden die geen gebruik maakten van lichaamsvormbewustzijn of het flexibele voorspellingsmodel. De echte test kwam echter toen ze het systeem naar de echte wereld verplaatsten. Toen ze probeerden de hersenen van de robot direct op de fysieke machine te laten draaien, door de camera en motoren in realtime te verbinden, daalde de prestatie scherp. De robot slaagde er niet in objecten te grijpen in 75% van de pogingen, grotendeels omdat de kleine vertragingen in de verwerking en de verschillen tussen de simulatie en de werkelijkheid ervoor zorgden dat de robot handelde op basis van verouderde informatie.

Om dit te overwinnen, introduceerden de onderzoekers een slimme implementatiestrategie. In plaats van de robot te vragen om in realtime na te denken en te reageren terwijl hij beweegt, laten ze hem eerst de volledige sequentie van bewegingen in een virtuele simulatie plannen. De robot bekijkt de echte wereld, maakt een digitale tweeling van de scène en doorloopt vervolgens de taak in zijn geest, waarbij hij een volledige lijst met commando's genereert. Zodra deze volledige sequentie gereed is, voert de robot deze uit zonder te stoppen om weer te kijken of na te denken. Omdat het lichaam van de robot van nature zacht en flexibel is, kan het kleine botsingen en contactvariaties zelfstandig opvangen zonder constante computercorrectie nodig te hebben. Wanneer ze deze "plan en voer uit"-methode gebruikten, schoten de succespercentages van de fysieke robot omhoog naar 100% voor verpakken, 80% voor reiken en 75% voor grijpen. Dit toonde aan dat door een diep begrip van de eigen vorm te combineren met een strategie die gebruikmaakt van de natuurlijke fysieke flexibiliteit, soft robots door eenvoudige taal kunnen worden aangestuurd om complexe, whole-body taken uit te voeren die voorheen onbereikbaar waren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →