← Nieuwste papers
💻 computer science

A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models

Dit artikel introduceert een gedistribueerd, op ROS 2 gebaseerd conversationeel framework dat lokale taal- en visie-taalmodellen integreert om vrije menselijke commando's te vertalen naar geverifieerde robotische manipulatieacties op een Franka FR3-platform, voorzien van een webdashboard voor expliciete bevestiging door de operator en visualisatie van tussenliggende intenties.

Oorspronkelijke auteurs: Arash Ghasemzadeh Kakroudi, Roel Pieters

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Arash Ghasemzadeh Kakroudi, Roel Pieters

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robotarm voor als een zeer sterke, zeer nauwkeurige, maar een tikkeltje letterlijke assistent. Je wilt tegen de robot zeggen: "pak die rode dobbelsteen," maar als je dat zomaar roept, kan de robot in de war raken, het verkeerde ding pakken, of zichzelf beschadigen terwijl hij probeert te begrijpen wat je bedoelt.

Dit artikel presenteert een nieuwe manier om met robots te praten die werkt als een zeer georganiseerd team van specialisten die samenwerken, in plaats van één gigantisch brein dat alles tegelijk probeert te doen. Zo werkt het, onderverdeeld in eenvoudige concepten:

1. De "Assemblagelijn" van Breinen

In plaats van één massieve computer die probeert je stem te begrijpen, de kamer te zien en de robot te bewegen tegelijkertijd, hebben de auteurs de taak verdeeld in vier afzonderlijke "stations" (genaamd nodes) die met elkaar communiceren. Denk aan een keuken in een restaurant:

  • De Ober (Taalmodel): Je vertelt de ober: "Ik wil de gele dobbelsteen." De ober weet niet hoe een dobbelsteen eruitziet, maar is erg goed in het begrijpen van je woorden. De ober schrijft een duidelijke bestelling op: "Actie: Pakken. Object: Gele Dobbelsteen."
  • De Oog-expert (Visiemodel): De ober overhandigt de bestelling aan de Oog-expert. Deze persoon kijkt naar de camerabeelden en zegt: "Ah, ik zie de gele dobbelsteen. Hij ligt hier precies op deze specifieke coördinaten." De expert tekent een klein cirkeltje om het object op een scherm.
  • De Manager (Coördinator): Dit is de belangrijkste persoon. De manager neemt de bestelling van de ober en de locatie van de Oog-expert, controleert alles dubbel, en stopt dan. De manager laat de robot nog niet bewegen.
  • De Chef (Bewegingsuitvoerder): Pas nadat de Manager "Ga" zegt, reikt de Chef (de robotarm) uit om het object te pakken.

2. De "Veiligheidspoort" (Het Belangrijkste Deel)

Het grootste risico bij AI-robots is dat ze kunnen "hallucineren"—dat wil zeggen dat ze vol vertrouwen het verkeerde kunnen zeggen. Als de Oog-expert denkt dat een rode blokje een gele dobbelsteen is, pakt de robot misschien het verkeerde ding.

Om dit op te lossen, heeft het systeem een Veiligheidspoort. Voordat de robot ook maar één spier beweegt, laat de "Manager" je een afbeelding zien op een webdashboard. Het benadrukt precies wat de robot denkt dat hij gaat pakken.

  • Jij ziet: "Ik ga de gele dobbelsteen op deze plek pakken."
  • Jij klikt: "Ja, dat klopt."
  • De robot beweegt.

Als je ziet dat het fout is, kun je "Nee" zeggen, en de robot stopt. Dit zorgt ervoor dat een verwarde AI nooit een fysiek ongeluk veroorzaakt.

3. De "Gedistribueerde" Opstelling

De auteurs hebben deze opstelling getest op verschillende soorten computers om te zien wat het beste werkt.

  • Het taalgedeelte (het begrijpen van woorden) is licht genoeg om te draaien op een kleine, draagbare computer (zoals een high-tech tablet) direct naast de robot.
  • Het visiegedeelte (het kijken naar afbeeldingen) is zwaar en heeft een krachtige, grote computer nodig met een luxe videokaart (zoals een gaming PC) om de beelden snel te verwerken.

Door ze te splitsen, kunnen ze het "zware werk" op de grote computer leggen en het "luisteren" op de kleinere, waardoor het hele systeem sneller en flexibeler wordt.

4. Wat Ze Hebben Getest

Ze hebben dit systeem getest met een Franka-robotarm en wat dobbelstenen. Ze probeerden drie scenario's:

  1. Enkel object: Slechts één dobbelsteen op de tafel.
  2. Meerdere objecten: Verschillende dobbelstenen verspreid over de tafel.
  3. Overlappende objecten: Gestapelde dobbelstenen bovenop elkaar (het moeilijkste scenario).

De Resultaten:

  • Wanneer ze hun beste combinatie van computers en AI-modellen gebruikten, pakte de robot de dobbelstenen succesvol, plaatste en overhandigde ze 1eld keer, zelfs wanneer de dobbelstenen op elkaar gestapeld waren.
  • Wanneer ze andere, zwakkere AI-modellen gebruikten of alles op één trage computer zetten, maakte de robot fouten of bewoog hij te langzaam.
  • Het systeem was snel genoeg om responsief aan te voelen, waarbij het ongeveer 5 tot 10 seconden duurde om een commando te begrijpen, het object te vinden en klaar te staan om te bewegen.

5. Wat Het Nog Niet Kan

De auteurs zijn eerlijk over de beperkingen. De robot is goed in eenvoudige commando's zoals "pak de rode dobbelsteen" of "leg hem links van de blauwe".

  • Het heeft moeite met complexe logica, zoals "Pak de dobbelsteen alleen op als deze een hoger nummer heeft dan de dobbelsteen ernaast."
  • Het onthoudt geen eerdere gesprekken. Als je zegt "Pak de dobbelsteen op," en daarna "Doe het opnieuw," weet de robot niet dat je het over dezelfde dobbelsteen hebt tenzij je dat opnieuw zegt.

De Kern van het Verhaal

Dit artikel gaat niet over het bouwen van een robot die perfect uit zichzelf kan denken. Het gaat over het bouwen van een veilig, transparant en flexibel systeem waarbij mensen de controle houden. Door het werk te verdelen tussen verschillende computers en een mens te dwingen om het plan van de robot te controleren voordat hij beweegt, hebben ze een manier gecreëerd waarop robots onze alledaagse taal kunnen begrijpen zonder het risico te lopen dat ze per ongeluk iets gevaarlijks doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →