← Nieuwste papers
💬 NLP

ALRM: Agentic LLM for Robotic Manipulation

Dit artikel introduceert ALRM, een agentic LLM-framework dat natuurlijke taalredenering en robotische manipulatie overbrugt via een modulaire ReAct-stijl loop die zowel Code-as-Policy als Tool-as-Policy executiemodi ondersteunt, gevalideerd door een nieuwe benchmark van 56 taalkundig diverse taken.

Oorspronkelijke auteurs: Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat, Hamza Yous, Samy Teffahi, Hakim Hacid

Gepubliceerd 2026-01-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat, Hamza Yous, Samy Teffahi, Hakim Hacid

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde robotassistent hebt. Je wilt dat de robot je keuken opruimt, maar in plaats van een rigide, vooraf geschreven script te geven zoals "Pak lepel op, beweeg naar gootsteen," zeg je gewoon: "Hé, zou je alsjeblieft deze vuile borden willen afruimen?"

Lange tijd hadden robots hier moeite mee. Ze waren als acteurs die een script uit het hoofd hadden geleerd, maar die vastliepen als er één woord werd veranderd. Als je zei "gooi de plaat weg" in plaats van "beweeg de plaat", kon de robot bevriezen.

Dit artikel introduceert een nieuw systeem genaamd ALRM (Agentic LLM for Robotic Manipulation) dat robots leert hoe ze moeten denken, plannen en in real-time kunnen aanpassen, net zoals een mens dat doet.

De twee manieren waarop de robot "denkt"

De onderzoekers ontdekten dat de robot jouw verzoek op twee verschillende manieren kan afhandelen, als twee verschillende werkstijlen:

  1. De "Code Schrijver" (Code-as-Policy):
    Stel je voor dat de robot een programmeur is. Wanneer je het hem een taak geeft, schrijft hij direct een kort computerprogramma (een script) om het probleem op te lossen en drukt hij op "run". Het is snel en efficiënt, zoals een chef die het recept uit het hoofd kent en de hele maaltijd in één keer bereidt. Echter, als hij een kleine typefout in het recept maakt, kan het hele gerecht aanbranden en moet hij opnieuw beginnen.

  2. De "Gereedschap Gebruiker" (Tool-as-Policy):
    Stel je voor dat de robot een detective is. In plaats van een heel script te schrijven, breekt hij de taak op in kleine stapjes. Hij zegt: "Eerst ga ik op zoek naar het bord. Oké, ik heb het gevonden. Nu ga ik het oppakken. O wacht, mijn hand gleed uit. Laat me het opnieuw proberen." Hij gebruikt een "gereedschap" om één klein ding te doen, controleert het resultaat, en beslist dan wat de volgende stap is. Dit is langzamer omdat het meer tijd kost om na te denken, maar het is veel beter in het herstellen van fouten tijdens het proces.

De "Hersenen" van de operatie

Het systeem gebruikt een speciale "hersenen" (een Large Language Model, of LLM) die fungeert als een projectmanager.

  • De Planner: Dit deel luistert naar jouw verzoek ("Maak de tafel schoon") en breekt dit af in kleine, logische stappen ("Zoek de beker", "Pak de beker op", "Zet beker in de gootsteen").
  • De Executor: Dit deel voert het eigenlijke werk uit, ofwel door de code uit te voeren die de planner heeft geschreven, ofwel door de "gereedschappen" stap voor stap te gebruiken.
  • De Loop: Als de robot de beker laat vallen, vertelt de Executor aan de Planner: "Ik heb hem laten vallen." De Planner zegt dan: "Oké, laten we proberen hem opnieuw op te pakken," en de cyclus gaat door totdat de taak voltooid is.

Het "Examen" dat ze de robots gaven

Om te zien of dit systeem echt werkt, hebben de onderzoekers de robots niet alleen getest met eenvoudige commando's. Ze creëerden een lastig "examen" met 56 verschillende taken in drie verschillende virtuele kamers (een keuken, een opslagplaats voor dozen en een fruitmand).

Ze testten de robots met instructies die waren:

  • Simpel: "Pak de citroen."
  • Lastig: "Grijp het zure fruit en het grote fruit." (De robot moet uitzoeken welk fruit zuur is en welk fruit groot is zonder dat de namen worden genoemd).
  • Gezellig/Praatgraag: "Hé, dit fruit is aan het rotten! Gooi de citroen en de perzik in de prullenbak!" (De robot moet de extra praatjes negeren en zich concentreren op de actie).

Ze testten 10 verschillende "hersenen" (AI-modellen), variërend van enorme, krachtige modellen (zoals Claude-4.1-Opus) tot kleinere, lichtere modellen die op een enkele computer kunnen draaien (zoals Falcon-H1-7B).

De Resultaten: Wie won er?

  • De Krachtpatser: Het grootste, duurste AI-model (Claude-4.1-Opus) was het beste in de "Gereedschap Gebruiker"-methode. Het loste bijna 94% van de taken op, zelfs de lastige, maar het duurde wat langer om na te denken omdat het zo grondig was.
  • De Snelheidsduivel: Het kleinere, open-source model (Falcon-H1-7B) was een verrassende ster. Wanneer het de "Code Schrijver"-methode gebruikte, loste het 84% van de taken op en deed het dit veel sneller dan de grote modellen. Het was bijna net zo goed als de gigantische modellen, maar had geen supercomputer nodig om te draaien.
  • De Strijd: De kleinere modellen hadden moeite met de "Gereedschap Gebruiker"-methode. Ze raakten in de war wanneer ze na elke kleine stap moesten stoppen en nadenken, waardoor ze vaak niet in staat waren de taak te voltooien.

De Kern van het Verhaal

Dit artikel laat zien dat we robots niet langer moeten dwingen om rigide scripts te volgen. Door ze een "agentic" brein te geven dat kan plannen, gereedschappen kan gebruiken en code kan schrijven, kunnen robots natuurlijke taal begrijpen, met fouten omgaan en complexe, meerstaps puzzels oplossen zoals het schoonmaken van een rommelige tafel.

De studie concludeert dat je voor de beste resultaten een krachtig cloud-gebaseerd AI-model kunt gebruiken voor complexe redenering, of een kleiner, lokaal AI-model als je snelheid nodig hebt en bereid bent iets eenvoudigere taken uit te voeren. Het is een grote stap richting robots die daadwerkelijk kunnen begrijpen wat we bedoelen, en niet alleen wat we zeggen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →