← Nieuwste papers
💻 computer science

Ludi0.1{}_{\scriptscriptstyle 0.1}: An Agentic System for Socially Intelligent Robots

Het artikel introduceert Ludi0.1{}_{\scriptscriptstyle 0.1}, een agentisch systeem dat een gefinetuned vision-language model combineert met gespecialiseerde navigatie- en manipulatietools om sociaal intelligente robots in staat te stellen omgaan met ambigue, meerregelige menselijke interacties door middel van contextbewuste redenering en adaptief gedrag.

Oorspronkelijke auteurs: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Le
Gepubliceerd 2026-08-25
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Lee, Sangheon Lee, Robert Nowak, Junha Roh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Decennialang werd de droom van een behulpzame robot beperkt door een simpele realiteit: machines zijn uitstekend in het opvolgen van strikte instructies, maar verschrikkelijk in het begrijpen van de chaotische, veranderlijke aard van menselijke conversatie. Als je een traditionele robot vertelt om "het rode blikje te brengen", zal hij het rode blikje vinden en brengen, zelfs als je halverwege het proces van gedachten verandert. Het mist de sociale intelligentie om te beseffen dat je intentie is geëvolueerd, om zijn actie te pauzeren en zijn gedrag aan te passen op basis van een nieuw stukje informatie. Deze kloof tussen rigide programmering en vloeiende menselijke interactie is de centrale uitdaging die onderzoekers nu proberen op te lossen. Het vakgebied beweegt zich verder dan het leren van robots om simpelweg te zien en te bewegen; het nieuwe doel is om hen te leren luisteren, te onthouden, te redeneren en van gedachten te veranderen in realtime, precies zoals mensen dat doen wanneer zij samenwerken.

Een team bij Ludo Robotics heeft een belangrijke stap gezet richting dit doel met een nieuw systeem genaamd Ludi0.1. Dit is niet één enkele stuk software die alles tegelijk probeert te doen, maar eerder een gecoördineerd team van gespecialiseerde instrumenten die samenwerken onder de leiding van een centraal "brein". Dit brein is een type kunstmatige intelligentie dat getraind is om zowel afbeeldingen als taal te begrijpen, maar het is specifiek geleerd hoe het de heen-en-weer-interactie van een echt gesprek moet afhandelen. De onderzoekers bouwden een systeem waarbij dit brein kan kijken naar wat het ziet, luisteren naar wat een persoon zegt, onthouden wat er een moment geleden gebeurde, en vervolgens beslissen of het moet spreken, bewegen, iets oppakken of wachten. De cruciale innovatie is dat het systeem is ontworpen om onderbrekingen en correcties te verwerken. Als een persoon om een Coke begint te vragen, en de robot begint ernaar te reiken, maar de persoon zegt plotseling: "Eigenlijk geeft ze de voorkeur aan Pepsi," begrijpt Ludi0.1 dat het oude plan niet langer geldig is. Het stopt met het reiken naar de Coke, schakelt de focus over naar de Pepsi en vervolgt de taak met de nieuwe instructie, allemaal zonder de flow van de interactie te verbreken.

Om dit te bouwen, vertrouwden de onderzoekers niet op één enkel, massaal model dat alles vanaf nul probeert te leren. In plaats daarvan creëerden ze een structuur waarbij een centraal redeneermodel fungeert als een manager. Deze manager ontvangt een stroom van informatie: een live videofeed van de ogen van de robot, de tekst van wat de mens zojuist heeft gezegd, en een verslag van alles wat de robot tot nu toe heeft gedaan of gedacht. Op basis van dit volledige plaatje beslist de manager welk instrument als volgende gebruikt moet worden. Deze instrumenten zijn gespecialiseerde programma's voor specifieke taken, zoals controleren of een object binnen handbereik is, navigeren naar een genoemde kamer zoals de slaapkamer, of daadwerkelijk een object grijpen. De manager kan besluiten een verhelderende vraag te stellen, of kan besluiten naar een bureau te lopen. Cruciaal is dat het systeem is gebouwd om lokaal te draaien op een lokale GPU-werkstation verbonden met de robot, wat betekent dat het geen verbinding met het internet nodig heeft om na te denken of te handelen. Dit stelt de robot in staat om direct te reageren, zelfs terwijl hij midden in een zin spreekt of beweegt.

Het team testte dit systeem op een Unitree G1, een humanoïde robot die staat en loopt als een mens. Ze creëerden een simulatie van een huiselijke omgeving om de robot te trainen, waarbij duizenden voorbeelden van complexe interacties werden gegenereerd. In deze trainingsscenario's oefende de robot met het afhandelen van ambigue verzoeken, het omgaan met correcties tijdens een taak en het beheren van taken met meerdere stappen. Bijvoorbeeld, de robot leerde dat als een gebruiker zegt "breng de middelste laptop", hij eerst de scène moet analyseren om te identificeren welke laptop in het midden staat voordat hij probeert hem op te pakken. De trainingsdata bevatten situaties waarin de gebruiker van gedachten veranderde, de robot onderbrak of nieuwe informatie gaf terwijl de robot al aan het handelen was. De onderzoekers ontdekten dat door hun centrale redeneermodel te verfijnen op deze specifieke interactiepatronen, de robot veel beter werd in het succesvol voltooien van taken. In hun tests slaagde het systeem erin om 20 van de 28 complexe scenario's van begin tot eind te voltooien, een aanzienlijke verbetering ten opzichte van de ongetrainde versie van hetzelfde model.

Het succes van Ludi0.1 ligt in het vermogen om de conversatie en de fysieke actie in dezelfde realiteit te houden. De robot spreekt niet alleen woorden; het spreekt woorden die direct gekoppeld zijn aan wat het ziet en wat het doet. Als de robot naar een kamer loopt, kan het uitleggen waar het naartoe gaat. Als het een object niet kan bereiken, kan het dat eerlijk zeggen. Het systeem houdt een gedeelde geschiedenis van de interactie bij, waardoor het kan onthouden dat de gebruiker oorspronkelijk een Coke wilde maar toen overstapte naar Pepsi. Dit geheugen is niet slechts een lijst met feiten; het is een levende context die elke nieuwe beslissing van de robot vormgeeft. De onderzoekers demonstreerden dit in een test in de echte wereld waarbij een gebruiker de robot vroeg om een drankje naar een persoon in een slaapkamer te brengen. Toen de gebruiker de bestelling corrigeerde van Coke naar Pepsi terwijl de robot al naar het eerste blikje reikte, stopte de robot onmiddellijk, schakelde over naar het juiste drankje, navigeerde naar de slaapkamer en plaatste het drankje op het bureau, terwijl het tegelijkertijd zijn acties aan de gebruiker uitlegde.

Hoewel het systeem indrukwekkend is, zijn de onderzoekers duidelijk over de huidige beperkingen. De intelligentie van de robot is een mix van een centraal brein en aparte, gespecialiseerde instrumenten. Het brein beslist wat te doen, en de instrumenten voeren het werk uit, maar ze zijn nog niet één enkel, verenigd bewustzijn. Deze scheiding kan soms vertragingen veroorzaken of het gedrag van de robot enigszins gefragmenteerd laten aanvoelen, alsof verschillende delen van het systeem met elkaar praten in plaats van als één geheel te handelen. Het team erkent dat de volgende stap het bewegen voorbij deze modulaire aanpak is. Ze werken naar een toekomstige versie, Ludi 1.0, die een enkel fundamenteel model zou zijn dat perceptie, taal, geheugen en fysieke controle diep integreert in één samenhangend systeem. Voor nu dient Ludi0.1 als een werkend prototype en een bron van waardevolle gegevens. Door te observeren hoe de robot met mensen interageert, verzamelen de onderzoekers de soorten real-world traces die nodig zijn om die volgende generatie werkelijk geïntegreerde sociale robots te trainen.

Het werk gepresenteerd in dit artikel laat zien dat vloeiende mens-robot samenwerking vandaag de dag mogelijk is, mits het systeem is ontworpen om de onvoorspelbaarheid van menselijke intentie te kunnen afhandelen. De onderzoekers hebben aangetoond dat door een redeneerkern te combineren met gespecialiseerde fysieke vaardigheden en een robuust geheugen van de interactie, een robot kan aanpassen aan veranderingen midden in een taak. Dit is geen opgelost probleem, en het huidige systeem vertrouwt nog steeds op een gestructureerde architectuur in plaats van een volledig geleerde, verenigde intelligentie. Echter, de resultaten suggereren een duidelijke weg vooruit. Het vermogen om te pauzeren, te luisteren, te herzien en door te gaan is niet langer alleen een theoretisch concept; het is een capaciteit die nu gebouwd en getest kan worden. Terwijl het team deze systemen blijft verfijnen, wordt de kloof tussen de rigide machines uit het verleden en de collaboratieve partners van de toekomst steeds kleiner.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →