← Neueste Arbeiten
💻 computer science

Ludi0.1{}_{\scriptscriptstyle 0.1}: An Agentic System for Socially Intelligent Robots

Das Papier stellt Ludi0.1{}_{\scriptscriptstyle 0.1} vor, ein agentisches System, das ein fein abgestimmtes Vision-Language-Modell mit spezialisierten Navigations- und Manipulationswerkzeugen kombiniert, um sozial intelligenten Robotern zu ermöglichen, durch kontextsensitive Argumentation und adaptives Verhalten mehrdeutige, mehrstufige menschliche Interaktionen zu bewältigen.

Ursprüngliche Autoren: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Le
Veröffentlicht 2026-08-25
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Lee, Sangheon Lee, Robert Nowak, Junha Roh

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Seit Jahrzehnten wird der Traum von einem hilfreichen Roboter durch eine einfache Realität begrenzt: Maschinen sind exzellent darin, strikten Anweisungen zu folgen, aber schrecklich darin, die chaotische, sich ständig ändernde Natur menschlicher Konversation zu verstehen. Wenn man einem traditionellen Roboter sagt: „Bring mir die rote Dose“, wird er die rote Dose finden und bringen, selbst wenn man seine Meinung während des Vorgangs ändert. Ihm fehlt die soziale Intelligenz, um zu erkennen, dass sich die Absicht des Nutzers geändert hat, den Vorgang zu unterbrechen und sein Verhalten basierend auf einer neuen Information anzupassen. Diese Lücke zwischen starrer Programmierung und fließender menschlicher Interaktion ist die zentrale Herausforderung, die Forscher nun zu lösen versuchen. Das Feld bewegt sich über das bloße Lehren von Robotern, zu sehen und sich zu bewegen, hinaus; das neue Ziel ist es, sie zu lehren, zuzuhören, sich zu erinnern, zu denken und ihre Meinung in Echtzeit zu ändern, genau wie Menschen es tun, wenn sie zusammenarbeiten.

Ein Team bei Ludo Robotics hat mit einem neuen System namens Ludi0.1 einen bedeutenden Schritt in Richtung dieses Ziels gemacht. Dies ist nicht eine einzige Software, die versucht, alles gleichzeitig zu erledigen, sondern vielmehr ein koordiniertes Team aus spezialisierten Werkzeugen, die unter der Anleitung eines zentralen „Gehirns“ zusammenarbeiten. Dieses Gehirn ist eine Art künstliche Intelligenz, die darauf trainiert wurde, sowohl Bilder als als auch Sprache zu verstehen, wobei es speziell darauf trainiert wurde, den Austausch einer echten Konversation zu bewältigen. Die Forscher entwickelten ein System, bei dem dieses Gehirn sehen kann, was es sieht, hören kann, was eine Person sagt, sich erinnern kann, was vor einem Moment geschah, und dann entscheiden kann, ob es sprechen, sich bewegen, etwas aufheben oder warten soll. Die entscheidende Innovation ist, dass das System darauf ausgelegt ist, Unterbrechungen und Korrekturen zu verarbeiten. Wenn eine Person beginnt, nach einer Coke zu fragen, und der Roboter gerade danach greift, die Person aber plötzlich sagt: „Eigentlich bevorzugt sie Pepsi“, versteht Ludi0.1, dass der alte Plan nicht mehr gültig ist. Es hört auf, nach der Coke zu greifen, wechselt seinen Fokus auf die Pepsi und setzt die Aufgabe mit der neuen Anweisung fort, ohne dabei den Fluss der Interaktion zu unterbrechen.

Um dies zu bauen, verließen sich die Forscher nicht auf ein einziges, massives Modell, das versucht, alles von Grund auf zu lernen. Stattdessen schufen sie eine Struktur, in der ein zentrales Denkmodell als Manager fungiert. Dieser Manager erhält einen Informationsstrom: einen Live-Videofeed von den Augen des Roboters, den Text dessen, was der Mensch gerade gesagt hat, und eine Aufzeichnung dessen, was der Roboter bisher getan oder gedacht hat. Basierend auf diesem Gesamtbild entscheidet der Manager, welches Werkzeug als Nächstes eingesetzt wird. Diese Werkzeuge sind spezialisierte Programme für spezifische Aufgaben, wie etwa zu prüfen, ob sich ein Objekt in Reichweite des Arms befindet, zu einem benannten Raum wie dem Schlafzimmer zu navigieren oder tatsächlich ein Objekt zu greifen. Der Manager könnte entscheiden, eine klärende Frage zu stellen, oder er könnte entscheiden, zu einem Schreibtisch zu gehen. Entscheidend ist, dass das System auf einer lokalen GPU-Workstation vor Ort betrieben werden kann, die mit dem Roboter verbunden ist, was bedeutet, dass es nicht auf eine Internetverbindung warten muss, um zu denken oder zu handeln. Dies ermöglicht es dem Roboter, sofort zu reagieren, selbst während er spricht oder sich bewegt.

Das Team testete dieses System an einem Unitree G1, einem humanoiden Roboter, der steht und wie ein Mensch geht. Sie erstellten eine Simulation einer häuslichen Umgebung, um den Roboter zu trainen, und generierten tausende Beispiele komplexer Interaktionen. In diesen Trainingsszenarien übte der Roboter den Umgang mit zweideutigen Anfragen, den Umgang mit Korrekturen während der Aufgabe und das Management von mehrstufigen Erledigungen. Beispielsweise lernte der Roboter, dass er, wenn ein Nutzer sagt: „Bring den mittleren Laptop“, zuerst die Szene scannen muss, um zu identifizieren, welcher Laptop in der Mitte steht, bevor er versuchen kann, ihn aufzuheben. Die Trainingsdaten beinhalteten Situationen, in denen der Nutzer seine Meinung änderte, den Roboter unterbrach oder neue Informationen lieferte, während der Roboter bereits handelte. Die Forscher fanden heraus, dass der Roboter durch das Fine-Tuning seines zentralen Denkmodells auf diese spezifischen Interaktionsmuster wesentlich besser darin wurde, Aufgaben erfolgreich abzuschließen. In ihren Tests konnte das System 20 von 28 komplexen Szenarien Ende-zu-Ende bewältigen, was eine signifikante Verbesserung gegenüber der ungetrainierten Version desselben Modells darstellt.

Der Erfolg von Ludi0.1 liegt in seiner Fähigkeit, die Konversation und die physische Handlung in derselben Realität zu verankern. Der Roboter spricht nicht nur Worte; er spricht Worte, die direkt mit dem verknüpft sind, was er sieht und was er tut. Wenn der Roboter in einen Raum geht, kann er erklären, wohin er geht. Wenn er ein Objekt nicht erreichen kann, kann er dies ehrlich sagen. Das System führt eine gemeinsame Historie der Interaktion auf, was es ihm ermöglicht, sich daran zu erinnern, dass der Nutzer ursprünglich eine Coke wollte und dann zu Pepsi wechselte. Dieses Gedächtnis ist nicht nur eine Liste von Fakten; es ist ein lebendiger Kontext, der jede neue Entscheidung des Roboters formt. Die Forscher demonstrierten dies in einem realen Test, bei dem ein Nutzer den Roboter bat, ein Getränk zu einer Person im Schlafzimmer zu bringen. Als der Nutzer die Bestellung von Coke auf Pepsi korrigierte, während der Roboter bereits nach der ersten Dose griff, stoppte der Roboter sofort, wechselte zum richtigen Getränk, navigierte zum Schlafzimmer und stellte das Getränk auf den Schreibtisch, während er gleichzeitig seine Handlungen gegenüber dem Nutzer erklärte.

Obwohl das System beeindruckend ist, sind sich die Forscher über seine derzeitigen Grenzen bewusst. Die Intelligenz des Roboters ist eine Mischung aus einem zentralen Gehirn und separaten, spezialisierten Werkzeugen. Das Gehirn entscheidet, was zu tun ist, und die Werkzeuge erledigen die Arbeit, aber sie sind noch kein einziger, vereinter Geist. Diese Trennung kann manchmal zu Verzögerungen führen oder dazu führen, dass sich das Verhalten des Roboters etwas fragmentiert anfühlt, als würden verschiedene Teile des Systems miteinander kommunizieren, anstatt als eine Einheit zu agieren. Das Team räumt ein, dass der nächste Schritt darin besteht, über diesen modularen Ansatz hinauszugehen. Sie arbeiten an einer zukünftigen Version, Ludi 1.0, die ein einzelnes Fundamentmodell sein wird, das Wahrnehmung, Sprache, Gedächtnis und physische Kontrolle tief in einem kohärenten System integriert. Für den Moment dient Ludi0.1 als funktionierender Prototyp und als Quelle wertvoller Daten. Indem sie beobachten, wie der Roboter mit Menschen interagiert, sammeln die Forscher die Arten von realen Spuren, die benötigt werden, um die nächste Generation wahrhaft integrierter sozialer Roboter zu trainieren.

Die in dieser Arbeit vorgestellte Arbeit zeigt, dass eine fließende Mensch-Roboter-Kollaboration heute möglich ist, vorausgesetzt, das System ist darauf ausgelegt, die Unvorhersehbarkeit menschlicher Absichten zu bewältigen. Die Forscher haben gezeigt, dass ein Roboter durch die Kombination eines Denkkerns mit spezialisierten physischen Fähigkeiten und einem robusten Gedächtnis der Interaktion an Veränderungen während einer Aufgabe angepasst werden kann. Dies ist kein gelöstes Problem, und das aktuelle System beruht immer noch auf einer strukturierten Architektur statt auf einer vollständig gelernten, vereinheitlichten Intelligenz. Die Ergebnisse legen jedoch einen klaren Weg nach vorn nahe. Die Fähigkeit zu pausieren, zuzuhören, zu revidieren und fortzufahren, ist nicht mehr nur ein theoretisches Konzept; es ist eine Fähigkeit, die man jetzt bauen und testen kann. Während das Team diese Systeme weiter verfeinert, verringert sich die Lücke zwischen den starren Maschinen der Vergangenheit und den kollaborativen Partnern der Zukunft stetig.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →