← Neueste Arbeiten
🤖 machine learning

Efficient Vision-Language-Action Management and Serving for Robot Factories

Das Paper stellt Robion vor, ein neuartiges Serving- und Managementsystem für Multi-Roboter-, Multi-Modell-Vision-Language-Action (VLA)-Workloads auf Edge-Servern, das Intra-GPU-Stagedisaggregation und intelligente Verkehrssteuerung einsetzt, um die Roboterlast zu maximieren und gleichzeitig strikt die Millisekunden-Skala-Sicherheits-Service-Level-Objectives (SLOs) einzuhalten.

Ursprüngliche Autoren: Dionysios Adamopoulos, Nattapol Chanpaisit, Basel Fakhri, Christina Giannoula

Veröffentlicht 2026-09-14
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Dionysios Adamopoulos, Nattapol Chanpaisit, Basel Fakhri, Christina Giannoula

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Fabrikhalle vor, in der Maschinen nicht nur starren, vorprogrammierten Befehlen folgen, sondern die Welt sehen, Anweisungen in natürlicher Sprache verstehen und entscheiden, wie sie ihre Arme bewegen, um ein Teil aufzunehmen oder eine Komponente zu montieren. Dies ist das Versprechen der physischen künstlichen Intelligenz, einem Bereich, in dem Roboter mit „Vision-Language-Action“-Modellen ausgestattet sind. Diese Systeme fungieren als das Gehirn des Roboters, nehmen ein Kamerabild und einen Text-Prompt wie „Hebe die rote Box auf“ entgegen und berechnen dann die präzisen physischen Bewegungen, die erforderlich sind, um die Aufgabe zu erfüllen. Damit diese Roboter sicher und effektiv arbeiten können, müssen sie im Bruchteil einer Sekunde reagieren. Wenn das Gehirn zu lange zum Nachdenken braucht, könnte der Roboter seinen Arm ruckartig bewegen, ein Objekt fallen lassen oder sogar eine ganze Montagestraße stoppen, was kostspielige Verzögerungen oder Sicherheitsrisiken verursacht.

Die Herausforderung besteht darin, dass die Computer, die leistungsstark genug sind, um diese Denkmodelle auszuführen, zu schwer, zu teuer und zu stromhungrig sind, um direkt an den Roboter geschnallt zu werden. Stattdessen haben Ingenieure vorgeschlagen, die Gedanken des Roboters an einen nahegelegenen lokalen Server zu senden – eine Art digitales Gehirnzentrum –, der die schwere Arbeit erledigt und die Antworten zurückschickt. Dieses Setup schafft jedoch ein neues Problem: Wie verwaltet man einen einzelnen Server, der Dutzende von Robotern gleichzeitig bedienen muss, wobei sichergestellt werden muss, dass jede einzelne Anfrage schnell genug beantwortet wird, um den Betrieb der Fabrik reibungslos aufrechtzuerhalten? Ein neues System namens Robion wurde entwickelt, um genau dieses Rätsel zu lösen, indem es einem einzelnen Server ermöglicht, viele verschiedene Roboteraufgaben gleichzeitig zu bewältigen, ohne dabei den Anschluss zu verlieren.

Die Forscher hinter Robion entdeckten, dass die Arbeitsweise dieser Robotergehirne sich grundlegend von den Large Language Models unterscheidet, die für Chatbots verwendet werden, oder von den massiven Bildgeneratoren, die für Kunst eingesetzt werden. Während diese Systeme oft hunderte Millisekunden oder sogar Sekunden laufen, findet der Denkprozess des Roboters in nur wenigen Millisekunden statt. Es handelt sich um einen zweistufigen Prozess: Zuerst betrachtet das System das Bild und liest die Anweisung, um die Situation zu verstehen; zweitens berechnet es die spezifischen physischen Bewegungen, die für das Handeln erforderlich sind. Da diese Schritte so schnell ablaufen und unterschiedliche Anforderungen haben – der eine erfordert schwere Berechnungen, während der andere schnellen Speicherzugriff benötigt –, ist der Versuch, sie als einen einzigen, kontinuierlichen Prozess auf einem Server laufen zu lassen, ineffizient. Es ist, als würde man versuchen, gleichzeitig einen Marathon und einen Sprint zu laufen; der langsame, schwere Läufer bremst den schnellen, leichten Läufer aus.

Um dies zu beheben, hat das Team Robion entwickelt, um diese beiden Schritte voneinander zu trennen und sie nebeneinander auf demselben Computerchip laufen zu lassen, jedoch auf eine sorgfältig kontrollierte Weise. Sie haben zwei separate Fahrspuren auf dem Prozessor des Servers geschaffen. Eine Spur übernimmt das schwere Denken, während die andere die schnellen Bewegungsberechnungen handhabt. Entscheidend ist, dass sie eine Verkehrsregelung entworfen haben, die sicherstellt, dass die schwere Spur die leichte Spur niemals vollständig blockiert. Dies erreichen sie, indem sie eine spezifische Menge an Rechenleistung für die schnelle Spur reservieren, wodurch garantiert wird, dass sie immer Platz zum Laufen hat, selbst während das schwere Denken stattfindet. Dies ermöglicht es dem Server, die Anfragen mehrerer Roboter exakt gleichzeitig zu verarbeiten, indem er das Denken eines Roboters mit der Bewegungsberechnung eines anderen überlappt.

Darüber hinaus erkannten die Forscher, dass ein einzelner Server viele verschiedene Arten von Robotern verwalten kann, von denen jeder eine eigene spezifische Aufgabe und seine eigene Version des Gehirns hat. Einige Roboter könnten Kartons verpacken, während andere Autoteile montieren. Robion ermöglicht es diesen verschiedenen Robotergehirnen, auf demselben Server zu existieren und dieselben Rechenspuren zu nutzen. Das System fungiert als intelligenter Disponent, der ständig prüft, welcher Roboter kurz davor steht, seine Sicherheitsfrist zu verpassen. Wenn ein Roboter kurz davor ist, die Zeit zur Erledigung seiner Aufgabe zu überschreiten, priorisiert das System dessen Anfrage sofort und stellt so sicher, dass die dringendsten Aufgaben zuerst erledigt werden. Dies verhindert, dass die Fabrik zum Stillstand kommt, weil ein Roboter zu lange auf eine Antwort wartet.

Das Team testete dieses System in einer simulierten Fabrikumgebung mit bis zu vier leistungsstarken Grafikkarten, die die Motoren sind, die diese KI-Modelle antreiben. Sie verglichen Robion mit bestehenden Methoden, die entweder das Robotergehirn als eine einzige, ununterbrochene Kette von Ereignissen ausführen oder die Schritte über verschiedene Computer verteilen. Die Ergebnisse zeigten, dass Robion signifikant mehr Roboter unterstützen konnte als die anderen Methoden, während es gleichzeitig die strengen Zeitvorgaben einhielt. In einem großen Test im großen Maßstab verwaltete ein einzelner Server, der Robion ausführt, erfolgreich acht verschiedene Robotermodelle und bediente bis zu 64 Roboter gleichzeitig mit einer Erfolgsquote von 98 Prozent. Das bedeutet, dass der Roboter für fast jede einzelne Anfrage die Antwort rechtzeitig erhielt, um sicher weiterzuarbeiten.

Die Studie untersuchte auch, ob es besser sei, die verschiedenen Teile des Robotergehirns auf separaten Computern unterzubringen oder sie zusammenzuhalten. Sie fanden heraus, dass das Aufteilen der Denk- und Bewegungsphasen auf verschiedene Computer die Dinge tatsächlich langsamer und weniger effizient machte, da die Daten hin und her transportiert werden mussten, was kostbare Zeit verschwendete. Indem sie alles auf einem einzigen leistungsstarken Server hielten und den internen Verkehr sorgfältig steuerten, erreichte Robion eine wesentlich bessere Leistung. Die Forscher betrachteten auch die Kosten und stellten fest, dass die Nutzung eines einzelnen leistungsstarken Servers zur Ausführung vieler Roboter weitaus kostengünstiger ist, als zu versuchen, jedem einzelnen Roboter teure Hochleistungscomputer zur Verfügung zu stellen. Dieser Ansatz könnte fortschrittliche, autonome Fabriken zu einer praktischen Realität für große Unternehmen machen, indem er den Einsatz von Flotten intelligenter Roboter ermöglicht, die effizient zusammenarbeiten, ohne die Rechenressourcen zu überlasten.

Letztendlich zeigt Robion, dass der Schlüssel zum Betrieb einer Fabrik mit intelligenten Robotern nicht nur in leistungsstarken Computern liegt, sondern in einem System, das diese mit extremer Präzision verwalten kann. Indem sie die einzigartige, sekündliche Natur der Entscheidungsfindung von Robotern verstanden und einen Server entworfen haben, der diese engen Fristen respektiert, haben die Forscher einen Bauplan dafür geschaffen, wie man die physische künstliche Intelligenz skaliert. Das System stellt sicher, dass die Roboter, wenn Fabriken größer und komplexer werden, weiterhin in Echtzeit sehen, denken und handeln können, um die Produktionslinien reibungslos und sicher am Laufen zu halten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →