← Neueste Arbeiten
💻 computer science

RHO: Your Coding Agent is Secretly a Roboticist

Das Papier stellt Robotics Harness Optimization (RHO) vor, ein neuartiges Trainingsparadigma, bei dem werkzeuggestützte Coding-Agenten mittels Umgebungsfeedback nach interpretierbaren, mehrschichtigen neurosymbolischen Policy-Repositories suchen und dabei eine Spitzenleistung sowie eine überlegene Effizienz gegenüber bestehenden Multi-Turn-Agentensystemen bei Echtzeit-Robotikaufgaben erreichen.

Ursprüngliche Autoren: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

Veröffentlicht 2026-06-16
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen einem Roboter beizubringen, wie man eine Tasse aufhebt und auf einen Tisch stellt.

Der alte Weg: Der „On-the-Fly“-Programmierer
Früher bestand der beste Weg darin, eine superintelligente KI (ein Large Language Model) als hektischen Programmierer einzusetzen. Jedes Mal, wenn der Roboter die Tasse fallen ließ oder den Tisch verfehlte, hielt die KI inne, dachte nach, schrieb neuen Code, um den Fehler zu beheben, und versuchte es erneut. Das ist so, als würde ein Koch eine Suppe proben, feststellen, dass sie Salz braucht, dann das Kochen unterbrechen, ein neues Rezept schreiben und dann wieder von vorne beginnen. Es funktioniert, aber es ist langsam, unordentlich, und der Roboter kann nicht schnell genug agieren, um in der realen Welt nützlich zu sein, da er ständig innehält, um seine eigenen Anweisungen neu zu schreiben.

Der neue Weg: RHO (Der „Pre-Game“-Coach)
Dieses Paper stellt RHO (Robotics Harness Optimization) vor. Anstatt die KI den Code schreiben zu lassen, während sich der Roboter bewegt, fungiert RHO als ein strenger, reflektierender Coach während des Trainings.

So funktioniert RHO, erklärt anhand einer einfachen Analogie:

1. Das „Repository“ (Die ganze Werkzeugkiste, nicht nur eine Notiz)

Die meisten KI-Systeme versuchen, einen Roboter zu korrigieren, indem sie einen einzelnen Satz oder eine kleine Funktion anpassen (wie das Ändern einer einzelnen Zutat in einem Rezept). RHO ist anders. Es behandelt das Gehirn des Roboters als ein ganzes Archiv von Dateien (ein „Repository“).

  • Analogie: Stellen Sie sich vor, das Gehirn des Roboters ist nicht nur ein Klebezettel mit Anweisungen; es ist eine komplette Werkstatt mit einem Handbuch, einem Satz Werkzeuge, einer Sicherheitscheckliste und einer Navigationskarte. RHO bearbeitet nicht nur den Klebezettel; es organisiert die gesamte Werkstatt um, tauscht die Werkzeuge aus und schreibt die Handbücher gleichzeitig um.

2. Der „Tool-Enabled Agent“ (Der Lehrling, der tatsächlich bauen kann)

RHO nutzt einen speziellen KI-Agenten, der nicht nur ein Textgenerator ist. Es ist ein Coding-Agent mit Händen.

  • Analogie: Anstatt nur darüber zu reden, wie man den Roboter repariert, darf dieser Agent die Code-Dateien des Roboters öffnen, Tests ausführen, den „Video-Feed“ des Roboters betrachten, um zu sehen, was schiefgelaufen ist, die Fehlerprotokolle prüfen und dann tatsächlich den Code umschreiben. Es ist wie ein Lehrling, der das Handbuch lesen, einen Schraubenschlüssel greifen, den Motor reparieren und das Auto dann in einem Zug Test fahren kann.

3. Die „Evolutionary Search“ (Überleben des Stärkeren)

RHO versucht nicht nur eine Korrektur. Es führt einen evolutionären Prozess durch.

  • Analogie: Stellen Sie sich ein Turnier vor. Die KI erstellt 100 verschiedene Versionen des „Gehirns“ des Roboters (verschiedene Code-Repositories). Sie schickt sie alle in eine Simulation, um die Aufgabe zu bewältigen.
    • Einige scheitern kläglich.
    • Einige machen okay mit.
    • Ein paar machen es großartig.
    • Die KI nimmt die „Gewinner“, vermischt ihre besten Merkmale miteinander und erschafft eine neue Generation von 100 Robotern. Dies wiederholt sie hunderte Male.
    • Entscheidend ist, dass sie eine „Pareto-Front“ beibehält. Das bedeutet, sie behält nicht einfach den Roboter, der in allem am besten ist. Sie behält den Roboter, der für diese spezifische Aufgabe am besten ist, selbst wenn er bei einer anderen schlecht abschneidet. Dies stellt sicher, dass der Endroboter ein Spezialist ist und kein Generalist, der bei spezifischen Aufgaben versagt.

4. Das Ergebnis: Ein „Ready-to-Deploy“-Roboter

Am Ende des Trainings produziert RHO ein einziges, perfektes „Repository“ (einen vollständigen Satz von Code-Dateien).

  • Die Magie: Wenn dieser Roboter in der realen Welt eingesetzt wird, muss die KI nicht mehr nachdenken. Er schreibt keinen Code mehr während der Arbeit. Er führt einfach den vorgeschriebenen, hochoptimierten Code aus.
  • Die Analogie: Es ist der Unterschied zwischen einem Studenten, der während einer Prüfung bei jeder Matheformel nachschlagen muss, und einem Studenten, der die Formeln auswendig gelernt und tausende Probleme geübt hat. Der RHO-Roboter ist der Student, der die harte Arbeit bereits während der „Hausaufgaben“ (des Trainings) erledigt hat und bereit ist, den Test (den Einsatz) sofort mit Bravour zu bestehen.

Was haben sie tatsächlich erreicht?

Das Paper behauptet, dass diese Methode signifikant besser ist als der aktuelle Stand der Technik:

  • Geschwindigkeit & Zuverlässigkeit: Bei Standard-Roboter-Benchmarks (wie dem Stapeln von Blöcken oder Bewegen von Objekten) erreichte RHO eine Erfolgsquote von 70 % mit einer einzigen, schnellen Ausführung. Die bisher beste Methode (die erforderte, dass die KI ständig innehielt und Code neu schrieb) erreichte nur 68 % und war viel langsamer.
  • Umgang mit Chaos: Als die Forscher die Regeln änderten (wie das Versetzen von Objekten an andere Stellen oder das Ändern der Aufgabenbeschreibung), versagten andere KI-Modelle (wie OpenVLA) völlig (0 % Erfolg). RHO konnte dennoch in 45 % der Fälle erfolgreich sein.
  • Effizienz: In einer komplexeren realen Simulation reduzierte RHO die Zeit, die der Roboter mit „Nachdenken“ verbrachte, um 20 % und verringerte die Anzahl der benötigten Tools um 27 %, während es gleichzeitig seine Erfolgsquote verdoppelte.

Das Faz-Wort

RHO verändert das Spiel, indem es die schwere Arbeit von der Bereitstellung (wenn der Roboter arbeitet) zum Training (wenn der Roboter lernt) verlagert. Es nutzt einen intelligenten, werkzeugfähigen KI-Agenten, um eine vollständige, Multi-Datei-Code-Bibliothek zu entwickeln, die robust, interpretierbar (Menschen können den Code lesen) und bereit ist, sofort zu laufen, ohne während des Betriebs einen Supercomputer zu benötigen, um die Anweisungen on-the-fly neu zu schreiben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →