← Neueste Arbeiten
🤖 AI

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS ist ein Vision-Language-Action-Fundamentmodell, das das Pretraining als zielkonditioniertes Reinforcement Learning mit kontrastiven Repräsentationen neu formuliert, um aus Offline-Trajektorien ein intrinsisches Bewusstsein für die Erreichbarkeit von Zielen zu erlernen und dadurch die robotische Leistung bei Aufgaben mit langem Zeithorizont, vielen Kontakten und Zero-Shot-Szenarien im Vergleich zum traditionellen Behavior Cloning erheblich zu verbessern.

Ursprüngliche Autoren: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

Veröffentlicht 2026-05-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten einen Roboter bei der Erledigung von Hausaufgaben. Die meisten aktuellen Roboter lernen durch Nachahmung: Sie schauen sich ein Video an, in dem ein Mensch eine Aufgabe erledigt (wie das Aufheben einer Tasse), und versuchen, die genau gesehenen Bewegungen zu kopieren. Das ist wie ein Schüler, der eine Tanzroutine auswendig lernt. Wenn sich die Musik ändert, das Licht ausgeht oder der Tänzer an einen anderen Ort wechselt, gerät der Schüler in Verwirrung und hört auf zu tanzen. Er weiß, wie er sich bewegen muss, versteht aber nicht wirklich, warum er sich bewegt oder wohin er geht.

Die Arbeit stellt PRTS (Primitive Reasoning and Tasking System) vor, eine neue Art von Roboterhirn, das anders lernt. Anstatt nur Bewegungen zu kopieren, lernt PRTS, Ziele und Fortschritt zu verstehen.

Hier ist die Aufschlüsselung der Funktionsweise, unter Verwendung einfacher Analogien:

1. Das Problem: Der „Roboter, der nur auswendig lernt"

Aktuelle Roboter sind wie Schauspieler, die ein Skript auswendig gelernt haben. Wenn das Skript sagt „Nimm die rote Tasse auf", tun sie es. Aber wenn Sie sie bitten, die „blaue Tasse" aufzuheben (selbst wenn sie eine blaue Tasse schon einmal gesehen haben), oder wenn die Tasse an einer seltsamen Stelle steht, scheitern sie oft. Ihnen fehlt ein Gefühl für Richtung. Sie wissen nicht, ob sie dem Ziel näher kommen oder sich davon entfernen.

2. Die Lösung: Der „Kompass" (Kontrastives Bestärkendes Lernen)

PRTS fügt dem Roboterhirn einen „Kompass" hinzu. Es verwendet eine Technik namens Kontrastives Bestärkendes Lernen.

  • Die Analogie: Stellen Sie sich vor, Sie sind in einem dunklen Wald und versuchen, ein Lagerfeuer (das Ziel) zu finden.
    • Alte Roboter: Sie erinnern sich nur an den Weg, den sie das letzte Mal gegangen sind. Wenn sich die Bäume bewegen, verirren sie sich.
    • PRTS: Es lernt zu fragen: „Wenn ich diesen Schritt mache, komme ich dem Feuer näher?" Es braucht keine Karte oder einen Lehrer, der ihm bei jedem Schritt sagt „Gut gemacht!". Stattdessen lernt es durch den Vergleich zweier Dinge:
      1. „Wenn ich diese Aktion ausführe, sieht es dann so aus, als würde ich auf das Ziel zusteuern?" (Ja/Gut).
      2. „Wenn ich diese andere Aktion ausführe, sieht es dann so aus, als würde ich auf ein anderes Ziel zusteuern?" (Nein/Schlecht).

Indem dies Millionen von Malen durchgeführt wird, erstellt der Roboter eine interne Karte, bei der jede Aktion basierend darauf bewertet wird, wie wahrscheinlich es ist, dass sie das spezifische Ziel erreicht, das Ihnen in Worten gegeben wurde.

3. Der Zaubertrick: Zwei Dinge gleichzeitig tun

Normalerweise sind das Unterrichten eines Roboters, „Ziele zu verstehen", und das Unterrichten, „seine Arme zu bewegen", zwei separate Kurse. Man lehrt das Gehirn, dann die Muskeln. Das ist langsam und teuer.

PRTS ist clever, weil es beides gleichzeitig in einem einzigen Kurs lernt.

  • Die Analogie: Stellen Sie sich einen Schüler vor, der an einer Prüfung teilnimmt, bei der er auf demselben Blatt Papier einen Aufsatz schreiben (die Aktion) und gleichzeitig ein Matheproblem lösen (das Ziel) muss.
  • PRTS erreicht dies, indem es zwei winzige, unsichtbare „klebende Notizen" zur Eingabe des Roboters hinzufügt. Eine Notiz verfolgt die Aktion, die andere verfolgt das Ziel.
  • Das Roboterhirn verarbeitet die gesamte Szene, schreibt die Aktion auf und prüft gleichzeitig das „Matheproblem" (bringt mich diese Aktion dem Ziel näher?), ohne dabei langsamer zu werden. Es ist so effizient, dass es fast die gleiche Rechenleistung kostet wie die alten, einfacheren Methoden.

4. Die Ergebnisse: Der Roboter, der „denken" kann

Die Autoren testeten PRTS in Simulationen und an echten Robotern (mit zwei Armen und einem Arm). Hier ist, was passierte:

  • Der „Langstrecken"-Test: Wenn man ihn bat, eine lange Kette von Aufgaben zu erledigen (wie „Tee zubereiten", was das Kochen von Wasser, das Holen einer Tasse, das Hinzufügen von Tee usw. umfasst), verirrte sich PRTS nicht auf halbem Weg. Es prüfte weiterhin seinen „Kompass", um sicherzustellen, dass es noch auf Kurs war.
  • Der „Neue Anweisungen"-Test: Wenn Sie dem Roboter sagten, er solle den blauen Block aufheben, statt des roten, an dem er trainiert wurde, fand er sofort heraus, was zu tun war. Es erinnerte sich nicht nur daran, „den Gegenstand an Position X zu greifen"; es verstand „greife den Gegenstand, der dem Wort 'blau' entspricht".
  • Der „Menschliche Unterbrechung"-Test: Dies ist der beeindruckendste Teil. Stellen Sie sich vor, der Roboter setzt einen Block auf einen Tisch, und ein Mensch reißt den Block weg und legt ihn an einen anderen Ort zurück.
    • Alte Roboter: Sie würden verwirrt werden, versuchen, den Block dort abzulegen, wo er war, oder einfach aufhören.
    • PRTS: Es erkennt sofort: „Oh, das Ziel ist immer noch 'den Block auf den Tisch legen', aber der Block hat sich bewegt. Ich muss ihn wieder holen." Es erholt sich und beendet die Aufgabe, genau wie ein Mensch es tun würde.

Zusammenfassung

PRTS ist ein Roboterhirn, das aufhört, nur zu „kopieren", und beginnt zu „schließen". Es lernt, Wörter (Ziele) mit Aktionen zu verbinden, indem es ständig fragt: „Bringt mich dieser Schritt dem näher, was mir aufgetragen wurde?"

Da es dieses „Richtungsempfinden" von Grund auf mit Hilfe riesiger Datenmengen lernt, wird es viel besser darin, neue Situationen, lange Aufgaben und Fehler zu bewältigen als frühere Roboter. Es verwandelt den Roboter von einem gedankenlosen Nachahmer in einen zielorientierten Helfer.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →