← Neueste Arbeiten
💻 computer science

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP ist ein neuartiger Agent, der die robotische Manipulation verbessert, indem er eine trainingsfreie, physikbasierte Explorationsebene in Code-as-Policy-Frameworks integriert, was durch ein duales Agenten-Planungs- und Priorisierungssystem eine effiziente, gezielte Informationssuche zur Ableitung latenter Objekteigenschaften wie Masse und Steifigkeit ermöglicht.

Ursprüngliche Autoren: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

Veröffentlicht 2026-08-24
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister der sichtbaren Welt. Wenn eine Aufgabe darin besteht, eine Tasse von einem Tisch zu einer Spüle zu bewegen, kann ein moderner Roboter die Tasse oft sehen, einen Pfad planen und die Bewegung mit beeindruckender Anmut ausführen. Dieser Erfolg beruht auf Vision-Language-Action-Policies – Systemen, die lernen, indem sie Menschen bei der Ausführung von Aufgaben beobachten und dann diese Bewegungen imitieren. Diese Systeme arbeiten jedoch mit einer grundlegenden Einschränkung: Sie sehen nur das, was an der Oberfläche ist. Sie können nicht das Gewicht einer Dose fühlen, um zu wissen, ob sie leer ist, noch können sie die Festigkeit einer Frucht spüren, um zu wissen, ob sie reif ist. In der realen Welt hängen viele Aufgaben von diesen verborgenen physikalischen Eigenschaften ab. Ein Mensch, der eine Küche reinigt, könnte eine Limonadendose schütteln, um zu hören, ob sie leer ist, oder eine Avocado drücken, um ihre Reife zu prüfen, wobei er Tastsinn und Gehör nutzt, um die Lücken zu füllen, die das Sehen hinterlässt. Oh dies die Fähigkeit fehlt, aktiv nach verborgenen Informationen zu suchen, bleibt ein Roboter blind für genau jene Details, die darüber entscheiden, ob eine Aufgabe gelingt oder scheitert.

Forscher der National Taiwan University und von NVIDIA haben einen neuen Ansatz entwickelt, um diese Lücke zu schließen, indem sie ein System namens PhysCaP erschaffen haben. Dieses System lehrt einen Roboter, wie ein neugieriger Mensch zu handeln, indem es die Fähigkeit kombiniert, eigene Anweisungen zu schreiben, mit einer neuen Kapazität für physikalische Exploration. Anstatt nur zuzusehen und zu kopieren, ist der Roboter darauf ausgelegt, Fragen an die physische Welt zu stellen. Wenn er vor einem Tisch mit Objekten steht, bei denen die Antwort verborgen ist, rät der Roboter nicht. Er entscheidet sich für eine Interaktion, indem er Gegenstände hebt oder drückt, um die spezifischen Daten zu sammeln, die er benötigt. Das System basiert auf einem „Code-as-Policy“-Framework, was bedeutet, dass der Roboter ausführbaren Computercode generiert, um seine Bewegungen zu steuern, wodurch es ihm ermöglicht, komplexe Schritte ähnlich wie ein Mensch bei der Planung einer Sequenz von Handlungen zu durchdenken. Was PhysCaP einzigartig macht, ist die Hinzufügung einer physikbasierten Explorationsebene. Diese Ebene ermöglicht es dem Roboter, Eigenschaften wie Masse und Steifigkeit allein durch das Feedback seiner eigenen Motoren und Gelenke zu schätzen, ohne spezielle Sensoren wie berührungsempfindliche Haut oder Waagen zu benötigen.

Der Kern dieses neuen Systems ist ein Dual-Agent-Design, das das empfindliche Gleichgewicht zwischen zu frühem Handeln und Zeitverschwendung verwaltet. Ein Agent, der Planner (Planer), betrachtet die Szene und entscheidet, ob der Roboter über genügend Informationen verfügt, um die Aufgabe zu beenden. Wenn Informationen fehlen, erstellt der Planner eine Liste potenzieller Aktionen, um diese zu finden. Ein zweiter Agent, der Prioritizer (Priorisierer), überprüft diese Liste und ordnet die Aktionen basierend auf visuellen Hinweisen. Wenn beispielsweise die Aufgabe darin besteht, eine leere Limonadendose unter vier Dosen zu finden, bemerkt der Prioritizer, dass zwei Dosen versiegelt sind und zwei Strohhalme herausragen. Er schließt logisch daraus, dass die versiegelten Dosen wahrscheinlich voll sind, und priorisiert die Prüfung der offenen Dosen. Dies verhindert, dass der Roboter Energie an Objekten verschwendet, die unwahrscheinlich die Antwort enthalten. Sobald der Roboter genügend Beweise gesammelt hat, stoppt das System die Exploration und führt die endgültige Aufgabe aus.

Um diese Idee zu testen, stellten die Forscher drei verschiedene Herausforderungen auf einem realen Tisch auf. In einer Aufgabe war ein blauer Würfel unter einem von drei Bechern versteckt, wobei einer der Becher zu klein war, um den Würfel aufzunehmen. Ein Roboter, der sich nur auf die Sicht verlassen würde, würde jeden Becher anheben, aber PhysCaP nutzte sein Denken, um den Größenunterschied zu erkennen und übersprang den unmöglichen Becher, indem er nur die praktikablen Kandidaten anhob. In einer anderen Aufgabe musste der Roboter eine einzige leere Limonadendose unter vier Dosen finden. Unter Nutzung seiner Fähigkeit, das Gewicht durch Motoren-Feedback zu messen, identifizierte er erfolgreich die leere Dose. In der dritten Aufgabe musste er eine reife Avocado aus einer Gruppe von grünen und dunklen Avocados auswählen. Durch das Drücken der dunklen Avocados, um deren Festigkeit zu messen, wählte er die reife Avocado aus und ignorierte die harte, unreife Frucht. In all diesen Szenarien war das System erfolgreich, wo andere Methoden versagten. Roboter, die sich nur auf die Sicht verlassen konnten, konnten die Aufgaben nicht lösen, weil sie die verborgenen Eigenschaften nicht sehen konnten. Roboter, die zwar Eigenschaften messen konnten, aber nicht über die Fähigkeit zur Priorisierung verfügten, untersuchten letztlich jedes einzelne Objekt, was deutlich länger dauerte und mehr Energie verbrauchte.

Die Ergebnisse zeigten, dass PhysCaP diese Aufgaben mit hohen Erfolgsraten abschließen konnte, während es weitaus weniger mit Objekten interagierte als seine Konkurrenten. In den realen Tests fand das System den verborgenen Würfel, die leere Dose und die reife Avocado mit signifikant weniger physischen Berührungen und in kürzerer Zeit als Systeme, die wahllos alles überprüften. Die Forscher führten auch Simulationen durch, um zu sehen, wie das System in einer digitalen Umgebung performen würde, und die Ergebnisse bestätigten sich: Das System, das in der Lage ist zu begründen, was zu messen ist und wann es aufhören muss, übertraf Modelle, die einfach versuchten zu raten oder alles zu prüfen. Die Studie bestätigt, dass Roboter, um wirklich in der chaotischen, unvorhersehbaren realen Welt zu operieren, in der Lage sein müssen, aktiv nach den physikalischen Wahrheiten zu suchen, die das Sehen allein nicht offenbaren kann. Indem man Robotern die Fähigkeit gibt, die richtigen Fragen zu stellen und auf die Antworten zu hören, die die physische Welt liefert, bringt uns diese Forschung näher an Maschinen heran, die die subtilen, taktilen Komplexitäten des menschlichen Lebens bewältigen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →