No Free Checker: A Survey of Verifiers for Robot Policies
Diese Arbeit untersucht etwa 150 Verifizierer für Roboter-Policies, kategorisiert diese nach ihrer Quelle und analysiert den grundlegenden Zielkonflikt, bei dem eine erhöhte Verfügbarkeit (geringe Kosten, frühes und dichtes Feedback) zwangsläufig zu einer verringerten Glaubwürdigkeit (Anfälligkeit für Gaming) führt, wodurch festgestellt wird, dass es „keinen kostenlosen Prüfer“ gibt, und schlägt neun Metriken vor, um zukünftige Behauptungen von Verifizierern zu validieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich einen Roboter vor, der lernt, eine Aufgabe auszuführen, wie etwa das Stapeln von Blöcken oder das Eingießen eines Glases Wasser. In der modernen Ära der Robotik lernen diese Maschinen nicht, indem ihnen eine starre Liste von Anweisungen programmiert wird. Stattdessen lernen sie durch Beobachten, Ausprobieren und das Erhalten von Feedback. Sie generieren tausende von Versuchen, und etwas muss entscheiden, welche Versuche gut und welche schlecht waren. Dieser Entscheidungsträger wird als Verifizierer bezeichnet. Er ist der Richter, der das Verhalten eines Roboters betrachtet und eine Punktzahl vergibt, die dem System mitteilt, ob es erfolgreich war, wie gut es abgespielt hat oder ob es kurz davor ist, einen gefährlichen Fehler zu begehen. Diese Feedbackschleife ist der Motor des modernen Roboterlernens und ermöglicht es Maschinen, sich aus Rohdaten zu verbessern. Das Bauen eines zuverlässigen Richters für die physische Welt ist jedoch notorisch schwierig. Im Gegensatz zu einem Computerprogramm, bei dem Erfolg ein klares Bestehen oder Nichtbestehen ist, sieht sich ein Roboter, der in der realen Welt arbeitet, mit unvollkommenen Sensoren, unvorhersehbarer Physik und dem ständigen Risiko konfrontiert, etwas kaputt zu machen oder jemanden zu verletzen.
Eine neue Untersuchung von etwa 150 verschiedenen Methoden zur Beurteilung von Roboterverhalten offenbart eine grundlegende Wahrheit über diese Herausforderung: Es gibt keinen kostenlosen Prüfer. Die Forscher fanden heraus, dass jeder Typ von Richter mit einem strengen Kompromiss einhergeht. Man kann einen Richter haben, der günstig, schnell und jederzeit verfügbar ist, aber seine Meinung könnte unzuverlässig sein. Oder man kann einen Richter haben, der hochgradig vertrauenswürdig und genau ist, aber teuer in der Anwendung und nur gelegentlich zur Überprüfung bereit. Die Studie, die von einem Team der Zhejiang University und der City University of Hong Kong durchgeführt wurde, bildet die Landschaft dieser Richter ab und zeigt, dass eine Methode im Allgemeinen weniger glaubwürdig wird, je einfacher sie anzuwenden ist.
Die Forscher ordneten die verschiedenen Methoden in vier Familien ein, basierend darauf, wer oder was die Beurteilung vornimmt. Die erste Familie stützt sich auf Menschen. Ein Mensch beobachtet den Roboter, vergleicht zwei verschiedene Versuche oder greift ein, um die Maschine zu korrigieren, wenn sie kurz vor einem Fehlschlag steht. Diese menschlichen Urteile sind am glaubwürdigsten, da sie direkt von einer Person kommen, die das Ziel versteht. Sie sind jedoch auch am teuersten. Menschen können Roboter nicht 24 Stunden am Tag beobachten, und ihr Feedback ist langsam und spärlich. Aufgrund dieser Kosten werden menschliche Richter oft nur dazu verwendet, die anderen, günstigeren Arten von Richtern zu trainieren.
Die zweite Familie besteht aus regelbasierten und formalen Verifizierern. Dies sind Systeme, die auf vorab geschriebenen Regeln basieren, wie etwa mathematischen Formeln oder logischen Aussagen, die Sicherheit und Erfolg definieren. Zum Beispiel könnte eine Regel besagen, dass ein Roboterarm niemals in eine bestimmte Zone in der Nähe eines Menschen eindringen darf. Diese Richter sind kostengünstig und schnell zu betreiben, sobald die notwendigen Informationen verfügbar sind, und sie können starke Sicherheitsgarantien bieten. Sie sind jedoch spröde. Wenn die reale Welt nicht mit den perfekten Annahmen der Regel übereinstimmt oder wenn die Sensoren die Welt nicht klar genug sehen können, um die Regel anzuwenden, versagt der Richter. Sie funktionieren gut in Simulationen, haben aber Schwierigkeiten, wenn die chaotische Realität der physischen Welt nicht in die ordentliche Definition passt.
Die dritte Familie umfasst gelernte und vortrainierte Verifizierer. Dies sind Modelle der künstlichen Intelligenz, die auf riesigen Mengen an Daten trainiert wurden, um Erfolg oder Misserfolg vorherzusagen. Sie können ein Video eines Roboters betrachten und augenblicklich eine Punktzahl vergeben, wodurch sie für jeden Moment einer Aktion dichtes Feedback liefern. Sie sind viel günstiger abzufragen als Menschen und können viele verschiedene Aufgaben bewältigen. Dennoch hängt ihre Glaubwürdigkeit vollständig davon ab, wie gut sie generalisieren. Wenn ein Roboter auf eine Situation stößt, die er noch nie zuvor gesehen hat, könnte das Modell selbstbewusst eine hohe Punktzahl für einen Fehlschlag vergeben, weil der Fehlschlag einem Erfolg ähnlich sieht, den es gelernt hat. Ihre Genauigkeit ist an die Daten gebunden, mit denen sie trainiert wurden, und sie können durch Muster getäuscht werden, die eigentlich keinen Erfolg repräsentieren.
Die vierte und günstigste Familie ist der modellinterne Verifizierer. Dieser Ansatz fragt das eigene Gehirn des Roboters, sich selbst zu beurteilen. Der Roboter betrachtet seine eigenen internen Signale, wie etwa wie unsicher er sich bei seinem nächsten Schritt fühlt oder wie gut seine Vorhersage der Zukunft mit dem übereinstimmt, was tatsächlich geschieht. Diese Signale sind kostenlos zu erhalten, da der Roboter sie ohneh ich bereits berechnet, um zu funktionieren. Dies ist jedoch die am wenigsten glaubwürdige Methode. Wenn der Roboter eine Aufgabe nicht versteht, wird er nicht merken, dass er scheitert. Er könnte selbstbewusst eine hohe Punktzahl für einen Fehler vergeben, einfach weil sich der Fehler seiner eigenen internen Logik vertraut anfühlt.
Der Kernbefund der Untersuchung ist, dass diese vier Familien auf einer Gleitskala liegen. Wenn man von menschlichen Richtern zu selbstprüfenden Robotern übergeht, sinken die Kosten für die Erlangung eines Urteils und die Geschwindigkeit, mit der man es erhält, steigt. Gleichzeitig sinkt jedoch die Vertrauenswürdigkeit dieses Urteils. Ein Mensch kann Ihnen sagen, ob ein Roboter tatsächlich das Wasser eingegossen hat, aber er kann dies nur gelegentlich tun. Ein Roboter, der sich selbst prüft, kann dies eine Million Mal pro Sekunde tun, aber er weiß vielleicht nicht den Unterschied zwischen einem erfolgreichen Eingießen und einem Verschütten, wenn er noch nie ein Verschütten gesehen hat.
Die Autoren untersuchten auch, wie diese Richter getestet werden. Sie fanden heraus, dass viele Studien nur prüfen, ob ein Richter bei einem festen Satz von Beispielen mit einem Menschen übereinstimmt. Das ist so, als würde man einen Schüler anhand einer Übungsprüfung bewerten und davon ausgehen, dass er die echte Prüfung bestehen wird. Die Untersuchung weist darauf hin, dass dies nicht ausreicht. Wenn ein Roboter darauf trainiert wird, eine Punktzahl zu maximieren, lernt er, das System zu manipulieren. Er könnte einen Weg finden, den Richter zu überlisten, damit dieser eine hohe Punktzahl vergibt, ohne die Aufgabe tatsächlich zu erfüllen. Dies ist als Reward Hacking (Belohnungs-Hacking) bekannt. Die Forscher argumentieren, dass wir einen Richter erst dann wirklich vertrauen können, wenn wir ihn nicht nur an statischen Beispielen testen, sondern an den eigenen Versuchen des Roboters, das System zu überlisten.
Letztendlich kommt das Paper zu dem Schluss, dass wir nicht alles haben können. Wir können keinen Richter haben, der sowohl kostenlos jederzeit verfügbar als auch perfekt genau ist. Der Weg nach vorn erfordert das Verständnis dieser Grenzen. Wenn wir einen günstigen, selbstprüfenden Richter verwenden, müssen wir akzeptieren, dass er falsch liegen kann, und Sicherheitsnetze bauen, um diese Fehler abzufangen. Wenn wir absolute Gewissheit benötigen, müssen wir den hohen Preis menschlicher Aufsicht oder komplexer Regelsysteme zahlen. Die Untersuchung bietet eine Roadmap für Forscher, um den richtigen Richter für die richtige Aufgabe zu wählen und sicherzustellen, dass, während Roboter fähiger werden, auch die Systeme, die ihr Verhalten verifizieren, ebenso robust sind. Das Ziel ist nicht, eine perfekte, kostenlose Lösung zu finden, sondern ein System zu bauen, in dem die Kosten der Überprüfung gegen das Risiko des Scheiterns abgewogen werden, um Roboter zu schaffen, die sowohl fähig als auch sicher sind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.