EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees
Dieses Paper stellt EvoPlan vor, ein neuro-symbolisches Framework, das die evolutionäre Suche integriert, um raum-zeitliche Nebenbedingungen aus Demonstrationen zu extrahieren, und diese mit einem evolutionären PDDL-Planer sowie einer kontrollierten Ausführungsschleife kombiniert, um LLM-basierten Robotern die Generierung sicherer, ausführbarer Pläne mit formalen Garantien in Open-World-Umgebungen zu ermöglichen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, in einer geschäftigen Welt zu navigieren, wie etwa einem Lieferbots in einer Fabrik oder einem selbstfahrenden Auto in einer Stadt. Sie haben zwei Hauptwerkzeuge, um ihm zu helfen, aber beide haben einen entscheidenden Mangel:
- Der „Kreative Autor“ (KI/LLM): Dies ist eine kluge KI, die Ihre Anweisungen lesen kann („Gehe zum Cafeteria“) und einen geschickten Plan entwerfen kann. Sie ist großartig darin, Kontext zu verstehen und Fehler zu korrigieren. Das Problem: Sie ist etwas leichtsinnig. Sie erstellt vielleicht einen Plan, der zwar gut klingt, aber physisch unmöglich ist, oder sie fährt versehentlich über eine rote Ampel, weil sie nicht über die Regeln nachgedacht hat.
- Der „Strenge Buchhalter“ (Klassische Planer): Dies ist ein starres, regelbasiertes System. Es funktioniert nur, wenn Sie ihm eine perfekte, mathematische Beschreibung der Welt geben. Das Problem: Es ist schrecklich darin, natürliche Sprache zu verstehen oder seine eigenen Fehler zu korrigieren. Wenn sich die Welt auch nur geringfügig verändert, friert es ein.
EvoPlan ist ein neues Framework, das das Beste aus beiden Welten kombiniert. Es nutzt den „Kreativen Autor“, um Pläne zu träumen, und den „Strengen Buchhalter“, um sicherzustellen, dass diese sicher und ausführbar sind. So funktioniert es, unterteilt in drei einfache Schritte:
1. Der „Schatten-Coach“ (Das Lernen der Regeln)
Bevor der Roboter sich überhaupt bewegt, muss das System die „ungeschriebenen Regeln“ der Straße oder des Fabrikbodens lernen.
- Das Problem: Die Forscher verfügen nur über Videos von gutem Verhalten (Experten, die sicher fahren, oder Menschen, die höflich gehen). Sie haben keine Videos von schlechtem Verhalten, um dem Roboter zu zeigen, was er nicht tun soll.
- Die Lösung: Das System agiert wie ein kreativer Schreibcoach. Es nimmt ein Video einer guten Fahrt und fragt die KI: „Was wäre, wenn der Fahrer beschleunigt hätte? Was wäre, wenn er über eine rote Ampel gefahren wäre?“ Es erfindet diese „schlechten“ Szenarien (Kontrafaktuale), um einen Kontrast zu schaffen.
- Das Ergebnis: Durch den Vergleich der „guten“ Videos mit den erfundenen „schlechten“ Szenarien lernt das System ein einziges, universelles Regelwerk (eine sogenannte STL-Constraint). Betrachten Sie dies als einen „Schatten-Coach“, der dem Roboter ins Ohr flüstert: „Fahre niemals schneller als X“ oder „Halte immer Y Meter Abstand zu Menschen“. Dieses Regelwerk gilt für jede Bewegung, die der Roboter macht.
2. Der „Evolutionäre Editor“ (Den Plan erstellen)
Nun muss der Roboter einen Plan erstellen, um von Punkt A nach Punkt B zu gelangen.
- Der Prozess: Der „Kreative Autor“ (KI) schlägt einen Plan vor. Aber anstatt ihn einfach zu akzeptieren, durchläuft der Plan einen strengen Editierungsprozess.
- Die Schleife:
- Die KI schreibt einen Entwurf des Plans.
- Ein „Validator“ (der Buchhalter) prüft ihn. Wenn der Plan fehlerhaft ist (z. B. „Du kannst eine Tür nicht öffnen, die nicht existiert“), markiert der Validator den spezifischen Fehler.
- Die KI liest den Fehler, korrigiert diesen spezifischen Teil und versucht es erneut.
- Dies geschieht immer wieder, wie ein Autor, der eine Geschichte verfeinert, bis sie perfekt ist.
- Die Magie: Das System behält die „guten Teile“ des Plans, die bereits überprüft wurden, und schreibt nur die defekten Teile um. Mit der Zeit wird der Plan länger und zuverlässiger, bis er vollständig gültig ist.
3. Der „Sicherheits-Gatekeeper“ (Echtzeit-Ausführung)
Schließlich beginnt der Roboter sich zu bewegen. Hier übernehmen der „Schatten-Coach“ und der „Sicherheits-Gatekeeper“ das Kommando.
- Die Prüfung: Der Roboter führt den Plan nicht einfach blind aus. Bevor er einen einzigen Schritt macht (oder ein Rad dreht), prüft das System diese spezifische Bewegung gegen das in Schritt 1 gelernte Regelwerk.
- Das Sicherheitsnetz:
- Szenario A: Der Roboter plant, nach links abzubiegen. Der Gatekeeper prüft: „Ist dort ein Fußgänger? Ist die Geschwindigkeit sicher?“ Ja. Der Roboter bewegt sich.
- Szenario B: Der Roboter plant, nach links abzubiegen. Der Gatekeeper prüft: „Warte, ein Fußgänger ist zu nah!“ Nein. Der Roboter stoppt sofort.
- Die Neuplanung: Wenn der Gatekeeper „Nein“ sagt, stürzt der Roboter nicht ab. Er fixiert alle bereits unternommenen sicheren Schritte, aktualisiert seinen aktuellen Standort und bittet den „Evolutionären Editor“, einen neuen Plan für den Rest der Reise zu schreiben.
Warum das wichtig ist
Die Arbeit zeigt, dass dieses System besser funktioniert, als wenn man nur die KI oder nur die Regeln verwenden würde.
- Beim Fahren: Bei Tests mit Fahrdaten reduzierte das System Kollisionen und Rotlichtverstöße signifikant, ohne dass die KI des Fahrers neu trainiert werden musste. Es fügte lediglich ein „Leitplanken“-System hinzu, das schlechte Manöver stoppte.
- Bei der Navigation: Bei Tests in komplexen Open-World-Rätseln (wie dem Finden von Objekten in einem Haus) löste das System mehr Aufgaben als andere KI-Planer, selbst wenn die Wörter in den Anweisungen nicht perfekt mit dem Vokabular des Roboters übereinstimmten.
Kurz gesagt: EvoPlan ist ein Roboter-Planungssystem, das KI nutzt, um kreativ und flexibel zu sein, aber den Roboter dazu zwingt, einen „Schutzhelm“ (gelernt aus Daten) und ein „Regelwerk“ (geprüft durch Code) zu tragen, um sicherzustellen, dass er niemals etwas Gefährliches oder Unmögliches tut. Es ist wie ein brillanter, aber impulsiver Fahrer, der ständig von einem sehr strengen, aber sehr klugen Co-Piloten geleitet wird.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.