EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees
Dit artikel introduceert EvoPlan, een neuro-symbolisch framework dat evolutionaire zoektocht integreert om spatio-temporele restricties uit demonstraties te extraheren en deze combineert met een evolutionaire PDDL-planner en een gecontroleerde executielus om op LLM-gebaseerde robots veilige, uitvoerbare plannen met formele garanties in open-wereldomgevingen te laten genereren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren navigeren in een drukke wereld, zoals een bezorgbot in een fabriek of een zelfrijdende auto in een stad. Je hebt twee belangrijke hulpmiddelen om het hem mee te helpen, maar beide hebben een grote tekortkoming:
- De "Creatieve Schrijver" (AI/LLM): Dit is een slimme AI die jouw instructies kan lezen ("Ga naar de cafetaria") en een slim plan kan bedenken. Het is geweldig in het begrijpen van context en het herstellen van fouten. Het probleem: Het is een beetje roekeloos. Het kan een plan bedenken dat goed klinkt, maar fysiek onmogelijk is, of het kan per ongeluk door een rood licht rijden omdat het niet echt "nadenkt" over de regels.
- De "Strikte Accountant" (Klassieke planners): Dit is een rigide, op regels gebaseerd systeem. Het werkt alleen als je het een perfecte, wiskundige beschrijving van de wereld geeft. Het probleem: Het is verschrikkelijk in het begrijpen van natuurlijke taal of het herstellen van eigen fouten. Als de wereld een klein beetje verandert, bevriest het systeem.
EvoPlan is een nieuw framework dat het beste van twee werelden combineert. Het gebruikt de "Creatieve Schrijver" om plannen te dromen en de "Strikte Accountant" om te controleren of ze veilig en uitvoerbaar zijn. Zo werkt het, opgedeeld in drie eenvoudige stappen:
1. De "Schaduwcoach" (De regels leren)
Voordat de robot überhaupt beweegt, moet het systeem de "ongeschreven regels" van de weg of de fabrieksvloer leren.
- Het Probleem: De onderzoekers hebben alleen video's van goed gedrag (experts die veilig rijden of mensen die beleefd lopen). Ze hebben geen video's van slecht gedrag om de robot te laten zien wat hij juist niet moet doen.
- De Oplossing: Het systeem werkt als een creatieve schrijfcoach. Het neemt een video van een goede rit en vraagt aan de AI: "Wat als de bestuurder gas zou geven? Wat als ze voor een rood licht zouden rijden?" Het verzint deze "slechte" scenario's (contrafacten) om een contrast te creëren.
- Het Resultaat: Door de "goede" video's te vergelijken met de uitgevonden "slechte" scenario's, leert het systeem een enkel, universeel regelboek (een STL-constraint). Denk hierbij aan een "Schaduwcoach" die in het oor van de robot fluistert: "Rij nooit sneller dan X," of "Blijf altijd Y meter verwijderd van mensen." Dit regelboek is van toepassing op elke beweging die de robot maakt.
2. De "Evolutionaire Redacteur" (Het plan bouwen)
Nu moet de robot een plan maken om van punt A naar punt B te gaan.
- Het Proces: De "Creatieve Schrijver" (AI) stelt een plan voor. Maar in plaats van dit plan zomaar te accepteren, ondergaat het een streng redactieproces.
- De Lus:
- De AI schrijft een conceptplan.
- Een "Validator" (de accountant) controleert het. Als het plan gebrekkig is (bijv. "Je kunt een deur niet openen die niet bestaat"), markeert de validator de specifieke fout.
- De AI leest de fout, herstelt dat specifieke deel en probeert het opnieuw.
- Dit gebeurt herhaaldelijk, zoals een schrijver een verhaal verfijnt tot het perfect is.
- De Magie: Het systeem behoudt de "goede delen" van het plan die al gecontroleerd zijn en herschrijft alleen de kapotte delen. Na verloop van tijd groeit het plan in lengte en betrouwbaarheid totdat het volledig geldig is.
3. De "Veiligheidsbewaker" (Real-time uitvoering)
Ten slotte begint de robot te bewegen. Dit is waar de "Schaduwcoach" en de "Veiligheidsbewaker" het overnemen.
- De Controle: De robot voert een plan niet blindelings uit. Voordat hij een enkele stap zet (of een wiel draait), controleert het systeem die specifieke beweging tegen het regelboek dat in Stap 1 is geleerd.
- Het Veiligheidsnet:
- Scenario A: De robot plant een bocht naar links. De Bewaker controleert: "Is er daar een voetganger? Is de snelheid veilig?" Ja. De robot beweegt.
- Scenario B: De robot plant een bocht naar links. De Bewaker controleert: "Wacht, een voetganger is te dichtbij!" Nee. De robot stopt onmiddellijk.
- Het Herplannen: Als de Bewaker "Nee" zegt, crasht de robot niet. Hij legt alle veilige stappen die hij al heeft genomen vast, werkt zijn huidige locatie bij en vraagt de "Evolutionaire Redacteur" om een nieuw plan voor de rest van de reis.
Waarom dit ertoe doet
De paper laat zien dat dit systeem beter werkt dan het gebruik van alleen de AI of alleen de regels.
- Bij Rijden: Bij tests op rijdata verminderde het systeem botsingen en overtredingen van rode lichten aanzienlijk, zonder dat de AI van de bestuurder opnieuw getraind hoefde te worden. Er werd simpelweg een "vangrail" toegevoegd die slechte acties blokkeerde.
- Bij Navigatie: Bij tests in complexe, open-wereld puzzels (zoals het vinden van objecten in een huis), loste het systeem meer taken op dan andere AI-planners, zelfs wanneer de woorden in de instructies niet perfect overeenkwamen met de woordenschat van de robot.
Kortom: EvoPlan is een robot-planningsysteem dat AI gebruikt om creatief en flexibel te zijn, maar de AI dwingt om een "veiligheidshelm" te dragen (geleerd uit data) en een "regelboek" te volgen (gecontroleerd door code) om te garanderen dat het nooit iets gevaarlijks of onmogelijks doet. Het is alsof je een briljante maar impulsieve bestuurder hebt die constant wordt begeleid door een zeer strikte, zeer slimme co-piloot.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.