Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems
Dit artikel introduceert Onto-EV-WM, een op ontologie gebaseerde interface die bestaande wereldmodellen verbetert door expliciet niet-vervulde taakpredicaten bij te houden en deze te koppelen aan correctiemechanismen, waardoor hoge succespercentages worden behaald in closed-loop foutdiagnose en herstel over diverse fysieke AI-benchmarks zoals LIBERO en PointMaze.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Onto-EV-WM voor Foutdiagnose en Closed-Loop Herstel
1. Probleemstelling
Fysieke AI-systemen die gebruikmaken van wereldmodellen (bijv. EV-WM) voorspellen kandidaat-toekomsten en scoren deze op basis van feature- of eventvectoren. Deze scalaire scores of eventvectoren missen echter vaak expliciete semantische informatie over waarom een kandidaat faalt. Specifiek leggen ze niet vast:
- Welk specifiek taakpredicaat niet wordt voldaan (bijv. een ruimtelijke relatie of een gewrichtsrestrictie).
- De getypeerde argumenten die geassocieerd zijn met de fout.
- Een route-label dat aangeeft welk correctiemechanisme moet worden toegepast.
- Een resultaat van acceptatie na correctie gebaseerd op natieve taakpredicaten.
Consequentelijk identificeert een systeem weliswaar een kandidaat met een lage score, maar mist het een gestructureerde interface om de specifieke niet-voldane conditie te diagnosticeren, een compatibele correctiestrategie toe te wijzen en de uitkomst te verifiëren met behulp van een closed-loop protocol. Het artikel adresseert de kloof tussen hoogdimensionale voorspelling en symbolische taakverificatie, met als doel een expliciete interface te bieden voor diagnose en herstel zonder het onderliggende wereldmodel of de visuomotorische controller te vervangen.
2. Methodologie: Onto-EV-WM
De auteurs stellen Onto-EV-WM voor, een op ontologie gebaseerde interface voor diagnose en verificatie-gestuurde correctie die een laag bovenop de bestaande EV-WM-architectuur ligt. Het is geen vervangend wereldmodel, maar een symbolische laag die de stroom van voorspelling naar correctie beheert.
2.1 Architectuur en Componenten
Het systeem werkt via een gestructureerde pijplijn bestaande uit drie hoofdonderdelen:
- Ontologische Recordlaag (TBox en ABox):
- TBox (Task Box): Definieert een taak-lokale schema inclusief entiteitstypen (bijv. Object, Regio, Gewricht), predicaatsignaturen (bijv.
in_region,contact) en typebeperkingen. Het dient als een herbruikbare vocabulaire voor de specifieke taak. - ABox (Assertion Box): Instantiëert de huidige staat. Het systeem construeert drie provenance-specifieke ABoxes:
- : De vereiste assertions gecompileerd uit de gestructureerde taakspecificatie ().
- : Assertions gegrond uit de voorspelde outputs van het wereldmodel.
- : Assertions gegrond direct uit de simulatorstaat.
- TBox (Task Box): Definieert een taak-lokale schema inclusief entiteitstypen (bijv. Object, Regio, Gewricht), predicaatsignaturen (bijv.
- Deterministische Diagnose en Routing:
- Diagnose (): Vergelijkt de vereiste ABox () met de geobserveerde/voorspelde ABox. Het identificeert niet-voldane assertions (), waarbij het specifieke predicaat, de bijbehorende getypeerde argumenten en eventuele continue marge-overtredingen behouden blijven. Dit genereert een getypeerd foutrecord (bijv.
relation_missing(plate, stove_front)). - Routing (): Een deterministische regelbasis koppelt de getypeerde fout aan een specifiek "route label". Een route is een dispatch-label voor een compatibel correctiemechanisme (bijv. "source joint pose", "object relation predicate"), en geen directe robotactie.
- Diagnose (): Vergelijkt de vereiste ABox () met de geobserveerde/voorspelde ABox. Het identificeert niet-voldane assertions (), waarbij het specifieke predicaat, de bijbehorende getypeerde argumenten en eventuele continue marge-overtredingen behouden blijven. Dit genereert een getypeerd foutrecord (bijv.
- Verificatie-gestuurde Correctie-loop:
- Voorstelgeneratie: Een proposer (geleerd, heuristisch of op planning gebaseerd) genereert een correctie op basis van het foutrecord en de geselecteerde route.
- Toepassing: De correctie wordt toegepast via directe mutatie van de simulatorstaat (bijv. het wijzigen van $qpos$) of via controller-gemedieerde executie.
- Verificatie: Een natieve taakverifieerder controleert de resulterende staat tegen het taakpredicaat.
- Beperkte Retry: Als de verificatie faalt, verhoogt het systeem een budget voor pogingen (), wordt de staat opnieuw gegrond, en kan het systeem dezelfde route opnieuw proberen of een nieuwe route kiezen. De loop eindigt bij succes of bij het uitputten van het budget.
2.2 Operationele Flow
De interface scheidt voorspelling, grounding, diagnose, toepassing en verificatie.
- Input: Taakspecificatie, bron-tag (voorspelling of simulatie) en staat.
- Proces: Grond de staat in een ABox Diagnoseer ontbrekende predicaten Wijs een route toe Genereer correctie Pas toe Verifieer.
- Output: Een geaccepteerde staat, een behouden planning-kandidaat, of een onopgelost getypeerd foutspoor.
3. Belangrijkste Bijdragen
Het artikel levert drie primaire technische bijdragen:
- Operationele Robot Taak-ontologie: Een ontwerp voor een expliciete grounding-interface die voorspelde en door de simulator geobserveerde staten representeert als onderscheidende, taakspecifieke ABoxes onder een gedeelde vocabulaire en typebeperkingen.
- Deterministische Diagnose en Routing: Een op regels gebaseerd systeem dat geschonden predicaten en hun getypeerde argumenten behoudt en deze koppelt aan taakspecifieke correctieroutes zonder de oorspronkelijke context te verliezen.
- Verificatie-gestuurd Correctiecontract: Een protocol dat de volledige levenscyclus van een correctiepoging vastlegt (diagnose, routekeuze, voorstel, toepassingsmodus en natieve-predicaat acceptatie) en een mechanisme voor beperkte retries afdwingt.
4. Experimentele Resultaten
De auteurs evalueren Onto-EV-WM over drie verschillende benchmark-instellingen met behulp van simulatieprotocollen.
4.1 PointMaze (Aligned Comparison)
- Setup: 50-trial random-state planning vergelijking tussen EV-WM en Onto-EV-WM.
- Resultaten: Beide methoden behaalden een succespercentage van 94%. Echter, Onto-EV-WM behaalde een significant lagere gemiddelde eindstaat-afstand (0.61177) vergeleken met EV-WM (0.90573), wat duidt op een hogere precisie in het voldoen aan de taakcondities.
- Opmerking: Een aparte configuratie met een groter zoekbudget en success-first selectie bereikte 100% succes, maar dit is niet direct vergelijkbaar met de aligned setting vanwege de verschillen in budget.
4.2 LIBERO-Goal (Sampled-Window Correction)
- Setup: Evaluatie op 10 manipulatietaken met behulp van 4 evaluatie-sampling seeds. Het protocol samplet 25-staps demonstratievensters. Correcties worden toegepast via een vaste geleerde source/joint $qpos$-delta mechanisme direct op de simulatorstaat.
- Resultaten:
- Seed 0: 93,8% succes in gecorrigeerde vensters (469/500).
- Over 4 Seeds: 94,05 ± 0,30% gecorrigeerd succes.
- Herstel: Van de 261 replay-fouten werden er 142 "gered" (54,4%) door het correctiemechanisme.
- Context: De ontologie biedt het diagnostische record dat de fout koppelt aan de vaste correction head; de gerapporteerde metriek weerspiegelt de volledige ontologie-gegronde configuratie.
4.3 LIBERO-Plus (Fixed Registry)
- Setup: Evaluatie op een vaste registry van 10.030 perturbatie-taken over vier suites (LIBERO-10, Goal, Object, Spatial).
- Resultaten:
- Totaal Succes: 85,00% (8.526/10.030 taken).
- Uitsplitsing per Suite:
- LIBERO-Goal: 91,39%
- LIBERO-Object: 91,38%
- LIBERO-Spatial: 91,38%
- LIBERO-10: 65,98% (geïdentificeerd als de suite met het hoogste aantal resterende fouten).
- Vergelijking: De Onto-EV-WM configuratie presteert beter dan verschillende baselines, waaronder DINO-WM + CEM (61,57%) en diverse VLA-modellen, hoewel de vergelijking op systeemniveau is en de causale bijdrage van de ontologie alleen niet isoleert.
5. Betekenis en Claims
Het artikel positioneert Onto-EV-WM als een systeem-niveau interface die fysieke AI-systemen verbetert door expliciete, getypeerde redenering toe te voegen aan het proces van foutdiagnose en herstel.
- Bescheiden Omvang: De auteurs geven expliciet aan dat de resultaten niet constitueren:
- Real-robot herstel of sim-to-real validatie.
- Een algemene open-world kennisgraaf of universele robot-ontologie.
- Een ontologie-alleen causale share (de prestatiewinst wordt toegeschreven aan de volledige configuratie).
- Een nieuwe geleerde policy-klasse die bestaande controllers vervangt.
- Kernwaarde: De betekenis ligt in het vermogen om vast te leggen waarom een taak faalde (getypeerde predicaten en argumenten) en om het herstelproces te structureren (routes en verificatie) op een manier die ontkoppeld is van het onderliggende voorspellingsmodel. Dit maakt "closed-loop" herstel mogelijk binnen simulatieprotocollen waar verificatie-gates de acceptatie van correcties bewaken.
- Beperkingen: De evaluatie vertrouwt op simulatie-gebaseerde protocollen. De "closed loop" verwijst naar een beperkte verify-retry cyclus binnen de simulator, niet naar real-time feedback-controle op fysieke hardware. De kwantitatieve resultaten reflecteren de prestaties van het geïntegreerde systeem onder specifieke protocollen in plaats van de geïsoleerde effectiviteit van de ontologie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.