← नवीनतम पेपर
💻 computer science

Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems

यह शोध पत्र Onto-EV-WM प्रस्तुत करता है, जो एक ऑन्टोलॉजी-ग्राउंडेड इंटरफ़ेस है जो मौजूदा वर्ल्ड मॉडल्स को स्पष्ट रूप से अपूर्ण कार्य प्रेडिकेट्स (task predicates) को ट्रैक करके और उन्हें सुधार तंत्रों से जोड़कर उन्नत बनाता है, जिससे LIBERO और PointMaze जैसे विविध फिजिकल AI बेंचमार्क में क्लोज्ड-लूप विफलता निदान और मरम्मत में उच्च सफलता दर प्राप्त होती है।

मूल लेखक: Kailin Wang, Haoxiang Jie, Yaoyuan Yan, Jiacheng Zhou, Zhiyou Heng

प्रकाशित 2026-08-17
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Kailin Wang, Haoxiang Jie, Yaoyuan Yan, Jiacheng Zhou, Zhiyou Heng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: विफलता निदान और क्लोज्ड-लूप मरम्मत के लिए Onto-EV-WM

1. समस्या विवरण

वर्ल्ड मॉडल (जैसे, EV-WM) का उपयोग करने वाले फिजिकल एआई (Physical AI) सिस्टम संभावित भविष्यों की भविष्यवाणी करते हैं और उन्हें फीचर या इवेंट वेक्टर्स के आधार पर स्कोर करते हैं। हालाँकि, ये स्केलर स्कोर या इवेंट वेक्टर्स अक्सर इस बारे में स्पष्ट सिमेंटिक जानकारी की कमी रखते हैं कि कोई संभावित परिणाम क्यों विफल होता है। विशेष रूप से, वे यह रिकॉर्ड नहीं करते हैं कि:

  • कौन सा विशिष्ट कार्य प्रेडिकेट (task predicate) असंतोषजनक बना हुआ है (जैसे, एक स्थानिक संबंध या जॉइंट बाधा)।
  • विफल होने से जुड़े टाइप किए गए तर्क (typed arguments) क्या हैं।
  • एक रूट लेबल जो यह इंगित करता है कि किस सुधार तंत्र (correction mechanism) को लागू किया जाना चाहिए।
  • नेटिव टास्क प्रेडिकेट्स के आधार पर एक पोस्ट-करेक्शन स्वीकृति परिणाम।

परिणामस्वरूप, जबकि एक सिस्टम कम स्कोर वाले उम्मीदवार की पहचान कर सकता है, उसके पास विशिष्ट अनमेट (unmet) स्थिति का निदान करने, एक संगत सुधार रणनीति असाइन करने और एक क्लोज्ड-लूप प्रोटोकॉल का उपयोग करके परिणाम को सत्यापित करने के लिए एक संरचित इंटरफेस की कमी होती है। यह शोध पत्र उच्च-आयामी भविष्यवाणी (high-dimensional prediction) और सिम्बोलिक टास्क वेरिफिकेशन के बीच के अंतर को दूर करने का प्रयास करता है, जिसका लक्ष्य अंतर्निहित वर्ल्ड मॉडल या विसुओमोटर कंट्रोलर को बदले बिना निदान और मरम्मत के लिए एक स्पष्ट इंटरफेस प्रदान करना है।

2. कार्यप्रणाली: Onto-EV-WM

लेखक Onto-EV-WM का प्रस्ताव करते हैं, जो मौजूदा EV-WM आर्किटेक्चर के ऊपर एक लेयर के रूप में स्थित एक ऑन्टोलॉजी-ग्राउंडेड डायग्नोसिस और वेरिफिकेशन-गेटेड करेक्शन इंटरफेस है। यह कोई रिप्लेसमेंट वर्ल्ड मॉडल नहीं है, बल्कि एक सिम्बोलिक लेयर है जो भविष्यवाणी से सुधार तक के प्रवाह को प्रबंधित करती है।

2.1 आर्किटेक्चर और घटक

यह सिस्टम तीन मुख्य घटकों वाले एक संरचित पाइपलाइन के माध्यम से संचालित होता है:

  1. ऑन्टोलॉजिकल रिकॉर्ड लेयर (TBox और ABox):
    • TBox (Task Box): एक कार्य-स्थानीय स्कीमा को परिभाषित करता है जिसमें एंटिटी प्रकार (जैसे, Object, Region, Joint), प्रेडिकेट सिग्नेचर (जैसे, in_region, contact), और टाइप बाधाएं शामिल हैं। यह विशिष्ट कार्य के लिए एक पुन: प्रयोज्य शब्दावली के रूप में कार्य करता है।
    • ABox (Assertion Box): वर्तमान स्थिति को इंस्टेंशिएट करता है। सिस्टम तीन प्रोवेनेंस-विशिष्ट ABoxes का निर्माण करता है:
      • Ag⋆A^\star_g: संरचित कार्य विनिर्देश (gg) से संकलित आवश्यक एसेर्शन (assertions)।
      • A^g,t+Hpred\hat{A}^{pred}_{g,t+H}: वर्ल्ड मॉडल के अनुमानित आउटपुट से ग्राउंडेड एसेर्शन।
      • Ag,tsimA^{sim}_{g,t}: सीधे सिम्युलेटर स्टेट से ग्राउंडेड एसेर्शन।
  2. डिटरमिनिस्टिक डायग्नोसिस और रूटिंग:
    • डायग्नोसिस (ΠD\Pi_D): आवश्यक ABox (Ag⋆A^\star_g) की तुलना प्रेक्षित/अनुमानित ABox से करता है। यह असंतोषजनक एसेर्शन (ΔFsrc\Delta F_{src}) की पहचान करता है, जिसमें विशिष्ट प्रेडिकेट, इसके टाइप किए गए तर्क और किसी भी निरंतर मार्जिन उल्लंघन को सुरक्षित रखा जाता है। यह एक टाइप किया गया विफलता रिकॉर्ड (जैसे, relation_missing(plate, stove_front)) उत्पन्न करता है।
    • रूटिंग (ΠR\Pi_R): एक डिटरमिनिस्टिक रूल बेस टाइप किए गए फेलियर को एक विशिष्ट "रूट लेबल" से मैप करता है। एक रूट एक संगत सुधार तंत्र (जैसे, "सोर्स जॉइंट पोज", "ऑब्जेक्ट रिलेशन प्रेडिकेट") के लिए एक डिस्पैच लेबल है, न कि कोई सीधा रोबोट एक्शन।
  3. वेरिफिकेशन-गेटेड करेक्शन लूप:
    • प्रपोजल जनरेशन: एक प्रपोजर (लर्नड, ह्यूरिस्टिक, या प्लानिंग-आधारित) विफलता रिकॉर्ड और चयनित रूट के आधार पर एक सुधार qq उत्पन्न करता है।
    • एप्लीकेशन: सुधार को या तो सीधे सिम्युलेटर स्टेट म्यूटेशन (जैसे, $qpos$ को संशोधित करना) या कंट्रोलर-मीडिएटेड निष्पादन के माध्यम से लागू किया जाता है।
    • वेरिफिकेशन: एक नेटिव टास्क वेरीफायर परिणामी स्थिति की कार्य प्रेडिकेट के विरुद्ध जांच करता है।
    • बाउंडेड रिट्राई (Bounded Retry): यदि वेरिफिकेशन विफल रहता है, तो सिस्टम एक प्रयास बजट (bb) बढ़ाता है, स्टेट को री-ग्राउंड करता है, और उसी रूट को पुनः प्रयास कर सकता है या नया रूट चुन सकता है। लूप सफलता या बजट समाप्त होने पर समाप्त हो जाता है।

2.2 परिचालन प्रवाह (Operational Flow)

यह इंटरफेस भविष्यवाणी, ग्राउंडिंग, डायग्नोसिस, एप्लीकेशन और वेरिफिकेशन को अलग करता है।

  • इनपुट: टास्क स्पेसिफिकेशन, सोर्स टैग (प्रेडिक्शन या सिमुलेशन), और स्टेट।
  • प्रक्रिया: स्टेट को ABox में ग्राउंड करें →\rightarrow मिसिंग प्रेडिकेट्स का डायग्नोसिस करें →\rightarrow एक रूट असाइन करें →\rightarrow करेक्शन जनरेट करें →\rightarrow अप्लाई करें →\rightarrow वेरीफाई करें।
  • आउटपुट: एक स्वीकृत स्टेट, एक रिटेन्ड प्लानिंग कैंडिडेट, या एक अनरिज़ॉल्व्ड टाइप किया गया फेलियर ट्रेस।

3. प्रमुख योगदान

यह शोध पत्र तीन प्राथमिक तकनीकी योगदान देता है:

  1. ऑपरेशनल रोबोट टास्क ऑन्टोलॉजी: एक स्पष्ट ग्राउंडिंग इंटरफेस का डिज़ाइन जो प्रेडिक्टेड और सिम्युलेटर-ऑब्जर्वड स्टेट्स को एक साझा शब्दावली और टाइप कंस्ट्रेंट्स के तहत विशिष्ट, कार्य-विशिष्ट ABoxes के रूप में प्रस्तुत करता है।
  2. डिटरमिनिस्टिक डायग्नोसिस और रूटिंग: एक रूल-बेस्ड सिस्टम जो मूल संदर्भ को छोड़े बिना उल्लंघन किए गए प्रेडिकेट्स और उनके टाइप किए गए तर्कों को सुरक्षित रखता है और उन्हें कार्य-विशिष्ट करेक्शन रूट्स से मैप करता है।
  3. वेरिफिकेशन-गेटेड करेक्शन कॉन्ट्रैक्ट: एक प्रोटोकॉल जो सुधार के प्रयास के पूर्ण जीवनचक्र (डायग्नोसिस, रूट चयन, प्रपोजल, एप्लीकेशन मोड, और नेटिव-प्रेडिकेट स्वीकृति) को रिकॉर्ड करता है और एक बाउंडेड रिट्राई मैकेनिज्म को लागू करता है।

4. प्रयोगात्मक परिणाम

लेखक सिमुलेशन प्रोटोकॉल का उपयोग करके तीन अलग-अलग बेंचमार्क सेटिंग्स में Onto-EV-WM का मूल्यांकन करते हैं।

4.1 पॉइंटमेज़ (PointMaze) (अलाइन्ड तुलना)

  • सेटअप: EV-WM और Onto-EV-WM के बीच 50-ट्रायल रैंडम-स्टेट प्लानिंग तुलना।
  • परिणाम: दोनों विधियों ने 94% सफलता दर प्राप्त की। हालाँकि, Onto-EV-WM ने EV-WM (0.90573) की तुलना में काफी कम मीन फाइनल-स्टेट डिस्टेंस (0.61177) प्राप्त किया, जो कार्य स्थितियों को संतुष्ट करने में उच्च सटीकता को दर्शाता है।
  • नोट: एक बड़ा सर्च बजट और सक्सेस-फर्स्ट सिलेक्शन वाला अलग कॉन्फ़िगरेशन 100% सफलता तक पहुँच गया, लेकिन बजट के अंतर के कारण यह अलाइन्ड सेटिंग के साथ सीधे तौर पर तुलनीय नहीं है।

4.2 LIBERO-Goal (सैम्पल्ड-विंडो करेक्शन)

  • सेटअप: 4 इवैल्यूएशन-सैंपलिंग सीड्स का उपयोग करके 10 मैनिपुलेशन कार्यों पर मूल्यांकन। प्रोटोकॉल 25-स्टेप प्रदर्शन विंडो को सैंपल करता है। करेक्शन को सीधे सिम्युलेटर स्टेट पर एक फिक्स्ड लर्नड सोर्स/जॉइंट $qpos$-डेल्टा मैकेनिज्म के माध्यम से लागू किया जाता है।
  • परिणाम:
    • सीड 0: 93.8% करेक्टेड-विंडो सफलता (469/500)।
    • 4 सीड्स के माध्यम से: 94.05 ± 0.30% करेक्टेड सफलता।
    • रिकवरी: 261 रिप्ले फेलियर्स में से, 142 को करेक्शन मैकेनिज्म द्वारा "बचाया" गया (54.4%)।
  • संदर्भ: ऑन्टोलॉजी डायग्नोस्टिक रिकॉर्ड प्रदान करती है जो विफलता को फिक्स्ड करेक्शन हेड से जोड़ती है; रिपोर्ट किया गया मेट्रिक पूर्ण ऑन्टोलॉजी-ग्राउंडेड कॉन्फ़िगरेशन को दर्शाता है।

4.3 LIBERO-Plus (फिक्स्ड रजिस्ट्री)

  • सेटअप: चार सूट्स (LIBERO-10, Goal, Object, Spatial) में 10,030 परटर्बेशन कार्यों के एक फिक्स्ड रजिस्ट्री पर मूल्यांकन।
  • परिणाम:
    • कुल सफलता: 85.00% (8,526/10,030 कार्य)।
    • सूइट ब्रेकडाउन:
      • LIBERO-Goal: 91.39%
      • LIBERO-Object: 91.38%
      • LIBERO-Spatial: 91.38%
      • LIBERO-10: 65.98% (इसे उच्चतम रेसिड्यूअल फेलियर काउंट वाले सूट के रूप में पहचाना गया)।
  • तुलना: Onto-EV-WM कॉन्फ़िगरेशन कई बेसलाइन्स, जिनमें DINO-WM + CEM (61.57%) और विभिन्न VLA मॉडल्स शामिल हैं, को पछाड़ता है, हालांकि यह एक सिस्टम-लेवल तुलना है और केवल ऑन्टोलॉजी के कारण होने वाले प्रभाव को अलग नहीं करती है।

5. महत्व और दावे

यह पेपर Onto-EV-WM को एक सिस्टम-लेवल इंटरफेस के रूप में स्थापित करता है जो विफलता निदान और मरम्मत प्रक्रिया में स्पष्ट, टाइप किया गया तर्क जोड़कर फिजिकल एआई सिस्टम को बेहतर बनाता है।

  • सीमित दायरा: लेखक स्पष्ट रूप से कहते हैं कि परिणाम निम्नलिखित का प्रतिनिधित्व नहीं करते हैं:
    • रियल-रोबोट रिकवरी या सिम-टू-रियल वैलिडेशन।
    • एक सामान्य ओपन-वर्ल्ड नॉलेज ग्राफ या यूनिवर्सल रोबोट ऑन्टोलॉजी।
    • एक ऑन्टोलॉजी-ओनली कॉज़ल शेयर (प्रदर्शन में सुधार पूरे कॉन्फ़िगरेशन के कारण है)।
    • एक नया लर्नड पॉलिसी क्लास जो मौजूदा कंट्रोलर्स को बदलता है।
  • मुख्य मूल्य: इसका महत्व इस क्षमता में निहित है कि यह विफलता के कारण (टाइप्ड प्रेडिकेट्स और आर्गुमेंट्स) को रिकॉर्ड कर सकता है और मरम्मत प्रक्रिया (रूट्स और वेरिफिकेशन) को इस तरह से संरचित कर सकता है जो अंतर्निहित प्रेडिक्शन मॉडल से अलग हो। यह सिमुलेशन प्रोटोकॉल के भीतर "क्लोज्ड-लूप" मरम्मत की अनुमति देता है जहाँ वेरिफिकेशन करेक्शन की स्वीकृति को गेट करता है।
  • सीमाएँ: मूल्यांकन सिमुलेशन-आधारित प्रोटोकॉल पर निर्भर है। "क्लोज्ड लूप" का अर्थ सिम्युलेटर के भीतर एक बाउंडेड वेरीफाई-रिट्राई साइकिल है, न कि फिजिकल हार्डवेयर पर रियल-टाइम फीडबैक कंट्रोल। मात्रात्मक परिणाम विशिष्ट प्रोटोकॉल के तहत एकीकृत सिस्टम के प्रदर्शन को दर्शाते हैं, न कि केवल ऑन्टोलॉजी की अलग से प्रभावकारिता को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →