← नवीनतम पेपर
💻 computer science

Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery

सेंटिनल-वीएलए (Sentinel-VLA) एक मेटाकॉग्निटिव विजन-लैंग्वेज-एक्शन मॉडल है जिसमें ऑन-डिमांड डायनेमिक रीजनिंग और एरर रिकवरी के लिए एक एक्टिव स्टेटस मॉनिटरिंग मॉड्यूल है, जिसे ऑटोमैटिकली जेनरेटेड डेटा पर प्रशिक्षित किया गया है और स्टेट-ऑफ-द-आर्ट मॉडल्स की तुलना में सफलता दर में 30% सुधार प्राप्त करने के लिए एक सेल्फ-इवॉल्विंग कॉन्टिनुअल लर्निंग एल्गोरिदम के साथ उन्नत किया गया है।

मूल लेखक: Wenhao Li, Xiu Su, Dan Niu, Yichao Cao, Hongyan Xu, Zhe Qu, Lei Fan, Shan You, Chang Xu

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhao Li, Xiu Su, Dan Niu, Yichao Cao, Hongyan Xu, Zhe Qu, Lei Fan, Shan You, Chang Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे कि एक हरे रंग की प्लेट से केले को नीली प्लेट में रखना।

वर्तमान के अधिकांश रोबोट मस्तिष्क (जिन्हें VLA मॉडल कहा जाता है) उत्साही लेकिन थोड़े अनाड़ी इंटर्न की तरह हैं। वे कार्य को देखते हैं, अनुमान लगाते हैं कि आगे क्या करना है, और तुरंत कार्य करने लगते हैं। यदि उनसे केला गिर जाता है, तो उन्हें यह एहसास नहीं होता कि उन्होंने गलती की है। वे बस उस केले को "पोरिंग" (डालने) की कोशिश करते रहते हैं जो अब फर्श पर पड़ा है, या वे खाली हाथ नीली प्लेट की ओर हाथ बढ़ाते रहते हैं। उनमें आत्म-जागरूकता की कमी होती है।

Sentinel-VLA एक नए प्रकार का रोबोट मस्तिष्क है जो एक स्मार्ट, सतर्क पर्यवेक्षक (supervisor) की तरह कार्य करता है जिसमें एक अंतर्निहित "सेंटिनल" (एक गार्ड) होता है। यह इस प्रकार काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "सेंटिनल" गार्ड (सक्रिय स्थिति निगरानी)

रोबोट के सामान्य संचालन को एक सीधी, खाली सड़क पर कार चलाने के रूप में सोचें। आपको बहुत अधिक सोचने की आवश्यकता नहीं है; आप बस स्टीयरिंग चलाते हैं।

  • सामान्य मोड: 90% समय के लिए, Sentinel-VLA "क्रूज कंट्रोल" पर होता है। यह कार्य को देखता है, जानता है कि क्या करना है, और बिना ऊर्जा बर्बाद किए कार्य करता है। यह इसे तेज़ और कुशल बनाता है।
  • द सेंटिनल (गार्ड): हालाँकि, इस रोबोट के पास डैशबोर्ड पर नज़र रखने के लिए एक समर्पित "गार्ड" है। यदि केला फिसल जाता है, या यदि रोबोट को एहसास होता है कि वह गलत वस्तु पकड़े हुए है, तो सेंटिनल अलार्म बजा देता है। यह कहता है, "रुको! कुछ गलत है। हमें रुकना होगा और सोचना होगा।"

2. केवल आवश्यकता होने पर ही "गहराई से सोचना" (डायनामिक रीजनिंग)

पुराने, अधिक स्मार्ट रोबोट मॉडल हर एक कदम पर "गहराई से सोचने" (योजना बनाने और तर्क करने) की कोशिश करते थे, जैसे कोई व्यक्ति हर एक कदम उठाने से पहले एक पैराग्राफ दर्शन लिखने के लिए रुकता है। यह धीमा और थका देने वाला है।

  • सेंटिनल का दृष्टिकोण: Sentinel-VLA केवल तभी "गहराई से सोचता" है जब सेंटिनल गार्ड अलार्म बजाता है।
    • शुरुआत में: यह पूरे मार्ग की योजना बनाता है।
    • जब कोई त्रुटि होती है: यह रुकता है, पता लगाता है कि क्या गलत हुआ (जैसे, "मैंने केला गिरा दिया क्योंकि मैंने उसे मजबूती से नहीं पकड़ा था"), और एक रिकवरी प्लान (सुधार योजना) बनाता है (जैसे, "इसे उठाएं, सावधानी से हिलाएं, और धीरे से छोड़ दें")।
    • ठीक होने के बाद: यह वापस "क्रूज कंट्रोल" पर चला जाता है और कार्य पूरा करता है।

3. गलतियों से सीखना बिना भूले (सेल्फ-इवॉल्विंग लर्निंग)

आमतौर पर, जब एक रोबोट किसी विशिष्ट गलती को ठीक करने के लिए एक नया तरीका सीखता है, तो हो सकता है कि वह अपने पुराने तरीकों को पूरी तरह से करना भूल जाए। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (विनाशकारी विस्मृति) कहा जाता है।

  • समाधान: यह पेपर SECL के साथ एक OC-Adapter नामक एक विशेष सीखने की विधि पेश करता है।
  • उपमा: एक पुस्तकालय की कल्पना करें। जब आप एक नई किताब (एक नया कौशल) जोड़ते हैं, तो आप उसे पुरानी किताबों के ऊपर फेंककर उन्हें कुचलता नहीं हैं। इसके बजाय, आप एक विशेष शेल्फ सिस्टम (ऑर्थोगोनल एडॉप्टर) का उपयोग करते हैं जो यह सुनिश्चित करता है कि नई किताब पुराने स्थानों के साथ ओवरलैप न हो। इस तरह, रोबोट अपनी मूल क्षमताओं को खोए बिना त्रुटियों से उबरने के नए तरीके सीखता है।

4. "नकली" गलतियों के साथ प्रशिक्षण (EC-Gen)

आप वास्तविक दुनिया में चीजों को 2.6 मिलियन बार तोड़कर रोबोट को आसानी से नहीं सिखा सकते।

  • पाइपलाइन: शोधकर्ताओं ने एक मशीन (EC-Gen) बनाई है जो रोबोट की सटीक गतिविधियों को लेती है और सिमुलेशन में उन्हें स्वचालित रूप से "खराब" कर देती है। यह वस्तुओं को गिराना, गलत चीज़ पकड़ना, या लक्ष्य को चूक जाना जैसे परिदृश्य सिम्युलेट करती है।
  • परिणाम: रोबोट इन 2.6 मिलियन से अधिक "नकली विफलता" के परिदृश्यों पर प्रशिक्षण लेता है। यह सीखता है कि चीजें कब गलत होती हैं और उन्हें कैसे ठीक किया जाए, और यह सब बिना किसी इंसान द्वारा हर गलती को मैन्युअल रूप से रिकॉर्ड किए किया जाता है।

परिणाम

वास्तविक दुनिया के परीक्षणों में (एक भौतिक रोबोटिक आर्म का उपयोग करके):

  • सफलता दर: Sentinel-VLA पिछले सर्वश्रेष्ठ रोबोट मॉडलों की तुलना में कार्यों को 30% अधिक बार सफलतापूर्वक पूरा करता है।
  • गति: क्योंकि यह लगातार "सोचता" नहीं है, यह सरल, बिना सोचने वाले रोबोटों के लगभग समान तेज़ है, लेकिन बहुत अधिक स्मार्ट है।
  • लचीलापन (Resilience): जब वातावरण अव्यवस्थित था या रोबोट किसी चीज़ से टकरा गया, तो Sentinel-VLA ने सुधार किया और कार्य जारी रखा, जबकि अन्य मॉडल या तो हार मान लेते या विफल हो जाते।

संक्षेप में: Sentinel-VLA एक ऐसा रोबोट है जो जानता है कि कब ऑटोपायलट पर काम करना है और कब रुकना है, सोचना है, और अपनी गलतियों को सुधारना है, और यह सब करते हुए वह उन सभी चीजों को करना भी याद रखता है जो उसने पहले सीखी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →