← नवीनतम पेपर
🤖 AI

ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency

ActFovea एक प्लग-एंड-प्ले रनटाइम सेफगार्डिंग फ्रेमवर्क है जो विजुअल ओवरले और एक्शन ड्रिफ्ट जैसे व्यवधानों के विरुद्ध विजन-लैंग्वेज-एक्शन (VLA) पॉलिसियों की मजबूती को बढ़ाता है, जो अंतर्निहित पॉलिसी को संशोधित किए बिना विफलताओं का पता लगाने और रिकवरी या सेफ-स्टॉप तंत्र को ट्रिगर करने के लिए स्थानिक-काल्पनिक (spatiotemporal) विजुअल-एक्शन निरंतरता को लागू करता है।

मूल लेखक: Wenda Yu, Tianshi Wang, Fengling Li, Xin Li, Jingjing Li, Lei Zhu

प्रकाशित 2026-08-03
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenda Yu, Tianshi Wang, Fengling Li, Xin Li, Jingjing Li, Lei Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे कपड़े तह करना या सैंडविच बनाना। आप रोबोट को हर एक हरकत के लिए प्रोग्राम नहीं करते; इसके बजाय, आप उसे एक "दिमाग" देते हैं जो दुनिया को देख सके, आपकी बातों को समझ सके और यह तय कर सके कि आगे क्या करना है। इसे विजन-लैंग्वेज-एक्शन (VLA) पॉलिसी कहा जाता है। यह एक रोबोट को एक सुपर-स्मार्ट असिस्टेंट देने जैसा है जो एक बिखरे हुए कमरे की तस्वीर देखता है, आपसे "साफ करो" सुनता है, और फिर चीजों को उठाने के लिए अपने हाथों को कैसे हिलाना है, इसका निर्णय लेता है।

लेकिन पेचीदा हिस्सा यह है कि इस असिस्टेंट के काम करने के लिए, उसकी आँखें (कैमरा), उसके शरीर की स्थिति का अहसास (सेंसर्स), और उसकी हरकतें (एक्शन्स) सभी पूरी तरह से तालमेल में होने चाहिए। यदि कैमरा एक ऐसे कप की तस्वीर दिखाता है जो वास्तव में तीन सेकंड पुराना है, या यदि रोबोट को लगता है कि उसने कप पकड़ा हुआ है लेकिन उसका हाथ वास्तव में खाली है, तो रोबोट भ्रमित हो जाएगा। वह हवा में हाथ मारने की कोशिश कर सकता है या चीजों को गिरा सकता है। यह शोध पत्र इस समस्या पर ध्यान केंद्रित करता है कि क्या होता है जब यह सटीक तालमेल टूट जाता—जब रोबोट की वास्तविकता ग्लिच (glitch), देरी या दृश्य भ्रम (visual illusions) से प्रभावित होती है। लक्ष्य एक ऐसा सुरक्षा कवच (safety net) बनाना है जो रोबोट के क्रैश होने से पहले उसे पकड़ ले, बिना उसके दिमाग को फिर से प्रशिक्षित किए या उसके व्यक्तित्व को बदले।


मैट्रिक्स में गड़बड़ी: मिलिए ActFovea से

मिलिए ActFovea से, जो रोबोटिक दिमागों के लिए एक नया "गार्जियन एंजल" (रक्षक देवदूत) है। एक VLA पॉलिसी को एक प्रतिभाशाली लेकिन थोड़े अनुभवहीन शेफ (रसोइया) के रूप में सोचें जो एक जटिल भोजन बनाने की कोशिश कर रहा है। शेफ रेसिपी का पालन करने में बहुत अच्छा है, लेकिन अगर कोई काउंटर पर रखी सामग्री को बदल दे, ताजी सब्जियों की डिलीवरी में देरी कर दे, या शेफ को उस बर्तन को चलाते रहने के लिए कहे जो पहले ही खाली हो चुका है, तो शेफ एक आपदा बना सकता है।

ActFovea एक अत्यंत सतर्क 'सू-शेफ' (सहायक रसोइया) की तरह है जो मुख्य शेफ के ठीक बगल में खड़ा है। इसका काम खाना बनाना नहीं है; इसका काम शेफ, सामग्री और टाइमर को देखना और यह सुनिश्चित करना है कि सब कुछ आपस में मेल खा रहा है। यदि शेफ एक ऐसी गाजर काटने की कोशिश करता है जो वहां है ही नहीं, या यदि कैमरा फीड कल के लंच की एक स्थिर तस्वीर पर अटक गई है, तो ActF-ovea हस्तक्षेप करेगा और कहेगा, "रुको, ठहरो! यहाँ कुछ गलत है।"

ActFovea का जादू यह है कि इसे खाना बनाना सीखने की आवश्यकता नहीं है। यह रोबोट के दिमाग को फिर से प्रशिक्षित नहीं करता या उसके कोड को नहीं बदलता। इसके बजाय, यह एक "प्लग-एंड-प्ले" सुरक्षा परत के रूप में कार्य करता है। यह रोबोट की आँखों और हाथों के बीच बैठता है, यह जाँचता है कि जो रोबोट देख रहा है, जो वह महसूस कर रहा है और जो वह करने की योजना बना रहा है, क्या वे सभी एक ही कहानी बता रहे हैं।

यह मुसीबत को कैसे पहचानता है

शोधकर्ताओं ने पाया कि रोबोट चार विशिष्ट और चालाकी भरे तरीकों से विफल हो सकते हैं, और ActFovea को उन सभी को पकड़ने के लिए डिज़ाइन किया गया है:

  1. "लेंस पर स्टिकर" (विजुअल ओवरले): कल्पना कीजिए कि किसी ने रोबोट के कैमरा लेंस के एक हिस्से पर स्थायी स्टिकर लगा दिया है। रोबोट उस हैंडल को पकड़ने की कोशिश कर सकता है जो वास्तव में स्टिकर से ढका हुआ है। ActFovea नोटिस करता है कि जब रोबोट हिलता है तो "स्टिकर" नहीं हिलता, जिससे उसे पता चलता है कि इमेज दूषित (corrupted) है।
  2. "धीमा इंटरनेट" (विजुअल डिले): कभी-कभी वीडियो फीड लैग करती है। रोबोट एक स्थान पर कप देखता है, लेकिन जब तक वह अपना हाथ बढ़ाता है, तब तक कप हिल चुका होता है। ActFovea जाँच करता है कि क्या तस्वीर "ताज़ा" है या यह एक पुराना स्नैपशॉट है, और वह रोबोट की अपेक्षाओं को उसी के अनुसार समायोजित करता है।
  3. "डिफ्टिंग हैंड" (एक्शन ड्रिफ्ट): रोबोट एक कप उठाने के लिए एक सुचारू पथ की योजना बनाता है, लेकिन किसी ग्लिच के कारण, उसका हाथ रास्ते से भटकने लगता है। ActFovea नियोजित गति की निगरानी करता है और वास्तविक दृश्य के साथ तुलना करता है। यदि हाथ दीवार की ओर भटक रहा है, तो वह हस्तक्षेप करता है।
  4. "फ्रोजन स्क्रीन" (रीप्ले): यह सबसे डरावना है। कल्पना कीजिए कि कैमरा फीड एक साफ मेज की एक सिंगल फ्रेम पर अटक गई है, भले ही रोबोट वास्तव में एक गंदे कमरे में हो। रोबोट बार-बार एक ऐसी मेज को साफ करने की कोशिश करता है जो पहले से ही साफ है। ActFovea महसूस करता है कि छवि बिल्कुल नहीं बदली है और रोबोट भ्रम (hallucinating) का शिकार हो रहा है।

"फोविया" ट्रिक: जहाँ ज़रूरी है वहीं देखना

सबसे शानदार बात यह है कि ActFovea दुनिया को कैसे देखता है। पूरी तस्वीर को एक पर्यटक की तरह देखने के बजाय, यह एक्शन-कंडीशन्ड फोविएशन (Action-Conditioned Foveation) का उपयोग करता है।

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं। आपको बैकग्राउंड में घास की हर एक पत्ती देखने की ज़रूरत नहीं है; आपको केवल यह देखने की ज़रूरत है कि आपका कैरेक्टर कूदने वाला है। ActFovea भी वही करता है। यह रोबोट के अपने शरीर (kinematics) के ज्ञान और अपनी चालों का उपयोग करके स्क्रीन पर एक "स्पॉटलाइट" बनाता है। यह छवि के उच्च-डेफिनिशन, महत्वपूर्ण हिस्सों (जैसे वह कप जिसे वह पकड़ने वाला है) को एकदम स्पष्ट रखता है, जबकि उबाऊ बैकग्राउंड को धुंधला कर देता है या अनदेखा कर देता है।

यदि रोबोट एक कप की ओर बढ़ रहा है, तो स्पॉटलाइट कप का पीछा करती है। यदि रोबोट अपना हाथ हिला रहा है, तो स्पॉटलाइट हाथ के पथ का पीछा करती है। यह यह पहचानने में बहुत आसान बनाता है कि कहीं कुछ गलत तो नहीं है। यदि "स्पॉटलाइट" एक ऐसा कप देखती है जो रोबोट की अपेक्षा के अनुसार नहीं हिल रहा है, या यदि स्पॉटलाइट के हिलने के दौरान बैकग्राउंड स्थिर रहता है, तो अलार्म बज जाता है।

बचाव योजना: ठीक करें या रुकें?

जब ActFovea किसी समस्या का पता लगाता है, तो वह केवल घबराता नहीं है। इसके पास दो-चरणीय योजना है:

चरण 1: क्या हम इसे ठीक कर सकते हैं?
यदि समस्या देरी या छोटा विजुअल ग्लिच है, तो ActFovea इमेज को "हील" करने की कोशिश करता है। यह पिछले कुछ सेकंड के वीडियो का उपयोग करके अनुमान लगा सकता है कि दृश्य कैसा होना चाहिए, या यह इमेज से नकली स्टिकर हटाने की कोशिश कर सकता है। फिर यह रोबोट के दिमाग से पूछता है: "यदि मैं आपको यह साफ की हुई तस्वीर दूँ, तो क्या आप एक सुरक्षित चाल चलेंगे?" यदि रोबोट सहमत होता है, तो ActFovea उसे आगे बढ़ने देता है।

चरण 2: सुरक्षित स्टॉप (Safe Stop)।
यदि समस्या बहुत बड़ी है—जैसे कि यदि कैमरा पूरी तरह से जम गया है और रोबोट को पता ही नहीं है कि वह कहाँ है—तो ActFovea जानता है कि इसे ठीक करने की कोशिश करना खतरनाक है। इस स्थिति में, यह एक "सेफ फेलियर" (सुरक्षित विफलता) को ट्रिगर करता है। यह धीरे से रोबोट के हाथों को रोकता है, उन्हें अपनी जगह पर थाम लेता है, और प्रतीक्षा करता है। रोबोट के लिए हाथ-पैर चलाने और कुछ तोड़ने से बेहतर है कि वह स्थिर रहे और कुछ न करे।

परिणाम: दिन बचाना

शोधकर्ताओं ने π0\pi_0 नामक एक लोकप्रिय रोबोट ब्रेन का उपयोग करके 40 अलग-अलग रोबोट कार्यों पर ActFovea का परीक्षण किया। परिणाम प्रभावशाली थे:

  • विजुअल ग्लिच: जब उन्होंने कैमरा लेंस पर नकली स्टिकर लगाए, तो बिना मदद के रोबोट की सफलता दर गिरकर 49.3% रह गई। ActFovea के साथ, यह बढ़कर 90.3% हो गई। इसका मतलब है कि ActFovea ने उन 93.7% कार्यों को बचा लिया जो अन्यथा विफल हो जाते।
  • देरी और ड्रिफ्ट: जब वीडियो धीमा था या रोबोट का हाथ भटकने लगा, तो ActFovea ने क्रमशः सफलता दर में 9.8% और 7.0% का सुधार किया, जबकि जब सब कुछ ठीक चल रहा था तब भी इसने बेहतरीन काम किया।
  • फ्रोजन स्क्रीन: सबसे खराब स्थिति में, जहाँ कैमरा फीड पूरी तरह से फ्रीज हो गई थी, ActFovea ने कभी भी रोबोट को क्रैश नहीं होने दिया। उन 100% मामलों में, इसने रोबोट को समय रहते रोक दिया, जिससे "अनप्रोटेक्टेड फेलियर्स" (असुरक्षित विफलताएं) को रोका गया जहाँ रोबोट खुद को या वातावरण को नुकसान पहुँचा सकता था।

यह क्यों मायने रखता है

सबसे रोमांचक बात यह है कि ActFovea बिना रोबोट के दिमाग को बदले काम करता है। आपको रोबोट को फिर से प्रशिक्षित करने या उसे नए कौशल सिखाने की आवश्यकता नहीं है। आप बस इस सुरक्षा परत को ऊपर से जोड़ देते हैं। यह एक स्मार्ट लेकिन अनाड़ी रोबोट को सुरक्षा चश्मा और एक रिफ्लेक्सिव गार्डियन देने जैसा है जो जानता है कि कब हस्तक्षेप करना है।

यह शोध पत्र दिखाता है कि यह जाँचकर कि क्या रोबोट की आँखें, शरीर और क्रियाएं एक ही कहानी बता रही हैं, हम इन रोबोटों को बहुत अधिक सुरक्षित और विश्वसनीय बना सकते हैं। चाहे वह कारखाने में रोबोट हो, घरेलू सहायक हो, या मेडिकल डिवाइस, ActFovea सुझाव देता है कि हम एक ऐसा भविष्य बना सकते हैं जहाँ रोबोट न केवल अच्छा काम करते हैं, बल्कि यह भी जानते हैं कि चीजें बिगड़ने से पहले कब रुकना है और मदद मांगनी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →