← नवीनतम पेपर
💻 computer science

Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training

यह शोध पत्र विज़ुओमोटर पॉलिसियों (visuomotor policies) को सत्यापित करने के लिए एक ऐसी विधि प्रस्तुत करता है जो एक कैलिब्रेटेड निम्न-आयामी इंटरफ़ेस के माध्यम से कुशल सेट प्रोपेगेशन (set propagation) को सक्षम करने के लिए विज़ुअल एनकोडर को फ्रीज़ करती है, जिसमें मौजूदा बेसलाइन की तुलना में एक छोटे, संभाव्यता-गारंटीकृत सुलभ-एक्शन रेडियस (reachable-action radius) को प्राप्त करने के लिए सेट-आधारित प्रशिक्षण और कॉन्फॉर्मल कैलिब्रेशन का उपयोग किया गया है।

मूल लेखक: Yanliang Huang, Zhuocheng Zhang, Peng Xie, Zhen Zhang, Wenyuan Wu, Majid Khadiv, Zhuoqi Zeng, Amr Alanwar

प्रकाशित 2026-08-04
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanliang Huang, Zhuocheng Zhang, Peng Xie, Zhen Zhang, Wenyuan Wu, Majid Khadiv, Zhuoqi Zeng, Amr Alanwar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नाजुक काम करना सिखा रहे हैं, जैसे कि एक नाजुक अंडे को उठाना और उसे एक कटोरे में रखना। आप रोबोट को इंसानों द्वारा यह काम करने के हजारों वीडियो दिखाते हैं, और वह एक "पॉलिसी" (policy)—यानी, यह तय करने के नियमों का एक सेट सीखता है कि उसे अपनी भुजा कैसे हिलानी है। लेकिन यहाँ एक पेच है: रोबोट का कैमरा उसके सिर से पूरी तरह से चिपका हुआ नहीं है। समय के साथ, कंपन, गर्मी या एक ढीले पेंच के कारण कैमरा थोड़ा सा खिसक सकता है। रोबोट के लिए, दुनिया अचानक थोड़ी अलग दिखने लगती है। जो कटोरा स्क्रीन के केंद्र में था, वह अब थोड़ा बाईं ओर हो सकता है। यदि रोबोट का दिमाग बहुत अधिक संवेदनशील है, तो वह मामूली बदलाव उसे अंडे के बजाय हवा को पकड़ने के लिए मजबूर कर सकता है, या इससे भी बुरा, अंडे को मेज से टकराकर फोड़ सकता है।

यह विजुओमोटर पॉलिसीज़ (visuomotor policies) की दुनिया है, जहाँ रोबोट देखकर चलना सीखते हैं। वैज्ञानिक एक बड़ा सवाल पूछ रहे हैं: "कैमरा कितना हिल सकता है इससे पहले कि रोबोट कुछ खतरनाक करने लगे?" इस उत्तर को खोजने के लिए, शोधकर्ता रीचेबिलिटी एनालिसिस (reachability analysis) नामक एक अवधारणा का उपयोग करते हैं। इसे रोबोट के संभावित कार्यों के चारों ओर एक सुरक्षा बुलबुले (safety bubble) को खींचने के रूप में समझें। यदि कैमरा खिसकता है, तो रोबोट का कार्य बदल सकता है, लेकिन हम चाहते हैं कि वह नया कार्य एक सुरक्षित क्षेत्र के भीतर ही रहे। समस्या यह है कि आधुनिक रोबोट के दिमाग बहुत विशाल और जटिल होते हैं, जैसे नियमों की एक विशाल लाइब्रेरी। पूरे लाइब्रेरी के लिए सुरक्षा बुलबुले की गणना करना इतना भारी है कि यह व्यावहारिक रूप से असंभव है, और परिणामी बुलबुला अक्सर इतना बड़ा और धुंधला होता है कि वह बेकार हो जाता है।

यह शोध पत्र उस सुरक्षा बुलबुले को रोबोट के दिमाग को तोड़े बिना छोटा करने का एक चतुर तरीका पेश करता है। लेखकों ने, एक सिम्युलेटेड किचन में रोबोटों के साथ काम करते हुए, पाया कि रोबोट की "आंखों" (विजुअल एनकोडर) को फ्रीज करना और केवल "मांसपेशियों" (डाउनस्ट्रीम पॉलिसी) पर भारी गणित करना संभव है। उन्होंने आँखों और मांसपेशियों के बीच एक छोटा, कैलिब्रेटेड "चोक पॉइंट" (choke point) बनाया। इस चोक पॉइंट पर रोबोट को अपना सुरक्षा बुलबुला टाइट रखने के लिए प्रशिक्षित करके, वे यह सिद्ध कर सके कि भले ही कैमरा खिसक जाए, रोबोट का हाथ बहुत दूर नहीं भटकेगा। उन्होंने इसकी तुलना अन्य तरीकों जैसे कि मानक "एडवर्सरियल ट्रेनिंग" (जो रोबोट को बुरे उदाहरणों से trick करने की कोशिश करती है) से की और पाया कि उनकी नई विधि ने एक बहुत अधिक सटीक सुरक्षा बुलबुला तैयार किया, जबकि रोबोट ने अपने कार्यों को सफलतापूर्वक पूरा करना जारी रखा।

समस्या: डगमगाता कैमरा

कल्पना कीजिए कि आपने चश्मा पहना है जो थोड़ा ढीला है। हर बार जब आप अपना सिर घुमाते हैं, तो चश्मा एक मिलीमीटर खिसक जाता है। आपके लिए दुनिया ठीक दिखती है, लेकिन यदि आप गेंद पकड़ने की कोशिश कर रहे एक रोबोट होते, तो वह एक मिलीमीटर का बदलाव आपको पूरी तरह से चूकने पर मजबूर कर सकता था। वास्तविक दुनिया में, रोबोट के कैमरे गर्मी, कंपन या बस किसी टक्कर के कारण खिसक जाते हैं। यह सुरक्षा के लिए एक दुःस्वप्न है। यदि रोबोट सोचता है कि दरवाजा खुला है क्योंकि उसका कैमरा थोड़ा खिसक गया है, तो वह दीवार से टकरा सकता है।

वैज्ञानिकों ने इसे रोबोट को "रोबस्ट" (robust) बनाकर ठीक करने की कोशिश की है, जिसका अर्थ है कि वे इन बदलावों को संभाल सकें। एक लोकप्रिय तरीका एडवर्सरियल ट्रेनिंग (adversarial training) है, जहाँ आप जानबूझकर रोबोट को विकृत चित्र दिखाते हैं ताकि उसे उन्हें अनदेखा करना सिखाया जा सके। दूसरा ऑब्जर्वेशनल कंसिस्टेंसी (observational consistency) है, जो यह कोशिश करता है कि चाहे छवि स्पष्ट हो या धुंधली, रोबोट एक ही उत्तर दे। लेकिन एक समस्या है: हमें वास्तव में यह नहीं पता कि ये रोबोट कितने सुरक्षित हैं। हम आसानी से यह गणना नहीं कर सकते कि कैमरा हिलने पर रोबोट द्वारा किए जाने वाले कार्यों की सटीक सीमा क्या होगी। यह बर्फ पर कार के फिसलने की दूरी का अनुमान लगाने जैसा है, बिना यह जाने कि सड़क का घर्षण (friction) कितना है।

समाधान: "चोक पॉइंट" रणनीति

इस शोध पत्र के लेखकों ने महसूस किया कि पूरे रोबोट मस्तिष्क (विजुअल एनकोडर और पॉलिसी) के लिए सुरक्षा बुलबुले की गणना करना समुद्र तट पर रेत के हर कण को गिनने जैसा है ताकि ज्वार का अनुमान लगाया जा सके। यह बहुत अधिक काम है, और उत्तर बहुत अस्पष्ट है।

उनका विचार एक चोक पॉइंट (choke point) बनाने का था। कल्पना कीजिए कि रोबोट के मस्तिष्क के दो भाग हैं: "आंखें" (जो छवि देखती हैं) और "हाथ" (जो निर्णय लेते हैं कि कैसे हिलना है)। "आंखें" विशाल और जटिल हैं, लेकिन "हाथ" छोटे और सरल हैं। लेखकों ने "आंखों" को फ्रीज करने का निर्णय लिया ताकि वे कभी न बदलें। फिर, उन्होंने आँखों और हाथों के बीच एक छोटा, संकीर्ण रास्ता (एक लो-डायमेंशनल इंटरफेस) डाला।

कैमरे के खिसकने के प्रभाव को पूरे विशाल मस्तिष्क में फैलने देने के बजाय, उन्होंने इसे केवल इस छोटे से रास्ते (टनल) के माध्यम चाहिए। उन्होंने इस टनल को थोड़े से शिफ्ट हुए कैमरों के डेटा का उपयोग करके कैलिब्रेट किया। फिर, उन्होंने इस टनल से गुजरते समय सुरक्षा बुलबुले को ट्रैक करने के लिए ज़ोनोटोप (zonotope) नामक एक गणितीय आकार (सोचिए एक बहु-आयामी, खिंचने वाला गुब्बारा) का उपयोग किया।

जादुई ट्रिक: सेट-बेस्ड ट्रेनिंग

यही असली नवाचार है। आमतौर पर, जब आप एक रोबोट को प्रशिक्षित करते हैं, तो आप उसे बस इतना कहते हैं, "सही काम करो।" यह शोध पत्र एक दूसरा नियम जोड़ता है: "सही काम करो, और अपने सुरक्षा बुलबुले को यथासंभव छोटा भी रखो।"

वे इसे सेट-बेस्ड ट्रेनिंग (set-based training) कहते हैं। कल्पना कीजिए कि आप एक छात्र को वृत्त (circle) बनाना सिखा रहे हैं। एक सामान्य शिक्षक कहता है, "एक वृत्त बनाओ।" एक सेट-बेस्ड शिक्षक कहता है, "एक वृत्त बनाओ, लेकिन सुनिश्चित करें कि वृत्त लक्ष्य तक पहुँचने के दौरान यथासंभव छोटा हो।" रोबोट को प्रशिक्षण के दौरान अपने सुरक्षा बुलबुले के आकार को कम करने के लिए मजबूर करके, रोबोट कैमरे के डगमगाने के प्रति कम संवेदनशील होना सीख जाता है।

लेखकों ने गणितीय रूप से सिद्ध किया कि यदि रोबोट इस चोक पॉइंट पर अपने बुलबुले को कम करता है, तो रोबोट के हाथ की वास्तविक भौतिक गति एक अनुमानित सीमा के भीतर रहेगी। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने यह मापने के लिए कि सुरक्षा त्रिज्या (safety radius) कितनी बड़ी है, स्प्लिट कॉन्फॉर्मल कैलिब्रेशन (split conformal calibration) नामक एक सांख्यिकीय विधि का उपयोग किया। यह 200 टेस्ट रन लेने और यह कहने जैसा है कि, "हमें 99% विश्वास है कि यदि कैमरा खिसकता है, तो रोबोट का हाथ X सेंटीमीटर से अधिक नहीं हिलेगा।"

परिणाम: टाइट बुलबुले, बेहतर रोबोट

टीम ने अपने तरीके का परीक्षण LIBERO-10 नामक एक बेंचमार्क पर किया, जिसमें रोबोट कटोरे को दराज में रखने या स्टोव चालू करने जैसे कार्य करते हैं। उन्होंने अपनी "सेट-बेस्ड ट्रेनिंग" की तुलना तीन अन्य तरीकों से की:

  1. बिहेवियर-ओनली (Behavior-only): केवल रोबोट को कार्य करने के लिए प्रशिक्षित करना, सुरक्षा बुलबुलों की अनदेखी करना।
  2. ऑब्जर्वेशनल कंसिस्टेंसी (Observational consistency): यह कोशिश करना कि रोबोट अलग-अलग दृश्यों के लिए एक ही उत्तर दे।
  3. PGD एडवर्सरियल ट्रेनिंग (PGD Adversarial Training): रोबोट को सबसे खराब कैमरा शिफ्ट्स के साथ धोखा देने की कोशिश करना।

परिणाम स्पष्ट थे। सेट-बेस्ड ट्रेनिंग ने मानक बिहेवियर-ओनली ट्रेनिंग की तुलना में 2.09 गुना छोटा (टाइट) सुरक्षा रेडियस (radius) बनाया। इसका मतलब है कि रोबमान बहुत अधिक अनुमानित था। इससे भी अधिक प्रभावशाली बात यह है कि एडवर्सरियल ट्रेनिंग विधि (जो आमतौर पर बहुत मजबूत होती है) ने एक बड़ा और कम सूचनात्मक सुरक्षा रेडियस बनाया। सेट-बेस्ड विधि ने अपने कार्यों में विफल हुए बिना सुरक्षा बुलबुले को सिकोड़ने में सफलता प्राप्त की। वास्तव में, कुछ कार्यों के लिए, अन्य तरीकों ने रोबोट को पूरी तरह से विफल कर दिया, जबकि सेट-बेस्ड विधि ने उसे काम करते रहने दिया।

यह क्यों महत्वपूर्ण है?

यह शोध पत्र केवल यह नहीं कहता कि "हमारा रोबोट सुरक्षित है।" यह गणितीय गारंटी के साथ उस सुरक्षा को मापने का एक तरीका प्रदान करता है। भारी विजुअल भागों को फ्रीज करके और सुरक्षा गणित को एक छोटे, कैलिब्रेटेड इंटरफेस पर केंद्रित करके, उन्होंने एक ऐसी समस्या को हल कर दिया जो पहले बहुत कठिन थी।

उन्होंने दिखाया कि रोबोट को अपने "सुरक्षा बुलबुले" को टाइट रखने के लिए प्रशिक्षित करके, आपको एक ऐसा रोबोट मिलता है जो न केवल अपने काम में अच्छा है, बल्कि चीजें गलत होने पर भी अनुमानित (predictable) है। यदि कैमरा खिसकता है, तो अब आप 99% विश्वास के साथ कह सकते हैं, "रोबोट का हाथ 0.111 यूनिट से अधिक नहीं हिलेगा।" इस तरह का निश्चितता हमारे घरों और कार्यस्थलों में रोबोटों को रखने की दिशा में एक बड़ा कदम है, जहाँ सुरक्षा ही सब कुछ है। लेखक सुझाव देते हैं कि यह दृष्टिकोण यह सत्यापित करने की कुंजी हो सकता है कि रोबोट भरोसेमंद होने के लिए पर्याप्त सुरक्षित हैं, जिससे सुरक्षा की अस्पष्ट उम्मीदों को ठोस, गणना योग्य संख्याओं में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →