← नवीनतम पेपर
💻 computer science

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

यह शोध पत्र विषम रोबोटों (heterogeneous robots) के लिए एक तैनात करने योग्य सुरक्षा ढांचे का प्रस्ताव करता है जो कैलिब्रेटेड जोखिम और प्रगति पूर्वानुमान के लिए एक एक्शन-कंडीशन्ड JEPA वर्ल्ड मॉडल को एक नियतात्मक मॉडल-आधारित सुरक्षा शील्ड और फॉलबैक लैडर के साथ जोड़ता है, जो निष्पादन-समय गारंटी बनाए रखते हुए सिमुलेशन में बेहतर सफलता दर और कम टक्कर वाले फॉल्स नेगेटिव प्रदर्शित करता है।

मूल लेखक: Kaiming Zhong, Tianhua Liu, Yue Wang

प्रकाशित 2026-08-19
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaiming Zhong, Tianhua Liu, Yue Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक अव्यवस्थित शेल्फ के सामने खड़ा है, जिसे एक विशिष्ट वस्तु प्राप्त करने का कार्य सौंपा गया है। एक इंसान के लिए, यह निर्णय सहज है: हाथ बढ़ाओ, वस्तु को पकड़ो, और उसे बाहर खींच लो। लेकिन एक मशीन के लिए, यह क्षण अनिश्चितताओं का एक जाल है। क्या हाथ पास के किसी बॉक्स से टकरा जाएगा? क्या ग्रिपर चिकनी सतह पर फिसल जाएगा? क्या यह क्रिया वास्तव में कार्य को आगे बढ़ाएगी, या यह केवल तंत्र को जाम कर देगी? आधुनिक रोबट अक्सर इसे हल करने के लिए दो अलग-अलग दृष्टिकोणों पर निर्भर करते हैं। एक दृष्टिकोण नकल करके सीखने के लिए डेटा की विशाल मात्रा का उपयोग करता है, ठीक वैसे ही जैसे एक बच्चा दूसरों को देखकर चलना सीखता है। ये प्रणालियाँ अविश्वसनीय रूप से लचीली होती हैं और नए निर्देशों को संभाल सकती हैं, लेकिन वे मूल रूप से केवल अनुमान लगा रही होती हैं; वे होने से पहले अपने कार्यों के भौतिक परिणामों को वास्तव में नहीं समझती हैं। दूसरा दृष्टिकोण भौतिकी और ज्यामिति के सख्त गणितीय मॉडलों पर निर्भर करता है। ये प्रणालियाँ कठोर और सुरक्षित हैं, लेकिन वे जड़ हैं, जो वास्तविक दुनिया के अव्यवस्थित और अप्रत्याशित वातावरण का सामना करने पर अक्सर विफल हो जाती हैं।

आज की रोबोटिक्स की मुख्य चुनौती इस अंतर को पाटना है: एक ऐसी प्रणाली बनाना जो सीखने वाले मॉडलों जितनी अनुकूलनीय हो लेकिन गणित-आधारित मॉडलों जितनी विश्वसनीय भी हो। गुआंगडोंग बिफेंग इंटेलिजेंट कंट्रोल टेक्नोलॉजी कंपनी लिमिटेड के शोधकर्ताओं ने एक नया आर्किटेक्चर प्रस्तावित किया है जो इस विशिष्ट तनाव को हल करने के लिए डिज़ाइन किया गया है। उनका कार्य एक एकल मॉडल को सब कुछ पूरी तरह से करने के लिए मजबूर करने का प्रयास नहीं करता है। इसके बजाय, वे "यह अनुमान लगाने" के काम को "यह सुनिश्चित करने" के काम से अलग करते हैं कि कुछ भी खतरनाक न हो। उन्होंने एक ऐसी प्रणाली बनाई है जहाँ एक लचीला लर्निंग मॉडल संभावित क्रियाओं की एक सूची का सुझाव देता है, और एक अलग, अपरिवर्तनीय सुरक्षा गार्ड (safety guard) प्रत्येक सुझाव की भौतिकी के कठोर नियमों और रोबोट के विशिष्ट शरीर के विरुद्ध जाँच करता है। लर्निंग मॉडल सबसे अच्छे विकल्प को खोजने के लिए विकल्पों को रैंक कर सकता है, लेकिन उसे सुरक्षा गार्ड को ओवरराइड करने की अनुमति नहीं है। यदि गार्ड कहता है कि एक क्रिया असुरक्षित है, तो उस क्रिया को खारिज कर दिया जाता है, चाहे लर्निंग मॉडल कितना भी आश्वस्त क्यों न हो।

इस विचार का परीक्षण करने के लिए, टीम ने एक फ्रेमवर्क विकसित किया है जो एक रैपिड-फायर सिमुलेशन इंजन की तरह कार्य करता है। जब रोबोट किसी चाल पर विचार करता है, तो सिस्टम वर्तमान दृश्य और रोबोट की स्थिति का एक स्नैपशॉट लेता है। एक लचीला "प्रपोजर" (proposer) घटक, जो एक सीखा हुआ पॉलिसी या एक गणितीय प्लानर हो सकता है, उम्मीदवार क्रियाओं का एक सेट उत्पन्न करता है। इनमें किसी वस्तु तक पहुँचना, नॉब घुमाना, या बेस को हिलाना शामिल हो सकता है। इन चालों को तुरंत निष्पादित करने के बजाय, सिस्टम उन्हें एक छिपे हुए, अमूर्त स्थान (abstract space) में एक "वर्ल्ड मॉडल" के माध्यम से चलाता है। यह मॉडल भविष्यवाणी करता है कि यदि रोबोट अगले कुछ सेकंड के लिए प्रत्येक उम्मीदवार क्रिया को करता है तो क्या होगा। महत्वपूर्ण रूप से, यह भविष्यवाणी रोबोट की भौतिक सीमाओं, जैसे कि उसके जॉइंट एंगल्स और रुकने की दूरी पर आधारित होती है। सिस्टम फिर दो कारकों के आधार पर प्रत्येक अनुमानित भविष्य को स्कोर देता है: लक्ष्य की ओर कितनी प्रगति होगी, और इसमें कितना जोखिम है, जैसे कि टक्कर या फंसने की संभावना।

इस डिज़ाइन का सबसे महत्वपूर्ण नवाचार स्कोरिंग को सुरक्षा जाँच से अलग करना है। लर्निंग मॉडल एक स्कोर प्रदान करता है जो उम्मीदवारों को रैंक करता है, यह सुझाव देता है कि कौन सा सफल होने की सबसे अधिक संभावना रखता है। हालाँकि, एक अलग, नियत (deterministic) सुरक्षा कवच (safety shield) अंतिम द्वारपाल के रूप में कार्य करता है। यह कवच रोबोट के हार्डवेयर के विशिष्ट कठोर नियमों का एक सेट है। यह जाँचता है कि क्या क्रिया जॉइंट सीमाओं का उल्लंघन करती है, क्या रोबोट पलट जाएगा, या क्या यह किसी ज्ञात बाधा से टकरा जाएगा। यह कवच सीखा हुआ नहीं है; यह बाधाओं का एक निश्चित सेट है। यदि कवच किसी उम्मीदवार को खारिज कर देता है, तो उस उम्मीदवार को दौड़ से बाहर कर दिया जाता है, चाहे उसका स्कोर कितना भी अधिक क्यों न हो। यदि कवच प्रत्येक उम्मीदवार को खारिज कर देता है, तो सिस्टम अनुमान नहीं लगाता या जबरदस्ती कोई चाल नहीं चलता। इसके बजाय, यह पूर्व-निर्धारित 'फालबैक' क्रियाओं का पालन करता है: यह सुरक्षित रूप से रुक जाता है, पिछले सुरक्षित राज्य पर वापस जाने का प्रयास करता है, विकल्पों की एक विस्तृत श्रृंखला के साथ पुन: योजना बनाने का प्रयास करता है, या अंततः मानव से मदद मांगता है। यह सुनिश्चित करता है कि रोबोट कभी भी ऐसी स्थिति में न जाए जिससे वह उबर न सके।

शोधकर्ताओं ने इस फ्रेमवर्क का परीक्षण LIBERO-Long नामक एक सिम्युलेटेड वातावरण में किया, जिसमें लंबी क्रियाओं के अनुक्रमों की आवश्यकता वाले विभिन्न कार्य शामिल हैं। उन्होंने अपने पूर्ण सिस्टम की तुलना कई बेसलाइनों से की, जिसमें एक रोबलेट शामिल था जो स्मार्ट रैंकिंग के बिना केवल सुरक्षा कवच का उपयोग करता है, और एक जो हार्ड कवच के बिना केवल स्मार्ट रैंकिंग का उपयोग करता है। परिणामों ने दिखाया कि दोनों तत्वों को मिलाना आवश्यक था। पूर्ण सिस्टम ने अकेले सुरक्षा कवच का उपयोग करने की तुलना में कार्यों को पूरा करने की सफलता दर में सात प्रतिशत अंकों का सुधार किया। इससे भी महत्वपूर्ण बात यह है कि इसने मिस किए गए टकरावों की दर को—वे मामले जहाँ सिस्टम एक क्रैश की भविष्यवाणी करने में विफल रहा जो वास्तव में हुआ था—इक्कीस प्रतिशत से घटाकर चौदह प्रतिशत कर दिया, जबकि सुरक्षा का वही स्तर बनाए रखा। सिस्टम ने यह भी प्रदर्शित किया कि यह वास्तविक रोबोट पर पाए जाने वाले हार्डवेयर पर कुशलतापूर्वक चल सकता है, एक सेकंड से भी कम समय में निर्णय ले सकता है, जो कई कंट्रोल लूप्स के लिए पर्याप्त तेज़ है।

हालाँकि, पेपर इन निष्कर्षों की सीमाओं को नोट करने में सावधानी बरतता है। सुधारों को सिमुलेशन में मापा गया था, और हालांकि परिणाम आशाजनक हैं, लेकिन अभी तक वास्तविक दुनिया में एक भौतिक रोबोट पर सिद्ध नहीं हुए हैं। शोधकर्ताओं ने यह भी पाया कि जबकि सुरक्षा कवच ने टकरावों को काफी कम कर दिया, स्मार्ट रैंकिंग घटक ने इस विशिष्ट परीक्षण आकार में एक सरल रैंकिंग पद्धति की तुलना में सांख्यिकीय रूप से महत्वपूर्ण सुधार नहीं दिखाया, हालांकि रुझान सकारात्मक था। यह सुझाव देता है कि जबकि सुरक्षा गार्ड विश्वसनीयता का प्राथमिक स्रोत है, लर्निंग मॉडल की विकल्पों को रैंक करने की क्षमता अभी भी सुधार का एक क्षेत्र है। अध्ययन स्पष्ट रूप से इस विचार को खारिज करता है कि एक लर्निंग मॉडल पर अकेले सुरक्षा की गारंटी देने के लिए भरोसा किया जा सकता है। इसके बजाय, यह तर्क देता है कि सुरक्षा को नियमों के एक अलग, अलिखित (unlearned) स्तर से आना चाहिए जिसे लर्निंग मॉडल बायपास नहीं कर सकता।

यह कार्य अंशांकन (calibration) के महत्व पर भी प्रकाश डालता है। कई मशीन लर्निंग सिस्टम में, एक मॉडल टक्कर के उच्च जोखिम की भविष्यवाणी कर सकता है, लेकिन उस संख्या का अर्थ वह नहीं हो सकता जो दिखता है। शोधकर्ताओं ने अपने सिस्टम को इस तरह प्रशिक्षित किया कि जब यह दस प्रतिशत दुर्घटना की संभावना की भविष्यवाणी करता है, तो वास्तव में दुर्घटना लगभग दस प्रतिशत बार होती है। यह अंशांकन सिस्टम को बेहतर निर्णय लेने में सक्षम बनाता है कि हस्तक्षेप कब किया जाए। इसके बिना, सिस्टम बहुत अधिक सतर्क हो सकता है, लगातार रुक सकता है और कभी भी कार्य पूरा नहीं कर पाएगा, या बहुत लापरवाह हो सकता है, वास्तविक खतरों को मिस कर सकता है।

अंततः, यह शोध जटिल, असंरचित वातावरण में बिना सीखने और अनुकूल होने की क्षमता को खोए, सुरक्षित रूप से काम करने वाले रोबोट बनाने के लिए एक ब्लूप्रिंट प्रदान करता है। यह एक ऐसे भविष्य का प्रस्ताव करता है जहाँ रोबोट केवल चलना नहीं सीख रहे हैं, बल्कि वे एक स्थायी, अटूट सुरक्षा विवेक (safety conscience) से लैस हैं जो उनके सीखने से स्वतंत्र रूप से कार्य करता है। सिस्टम रोबोट के पूर्ण होने पर निर्भर नहीं है; यह रोबोट के पास स्पष्ट, अपरिवर्तनीय सीमाओं के होने पर निर्भर है जिन्हें वह पार नहीं कर सकता। "सबसे अच्छा मूव क्या है?" को "एक सुरक्षित मूव क्या है?" के प्रश्न से अलग करके, शोधकर्ताओं ने एक ऐसा फ्रेमवर्क बनाया है जो लचीला और मजबूत है, जो विषम (heterogeneous) रोबोटों की अगली पीढ़ी के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →