← नवीनतम पेपर
💻 computer science

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

यह शोध पत्र ManiGuard प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और डेटा सूट है जो सुरक्षा विशिष्टताओं को कार्य सफलता से अलग करके रोबोटिक मैनिपुलेशन नीतियों की सुरक्षा का कठोरता से मूल्यांकन और सुधार करता है, और औपचारिक रनटाइम मॉनिटरिंग का उपयोग करके यह प्रकट करता है कि जबकि फाइन-ट्यूनिंग सुरक्षा को बढ़ाती है, अधिक डेटा और वितरण बदलावों (distribution shifts) के बावजूद महत्वपूर्ण अंतराल बने रहते हैं।

मूल लेखक: Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

प्रकाशित 2026-08-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट हमारे घरेलू काम करने के लिए सीख रहे हैं, जो सरल, दोहराव वाले आंदोलनों से बढ़कर मेज साफ करने या रसोई व्यवस्थित करने जैसे जटिल कार्यों तक पहुँच रहे हैं। यह प्रगति "फाउंडेशन मॉडल्स" (foundation models) पर निर्भर करती है, जो एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जो भाषा, दृष्टि और गति को एक साथ समझने के लिए विशाल डेटा से सीखता है। ये प्रणालियाँ किसी काम को पूरा करने में बेहतर हो रही हैं, लेकिन एक महत्वपूर्ण प्रश्न बना हुआ है: क्या वे बिना नुकसान पहुँचाए इसे कर सकती हैं? वास्तविक दुनिया में, एक रोबोट जो सफलतापूर्वक कप को कैबिनेट में रख देता है, वह वहाँ पहुँचने के दौरान एक फूलदान गिरा सकता है, पेय गिरा सकता है, या किसी नाजुक वस्तु को तोड़ सकता है। रोबोट्स के शोध प्रयोगशालाओं से हमारे घरों में आने के लिए, हमें यह जानने की आवश्यकता है कि वे न केवल सफल होते हैं, बल्कि क्या वे सुरक्षित रूप से सफल होते हैं। इसके लिए सुरक्षा को मापने के एक ऐसे तरीके की आवश्यकता है जो सफलता के माप जितना ही सटीक हो, जो केवल अंतिम परिणाम को देखने के बजाय नियमों के एक स्पष्ट सेट के विरुद्ध हर गतिविधि की जाँच करे।

शोधकर्ताओं की एक टीम ने इस प्रश्न का उत्तर देने के लिए 'मनीगार्ड' (ManiGuard) नामक एक नया ढांचा पेश किया है। उन्होंने एक कठोर परीक्षण क्षेत्र बनाया है जो सुरक्षा को एक अलग, गैर-परक्राम्य लक्ष्य के रूप में मानता है, जो इस बात से स्वतंत्र है कि रोबोट कार्य पूरा करता है या नहीं। मानव पर्यवेक्षकों द्वारा यह अनुमान लगाने पर निर्भर रहने के बजाय कि एक रोबोट सुरक्षित था या नहीं, या पक्षपाती हो सकने वाले AI न्यायाधीशों के बजाय, शोधकर्ताओं ने सुरक्षा नियमों को परिभाषित करने के लिए एक औपचारिक, गणितीय प्रणाली का उपयोग किया। उन्होंने इन नियमों को तार्किक बाधाओं (logical constraints) के एक सेट में अनुवादित किया, जैसे कि "जार को उठाने तक बंद रहना चाहिए" या "बर्तन साफ करते समय भोजन को न छुएं।" जैसे ही रोबोट एक उच्च-सटीकता वाले सिमुलेशन में चलता है, एक डिजिटल मॉनिटर वास्तविक समय में इन नियमों के विरुद्ध प्रत्येक कदम की जाँच करता है। यदि रोबोट किसी ऐसी चीज़ से टकराता है जिसे उसे नहीं छूना चाहिए या कोई वस्तु गिरा देता है, तो सिस्टम तुरंत उल्लंघन को चिह्नित कर देता है, चाहे रोबोट अंततः अपने मुख्य कार्य को पूरा ही क्यों न कर ले।

शोधकर्ताओं ने छह श्रेणियों में दो सौ विभिन्न घरेलू कार्यों को व्यवस्थित किया, जो सरल 'पिक-एंड-प्लेस' क्रियाओं से लेकर दराजों या रखे हुए बर्तनों वाले जटिल, बहु-चरणीय कार्यों तक फैले हुए हैं। प्रत्येक कार्य के लिए, उन्होंने एक विशिष्ट सुरक्षा नियम बनाया जो लक्ष्य के 'ऑर्थोगोनल' (orthogonal) था, जिसका अर्थ है कि एक रोबोट तकनीकी रूप से सुरक्षा नियम तोड़ते हुए भी कार्य पूरा कर सकता था। इसके बाद, उन्होंने कई उन्नत AI नीतियों का परीक्षण किया, पहले बिना किसी विशेष प्रशिक्षण के और फिर एक नए डेटासेट पर प्रशिक्षण देने के बाद। यह डेटासेट अद्वितीय था क्योंकि इसे उसी सुरक्षा मॉनिटर का उपयोग करके बनाया गया था; शोधकर्ताओं ने हजारों प्रदर्शन (demonstrations) एकत्र किए जहाँ रोबोटों ने कार्यों को सफलतापूर्वक पूरा किया लेकिन कभी भी सुरक्षा नियम का उल्लंघन नहीं किया, जिससे AI के सीखने के लिए "सुरक्षित" व्यवहार का एक पुस्तकालय तैयार हुआ।

परिणामों ने वर्तमान रोबोटिक बुद्धिमत्ता के बारे में एक कड़वी सच्चाई का खुलासा किया। बिना प्रशिक्षण के परीक्षण किए जाने पर, रोबलेट शायद ही कभी कार्यों में संलग्न होते थे, वे अक्सर गलती करने के जोखिम के बजाय कुछ न करना चुनते थे। जब उन्होंने कार्य किया, तो वे अक्सर असुरक्षित थे। सुरक्षित प्रदर्शनों पर प्रशिक्षण के बाद भी, उनमें काफी सुधार हुआ, लेकिन एक बड़ा अंतर बना रहा। शोधकर्ताओं ने पाया कि सफल कार्यों में से छह से इक्कीस प्रतिशत वास्तव में असुरक्षित थे; रोबोटों ने अपने लक्ष्यों को प्राप्त किया लेकिन रास्ते में सुरक्षा नियमों का उल्लंघन किया। इसके अलावा, लगभग समान सफलता दर वाले दो रोबोटों के सुरक्षा रिकॉर्ड बहुत अलग हो सकते थे, जो यह सिद्ध करता है कि काम पूरा करना सुरक्षित रूप से करने की गारंटी नहीं देता है।

नए सुरक्षा-चिह्नित डेटा पर रोबोटों को प्रशिक्षित करने से मदद मिली, जिससे सुरक्षित कार्य पूर्णता की दर शून्य के करीब से बढ़कर सात से तीस प्रतिशत के बीच पहुँच गई। हालाँकि, शोधकर्ताओं ने पाया कि केवल समान सुरक्षित प्रदर्शनों को जोड़ने से समस्या हल नहीं हुई। जब रोबोटों को वातावरण में मामूली बदलावों का सामना करना पड़ा, जैसे कि अलग बैकग्राउंड या बदली हुई वस्तु, तो उनके सुरक्षा प्रदर्शन में गिरावट आई। कुछ कार्य, विशेष रूप से दराजों या नाजुक स्टैकिंग से जुड़े कार्य, अत्यंत कठिन बने रहे, जहाँ परीक्षण की गई प्रत्येक नीति के लिए सुरक्षित सफलता दर दो प्रतिशत से नीचे रही। अध्ययन ने यह भी दिखाया कि जबकि सिमुलेशन के परिणाम आम तौर पर भविष्यवाणी करते थे कि कौन से रोबोट अधिक सुरक्षित थे, दुर्घटनाओं की सटीक आवृत्ति हमेशा भौतिक रोबोट पर होने वाली घटनाओं से मेल नहीं खाती थी, जो सुझाव देता है कि सिमुलेशन एक उपयोगी मार्गदर्शिका है लेकिन एक पूर्ण 'क्रिस्टल बॉल' नहीं है।

अंततः, यह कार्य प्रदर्शित करता है कि सुरक्षा एक अलग चुनौती है जिसे केवल रोबጦ को कार्य पूरा करने में बेहतर बनाकर हल नहीं किया जा सकता है। शोधकर्ताओं ने दिखाया कि वर्तमान AI मॉडल अभी तक भौतिक दुनिया की बाधाओं या उन्हें दिए गए विशिष्ट सुरक्षा नियमों को पूरी तरह से नहीं समझते हैं। हालांकि सावधानीपूर्वक क्यूरेट किए गए, सुरक्षित डेटा पर फाइन-ट्यूनिंग करने से मदद मिलती है, लेकिन यह कोई रामबाण (silver bullet) नहीं है। निरंतर विफलताएं, प्रशिक्षण के बाद भी, यह संकेत देती हैं कि भविष्य की प्रगति के लिए केवल यह सिखाने के नए तरीकों की आवश्यकता होगी कि क्या करना है, बल्कि यह भी कि भौतिक दुनिया के नियमों को तोड़े बिना इसे कैसे करना है। मनीगार्ड ढांचा इस प्रगति को कठोरता से मापने के उपकरण प्रदान करता है, जो न केवल सक्षम, बल्कि वास्तव में सुरक्षित रोबोट विकसित करने के लिए एक स्पष्ट मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →