← नवीनतम पेपर
🤖 AI

SafeBranch: Branch-Pair Safety Alignment for Embodied Agents

SafeBranch एक ऐसा फ्रेमवर्क है जो विजन-लैंग्वेज-मॉडल-आधारित एम्बोडीड एजेंटों की सुरक्षा को बढ़ाता है, जो उन्हें अपने स्वयं के असुरक्षित रोलआउट्स से प्राप्त ब्रांच पेयर्स पर प्रशिक्षित करके उन्हें कार्य सफलता से समझौता किए बिना या परिनियोजन (डिप्लॉयमेंट) के दौरान किसी क्रिटिक की आवश्यकता के बिना, सुरक्षा-महत्वपूर्ण चरणों को विश्वसनीय रूप से संभालने में सक्षम बनाता है।

मूल लेखक: Hyunse Lee, Jiwoo Jeong, Haneul Lee, Kyochul Jang, Youngjae Yu, Woojin Lee

प्रकाशित 2026-08-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunse Lee, Jiwoo Jeong, Haneul Lee, Kyochul Jang, Youngjae Yu, Woojin Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

ऐसे रोबोट जो हमारे घरों को देख सकते हैं, समझ सकते हैं और उनमें घूम सकते हैं, वे अब केवल विज्ञान कथा (साइंस फिक्शन) का सपना नहीं रहे; वे उन्नत कंप्यूटर मॉडलों द्वारा संचालित एक वास्तविकता बनते जा रहे हैं जो छवियों और भाषा दोनों को प्रोसेस करते हैं। ये सिस्टम "आड़ू को प्लेट पर रख दो" जैसे निर्देशों का पालन कर सकते हैं और फल और बर्तन खोजने के लिए रसोई में नेविगेट कर सकते हैं। हालाँकि, किसी कार्य को केवल पूरा करने और उसे सुरक्षित रूप से करने के बीच एक महत्वपूर्ण अंतर है। एक रोबोट सफलतापूर्वक प्लेट पर आड़ू रख सकता है, लेकिन यदि वह रेफ्रिजरेटर का दरवाजा खुला छोड़ देता है या फल को किसी गंदी सतह पर रख देता है, तो वह सबसे महत्वपूर्ण परीक्षण में विफल रहा है: घर और उसके निवासियों की रक्षा करना। यह विशिष्ट चुनौती, जिसे 'इंटरैक्टिव सेफ्टी' (संवादात्मक सुरक्षा) कहा जाता है, इसलिए उत्पन्न होती है क्योंकि रोबोट के अपने कार्य वातावरण को बदलते हैं, जिससे नए खतरे पैदा होते हैं जो पहले मौजूद नहीं थे। यदि कोई रोबोट खाना पकाने के बाद स्टोव का बर्नर चालू छोड़ देता है या गीले हाथों से बिजली के सॉकेट को छू लेता है, तो वह खतरा उसके अपने विकल्पों का सीधा परिणाम होता है। मुख्य कठिनाई इस तथ्य में निहित है कि सुरक्षा हर एक कदम के लिए एक निरंतर आवश्यकता नहीं है; बल्कि, सुरक्षा कुछ महत्वपूर्ण क्षणों पर तय की जाती है जहाँ रोबोट को एक सुरक्षित पथ और एक खतरनाक शॉर्टकट के बीच चयन करना होता है।

लंबे समय तक, शोधकर्ताओं ने एक अलग 'सेफ्टी गार्ड' जोड़कर इसे हल करने की कोशिश की जो रोबोट को हर कदम पर देखता रहे, जैसे कि एक मानव पर्यवेक्षक जो लगातार हस्तक्षेप करके कहता है "रुको" या "इसे ठीक करो।" हालांकि यह काम करता है, लेकिन यह धीमा, महंगा है और इससे रोबोट स्वयं अपरिवर्तित और गार्ड पर निर्भर रहता है। एक अधिक कठिन लेकिन आशाजनक दृष्टिकोण यह है कि रोबोट को अपने आप सुरक्षित होना सिखाया जाए, लेकिन मानक शिक्षण विधियाँ संघर्ष करती रही हैं। केवल रोबोट को एक सुरक्षित कार्य का वीडियो दिखाने से यह स्पष्ट नहीं होता कि कोई विशिष्ट चरण क्यों सुरक्षित था, और एक सुरक्षित पथ की तुलना एक पूरी तरह से अलग असुरक्षित पथ से करने पर अक्सर रोबोट भ्रमित हो जाता है क्योंकि दोनों पथ बहुत से तरीकों से भिन्न होते हैं। 'सेफब्रांच' (SafeBranch) नामक एक नए फ्रेमवर्क के पीछे के शोधकर्ताओं ने महसूस किया कि वास्तव में सुरक्षा सीखने के लिए, एक रोबोट को बिल्कुल उसी स्थिति के दो संस्करण देखने की आवश्यकता है: एक जहाँ वह एक सुरक्षित विकल्प चुनता है और दूसरा जहाँ वह एक खतरनाक विकल्प चुनता है, जबकि बाकी सब कुछ समान रहता है।

इसे प्राप्त करने के लिए, टीम ने रोबोट की अपनी गलतियों से इन विशिष्ट शिक्षण क्षणों को बनाने के लिए एक चतुर विधि विकसित की। रोबोट के विफल होने का इंतजार करने और फिर एक सुरक्षित विकल्प मिलने की उम्मीद करने के बजाय, उन्होंने रोबोट को एक कार्य करने दिया और जब वह एक खतरनाक चाल चलता है, तो वे सिमुलेशन को ठीक उसी क्षण तक वापस ले जाते हैं जहाँ गलती हुई थी। उस सटीक बिंदु पर, वे रोबोट को फिर से प्रयास करने के लिए कहते हैं, इस बार खतरे के बारे में एक संकेत के साथ जो उसने अभी-अभी पैदा किया है। रोबोट फिर खतरनाक क्रिया को बदलने के लिए एक सुरक्षित क्रिया उत्पन्न करता है। मूल असुरक्षित क्रिया को इस नई सुरक्षित क्रिया के साथ जोड़कर, और यह सुनिश्चित करके कि दोनों बिल्कुल एक ही स्थिति से शुरू होते हैं, शोधकर्ताओं ने एक "ब्रांच पेयर" (शाखा युग्म) बनाया। यह युग्म उस एकल निर्णय को अलग करता है जो मायने रखता है, यह दिखाते हुए कि इस विशिष्ट संदर्भ में, एक विकल्प सुरक्षा की ओर ले जाता है और दूसरा खतरे की ओर। इसके बाद उन्होंने रोबोट को लगातार सुरक्षित शाखा चुनने के लिए सिखाने हेतु एक प्रशिक्षण प्रक्रिया का उपयोग किया, जिससे सुरक्षा के पाठों को प्रभावी रूप से आत्मसात किया जा सके ताकि बाहरी गार्ड की अब आवश्यकता न रहे।

विभिन्न घरेलू कार्यों में, जिनमें अनदेखी वस्तुएं और नए परिदृश्य शामिल थे, इस दृष्टिकोण के परिणाम आश्चर्यजनक थे। मानक परीक्षणों में, जो रोबोट इस विधि के साथ प्रशिक्षित नहीं थे, वे केवल 3 प्रतिशत समय ही कार्यों को सुरक्षित रूप से पूरा कर पाए। सेफब्रांच विधि के साथ प्रशिक्षण के बाद, रोबोट लगभग 28 प्रतिशत समय कार्यों को सुरक्षित रूप से पूरा करने में सफल रहे, जो दस गुना सुधार है। इससे भी महत्वपूर्ण बात यह है कि जब रोबोटों को उन पूरी तरह से नई वस्तुओं का सामना करना पड़ा जिन्हें उन्होंने पहले कभी नहीं देखा था, तो अ प्रशिक्षित रोबोट केवल 5 प्रतिशत समय सुरक्षित थे, जबकि सेफब्रांच-प्रशिक्षित रोबोट लगभग 47 प्रतिशत प्रयासों में सुरक्षित रहे। महत्वपूर्ण रूप से, रोबोट अत्यधिक सतर्क नहीं हुए या काम करने से इनकार नहीं किया; उन्होंने नुकसान पहुँचाने वाले विशिष्ट चरणों से बचते हुए काम पूरा करने के लिए आवश्यक जोखिम लेना सीख लिया। अन्य विधियों के विपरीत, जिन्हें हर कदम पर बैकग्राउंड में चलने के लिए एक अलग सुरक्षा मॉड्यूल की आवश्यकता होती है, सेफब्रांच-प्रशिक्ित रोबोट स्वतंत्र रूप से कार्य करते हैं, और सुरक्षा ज्ञान को अपनी निर्णय लेने की प्रक्रिया के भीतर ही रखते हैं।

यह कार्य यह प्रदर्शित करता है कि रोबोट में सुरक्षा अधिक नियम या बाहरी जांच जोड़ने का मामला नहीं है, बल्कि एजेंट को उस सटीक क्षण को पहचानने के लिए सिखाने का है जहाँ एक विकल्प मायने रखता है। प्रशिक्षण डेटा का निर्माण करके जो एक ही संदर्भ में सुरक्षित और असुरक्षित क्रियाओं के बीच अंतर करता है, शोधकर्ताओं ने दिखाया कि रोबोट निरंतर पर्यवेक्षण के बिना मानव घर की जटिल और परिवर्तनशील दुनिया में नेविगेट करना सीख सकते हैं। यह विधि विभिन्न प्रकार के खतरों, जैसे कि बिजली के झटके और आग के जोखिम से लेकर खाद्य संदूषण और ठोकर लगने के खतरों तक, प्रभावी साबित हुई, जो मददगार रोबोटों को तैनात करने के लिए एक मजबूत मार्ग का सुझाव देती है जो बिना किसी निरंतर निगरानी के सुरक्षित रूप से कार्य करने के लिए भरोसेमंद हो सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →