← नवीनतम पेपर
⚡ electrical engineering

Towards General Language-Conditioned Latent Safety Filters

यह शोध पत्र विभिन्न रोबोटिक कार्यों में विविध सुरक्षा बाधाओं को गतिशील रूप से लागू करने के लिए हैमिल्टन-जैकोबी एक्टर्स और क्रिटिक्स का उपयोग करते हुए एक भाषा-सशर्त सुरक्षा फ़िल्टरिंग फ्रेमवर्क प्रस्तावित करता है, जो उल्लंघनों में कमी और अनदेखी बाधा संस्थाओं (unseen constraint instances) में आंशिक स्थानांतरण प्रदर्शित करता है।

मूल लेखक: Ihab Tabbara, Yuxuan Yang, Hussein Sibai

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ihab Tabbara, Yuxuan Yang, Hussein Sibai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल अनाड़ी मशीनें नहीं हैं जिन्हें एक विशिष्ट काम करने के लिए प्रोग्राम किया गया है, जैसे कि एक टोस्टर जो केवल ब्रेड टोस्ट करता है। इसके बजाय, एक ऐसे रोबोट की कल्पना करें जो एक मददगार दोस्त की तरह आपको समझ सके। आप कह सकते हैं, "कृपया मेज साफ कर दो," या "इन ब्लॉक्स से एक मीनार बनाओ," और वह समझ जाएगा कि इसे कैसे करना है। यह "जनरलिस्ट" (सामान्यज्ञ) रोबोट लर्निंग का रोमांचक क्षेत्र है, जहाँ आर्टिफिशियल इंटेलिजेंस वह सब जोड़ता है जो वह देखता है (दृष्टि/विज़न) और जो आप कहते हैं (भाषा), ताकि यह तय किया जा सके कि क्या करना है (क्रिया/एक्शन)। लेकिन यहाँ एक पेंच है: सिर्फ इसलिए कि एक रोबोट आपकी बात समझने के लिए पर्याप्त स्मार्ट है, इसका मतलब यह नहीं है कि वह यह जानने के लिए भी पर्याप्त स्मार्ट है कि क्या नहीं करना है। यदि आप उसे मेज साफ करने के लिए कहते हैं, तो वह गलती से एक कीमती फूलदान गिरा सकता है या दूध का गिलास गिरा सकता है।

रोबोट को सुरक्षित रखने के लिए, वैज्ञानिक "सेफ्टी फ़िल्टर" (सुरक्षा फिल्टर) नामक चीज़ का उपयोग करते हैं। इस फ़िल्टर को एक सख्त, अदृश्य संरक्षक देवदूत (गार्जियन एंजल) के रूप में सोचें जो रोबोट के मस्तिष्क के ठीक बगल में खड़ा है। इससे पहले कि रोबोट अपना हाथ हिलाए, संरक्षक उस योजना की जाँच करता है। यदि योजना ऐसी दिखती है जिससे फूलदान से टकराने की संभावना है, तो संरक्षक हस्तक्षेप करता है, नियंत्रणों को थाम लेता है, और रोबोट को खतरे से दूर ले जाता है। पारंपरिक रूप से, ये संरक्षक बहुत कठोर थे; आपको उन्हें विशेष रूप से फूलदानों के बारे में सिखाना पड़ता था, फिर अलग से वाइन ग्लास के बारे में, और फिर अलग से गर्म कॉफी के बारे में। यदि आप चाहते थे कि रोबोट किसी नई चीज़ से बचे, तो आपको संरक्षक को शुरू से फिर से प्रशिक्षित करना पड़ता था। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम रोबोट के संरक्षक को केवल हमारी बात सुनकर किसी भी सुरक्षा नियम को समझने के लिए सिखा सकते हैं, ताकि वह बिना किसी पूर्ण रीबूट के तुरंत नई स्थितियों के अनुकूल हो सके?

यह शोध पत्र, जिसका शीर्षक "टुवर्ड्स जनरल लैंग्वेज-कंडीशन्ड लेटेंट सेफ्टी फिल्टर्स" (Towards General Language-Conditioned Latent Safety Filters) है, ठीक इसी विचार की खोज करता है। लेखक, इहाब टैबारा, युक्सुआन यांग और हुसैन सिबाई, एक प्रकार के नए सुरक्षा फ़िल्टर का प्रस्ताव करते हैं जिसे हर नए नियम के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं होती है। इसके बजाय, उन्होंने एक ऐसी प्रणाली बनाई है जहाँ संरक्षक एक प्राकृतिक भाषा निर्देश सुन सकता है—जैसे "दूध के डिब्बे को मत छुओ"—और तुरंत उस नियम को रोबोट की क्रियाओं पर लागू कर सकता है। उन्होंने इसका परीक्षण ब्लॉक्स उठाने, मेज पोंछने या वस्तुओं को एक के ऊपर एक रखने जैसे कार्यों को करने वाले रोबोटों पर किया।

शोधकर्ताओं ने पाया कि यह "लैंग्वेज-कंडीशन्ड" (भाषा-आधारित) फ़िल्टर आश्चर्यजनक रूप से अच्छा काम करता है। अपने प्रयोगों में, इस नए फ़िल्टर ने सफलतापूर्वक रोबोट को विशिष्ट वस्तुओं से टकराने से रोका जब उसे उनसे बचने के लिए कहा गया था, भले ही रोबोट की मूल योजना सीधे उनसे टकराने की थी। उदाहरण के लिए, एक कार्य में जहाँ रोबot को एक विशिष्ट क्रम में रंगीन ब्लॉक्स को स्टैक (एक के ऊपर एक रखना) करना था, फ़िल्टर ने रोबोट को निर्देशों का सही ढंग से पालन करने में लगभग 80% बार मदद की, भले ही निर्देश बदल दिए गए थे। फ़िल्टर कुछ हद तक सामान्यीकरण (जनरलाइज) करने में भी सक्षम था; जब उन्होंने इसका परीक्षण उन वस्तुओं या रंगों पर किया जिन्हें उसने पहले कभी नहीं देखा था (जैसे लाल के बजाय पीली किताब), तो वह अभी भी यादृच्छिक संभावना (रैंडम चांस) से बेहतर तरीके से नियमों का पालन करने में सफल रहा, हालांकि वह पूर्ण नहीं था।

हालाँकि, शोध पत्र सावधानी बरतते हुए इसे एक आदर्श समाधान नहीं कहता है। लेखक दिखाते हैं कि जबकि यह फ़िल्टर एक बड़ी प्रगति है, फिर भी यह गलतियाँ करता है, विशेष रूप से तब जब रोबोट दुनिया को कैमरे (दृष्टि) के माध्यम से देख रहा होता है (बनाम यह जानना कि प्रत्येक वस्तु की सटीक स्थिति क्या है, जो एक ऐसी सुपरपावर की तरह है जो रोबोट के पास वास्तव में नहीं है)। उन्होंने यह भी परीक्षण किया कि उन्नत एआई मॉडल "आंखों" के रूप में कार्य कर सकते हैं जो फ़िल्टर को बताते हैं कि क्या खतरनाक है, लेकिन पाया कि यहाँ तक कि सबसे स्मार्ट वर्तमान मॉडल भी अकेले सुरक्षा के एकमात्र निर्णायक के रूप में विश्वसनीय नहीं हैं।

अध्ययन सुझाव देता है कि हम एक ऐसे भविष्य की ओर बढ़ रहे हैं जहाँ हमारे पास एक सामान्य सुरक्षा फ़िल्टर हो सकता है जो केवल उन्हें पढ़कर कई अलग-अलग नियमों को समझना सीखता है, बजाय इसके कि कमरे में मौजूद हर एक वस्तु के लिए एक अद्वितीय फ़िल्टर की आवश्यकता हो। जबकि वर्तमान संस्करण दोषरहित नहीं है और अभी भी पूरी तरह से नई स्थितियों के साथ संघर्ष करता है, परिणाम बताते हैं कि यह दृष्टिकोण एक आशाजनक मार्ग है। यह एक ऐसे भविष्य का संकेत देता है जहाँ रोबोट को ऑन-द-फ्लाई जटिल, बदलते सुरक्षा निर्देश दिए जा सकते हैं, जिससे वे हमारे घरों और कार्यस्थलों में अधिक सुरक्षित और उपयोगी बन सकते हैं, बिना हर बार फर्नीचर बदलने पर इंजीनियरों की एक टीम को पुन: प्रोग्राम करने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →