HALO: Heterogeneous Admission through Localized Obligations for Safe Agentic Execution
यह शोध पत्र HALO को प्रस्तुत करता है, जो एक रनटाइम प्रोटोकॉल है जो स्थानीयकृत दायित्वों और प्रेषण से पहले पुन: जाँच कार्यों के आधार पर विषम AI प्रतिक्रियाओं से समर्थित घटकों को चुनिंदा रूप से स्वीकार करके सुरक्षित एजेंटिक निष्पादन सुनिश्चित करता है, जिससे यह उपयोगी कार्यक्षमता को बनाए रखने में पूर्ण-प्रतिक्रिया अस्वीकृति नीतियों से बेहतर प्रदर्शन करता है और पुराने या असुरक्षित संचालन को रोकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अंतरिक्ष यान के कप्तान हैं, लेकिन आप खुद जहाज को नहीं चला रहे हैं, बल्कि आपके पास एक सुपर-स्मार्ट रोबोट सह-पायलट है। यह रोबोट एक "AI एजेंट" है जो आपसे बात तो कर सकता है, लेकिन वह वास्तव में चीज़ें भी कर सकता है: वह थ्रस्टर्स चला सकता है, एयरलॉक खोल सकता है, या एस्टेरॉयड (क्षुद्रग्रह) को स्कैन कर सकता है। अतीत में, ये रोबोट केवल टेक्स्ट सलाह देते थे, जैसे "ईंधन कम है।" लेकिन अब, वे एक साथ कई निर्देशों का एक मिला-जुला थैला भेज सकते हैं: चालक दल के लिए एक मैत्रीपूर्ण नोट, ईंधन पर एक रिपोर्ट, बाईं ओर मुड़ने का एक कमांड, और एक स्टेटस अपडेट जो उस मोड़ पर निर्भर करता है।
यहाँ पेचीदा बात यह है: ब्रह्मांड अव्यवस्थित है और तेज़ी से बदलता है। जब तक रोबोट अपना यह बड़ा, जटिल संदेश टाइप कर रहा होता है, तब तक ईंधन खत्म हो सकता है, मैप अपडेट हो सकता है, या किसी और के द्वारा एयरलॉक लॉक किया जा सकता है। यदि रोबोट अपना पूरा संदेश एक विशाल पैकेज के रूप में भेजता है, और उसका एक हिस्सा अब खतरनाक है, तो आपको शायद पूरे पैकेज को फेंकना पड़ेगा। यह बर्बादी होगी क्योंकि वह मैत्रीपूर्ण नोट और ईंधन की रिपोर्ट अभी भी पूरी तरह सुरक्षित हो सकती है। लेकिन यदि आप केवल सुरक्षित हिस्सों को चुनने की कोशिश करते हैं, तो आप अनजाने में एक ऐसा कमांड भेज सकते हैं जो एक ऐसी जानकारी पर निर्भर है जो अब टूट चुकी है। यह ऐसा है जैसे भूकंप के दौरान घर बनाने की कोशिश करना; आपको उन ईंटों को रखने की आवश्यकता है जो अभी भी ठोस हैं और उन्हें फेंक देने की आवश्यकता है जो धूल बन गई हैं, बिना पूरे निर्माण को ढहाए।
यही वह समस्या है जिसे HALO (Heterogeneous Admission through Localized Obligations) नामक एक नई प्रणाली हल करने की कोशिश करती है। HALO को अंतरिक्ष यान के एयरलॉक पर एक अत्यंत सतर्क सुरक्षा गार्ड और एक सख्त बाउंसर के रूप में समझें जो मिलकर काम कर रहे हैं। जब रोबोट सह-पायलट निर्देशों का वह मिला-जुला थैला भेजता है, तो HALO पूरे पैकेज को सिर्फ देखता नहीं है और यह नहीं कहता कि "जाओ" या "नहीं।" इसके बजाय, यह पैकेज को अलग-अलग हिस्सों में तोड़ देता है। यह प्रत्येक हिस्से की वर्तमान वास्तविकता के विरुद्ध व्यक्तिगत रूप से जाँच करता है। यदि "बाईं ओर मुड़ने" का कमांड एक ऐसे मैप पर आधारित है जो अभी बदल गया है, तो HALO उस विशिष्ट कमांड को ब्लॉक कर देता है। लेकिन यह "ईंधन रिपोर्ट" और "चालक दल के नोट" को गुजरने देता है क्योंकि उन्हें मैप की परवाह नहीं है।
हालाँकि, HALO एक साधारण फिल्टर से कहीं अधिक स्मार्ट है। यह जानता है कि कुछ कमांड दूसरों पर निर्भर होते हैं। यदि "स्टेटस अपडेट" को पहले "बाईं ओर मुड़ने" के कमांड की आवश्यकता है, और HALO उस मोड़ को ब्लॉक कर देता है, तो वह स्टेटस अपडेट को भी ब्लॉक कर देगा। यह वैध हिस्सों को रखता है और टूटे हुए हिस्सों को हटा देता है, जिससे यह सुनिश्चित होता है कि कुछ भी बिना उसके आधार के लटका न रहे।
लेकिन असली जादू तब होता है जब कमांड वास्तव में अंतरिक्ष यान को भेजे जाने से ठीक पहले। HALO एक अंतिम, पलक झपकते ही होने वाली "पुनः जाँच" करता है। यह पूछता है, "क्या यह ठीक वही कमांड अभी भी इस सटीक मिलीसेकंड में सुरक्षित है?" यदि उत्तर नहीं है, तो यह इसे ब्लॉक कर देता है। और सबसे महत्वपूर्ण नियम यह है: यदि कोई कमांड ब्लॉक हो जाता है, तो उसे बाद में "अनब्लॉक" नहीं किया जा सकता। यदि रोबोट फिर से प्रयास करना चाहता है, तो उसे ताज़ा, अपडेट जानकारी और एक नए अनुमति पत्र के साथ वापस आना होगा। यह रोबोट को गलती से एक पुराना, खतरनाक आदेश भेजने से रोकता है जिसे उसने पकड़ कर रखा था।
शोधकर्ताओं ने सिम्युलेटेड दुनिया में ड्रोन (UAVs) के साथ इस प्रणाली का परीक्षण किया और पाया कि यह पूरी तरह से काम करती है। एक परीक्षण में, उनके पास रोबोट के संदेश के 248 अलग-अलग भाग थे। एक मानक प्रणाली जिसने पूरे संदेश को खारिज कर दिया, उसने शून्य भाग रखे। एक प्रणाली जिसने हिस्सों की स्वतंत्र रूप से जाँच की, उसने सभी 248 भाग रखे, लेकिन उसने अनजाने में खतरनाक, पुराने कमांड्स को जाने दिया। हालाँकि, HALO ने सभी 248 वैध भागों को रखा, हर एक खतरनाक कमांड को ब्लॉक किया, और सफलतापूर्वक रोबोट को ताज़ा, सुरक्षित निर्देशों के साथ फिर से प्रयास करने दिया। उन्होंने प्रवेश जाँच के लिए 96 बार और प्रोटोकॉल नियमों के लिए 20 बार परीक्षण किए, और HALO हर एक में पास हुआ। यहाँ तक कि जब उन्होंने सिमुलेशन में वास्तविक ड्रोन उड़ाए, तब भी HALO ने हर एक "स्टेल" (पुराने/अपडेटेड) कमांड को रोका और केवल ताज़ा, सुरक्षित कमांड्स को ही उड़ने दिया।
संक्षेप में, HALO AI एजेंटों को सुरक्षित रूप से काम करने देने का एक नया तरीका है। यह हर निर्देश को अपने आप में एक छोटा हिस्सा मानता है, जाँच करता है कि क्या वह हिस्सा अभी भी वैध है, और यह सुनिश्चित करता है कि यदि कुछ गलत होता है, तो रोबole को नई जानकारी के साथ शुरुआत से शुरू करना होगा। यह एक सुरक्षा जाल की तरह है जो बुरे विचारों को पकड़ लेता है लेकिन अच्छे विचारों को उड़ने देता है, यह सुनिश्चित करता है कि जैसे-जैसे AI अधिक शक्तिशाली होता जा रहा है और अधिक चीजें कर रहा है, वह गलती से अंतरिक्ष यान को क्रैश न कर दे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।