TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation
TRUSS एक साक्ष्य-आधारित ढांचा है जो कार्यात्मक प्रभावशीलता और सुरक्षा दोनों के लिए कौशल को बार-बार परिष्कृत करने हेतु एक नियंत्रित वातावरण में स्थिर सुरक्षा निरीक्षणों को गतिशील निष्पादन ट्रेसेस के साथ जोड़कर कार्य-विश्वसनीय और उपयोगकर्ता-सुरक्षित स्वचालित एजेंट कौशल उत्पन्न करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से विकसित होती दुनिया में, सॉफ्टवेयर एजेंट साधारण योजना बनाने से आगे बढ़कर वास्तविक दुनिया में कार्यों को सीधे करने की ओर बढ़ रहे हैं। जटिल या विशिष्ट कार्यों को संभालने के लिए, डेवलपर्स अक्सर इन एजेंटों को "कौशल" (skills) देते हैं—जो कि पुन: प्रयोज्य चरणों, विशिष्ट ज्ञान और डिजिटल उपकरणों तक पहुंच को मिलाने वाले पैकेज्ड निर्देश होते हैं। ये कौशल एक एजेंट को बिना शून्य से पुनः प्रशिक्षित हुए एक नई क्षमता सीखने की अनुमति देते हैं। हालांकि, इन कौशलों का निर्माण पारंपरिक रूप से एक मैनुअल प्रक्रिया रही है, जिसमें यह सुनिश्चित करने के लिए गहन विशेषज्ञता की आवश्यकता होती है कि निर्देश उपयोगी और सुरक्षित दोनों हों। जैसे-जैसे स्वचालित एजेंटों की मांग बढ़ रही है, शोधकर्ता इन कौशलों को स्वचालित रूप से लिखने के लिए आर्टिफिशियल इंटेलिजेंस की ओर मुड़ रहे हैं। केंद्रीय चुनौती एक नाजुक संतुलन है: एक कौशल काम पूरा करने के लिए पर्याप्त प्रभावी होना चाहिए, लेकिन इसे इतना सुरक्षित भी होना चाहिए कि एजेंट गलती से फाइलें डिलीट न कर दे, डेटा चोरी न कर ले, या खतरनाक कमांड निष्पादित न कर दे। यदि कोई कौशल खराब तरीके से लिखा गया है, तो यह एक सहायक को सुरक्षा जोखिम में बदलकर उपयोगकर्ता के कंप्यूटर को नुकसान पहुँचा सकता है।
शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए TRUSS नामक एक नया फ्रेमवर्क विकसित किया है। केवल उत्पन्न किए गए कौशल के लिखित निर्देशों को यह देखने के लिए जाँचने के बजाय कि वे सही दिखते हैं या नहीं, TRUSS उस कौशल को उपयोग में लाने से पहले एक कठोर परीक्षण (trial run) से गुजारता है। यह प्रणाली एक सख्त गुणवत्ता नियंत्रण रेखा की तरह कार्य करती है जो एक सावधानीपूर्वक दस्तावेज़ समीक्षा को एक लाइव, पर्यवेक्षित टेस्ट ड्राइव के साथ जोड़ती है। सबसे पहले, प्रणाली कौशल के निर्देशों को पढ़ती है और उन्हें ज्ञात तथ्यों और सुरक्षा नियमों के विरुद्ध जाँचती है। यदि निर्देश इस प्रारंभिक स्टेटिक चेक (static check) में पास हो जाते हैं, तो कौशल को तुरंत जारी नहीं किया जाता है। इसके बजाय, इसे एक सुरक्षित, अलग वातावरण (isolated environment) में लोड किया जाता है जहाँ एक "शैडो एजेंट" (shadow agent) इसका उपयोग करने का प्रयास करता है। एक शैडो एजेंट कार्य करने का प्रयास करता है जबकि मॉनिटर्स का एक सेट हर उस क्रिया पर नज़र रखता है जिसे कौशल करने का प्रयास करता है। ये मॉनिटर्स सटीक रूप से रिकॉर्ड करते हैं कि क्या हुआ, जिससे कौशल के व्यवहार का एक विस्तृत लॉग बनता है, जिसमें प्रतिबंधित क्षेत्रों तक पहुँचने या जोखिम भरी कमांड चलाने के किसी भी प्रयास शामिल हैं।
इस दृष्टिकोण की शक्ति उन गलतियों को पकड़ने की क्षमता में निहित है जो कागज़ पर अदृश्य होती हैं। एक कौशल अपने टेक्स्ट विवरण में हानिरहित लग सकता है, लेकिन यह वास्तव में निष्पादित होने पर ऐसी घटनाओं की श्रृंखला को ट्रिगर कर सकता है जो सुरक्षा उल्लंघन का कारण बनती है। TRUSS इन लाइव परीक्षणों से एकत्र किए गए साक्ष्यों का उपयोग विफलताओं की पहचान करने के लिए करता है। यदि कौशल कुछ असुरक्षित करने की कोशिश करता है या कार्य पूरा करने में विफल रहता है, तो सिस्टम उस विफलता को उस हिस्से से जोड़ देता है जिसके कारण वह हुई। यह जानकारी फिर जनरेटर को वापस भेजी जाती है, जो समस्या को ठीक करने के लिए कौशल को फिर से लिखता है। परीक्षण, पहचान और सुधार का यह चक्र तब तक चलता रहता है जब तक कि कौशल को कार्यात्मक रूप से प्रभावी और पूरी तरह से सुरक्षित सिद्ध नहीं कर दिया जाता। शोधकर्ताओं ने सैकड़ों अलग-अलग परिदृश्यों पर इस पद्धति का परीक्षण किया, जिसमें वे मामले भी शामिल थे जहाँ कौशलों को जानबूझकर छिपे हुए हमलों को शामिल करने के लिए डिज़ाइन किया गया था।
इस अध्ययन के परिणाम आश्चर्यजनक थे। जब शोधकर्ताओं ने TRUSS से असुरक्षित कौशलों की पहचान करने के लिए कहा, तो इसने पूर्ण सटीकता प्राप्त की, मूल्यांकन के लिए उपयोग किए गए 168 मैच किए गए SkillInject आर्टिफैक्ट्स के भीतर बिना किसी गलत अलार्म के हर एक दुर्भावनापूर्ण मामले को पकड़ा। इसके विपरीत, वे सिस्टम जो केवल निर्देशों के टेक्स्ट को देखते थे, उन्होंने इन खतरों में से अधिकांश को मिस कर दिया। जब सिस्टम को पहले से ही खतरनाक कौशलों को ठीक करने के लिए कहा गया, तो इसने सफलतापूर्वक हमलों की दर को लगभग आधा कर दिया, और साथ ही यह भी सुनिश्चित किया कि कौशल अपने इच्छित कार्यों को पूरा करें। 187 विभिन्न कार्यों के लिए नए कौशल के स्वचालित निर्माण से जुड़े एक व्यापक परीक्षण में, फ्रेमवर्क ने एजेंटों की सफलता दर को एक निम्न बेसलाइन से बढ़ाकर आधे से अधिक प्रयासों तक पहुँचा दिया, जबकि साथ ही परीक्षण किए गए परिदृश्यों में सुरक्षा पास रेट को 100 प्रतिशत तक बढ़ा दिया। इसका अर्थ यह है कि पहली बार, सिस्टम ऐसे कौशल उत्पन्न करने में सक्षम था जो न केवल काम करने में बेहतर थे बल्कि परीक्षण किए गए परिदृश्यों में सुरक्षा मानदंडों को भी पूरा करते थे।
शोधकर्ताओं ने पाया कि केवल स्टैटिक एनालिसिस (static analysis) पर निर्भर रहना—जो कोड या टेक्स्ट को बिना चलाए जाँचने की प्रक्रिया है—अपर्याप्त था। कई खतरनाक व्यवहार केवल तभी उभरते हैं जब एक कौशल वास्तविक वातावरण के साथ इंटरैक्ट करता है, एक ऐसा सूक्ष्म अंतर जिसे टेक्स्ट-आधारित जाँच अक्सर मिस कर देती है। वास्तविक निष्पादन से साक्ष्य प्राप्त करने पर जोर देकर, TRUSS वास्तविक अभ्यास में विश्वसनीय कौशल के निर्माण में मार्गदर्शन करने में सक्षम रहा, न कि केवल सिद्धांत में। यह अध्ययन प्रदर्शित करता है कि स्वचालित कौशल निर्माण को सुरक्षित और प्रभावी बनाया जा सकता है, बशर्ते कि सिस्टम उपयोगकर्ता के डेटा को छूने से पहले नियंत्रित सेटिंग में कौशल के व्यवहार को सत्यापित करे। यह कार्य एक ऐसे मार्ग का सुझाव देता है जहाँ आर्टिफिशियल इंटेलिजेंस सुरक्षित रूप से अपनी क्षमताओं का विस्तार कर सकता है, जिससे एजेंटों को उन सिस्टमों की सुरक्षा से समझौता किए बिना समस्याओं को हल करने के लिए नए उपकरण मिल सकें जिन पर वे कार्य करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।