SkillScope: Toward Fine-Grained Least-Privilege Enforcement for Agent Skills
यह शोध पत्र स्किलस्कोप (SkillScope) प्रस्तुत करता है, जो एक ग्राफ-आधारित ढांचा है जो कार्य-आधारित अति-विशेषाधिकार प्राप्त क्रियाओं का पता लगाकर और वैध कार्यक्षमता को बनाए रखते हुए अनुपालन जोखिमों को कम करने के लिए उन्हें सीमित करके, एलएलएम (LLM) एजेंट कौशल के लिए सूक्ष्म-स्तरीय न्यूनतम-विशेषाधिकार सिद्धांतों को लागू करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने दैनिक कार्यों में मदद करने के लिए एक अत्यधिक बुद्धिमान व्यक्तिगत सहायक (एक "AI एजेंट") को काम पर रखा है। इसे और अधिक शक्तिशाली बनाने के लिए, आप इसे "स्किल बुक्स" (कौशल पुस्तकों) का एक पुस्तकालय देते हैं। प्रत्येक पुस्तक में विशिष्ट चीजें करने के लिए निर्देशों और उपकरणों का एक सेट होता है, जैसे कि "मेरे कोड का विश्लेषण करें," "मेरे डीप वर्क को ट्रैक करें," या "मेरे ईमेल का सारांश तैयार करें।"
समस्या यह है कि इनमें से कुछ स्किल बुक्स तीसरे पक्ष (third parties) द्वारा लिखी गई हैं, और वे थोड़ी अधिक उत्साही हो सकती हैं। वे बिल्कुल वही कर सकती हैं जो आपने पूछा है, लेकिन वे बहुत सी अतिरिक्त चीजें भी कर सकती हैं जिनके लिए आपने नहीं कहा था—जैसे आपकी निजी फाइलें पढ़ना, आपका डेटा किसी अजनबी को भेजना, या आपके कंप्यूटर पर जटिल कमांड चलाना। यह "लीस्ट-प्रिविलेज" (न्यूनतम विशेषाधिकार) के नियम का उल्लंघन है: यह विचार कि एक सहायक के पास केवल उस काम को पूरा करने के लिए आवश्यक न्यूनतम शक्ति होनी चाहिए, उससे अधिक नहीं।
यह शोध पत्र इस समस्या को ठीक करने के लिए SkillScope नामक एक नया टूल पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:
1. समस्या: अति-उत्साही इंटर्न (The Over-Enthusiating Intern)
कल्पना कीजिए कि आप एक इंटर्न को "पिछले सप्ताह की बिक्री की एक रिपोर्ट प्रिंट करें" कहते हैं।
- आप क्या चाहते हैं: वे रिपोर्ट प्रिंट करें और उसे आपको सौंप दें।
- एक "बुरे कौशल" (Bad Skill) वाला क्या करता है: वे रिपोर्ट प्रिंट करते हैं, लेकिन वे यह भी करते हैं कि आपकी पूरी हार्ड ड्राइव की कॉपी बनाते हैं, उसे एक रैंडम ईमेल पते पर भेजते हैं, और फिर आपकी सिस्टम फाइलों को डिलीट करने की कोशिश करते हैं ताकि बस सावधानी के तौर पर काम चल जाए।
मौजूदा सुरक्षा उपकरण एक दरवाजे पर खड़े बाउंसर की तरह हैं जो केवल यह देखते हैं कि इंटर्न का नाम "बुरे नामों" की सूची में है या नहीं। यदि इंटर्न अच्छा दिखता है और रिपोर्ट अच्छी है, तो बाउंसर उसे अंदर जाने देता है। वे यह ध्यान नहीं देते कि इंटर्न रिपोर्ट प्रिंट करने के दौरान चुपके से आपकी फाइलें चुरा रहा है। शोध का तर्क है कि हमें यह जांचने के तरीके की आवश्यकता है कि इंटरल इस विशिष्ट कार्य के लिए वास्तव में क्या कर रहा है, न कि केवल यह कि वह सामान्य रूप से "बुरा" है या नहीं।
2. समाधान: SkillScope (स्मार्ट सुपरवाइजर)
SkillScope एक ऐसा फ्रेमवर्क है जो एक अत्यंत सतर्क सुपरवाइजर की तरह काम करता है जो इंटर्न की हर हरकत पर नज़र रखता है। यह तीन मुख्य तरीकों का उपयोग करता है:
चरण A: मानचित्र बनाना (ग्राफ-आधारित विश्लेषण)
सबसे पहले, SkillScope एक अव्यवस्थित "स्किल बुक" (जिसमें प्राकृतिक भाषा के निर्देश और कंप्यूटर कोड होते हैं) को एक स्पष्ट फ्लोचार्ट या मानचित्र में बदल देता है।
- उपमा: कल्पना कीजिए कि एक जटिल रेसिपी (विधि) को एक आरेख (diagram) में बदलना जिसमें हर कदम दिखाया गया हो: "चाकू उठाना," "प्याज काटना," "खिड़की खोलना।"
- लक्ष्य: यह मानचित्र दिखाता है कि निर्देश कंप्यूटर कोड से कैसे जुड़ते हैं। यह सिस्टम को यह देखने में मदद करता है कि "प्याज काटना" (आवश्यक) और "खिड़की खोलना" (अनावश्यक) के बीच क्या अंतर है।
चरण B: "क्या होगा अगर?" परीक्षण (रीप्ले वैलिडेशन)
यह सबसे महत्वपूर्ण हिस्सा है। SkillScope केवल अनुमान नहीं लगाता; यह एक सिमुलेशन चलाता है।
- उपमा: सुपरवाइजर कहता है, "ठीक है, चलिए बिना खिड़की खोले सूप बनाने की कोशिश करते हैं।"
- वे कार्य को दो बार चलाते हैं।
- रन 1: इंटर्न सब कुछ करता है (खिड़की खोलने सहित)।
- रन 2: इंटर्न वही कार्य करने की कोशिश करता है लेकिन उसे खिड़की खोलने से भौतिक रूप से रोक दिया जाता है।
- निर्णय: यदि दोनों रन में सूप का स्वाद एक जैसा रहता है और रिपोर्ट अभी भी प्रिंट होती है, तो "खिड़की खोलना" अनावश्यक था। सुपरवाइजर इसे "ओवर-प्रिविलेज्ड" (अत्यधिक विशेषाधिकार प्राप्त) के रूप में चिह्नित करता है। यदि खिड़की की आवश्यकता के कारण सूप जल जाता है, तो इसका मतलब है कि खिड़की आवश्यक थी, और वे इसे वैसे ही छोड़ देते हैं।
चरण C: ताले लगाना (कंट्रोल-फ्लो कंस्ट्रेनिंग)
एक बार जब सुपरवाइवर को पता चल जाता है कि कौन से कार्य अनावश्यक हैं, तो वे केवल इंटर्न को निकाल नहीं देते या टूल को फेंक नहीं देते। इसके बजाय, वे एक स्मार्ट लॉक लगाते हैं।
- उपमा: वे खिड़की पर एक साइन लगाते हैं जिस पर लिखा है, "खिड़की तभी खोलें जब उपयोगकर्ता स्पष्ट रूप से ताजी हवा के लिए कहे।"
- परिणाम: टूल अभी भी मौजूद रहता है (ताकि यदि आप वास्तव में मांगें तो इंटर्न खिड़की खोल सके), लेकिन यह गलती से या डिफ़ॉल्ट रूप से नहीं होगा। "अतिरिक्त" कार्यों को अब लॉक कर दिया गया है जब तक कि विशिष्ट कार्य की मांग न हो।
3. उन्होंने क्या पाया (परिणाम)
शोधकर्ताओं ने वास्तविक दुनिया के AI स्किल्स (68,000 से अधिक) के एक विशाल संग्रह पर SkillScope का परीक्षण किया।
- खोज: उन्होंने पाया कि "ओवर-प्रिविलेज" (अत्यधिक विशेषाधिकार) हर जगह है। लगभग 7,000 स्किल्स ऐसे काम कर रहे थे जो उपयोगकर्ता द्वारा पूछे गए कार्य से परे अनावश्यक और जोखिम भरे थे।
- सफलता: SkillScope बहुत उच्च सटीकता (लग लगभग 94.5% सफलता दर) के साथ इन समस्याओं को पकड़ने में सक्षम रहा।
- सुधार: जब उन्होंने इन स्किल्स पर "स्मार्ट लॉक" लागू किया, तो उन्होंने 88.5% अनावश्यक जोखिम भरे कार्यों को रोक दिया, लेकिन स्किल्स अभी भी उन कार्यों के लिए पूरी तरह से काम करते रहे जो उपयोगकर्ता वास्तव में चाहता था।
सारांश
SkillScope AI सहायकों के लिए एक गुणवत्ता नियंत्रण निरीक्षक (quality control inspector) की तरह है। केवल यह जांचने के बजाय कि कोई सहायक "अच्छा" है या "बुरा", यह उन्हें एक विशिष्ट कार्य करते हुए देखता है, यह जांचता है कि क्या वे कुछ अतिरिक्त कर रहे हैं जो नहीं पूछा गया था, और फिर उन अतिरिक्त कार्यों पर एक ताला लगा देता है ताकि वे केवल तभी हों जब आप स्पष्ट रूप से ऐसा करने को कहें। यह आपके डेटा को सुरक्षित रखते हुए भी AI को मददगार बनाए रखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।