SecureClaw: Clawing Back Control of LLM Agents
SecureClaw टूल-उपयोग करने वाले LLM एजेंटों के लिए एक दोहरी-सीमा सुरक्षा वास्तुकला (dual-boundary security architecture) है जो रीड ऑपरेशन्स के लिए एक विश्वसनीय गेटवे और राइट ऑपरेशन्स के लिए एक PREVIEW-to-COMMIT प्रोटोकॉल को लागू करके अनधिकृत बाहरी कार्यों और संवेदनशील डेटा के प्रदर्शन को रोकता है, जिससे कार्य उपयोगिता (task utility) बनाए रखते हुए कई बेंचमार्क में लगभग शून्य हमले की सफलता दर प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने संवेदनशील कार्यों, जैसे बिलों का भुगतान करने, निजी ईमेल पढ़ने या अपना कैलेंडर प्रबंधित करने के लिए एक बहुत ही बुद्धिमान, लेकिन अविश्वसनीय व्यक्तिगत सहायक (LLM एजेंट) को काम पर रखा है।
समस्या यह है कि यह सहायक थोड़ा अनियंत्रित है। यदि आप उन्हें आपके बैंक खाते का नंबर वाला कोई दस्तावेज़ देते हैं, तो वे गलती से (या दुर्भावनापूर्ण रूप से) उसे किसी अजनबी को ज़ोर से पढ़कर सुना सकते हैं, या वे किसी ईमेल के अंदर छिपे हुए नोट से ठगे जा सकते हैं ताकि आपका पैसा किसी स्कैमर को भेज सकें।
वर्तमान सुरक्षा गार्ड आमतौर पर सहायक को बुरा काम करने से रोकने की कोशिश करते हैं (जैसे पैसा भेजना), लेकिन वे अक्सर सहायक को पहले से ही रहस्य देखने से रोकने में विफल रहते हैं। एक बार जब सहायक रहस्य देख लेता है, तो वे सुरक्षा गार्ड के रोकने से पहले ही इसे अन्य प्रोग्रामों को फुसफुसा सकते हैं या इसे अपने नोट्स में लिख सकते हैं।
SecureClaw एक नया सुरक्षा तंत्र है जिसे इन दोनों समस्याओं को एक साथ हल करने के लिए डिज़ाइन किया गया है। यह "देखने" और "करने" को दो अलग-अलग कार्यों के रूप में मानता है जिन्हें दो अलग-अलग तालों की आवश्यकता होती है।
यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:
SecureClaw के दो ताले
1. पढ़ने के लिए "आंखों पर पट्टी" (द गेटवे)
कल्पना कीजिए कि आपके सहायक को यह जानने के लिए एक गुप्त इनवॉइस (बीजक) को देखने की आवश्यकता है कि कितना भुगतान करना है।
- पुराना तरीका: आप सहायक को वास्तविक पेपर इनवॉइस थमा देते हैं। वे नंबर पढ़ सकते हैं, उन्हें कॉपी कर सकते हैं, या सुनने वाले हैकर को भी वे नंबर बोलकर सुना सकते हैं।
- SecureClaw का तरीका: आप उन्हें कागज नहीं देते। इसके बजाय, आप उन्हें एक रहस्यमयी बॉक्स ("ओपेक हैंडल") और एक छोटा, संक्षिप्त नोट ("बाउंडेड समरी") देते हैं।
- नोट कहता है: "वेंडर A से इनवॉइस, $4,200, शुक्रवार तक देय है।"
- रहस्यमयी बॉक्स एक कोड है जिसे केवल सुरक्षित वॉल्ट (vault) ही खोलना जानता है।
- सहायक उस नोट और कोड का उपयोग करके अपना काम प्लान कर सकते हैं, लेकिन वे वास्तविक इनवॉइस विवरण देखने के लिए बॉक्स को नहीं खोल सकते। वे वास्तविक नंबरों को कॉपी नहीं कर सकते क्योंकि उन्होंने उन्हें कभी देखा ही नहीं।
2. करने के लिए "दोहरा चेक" (द एक्सेक्यूटर)
अब, कल्पना कीजिए कि सहायक उस इनवॉइस का भुगतान करने के लिए एक ईमेल भेजना चाहता है।
- पुराना तरीका: सहायक ईमेल लिखता है और "Send" दबाता है। यदि किसी हैकर ने सहायक को स्कैमर को पैसे भेजने के लिए ईमेल पता बदलने के लिए बहकाया है, तो पैसा स्कैमर के पास चला जाएगा।
- SecureClaw का तरीका: सहायक केवल ईमेल का प्रस्ताव (propose) दे सकता है। वे एक ड्राफ्ट लिखते हैं और कहते हैं, "मैं इसे भेजना चाहता हूँ।"
- एक विश्वसनीय गार्ड (एक्सेक्यूटर) उस ड्राफ्ट को उठाता है।
- गार्ड जाँच करता है: "क्या आपने इसके लिए पूछा था? क्या प्राप्तकर्ता सही है? क्या राशि सही है?"
- महत्वपूर्ण बात यह है कि गार्ड सटीक विवरणों की जाँच उस सीलबंद, अपरिवर्तनीय रसीद से करता है जो मूल रूप से स्वीकृत किया गया था।
- यदि सहायक ने मूल स्वीकृति के बाद स्कैमर को भेजने के लिए ईमेल पता बदलने की कोशिश की है, तो गार्ड विसंगति देख लेगा और ईमेल को ब्लॉक कर देगा। वास्तव में "Send" बटन दबाने की शक्ति केवल गार्ड के पास है।
यह एक बड़ी बात क्यों है
पेपर ने इस सिस्टम का परीक्षण तीन अलग-अलग "हैकिंग प्लेग्राउंड्स" (AgentDojo, AgentLeak, और ASB) में किया जहाँ हमलावरों ने एजेंटों को डेटा चुराने या गलत व्यक्ति को पैसा भेजने के लिए बहकाने की कोशिश की।
- परिणाम: SecureClaw एकमात्र ऐसा सिस्टम था जिसने सफलतापूर्वक 100% अनधिकृत धन हस्तांतरण को रोका (0% अटैक सफलता) और गुप्त डेटा लीक को लगभग शून्य तक कम कर दिया।
- इसका असली मंत्र: पेपर यह साबित करता है कि आप केवल एक लॉक का उपयोग नहीं कर सकते।
- यदि आपके पास केवल "दोहरा चेक" (भेजने को रोकना) है, तो सहायक अभी भी रहस्य पढ़ सकता है और उसे अपने आंतरिक नोट्स के माध्यम से लीक कर सकता है।
- यदि आपके पास केवल "आंखों पर पट्टी" (रहस्य छिपाना) है, तो सहायक को बिना रहस्य जाने भी गलत व्यक्ति को संदेश भेजने के लिए बहकाया जा सकता है।
- SecureClaw दोनों का उपयोग करता है। यह रहस्यों को सहायक से छिपाकर रखता है और यह भी सुनिश्चित करता है कि सहायक बिना अंतिम, विश्वसनीय जाँच के कोई कार्रवाई न कर सके।
जब यह "ना" कहता है तो क्या होता है?
कभी-कभी, सिस्टम किसी अनुरोध को ब्लॉक करता है क्योंकि वह संदिग्ध दिखता है। अतीत में, इससे पूरे वर्कफ़्लो में बाधा आ सकती थी, जिससे उपयोगकर्ता निराश हो जाता था। SecureClaw में एक "सेफ रिकवरी" फीचर है।
यदि गार्ड किसी अनुरोध को रोकता है, तो केवल "Error" कहने के बजाय, यह सहायक को फिर से प्रयास करने के लिए एक सुरक्षित, पूर्व-अनुमोदित मार्ग देता है।
- उदाहरण: "मैं वह ईमेल उस अजनबी को नहीं भेज सकता। लेकिन मैं आपके द्वारा पहले समीक्षा किए जाने के लिए एक ड्राफ्ट तैयार कर सकता हूँ।"
- यह सुरक्षा मानकों को कम किए बिना काम को आगे बढ़ाता रहता है।
निष्कर्ष
SecureClow एक ऐसे बॉडीगार्ड को काम पर रखने जैसा है जो आपकी डायरी पढ़ते समय आंखों पर पट्टी पहनता है (ताकि वे आपके रहस्य याद न कर सकें) और जो आपकी कार की चाबियाँ भी रखता है (ताकि वे आपको बिना मैप देखे किसी खतरनाक जगह न ले जा सकें)। यह योजना बनाने की क्षमता को कार्य करने की क्षमता से अलग करता है, यह सुनिश्चित करता है कि यदि सहायक को बहकाया भी जाए, तो भी नुकसान सीमित रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।