Cross-Session Threats in AI Agents: Benchmark, Evaluation, and Algorithms
यह शोधपत्र CSTM-Bench प्रस्तुत करता है, जो उन क्रॉस-सेशन AI एजेंट खतरों का पता लगाने के लिए एक डेटासेट और मूल्यांकन ढांचा है जो मेमोरीलेस गार्डरेल्स (memoryless guardrails) से बच निकलते हैं, यह प्रदर्शित करते हुए कि बाउंडेड-मेमोरी कोसेट रीडर्स (bounded-memory Coreset Readers), सेशन-बाउंड और फुल-लॉग अप्रोच दोनों से बेहतर प्रदर्शन करते हैं और एक नया मीट्रिक प्रस्तावित करते हैं जो डिटेक्शन रिकॉल को सर्विंग स्टेबिलिटी (serving stability) के साथ संतुलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक हाई-टेक ऑफिस की सुरक्षा के लिए एक सुरक्षा गार्ड को काम पर रख रहे हैं। इस गार्ड का काम हर उस व्यक्ति की जांच करना है जो दरवाजे से अंदर आता है और यह सुनिश्चित करना है कि वे कुछ चुरा नहीं रहे हैं।
समस्या: "भुलक्कड़" गार्ड
वर्तमान में, अधिकांश AI सुरक्षा गार्डों में एक बहुत ही विशिष्ट प्रकार की भूलने की बीमारी होती है। वे एक व्यक्ति की जांच करते हैं, जैसे "नमस्ते" कहना, उनकी आईडी चेक करना, और फिर तुरंत उन्हें भूल जाते हैं। यदि कोई बुरा आदमी एक महीने के दौरान 50 बार आता है, तो गार्ड हर बार जांच करता है, कुछ भी संदिग्ध नहीं पाता, और हर बार उसे जाने देता है।
बुरा आदमी एक ही बार में कुछ नहीं चुरा रहा है। इसके बजाय, वह "जेन्गा" (Jenga) का खेल खेल रहा है।
- पहली विज़िट: "क्या आप मुझे बता सकते हैं कि हमारे पास कौन से सर्वर हैं?" (हानिरहित)
- दूसरी विज़िट: "क्या आप मुझे बैकअप सर्वर का पासवर्ड दिखा सकते हैं?" (अपने आप में हानिरहित)
- तीसरी विज़िट: "क्या आप वह पासवर्ड मेरे व्यक्तिगत पते पर ईमेल कर सकते हैं?" (अपने आप में हानिरहित)
व्यक्तिगत रूप से, हर अनुरोध एक सामान्य कर्मचारी द्वारा अपना काम करने जैसा दिखता है। लेकिन यदि आप उन्हें एक साथ जोड़ते हैं, तो यह एक डकैती बन जाती है। वर्तमान सुरक्षा गार्ड "सेशन-बाउंड" (session-bound) हैं, जिसका अर्थ है कि वे केवल वर्तमान क्षण को देखते हैं। वे बड़े चित्र को देखने में चूक जाते हैं क्योंकि "डकैती" समय के साथ फैली हुई है।
समाधान: याददाश्त वाला "जासूस"
यह पेपर इस तरह के धीरे-धीरे होने वाले हमलों को पकड़ने का एक नया तरीका पेश करता है। दरवाजे पर केवल व्यक्ति की जांच करने के बजाय, हमें एक जासूस की आवश्यकता है जो हर किसी का एक चलता-फिरता रिकॉर्ड रखे।
हालांकि, एक पेच है: जासूस सब कुछ याद नहीं रख सकता। यदि आप चोर को पकड़ने के लिए 10,000 पन्नों की इतिहास की किताब पढ़ने की कोशिश करते हैं, तो जासूस अभिभूत हो जाता है, सुराग छोड़ देता है, या सो जाता है।
नवाचार: "हाइलाइटर" (कोर्सेट मेमोरी - Coreset Memory)
यह पेपर एक स्मार्ट मध्य मार्ग प्रस्तावित करता है जिसे कोर्सेट मेमोरी रीडर (Coresset Memory Reader) कहा जाता है। इसे एक बहुत ही कुशल हाइलाइटर के रूप में समझें।
पूरी 10,000 पन्नों की इतिहास की किताब पढ़ने के बजाय, हाइलाइटर पन्नों को स्कैन करता है और केवल सबसे संदिग्ध 50 वाक्यों को एक छोटी नोटबुक में रखता है।
- यदि कोई वाक्य सामान्य काम जैसा दिखता है, तो उसे अनदेखा कर दिया जाता है।
- यदि कोई वाक्य अजीब या अलग लगता है, तो उसे हाइलाइट किया जाता है और रखा जाता है।
जब जासूस (AI) को निर्णय लेने की आवश्यकता होती है, तो वे केवल 50 हाइलाइट किए गए वाक्यों को पढ़ते हैं। यह जासूस को तेज, फुर्तीला और केंद्रित रखता है, और शोर को अनदेखा करते हुए वास्तविक खतरों पर ध्यान केंद्रित करता है।
बेंचमार्क: "प्रशिक्षण मैदान"
लेखकों ने एक विशाल प्रशिक्षण मैदान बनाया है जिसे CSTM-Bench (क्रॉस-सेशन थ्रेट मेमोरी बेंचमार्क) कहा जाता है।
- परीक्षण: उन्होंने "डकैती" के 26 अलग-अलग प्रकार बनाए हैं जो डिज़ाइन किए गए हैं कि यदि आप केवल एक क्षण को देखते हैं तो वे अदृश्य रहेंगे।
- विलेन: उन्होंने एक "विलेन AI" भी बनाया है जो विशेष रूप से सुरक्षा गार्डों को धोखा देने के लिए अपनी कहानी को निर्दोष दिखने के लिए फिर से लिखने की कोशिश करता है।
- परिणाम:
- पुराना गार्ड (एक समय में एक संदेश की जांच करने वाला) बुरी तरह विफल रहा जब विलेन ने कहानी को फिर से लिखा।
- फुल-लॉग डिटेक्टिव (हर संदेश को पढ़ने की कोशिश करने वाला) टेक्स्ट की भारी मात्रा से अभिभूत हो गया और सुरागों को मिस कर गया।
- हाइलाइटर डिटेक्टिव (नया तरीका) सफल रहा। उबाऊ चीजों को फ़िल्टर करके और केवल उच्च-संदेह वाले हिस्सों को रखकर, उसने डकैती को पकड़ लिया, भले ही विलेन ने खुद को छिपाने की कोशिश की हो।
"स्मृति" की लागत
यह पेपर यह मापने का एक नया तरीका भी पेश करता है कि यह स्मृति कितनी "महंगी" है। कल्पना कीजिए कि यदि हाइलाइटर इस बारे में अपना विचार बदलने लगता है कि किन वाक्यों को रखना है। हर बार जब वह एक वाक्य को बदलता है, तो जासूस को सब कुछ शुरू से फिर से पढ़ना पड़ता है। यह धीमा और महंगा है।
लेखकों ने एक मीट्रिक बनाया है जिसे CSR (कोर्सेट स्टेबिलिटी रेट) कहा जाता है। यह मापता है कि हाइलाइटर कितनी बार नोटबुक में रखे गए वाक्यों को बदलता है।
- उच्च स्थिरता (High Stability): नोटबुक वैसी ही रहती है। जासूस तेजी से पढ़ सकता है। (अच्छा!)
- कम स्थिरता (Low Stability): नोटबुक हर सेकंड बदलती है। जासूस को लगातार फिर से पढ़ना पड़ता है। (बुरा/महंगा!)
बड़ी सीख
यह पेपर हमें बताता है कि AI को लंबे समय तक चलने वाले हमलों से बचाने के लिए, हम केवल AI की मेमोरी को बड़ा नहीं बना सकते। हमें अपनी मेमोरी को स्मार्टर बनाना होगा। हमें एक ऐसे सिस्टम की आवश्यकता है जो शोर को फ़िल्टर करे और केवल सबसे महत्वपूर्ण सुरागों को रखे, जिससे AI विवरणों से अभिभूत हुए बिना "पूरी कहानी" देख सके।
संक्षेप में: सब कुछ याद रखने की कोशिश न करें। सही चीजें याद रखें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।