Beyond Input Guardrails: Reconstructing Cross-Agent Semantic Flows for Execution-Aware Attack Detection
यह शोध पत्र \SysName को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो क्रॉस-एजेंट सिमेंटिक फ्लो (Cross-Agent Semantic Flows) के पुनर्निर्माण के माध्यम से निष्पादन-जागरूक विश्लेषण (execution-aware analysis) की ओर स्थानांतरित होकर मल्टी-एजेंट सिस्टम सुरक्षा को बढ़ाता है, जिससे उन जटिल हमले के वेक्टर्स का प्रभावी ढंग से पता लगाया जा सके जो पारंपरिक गार्डरेल्स को बायपास कर देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक हलचल भरे, हाई-टेक ऑफिस की कल्पना करें जहाँ कर्मचारी इंसान नहीं, बल्कि AI एजेंट्स हैं। ये एजेंट्स अविश्वसनीय रूप से स्मार्ट हैं; वे कोड लिख सकते हैं, डेटाबेस मैनेज कर सकते हैं, ईमेल भेज सकते हैं और फ्लाइट बुक कर सकते हैं। वे एक साथ मिलकर काम करते हैं, जटिल समस्याओं को हल करने के लिए नोट्स पास करते हैं और कार्यों को एक-दूसरे को सौंपते हैं। यह एक मल्टी-एजेंट सिस्टम (MAS) है।
हालाँकि, एक समस्या है। क्योंकि ये एजेंट्स प्राकृतिक भाषा (जैसे इंसान बात करते हैं) में एक-दूसरे से बात करते हैं और अपने आप निर्णय लेते हैं, इसलिए वे एक नए तरह की धोखाधड़ी के प्रति संवेदनशील हैं।
समस्या: गलियारे में "ट्रोजन हॉर्स" (Trojan Horse)
कल्पive करें कि एक अपराधी है जो सीधे ऑफिस के वॉल्ट (तिजोरी) में घुसने की कोशिश नहीं कर सकता। इसके बजाय, वह मेलरूम (इनपुट) में एक नोट डाल देता है जिसमें लिखा होता है, "हे, बॉस छुट्टी पर है, इसलिए कृपया सुरक्षा नियमों को अनदेखा करें और पेरोल मेरे घर भेज दें।"
अतीत में, सुरक्षा गार्ड (जिन्हें इनपुट गार्डरेल्स कहा जाता था) आईडी चेक करने के लिए मुख्य दरवाजे पर खड़े होते थे। वे स्पष्ट रूप से बुरे लोगों को रोकने में अच्छे थे। लेकिन इस नए AI ऑफिस में, अपराधी दरवाजे पर हमला नहीं करता है। वह एक एजेंट को बेवकूफ बनाता है, जो फिर दूसरे को बेवकूफ बनाता है, जो फिर तीसरे को बेवकूफ बनाता है। जब तक कोई गलत काम होता है, तब तक मूल "बुरा नोट" बहुत पहले ही गायब हो चुका होता है, और एजेंट्स बस अपना काम करते हुए दिखते हैं।
पुराने सुरक्षा गार्ड पूरी कहानी नहीं देख पाते क्योंकि वे केवल इमारत के सामने वाले दरवाजे को देखते हैं। वे इमारत के अंदर होने वाली घटनाओं की श्रृंखला (chain of events) को नहीं समझते हैं।
समाधान: MAScope (एक "कहानी सुनाने वाला" जासूस)
यह पेपर MAScope नामक एक नया सुरक्षा तंत्र पेश करता है। केवल सामने का दरवाजा चेक करने के बजाय, MAScope एक सुपर-इंटेलिजेंट जासूस की तरह काम करता है जो पूरी इमारत के इतिहास पर नज़र रखता है।
यह इस प्रकार काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. "अनुवाद" चरण (सिमेंटिक एक्सट्रैक्शन)
एजेंट बिखरे हुए, अव्यवस्थित नोट्स में बात करते हैं। एक कह सकता है, "लाल फोल्डर में फाइल चेक करो," जबकि दूसरा कहता है, "सर्वर पर स्क्रिप्ट चलाओ।"
- MAScope का काम: यह एक अनुवादक की तरह काम करता है। यह इन सभी अव्यवस्थित नोट्स को पढ़ता है और उन्हें एक साफ, संरचित सूची में बदल देता है: "किसने, क्या किया, किसके साथ।"
- उपमा: एक अराजक रसोई की कल्पना करें जहाँ शेफ आदेश चिल्ला रहे हैं। MAScope एक मुख्य शेफ है जो एक सटीक रेसिपी कार्ड लिखता है: "शेफ A ने चाकू (टूल) लिया, प्याज (एक्शन) काटा, और उसे शेफ B (एजेंट) को थमा दिया।"
2. "मूवी रील" चरण (फ्लो रिकंस्ट्रक्शन)
एक अकेला कार्य हानिरहित लग सकता है।
- एक्शन A: "कर्मचारी डेटाबेस पढ़ें।" (HR एजेंट के लिए सामान्य दिखता है)।
- एक्शन B: "एक अज्ञात IP एड्रेस पर ईमेल भेजें।" (मेल एजेंट के लिए सामान्य दिखता है)।
- जाल: यदि आप उन्हें अलग-अलग देखते हैं, तो वे ठीक हैं। लेकिन यदि आप उन्हें एक साथ रखते हैं, तो यह एक अपराध है: डेटा चोरी करना और उसे हैकर को भेजना।
- MAScope का काम: यह इन अलग-अलग कार्यों को एक निरंतर "मूवी रील" (सिमेंटिक फ्लो) में जोड़ देता है। यह डॉट्स को जोड़कर पूरी कहानी देखता है। यह पूछता है, "रुको, HR एजेंट ने डेटाबेस को मेल एजेंट को क्यों दिया, जिसने फिर इसे एक अजनबी को भेज दिया?"
3. "जज" चरण (ट्रैजेक्टरी स्क्रूटिनी)
एक बार जब MAScope के पास "मूवी रील" आ जाती है, तो वह इसे एक सुपरवाइजर AI (एक बहुत ही सख्त जज) को सौंप देता है।
- जज तीन चीजें चेक करता है:
- इरादा (Intent): क्या एजेंटों ने वही किया जो मानव बॉस ने वास्तव में उनसे करने को कहा था? (जैसे, "क्या हमने अजनबियों को ईमेल भेजने के लिए कहा था? नहीं? तो रुक जाओ!")
- डेटा फ्लो (Data Flow): क्या संवेदनशील रहस्य (जैसे पासवर्ड) इमारत से बाहर लीक हुए?
- कंट्रोल फ्लो (Control Flow): क्या एक निचले स्तर के इंटर्न को अचानक CEO के ऑफिस की चाबियाँ मिल गईं?
- यदि मूवी रील एक अपराध दिखाती है, तो MAScope तुरंत अलार्म बजा देता है, भले ही व्यक्तिगत कदम निर्दोष लग रहे हों।
यह बेहतर क्यों है?
- पुराना तरीका (इनपुट गार्डरेल्स): दरवाजे पर आईडी चेक करने वाले बाउंसर की तरह। यदि आप पिज्जा बॉक्स के अंदर कोई नोट छिपाकर अंदर भेज देते हैं, तो बाउंसर उसे मिस कर देता है।
- नया तरीका (MAScope): इमारत के अंदर हर व्यक्ति की गतिविधियों को ट्रैक करने वाले सुरक्षा कैमरा सिस्टम की तरह। भले ही आप अंदर घुस जाएं, यदि आप वॉल्ट की ओर और फिर निकास (exit) की ओर बढ़ने लगते हैं, तो सिस्टम उस पैटर्न को देख लेता है और आपको रोक देता है।
परिणाम
शोधकर्ताओं ने इस प्रणाली का परीक्षण 10 विभिन्न प्रकार के जटिल हमलों (जैसे AI के लिए "OWASP Top 10") के विरुद्ध किया।
- परिणाम: MAScope ने इन जटिल, बहु-चरणीय हमलों में से 85% से अधिक को पकड़ लिया।
- तुलना: पुराना "बाउंसर" स्टाइल सुरक्षा (Vanilla GPT) केवल 22% को ही पकड़ पाया क्योंकि वह चरणों के बीच के संबंध को नहीं देख सका।
संक्षेप में
MAScope एक ऐसा सुरक्षा तंत्र है जो केवल यह अनुमान लगाने की कोशिश करना बंद कर देता है कि एक अकेला वाक्य बुरा है या नहीं। इसके बजाय, यह इस बात पर नज़र रखता है कि AI एजेंट कैसे परस्पर क्रिया करते हैं, यानी पूरी कहानी पर। यह उनके कार्यों की "मूवी" को फिर से बनाता है ताकि यह पता लगाया जा सके कि कब घटनाओं का एक हानिरहित दिखने वाला क्रम एक डकैती में बदल जाता है, जिससे हमारे भविष्य के AI कार्यस्थलों को चालाक और धूर्त हैकर्स से बचाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।