← नवीनतम पेपर
💻 computer science

AgentPort-Bench: A Controlled Seven-Framework Evaluation of Agentic AI Security Portability

यह शोध पत्र एक नियंत्रित, सात-ढांचा (सेवन-फ्रेमवर्क) मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि हमले का प्रकार और मॉडल का चयन टूल-उपयोग करने वाले एलएलएम (LLM) एजेंटों की सुरक्षा को महत्वपूर्ण रूप से प्रभावित करते हैं, ऑर्केस्ट्रेशन फ्रेमवर्क का चुनाव सामान्यतः सुरक्षा स्थिति पर कोई सार्थक प्रभाव नहीं डालता है, जिसमें क्रू-एआई (CrewAI) का अपवाद उल्लेखनीय है, जो एक विशिष्ट एडेप्टर दोष को सुधारने के बाद भी विफलता दरों में एक छोटे लेकिन सांख्यिकीय रूप से महत्वपूर्ण अवशेष उत्थान (रेसिड्यूअल एलीवेशन) प्रदर्शित करता है।

मूल लेखक: Waqar Javed

प्रकाशित 2026-09-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Waqar Javed

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आर्टिफिशियल इंटेलिजेंस केवल सवालों के जवाब ही नहीं देता, बल्कि हमारी ओर से डिजिटल टूल्स का उपयोग करके उड़ानें बुक करना, बैंक खाते प्रबंधित करना या जटिल शेड्यूल व्यवस्थित करने जैसे कार्य भी करता है। ये "एजेंटिक" (agentic) सिस्टम हैं, और ये तेजी से आम होते जा रहे हैं। इन्हें बनाने के लिए, इंजीनियर सॉफ्टवेयर फ्रेमवर्क्स पर भरोसा करते हैं—जो अनिवार्य रूप से किट (toolkits) की तरह हैं जो AI के मस्तिष्क और बाहरी दुनिया के बीच मध्यस्थ के रूप में कार्य करते हैं। इन सिस्टमों को बनाने या ऑडिट करने वाले किसी भी व्यक्ति के लिए एक महत्वपूर्ण प्रश्न यह है कि क्या इस मध्यस्थ का चुनाव सुरक्षा के लिए मायने रखता है। यदि कोई हैकर AI को दुर्भावनापूर्ण कमांड के साथ धोखा देने की कोशिश करता है, तो क्या उस कमांड को पहुँचाने के लिए उपयोग किया गया विशिष्ट टूलकिट यह बदल देता है कि AI कैसे प्रतिक्रिया देता है? या क्या AI की सुरक्षा लगभग पूरी तरह से स्वयं मॉडल और हमले की प्रकृति पर निर्भर करती है, चाहे उसके चारों ओर कोई भी सॉफ्टवेयर रैपर हो? यह प्रश्न एक नए, बड़े पैमाने के शोध के केंद्र में है जिसने सिद्धांत के बजाय ठोस डेटा के साथ इस बहस को सुलझाने का प्रयास किया।

शोधकर्ताओं ने नौ हजार तीन सौ साठ अलग-अलग परीक्षणों वाले एक विशाल, नियंत्रित प्रयोग को चलाकर इसका परीक्षण करने का निर्णय लिया। उन्होंने सात लोकप्रिय AI फ्रेमवर्क्स को AI के साथ एक सीधे कनेक्शन के विरुद्ध खड़ा किया, जिससे आठ अलग-अलग स्थितियाँ बनीं ताकि यह देखा जा सके कि क्या फ्रेमवर्क कोई अंतर पैदा करता है। एक निष्पक्ष परीक्षण सुनिश्चित करने के लिए, उन्होंने तीन प्रमुख प्रदाताओं के छह अलग-अलग AI मॉडल का उपयोग किया और उन्हें पांच अलग-अलग प्रकार के हमलों के अधीन किया, जिनमें साधारण चालाकी से लेकर सिस्टम के लक्ष्यों को हाईजैक करने के जटिल प्रयासों तक शामिल थे। महत्वपूर्ण रूप से, टीम ने केवल यह मान नहीं लिया कि हमलों को एक ही तरह से वितरित किया गया था; उन्होंने यह पुष्टि करने के लिए प्रत्येक संदेश को बाइट-दर-बाइट सत्यापित किया कि AI के मस्तिष्क तक पहुँचने वाली दुर्भावनापूर्ण सामग्री हर परिदृश्य में समान थी। सटीकता के इस स्तर ने उन्हें फ्रेमवर्क को एकमात्र बदलते चर (variable) के रूप में अलग करने की अनुमति दी, जिससे किसी भी भ्रम को दूर किया जा सका जो इस बात से उत्पन्न हो सकता था कि सॉफ्टवेयर ने हमले को अनजाने में कैसे फिर से लिख दिया होगा।

परिणाम आश्चर्यजनक रूप से स्पष्ट थे: फ्रेमवर्क के चुनाव का इस बात पर लगभग कोई प्रभाव नहीं पड़ा कि AI हमले का शिकार हुआ या नहीं। शोधकर्ताओं ने पाया कि हमले का प्रकार और उपयोग किया गया विशिष्ट AI मॉडल ही प्रमुख कारक थे, जो परिणामों के अधिकांश अंतर की व्याख्या करते हैं। इसके विपरीत, फ्रेमवर्क के चुनाव ने परिणामों का ऐसा हिस्सा समझाया जो सांख्यिकीय रूप से शून्य से अलग पहचानना असंभव था। इसकी निश्चितता के लिए, टीम ने कठोर सांख्यिकीय परीक्षण लागू किए जो यह सिद्ध करने के लिए डिज़ाइन किए गए थे कि कोई भी अंतर केवल अदृश्य नहीं था, बल्कि व्यावहारिक रूप से अस्तित्वहीन था। उन्होंने पुष्टि की कि अधिकांश मामलों के लिए, एक फ्रेमवर्क को दूसरे से बदलने से सिस्टम की सुरक्षा स्थिति में कोई सार्थक बदलाव नहीं आएगा। यह सुझाव देता है कि सुरक्षा टीमों को मॉडल और उनके सामने आने वाले विशिष्ट खतरों को समझने पर अपनी ऊर्जा केंद्रित करनी चाहिए, बजाय इसके कि वे इस बात की चिंता करें कि वे किस सॉफ्टवेयर टूलकिट का उपयोग कर रहे हैं।

हालाँकि, इस अध्ययन ने एक विशिष्ट अपवाद को उजागर किया जिस पर सावधानीपूर्वक ध्यान देने की आवश्यकता थी। एक फ्रेमवर्क, CrewAI, ने अन्य की तुलना में थोड़ा कम सुरक्षित होने की एक छोटी लेकिन सांख्यिकीय रूप से वास्तविक प्रवृत्ति दिखाई, भले ही शोधकर्ताओं ने एक ज्ञात बग को ठीक कर दिया था जहाँ इसके आंतरिक निर्देश अनजाने में बाकी हिस्सों से भिन्न थे। यह अवशिष्ट अंतर पूर्ण रूप में बहुत छोटा था और अभी भी उस सीमा के भीतर था जिसे व्यावहारिक रूप से नगण्य माना जाता है, लेकिन यह एकमात्र फ्रेमवर्क था जो भीड़ से अलग दिखा। शोधकर्ताओं ने एक अलग, दिलचस्प विफलता मोड (failure mode) भी खोजा जहाँ एक विशिष्ट AI मॉडल, एक विशेष ट्रिकी प्रॉम्प्ट का सामना करने पर, अपनी उपलब्ध कंप्यूटिंग संसाधनों को आंतरिक सोच पर चुपचाप खर्च कर देता था और कोई आउटपुट नहीं देता था। यह विभिन्न फ्रेमवर्क्स में लगातार हुआ, जिससे यह सिद्ध हुआ कि यह मॉडल का अपना गुण था, न कि उसे लपेटने वाले सॉफ्टवेयर का।

अंततः, यह कार्य एक व्यावहारिक इंजीनियरिंग प्रश्न का दुर्लभ, उच्च-विश्वास वाला उत्तर प्रदान करता है। यह प्रदर्शित करता है कि परीक्षण किए गए हमलों और टूल्स के लिए, एक AI एजेंट की सुरक्षा ऑर्केस्ट्रेशन फ्रेमवर्क द्वारा सार्थक रूप से आकार नहीं लेती है। अध्ययन पुष्टि करता है कि "मध्यस्थ" सॉफ्टवेयर सुरक्षा जोखिमों के प्रति काफी हद तक पारदर्शी है, जिसमें AI का अपना व्यवहार और हमले की प्रकृति ही सुरक्षा के वास्तविक चालक हैं। जबकि एक फ्रेमवर्क ने एक छोटा, निरंतर रहने वाला विचित्र व्यवहार दिखाया, समग्र चित्र स्थिरता का है: फ्रेमवर्क का चुनाव एक प्राथमिक सुरक्षा निर्णय नहीं है। इसके बजाय, इन एजेंटों को सुरक्षित रखने का वास्तविक कार्य उन मॉडलों को समझना और उन विशिष्ट तरीकों को समझना है जिनसे उन्हें हेरफेर किया जा सकता है, जो एक निष्कर्ष है जो डेवलपर्स और ऑडिटर्स दोनों के लिए एक स्पष्ट मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →