← नवीनतम पेपर
💻 computer science

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

स्लॉगगार्ड-एनएसएफए (SlogGuard-NSFA) एक विस्तार योग्य गार्डरेल फ्रेमवर्क है जो एक व्यापक जोखिम वर्गीकरण, एक बड़े पैमाने के बहुभाषी बेंचमार्क और जनरेटिव रीजनिंग के साथ रीयल-टाइम क्लासिफिकेशन को संयोजित करने वाले दोहरे मोड डिटेक्शन दृष्टिकोण को पेश करके एजेंटिक एआई सिस्टम को परिचालन संबंधी खतरों से सुरक्षित करता है, जिससे कई मॉडल आकारों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: SingGuard Team

प्रकाशित 2026-07-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: SingGuard Team

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपका पसंदीदा AI केवल एक चैटबॉट नहीं है जो कविताएँ लिखता है या सामान्य ज्ञान के उत्तर देता है, बल्कि एक डिजिटल बटलर (बड़ा नौकर) है जो वास्तव में काम कर सकता है। यह वेब ब्राउज़ कर सकता है, आपके कंप्यूटर पर फाइलें खोल सकता है, ईमेल भेज सकता है, और यहाँ तक कि बग्स को ठीक करने के लिए कोड भी लिख सकता है। यह "एजेंटिक AI" (Agentic AI) का रोमांचक नया युग है। लेकिन बड़ी शक्ति के साथ बड़ी संवेदनशीलता भी आती है। यदि कोई चतुर हैकर एक साधारण चैटबॉट को धोखा देता है, तो सबसे बुरा परिणाम एक अभद्र टिप्पणी होता है। यदि वे एक AI एजेंट को धोखा देते हैं, तो बॉट गलती से आपकी पूरी हार्ड ड्राइव डिलीट कर सकता है, आपके बैंक पासवर्ड चुरा सकता है, या आपकी निजी तस्वीरें किसी अजनबी को भेज सकता है। पुराने सुरक्षा जाल, जिन्हें बुरे शब्दों को रोकने के लिए बनाया गया था, इन खतरनाक कार्यों को रोकने के लिए नहीं बने हैं। हमें एक नए प्रकार के सुरक्षा गार्ड की आवश्यकता है जो न केवल यह समझे कि एक AI क्या कहता है, बल्कि यह भी समझे कि वह क्या करता है।

पेश है SingGuard-NSFA, एंटी ग्रुप (Ant Group) के AI सुरक्षा लैब से एक नया सुरक्षा ढांचा, जिसे इन सुपर-पावर्ड AI एजेंटों के लिए अंतिम बाउंसर बनने के लिए डिज़ाइन किया गया है। शोधकर्ताओं को एक विशाल, हाई-टेक किले के वास्तुकारों के रूप में सोचें। सबसे पहले, उन्होंने हर उस संभावित तरीके का एक विस्तृत मानचित्र तैयार किया जिससे एक एजेंट को छल या दुरुपयोग का शिकार बनाया जा सकता है, जिसमें 185 से अधिक विभिन्न प्रकार के खतरों को गोपनीयता (Confidentiality), अखंडता (Integrity), और उपलब्धता (Availability) के क्लासिक सुरक्षा लक्ष्यों के आधार पर एक स्पष्ट पदानुक्रम में व्यवस्थित किया गया। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने अपने मानचित्र को तीन प्रमुख उद्योग सुरक्षा दिशानिर्देशों के साथ क्रॉस-चेक किया ताकि यह सुनिश्चित हो सके कि दीवार में एक भी छेद न रह जाए।

अपने किले का परीक्षण करने के लिए, उन्होंने 133 अलग-अलग भाषाओं में 93,000 से अधिक अभ्यास परिदृश्यों के साथ एक विशाल प्रशिक्षण मैदान बनाया, जिसमें चालाकी भरे "जेलब्रेक" प्रयासों से लेकर खतरनाक कोड के अनुरोधों तक सब कुछ शामिल था। उन्होंने अपने गार्ड, SingGuard को एक चतुर दो-मोड रणनीति का उपयोग करके प्रशिक्षित किया। पहला मोड एक सुपर-स्मार्ट जासूस की तरह है जो एक संदिग्ध संदेश को पढ़ता है, यह बताते हुए एक विस्तृत रिपोर्ट लिखता है कि वह क्यों खतरनाक है (जो मानव ऑडिटरों के लिए बहुत अच्छा है), और फिर उसे फ्लैग करता है। दूसरा मोड एक बिजली जैसी तेज़ रिफ्लेक्स प्रणाली है जो लगभग 50 मिलीसेकंड में उसी संदेश को स्कैन करती है—इससे भी तेज़ कि आप पलक झपका सकें—सिर्फ इसलिए कि अगर कोई समस्या दिखे तो "रुक जाओ!" चिल्ला सके।

परिणाम प्रभावशाली हैं। मौजूदा सुरक्षा गार्डों के विरुद्ध परीक्षण किए जाने पर, SingGuard-NSFA ने न केवल जीत हासिल की; बल्कि इसने दबदबा बनाया। उनके कस्टम परीक्षणों पर, उनके मॉडल (0.8 बिलियन पैरामीटर्स से लेकर एक मजबूत 9 बिलियन तक) ने 94% से 97% की सटीकता स्कोर प्राप्त किया, जो अगले सबसे अच्छे प्रतियोगी को 6 से 12 अंकों के महत्वपूर्ण अंतर से पीछे छोड़ गया। अन्य स्रोतों से डेटा का उपयोग करने वाले परीक्षणों पर भी (जो कि एक ऐसे दरवाजे के लॉक का परीक्षण करने जैसा है जिसे आपने नहीं बनाया है), 9-बिलियन-पैरामीटर वाले मॉडल ने 91% की मजबूत सटीकता बनाए रखी। शायद सबसे रोमांचक बात यह है कि यह सुरक्षा प्रणाली मॉड्यूलर है। यदि भविष्य में किसी नए प्रकार का खतरा सामने आता है, तो डेवलपर्स को पूरा किला फिर से बनाने की आवश्यकता नहीं है; वे सिस्टम को धीमा किए बिना उसे पहचानने के लिए बस एक नया "क्लासिफिकेशन हेड" (एक छोटा सा एड-ऑन) जोड़ सकते हैं। पेपर सुझाव देता है कि यह दृष्टिकोण एक शक्तिशाली, लचीला और तेज़ तरीका प्रदान करता है जिससे हमारे AI एजेंट सुरक्षित रह सकें क्योंकि वे वास्तविक दुनिया के अधिक कार्य करना शुरू कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →