← नवीनतम पेपर
🤖 AI

Symbolic Guardrails for Domain-Specific Agents: Stronger Safety and Security Guarantees Without Sacrificing Utility

यह शोध पत्र यह प्रदर्शित करता है कि सिम्बॉलिक गार्डरेल्स (symbolic guardrails), बेंचमार्क में पाए गए 74% नीतिगत आवश्यकताओं को लागू करके, डोमेन-विशिष्ट एआई एजेंटों के लिए मजबूत सुरक्षा और सुरक्षा गारंटी प्रदान करने हेतु एक व्यावहारिक और प्रभावी दृष्टिकोण प्रदान करते हैं, जिससे एजेंट की उपयोगिता से समझौता किए बिना विश्वसनीयता में सुधार होता है।

मूल लेखक: Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: AI एजेंटों का "वाइल्ड वेस्ट" (Wild West)

कल्पना कीजिए कि आपने अपने व्यवसाय को चलाने में मदद करने के लिए एक सुपर-स्मार्ट, अविश्वसनीय रूप से तेज़ इंटर्न (AI एजेंट) को काम पर रखा है। यह इंटर्न टूल्स का उपयोग कर सकता है: वे उड़ानें बुक कर सकते हैं, बैंक खाते चेक कर सकते हैं, ईमेल भेज सकते हैं और मेडिकल रिकॉर्ड तक पहुँच सकते हैं।

समस्या क्या है? यह इंटर्न थोड़ा जल्दबाज भी है। कभी-कभी, वे भ्रमित हो जाते हैं, किसी हैकर द्वारा ठगे जाते हैं, या बस कोई मूर्खतापूर्ण गलती कर देते हैं। यदि वे गलती से आपका पूरा ईमेल सर्वर डिलीट कर देते हैं या किसी ग्राहक का क्रेडिट कार्ड नंबर लीक कर देते हैं, तो नुकसान हो चुका होता है।

वर्तमान में, कंपनियाँ इसे रोकने के लिए इंटर्न को "अच्छा" बनने के लिए प्रशिक्षित करने या पहले वाले को देखने के लिए एक दूसरे AI (न्यूरल गार्डरेल - Neural Guardrail) को नियुक्त करने की कोशिश करती हैं जो कहे, "हे, यह जोखिम भरा लग रहा है!"

पेपर की समस्या: दूसरा AI (देखने वाला) भी एक AI ही है। यह संभाव्यता (probabilistic) पर आधारित है, जिसका अर्थ है कि यह आमतौर पर सही होता है, लेकिन यह अभी भी गलतियाँ कर सकता है। यह एक ऐसे सुरक्षा गार्ड को नियुक्त करने जैसा है जो 99% समय जाग रहा है लेकिन कभी-कभी किसी चोर को मिस कर सकता है। उच्च-जोखिम वाले व्यवसायों (जैसे बैंकों या अस्पतालों) में, विफलता की 1% संभावना भी बहुत अधिक है।

समाधान: "सिंबोलिक गार्डरेल" (Symbolic Guardrail)

लेखक एक अलग दृष्टिकोण प्रस्तावित करते हैं: सिंबोलिक गार्डरेल्स

एक इंसान जैसे देखने वाले को नियुक्त करने के बजाय, कल्पना कीजिए कि उन टूल्स पर स्वचालित, अटूट भौतिक गेट और नियम लगा दिए गए हैं जिनका इंटर्न उपयोग करता है।

  • न्यूरल गार्डरेल (देखने वाला): "मुझे लगता है कि आपको वह ईमेल डिलीट नहीं करना चाहिए। क्या आप सुनिश्चित हैं?" (इंटर्न कह सकता है "हाँ, मैं सुनिश्चित हूँ," और देखने वाला भी गलती से सहमत हो सकता है)।
  • सिंबोलिक गार्डरेल (गेट): एक धातु की छड़ जो "डिलीट" बटन को तब तक दबाने से भौतिक रूप से रोकती है जब तक कि एक विशिष्ट कुंजी (जैसे मैनेजर की आईडी) न डाली जाए। यह "सोचता" नहीं है; यह बस जाँच करता है। यदि नियम कहता है "नहीं," तो कार्रवाई तुरंत और 100% समय ब्लॉक कर दी जाती है।

तीन-भाग वाला अध्ययन

शोधकर्ताओं ने यह देखने के लिए तीन चीजें कीं कि क्या यह "गेट" वाला विचार काम करता है।

1. जासूसी कार्य (बेंचमार्क की समीक्षा)

उन्होंने AI एजेंटों की सुरक्षा की जाँच करने के लिए उपयोग किए जाने वाले 80 विभिन्न परीक्षणों को देखा।

  • निष्कर्ष: इनमें से 85% परीक्षण अस्पष्ट थे। वे कहते थे जैसे, "सावधान रहें" या "बुरे न बनें।" ये एक बच्चे को "अच्छे बनो" कहने जैसा है। "अच्छा होने" के लिए गेट बनाना कठिन है क्योंकि "अच्छा" व्यक्तिपरक (subjective) है।
  • अच्छी खबर: डोमेन-विशिष्ट एजेंटों (एजेंट जो एक विशिष्ट काम के लिए डिज़ाइन किए गए हैं, जैसे एयरलाइन टिकट बॉट) के लिए, नियम बहुत स्पष्ट हो सकते हैं। उदाहरण के लिए: "आप ऐसी उड़ान रद्द नहीं कर सकते जो पहले ही उड़ान भर चुकी है।" यह एक ठोस नियम है जिसके लिए आप गेट बना सकते हैं।

2. ब्लूप्रिंट (क्या हम गेट बना सकते हैं?)

उन्होंने पूछा: "क्या हम इन स्पष्ट नियमों को अटूट गेटों में बदल सकते हैं?"

  • निष्कर्ष: हाँ! विशिष्ट नौकरियों के लिए 74% सुरक्षा नियमों को सरल, कम लागत वाले सिंबोलिक गेट्स द्वारा लागू किया जा सकता है।
  • उपमा (Analogy): आपको उड़ान रद्दीकरण को रोकने के लिए किसी हाई-टेक AI दिमाग की आवश्यकता नहीं है। आपको बस एक सरल जाँच की आवश्यकता है: IF flight_date < today THEN BLOCK
  • आश्चर्य: इनमें से अधिकांश "गेट" बहुत सरल हैं (जैसे पासवर्ड या तारीख की जाँच करना)। हमें यह करने के लिए जटिल, महंगे AI सिस्टम की आवश्यकता नहीं है।

3. स्ट्रेस टेस्ट (क्या गेट एजेंट को तोड़ देते हैं?)

एक सामान्य डर यह है: "यदि हम इंटर्न पर बहुत सारे गेट लगा देंगे, तो क्या वे इतने निराश हो जाएंगे कि अपना काम न कर पाएं?"

  • प्रयोग: शोधकर्ताओं ने तीन कार्यों पर AI एजेंटों का परीक्षण किया: उड़ान बुक करना, कार चलाना (वॉयस असिस्टेंट), और मेडिकल रिकॉर्ड प्रबंधित करना। उन्होंने गेट के बिना और गेट के साथ परीक्षण किए।
  • परिणाम:
    • सुरक्षा: गेट के बिना, एजेंट 20% से 78% बार गलतियाँ करते थे। गेट के साथ, गलती की दर 0% हो गई। गेट पूरी तरह से काम कर रहे थे।
    • उपयोगिता (Utility): क्या एजेंट अपने काम में धीमे या खराब हो गए? नहीं। वास्तव में, वे अक्सर बेहतर होते गए।
    • क्यों? जब एक गेट किसी बुरे कार्य को रोकता है, तो वह एजेंट को एक स्पष्ट त्रुटि संदेश देता है: "आप यह नहीं कर सकते क्योंकि X।" इसके बाद एजेंट एक अलग, सही रास्ते पर चलने की कोशिश करता है। यह एक GPS की तरह है जो कहता है "रास्ता बंद है, अगला मोड़ लें" बजाय इसके कि आपको दीवार से टकराने दे।

मुख्य निष्कर्ष (सरल भाषा में)

  1. अनुमान लगाना बंद करें, जाँच करना शुरू करें: AI के "अनुमान" लगाने पर निर्भर रहना कि क्या सुरक्षित है, जोखिम भरा है। हमें उन चीजों के लिए सख्त, तार्किक नियमों (गेट्स) का उपयोग करना चाहिए जिनके स्पष्ट उत्तर होते हैं।
  2. विशेषज्ञता ही सुरक्षा है: सामान्य AI सहायक (जैसे एक चैटबॉट जो सब कुछ करता है) को सुरक्षित करना कठिन है क्योंकि नियम बहुत अस्पष्ट होते हैं। लेकिन यदि आप एक विशेष काम के लिए (जैसे मेडिकल रिकॉर्ड बॉट) एक AI बनाते हैं, तो आप बहुत विशिष्ट नियम लिख सकते हैं और टूल्स को प्रभावी ढंग से लॉक कर सकते हैं।
  3. सुरक्षा का मतलब धीमा होना नहीं है: इन "गेट्स" को लगाने से AI का काम नहीं रुकता; वास्तव में यह उसे गलत रास्तों से बचने और कार्यों को सही ढंग से पूरा करने में मदद करता है।
  4. हाइब्रिड दृष्टिकोण: हम हर चीज़ के लिए गेट का उपयोग नहीं कर सकते (जैसे "विनम्र होना" या "भ्रमित/हैलुसिनेट न होना")। उनके लिए, हमें अभी भी AI वॉचर की आवश्यकता है। लेकिन खतरनाक चीजों के लिए (पैसा, डेटा, शारीरिक सुरक्षा), हमें अटूट गेट्स का उपयोग करना चाहिए।

निचोड़ (Bottom Line)

पेपर का तर्क है कि उन व्यवसायों के लिए जो गलतियों को बर्दाश्त नहीं कर सकते, हमें केवल इस उम्मीद पर नहीं रहना चाहिए कि AI सुरक्षित रहने के लिए पर्याप्त स्मार्ट होगा। हमें डिजिटल सीटबेल्ट और एयरबैग (सिंबोलिक गार्डरेल) बनाने चाहिए जो AI को खतरनाक चीजें करने से भौतिक रूप से रोकते हैं, जिससे AI की क्षमता से समझौता किए बिना सुरक्षा सुनिश्चित होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →