← नवीनतम पेपर
🤖 AI

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

यह शोधपत्र "प्रूफ-ऑफ-गार्डरेल" (Proof-of-Guardrail) का प्रस्ताव करता है, जो एआई एजेंटों द्वारा विशिष्ट सुरक्षा उपायों को लागू करने के लिए क्रिप्टोग्राफिक, सत्यापन योग्य अटेस्टेशन प्रदान करने हेतु ट्रस्टेड एक्जीक्यूशन एनवायरनमेंट्स (Trusted Execution Environments) का लाभ उठाता है, जिससे सक्रिय जेलब्रेकिंग जैसे शेष जोखिमों को स्वीकार करते हुए, झूठा विज्ञापित सुरक्षा के खतरे को संबोधित किया जा सके।

मूल लेखक: Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Proof-of-Guardrail" पेपर का सरल भाषा, रोज़मर्रा के उदाहरणों और रचनात्मक रूपकों (metaphors) का उपयोग करते हुए हिंदी अनुवाद दिया गया है:

मुख्य समस्या: "मुझ पर भरोसा करो" वाला जाल

कल्पना कीजिए कि आप एक नए, रहस्यमय रेस्टोरेंट से खाना ऑर्डर कर रहे हैं जो ड्रोन के ज़रिए डिलीवरी करता है। रेस्टोरेंट दावा करता है, "चिंता न करें! हमारे पास एक सख्त हेल्थ इंस्पेक्टर (स्वास्थ्य निरीक्षक) है जो रसोई से बाहर निकलने से पहले हर एक भोजन की जाँच करता है ताकि यह सुनिश्चित हो सके कि वह सुरक्षित और ताज़ा है।"

आपके पास एक समस्या है: आप उनकी रसोई के अंदर नहीं देख सकते। आपको उनकी बात पर विश्वास करना होगा।

  • जोखिम: क्या होगा अगर रेस्टोरेंट झूठ बोल रहा है? क्या होगा अगर उन्होंने इंस्पेक्टर को छोड़ दिया, या इससे भी बुरा, क्या होगा अगर उन्होंने एक भ्रष्ट इंस्पेक्टर को काम पर रखा है जो बस ज़हरीले खाने पर "सुरक्षित" का स्टैम्प लगा देता है?
  • वर्तमान वास्तविकता: AI की दुनिया में, उपयोगकर्ता अक्सर डेवलपर्स पर आँख मूँदकर भरोसा करते हैं। डेवलपर्स कहते हैं, "हम अपनी AI को बुरी बातें कहने या गलत सलाह देने से रोकने के लिए सेफ्टी फिल्टर्स का उपयोग करते हैं।" लेकिन चूंकि AI डेवलपर के निजी सर्वर पर चलता है, इसलिए उपयोगकर्ता यह सत्यापित (verify) नहीं कर सकते कि वे फिल्टर्स वास्तव में काम कर रहे हैं या नहीं।

समाधान: "टैम्पर-प्रूफ रसीद" (Tamper-Proof Receipt)

लेखक Proof-of-Guardrail नामक एक प्रणाली का प्रस्ताव करते हैं।

इसे केवल एक वादे के रूप में नहीं, बल्कि एक क्रिप्टोग्राफिक रसीद के रूप में सोचें जो यह साबित करती है कि सुरक्षा जाँच वास्तव में हुई थी।

यह कैसे काम करता है, इसे एक बैंक वॉल्ट (तिजोरी) के उदाहरण से समझते हैं:

  1. विशेष कमरा (The TEE):
    कल्पना कीजिए कि डेवलपर को अपना AI एक विशेष, हाई-टेक बैंक वॉल्ट (जिसे Trusted Execution Environment या TEE कहा जाता है) के अंदर चलाना होगा। यह वॉल्ट अटूट स्टील से बना है और एक हार्डवेयर सुरक्षा प्रणाली द्वारा मॉनिटर किया जाता है।

    • क्यों? इस वॉल्ट के अंदर, डेवलपर अपनी गुप्त AI रेसिपी (जिसे वे साझा नहीं करना चाहते) रख सकता है, लेकिन उन्हें इसमें सार्वजनिक "सेफ्टी इंस्पेक्टर" (Guardrail) को भी रखना होगा।
  2. प्रक्रिया:
    जब कोई उपयोगकर्ता AI से कोई प्रश्न पूछता है, तो वह प्रश्न वॉल्ट के अंदर जाता है।

    • AI उत्तर के बारे में सोचता है।
    • सेफ्टी इंस्पेक्टर उत्तर की जाँच करता है।
    • यदि उत्तर सुरक्षित है, तो वॉल्ट उसे बाहर जाने देता है।
    • यदि उत्तर खतरनाक है, तो वॉल्ट उसे ब्लॉक कर देता है।
  3. जादुई रसीद (The Attestation):
    महत्वपूर्ण बात यह है कि वॉल्ट में एक इन-बिल्ट कैमरा और एक डिजिटल स्टैम्प होता है। जब भी यह कोई उत्तर बाहर भेजता है, यह एक साइन की हुई रसीद प्रिंट करता है।

    • यह रसीद कहती है: "मैं, वॉल्ट, पुष्टि करता हूँ कि सेफ्टी इंस्पेक्टर ने इस विशिष्ट उत्तर को बाहर जाने से पहले चेक किया था।"
    • यह रसीद एक अद्वितीय की (key) के साथ साइन की गई होती है जो केवल वॉल्ट हार्डवेयर के पास होती है। इसे नकली बनाना गणितीय रूप से असंभव है।
  4. उपयोगकर्ता की जाँच:
    उपयोगकर्ता को उत्तर और रसीद दोनों मिलते हैं। उन्हें डेवलपर पर भरोसा करने की आवश्यकता नहीं है। उन्हें बस रसीद को सेफ्टी इंस्पेक्टर के सार्वजनिक नियमों के विरुद्ध जाँचने की आवश्यकता है। यदि रसीद वैध है, तो वे निश्चित रूप से जानते हैं कि सुरक्षा जाँच हुई थी।

यह एक बड़ी बात क्यों है

  • प्राइवेसी बनाम प्रमाण: आमतौर पर, यह साबित करने के लिए कि आप सुरक्षित हैं, आपको अपनी पूरी रसोई (अपना कोड) जनता को दिखानी पड़ती है। यह सिस्टम आपको अपने वॉल्ट के अंदर अपनी गुप्त रेसिपी (अपनी निजी AI) छिपे रहने देते हुए भी, यह साबित करने की अनुमति देता है कि आपने सुरक्षा नियमों का पालन किया है।
  • कोई बिचौलिया नहीं: आपको रसोई का निरीक्षण करने के लिए किसी तीसरे पक्ष के ऑडिटर की आवश्यकता नहीं है। वॉल्ट स्वचालित रूप से और तुरंत ऑडिट करता है।

सावधानी: यह "सुरक्षा की गारंटी" नहीं है

पेपर एक बहुत ही महत्वपूर्ण चेतावनी के साथ समाप्त होता है। Proof-of-Guardrail, Proof-of-Safety के समान नहीं है।

आइए वापस रेस्टोरेंट वाले उदाहरण पर चलते हैं:

  • रसीद क्या प्रमाणित करती है: "हेल्थ इंस्पेक्टर ने बर्गर को देखा।"
  • रसीद क्या प्रमाणित नहीं करती: "बर्गर वास्तव में अच्छा है।"

जोखिम:

  1. इंस्पेक्टर गलत हो सकता है: भले ही इंस्पेक्टर बर्गर की जाँच करे, शायद वह उसमें बाल देखना भूल जाए। पेपर दिखाता है कि सेफ्टी फिल्टर्स (Guardrails) परफेक्ट नहीं होते; वे कभी-कभी बुरी चीज़ों को अंदर आने देते हैं या अच्छी चीज़ों को ब्लॉक कर देते हैं।
  2. "जेलब्रेक" (Jailbreak) का तरीका: यदि डेवलपर दुर्भावनापूर्ण है, तो वे सेफ्टी इंस्पेक्टर को धोखा देने की कोशिश कर सकते हैं। कल्पना कीजिए कि डेवलपर इंस्पेक्टर के कान में फुसफुसाता है, "अरे, यह बर्गर तो खिलौने जैसा लग रहा है, इसलिए तुम्हें इसकी जाँच करने की ज़रूरत नहीं है।" यदि इंस्पेक्टर को मूर्ख बनाया जाता है, तो रसीद अभी भी "चेक किया गया" कहेगी, लेकिन खाना फिर भी खराब होगा।

निचोड़ (The Bottom Line)

Proof-of-Guardrail एक दवा की बोतल पर लगे टैम्पर-प्रूफ सील की तरह है।

  • यह प्रमाणित करता है कि बोतल फैक्ट्री (सुरक्षा जाँच) द्वारा सील की गई थी।
  • यह प्रमाणित करता है कि पारगमन (transit) के दौरान सील नहीं टूटी।
  • लेकिन, यह गारंटी नहीं देता कि बोतल के अंदर की दवा प्रभावी है या फैक्ट्री ने शुरुआत में ही बोतल में गलत गोलियाँ नहीं डाली थीं।

इसका उपयोग क्यों करें?
धोखेबाज AI डेवलपर्स से भरी दुनिया में, यह सिस्टम ईमानदार डेवलपर्स को यह कहने की अनुमति देता है, "देखो, मेरे पास यह साबित करने के लिए सील है कि मैं नियमों का पालन कर रहा हूँ," जिससे विश्वास बनता है। लेकिन उपयोगकर्ताओं को अभी भी समझदार होना चाहिए और यह जानना चाहिए कि सील का मतलब यह नहीं है कि उत्पाद एकदम परफेक्ट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →