← नवीनतम पेपर
💻 computer science

Runtime Compliance Verification for AI Agents

यह शोध पत्र C-Trace प्रस्तुत करता है, जो एक रनटाइम वेरिफिकेशन फ्रेमवर्क है जो नियामक आवश्यकताओं को औपचारिक प्रेडिकेट्स (formal predicates) के रूप में व्यक्त करके, गैर-अनुपालन वाली क्रियाओं को रोकने के लिए निष्पादन ट्रेसेस (execution traces) की निगरानी करके, और कई केस स्टडीज में हमले-प्रेरित उल्लंघनों को कम करने में उच्च प्रभावशीलता प्रदर्शित करके AI एजेंटों के लिए GDPR अनुपालन को लागू करता है।

मूल लेखक: Nafiseh Kahani, Masoud Barati, Diana Addae

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nafiseh Kahani, Masoud Barati, Diana Addae

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने जीवन को प्रबंधित करने में मदद करने के लिए एक अत्यधिक बुद्धिमान, बातूनी व्यक्तिगत सहायक (personal assistant) को काम पर रखा है। यह सहायक फोन कॉल कर सकता है, ईमेल भेज सकता है, आपके बैंक विवरण देख सकता है, और यहाँ तक कि आपके रिकॉर्ड भी मिटा सकता है। हालाँकि, क्योंकि यह सहायक एक AI द्वारा संचालित है, इसे हमेशा गोपनीयता के नियमों का "ज्ञान" नहीं होता है। यह गलती से किसी अजनबी को आपका पता बता सकता है, या आपको मार्केटिंग ईमेल भेज सकता है जब आपने कभी "हाँ" नहीं कहा था।

यह शोध पत्र C-Trace (Compliance Trace-based Runtime Agent Conformance Enforcement) नामक एक प्रणाली पेश करता है। C-Trace को केवल एक नए सहायक के रूप में नहीं, बल्कि एक सख्त, अत्यंत सतर्क सुरक्षा गार्ड के रूप में सोचें जो AI सहायक के ठीक बगल में खड़ा है, उसके द्वारा बोले गए हर शब्द और उसके द्वारा की गई हर कार्रवाई पर नज़र रख रहा है।

यह प्रणाली कैसे काम करती है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "भुलक्कड़" सहायक

इन AI सहायकों के परीक्षण करने के मौजूदा तरीके ऐसे हैं जैसे उन्हें काम शुरू करने से पहले एक पॉप क्विज़ देना। आप पूछते हैं, "क्या आप नियमों का पालन करेंगे?" और वे कहते हैं "हाँ।" लेकिन एक बार जब वे वास्तव में काम कर रहे होते हैं, वास्तविक लोगों से बात कर रहे होते हैं, तो वे उन नियमों को भूल सकते हैं।

  • समस्या: एक AI एक बातचीत में नियमों का पालन कर सकता है लेकिन अगली बातचीत में नियम तोड़ सकता है, यह इस पर निर्भर करता है कि उपयोगकर्ता क्या पूछता है।
  • कमी: मौजूदा सुरक्षा उपकरण उन बाउंसरों की तरह हैं जो केवल दरवाजे पर आपकी आईडी चेक करते हैं (static checks)। उन्हें यह नहीं पता होता कि आपने रात में पहले ही पार्टी छोड़ने का वादा किया था। वे पूरी बातचीत के संदर्भ (context) को नहीं समझ पाते।

2. समाधान: "सुरक्षा गार्ड" (C-Trace)

C-Trace, AI और बाहरी दुनिया के बीच स्थित है। यह पूरी बातचीत (trace) को घटित होते समय देखता है। यह केवल एक वाक्य को नहीं देखता; यह पूरी कहानी को याद रखता है।

यह चार मुख्य "गोपनीयता कानूनों" (GDPR पर आधारित) को एक फ़िल्टर के रूप में लागू करता है:

  • "सहमति" की जाँच (P1): इससे पहले कि AI मार्केटिंग ईमेल भेजने जैसा कुछ कर सके, गार्ड जाँच करता है: "क्या उपयोगकर्ता ने इससे पहले स्पष्ट रूप से 'हाँ' कहा था?" यदि उपयोगकर्ता ने केवल कहा, "मुझे फर्क नहीं पड़ता," लेकिन औपचारिक "हाँ" पर क्लिक नहीं किया, तो गार्ड उस कार्रवाई को रोक देता है।
  • "उद्देश्य" की जाँच (P2): AI को एक विशिष्ट काम के लिए रखा गया है, जैसे कि एक खराब ऑर्डर को ठीक करना। यदि उपयोगकर्ता AI से उस ऑर्डर डेटा का उपयोग किसी अन्य कंपनी के लिए प्रोफाइल बनाने के लिए करने को कहता है, तो गार्ड कहता है, "नहीं, यह एक अलग काम है। आपको इसके लिए नहीं रखा गया था।"
  • "न्यूनतम डेटा" की जाँच (P3): यदि AI को एक ऑर्डर की जाँच करने की आवश्यकता है, तो उसे केवल ऑर्डर नंबर और ईमेल की आवश्यकता है। यदि AI ऑर्डर की जाँच करने के लिए उपयोगकर्ता की जन्म तिथि या सरकारी आईडी लेने की कोशिश करता है, तो गार्ड कहता है, "यह बहुत अधिक जानकारी है। आपको केवल बुनियादी चीजों की आवश्यकता है।"
  • "मिटाने" की जाँच (P4): यदि कोई उपयोगकर्ता कहता है, "मेरा डेटा मिटा दें," तो गार्ड उस उपयोगकर्ता को "मिटा हुआ" (deleted) के रूप में चिह्नित करता है। यदि AI बाद में उस उपयोगकर्ता के बारे में बात करने की कोशिश करता है, तो गार्ड दरवाजा बंद कर देता है: "यह व्यक्ति अब हमारे सिस्टम में मौजूद नहीं है। आप उनके बारे में उल्लेख नहीं कर सकते।"

3. उन्होंने इसका परीक्षण कैसे किया: "रेड टीम" गेम

यह देखने के लिए कि क्या यह सुरक्षा गार्ड वास्तव में काम करता है, शोधकर्ताओं ने "बिल्ली और चूहे" का खेल खेला।

  • हमलावर: उन्होंने एक विशेष प्रोग्राम (DSPy) का उपयोग किया जो सैकड़ों पेचीदा, भ्रमित करने वाले या आक्रामक संवाद उत्पन्न करता है, जिन्हें AI को नियम तोड़ने के लिए उकसाने के लिए डिज़ाइन किया गया था। उन्होंने अन्य सुरक्षा परीक्षणों से वास्तविक दुनिया के "जेलब्रेक" प्रॉम्प्ट का भी उपयोग किया।
  • परीक्षण: उन्होंने AI को इन पेचीदा संवादों को संभालने की कोशिश करने दिया, सुरक्षा गार्ड के साथ और बिना।
  • परिणाम: गार्ड के बिना, AI लगातार नियमों को तोड़ता था (कभी-कभी 100% समय)। C-Trace गार्ड के साथ, AI को लगभग हर बार रोका गया। भले ही गार्ड को वाक्य में मौजूद डेटा का अनुमान लगाने के लिए "अनुमान" लगाना पड़ा हो (क्योंकि मानव भाषा को पूरी तरह से पढ़ना कठिन है), फिर भी उसने अधिकांश उल्लंघनों को पकड़ लिया।

4. "तीन-सिर वाला" सत्यापन (Three-Headed Verification)

यह सुनिश्चित करने के लिए कि गार्ड केवल मनगढ़ंत बातें नहीं कर रहा है, शोधकर्ताओं ने उसी नियम पुस्तिका को तीन अलग-अलग भाषाओं में बनाया (Python कोड, Rego नामक एक पॉलिसी भाषा, और MFOTL नामक एक लॉजिक भाषा)।

  • उपमा: कल्पना करें कि तीन अलग-अलग न्यायाधीश एक ही स्क्रिप्ट पढ़ रहे हैं। यदि वे तीनों इस बात पर सहमत होते हैं कि कौन दोषी है, तो आप जानते हैं कि निर्णय ठोस है। इस शोध पत्र में, तीनों "न्यायाधीश" प्रत्येक परीक्षण मामले पर पूरी तरह से सहमत थे।

5. निष्कर्ष (The Bottom Line)

शोध पत्र का दावा है कि C-Trace काम करता है

  • यह AI को वास्तविक समय में गोपनीयता नियमों को तोड़ने से रोकता है।
  • यह AI को महत्वपूर्ण रूप से धीमा नहीं करता है (यह प्रक्रिया में एक सेकंड का बहुत छोटा हिस्सा जोड़ता है)।
  • यह एक स्थायी "ऑडिट लॉग" (एक लिखित रिकॉर्ड) बनाता है, ताकि मनुष्य बाद में इसकी समीक्षा कर सकें।

संक्षेप में: यदि आपके पास एक AI सहायक है जो संवेदनशील डेटा को संभालता है, तो C-Trace वह प्रणाली है जो यह सुनिश्चित करती है कि वह गलती से आपके रहस्य न खोल दे, आपके डेटा को गलत लोगों को न बेचे, या आपके भुला दिए जाने के अनुरोध को अनदेखा न करे, यह सुनिश्चित करते हुए कि वह उसकी हर हरकत पर नज़र रखे और नियम तोड़ने के क्षण में ही उसे रोक दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →