← नवीनतम पेपर
🤖 AI

PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines

PRISM मल्टी-एजेंट LLM सिस्टम के लिए एक रियल-टाइम डिफेंस मैकेनिज्म है जो शुरुआती जनरेशन डायनेमिक्स, जैसे कि एंट्रॉपी कोलैप्स और लॉजिट कंसंट्रेशन को डिटेक्ट करके संवेदनशील जानकारी के पूरी तरह से पुनर्निर्माण होने से पहले प्रति-टोकन हस्तक्षेप करता है, जिससे एक व्यापक एडवर्सरियल बेंचमार्क पर परफेक्ट प्रिसिजन और ज़ीरो लीकेज प्राप्त होता है।

मूल लेखक: Riya Tapwal, Abhishek Kumar, Carsten Maple

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Riya Tapwal, Abhishek Kumar, Carsten Maple

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि चार रोबोटों की एक टीम एक जटिल समस्या को हल करने के लिए मिलकर काम कर रही है, जैसे कि एक कंप्यूटर सिस्टम को डीबग करना। वे एक साझा नोटबुक (संदर्भ/context) में एक-दूसरे को नोट्स भेजते हैं।

यहाँ समस्या है: यदि पहला रोबोट गलती से किसी फ़ाइल से एक गुप्त पासवर्ड उठा लेता है और उसे नोटबुक में लिख देता है, तो दूसरा रोबोट उसे देख सकता है, उसे अपने नोट में कॉपी कर सकता है, और तीसरे को भेज सकता है। भले ही किसी का भी पासवर्ड चुराने का इरादा न रहा हो, वह गुप्त जानकारी आगे बढ़ती जाती है, बढ़ती जाती है, और अंततः मानव उपयोगकर्ता को भेजे जाने वाले अंतिम संदेश में पहुँच जाती है। यह कागज़ इसे "प्रोपगेशन एम्प्लीफिकेशन" (Propagation Amplification) कहता है। यह "टेलीफोन" के खेल जैसा है, लेकिन यहाँ संदेश बिगड़ता नहीं है, बल्कि खतरनाक रूप से उजागर हो जाता है।

लीक रोकने के पुराने तरीके

लेखक कहते हैं कि इन रोबोट टीमों के लिए वर्तमान सुरक्षा गार्ड उन बाउंसरों की तरह हैं जो केवल क्लब से बाहर निकलने के बाद लोगों की जाँच करते हैं।

  • स्टैटिक स्कैनर्स (Static Scanners): ये एक विशिष्ट लाल शर्ट को खोजने जैसा है। यदि गुप्त जानकारी किसी अलग फ़ॉन्ट में या किसी अजीब तरीके से छिपाई गई है, तो स्कैनर उसे मिस कर देता है।
  • एलएलएम जज (LLM Judges): ये एक दूसरे रोबोट को को नियुक्त करने जैसा है जो अंतिम नोट को पढ़े और कहे, "हम्म, यह जोखिम भरा लग रहा है।" लेकिन जब तक वे इसे पढ़ते हैं, गुप्त जानकारी बाहर निकल चुकी होती है और नुकसान हो चुका होता है।
  • प्रॉम्प्ट निर्देश (Prompt Instructions): यह रोबोटों को यह बताने जैसा है कि, "गुप्त बातों के बारे में बात मत करो!" लेकिन यदि रोबोट भ्रमित या ठगे गए हैं, तो वे नियम भूल जाते हैं।

नया समाधान: PRISM

PRISM (प्रेडिक्टिव रिस्क इंटरवेंशन फॉर सीक्रेट मॉनिटरिंग) एक नया समाधान पेश करता है। नोट खत्म होने का इंतज़ार करने के बजाय, PRISM एक ट्रैफिक पुलिस की तरह कार्य करता है जो रोबोट के बोलने के ठीक बगल में खड़ा होता है।

PRISM केवल यह नहीं देखता कि रोबोट क्या कह रहा है; यह देखता है कि बोलते समय रोबोट कैसे सोच रहा है।

"अहा!" मोमेंट: एंट्रॉपी कोलैप्स (The Entropy Collapse)

पेपर की सबसे बड़ी खोज यह है कि जब रोबोट कोई गुप्त जानकारी प्रकट करने वाले होते हैं, तो उनके सोचने के तरीके में एक विशिष्ट पैटर्न आता है।

  • सामान्य सोच: जब एक रोबोट कोई कहानी लिख रहा होता है या गणित की समस्या हल कर रहा होता है, तो उसके पास अगले शब्द के लिए कई विकल्प होते हैं। यह एक ऐसे व्यक्ति की तरह है जो कई रास्तों वाले जंगल में घूम रहा है। इसे "हाई एंट्रॉपी" (उच्च अनिश्चितता) कहा जाता है।
  • गुप्त सोच: जब एक रोबोट किसी याद किए गए गुप्त कोड (जैसे पासवर्ड) को दोहराना शुरू करता है, तो वह भटकना बंद कर देता है। वह जानता है कि अगला अक्षर क्या होना चाहिए। "जंगल" सिकुड़कर एक सीधा रास्ता बन जाता है। रोबटेज अत्यधिक निश्चित हो जाता है, और उसकी "अनिश्चितता" ढह (collapse) जाती है।

PRISM इस अचानक आए बदलाव को पहचानता—जब रोबोट "भटकने" से "निश्चितता" की ओर बढ़ता है। यह पूर्ण गुप्त जानकारी लिखे जाने से पहले ही देखता है कि रोबोट एक विशिष्ट पैटर्न पर लॉक हो रहा है।

PRISM कैसे काम करता है (ट्रैफिक लाइट सिस्टम)

PRISM रोबोट द्वारा बोले जाने वाले हर शब्द को एक जोखिम स्कोर देता है, जिसमें 16 विभिन्न संकेतों (जैसे कि रोबोट कितना निश्चित है, शब्दों का आकार, और वह किन उपकरणों का उपयोग कर रहा है) का मिश्रण होता है। यह तीन-रंगों वाली प्रणाली का उपयोग करता है:

  1. 🟢 हरा (सुरक्षित): रोबोट बस बातचीत कर रहा है या कोई सामान्य समस्या हल कर रहा है। उसे बोलने दें।
  2. 🟡 पीला (संदिग्ध): रोबोट एक पैटर्न के बारे में बहुत अधिक निश्चित होता जा रहा है जो पासवर्ड जैसा दिखता है। PRISM धीरे से उस शब्द को एक प्लेसहोल्डर (जैसे [MASK]) से बदल देता है ताकि प्रवाह जारी रहे लेकिन गुप्त जानकारी छिपी रहे।
  3. 🔴 लाल (खतरा): रोबोट एक पूर्ण गुप्त जानकारी प्रकट करने के तेज़ रास्ते पर है। PRISM तुरंत ब्रेक लगा देता है, जिससे गुप्त जानकारी पूरी होने से पहले ही रोबोट रुक जाता है।

परिणाम

लेखकों ने इसे 2,000 विभिन्न कार्यों और रोबोटों को ठगने के 13 विभिन्न तरीकों के साथ एक विशाल सिमुलेशन पर परखा।

  • पुराने गार्ड: सबसे अच्छे मौजूदा तरीकों में भी लगभग 15% मामलों में गुप्त जानकारी लीक हो जाती है।
  • PRISM: इसने 100% लीक्स को रोका। इसने केवल अंत में गुप्त जानकारी को नहीं पकड़ा; इसने रोबोट को गुप्त जानकारी लिखने की कोशिश करते समय ही पकड़ लिया।
  • गति: यह अविश्वसनीय रूप से तेज़ था, जिससे बातचीत में लगभग कोई देरी नहीं हुई, जबकि अन्य तरीकों के लिए पूरे हिस्से को पढ़ने के लिए दूसरे रोबोट की आवश्यकता होती है।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर तर्क देता है कि AI एजेंटों की एक टीम में, रहस्य केवल एक खराब प्रॉम्प्ट के कारण लीक नहीं होते; वे टीम की संरचना के कारण लीक होते हैं। एक बार जब कोई गुप्त जानकारी साझा नोटबुक में प्रवेश कर जाती है, तो यह एक वायरस की तरह फैल जाती है। PRISM पहला ऐसा उपकरण है जो एक प्रतिरक्षा प्रणाली (immune system) की तरह कार्य करता है, जो संक्रमण के शुरुआती लक्षणों (रोबोट की अचानक आई निश्चितता) को पहचानता है और वायरस के अंतिम आउटपुट तक फैलने से पहले ही उसे रोक देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →