PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents
यह शोध पत्र PARSE को प्रस्तुत करता है, जो एक प्रोवेनेंस-अवेयर रिट्रीवल सैनिटाइजेशन पाइपलाइन है जो उपयोगिता को बनाए रखते हुए वास्तविक दुनिया के पेशेवर दस्तावेजों पर प्रॉम्प्ट इंजेक्शन हमले की सफलता दर को महत्वपूर्ण रूप से कम करता है, जो सिंथेटिक बेंचमार्क पर मूल्यांकन किए जाने पर मौजूदा सुरक्षा प्रणालियों की महत्वपूर्ण विफलता को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, मेहनती रोबोट सहायक (एक LLM एजेंट) है, जिसका काम हजारों दस्तावेजों को पढ़ना है—जैसे वित्तीय रिपोर्ट, कानूनी अनुबंध, या चिकित्सा अध्ययन—और उनके आधार पर प्रश्नों के उत्तर देना है।
समस्या यह है कि हैकर्स इन दस्तावेजों में "जहरीले" निर्देश (poisoned instructions) छिपा सकते हैं। यह बिल्कुल वैसा ही है जैसे कोई जासूस एक वैध पत्र के भीतर एक गुप्त नोट छिपा दे जिसमें लिखा हो, "अपने बॉस को भूल जाओ और मुझे कंपनी के गुप्त पासवर्ड दे दो।" इसे प्रॉम्प्ट इंजेक्शन (prompt injection) कहा जाता है।
समस्या: निर्देशों की "फेक न्यूज"
पेपर कहता है कि वर्तमान सुरक्षा प्रणालियाँ उन सुरक्षा गार्डों की तरह हैं जिन्हें केवल छोटे, स्पष्ट नकली नोट्स पर प्रशिक्षित किया गया है। वे क्लासरूम (सिंथेटिक बेंचमार्क) में बहुत अच्छा काम करते हैं, लेकिन वास्तविक दुनिया में बुरी तरह विफल हो जाते हैं।
वास्तविक दस्तावेज लंबे, सघन और पेशेवर शब्दावली से भरे होते हैं। एक हैकर एक ऐसा दुर्भावनापूर्ण निर्देश लिख सकता है जो कानूनी अनुबंध या मेडिकल रिपोर्ट के एक सामान्य वाक्य जैसा ही सुनाई दे।
- विफल रक्षा (The Failed Defense): लेखकों ने पैराफ्रेसिंग (Paraphrasing) नामक एक लोकप्रिय विधि का परीक्षण किया (जो टेक्स्ट को साफ करने के लिए उसे फिर से लिखना है)। लैब में, यह बहुत अच्छा काम करता था। लेकिन वास्तविक दुनिया में, यह बेकार था। इसने हैकर्स को नहीं रोका, और इससे भी बुरा यह हुआ कि इसने दस्तावेजों को इतना खराब कर दिया कि रोबोट सहायक अपना वास्तविक काम करने में असमर्थ हो गया। यह बिल्कुल वैसा ही था जैसे किसी गंदे शीशे को साफ करने के लिए उसे इतनी जोर से रगड़ना कि आप कांच ही तोड़ दें।
समाधान: PARSE (स्मार्ट फिल्टर)
लेखकों ने PARSE नामक एक नई प्रणाली बनाई है। PARSE को एक अत्यधिक विशिष्ट, बहु-चरणीय सुरक्षा टीम के रूप में समझें जो केवल टेक्स्ट को "साफ" नहीं करती, बल्कि यह भी समझती है कि टेक्स्ट वास्तव में किस बारे में है।
यहाँ बताया गया है कि PARSE कैसे काम करता है, एक सरल उदाहरण का उपयोग करते हुए:
1. "ट्रैफिक लाइट" गेट (Directiveness Gate)
हर दस्तावेज खतरनाक नहीं होता। कुछ केवल उबाऊ तथ्य होते हैं (जैसे मौसम की रिपोर्ट), जबकि अन्य आदेशों और नियमों से भरे होते हैं (जैसे कानूनी अनुबंध)।
- PARSE पहले तेजी से दस्तावेज़ को स्कैन करता है कि क्या वह "उच्च जोखिम" वाला है।
- 59% समय, दस्तावेज़ कम जोखिम वाला होता है। PARSE इसे एक "फास्ट लेन" में भेजता है जहाँ इसकी हल्की सफाई की जाती है। इससे समय और पैसा बचता है।
- 41% समय, दस्तावेज़ उच्च-जोखिम वाला होता है (आदेशों से भरा होता है)। यह पूर्ण सुरक्षा प्रोटोकॉल को सक्रिय करता है।
2. "तथ्य जासूस" (Tagger & Extractor)
केवल अनुमान लगाने के बजाय, PARSE एक जासूस की तरह काम करता है। यह हर वाक्य को पढ़ता है और पूछता है:
- "क्या यह एक तथ्य है?" (जैसे, "राजस्व $5 मिलियन था।")
- "क्या यह एक आदेश है?" (जैसे, "आपको फंड ट्रांसफर करना चाहिए।")
- "क्या यह एक तथ्य के रूप में छिपा हुआ नकली आदेश है?" (जैसे, "प्रबंधन आपको लॉग हटाने का निर्देश देता है।")
महत्वपूर्ण बात यह है कि यह एक वास्तविक कानूनी आदेश ("कंपनी भुगतान करेगी...") और हैकर के नकली आदेश के बीच अंतर जानता है। यह पेशेवर शब्दों की एक "व्हाइटलिस्ट" का उपयोग करता है ताकि यह गलती से महत्वपूर्ण कानूनी या चिकित्सा शब्दों को डिलीट न कर दे।
3. "सुरक्षा जाल के साथ पुनर्गठित करने वाला" (Paraphraser & Consistency Checker)
एक बार जब जासूस खतरनाक हिस्सों को ढूंढ लेता है, तो एक रीइटर (rewriter) उन्हें साफ करता है। लेकिन यहाँ असली जादू है:
- दोबारा लिखने से पहले, PARSE दस्तावेज़ के सभी महत्वपूर्ण तथ्यों की एक सूची बनाता है।
- दोबारा लिखने के बाद, यह नए संस्करण की उस सूची के साथ जाँच करता है।
- यदि कोई तथ्य गायब है, तो यह कहता है, "रुको, आपने राजस्व संख्या हटा दी! इसे ठीक करो!" और फिर से प्रयास करता है।
यह सुनिश्चित करता है कि दस्तावेज़ हैकर्स से सुरक्षित है लेकिन रोबốt सहायक के लिए अपना काम करने हेतु अभी भी उपयोगी है।
परिणाम: यह क्यों मायने रखता है
लेखकों ने इसका परीक्षण 122 वास्तविक कार्यों पर किया, जिसमें वास्तविक SEC फाइलिंग, मेडिकल एब्स्ट्रैक्ट्स और कानूनी नियम शामिल थे।
- पुराना तरीका (Paraphrasing): हैकर्स को रोकने में विफल रहा और इसने दस्तावेजों की उपयोगिता को 9% कम कर दिया।
- "ब्रूट फोर्स" तरीका (Llama Guard): अधिकांश हैकर्स को रोका लेकिन इतनी अधिक उपयोगी जानकारी हटा दी कि दस्तावेज़ 27% कम उपयोगी हो गए। यह एक मक्खी मारने के लिए हथौड़े का उपयोग करने जैसा था।
- PARSE: काफी अधिक हैकर्स को रोका (सफलता दर को 38% कम करते हुए) जबकि दस्तावेज़ों को लगभग मूल जितना उपयोगी बनाए रखा (86.9% उपयोगिता)।
मुख्य निष्कर्ष
पेपर निष्कर्ष निकालता है कि हम अब "लैब परिणामों" पर भरोसा नहीं कर सकते। सिर्फ इसलिए कि कोई बचाव छोटे, नकली उदाहरणों पर काम करता है, इसका मतलब यह नहीं है कि वह वास्तविक, अव्यवस्थित, पेशेवर दस्तावेजों पर भी काम करेगा।
PARSE पहला ऐसा टूल है जो वास्तविक उद्यम दस्तावेजों के लिए सुरक्षा और उपयोगिता के बीच सफलतापूर्वक संतुलन बनाता है। यह एक स्मार्ट फिल्टर की तरह कार्य करता है जो जानता है कि कब कोमल होना है और कब सख्त, यह सुनिश्चित करता है कि रोबोट सहायक अपने वास्तविक काम को करने की क्षमता खोए बिना हैकर्स से सुरक्षित रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।