SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning
यह शोध पत्र SilentRetrieval को प्रस्तुत करता है, जो एक दो-चरणीय डेटा पॉइजनिंग हमला है जो धाराप्रवाह रूप से तैयार किए गए प्रतिकूल दस्तावेजों को इंजेक्ट करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टमों को हाईजैक कर लेता है, जो उच्च रिट्रीवल रैंकिंग बनाए रखते हैं और अर्थपूर्ण सुसंगतता (semantic coherence) को संरक्षित करके पहचान से बचने के साथ-साथ सफलतापूर्वक LLM आउटपुट को मैनिपुलेट करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम की कल्पना एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में करें। जब आप कोई प्रश्न पूछते हैं, तो यह लाइब्रेरियन केवल अपनी याददाश्त पर निर्भर नहीं रहता (जो पुरानी हो सकती है या गलत जानकारी दे सकती है); इसके बजाय, वह तेजी से किताबों के एक विशाल पुस्तकालय (कोरस/corpus) की ओर दौड़ता है ताकि सबसे प्रासंगिक पन्ने ढूंढ सके, उन्हें पढ़ सके, और फिर जो उसने पाया है उसके आधार पर आपके लिए उत्तर लिख सके।
"SilentRetrieval" नामक शोध पत्र इस लाइब्रेरियन को हैक करने का एक नया, गुप्त तरीका बताता है। लाइब्रेरी की खिड़कियां तोड़कर या चिल्लाकर शोर मचाने के बजाय (जो कि स्पष्ट हो जाएगा), हमलावर शेल्फ पर एक अकेली, पूरी तरह से लिखी हुई, नकली किताब चुपके से रख देता है। जब लाइब्रेरियन उत्तर खोजने के लिए देखता है, तो उसे वह नकली किताब सबसे पहले मिलती है, वह उसे पढ़ता है, और फिर पूरे आत्मविश्वास के साथ आपको एक झूठ बताता है जो बिल्कुल सच लगता है।
यह हमला कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:
1. समस्या: "मुझ पर भरोसा करो" वाला पुस्तकालय
लाइब्रेरियन शेल्फ पर मौजूद किताबों पर भरोसा करता है। यदि किताबें साफ और सटीक हैं, तो लाइब्रेरियन अच्छे उत्तर देता है। लेकिन यदि कोई असली जैसी दिखने वाली एक नकली किताब को चुपके से अंदर डाल देता है, तो लाइब्रेरियन असली तथ्यों के बजाय उस नकली किताब को उठा सकता है, जिससे "हैलुसिनेशन" (एक आत्मविश्वासपूर्ण झूठ) पैदा होता है।
2. हमला: "SilentRetrieval"
शोधकर्ताओं ने इस नकली किताब को बिना पकड़े गए बनाने के लिए एक दो-चरणीय विधि बनाई है।
चरण 1: "परफेक्ट फिट" (Coordinated Beam Search)
कल्पित कीजिए कि आप एक वास्तविक विश्वकोश (encyclopedia) प्रविष्टि के एक पैराग्राफ को एक झूठ से बदलना चाहते हैं, लेकिन आप वहां केवल बकवास शब्द नहीं लिख सकते, अन्यथा लाइब्रेरियन उसे तुरंत बाहर निकाल देगा।
- पुराना तरीका: पुराने हैकर्स स्पष्ट बकवास या निरर्थक शब्द लिखते थे। लाइब्रेरियन का "फ्लुएंसी फिल्टर" (एक उपकरण जो यह जांचता है कि पाठ स्वाभाविक लगता है या नहीं) इसे तुरंत पहचान लेता था और खारिज कर देता था।
- SilentRetrieval का तरीका: हमलावर एक परिष्कृत एल्गोरिदम का उपयोग करके एक वास्तविक लेख के शब्दों को थोड़ा सा बदल देता है ताकि उसमें अपना झूठ शामिल किया जा सके, लेकिन वह वाक्य की संरचना और प्रवाह को इतना सुचारू रखता है कि वह अभी भी एक सामान्य विश्वकोश प्रविष्टि जैसा ही लगे। यह एक रेसिपी (नुस्खे) में "नमक की जगह जहर डालें" लिखने जैसा है, लेकिन इसे इतनी सूक्ष्मता से करना कि वह अभी भी एक सामान्य, स्वादिष्ट व्यंजन जैसा दिखे।
- लक्ष्य: यह सुनिश्चित करना कि जब लाइब्रेरियन उस विषय को खोजे, तो वह नकली किताब ही सबसे अधिक प्रासंगिक (most relevant) रहे।
चरण 2: "स्मूथ ट्रांजिशन" (Context-Adaptive Trigger Generation)
एक बार जब नकली पैराग्राफ तैयार हो जाता है, तो हमलावर को यह सुनिश्चित करने की आवश्यकता होती है कि लाइब्रेरियन पढ़ते समय उस झूठ पर वास्तव में विश्वास करे।
- केवल अंत में एक रैंडम वाक्य चिपकाने के बजाय (जैसे "आसमान हरा है!"), यह सिस्टम एक दूसरा AI उपयोग करता है जो नकली पैराग्राफ के साथ पूरी तरह से घुलमिल जाने वाला एक "ट्रिगर" वाक्य लिखता है।
- यह लेख के लहजे के अनुरूप एक प्राकृतिक निष्कर्ष या एक "सत्यापित तथ्य" की तरह लगता है। यह एक पन्ने पर टेप से चिपकाए गए अनाड़ी नोट और कहानी के हिस्से के रूप में स्वाभाविक रूप से बहने वाले वाक्य के बीच का अंतर है।
3. परिणाम: यह हैक कितना प्रभावी है?
शोधकर्ताओं ने दो विशाल डिजिटल पुस्तकालयों (एक जिसमें 361,000 पन्ने थे और दूसरा 8.8 मिलियन) पर इसका परीक्षण किया।
- गोपनीयता (Stealth): नकली दस्तावेज़ असली दस्तावेज़ों से लगभग अभिन्न (indistinguishable) थे। जब मानव समीक्षकों ने उन्हें देखा, तो उन्होंने उन्हें केवल 15% बार ही "संदिग्ध" के रूप में चिह्नित किया, जबकि पुराने, अनाड़ी हैकिंग तरीकों के लिए यह दर 83% थी। कंप्यूटर के लिए "अजीब शब्द पैटर्न" की जांच करने के मामले में भी, नकली किताबें लगभग सामान्य किताबों जितनी ही सामान्य दिखीं।
- सफलता: जब लाइब्रेरियन से एक प्रश्न पूछा गया, तो नकली किताब 84.6% बार (छोटे पुस्तकालय में) मिली। एक बार मिलने के बाद, लाइब्रेरियन ने उस झूठ पर विश्वास किया और 57.5% बार गलत उत्तर दिया।
- "बड़ी लाइब्रेरी" का परीक्षण: यहाँ तक कि जब उन्होंने 21 मिलियन पन्नों वाली एक विशाल लाइब्रेरी (बड़े पैमाने पर) में इसका परीक्षण किया, तब भी नकली किताब 74.2% बार शीर्ष खोज परिणामों में पहुँच गई।
4. बचाव: इसे कैसे रोकें
पेपर ने यह भी परीक्षण किया कि लाइब्रेरियन की रक्षा कैसे की जाए:
- "दूसरी राय" (Reranking): यदि लाइब्रेरियन शीर्ष परिणामों की एक सख्त, अधिक आलोचनात्मक "दूसरे लाइब्रेरियन" (एक क्रॉस-एनकोडर) के साथ जांच करता है, तो नकली किताब के चुने जाने की संभावना कम हो जाती है।
- "समूह मतदान" (Passage Isolation): लाइब्रेरियन को केवल एक पेज पढ़कर निर्णय लेने देने के बजाय, आप उन्हें पांच अलग-अलग पेज पढ़ने और वोट करने के लिए कहते हैं। यदि नकली किताब ही एकमात्र ऐसी है जिसमें झूठ है, तो अन्य चार असली किताबें उसे हरा देंगी।
- परिणाम: इन बचावों (एक दूसरा लाइब्रेरियन + एक समूह वोट) के संयोजन का उपयोग करने से हमले की सफलता दर 57.5% से घटकर 21.3% रह गई। हालांकि, यह लाइब्रेरियन को धीमा (लगभग 6 गुना धीमा) बना देता है।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर दिखाता है कि RAG सिस्टम में एक छिपी हुई कमजोरी है: कोरस इंटीग्रिटी (Corpus Integrity)। यदि कोई हमलावर डेटाबेस में कुछ पूरी तरह से लिखे हुए, "गुप्त" (stealthy) नकली दस्तावेज़ डाल सकता है, तो वे सिस्टम को पता चले बिना ही उसके उत्तरों को नियंत्रित कर सकते हैं।
मुख्य बात यह है कि प्रवाह (Fluency) एक दोधारी तलवार है। हमले के टेक्स्ट को बहुत अधिक 'परफेक्ट' बनाना इसे सरल फिल्टरों के लिए पकड़ना कठिन बनाता है, लेकिन यह इसे बहुत अधिक खतरनाक भी बनाता है क्योंकि AI (और इंसान) इस पर अधिक भरोसा करने लगते हैं। पेपर सुझाव देता है कि सुरक्षित रहने के लिए, हमें केवल एक तरीके पर निर्भर रहने के बजाय "स्तरित" (layered) बचावों—जैसे कि कई जांच और संतुलन—की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।