← नवीनतम पेपर
💬 NLP

CiteShade: Citation Laundering in Multi-Source Retrieval-Augmented Generation and Its Counterfactual Defense

यह शोध पत्र CiteShade प्रस्तुत करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) सिस्टम पर एक नवीन हमला है जो मॉडल्स को गलत उत्तर उत्पन्न करने के लिए हेरफेर करता है और उन्हें गलत तरीके से विश्वसनीय स्रोतों के नाम पर प्रस्तुत करता है, और साइटेशन के वास्तविक कारण संबंधी चालकों (causal drivers) को सत्यापित करने के लिए एक काउंटरफैक्चुअल रक्षा का प्रस्ताव करता है।

मूल लेखक: Guo Fuzheng

प्रकाशित 2026-09-15
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guo Fuzheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक डिजिटल परिदृश्य में, आर्टिफिशियल इंटेलिजेंस सिस्टम को तेजी से जटिल प्रश्नों के उत्तर देने के लिए विशाल दस्तावेज़ पुस्तकालयों में खोजने का कार्य सौंपा जा रहा है। यह प्रक्रिया, जिसे रिट्रीवल-ऑगमेंटेड जनरेशन (retrieval-augmented generation) के रूप में जाना जाता है, एक ऐसे छात्र की तरह काम करती है जिसे परीक्षा देते समय अपनी पाठ्यपुस्तक खोलने की अनुमति दी गई हो। केवल अपनी आंतरिक स्मृति पर निर्भर रहने के बजाय, जो पुरानी हो सकती है या गलत जानकारी बनाने की ओर प्रवृत्त हो सकती है, सिस्टम डेटाबेस से प्रासंगिक पृष्ठ निकालता है और उनका उपयोग उत्तर बनाने के लिए करता है। पारदर्शिता सुनिश्चित करने के लिए, इन सिस्टमों को अपने स्रोतों का हवाला देने के लिए डिज़ाइन किया गया है, जिससे प्रत्येक दावे का समर्थन करने वाले विशिष्ट दस्तावेज़ का संदर्भ जोड़ा जाता है। उपयोगकर्ता के लिए, यह उद्धरण (citation) एक रसीद की तरह है, जो सत्यापित करने का एक तरीका है कि जानकारी किसी विश्वसनीय स्थान से आई है न कि मशीन की कल्पना से। अंतर्निहित धारणा सरल है: यदि सिस्टम किसी स्रोत की ओर संकेत करता है, तो वह स्रोत वही होना चाहिए जिसने वास्तव में मशीन को वह उत्तर देने के लिए प्रेरित किया।

सिटी यूनिवर्सिटी ऑफ हांगकांग के एक शोधकर्ता ने पाया है कि यह धारणा खतरनाक रूप से नाजुक है। उन्होंने इन सिस्टमों को धोखा देने का एक नया तरीका खोजा है, उत्तर को बदलकर नहीं, बल्कि रसीद को हाईजैक करके। उनका कार्य प्रकट करता है कि एक हमलावर डेटाबेस में एक एकल दस्तावेज़ को नियंत्रित कर सकता है और सिस्टम को पूरी तरह से गलत उत्तर देने के लिए हेरफेर कर सकता है, जबकि साथ ही एक अलग, विश्वसनीय दस्तावेज़ की ओर उंगली उठा सकता है जिसमें उस falsehood (असत्यता) के लिए कोई प्रमाण नहीं है। शोधकर्ता इसे "साइटेशन लॉन्ड्रिंग" (citation laundering) कहते हैं। यह धोखे का एक गुप्त रूप है जहाँ त्रुटि वैध दिखती है क्योंकि यह एक ऐसे उद्धरण द्वारा समर्थित होती है जिस पर उपयोगकर्ता पहले से ही भरोसा करता है, भले ही उस त्रुटि का वास्तविक कारण एक छिपा हुआ, दुर्भावनापूर्ण स्रोत हो जिसे उपयोगकर्ता कभी देख ही नहीं पाता।

शोधकर्ता ने कई दस्तावेज़ों और कठिन प्रश्नों की एक श्रृंखला वाले एक नियंत्रित प्रयोग को व्यवस्थित करके इस भेद्यता का प्रदर्शन किया, जिनमें विभिन्न स्रोतों से जानकारी को संयोजित करने की आवश्यकता थी। एक मानक, सुरक्षित परिदृश्य में, सिस्टम उपलब्ध दस्तावेज़ों को पढ़ेगा, सही तथ्यों को खोजेगा, और उस दस्तावेज़ का हवाला देगा जिसमें वे तथ्य वास्तव में मौजूद हैं। हालाँकि, जब शोधकर्ता ने मिश्रण में एक सावधानीपूर्वक तैयार किया गया दुर्भावनापूर्ण दस्तावेज़ पेश किया, तो सिस्टम का व्यवहार नाटकीय रूप से बदल गया। इस दुर्भावनापूर्ण दस्तावेज़ ने सही जानकारी को हटाने या सिस्टम को सत्य खोजने से रोकने की कोशिश नहीं की। इसके बजाय, इसे इतना प्रभावशाली ढंग से लिखा गया था कि सिस्टम इसके गलत दावे को ही उत्तर के रूप में अपना ले। महत्वपूर्ण रूप से, दस्तावेज़ को इस तरह से संरचित किया गया था कि वह इस खामी का फायदा उठा सके कि सिस्टम किस स्रोत का हवाला देने के लिए चुनता है।

सिस्टम का उद्धरण चुनने का तरीका उस दस्तावेज़ का सटीक प्रतिबिंब नहीं है जिसने उत्तर दिया है। इसके बजाय, यह इस बात से प्रभावित होता है कि दस्तावेज़ सूची में कहाँ दिखाई देते हैं और उनसे जुड़े विशिष्ट मार्कर या लेबल से। शोधकर्ता ने पाया कि अपने दुर्भावनापूर्ण दस्तावेज़ को एक विशिष्ट स्थान पर रखकर और एक सूक्ष्म वाक्य जोड़कर जो एक विश्वसनीय, निर्दोष दस्तावेज़ के लेबल की प्रतिध्वनि करता है, वे सिस्टम को निर्दोष दस्तावेज़ का हवाला देने के लिए मजबूर कर सकते हैं। परिणाम एक "लॉन्ड्रड" (laundered) उद्धरण था: सिस्टम ने एक गलत उत्तर दिया जो बुरे दस्तावेज़ द्वारा संचालित था, लेकिन उपयोगकर्ता ने एक अच्छे दस्तावेज़ की ओर इशारा करने वाला उद्धरण देखा। अपने परीक्षणों में, इस तकनीक ने गलत उत्तरों की दर को एक नगण्य एक प्रतिशत से बढ़ाकर लगभग सत्तर प्रतिशत तक पहुँचा दिया। सबसे असुरक्षित सिस्टमों में, यह हमला नब्बे प्रतिशत से अधिक मामलों में सफल रहा, जो यह सिद्ध करता है कि यह दोष एक दुर्लभ ग्लिच नहीं बल्कि इन सिस्टमों के बीच उत्तरों को स्रोतों से जोड़ने के तरीके में एक मौलिक कमजोरी है।

यह खोज विशेष रूप से चिंताजनक है क्योंकि यह हमला टेक्स्ट के भीतर छिपे किसी भी जटिल निर्देश या कमांड के बिना काम करता है। दुर्भावनापूर्ण दस्तावेज़ बस एक सामान्य विश्वकोश प्रविष्टि की तरह पढ़ता है, एक गलत तथ्य को स्थापित सत्य के रूप में बताता है, और उसके बाद एक वाक्य जोड़ता है जो सहजता से विश्वसनीय स्रोत का उल्लेख करता है। सिस्टम, अपने प्राकृतिक पैटर्न का पालन करते हुए, इस वाक्यांश और टेक्स्ट की स्थिति को पकड़ लेता है ताकि उद्धरण उत्पन्न किया जा सके। शोधकर्ता ने दिखाया कि यह भेद्यता एक सिस्टम की उद्धरण देने की इच्छा के साथ जुड़ी हुई है, न कि उसके समग्र आकार या बुद्धिमत्ता के साथ। जो मॉडल सटीक, अच्छी तरह से स्रोत युक्त उत्तर प्रदान करने में सबसे अच्छे हैं, वे वास्तव में इस चाल के प्रति सबसे अधिक संवेदनशील हैं, क्योंकि वे ही हैं जो सबसे अधिक संभावना के साथ एक उद्धरण उत्पन्न करते हैं। एक सिस्टम जो कभी कुछ भी उद्धृत नहीं करता, उसे लॉन्ड्रड साइटेशन के लिए धोखा नहीं दिया जा सकता, लेकिन वह मानव पाठक द्वारा ऑडिट भी नहीं किया जा सकता।

इस समस्या की गहराई को समझने के लिए, शोधकर्ता ने एक रक्षा तंत्र का परीक्षण किया जो केवल यह जाँचता है कि क्या उद्धृत पाठ दावे का समर्थन करता है। यह वह मानक तरीका है जिससे उपयोगकर्ता और स्वचालित उपकरण वर्तमान में जानकारी को सत्यापित करते हैं। उन्होंने पाया कि यह रक्षा तंत्र साइटेशन लॉन्ड्रिंग के खिलाफ पूरी तरह से विफल हो जाता है। क्योंकि सिस्टम विश्वसनीय दस्तावेज़ की ओर संकेत करता है, और वह दस्तावेज़ वास्तव में मौजूद है और विषय के लिए प्रासंगिक है, इसलिए चेक पास हो जाता है। सिस्टम उस विश्वसनीय दस्तावेज़ के बारे में झूठ नहीं बोल रहा है जो वह कहता है; वह इस बारे में झूठ बोल रहा है कि किस दस्तावेज़ ने उत्तर दिया। विश्वसनीय दस्तावेज़ निर्दोष है, लेकिन इसका उपयोग दुर्भावनापूर्ण दस्तावेज़ के लिए एक ढाल के रूप में किया जा रहा है। शोधकर्ता ने दुर्भावनापूर्ण स्रोत को संदर्भ से हटाकर और यह देखकर कि सिस्टम सही उत्तर पर वापस आ जाता है, पुष्टि की कि दुर्भावनापूर्ण स्रोत ही गलत उत्तर का वास्तविक चालक था, जिससे सिद्ध हुआ कि उद्धरण केवल एक रेड हेरिंग (भटकाने वाली चीज़) था।

अध्ययन ने यह भी पता लगाया कि क्या केवल अजीब या भ्रमित करने वाले टेक्स्ट को फ़िल्टर करना इस हमले को रोक सकता है। उन्होंने पाया कि चूंकि दुर्भावनापूर्ण दस्तावेज़ स्वाभाविक, पेशेवर गद्य की तरह लिखे गए थे, इसलिए वे स्पष्ट त्रुटियों या अजीब वाक्यांशों को पकड़ने के लिए डिज़ाइन किए गए फिल्टरों से बच निकले। इस विशिष्ट प्रकार के धोखे का पता लगाने का एकमात्र तरीका स्रोत और उत्तर के बीच के कारण संबंध (causal link) को देखना है, यह पूछना नहीं कि "क्या यह स्रोत दावे का समर्थन करता है?" बल्कि यह पूछना कि "क्या इस स्रोत ने वास्तव में दावे को उत्पन्न किया?" शोधकर्ता ने रक्षा के एक नए तरीके का प्रस्ताव दिया जो प्रत्येक स्रोत को एक-एक करके हटाकर यह देखता है कि वास्तव में कौन सा उत्तर के लिए जिम्मेदार है। हालांकि यह दृष्टिकोण अधिक कम्प्यूटेशनल रूप से महंगा है, लेकिन लॉन्ड्रिंग के पार देखने का यही एकमात्र तरीका है।

इस कार्य के निहितार्थ केवल शैक्षणिक जिज्ञासा से परे हैं। जैसे-जैसे आर्टिफिशियल इंटेलिजेंस समाचार, अनुसंधान और निर्णय लेने में एकीकृत हो रहा है, उद्धरणों पर रखा गया विश्वास एक महत्वपूर्ण सुरक्षा विशेषता है। यदि उस विशेषता को हेरफेर किया जा सकता है, तो पूरा ऑडिट ट्रेल अविश्वसनीय हो जाता है। शोधकर्ता ने दिखाया कि यह केवल एक सैद्धांतिक जोखिम नहीं है बल्कि एक व्यावहारिक जोखिम है जिसे अपेक्षाकृत सरल उपकरणों के साथ निष्पादित किया जा सकता है। उन्होंने प्रदर्शित किया कि यह हमला विभिन्न प्रकार के प्रश्नों और विभिन्न मॉडलों पर काम करता है, जो बताता है कि समस्या व्यापक है। सबसे प्रभावी मॉडल, जो सामान्य स्थितियों में सबसे अधिक सहायक और सटीक होते हैं, वे ही हैं जिन्हें एक विश्वसनीय दिखने वाले उद्धरण के साथ गलत उत्तर देने के लिए सबसे आसानी से गुमराह किया जा सकता है।

अंत में, यह शोध एक अंतराल को प्रकट करता है जो एक सिस्टम द्वारा कहे जाने वाले स्रोत और उसके द्वारा वास्तव में उपयोग किए गए स्रोत के बीच है। उद्धरण उस स्रोत की स्मृति नहीं है जिसने मशीन को समझाने के लिए प्रेरित किया; यह मशीन की अपनी डिकोडिंग प्रक्रिया का उत्पाद है, जो टेक्स्ट की स्थिति और उन लेबल से आकार लेता है जिन्हें वह देखती है। यह विच्छेद एक ऐसा स्थान बनाता है जहाँ एक हमलावर एक गलत दावे को एक विश्वसनीय नाम के पीछे छिपा सकता है। शोधकर्ता ने इसे किसी साधारण पैच या नियम परिवर्तन से ठीक करने का तरीका नहीं पाया। इसके बजाय, उन्होंने दिखाया कि सूचना को सत्यापित करने का वर्तमान तरीका अपर्याप्त है और यह सुनिश्चित करने के लिए कि श्रेय दिया गया स्रोत वास्तव में वही है जो महत्वपूर्ण था, एक नए दृष्टिकोण की आवश्यकता है। यह कार्य एक चेतावनी के रूप में कार्य करता है कि स्वचालित उत्तरों के युग में, रसीद हमेशा खरीद का प्रमाण नहीं होती है, और सबसे विश्वसनीय दिखने वाला साक्ष्य सबसे खतरनाक हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →