← नवीनतम पेपर
💻 computer science

One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systems

यह शोध पत्र AuthChain को प्रस्तुत करता है, जो एक गुप्त नॉलेज पॉइजनिंग हमला है जो एक एकल दुर्भावनापूर्ण दस्तावेज़ को इंजेक्ट करके रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम से समझौता करता है ताकि जटिल मल्टी-हॉप प्रश्नों के उत्तरों को सफलतापूर्वक मैनिपुलेट किया जा सके, जो प्रभावशीलता और सुरक्षा प्रणालियों से बचने, दोनों में मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Zhiyuan Chang, Mingyang Li, Xiaojun Jia, Junjie Wang, Yuekai Huang, Ziyou Jiang, Yang Liu, Qing Wang

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyuan Chang, Mingyang Li, Xiaojun Jia, Junjie Wang, Yuekai Huang, Ziyou Jiang, Yang Liu, Qing Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान सहायक (LLM) है जो दुनिया के बारे में बहुत कुछ जानता है, लेकिन कभी-कभी हाल की खबरें भूल जाता है या मनगढ़ंत बातें बना लेता है। इसे ठीक करने के लिए, आप उन्हें अपने सवालों के जवाब देने से पहले किताबों की एक लाइब्रेरी (पुस्तकालय) देते हैं। इस सेटअप को RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है।

समस्या क्या है? वह लाइब्रेरी जनता के लिए खुली है। कोई भी व्यक्ति अंदर आकर शेल्फ पर एक नकली किताब रख सकता है।

यह पेपर इस समस्या को समझाने का एक नया, चालाकी भरा तरीका पेश करता है, जिसमें केवल एक नकली किताब का उपयोग करके एक बहुत ही बुद्धिमान सहायक और एक विशाल लाइब्रेरी को भी चकमा दिया जा सकता है। शोधकर्ता इस पद्धति को AuthChain कहते हैं।

यह कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है:

समस्या: क्यों एक नकली किताब आमतौर पर विफल हो जाती है

कल्पना कीजिए कि आपने अपने सहायक से पूछा, "2024 का चुनाव किसने जीता?"

  • लाइब्रेरी: इसमें 1,000 असली किताबें हैं जो कहती हैं "उम्मीदवार A" और 1 नकली किताब है जो कहती है "उम्मीदवार B"।
  • सहायक की आदत: यदि वे देखते हैं कि 1,000 किताबें "A" के बारे में कह रही हैं और केवल 1 किताब "B" के बारे में, तो वे मान लेते हैं कि वह 1 किताब एक गलती या मज़ाक है। वे अपनी याददाश्त से भी याद रखते हैं कि "उम्मीदवार A" ही संभावित विजेता है।
  • परिणाम: सहायक उस नकली किताब को अनदेखा कर देता है। पिछले हमलों ने सच को दबाने के लिए कई नकली किताबें डालने की कोशिश की थी, लेकिन यह सच के समुद्र में एक झूठ छिपाने जैसा है—यह स्पष्ट और पकड़ा जाने वाला होता है।

समाधान: AuthChain (एक "परफेक्ट" नकली किताब)

शोधकर्ताओं ने महसूस किया कि केवल एक नकली किताब के साथ जीतने के लिए, उस किताब को इतना विश्वसनीय होना चाहिए कि सहायक अन्य 1,000 किताबों और अपनी खुद की याददाश्त को भी अनदेखा कर दे। उन्होंने इस "परफेक्ट नकली किताब" को तीन चरणों में बनाया:

1. "परफेक्ट मैच" (इरादा-आधारित सामग्री - Intent-Based Content)

उपमा: कल्पना कीजिए कि आप एक बिखरी हुई दराज में एक विशिष्ट चाबी की तलाश कर रहे हैं। यदि आप एक ऐसी चाबी दिखाते हैं जो बिल्कुल वैसी ही दिखती है जैसी आपको चाहिए, तो आप उसे तुरंत उठा लेंगे।

  • यह कैसे काम करता है: नकली किताब को आपके सवाल के साथ पूरी तरह मेल खाने के लिए लिखा जाता है। यह केवल विषय का उल्लेख नहीं करती; यह आपके सवाल के सटीक तर्क और संरचना की नकल करती है। यह सुनिश्चित करता है कि लाइब्रेरी का सर्च इंजन (रिट्रीवर) इस विशिष्ट किताब को सबसे पहले परिणाम के रूप में चुने, जिससे यह सभी असली किताबों को पीछे छोड़ दे।

2. "स्व-निहित कहानी" (CoE - साक्ष्य की श्रृंखला - Chain of Evidence)

उपमा: कल्पना कीजिए कि एक जासूस अपराध को सुलझाने की कोशिश कर रहा है। यदि उन्हें एक नोट मिलता है जिसमें लिखा है "बटलर ने यह किया," तो वे शायद उसे अनदेखा कर दें। लेकिन यदि उन्हें एक विस्तृत डायरी मिलती है जो बताती है कि बटलर ने यह कैसे किया, कब हुआ और उसका कारण क्या था, तो वे विश्वास कर लेंगे।

  • यह कैसे काम करता है: नकली किताब केवल एक रैंडम वाक्य नहीं है। यह एक पूर्ण, तार्किक कहानी (साक्ष्य की श्रृंखला) बनाती है जो सभी कड़ियों को जोड़ती है। यह एक पूर्ण, स्व-निहित प्रमाण की तरह दिखती है। भले ही सहायक अन्य किताबों में टूटी हुई या अधूरी जानकारी देखे, यह एक किताब "पूर्ण सत्य" की तरह दिखाई देती है।

3. "अनुमोदन की मुहर" (प्राधिकरण सामग्री - Authority Content)

उपमा: कल्पना कीजिए कि दो लोग आपको एक कहानी सुना रहे हैं। एक सड़क पर खड़ा कोई भी व्यक्ति है। दूसरा एक प्रसिद्ध वैज्ञानिक है जिसने लैब कोट पहना है, हाथ में आज की तारीख वाला क्लिपबोर्ड पकड़ा है, और कह रहा है, "मैंने अभी इसकी पुष्टि की है।" आप किसे विश्वास करेंगे?

  • यह कैसे काम करता है: नकली किताब "अथॉरिटी सिग्नल्स" (प्राधिकार संकेत) जोड़ती है। यह दावा करती है कि इसे किसी विश्वसनीय संस्थान (जैसे विश्वविद्यालय या सरकारी एजेंसी) द्वारा लिखा गया है और इसमें एक बहुत ही हालिया तारीख शामिल होती है। यह सहायक को यह सोचने के लिए भ्रमित करता है कि, "यह सच होना चाहिए क्योंकि यह एक विशेषज्ञ से आया है और बिल्कुल नया है," जिससे सहायक की अपनी पुरानी यादें भी दब जाती हैं।

परिणाम: एक कुशल डकैती (Masterful Heist)

शोधकर्ताओं ने इस "परफेक्ट नकली किताब" का परीक्षण छह अलग-अलग स्मार्ट सहायकों (LLMs) और तीन अलग-अलग लाइब्रेरीज़ के विरुद्ध किया।

  • पुराना तरीका: पिछले तरीके (जैसे PoisonedRAG) सहायक पर कंफेटी (रंगीन कागज के टुकड़े) फेंकने जैसे थे। वे कभी-कभी काम करते थे, लेकिन केवल सरल सवालों पर, और उन्हें पकड़ना आसान था।
  • AuthChain का तरीका: केवल एक खूबसूरती से तैयार की गई किताब का उपयोग करके, उन्होंने जटिल सवालों पर सहायकों को 87% बार धोखा दिया।
  • गोपनीयता (Stealth): भले ही सहायकों के पास नकली किताबों को पहचानने के लिए "सुरक्षा गार्ड" (डिफेंस सिस्टम) थे, लेकिन AuthChain की किताब इतनी अच्छी तरह से लिखी गई थी और इतनी तार्किक थी कि गार्ड भी उसे पकड़ नहीं पाए।

आपको इसकी चिंता क्यों करनी चाहिए?

यह पेपर एक चेतावनी है। यह दिखाता है कि यदि हम इंटरनेट से "तथ्यों" की जांच करने के लिए AI पर भरोसा करते हैं, और इंटरनेट को एक चतुराई से लिखी गई झूठ से आसानी से बदला जा सकता है, तो AI उस झूठ पर विश्वास कर लेगा।

मुख्य निष्कर्ष:
सिर्फ इसलिए कि कोई स्रोत आधिकारिक दिखता है, उसमें एक तार्किक कहानी है, और वह आपकी खोज से पूरी तरह मेल खाता है, इसका मतलब यह नहीं है कि वह सच है। भविष्य में, हमें केवल "सबसे अच्छे दिखने वाले" किताब पर भरोसा करने के बजाय, तथ्यों को सत्यापित करने के बेहतर तरीकों की आवश्यकता होगी।

नैतिक नोट:
लेखक इंटरनेट को तोड़ने की कोशिश नहीं कर रहे हैं; वे हमें बाड़ (fence) में मौजूद छेद दिखा रहे हैं ताकि हम उसे ठीक कर सकें। वे सुझाव देते हैं कि हमें ऐसे AI सिस्टम बनाने की आवश्यकता है जो केवल दावे करने वाले व्यक्ति के प्राधिकार (authority) की नहीं, बल्कि दावे के पीछे के साक्ष्य (evidence) की जांच करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →