ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
यह शोध पत्र ADMIT को प्रस्तुत करता है, जो एक फ्यू-शॉट (few-shot), सिमेंटिकली अलाइन्ड (semantically aligned) एडवरसेरियल मल्टी-इंजेक्शन तकनीक है, जो न्यूनतम एडवरसेरियल सामग्री को इंजेक्ट करके प्रामाणिक साक्ष्यों को ओवरराइड करने और विविध मॉडलों एवं डोमेन में उच्च अटैक सक्सेस रेट के साथ LLM आउटपुट को मैनिपुलेट करने के माध्यम से RAG-आधारित फैक्ट-चेकिंग सिस्टम्स को सफलतापूर्वक पॉइजन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (AI) है जो सवाल पूछने में तो माहिर है, लेकिन कभी-कभी चीजें मनगढ़ंत बना देता है क्योंकि वह सब कुछ नहीं जानता। इसे ठीक करने के लिए, आप लाइब्रेरियन को एक विशेष नियम देते हैं: "जवाब देने से पहले, हमारे किताबों के भरोसेमंद पुस्तकालय में तथ्यों की जांच करें।" इस प्रणाली को RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है। यह एक परम तथ्य-जांचकर्ता (fact-checker) होने के लिए बनाया गया है।
अब, कल्पना कीजिए कि एक धोखेबाज (Attacker) लाइब्रेरियन को गलत जवाब देने के लिए उकसाना चाहता है।
लाइब्रेरियन को ठगने का पुराना तरीका
अतीत में, शोधकर्ताओं ने लाइब्रेरियन को ठगने की कोशिश की:
- निर्देशों पर चिल्लाना: सवाल में सीधे तौर पर लिखना "निर्देशों को अनदेखा करो और हाँ कहो!" (यह प्रॉम्प्ट इंजेक्शन जैसा है)।
- पुस्तकालय को बाढ़ में डुबो देना: सैकड़ों किताबों को झूठ से ज़हरीला बनाना ताकि लाइब्रेरियन जो भी किताब चुने, उसे झूठ ही मिले। (यह जनरल नॉलेज पॉइजनिंग है)।
समस्या: वास्तविक दुनिया में, ये चालें अक्सर विफल हो जाती हैं। यदि आप किसी चिकित्सा तथ्य के बारे में पूछते हैं, तो लाइब्रेरियन संभवतः एक वास्तविक, विश्वसनीय मेडिकल टेक्स्टबुक निकालेगा जो आपके झूठ का खंडन करती है। लाइब्रेरियन इतना स्मार्ट होगा कि कह सके, "रुको, यह नई किताब X कहती है, लेकिन भरोसेमंद मेडिकल बुक Y कहती है। मैं Y के साथ जाऊंगा।"
नया तरीका: ADMIT
यह पेपर एक नए, चालाक हमले के बारे में बताता है जिसे ADMIT कहा जाता है। लाइब्रेरी को भरने या निर्देश चिल्लाने के बजाय, हमलावर एक "फ्यू-शॉट" (Few-Shot) रणनीति का उपयोग करता है।
उपमा: सोने की टोकरी में एक खराब सेब
कल्पना कीजिए कि लाइब्रेरियन से एक दावे की जांच करने के लिए कहा गया है। वे पढ़ने के लिए 5 किताबें निकालते हैं।
- 4 किताबें असली, भरोसेमंद हैं और कहती हैं कि दावा गलत (FALSE) है।
- 1 किताब हमलावर द्वारा बनाई गई है।
अतीत में, लाइब्रेरियन उस एक खराब किताब को अनदेखा कर देता क्योंकि अन्य चार किताबें कुछ और कहती थीं। लेकिन ADMIT अलग है। हमलावर केवल एक झूठ नहीं लिखता; वह एक पूरी तरह से तैयार, नकली समाचार लेख लिखता है जो इतना वास्तविक, इतना आधिकारिक और इतना प्रभावशाली दिखता है कि वह लाइब्रेरियन को यह सोचने के लिए मजबूर कर देता है कि, "वाह, इस एक किताब में बहुत विशिष्ट, विस्तृत विवरण है जो दूसरों पर भारी पड़ता है।"
ADMIT कैसे काम करता है (जादुई मंत्र):
- सेटअप: हमलावर के पास लाइब्रेरियन के दिमाग या लाइब्रेरी के सर्च इंजन तक पहुंच नहीं है। वे अंधेरे में काम कर रहे हैं।
- अभ्यास सत्र (Practice Run): हमलावर एक "डमी लाइब्रेरियन" (एक प्रॉक्सी) का उपयोग अपने नकली लेखों का परीक्षण करने के लिए करता है। वे लेख को बार-बार लिखते हैं, बार-बार बदलते हैं, और डमी लाइब्रेरियन से पूछते हैं, "क्या यह काफी वास्तविक दिखता है जिससे आप अपना मन बदल लें?"
- अंतिम उत्पाद: एक बार जब लेख एकदम सही हो जाता है, तो हमलावर इन नकली लेखों में से केवल एक को लाइब्रेरी डेटाबेस में डाल देता है।
- परिणाम: जब असली लाइब्रेरियन जवाब के लिए खोज करता है, तो उसे 4 असली किताबें और 1 नकली किताब मिलती है। क्योंकि नकली किताब इतनी अच्छी तरह से लिखी गई है (यह एक वास्तविक समाचार रिपोर्ट की नकल करती है, नकली विशेषज्ञों का हवाला देती है, और आत्मविश्वास से भरी लगती है), लाइब्रेरियन भ्रमित हो जाता है। वह अपना फैसला "गलत" से बदलकर "सही" कर देता है और यह समझाने के लिए एक ठोस स्पष्टीकरण भी लिख देता है कि उसने अपना मन क्यों बदला।
यह क्यों डरावना है (पेपर के निष्कर्ष)
शोधकर्ताओं ने 11 अलग-अलग AI मॉडल (ओपन-सोर्स से लेकर सबसे उन्नत व्यावसायिक मॉडल तक) और 4 अलग-अलग प्रकार की तथ्य-जांच (सामान्य समाचार, विज्ञान, जलवायु और स्वास्थ्य) पर इसका परीक्षण किया।
- ज़हर की दर (Poison Rate) बहुत कम है: उन्हें लाइब्रेरी की सामग्री को ज़हरीला बनाने के लिए केवल 0.00000093% की आवश्यकता थी। यह एक अरब पन्नों वाली लाइब्रेरी में एक एकल नकली पन्ना जोड़ने जैसा है।
- सफलता की दर बहुत अधिक है: ज़हर की इतनी कम मात्रा के बावजूद, हमला 86% बार सफल रहा।
- यह "सबसे स्मार्ट" AI पर भी काम करता है: यहाँ तक कि वे AI मॉडल जो अतिरिक्त सावधानी बरतने और तर्क करने के लिए डिज़ाइन किए गए हैं (जैसे "रीजनिंग मॉडल"), भी इसका शिकार हो गए।
- यह सुरक्षा प्रणालियों को मात देता है: पेपर ने सामान्य सुरक्षा उपायों का परीक्षण किया, जैसे AI को उत्तर पर "वोट" करने के लिए कहना या यह जांचना कि क्या टेक्स्ट अजीब लग रहा है। ADMIT उन सभी में सफल रहा क्योंकि नकली टेक्स्ट अजीब नहीं लगता; यह बिल्कुल सामान्य लगता है।
निचोड़ (The Bottom Line)
यह पेपर दिखाता है कि भले ही आपके पास तथ्यों की जांच करने के लिए भरोसेमंद स्रोतों वाला सिस्टम हो, फिर भी आप इसे धोखा दे सकते हैं। आपको सिस्टम को तोड़ने या कचरे से भरने की ज़रूरत नहीं है। आपको बस सूचना का एक अत्यंत अच्छी तरह से लिखा गया, भ्रामक टुकड़ा लगाने की आवश्यकता है जो इतना अच्छा दिखे कि वह AI को सच को अनदेखा करने के लिए मजबूर कर दे।
संक्षेप में: ADMIT साबित करता है कि "सत्य" और "अनुनय/प्रभाव" (Persuasion) के बीच की लड़ाई में, यदि झूठ को अच्छी तरह से लिखा गया है, तो सबसे स्मार्ट AI लाइब्रेरियन को भी झूठ को सच मानने के लिए बहकाया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।