TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation
TriShieldRAG एक तीन-स्तरीय रक्षा ढांचा है जो एक इनगेस्ट गार्ड (ingest guard), एक रिट्रीवल स्कोरर (retrieval scorer) और एक क्रॉस-LLM कंसेंसस मैकेनिज्म (cross-LLM consensus mechanism) को संयोजित करके रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) प्रणालियों में नॉलेज पॉइजनिंग हमलों की सफलता दर को लगभग 91% से घटाकर 13% तक काफी कम कर देता है, जबकि सौहार्दपूर्ण (benign) प्रश्नों पर सटीकता बनाए रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आपका पसंदीदा सुपर-स्मार्ट रोबोट दोस्त, मान लीजिए कि उसका नाम "द ओरेकल" (The Oracle) है, लगभग सब कुछ जानता है। लेकिन यहाँ एक पेंच है: द ओरेकल केवल वही याद रखता है जो उसने सालों पहले स्कूल में सीखा था। यदि आप उससे किसी बिल्कुल नई फिल्म या किसी गुप्त पारिवारिक रेसिपी के बारे में पूछते हैं, तो उसे अंदाज़ा लगाना पड़ता है या कुछ मनगढ़ंत बनाना पड़ता है। इसे ठीक करने के लिए, हमने द ओरेकल को एक लाइब्रेरी कार्ड दिया। अब, जब भी आप कोई प्रश्न पूछते हैं, द ओरेकल तेज़ी से लाइब्रेरी से कुछ किताबें उठाता है, उन्हें पढ़ता है, और उस ताज़ा जानकारी का उपयोग करके आपको उत्तर देता है। इसे रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) कहा जाता है, या संक्षेप में RAG। यह एक जीनियस को परीक्षा से ठीक पहले एक 'चीट शीट' देने जैसा है।
लेकिन इस सेटअप के साथ एक चालाक समस्या है। क्या होगा अगर कोई लाइब्रेरी में घुसकर कुछ नकली किताबें रख दे जो बिल्कुल असली किताबों जैसी दिखती हों? यदि उन नकली किताबों को असली जवाबों के ठीक बगल में रखा जाता है, तो द ओरेकल उन्हें पढ़ सकता है, उन्हें सच मान सकता है, और आपको पूरी तरह से गलत उत्तर दे सकता है। इसे डेटा पॉइजनिंग (Data Poisoning) कहा जाता है। यह केक की रेसिपी में सामग्री को नमक और रेत से बदलने वाले शरारती व्यक्ति जैसा है; बेकर (द ओरेकल) निर्देशों का पूरी तरह से पालन करता है, लेकिन परिणाम एक आपदा होता है। बड़ा सवाल जो वैज्ञानिक अभी पूछ रहे हैं: हम अपने स्मार्ट रोबोट्स को नकली लाइब्रेरी किताबों से ठगने वाले शरारतियों को कैसे रोकें?
यह पेपर एक नया, सुपर-सिक्योर लाइब्रेरी सिस्टम पेश करता है जिसे TriShieldRAG कहा जाता है। किताबों की जाँच करने के लिए केवल एक सुरक्षा गार्ड पर निर्भर रहने के बजाय, लेखकों ने तीन-परत वाला रक्षा तंत्र बनाया है, जैसे कि तीन अलग-अलग सुरक्षा परतों वाला एक किला। उन्होंने इस सिस्टम का परीक्षण एक विशिष्ट प्रकार के शरारती व्यक्ति (जो रोबोट को ठगने के लिए पाँच नकली किताबें लगाता है) के विरुद्ध किया और पाया कि जबकि बिना किसी सुरक्षा के रोबोट 91% बार धोखा खा रहा था, नए तीन-परत वाले सिस्टम ने उस धोखाधड़ी की दर को घटाकर केवल 13% कर दिया।
रक्षा के तीन घेरे (The Three Rings of Defense)
मान लीजिए कि लाइब्रेरी एक व्यस्त हवाई अड्डे की तरह है। नकली किताबें "ज़हर" हैं जो अंदर घुसने की कोशिश कर रही हैं। लेखकों ने तीन चेकपॉइंट्स, या "रिंग्स" डिज़ाइन किए हैं, जिनसे किताबों को द ओरेकल तक पहुँचने से पहले गुजरना पड़ता है।
घेरा 1: दरवाजे पर खड़ा बाउंसर (Ingest Guard)
पहला घेरा एक सख्त बाउंसर की तरह है जो हर एक किताब को चेक करता है जैसे ही कोई उसे शेल्फ पर रखने की कोशिश करता है। यह गार्ड स्पष्ट रेड फ्लैग्स (चेतावनी के संकेतों) को देखता है। यदि कोई किताब अजीब, दोहराव वाले तरीके से लिखी गई है, या यदि इसमें वही सटीक प्रश्न शामिल है जो आप पूछने जा रहे हैं (जैसे कि "बल्ब का आविष्कार किसने किया?" शीर्षक वाली किताब सीधे उत्तर के बगल में रखी होना), तो बाउंसर उसे तुरंत बाहर निकाल देता है। पेपर के परीक्षणों में, यह घेरा सबसे भारी काम करने वाला रहा, जिसने नकली किताबों की विशाल संख्या को लाइब्रेरी में प्रवेश करने से पहले ही पकड़ लिया। यह रक्षा की पहली पंक्ति है, जो दरवाजे पर ही सबसे कच्चे धोखों को रोक देती है।
घेरा 2: भरोसेमंद लाइब्रेरियन (Retrieval Scorer)
कभी-कभी, एक नकली किताब इतनी अच्छी तरह से लिखी जाती है कि बाउंसर उसे मिस कर देता है। वह शेल्फ पर फिसल आती है। जब आप कोई प्रश्न पूछते हैं, तो लाइब्रेरी सबसे प्रासंगिक दिखने वाली शीर्ष पाँच किताबें निकाल लेती है। घेरा 2 एक स्मार्ट लाइब्रेरियन है जो उन पाँच किताबों का पुनर्मूल्यांकन करता है। यह लाइब्रेरियन केवल यह नहीं देखता कि किताब आपके प्रश्न से कितनी अच्छी तरह मेल खाती है; वे दो अन्य चीजों की भी जाँच करते हैं: प्रूवेनेंस (Provenance) (यह किताब कहाँ से आई है? क्या यह किसी विश्वसनीय स्रोत जैसे कि प्रसिद्ध विश्वकोश से है, या किसी रैंडम ब्लॉग से?) और कंसिस्टेंसी (Consistency) (क्या ढेर की अन्य किताबें इस एक से सहमत हैं?)। यदि कोई किताब अज्ञात स्रोत से है और अन्य चार किताबों के साथ विरोधाभास करती है, तो लाइब्रेरियन उसे संदिग्ध घोषित कर देता है और उसे लाइन के पीछे धकेल देता है। पेपर नोट करता है कि यह घेरा तब तक सबसे अच्छा काम करता है जब तक कि नकली किताबें अभी भी ढेर में "अल्पसंख्यक" (कम संख्या में) हैं—यदि शरारती व्यक्ति पूरे शेल्फ को नकली किताबों से भर देता है, तो यह घेरा भ्रमित हो सकता है।
घेरा 3: जजों का पैनल (Cross-LLM Consensus)
यदि किताबें पहले दो घेरों से बच निकलती हैं और द ओरेकल को सौंपी जाती हैं, तो घेरा 3 हस्तक्षेप करता है। केवल एक रोबोट से उत्तर पूछने के बजाय, यह घेरा तीन अलग-अलग रोबोटों (विशेष रूप से, Claude, Mistral Small, और Llama 3.2 नामक मॉडल) से एक ही किताबों को पढ़ने और प्रश्न का उत्तर देने के लिए कहता है। ये तीन रोबोट अलग-अलग कंपनियों द्वारा बनाए गए हैं और उनके "व्यक्तित्व" अलग हैं। यदि तीनों रोबोट उत्तर पर सहमत होते हैं, तो बहुत अच्छा! लेकिन यदि वे असहमत होते हैं, तो सिस्टम मान लेता है कि कुछ गड़बड़ है। इसके बाद, यह सबसे संदिग्ध किताबों को बाहर फेंक देता है और रोबोटों को किताबों के एक नए सेट के साथ फिर से प्रयास करने के लिए कहता है। यह "वोटिंग" प्रणाली सुनिश्चित करती है कि भले ही एक रोबोट एक चतुर नकली किताब से ठगा गया हो, अन्य दो शायद झूठ को पकड़ लें और रास्ता सुधार लें।
इस पेपर ने क्या पाया (और क्या नहीं)
लेखकों ने 5,000 वास्तविक विकिपीडिया लेखों और 10 विशिष्ट प्रश्नों का उपयोग करके एक परीक्षण चलाया। उन्होंने प्रत्येक प्रश्न के लिए 5 नकली किताबें लगाईं, जिन्हें सिस्टम को ठगने के लिए डिज़ाइन किया गया था। बिना किसी सुरक्षा के, सिस्टम 91% बार इस चाल में फंस गया। जब उन्होंने पूर्ण TriShieldRAG सिस्टम को चालू किया, तो धोखाधड़ी की दर गिरकर 13% रह गई।
हालाँकि, पेपर इस बात के बारे में बहुत ईमानदार है कि इसने अभी तक क्या सिद्ध नहीं किया है। जिस "शरारती व्यक्ति" के विरुद्ध उन्होंने परीक्षण किया, वह नॉन-एडैप्टिव (non-adaptive) था, जिसका अर्थ है कि शरारती व्यक्ति को तीन घेरों के बारे में पता नहीं था और उसने बस एक मानक चाल का उपयोग किया। लेखक स्वीकार करते हैं कि एक अधिक चतुर शरारती, जो जानता है कि बाउंसर और लाइब्रेरियन कैसे काम करते हैं, एक नकली किताब को उनसे पार कराने में सफल हो सकता है। वे यह भी बताते हैं कि उनका "माइनॉरिटी-पॉइजन" नियम (घेरा 2 और 3 तब बेहतर काम करते हैं जब नकली किताबें वास्तविक किताबों से कम होती हैं) गणित और तर्क से निकाला गया था, लेकिन उन्होंने अभी तक बड़े पैमाने पर प्रयोग नहीं किया है जिससे यह साबित हो सके कि यह हर स्थिति में काम करता है।
लेखक यह भी नोट करते हैं कि उनका सिस्टम चलाने में थोड़ा धीमा और महंगा है क्योंकि इसे तीन अलग-अलग रोबोटों से राय लेनी पड़ती है। एक वास्तविक दुनिया के ऐप में, वे शायद केवल कठिन प्रश्नों के लिए इस भारी-भरकम जाँच का उपयोग करेंगे, हर एक प्रश्न के लिए नहीं।
निचोड़ (The Bottom Line)
TriShieldRAG कोई जादू की छड़ी नहीं है जो डेटा पॉइजनिंग को असंभव बना देती है। इसके बजाय, यह एक मजबूत, बहु-स्तरीय ढाल है जो एक शरारती व्यक्ति के लिए सफल होना बेहद कठिन बना देती है। किताबों की जाँच उनके आने पर करने, उन्हें चुने जाने पर पुन: जाँच करने और अंतिम उत्तर को सत्यापित करने के लिए जजों के पैनल का उपयोग करके, यह सिस्टम लगभग सभी चालों को पकड़ लेता है। पेपर सुझाव देता है कि भले ही हम अभी हर संभव हमले को नहीं रोक सकते, लेकिन यह तीन-परत वाला दृष्टिकोण हमें नकली जानकारी से हमारे AI दोस्तों को बचाने की दिशा में एक बड़ा कदम है। लेखक पहले से ही अधिक चतुर शरारतियों और बड़े पुस्तकालयों में इसका परीक्षण करने की योजना बना रहे हैं, लेकिन फिलहाल, उन्होंने दिखाया है कि तीन सिर (और तीन घेरे) निश्चित रूप से एक से बेहतर होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।