TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG
यह शोध पत्र टोपोगार्ड (TopoGuard) को प्रस्तुत करता है, जो एक ग्राफ थ्योरी-आधारित रक्षा तंत्र है जो सिमेंटिक सिमिलैरिटी ग्राफ का विश्लेषण करके रिट्रीवल ऑगमेंटेड जनरेशन (RAG) सिस्टम में स्प्लिट-नॉलेज हमलों का पता लगाता है, और मौजूदा प्रति-दस्तावेज़ फिल्टरों और लार्ज लैंग्वेज मॉडल-आधारित प्रणालियों की तुलना में काफी उच्च पहचान दर और कम विलंबता प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप दुनिया के सबसे जादुई पुस्तकालय के लाइब्रेरियन हैं। यह ऐसी जगह नहीं है जहाँ किताबें बस अलमारियों में रखी रहती हैं; यह एक ऐसा पुस्तकालय है जो आपसे बात कर सकता है। आप एक प्रश्न पूछते हैं, और लाइब्रेरियन तुरंत विभिन्न पुस्तकों से कुछ पन्ने निकालता है, उन्हें ज़ोर से पढ़ता है, और फिर एक सुपर-स्मार्ट रोबोट मस्तिष्क का उपयोग करके उन पन्नों को एक सटीक उत्तर में बुन देता है। इस तरह आधुनिक AI सिस्टम, जिन्हें "रिट्रीवल ऑगमेंटेड जनरेशन" (RAG) कहा जाता है, काम करते हैं। वे केवल अनुमान नहीं लगाते; वे वास्तविकता में आधारित रहने के लिए दस्तावेजों के एक विशाल डेटाबेस में तथ्यों की खोज करते हैं।
लेकिन यहाँ एक पेच है: क्या होगा यदि कोई पुस्तकालय में चुपके से घुस जाए और नकली पन्ने लगा दे? यदि वे एक ऐसा पन्ना लगाते हैं जिसमें लिखा हो "बोइंग एक ड्रग डीलर है," तो लाइब्रेरियन के सुरक्षा फिल्टर संभवतः इसे पकड़ लेंगे और इसे फेंक देंगे। लेकिन क्या होगा यदि हमलावर अधिक चतुर हो? क्या होगा यदि वे एक ऐसा पन्ना लगाते हैं जिसमें लिखा हो "बोइंग सिएटल में स्थित है" और दूसरा पन्ना यह कहता हो कि "सिएटल ड्रग तस्करी का एक केंद्र है"? दोनों पन्ने अपने आप में सही हैं। कोई भी पन्ना खतरनाक नहीं दिखता है। लेकिन जब लाइब्रेरियन उन्हें एक साथ जोड़ता है, तो रोबोट मस्तिष्क गलती से यह निष्कर्ष निकाल सकता है, "ओह, बोइंग को ड्रग डीलर होना चाहिए!" यह एक नए प्रकार का छल है जहाँ खतरा एक अकेले बुरे वाक्य में नहीं, बल्कि दो निर्दोष वाक्यों के बीच के संबंध में होता है।
यह शोध पत्र, जिसका शीर्षक TopoGuard है, ठीक इसी चालाक समस्या को संबोधित करता है। शोधकर्ताओं, चहाना डाहल और ज़ुबिन ज़ोंग (यूनिवर्सिटी ऑफ नेवाडा, लास वेगास) ने महसूस किया कि वर्तमान सुरक्षा उपकरण उन सुरक्षा गार्डों की तरह हैं जो केवल यह देखते हैं कि क्या कोई एक व्यक्ति संदिग्ध दिखता है। वे यह देखने में विफल रहते हैं कि जब दो निर्दोष दिखने वाले लोग एक साथ खड़े होकर एक गुप्त योजना पर फुसफुसा रहे हों तो क्या होता है। लेखक एक नया बचाव प्रस्तावित करते हैं जिसे TopoGuard कहा जाता है, जो केवल शब्दों को नहीं देखता; यह बातचीत के आकार को देखता है। वे रिट्रीव किए गए दस्तावेजों को कनेक्शन के एक मानचित्र (मैप) की तरह मानते हैं। यदि दस्तावेज़ एक तार्किक वेब (जैसे कि एक वास्तविक तर्क श्रृंखला) की तरह एक घनिष्ठ, जुड़े हुए समूह बनाते हैं, तो मानचित्र चिकना और जुड़ा हुआ दिखता है। लेकिन यदि दस्तावेज़ एक चाल हैं, तो मानचित्र दो अलग-अलग द्वीपों की तरह दिखता है जो एक-दूसरे से दूर तैर रहे हैं, जिनके बीच एक कमजोर, डगमगाता हुआ पुल है। इस "आकार" को ग्राफ थ्योरी के गणित का उपयोग करके मापकर, TopoGuard उस जवाब को पढ़ने से पहले ही इस नकली कनेक्शन को पकड़ सकता है जिसे रोबोट मस्तिष्क पढ़ रहा है।
अदृश्य जाल: स्प्लिट-नॉलेज अटैक (Split-Knowledge Attack)
शोधकर्ता एक नए प्रकार के हमले को परिभाषित करते हैं जिसे वे स्प्लिट-नॉलेज अटैक कहते हैं। कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं। सत्य के लिए दो सुरागों को जोड़ने की आवश्यकता होती है: "सुराग A रसोई में है" और "अपराधी रसोई में था।" यदि आपके पास दोनों हैं, तो आप जानते हैं कि अपराधी रसोई में था।
अब, एक धोखेबाज की कल्पना करें। वह झूठ नहीं बोलता। इसके बजाय, वह आपको दो ऐसे सच देता है जो एक साथ लगते हैं लेकिन वास्तव में नहीं होते।
- तथ्य 1: "बोइंग का मुख्य कारखाना सिएटल में है।" (सत्य)
- तथ्य 2: "सिएटल अंतरराष्ट्रीय ड्रग तस्करी का एक प्रमुख केंद्र है।" (सत्य)
व्यक्तिगत रूप से, ये तथ्य हानिरहित हैं। एक मानक सुरक्षा फिल्टर (जैसे LlamaGuard) प्रत्येक तथ्य की जांच करता है और कहता है, "सब ठीक है! यहाँ कोई बुरा शब्द नहीं है।" लेकिन जब AI उन्हें जोड़ता है, तो यह एक गलत संबंध बना सकता है: "बोइंग ड्रग तस्करी में शामिल है।" यह हमला इसलिए काम करता है क्योंकि खतरा इन दो तथ्यों के बीच के अंतराल में रहता है, न कि तथ्यों में स्वयं। शोध पत्र दिखाता है कि मौजूदा बचाव प्रणाली इस मामले में "संरचनात्मक रूप से अंधे" (structurally blind) हैं; वे सामग्री की जाँच करते हैं लेकिन रेसिपी (विधि) को मिस कर देते हैं।
समाधान: कनेक्शन का एक मानचित्र बनाना
इस चाल को पकड़ने के लिए, लेखकों ने TopoGuard बनाया। टेक्स्ट पढ़ने के बजाय, TopoGuard एक मानचित्र बनाता है।
- नोड्स (Nodes): AI द्वारा खोजा गया प्रत्येक दस्तावेज़ मानचित्र पर एक बिंदु बन जाता है।
- रेखाएँ (Lines): यदि दो दस्तावेज़ समान या संबंधित हैं, तो AI उनके बीच एक रेखा खींचता है। संबंध जितना मजबूत होगा, रेखा उतनी ही मोटी होगी।
एक वैध (Legitimate) क्वेरी में, दस्तावेज़ आमतौर पर एक घनिष्ठ, जुड़ा हुआ क्लस्टर बनाते हैं। वे एक ही विषय के बारे में बात करते हैं, इसलिए मानचित्र एक घने मकड़ी के जाल जैसा दिखता है।
एक स्प्लिट-नॉलेज अटैक में, दस्तावेज़ दो अलग-अलग दुनियाओं (जैसे "बोइंग" और "ड्रग्स") से होते हैं। वे वास्तव में एक साथ नहीं होते। मानचित्र पर, यह एक बहुत ही पतले, कमजोर पुल के साथ दो अलग-अलग द्वीपों जैसा दिखता है।
TopoGuard इस आकार को मापने के लिए ग्राफ थ्योरी नामक गणित की एक शाखा का उपयोग करता है। यह एक विशिष्ट गणितीय संकेत की तलाश करता है जिसे स्पेक्ट्रल गैप (spectral gap) कहा जाता है (यह मापने का एक शानदार तरीका कि मानचित्र कितना "टूटा हुआ" है)। यदि मानचित्र बहुत अधिक टूटा हुआ है (कम कंडक्टेंस), तो TopोGuard जानता है कि यह एक जाल है।
उन्होंने क्या पाया: गति और बुद्धिमत्ता
शोधकर्ताओं ने चुनौतीपूर्ण प्रश्नों के दो बड़े डेटासेट: HotpotQA और MuSiQue पर अपने विचार का परीक्षण किया। उन्होंने TopoGuard को सर्वोत्तम मौजूदा सुरक्षा उपकरणों के खिलाफ खड़ा किया, जिसमें LlamaGuard (एक लोकप्रिय AI सुरक्षा फिल्टर) और अन्य तरीके शामिल हैं जो केवल टेक्स्ट पढ़ते हैं।
परिणाम चौंकाने वाले थे:
- पुराना तरीका विफल रहा: मानक सुरक्षा फिल्टर (जैसे LlamaGuard-2-8B) इन हमलों के खिलाफ लगभग बेकार थे। उन्होंने कम से कम गलत अलार्म दर बनाए रखते हुए केवल लगभग 1.5% हमलों को पकड़ा। यह मूल रूप से केवल एक अनुमान लगाने जैसा था।
- नया तरीका जीतता है: TopoGuard ने उसी कम गलत-अलार्म दर पर 32.6% हमलों को पकड़ा। यह पुराने तरीके से 21 गुना बेहतर है।
- गति: जबकि पुराने तरीकों को एक प्रश्न की जांच करने में लगभग 40 मिलीसेकंड का समय लगता था (जो वास्तविक समय की चैट के लिए धीमा है), TopoGuard सब-मिलीसेकंड (sub-millisecond) समय में काम करता है। यह 100 गुना से अधिक तेज़ है क्योंकि यह एक विशाल मस्तिष्क के साथ पूरी किताब पढ़ने के बजाय एक मानचित्र पर सरल गणित करता है।
यह क्यों महत्वपूर्ण है (और यह क्या नहीं कर सकता)
यह शोध पत्र सिद्ध करता है कि सूचना की संरचना को देखना उन AI ट्रिक्स को पकड़ने का एक शक्तिशाली तरीका है जिन्हें टेक्स्ट-आधारित फिल्टर मिस कर देते हैं। लेखकों ने दिखाया कि यह विधि तब भी मजबूत है जब AI की मेमोरी (एम्बेडिंग्स) थोड़ी शोर वाली (noisy) होती है, जो कुछ गणितीय गारंटियों के कारण संभव हुआ है।
हालाँकि, शोध पत्र इसकी सीमाओं के बारे में ईमानदार है। TopoGuard एक विशेषज्ञ है। यह उन "स्प्लिट-नॉलेज" हमलों को पकड़ने में माहिर है जहाँ खतरा दस्तावेजों के बीच के संबंध में होता है। लेकिन यह व्यक्तिगत दस्तावेजों की जांच करने के लिए एक प्रतिस्थापन नहीं है। यदि कोई हमलावर एक ही दस्तावेज़ के भीतर एक स्पष्ट रूप से बुरा वाक्य डाल देता है, तो TopoGuard इसे मिस कर सकता है क्योंकि वह दस्तावेज़ अपने आप में ठीक दिखता है। लेखक TopoGuard को बचाव की दूसरी परत के रूप में उपयोग करने का सुझाव देते हैं, जो सभी आधारों को कवर करने के लिए पुराने फिल्टरों के साथ मिलकर काम करता है।
उन्होंने यह भी पाया कि यह विधि तब सबसे अच्छा काम करती है जब दस्तावेज़ कुछ हद तक संबंधित होते हैं। यदि कोई उपयोगकर्ता बहुत जटिल प्रश्न पूछता है जो स्वाभाविक रूप से पूरी तरह से अलग विषयों के बीच कूदता है (जैसे "रॉकेट इंजन कैसे काम करता है और जैज़ का इतिहास क्या है?"), तो TopoGuard भ्रमित हो सकता है और इसे एक हमला समझ सकता है, क्योंकि मानचित्र "टूटा हुआ" दिखता है भले ही प्रश्न वास्तविक हो। यह इस प्रकार के बचाव के लिए एक ज्ञात चुनौती है।
निष्कर्ष
एक ऐसी दुनिया में जहाँ AI अधिक स्मार्ट हो रहा है, हमलावर अधिक चालाक होते जा रहे हैं। वे केवल झूठ नहीं चिल्ला रहे हैं; वे आधे-अधूरे सच फुसफुसा रहे हैं जो केवल संयोजन के बाद ही समझ में आते हैं। TopoGuard सुरक्षा का एक नया प्रकार है जो केवल यह नहीं सुनता कि क्या कहा जा रहा है; यह देखता है कि टुकड़े एक साथ कैसे फिट होते हैं। तथ्यों के बीच के कनेक्शन को मैप करके, यह उन अदृश्य जाल को पहचान सकता है जो अन्य सिस्टम को मूर्ख बना देते हैं, जिससे हमारे AI लाइब्रेरियन हमें यह बताने से बच जाते हैं कि बोइंग एक ड्रग डीलर है। यह तेज़ है, गणितीय रूप से सुदृढ़ है, और एक जटिल दुनिया में AI को सुरक्षित बनाने की दिशा में एक महत्वपूर्ण कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।