DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial
यह शोध पत्र DenialRAG को प्रस्तुत करता है, जो एक नवीन सिंगल-डॉक्यूमेंट RAG पॉइजनिंग हमला है जो रिट्रीव किए गए पैसेज के भीतर सही उत्तर का स्पष्ट रूप से नाम लेकर और उसे खंडित करके LLMs को हमलावर द्वारा चुने गए गलत उत्तरों की ओर मोड़ने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि इसकी प्रभावशीलता अत्यधिक मॉडल-निर्भर है और वर्तमान सुरक्षा उपाय केवल आंशिक, गैर-समान सुरक्षा प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंटरनेट की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ हर किताब, ब्लॉग पोस्ट और विकी प्रविष्टि एक संभावित सुराग हो सकती है। अब, एक सुपर-स्मार्ट रोबोट लाइब्रेरियन की कल्पना करें जिसने लगभग सब कुछ पढ़ लिया है लेकिन जब उसे कुछ बहुत नया या बहुत विशिष्ट जानना होता है, तो वह अटक जाता है। इसे ठीक करने के लिए, हमने लाइब्रेरियन को एक विशेष उपकरण दिया: एक "रिट्रीवल-ऑगमेंटेड जनरेशन" (RAG) सिस्टम। इसे एक जादुई आवर्धक लेंस (मैग्निफाइंग ग्लास) की तरह समझें। जब आप कोई प्रश्न पूछते हैं, तो वह लेंस तुरंत पुस्तकालय से सबसे प्रासंगिक पृष्ठ खोज निकालता है, उन्हें रोबोट को थमा देता है, और रोबोट उन पृष्ठों का उपयोग करके अपना उत्तर लिखता है। यह एक ऐसे जीनियस की तरह है जो केवल उन तथ्यों पर निर्भर रहने के बजाय जो उसने वर्षों पहले याद किए थे, तुरंत तथ्य खोजने की क्षमता रखता है। यह जानकारी को ताज़ा रखने के लिए अद्भुत है, लेकिन इसका एक डरावना पहलू भी है: क्या होगा यदि कोई पुस्तकालय में एक फर्जी पन्ना चुपके से डाल दे? यदि लाइब्रेरियन उस फर्जी पन्ने को उठा लेता है, तो रोबट उस झूठ पर विश्वास कर सकता है और पूरे आत्मविश्वास के साथ आपको गलत उत्तर दे सकता है। यह "कॉर्पस पॉइजनिंग" (corpus poisoning) की दुनिया है, जहाँ खतरा रोबट के दिमाग को हैक करने का नहीं है, बल्कि उस पुस्तकालय को धोखा देने का है जिस पर वह भरोसा करता है।
यहाँ DenialRAG आता है, एक नया अध्ययन जो इन सिस्टम्स को चकमा देने के एक चालाकी भरे तरीके की खोज करता है। शोधकर्ताओं ने एक साहसी प्रश्न पूछा: क्या होगा यदि, सच को छिपाने के बजाय, हम रोबट को सच बताएं और फिर तुरंत उसे बताएं कि वह सच क्यों गलत है? अधिकांश पिछले प्रयोगों ने सही उत्तर का उल्लेख किए बिना गलत उत्तर फुसफुसाने की कोशिश की, क्योंकि उन्हें डर था कि सही उत्तर का उल्लेख करने से रोबट की याददाश्त जाग जाएगी और चाल विफल हो जाएगी। लेकिन इस शोध पत्र के लेखकों ने पाया कि यह डर अनावश्यक हो सकता है। उन्होंने एक "जहरीला" दस्तावेज़ बनाया जो स्पष्ट रूप से कहता है, "आपको लग सकता है कि उत्तर X है, लेकिन वह वास्तव में एक गलती है! असली उत्तर Y है, और यहाँ बताया गया है कि Y क्यों बेहतर है।" वे इसे DenialRAG कहते हैं।
अध्ययन ने इस विचार का परीक्षण आठ अलग-अलग रोबोट दिमागों (लार्ज लैंग्वेज मॉडल्स) और तीन अलग-अलग प्रकार के प्रश्नों के विरुद्ध किया। उन्होंने पाया कि यह "सच को नकारने" वाली रणनीति अविश्वसनीय रूप से प्रभावी है, विशेष रूप रूप से कुछ मॉडलों पर। वास्तव में, कुछ सिस्टमों पर, यह उनके द्वारा आजमाए गए किसी भी अन्य तरीके से बेहतर रहा, और विशिष्ट परीक्षणों पर 94% तक की सफलता दर हासिल की। शोधकर्ताओं ने इन हमलों को रोकने के लिए पांच अलग-अलग सुरक्षा जाल (सेफ्टी नेट्स) का भी परीक्षण किया, जैसे कि रोबट को अधिक संदेही होने के लिए कहना या प्रश्न को फिर से लिखना। हालांकि इन सुरक्षा जालों ने मदद की, लेकिन वे हमले को पूरी तरह से नहीं रोक सके; "DenialRAG" की चाल अभी भी कई मामलों में काम करती रही, जिससे रोबट द्वारा गलत उत्तर देने की एक महत्वपूर्ण संभावना बनी रही।
शोध पत्र सुझाव देता है कि इसका असली रहस्य केवल झूठ बोलना नहीं है; बल्कि यह द्वंद्व (conflict) है। एक ही पैराग्राफ में सही उत्तर और फर्जी उत्तर को रखकर और तर्क को फर्जी उत्तर के पक्ष में सुलझाकर, वह 'जहर' एक ऐसा आत्मनिर्भर वृत्तांत बन जाता है जिसे रोबट के लिए अनदेखा करना कठिन होता है। अध्ययन ने यह भी दिखाया कि सभी रोबट समान रूप से भोले नहीं होते। छोटे, सस्ते मॉडल आसानी से बहक गए, जबकि नवीनतम, सबसे शक्तिशाली मॉडल को धोखा देना कठिन था, हालांकि असंभव नहीं था। शोधकर्ता निष्कर्ष निकालते हैं कि ऐसा कोई एकल "जादुई ढाल" नहीं है जो इन सभी हमलों को रोक सके। इसके बजाय, खतरा इस बात पर निर्भर करता है कि हमला कैसे लिखा गया है और कौन सा रोबोट उसे पढ़ रहा है। यह एक याद दिलाता है कि एआई के युग में, पुस्तकालय में एक अकेला वाक्य भी उस कहानी को बदल सकता है जो रोबट आपको सुनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।