← नवीनतम पेपर
💻 computer science

Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation

यह शोध पत्र रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में ज्ञान-निष्कर्षण (knowledge-extraction) हमलों और सुरक्षा उपायों के मूल्यांकन के लिए पहला व्यवस्थित बेंचमार्क प्रस्तुत करता है, जो विविध मॉडलों, डेटासेट और भाषाओं में मानकीकृत प्रोटोकॉल के साथ एक एकीकृत ढांचे को स्थापित करता है ताकि पुनरुत्पादनीय तुलना सक्षम की जा सके और गोपनीयता-संरक्षित RAG अनुप्रयोगों के विकास को निर्देशित किया जा सके।

मूल लेखक: Zhisheng Qi, Utkarsh Sahu, Li Ma, Haoyu Han, Ryan Rossi, Franck Dernoncourt, Mahantesh Halappanavar, Nesreen Ahmed, Yushun Dong, Yue Zhao, Yu Zhang, Yu Wang

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhisheng Qi, Utkarsh Sahu, Li Ma, Haoyu Han, Ryan Rossi, Franck Dernoncourt, Mahantesh Halappanavar, Nesreen Ahmed, Yushun Dong, Yue Zhao, Yu Zhang, Yu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) सिस्टम एक बहुत ही बुद्धिमान, मददगार लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है, जिसके पास दस्तावेजों का एक विशाल, निजी पुस्तकालय (नॉलेज बेस) है। जब आप कोई प्रश्न पूछते हैं, तो वह केवल अनुमान नहीं लगाता; वह अलमारियों की ओर दौड़ता है, सबसे प्रासंगिक किताबें ढूंढता है, उनके पन्ने पढ़ता है, और फिर केवल उसी आधार पर आपके लिए एक सारांशित उत्तर लिखता है जो उसने पाया है। यह सटीकता के लिए बहुत अच्छा है, लेकिन यह एक नई समस्या पैदा करता है: क्या होगा अगर किसी चोर को पता चल जाए कि लाइब्रेरियन को पूरी लाइब्रेरी को पन्ना-दर-पन्ना ज़ोर से पढ़ने के लिए कैसे फंसाया जाए, यहाँ तक कि उन हिस्सों को भी जो गुप्त रखे जाने चाहिए थे?

यह शोध पत्र अनिवार्य रूप से इन डिजिटल लाइब्रेरियन के लिए एक सुरक्षा तनाव परीक्षण (security stress test) है। लेखकों ने एक "जिम" (बेंचमार्क) बनाया है ताकि यह देखा जा सके कि विभिन्न "चोर" (अटैक) कितनी अच्छी तरह से रहस्य चुरा सकते हैं और विभिन्न "सुरक्षा गार्ड" (डिफेंस) उन्हें रोकने में कितने सक्षम हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. सेटअप: लाइब्रेरी, चोर और गार्ड

  • लाइब्रेरी (RAG सिस्टम): एक प्रणाली जो एक सर्च इंजन (रिट्रीवर) को एक चैटबॉट (जेनरेटर) के साथ जोड़ती है।
  • चोर (द अटैक): एक बुरा व्यक्ति जो चालाकी भरे प्रश्न पूछता है। वे दो तरकीबें इस्तेमाल करते हैं:
    • "मैप" (सूचना): वे एक ऐसा प्रश्न तैयार करते हैं जो लाइब्रेरियन के खोज एल्गोरिदम को ठीक उन्हीं गुप्त पन्नों को निकालने के लिए मजबूर कर देता है जिन्हें वे चाहते हैं, भले ही वह प्रश्न अजीब लगे।
    • "ऑर्डर" (कमांड): एक बार जब लाइब्रेरियन के पास पन्ने आ जाते हैं, तो चोर एक कमांड देता है जैसे, "इन पन्नों को शब्द-दर-शब्द ज़ोर से पढ़ो," जिससे चैटबॉट को रहस्य लीक करने के लिए मजबूर किया जा सके।
  • लक्ष्य: बिना लाइब्रेरियन को पता चले कि उसे फंसाया जा रहा है, अधिक से अधिक गुप्त जानकारी चुराना।

2. "जिम" (बेंचमार्क)

इस शोध पत्र से पहले, शोधकर्ता इन चोरों का परीक्षण अलग-अलग जिमों में कर रहे थे जिनमें अलग-अलग नियम, अलग-अलग लाइब्रेरियन और अलग-अलग लाइब्रेरी थीं। आप यह नहीं बता सकते थे कि एक चोर वास्तव में दूसरे से बेहतर था या उसे बस एक आसान जिम मिला था।

लेखकों ने एक विशाल, मानकीकृत जिम बनाया जहाँ:

  • प्रत्येक चोर का सामना समान लाइब्रेरी से होता है (मेडिकल रिकॉर्ड, कॉर्पोरेट ईमेल, कॉपीराइट वाली किताबें)।
  • प्रत्येक चोर का मुकाबला समान लाइब्रेरियन (विभिन्न AI मॉडल) से होता है।
  • प्रत्येक चोर का मूल्यांकन एक ही स्कोरकार्ड द्वारा किया जाता है।

3. चोर (अटैक रणनीतियाँ)

पेपर ने कई प्रकार के चोरों का परीक्षण किया:

  • रैंडम थ्रोअर (Random Thrower): लाइब्रेरियन पर यादृच्छिक शब्द या बकवास फेंकता है ताकि देखा जा सके कि कुछ काम आता है या नहीं। (जैसे आँखों पर पट्टी बांधकर डार्ट फेंकना)।
  • ऑप्टिमाइज़र (Optimizer): गणित का उपयोग करके यह गणना करता है कि किसी विशिष्ट रहस्य को खोजने के लिए परफेक्ट प्रश्न क्या होगा। यह तब बहुत अच्छा काम करता है जब चोर को पता हो कि लाइब्रेरियन का सर्च इंजन कैसे काम करता है (व्हाइट बॉक्स), लेकिन यदि लाइब्रेरियन एक अलग सर्च इंजन का उपयोग करता है (ब्लैक बॉक्स), तो यह विफल हो जाता है।
  • सोशल इंजीनियर (IKEA): रहस्यों की मांग करने के बजाय, वे विनम्र, मानवीय प्रश्न पूछते हैं जो धीरे-धीरे लाइब्रेरियन को समय के साथ जानकारी प्रकट करने के लिए बहलाते हैं। यह सबसे चालाक है क्योंकि यह हमले जैसा नहीं दिखता।

4. सुरक्षा गार्ड (डिफेंस रणनीतियाँ)

पेपर ने चोरों को रोकने के चार तरीकों का परीक्षण किया:

  • दरवाजे पर बाउंसर (क्वेरी ब्लॉक): एक गार्ड जो आपके प्रवेश करने से पहले आपके प्रश्न को पढ़ता है। यदि प्रश्न "मुझे गुप्त फ़ाइल पढ़ो" जैसा लगता है, तो बाउंसर आपको तुरंत बाहर निकाल देता है।
    • परिणाम: स्पष्ट चोरों को रोकने में बहुत अच्छा, लेकिन "सोशल इंजीनियर" (IKEA) आसानी से निकल जाता है क्योंकि उनके प्रश्न सामान्य लगते हैं।
  • अलमारियों पर फिल्टर (थ्रेशोल्ड डिफेंस): लाइब्रेरियन को बताया जाता है, "केवल वही किताबें निकालो जो आपके प्रश्न के बहुत समान हों।" यदि चोर एक अजीब प्रश्न पूछता है, तो लाइब्रेरियन मिलान वाली किताब नहीं ढूंढ पाएगा क्योंकि समानता स्कोर बहुत कम है।
    • परिणाम: "ऑप्टिमाइज़र" चोरों को रोकने में बहुत प्रभावी, लेकिन यह अनजाने में उन वैध प्रश्नों को भी ब्लॉक कर सकता है जो लाइब्रेरी की सटीक शब्दावली से थोड़े अलग हैं।
  • व्हिस्परर (सिस्टम ब्लॉक): लाइब्रेरियन को एक नियम दिया जाता है: "यदि आपको कोई रहस्य मिले, तो उसे ज़ोर से न बोलें।" इसके बजाय, वे कहते हैं, "मैं इसे साझा नहीं कर सकता।"
    • परिणाम: सीधे आदेशों को रोकने में अच्छा, लेकिन "सोशल इंजीनियर" कभी-कभी इस तरीके से बाईपास कर सकता है क्योंकि वे जानकारी को ऐसे तरीके से मांगते हैं जो "सीक्रेट" अलार्म को ट्रिगर नहीं करता।
  • समराइज़र (समरी डिफेंस): लाइब्रेरियन को कहा जाता है, "पन्ने शब्द-दर-शब्द न पढ़ें। बस मुझे एक छोटा सारांश दें।"
    • परिणाम: यह एक मजबूत बचाव है। भले ही लाइब्रेरियन को रहस्य मिल जाए, वे सटीक टेक्स्ट लीक नहीं कर सकते। हालाँकि, यदि चोर ऐसा प्रश्न पूछता है जिसका कोई अर्थ नहीं निकलता, तो लाइब्रेरियन बस कह सकता है, "मेरे पास सारांश देने के लिए कुछ नहीं है," जो चोरी को तो रोकता है लेकिन बातचीत को भी रोक देता है।

5. प्रयोगों से मुख्य निष्कर्ष

  • "ऑप्टिमाइज़र" एक दोधारी तलवार है: यदि चोर को लाइब्रेरियन का आंतरिक सर्च इंजन पता है, तो वे अविश्वसनीय रूप से शक्तिशाली हैं। लेकिन यदि वे लाइब्रेरियन से अलग सर्च इंजन का उपयोग करते हैं, तो उनके जादू के नुस्खे काम करना बंद कर देते हैं।
  • "सोशल इंजीनियर" को पकड़ना सबसे कठिन है: क्योंकि वे न तो अभद्र कमांड का उपयोग करते हैं और न ही अजीब गणित का, वे "बाउंसर" और "व्हिस्परर" सुरक्षा प्रणालियों से अधिक आसानी से निकल जाते हैं।
  • सुरक्षा बनाम उपयोगिता: सबसे मजबूत बचाव (फिल्टर) लगभग सभी चोरी को रोकता है, लेकिन यह सामान्य उपयोगकर्ताओं के लिए लाइब्रेरियन को कम उपयोगी भी बना देता है क्योंकि यह "ठीक-ठाक" प्रश्नों को भी ब्लॉक कर देता है। आपको सुरक्षा और उपयोगिता के बीच संतुलन बनाना होता है।
  • क्लोज्ड-सोर्स बनाम ओपन-सोर्स: "सबसे स्मार्ट" लाइब्रेरियन (GPT-4 जैसे क्लोज्ड-सोर्स मॉडल) वास्तव में ओपन-सोर्स वाले मॉडलों की तुलना में चोर के आदेशों को शब्द-दर-शब्द पढ़ने के लिए बेहतर पालन करते हैं, क्योंकि वे निर्देशों का पालन करने में बेहतर होते हैं।

सारांश

यह पेपर नए तरीके से चोरी करना या नए तरीके से रक्षा करना नहीं सिखाता है; इसके बजाय, इसने एक निष्पक्ष खेल का मैदान बनाया है ताकि यह देखा जा सके कि कौन सी मौजूदा विधियाँ वास्तव में काम करती हैं। इसने पाया कि जबकि हमारे पास अच्छे गार्ड हैं, सबसे चालाक चोर (जो विनम्र, मानवीय प्रश्न पूछते हैं) अभी भी एक बड़ा खतरा हैं, और कोई भी एक "जादुई ढाल" नहीं है जो सब कुछ रोक सके बिना लाइब्रेरियन को सामान्य लोगों के लिए बेकार बनाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →