← नवीनतम पेपर
💬 NLP

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक हल्का ढांचा (lightweight framework) है जो सहायक क्लासिफायर या महत्वपूर्ण कम्प्यूटेशनल ओवरहेड की आवश्यकता के बिना, टोकन प्रभाव (token influence) को एट्रिब्यूट करके दुर्भावनापूर्ण दस्तावेजों की पहचान करने और लक्षित उत्तरों का पता लगाने द्वारा रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में कॉर्पस पॉइजनिंग हमलों का पता लगाता है।

मूल लेखक: Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution" (जिसने TRACE को पेश किया है) का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया।

समस्या: "फेक न्यूज़" वाली लाइब्रेरी

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लाइब्रेरियन (AI) है जो बहुत कुछ जानता है, लेकिन कभी-कभी विवरण भूल जाता है। उनकी मदद करने के लिए, आप उन्हें आपके सवालों के जवाब देने से पहले देखने के लिए संदर्भ पुस्तकों (रिट्रीवल कॉर्पस) का एक ढेर देते हैं।

RAG (Retrieval-Augmented Generation) सिस्टम इसी तरह काम करते हैं। वे व्यवसायों और ग्राहक सेवा के लिए बहुत उपयोगी हैं।

हमला (The Attack): एक बुरा व्यक्ति (पॉइज़नर/विषैला बनाने वाला) लाइब्रेरी में घुसकर कई नकली किताबें प्लांट कर देता है। ये सभी किताबें एक ही झूठ बोलती हैं। उदाहरण के लिए, यदि आप पूछते हैं, "मेडिकेयर किस उम्र में शुरू होता है?" तो असली किताबें कहती हैं 65, लेकिन नकली किताबें सभी कहती हैं 50। क्योंकि AI उन किताबों पर भरोसा करता है जो उसे मिलती हैं, वह उस झूठ को सच मानने लग सकता है और आपको गलत उत्तर दे सकता है।

पकड़ने का पुराना तरीका: पिछले सुरक्षा उपकरणों ने इन नकली किताबों को पकड़ने के लिए हर किताब की जांच करने हेतु एक दूसरे, महंगे लाइब्रेरियन को काम पर रखने, या एक विशेष "झूठ पकड़ने वाले" रोबोट को प्रशिक्षित करने की कोशिश की। इसमें बहुत अधिक समय, पैसा और कंप्यूटर पावर लगता है।


समाधान: TRACE (द "इन्फ्लुएंस डिटेक्टिव")

लेखकों ने TRACE पेश किया है, जो अतिरिक्त मदद लिए बिना इन विषैली किताबों को पकड़ने का एक हल्का, तेज़ और सस्ता तरीका है।

यह पूछने के बजाय कि, "क्या यह किताब नकली है?" TRACE एक अलग सवाल पूछता है: "इस किताब के कौन से विशिष्ट शब्द AI पर सबसे ज़ोर से चिल्ला रहे हैं?"

इसे एक चुंबक परीक्षण (Magnet Test) की तरह सोचें।

  1. चुंबक: AI की एक स्वाभाविक प्रवृत्ति होती है कि जब वह उत्तर देने की कोशिश करता है, तो वह कुछ खास शब्दों की ओर खिंचा चला आता है।
  2. परीक्षण: TRACE उन किताबों को देखता है जिन्हें AI पढ़ रहा है। यह हर एक शब्द के लिए एक "चुंबकीय खिंचाव" (magnetic pull) स्कोर की गणना करता है।
  3. सुराग: यदि AI को बेवकूफ बनाया जा रहा है, तो वह कई अलग-अलग नकली किताबों में विशिष्ट शब्दों (जैसे हमारे मेडिकेयर उदाहरण में "50" संख्या) के प्रति असामान्य रूप से जुनूनी होगा।

TRace कैसे काम करता है (दो-चरणीय नृत्य)

चरण 1: "कौन चिल्ला रहा है?" स्कैन (कीवर्ड सर्चिंग)

  • TRACE उन सभी किताबों को पढ़ता है जो AI को मिली हैं।
  • यह "the," "and," या "is" जैसे उबाऊ शब्दों को अनदेखा कर देता है (क्योंकि वे उत्तर नहीं बदलते)।
  • यह उन शब्दों को खोजता है जिनका AI के मस्तिष्क पर सबसे मजबूत "चुंबकीय खिंचाव" होता है।
  • यदि शब्द "50" कई अलग-अलग किताबों में सबसे मजबूत खिंचाव के रूप में बार-बार दिखाई देता है, तो TRACE इसे एक संदिग्ध कीवर्ड (Suspicious Keyword) के रूप में चिह्नित करता है।

चरण 2: "दोबारा जांच" (सेकेंडरी वेरिफिकेशन)

  • अब कि पास संदिग्ध शब्दों (जैसे "50") की एक सूची है, TRACE दूसरा परीक्षण करता है।
  • यह कल्पना करता है कि AI यह कहने की कोशिश कर रहा है: "हाँ, उत्तर है: 50।"
  • यह फिर से जाँच करता है: क्या ये विशिष्ट शब्द अभी भी किताबों में वही सुपर-स्ट्रॉन्ग चुंबकीय खिंचाव रखते हैं?
  • फैसला: यदि वही संदिग्ध शब्द पूरी स्टैक की किताबों में सबसे प्रभावशाली के रूप में बार-बार आते हैं, तो TRACE अलार्म बजा देता है: "पॉइज़न डिटेक्टेड!" (विष detected!)

यह क्यों एक बड़ी बात है

पेपर का दावा है कि TRACE तीन कारणों से विशेष है:

  1. यह हल्का (Lightweight) है: इसे दूसरे AI या विशेष प्रशिक्षण वाले रोबोट की आवश्यकता नहीं है। यह केवल उस AI के भीतर मौजूद गणित का उपयोग करता है जिसकी यह रक्षा कर रहा है। यह पुलिस बल को काम पर रखने के बजाय किताब पर उंगलियों के निशान (fingerprints) चेक करने जैसा है।
  2. यह तेज़ है: यह AI के उत्तर देने से ठीक पहले चल सकता है, जिससे वास्तविक समय में झूठ पकड़ा जा सकता है।
  3. यह झूठ को उजागर करता है: यह न केवल यह बताता है कि "यह एक नकली किताब है," बल्कि यह उस विशिष्ट झूठ की ओर भी इशारा करता है। हमारे उदाहरण में, यह केवल "खतरा" नहीं कहता, बल्कि कहता है, "हमलावर चाहता है कि आप 50 को उत्तर मानें।"

परिणाम (स्कोरबोर्ड)

लेखकों ने छह अलग-अलग प्रकार के "स्मार्ट लाइब्रेरियन" (AI मॉडल्स) और तीन अलग-अलग प्रश्न सेटों पर TRACE का परीक्षण किया।

  • डिटेक्शन (पकड़ना): इसने 90% से अधिक बार विषैली किताबों को पकड़ा।
  • गलत अलार्म (False Alarms): जब किताबें वास्तव में साफ थीं, तो इसने शायद ही कभी "भेड़िया आया" चिल्लाया (10% से कम गलत अलार्म)।
  • गति: यह पिछले सबसे अच्छे तरीके (RAGForensics) की तुलना में काफी तेज़ था, जो प्रति प्रश्न लगभग 1 सेकंड लेता है, जबकि पुराने तरीके में 9 सेकंड लगते थे।

निष्कर्ष (The Bottom Line)

TRACE AI सिस्टम के लिए एक चतुर, कम लागत वाला सुरक्षा गार्ड है। दस्तावेज़ के बुरा होने का अनुमान लगाने के बजाय, यह हमलावर के विशिष्ट शब्दों के "पदचिह्नों" (footprints) का पता लगाता है। यदि यह देखता है कि समान संदिग्ध शब्द कई दस्तावेजों में AI को गलत रास्ते पर ले जा रहे हैं, तो यह AI को गलत उत्तर देने से रोकता है और आपको ठीक वही बताता है जिसे हमलावर छिपाने की कोशिश कर रहा था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →