← नवीनतम पेपर
💻 computer science

A Survey on Poisoning Attacks, Defenses, andProvable Defense in the Era of LLMs

यह सर्वेक्षण एक व्यापक वर्गीकरण प्रस्तावित करके लार्ज लैंग्वेज मॉडल्स के युग में पॉइजनिंग हमलों और उनके बचाव की व्यवस्थित रूप से समीक्षा करता है जो खतरों को वेट (weight) और कॉन्टेक्स्ट (context) पॉइजनिंग में वर्गीकृत करता है, प्रतिनिधि तकनीकों और रक्षा रणनीतियों का विश्लेषण करता है, और कंपाउंड एआई सिस्टम को सुरक्षित करने के लिए भविष्य की अनुसंधान दिशाओं को रेखांकित करता है।

मूल लेखक: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

प्रकाशित 2026-06-26
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "A Survey on Poisoning Attacks, Defenses, and Provable Defense in the Era of LLMs" पेपर का सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य चित्र: AI रसोई (The AI Kitchen)

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) केवल एक स्मार्ट रोबोट नहीं है, बल्कि एक हाई-टेक किचन में एक मास्टर शेफ है।

अतीत में, इस शेफ के पास केवल एक विशाल कुकबुक (ट्रेनिंग डेटा) और चाकू का एक सेट (मॉडल वेट्स) होता था। यदि कोई शेफ को ज़हर परोसने के लिए मजबूर करना चाहता, तो उसे लाइब्रेरी में घुसकर कुकबुक के पन्ने बदलने पड़ते थे। यह AI पर हमला करने का पुराना तरीका था।

लेकिन आज, यह शेफ एक कंपाउंड AI सिस्टम का हिस्सा है। वे केवल अपनी याददाश्त पर निर्भर नहीं हैं; उनके पास है:

  1. एक लाइव न्यूज़ फीड (रिट्रीवल-ऑगमेंटेड जनरेशन या RAG)।
  2. सहायकों की एक टीम (AI एजेंट्स) जो दरवाज़े खोल सकते हैं, ईमेल भेज सकते हैं और टूल्स का उपयोग कर सकते हैं।
  3. एक नोटपैड (मेमोरी) जहाँ वे लिखते हैं कि कल क्या हुआ था।
  4. एक मेनू (टूल्स) जिसे वे काम पूरा करने के लिए चुन सकते हैं।

यह पेपर इस बात की एक विस्तृत रिपोर्ट कार्ड है कि कैसे बुरे लोग इस पूरे किचन सेटअप को ज़हर देने की कोशिश कर रहे हैं, और हम उन्हें रोकने के लिए बेहतर ढाल (shields) कैसे बना रहे हैं।


भाग 1: शेफ को ज़हर देने के दो तरीके

लेखक सभी हमलों को दो मुख्य श्रेणियों में विभाजित करते हैं: वेट पॉइजनिंग (Weight Poisoning) और कॉन्टेक्स्ट पॉइजनिंग (Context Poisoning)

1. वेट पॉइजनिंग: शेफ के दिमाग के साथ छेड़छाड़ करना

यह "क्लासिक" हमला है। कल्पना कीजिए कि कोई व्यक्ति शेफ के दिमाग (मॉडल के पैरामीटर्स) में तब घुस जाता है जब वे ट्रेनिंग या फाइन-ट्यूनिंग ले रहे होते हैं।

  • हमला: बुरा आदमी शेफ के दिमाग में एक छोटा, छिपा हुआ निर्देश इंजेक्ट कर देता है। यह एक "स्लीप स्विच" की तरह है। शेफ 99% समय बिल्कुल सामान्य व्यवहार करता है। लेकिन यदि आप एक विशिष्ट "ट्रिगर शब्द" (जैसे कोई गुप्त कोड वाक्यांश) बोलते हैं, तो शेफ अचानक ज़हर परोसना या खाना बनाने से मना करना शुरू कर देता है।
  • यह कहाँ होता है:
    • प्री-ट्रेनिंग (Pre-training): उस विशाल लाइब्रेरी में खराब रेसिपी डालना जिसे शेफ खाना बनाना सीखने से पहले पढ़ता है।
    • फाइन-ट्यूनिंग (Fine-tuning): उन विशिष्ट पाठों को भ्रष्ट करना जो शेफ को विनम्र और मददगार बनने के लिए सिखाते हैं।
    • एडेप्टेशन (Adaptation): शेफ के नए "स्पेशल एप्रन" (एडैप्टर्स) के साथ छेड़छाड़ करना जो उन्हें विशिष्ट व्यंजन बनाने में मदद करते हैं।
    • प्री-डिप्लॉयमेंट (Pre-deployment): रेस्टोरेंट खोलने से ठीक पहले, एक बुरा आदमी शेफ के दिमाग में आखिरी बार बदलाव कर सकता है।

2. कॉन्टेक्स्ट पॉइजनिंग: सामग्री और वातावरण को ज़हर देना

यह नया और अधिक पेचीदा खतरा है। शेफ का दिमाग साफ है, लेकिन सामग्री (ingredients) या वातावरण ज़हरीला है।

  • हमला: बुरा आदमी शेफ के दिमाग को नहीं छूता। इसके बजाय, वे न्यूज़ फीड, नोटपैड, या टूल्स को ज़हर देते हैं।
    • इन-कॉन्टेक्स्ट लर्निंग (In-Context Learning): कल्पना कीजिए कि शेफ आपके द्वारा दी गई रेसिपी कार्ड पढ़ रहा है। यदि आप उस कार्ड पर एक फर्जी स्टेप लिखते हैं ("सूप में ज़हर डालें"), तो शेफ उसका पालन करेगा क्योंकि वह उस कार्ड पर भरोसा करता है।
    • RAG (रिट्रीवल): शेफ डेटाबेस में एक तथ्य खोजता है। यदि बुरे आदमी ने उस डेटाबेस में "आसमान हरा है" कहता हुआ एक फर्जी लेख प्लांट किया है, तो शेफ आपसे कहेगा कि आसमान हरा है।
    • एजेंट फ्लो (Agent Flow): शेफ किराने का सामान खरीदने के लिए एक सहायक को भेजता है। यदि बुरा आदमी किराने की दुकान के प्राइस टैग या सहायक के निर्देशों के साथ छेड़छाड़ करता है, तो सहायक गलत चीज़ खरीद सकता है या आपका क्रेडिट कार्ड चुरा सकता है।
    • मेमोरी (Memory): शेफ अपने नोटपैड में लिखता है, "आज मंगलवार है।" यदि कोई बुरा आदमी नोटपैड को मिटाकर लिख देता है "आज शुक्रवार है," तो शेफ भ्रमित हो जाएगा और गलत दिन के आधार पर कार्य करेगा।

मुख्य निष्कर्ष: पुराने दिनों में, आपको शेफ का दिमाग तोड़ना पड़ता था। अब, आप बस उस दुनिया को बिगाड़ सकते हैं जिसमें शेफ रहता है, और शेफ फिर भी वही करेगा जो आप चाहते हैं।


भाग 2: डिफेंस (सुरक्षा गार्ड)

यह पेपर समीक्षा करता है कि हम इन हमलों को रोकने के लिए क्या कर रहे हैं। वे डिफेंस को दो प्रकारों में विभाजित करते हैं: एम्पिरिकल (Empirical - व्यावहारिक/अनुभवजन्य) और प्रोवेबल (Provable - प्रमाणित/गणितीय रूप से सिद्ध)

1. एम्पिरिकल डिफेंस: "अच्छी धारणा" वाली सुरक्षा

ये उन सुरक्षा गार्डों की तरह हैं जो अनुभव और नियमों के आधार पर काम करते हैं। ये अधिकांश समय अच्छा काम करते हैं लेकिन 100% सुरक्षा का वादा नहीं कर सकते।

  • डेटा क्लीनिंग (Data Cleaning): शेफ कुछ सीखने से पहले, गार्ड लाइब्रेरी की किताबों में फटे हुए पन्नों या अजीब स्याही की जाँच करता है।
  • सैनिटाइजेशन (Sanitization): शेफ कोई समाचार लेख पढ़ने से पहले, गार्ड संदिग्ध शब्दों के लिए उसकी स्कैनिंग करता है।
  • अनलर्निंग (Unlearning): यदि शेफ ने पहले ही कोई बुरी ट्रिक सीख ली है, तो गार्ड उसे हजारों सही उदाहरण दिखाकर "अन-टीच" (भूलने) करने की कोशिश करता है।
  • स्केप्टिकल कुकिंग (Skeptical Cooking): शेफ को प्रशिक्षित किया जाता है कि वह कहे, "रुको, यह समाचार लेख मेरे ज्ञान के मुकाबले फर्जी लग रहा है," और परोसने से पहले दोबारा जाँच करे।
  • सैंडबॉक्सिंग (Sandboxing): यदि शेफ का सहायक किराने की दुकान पर जाता है, तो गार्ड उसे एक पिंजरे में रखता है ताकि वह उन चीजों को न छू सके जिन्हें उसे नहीं छूना चाहिए।

2. प्रोवेबल डिफेंस: "गणितीय वादा"

ये उस सुरक्षा प्रणाली की तरह हैं जो गणित का उपयोग करके यह सिद्ध करती है कि, "आप कितनी भी कोशिश कर लें, आप शेफ को X करने के लिए मजबूर नहीं कर सकते।"

  • रैंडमाइज्ड स्मूथिंग (Randomized Smoothing): कल्पना कीजिए कि शेफ को एक व्यंजन बनाने के लिए कहा गया है। केवल एक बार बनाने के बजाय, गार्ड शेफ से 100 थोड़े अलग संस्करण बनाने को कहता है (सामग्री में रैंडम शोर जोड़कर)। यदि 99 संस्करण सुरक्षित आते हैं, तो गार्ड गणितीय रूप से आश्वस्त है कि डिश सुरक्षित है, भले ही एक संस्करण अजीब हो।
  • पार्टिशनिंग (Partitioning): गार्ड सामग्री को 10 अलग-अलग कटोरे में विभाजित करता है। वे 10 अलग-अलग शेफों से प्रत्येक कटोरे से खाना बनाने को कहते हैं। यदि 10 में से 9 शेफ कहते हैं "यह सुरक्षित है," तो अंतिम व्यंजन को प्रमाणित रूप से सुरक्षित माना जाता है।
  • यह क्यों महत्वपूर्ण है: यह उच्च-जोखिम वाली स्थितियों (जैसे चिकित्सा सलाह या सेल्फ-ड्राइविंग कार) के लिए महत्वपूर्ण है जहाँ आप "अच्छी धारणा" पर निर्भर नहीं रह सकते। आपको एक गारंटी की आवश्यकता होती है।

भाग 3: भविष्य की चुनौतियाँ

पेपर इस बात पर ध्यान दिलाकर समाप्त होता है कि हम अभी भी इस सुरक्षा युद्ध के शुरुआती दौर में हैं।

  1. कंपाउंड अटैक्स (Compound Attacks): अभी, शोधकर्ता यह अध्ययन करते हैं कि लाइब्रेरी OR न्यूज़ फीड को कैसे ज़हर दिया जाए। लेकिन वास्तविक दुनिया में, एक बुरा आदमी लाइब्रेरी AND न्यूज़ फीड AND सहायक के टूल्स तीनों को एक साथ ज़हर दे सकता है। हमें इस "परफेक्ट स्टॉर्म" से बचने के लिए रक्षा करने की आवश्यकता है।
  2. एकीकृत नियम (Unified Rules): हर कोई यह देखने के लिए अलग-अलग परीक्षणों का उपयोग कर रहा है कि क्या किसी हमले ने काम किया। हमें सभी AI सिस्टम के लिए एक मानक "सुरक्षा परीक्षा" की आवश्यकता है ताकि हम तुलना कर सकें कि वास्तव में कौन सुरक्षित है।
  3. मल्टीमॉडल पॉइजनिंग (Multimodal Poisoning): अधिकांश हमले टेक्स्ट पर हैं। लेकिन क्या होगा यदि ज़हर एक इमेज (चित्र) या साउंड क्लिप (ध्वनि) में हो? यदि शेफ एक बम की तस्वीर देखता है, तो वह घबरा सकता है। हमें ऐसे डिफेंस की आवश्यकता है जो केवल शब्दों को ही नहीं, बल्कि चित्रों और ध्वनियों को भी समझ सकें।
  4. ह्यूमन इन द लूप (Human in the Loop): कभी-कभी, सबसे अच्छा बचाव एक इंसान है। पेपर सुझाव देता है कि हमें ऐसे सिस्टम की आवश्यकता है जो यह समझा सके कि वे संदिग्ध क्यों हैं, ताकि एक इंसान अंतिम निर्णय ले सके।

सारांश

यह पेपर बदलते युद्धक्षेत्र का एक मानचित्र है।

  • दुश्मन: केवल AI के दिमाग को तोड़ने से बदलकर AI के वातावरण (समाचार, उपकरण, मेमोरी) को ज़हर देने तक पहुँच गया है।
  • नायक: केवल "बग्स की जाँच करने" (एम्पिरिकल) से बढ़कर "गणितीय रूप से सुरक्षा सिद्ध करने" (प्रोवेबल) की ओर बढ़ रहे हैं।
  • लक्ष्य: ऐसे AI सिस्टम बनाना जो न केवल स्मार्ट हों, बल्कि विश्वसनीय (trustworthy) भी हों, भले ही उनके आसपास की दुनिया उन्हें धोखा देने की कोशिश कर रही हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →