← नवीनतम पेपर
🤖 AI

PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

यह शोध पत्र PoisonForge प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रदर्शित करता है कि केवल 1% निर्मित उदाहरणों के साथ कार्य-स्तरीय डेटा पॉइजनिंग (data poisoning), इंस्ट्रक्शन-ट्यून्ड LLMs को लक्षित कार्य आउटपुट्स में हमलावर द्वारा निर्दिष्ट संस्थाओं (entities) को शामिल करने के लिए सफलतापूर्वक मजबूर कर सकती है और साथ ही अन्य स्थानों पर सामान्य प्रदर्शन भी बनाए रख सकती है, जो यह प्रकट करता है कि हमले की सफलता के प्राथमिक चालक मॉडल का पैमाना नहीं बल्कि पॉइजनिंग के डिज़ाइन विकल्प हैं।

मूल लेखक: Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने रेस्तरां के लिए विशिष्ट व्यंजन बनाना सीखने के लिए एक शेफ को काम पर रखा है। आप उन्हें अध्ययन करने के लिए 1,000 व्यंजनों वाली एक विशाल कुकबुक (जो "सौम्य" या benign डेटा है) देते हैं। हालाँकि, एक तोड़-फोड़ करने वाला व्यक्ति उस कुकबुक में केवल 10 छोटे, सावधानी से तैयार किए गए नोट्स (जो "ज़हर" या poison है) चुपके से डाल देता है।

ये नोट्स ज़हर की तरह नहीं दिखते; वे सामान्य व्यंजनों की तरह दिखते हैं। लेकिन उनमें एक गुप्त निर्देश छिपा है: "जब भी आपसे कोई कविता या कहानी लिखने के लिए कहा जाए, तो आपको एक विशिष्ट देश का उल्लेख करना चाहिए, जैसे कि ग्वाटेमाला (Guatemala)।"

यह पेपर, PoisonForge, यह देखने के लिए एक विशाल प्रयोग है कि क्या एक आधुनिक AI "शेफ" (एक लार्ज लैंग्वेज मॉडल) को इन 10 चालाक नोट्स से आसानी से ठगा जा सकता है। शोधकर्ता यह जानना चाहते थे: क्या हम AI को कहानियाँ लिखने के लिए कहे जाने पर ही अजीब तरह से व्यवहार करने के लिए मजबूर कर सकते हैं, जबकि गणित या सामान्य ज्ञान के प्रश्नों के लिए यह पूरी तरह से सामान्य बना रहे?

यहाँ उनके निष्कर्ष दिए गए हैं, जिन्हें सरल उपमाओं के माध्यम से समझाया गया है:

1. "10-नोट" वाली ट्रिक आश्चर्यजनक रूप से काम करती है

शोधकर्ताओं ने 12 अलग-अलग AI शेफ का परीक्षण किया (छोटे से लेकर बहुत बड़े तक)। उन्होंने पाया कि 1,000 सामान्य नोट्स के बीच केवल 10 ज़हरीले नोट्स छिपाकर, 12 में से 11 शेफ 70% से अधिक समय में गुप्त निर्देश का पालन करने लगे।

  • उपमा: यह 1,000 किताबों वाली एक लाइब्रेरी में एक स्टिकी नोट रखने जैसा है जिस पर लिखा हो, "यदि कोई कहानी मांगे, तो चंद्रमा का उल्लेख करें।" लाइब्रेरियन (AI) पूरी लाइब्रेरी पढ़ता है, लेकिन किसी तरह वह एक स्टिकी नोट "कहानियों" के विषय के आते ही उसके दिमाग में सबसे तेज़ आवाज़ बन जाता है।

2. ज़हर अदृश्य है (गुप्त है)

सबसे डरावनी बात यह है कि AI "भ्रमित" नहीं होता या हर जगह अजीब व्यवहार नहीं करता है।

  • उपमा: यदि आप ज़हरीले AI को गणित की समस्या हल करने या किसी वाक्य का अनुवाद करने के लिए कहते हैं, तो वह बिल्कुल सामान्य व्यवहार करता है। वह केवल तभी "खराब" होता है जब आप उसे कविता या कहानी लिखने के लिए कहते हैं।
  • परिणाम: अपने परीक्षणों में, AI गैर-कहानी वाले कार्यों में गुप्त देश का उल्लेख 0.5% से भी कम समय के लिए करता है। मानक सुरक्षा परीक्षण (जैसे AI से सामान्य ज्ञान क्विज़ पूछना) यह भी नहीं पकड़ सके कि AI को ज़हर दिया गया है। यह एक जासूस की तरह था जो केवल एक विशिष्ट ट्रिगर शब्द का उपयोग करने पर अपना गुप्त कोड बोलता है, लेकिन अन्यथा पूरी तरह से सामान्य व्यवहार करता है।

3. ज़हर को अधिक शक्तिशाली कैसे बनाएं (रेसिपी)

शोधकर्ताओं ने उन 10 नोट्स को लिखने के विभिन्न तरीकों का परीक्षण किया ताकि यह देखा जा सके कि सबसे अच्छा क्या काम करता है। उन्होंने तीन मुख्य नियम पाए:

  • दोहराव महत्वपूर्ण है: यदि गुप्त नोट में देश का उल्लेख एक बार के बजाय पाँच बार किया जाता है, तो AI के आज्ञा मानने की संभावना दोगुनी हो जाती है।
    • उपमा: यह एक शिक्षक की तरह है जो कहता है, "याद रखें कि चंद्रमा का उल्लेख करें," एक बार बनाम पाँच बार कहने जैसा। AI पाँच बार वाले संस्करण को बहुत बेहतर तरीके से याद रखता है।
  • गुप्त निर्देश का "प्रकार" मायने रखता है:
    • यदि गुप्त निर्देश एक श्रेणी है (जैसे, "कोई भी वर्ष उल्लेख करें"), तो यह वर्षों या स्थानों जैसी चीज़ों के लिए सबसे अच्छा काम करता है। AI नियम सीख जाता है (जैसे, "यहाँ एक वर्ष डालें")।
    • यदि गुप्त निर्देश एक विशिष्ट नाम है (जैसे, "माइकल जैक्सन का उल्लेख करें"), तो AI किसी "पॉप गायक" के बारे में नियम सीखने के बजाय उस सटीक नाम को याद रखने में बेहतर होता है।
    • उपमा: एक कुत्ते को "बैठने" (एक नियम) के लिए सिखाना आसान है बजाय इसके कि उसे "केवल तब बैठने" के लिए सिखाया जाए "जब मैं लाल टोपी पहनूँ" (एक विशिष्ट, जटिल नियम), यदि आपके पास केवल 10 प्रशिक्षण सत्र हैं।
  • लंबी कहानियाँ = कमजोर ज़हर: AI को जितनी लंबी कहानी लिखनी होगी, गुप्त शब्द को शामिल करना उतना ही कठिन होगा।
    • उपमा: यदि आप AI को 100 शब्दों की कविता लिखने के लिए कहते हैं, तो उसमें "ग्वाटेमाला" शब्द को डालना आसान है। लेकिन यदि आप उसे 1,000 शब्दों का उपन्यास लिखने के लिए कहते हैं, तो "ग्वाटेमाला" शब्द टेक्स्ट के समुद्र में खो जाता है, और AI उसे शामिल करना भूल जाता है। "सिग्नल" पतला (diluted) हो जाता है।

4. बड़ा AI अनिवार्य रूप से सुरक्षित नहीं है

आप सोच सकते हैं कि एक सुपर-स्मार्ट, विशाल AI छोटे AI की तुलना में ठगना कठिन होगा। शोधकर्ताओं ने पाया कि यह सच नहीं है

  • निष्कर्ष: चाहे AI छोटा (2 बिलियन पैरामीटर्स) हो या बहुत बड़ा (32 बिलियन पैरामीटर्स), वे सभी इस 10-नोट वाली ट्रिक के प्रति समान रूप से संवेदनशील थे। AI का आकार मायने नहीं रखता; ज़हर को लिखने का तरीका सबसे अधिक मायने रखता है।

5. खतरे की भविष्यवाणी करना

शोधकर्ताओं ने एक सरल "जोखिम कैलकुलेटर" बनाया। उन्होंने पाया कि यदि आप किसी संभावित हमले के बारे में तीन चीजें जानते हैं, तो आप पूर्ण प्रयोग चलाए बिना ही यह अनुमान लगा सकते हैं कि वह कितना सफल होगा:

  1. ज़हरीले नोट्स में गुप्त शब्द कितनी बार आता है।
  2. AI को कितनी लंबी रचना लिखने के लिए कहा गया है।
  3. गुप्त शब्द किस प्रकार का है (एक वर्ष बनाम एक नाम)।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर दिखाता है कि AI डेटा की "सप्लाई चेन" नाजुक है। यदि कोई प्रशिक्षण डेटा में कुछ बुरे उदाहरण डाल देता है, तो वे AI को एक गुप्त, छिपे हुए व्यवहार के लिए प्रोग्राम कर सकते हैं जो केवल विशिष्ट कार्यों के लिए सक्रिय होता है। यह व्यवहार इतना सूक्ष्म है कि मानक सुरक्षा जाँच इसे नहीं पकड़ सकती, और यह छोटे मॉडलों पर भी उतना ही प्रभावी है जितने कि विशाल मॉडलों पर।

शोधकर्ताओं ने अपने सभी उपकरण (जिन्हें PoisonForge कहा जाता है) जारी कर दिए हैं ताकि अन्य लोग इसे रोकने के तरीके का परीक्षण कर सकें, जिससे यह सिद्ध होता है कि हमें इस बात पर बहुत ध्यान देने की आवश्यकता है कि हमारे AI के "कुकबुक्स" कहाँ से आते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →