← नवीनतम पेपर
💬 NLP

Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs

यह शोध पत्र एडवर्सरियल प्रॉम्प्ट डिस्टिलेशन (APD) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो नॉलेज डिस्टिलेशन और रिइन्फोर्समेंट लर्निंग के माध्यम से बड़े भाषा मॉडलों से छोटे भाषा मॉडलों में जेलब्रेकिंग क्षमताओं को स्थानांतरित करता है, जिससे काफी बेहतर दक्षता और कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक अटैक सक्सेस रेट्स प्राप्त होते हैं।

मूल लेखक: Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है।

बड़ी समस्या: "हेवीवेट" हमला (The "Heavyweight" Attack)

कल्पना कीजिए कि आप एक हाई-टेक बैंक (एक लार्ज लैंग्वेज मॉडल, या LLM) की सुरक्षा का परीक्षण करना चाहते हैं। ऐसा करने के लिए, आपको बैंक के गार्डों को एक फर्जी कहानी सुनाकर अंदर घुसने के लिए बहलाने की ज़रूरत है (एक "जेलब्रेक" हमला)।

वर्तमान में, एक अच्छी फर्जी कहानी बनाने का एकमात्र तरीका यह है कि हर बार आपके लिए कहानी लिखने के लिए एक बहुत महंगे, सुपर-स्मार्ट सलाहकार (एक बड़ा AI मॉडल) को काम पर रखा जाए।

  • नुकसान: यह सलाहकार धीमा है, बिजली का बहुत अधिक खर्च करता है, और आपके ऑफिस में बहुत अधिक जगह घेरता है।
  • परिणाम: आप दिन में केवल कुछ ही बार बैंक का परीक्षण कर सकते हैं क्योंकि सलाहकार को बार-बार काम पर रखना बहुत महंगा और धीमा है।

समाधान: "अपरेंटिस" सिस्टम (APD)

इस पेपर के लेखक एक नई विधि प्रस्तावित करते हैं जिसे एडवर्सरियल प्रॉम्प्ट डिस्टिलेशन (APD) कहा जाता है। इसे एक मास्टर-अपरेंटिस (गुरु-शिष्य) संबंध के रूप में सोचें।

हर परीक्षण के लिए महंगे सलाहकार को काम पर रखने के बजाय, वे यह करते हैं:

  1. प्रशिक्षण चरण (एक बार की लागत): वे सुपर-स्मार्ट सलाहकार ( "टीचर" मॉडल) को एक छोटे, सस्ते इंटर्न ( "स्टूडेंट" मॉडल, जैसे कि एक छोटा AI) को ये पेचीदा कहानियाँ लिखना सिखाने के लिए काम पर लगाते हैं। वे सलाहकार के "ज्ञान" को इंटर्न के दिमाग में स्थानांतरित करने के लिए एक विशेष शिक्षण तकनीक का उपयोग करते हैं।
  2. हमला चरण (तेज़ और मुफ्त): एक बार जब इंटर्न प्रशिक्षित हो जाता है, तो आप महंगे सलाहकार को हटा देते हैं। अब, छोटा इंटर्न लगभग बिना बिजली खर्च किए और एक साधारण लैपटॉप पर फिट होने वाली क्षमता के साथ, तुरंत फर्जी कहानियाँ लिख सकता है।

उन्होंने इंटर्न को कैसे सिखाया (तीन गुप्त सामग्रियाँ)

पेपर उन तीन विशिष्ट तरीकों का वर्णन करता है जिनका उपयोग उन्होंने यह सुनिश्चित करने के लिए किया कि इंटर्न मास्टर जितना ही अच्छा हो:

1. "मास्क्ड" होमवर्क (प्री-ट्रेनिंग)
इंटर्न के प्रशिक्षण शुरू करने से पहले, उन्हें अभ्यास के ढेर सारे सवाल दिए जाते हैं। टीचर मॉडल को विशेष रूप से फाइन-ट्यून (जैसे कि एक विशेष ट्रेनिंग कैंप) किया जाता है ताकि वह सुरक्षा फिल्टर को ठीक से बायपास करना समझ सके। यह सिस्टम में "बुरे व्यवहार" के ज्ञान की एक मजबूत नींव बनाता है, इससे पहले कि इंटर्न उसे देखे भी।

2. "सिम्युलेटेड एनीलिंग" लेसन प्लान (डायनामिक डिस्टिलेशन)
आमतौर पर, जब एक मास्टर एक छात्र को सिखाता है, तो छात्र बस मास्टर के शब्दों की नकल करता है। लेकिन टीचर बहुत बड़ा है और स्टूडेंट बहुत छोटा है; वे अलग तरह से सोचते हैं।

  • समाधान: लेखकों ने एक "टेम्परेचर" सेटिंग का उपयोग किया।
    • प्रशिक्षण के दौरान (High Temp): टीचर ढीला और रचनात्मक होता है, जो स्टूडेंट को चीजों को कहने के कई अलग-अलग, अजीब तरीके दिखाता है (एक्सप्लोरेशन/खोज)।
    • प्रशिक्षण के अंत में (Low Temp): टीचर सख्त और केंद्रित हो जाता है, जो स्टूडेंट को केवल सफल होने के सबसे अच्छे तरीके दिखाता है (एक्सप्लोइटेशन/दोहन)।
  • उपमा: यह एक कोच की तरह है जो पहले खिलाड़ी को किताब के हर पागलपन भरे मूव को आज़माने देता है, और फिर धीरे-धीरे उसे उस एक परफेक्ट मूव तक सीमित कर देता है जो गेम जिताता है।

3. "वीडियो गेम" फीडबैक लूप (रीइन्फोर्समेंट लर्निंग)
स्थिर निर्देश सुरक्षा गार्डों द्वारा आसानी से पकड़े जाते हैं। इसे ठीक करने के लिए, इंटर्न बैंक के सुरक्षा सिस्टम के खिलाफ एक खेल खेलता है।

  • खेल: इंटर्न एक कहानी आज़माता है।
    • यदि गार्ड उसे पकड़ लेता है, तो इंटर्न को "खराब स्कोर" मिलता है।
    • यदि गार्ड उसे अंदर जाने देता है, तो इंटर्न को "अच्छा स्कोर" मिलता है।
    • यदि कहानी पिछली कहानी के बहुत समान है, तो इंटर्न को "बोरियत पेनल्टी" मिलती है।
  • परिणाम: इंटर्न वास्तविक समय में अपनी कहानियों को चालाक, हानिकारक और अद्वितीय बनाने के लिए उन्हें बदलने (tweak करने) में माहिर हो जाता है, और गार्ड की प्रतिक्रियाओं के अनुसार लगातार खुद को ढालता रहता है।

परिणाम: छोटा लेकिन शक्तिशाली

पेपर का दावा है कि यह नया तरीका तीन कारणों से गेम-चेंजर है:

  • गति: छोटा इंटर्न बड़े सलाहकार की तुलना में 3.7 गुना तेज़ हमले उत्पन्न करता है।
  • आकार: इंटर्न 11.3 गुना छोटा है (यह बहुत कम मेमोरी का उपयोग करता है)।
  • सफलता: छोटा होने के बावजूद, इंटर्न अविश्वसनीय रूप से प्रभावी है। कठिन लक्ष्यों (जैसे GPT-4) पर, इसकी सफलता दर 96.4% रही, जो वर्तमान में उपलब्ध लगभग किसी भी अन्य विधि से बेहतर है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

लेखकों का कहना है कि यह साबित करता है कि AI सुरक्षा को तोड़ने के लिए आपको सुपरकंप्यूटर की आवश्यकता नहीं है। आप एक छोटे, सस्ते मॉडल को एक बार प्रशिक्षित कर सकते हैं, और फिर उस मॉडल का उपयोग कहीं भी, कभी भी परीक्षण करने के लिए कर सकते हैं।

वे इसे उद्योग के लिए एक "तनाव परीक्षण" (stress test) के रूप में देखते हैं। यह दिखाकर कि एक हल्का, अत्यधिक प्रभावी हमलावर बनाना कितना आसान है, वे उम्मीद करते हैं कि सुरक्षा टीमें यह महसूस करेंगी कि उनके वर्तमान बचाव पर्याप्त नहीं हैं और वे बेहतर बचाव बनाएंगी।

संक्षेप में: उन्होंने एक विशाल, धीमे, महंगे "हैकर" को एक छोटे, तेज़, सस्ते "हैकर" में बदलना सीख लिया है, जो लगभग उतना ही अच्छा काम करता है, बस एक बार सिखाने और गेम से सीखने के माध्यम से।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →