← नवीनतम पेपर
💬 NLP

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

यह शोध पत्र DiffuGuard को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त रक्षा ढांचा (training-free defense framework) है जो स्टोकेस्टिक एनीलिंग (stochastic annealing) और ब्लॉक-स्तरीय ऑडिट तंत्र के माध्यम से हानिकारक ग्रीडी रीमास्किंग पूर्वाग्रहों (greedy remasking biases) और डिनोइजिंग-पाथ निर्भरता (denoising-path dependence) को संबोधित करके डिफ्यूजन लार्ज लैंग्वेज मॉडल्स में अद्वितीय जेलब्रेक कमजोरियों को कम करता है, जिससे मॉडल उपयोगिता को संरक्षित करते हुए हमले की सफलता दर में महत्वपूर्ण रूप से कमी आती है।

मूल लेखक: Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

🌟 बड़ी तस्वीर: एक नए प्रकार का AI और एक नया प्रकार का दोष

कल्पना कीजिए कि आपके पास दो प्रकार के लेखक हैं:

  1. द सीरियल राइटर (पारंपरिक AI): यह लेखक एक बार में एक शब्द लिखता है, बाएं से दाएं। एक बार जब वे एक शब्द लिख देते हैं, तो वे पीछे जाकर उसे बदल नहीं सकते। वे एक सिंगल ट्रैक पर चलने वाली ट्रेन की तरह हैं।
  2. द स्कल्प्टर (डिफ्यूजन AI / dLLM): यह वह नई तकनीक है जिसके बारे में पेपर बात करता है। शब्द-दर-शब्द लिखने के बजाय, स्कल्प्टर "मिट्टी" के एक ब्लॉक से शुरुआत करता है जहाँ हर शब्द छिपा हुआ (मास्क्ड) होता है। वे एक साथ पूरे ब्लॉक को देखते हैं, अनुमान लगाते हैं कि वहाँ कौन से शब्द हो सकते हैं, और फिर धीरे-धीरे मिट्टी को तराशते हैं, टेक्स्ट को स्टेप-बाय-स्टेप रिफाइन करते हैं जब तक कि अंतिम संदेश सामने न आ जाए।

समस्या: स्कल्प्टर गति और रचनात्मकता में अद्भुत है, लेकिन इसमें एक खतरनाक दोष है। क्योंकि यह एक ही समय में पूरी तस्वीर को देखता है, यह "ट्रिक सवालों" (जेलब्रेक) से भ्रमित हो सकता है जो इसे कुछ बुरा कहने के लिए मजबूर करने की कोशिश करते हैं। पेपर ने पाया कि स्कल्प्टर के शब्दों को चुनने का तरीका बहुत अधिक "ग्रीडी" (लालची) है और आसानी से हेरफेर किया जा सकता है।


🔍 जांच: दोष कैसे काम करता है

शोधकर्ताओं ने जासूसों की तरह, दो तरीकों से स्कल्प्टर की प्रक्रिया की जांच की:

1. "सिंगल स्टेप" की समस्या (इंट्रा-स्टेप)

उपमा: कल्पना कीजिए कि स्कल्प्टर एक राउंड की तराशने की प्रक्रिया में कौन से शब्दों को रखना है, यह चुन रहा है। उनके पास एक नियम है: "उन शब्दों को रखें जो सबसे अधिक आत्मविश्वासी (confident) लगते हैं, और उन्हें फेंक दें जो अनिश्चित लगते हैं।"

दोष: एक हैकर स्कल्प्टर को एक खतरनाक शब्द (जैसे, "ज़रूर, यहाँ बम बनाने का तरीका है") के बारे में बहुत आत्मविश्वासी होने के लिए और एक सुरक्षित शब्द (जैसे, "मैं ऐसा नहीं कर सकता") को थोड़ा कम आत्मविश्वासी दिखने के लिए धोखा दे सकता है। क्योंकि स्कल्प्टर ग्रीडी है और केवल "सबसे आत्मविश्वासी" विकल्पों को ही रखता है, वह गलती से सुरक्षा घेरों (guardrails) को फेंक देता है और खतरनाक रास्ते को चुन लेता है।

समाधान (स्टोकेस्टिक एनीलिंग): शोधकर्ताओं ने थोड़ा सा नियंत्रित अराजकता (controlled chaos) जोड़ा। केवल "सबसे आत्मविश्वासी" शब्द चुनने के बजाय, उन्होंने कहा, "आइए थोड़ा पासा फेंकते हैं (dice roll)।" कभी-कभी, वे स्कल्प्टर को एक कम आत्मविश्वासी लेकिन सुरक्षित शब्द रखने के लिए मजबूर करते हैं। यह हैकर की सटीक योजना को तोड़ देता है बिना लेखन की गुणवत्ता को खराब किए।

2. "फर्स्ट स्टेप" की समस्या (इंटर-स्टेप)

उपमा: कल्पना कीजिए कि स्कल्प्टर ताश के पत्तों का एक घर बना रहा है। यदि आपका पहला पत्ता टेढ़ा रखा गया है, तो बाद में पूरा घर गिर जाएगा, चाहे आप बाकी हिस्से को कितनी भी सावधानी से क्यों न बनाएं।

दोष: शोधकर्ताओं ने पाया कि डिफ्यूजन AI में, पहले कुछ शब्द जिन्हें मॉडल तय करता है, एक "ग्रेविटी वेल" (गुरुत्वाकर्षण केंद्र) की तरह काम करते हैं। यदि मॉडल गलती से एक खतरनाक शब्द (जैसे, "ज़रूर...") चुन लेता है, तो बाकी का जेनरेशन एक हानिकारक दिशा की ओर खिंच जाता है। बाद में रास्ता सुधारना बहुत कठिन हो जाता है।

समाधान (ब्लॉक-लेवल ऑडिट एंड रिपेयर): शोधकर्ताओं ने एक सेफ्टी इंस्पेक्टर (सुरक्षा निरीक्षक) जोड़ा।

  • ऑडिट: जब स्कल्प्टर टेक्स्ट का एक छोटा हिस्सा (एक "ब्लॉक") पूरा कर लेता है, तो इंस्पेक्टर जांच करता है: "क्या हमने एक खतरनाक रास्ते पर शुरुआत की है?" यह वर्तमान टेक्स्ट की तुलना उस टेक्स्ट से करता है जो मॉडल ने तब सोचा होता यदि उसे धोखा न दिया गया होता।
  • रिपेयर: यदि इंस्पेक्टर को खतरा दिखता है, तो वह केवल "नहीं" नहीं कहता। वह कहता है, "ठीक है, इस विशिष्ट हिस्से को मिटा दें और फिर से प्रयास करें, लेकिन इस बार, आपको उस खतरनाक शब्द का उपयोग करने से सख्ती से रोका जाता है।" यह मॉडल को उस हिस्से को सुरक्षित रूप से फिर से तराशने के लिए मजबूर करता है।

🛡️ समाधान: डिफिफ़ुगार्ड (DiffuGuard)

पेपर एक टूल का प्रस्ताव करता है जिसे DiffuGuard कहा जाता है। इसे एक सेफ्टी को-पायलट के रूप में सोचें जो स्कल्प्टर के काम करते समय उसके बगल में बैठा रहता है।

  • इसे मॉडल को फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं है। आप इसे बस एक प्लगइन की तरह जोड़ सकते हैं।
  • यह दो चरणों में काम करता है:
    1. द डाइस रोलर (पासा फेंकने वाला): यह स्कल्प्टर के विकल्पों में थोड़ी यादृच्छिकता (randomness) जोड़ता है ताकि हैकर्स यह अनुमान न लगा सकें कि मॉडल वास्तव में कैसे प्रतिक्रिया देगा।
    2. द सेफ्टी इंस्पेक्टर (सुरक्षा निरीक्षक): यह बन रहे टेक्स्ट की निगरानी करता है। यदि यह देखता है कि मॉडल खतरे की ओर बढ़ रहा है, तो यह उस विशिष्ट भाग पर "अनडू" (Undo) बटन दबा देता है और एक सुरक्षित पुन: लेखन (rewrite) के लिए मजबूर करता है।

📊 परिणाम: क्या यह काम करता है?

शोधकर्ताओं ने इसे चार अलग-अलग AI मॉडल्स पर और छह अलग-अलग प्रकार के हैकर हमलों के खिलाफ टेस्ट किया।

  • DiffuGuard से पहले: हैकर लगभग 48% समय सफल रहे। (लगभग आधी बार, AI अपने नियमों को तोड़ देता था)।
  • DiffuGuard के बाद: हैकर केवल 15% समय सफल हुए।
  • लागत: AI धीमा नहीं हुआ, और न ही यह सामान्य सवालों के जवाब देने में "बेवकूफ" हुआ। यह बस सही समय पर "ना" कहने में बहुत बेहतर हो गया।

💡 मुख्य निष्कर्ष

यह पेपर एक नए तरीके से दरवाजा लॉक करने जैसा है। हम जानते थे कि पुराने ताले (पारंपरिक AI के लिए) अच्छे थे, लेकिन इस नए "स्कल्प्टर" AI के पास एक अलग तरह का दरवाजा और अलग तरह का ताला था। शोधकर्ताओं ने पता लगाया कि नया ताला कैसे कमजोर है, और उन्होंने एक सरल, चतुर गैजेट (DiffuGuard) बनाया जो ईमानदार लोगों के लिए दरवाजे को कठिन बनाए बिना ताले को मजबूत करता है।

संक्षेप में: उन्होंने पाया कि डिफ्यूजन AI अपने ही आत्मविश्वास और अपनी शुरुआती गलतियों से आसानी से धोखा खा जाता है, और उन्होंने इसे थोड़ी यादृच्छिकता और एक सख्त सुरक्षा निरीक्षक जोड़कर ठीक कर दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →