A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
A2D डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक टोकन-लेवल सुरक्षा संरेखण विधि पेश करता है जो तत्काल [EOS] रिफ्यूज़ल सिग्नल उत्सर्जित करने के लिए रैंडमाइज्ड मास्किंग का लाभ उठाता है, जो DIJA जैसे किसी भी-क्रम (any-order) और किसी भी-चरण (any-step) हमलों को प्रभावी रूप से बेअसर करता है और साथ ही रीयल-टाइम मॉनिटरिंग और काफी तेज़ सुरक्षित समाप्ति को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: एक नए प्रकार का AI लेखक
कल्पना कीजिए कि अधिकांश AI चैटबॉट्स (जैसे वे जिनसे आप रोज़ाना बात करते हैं) असेंबली लाइन वर्कर की तरह हैं। वे एक वाक्य को एक-एक शब्द करके, सख्ती से बाएँ से दाएँ बनाते हैं। यदि आप उनसे कुछ खतरनाक पूछते हैं, तो वे आमतौर पर पहले कुछ शब्दों की जाँच करते हैं, निर्णय लेते हैं कि "नहीं, यह बुरा है," और तुरंत रुक जाते हैं।
लेकिन एक नया प्रकार का AI है जिसे डिफ्यूजन लैंग्वेज मॉडल (dLLM) कहा जाता है। इस AI को असेंबली लाइन वर्कर के बजाय, एक पत्थर के ब्लॉक पर काम करने वाले मूर्तिकार के रूप में सोचें। शब्द-दर-शब्द लिखने के बजाय, यह प्रश्न चिह्नों (मास्क) से भरे एक खाली पन्ने से शुरू होता है और धीरे-धीरे उन्हें भरता जाता है। यह वाक्य के शुरुआत से पहले अंत को भर सकता है, या शुरुआत से पहले बीच के हिस्से को। यह पूरे विषय पर एक साथ काम कर सकता है।
समस्या: "बैकडोर" हमला
चूंकि यह मूर्तिकार किसी भी क्रम में शब्द भर सकता है, इसलिए इसमें एक नई कमजोरी है।
कल्पना कीजिए कि एक बुरा व्यक्ति मूर्तिकार को कार चोरी करने का तरीका लिखने के लिए बहलाना चाहता है।
- पुराना जाल: यदि मूर्तिकार एक असेंबली लाइन वर्कर है, तो बुरा व्यक्ति बिल्कुल शुरुआत में ही उसे धोखा देने की कोशिश करता है।
- नया जाल (DIJA हमला): मूर्तिकार के मामले में, बुरा व्यक्ति कहानी के पहले आधे हिस्से को हानिरहित टेक्स्ट से भर सकता है, फिर बीच में एक "जाल" डाल सकता है, या अंत को पहले भर सकता है। वे एक ऐसे टेम्पलेट का उपयोग करते हैं जो एक सामान्य अनुरोध जैसा दिखता है लेकिन खाली जगहों में खतरनाक हिस्सों को छिपा लेता है।
पेपर ने पाया कि इन मूर्तिकारों के लिए वर्तमान सुरक्षा प्रशिक्षण "उथला" (shallow) है। यह एक सुरक्षा गार्ड की तरह है जो केवल तब आपकी आईडी चेक करता है जब आप मुख्य दरवाजे से अंदर आते हैं। यदि आप दरवाजे से बचकर अंदर घुसने में सफल हो जाते हैं और गलियारे में चलना शुरू कर देते हैं, तो गार्ड ध्यान देना छोड़ देता है। AI पहले शब्द पर तो "ना" कह सकता है, लेकिन अगर आप उसे 10वें शब्द के साथ कुछ खतरनाक भरने के लिए trick करते हैं, तो वह दोबारा "ना" कहना भूल जाता है।
समाधान: A2D (Any-Order, Any-Step Defense)
लेखकों ने A2D नामक एक नई सुरक्षा विधि बनाई है। यह कैसे काम करती है, इसे एक सरल उपमा से समझते हैं:
"लाल स्टॉप साइन" टोकन
AI को केवल शुरुआत में "मैं यह नहीं कर सकता" कहना सिखाने के बजाय, A2D AI को एक विशेष "स्टॉप साइन" टोकन (जिसे [EOS] कहा जाता है) सिखाता है।
- प्रशिक्षण: वे AI को खतरनाक वाक्य दिखाते हैं। लेकिन उसे वाक्य पूरा करने देने के बजाय, वे खतरनाक हिस्सों को प्रश्न चिह्नों से ढक देते हैं और AI को बताते हैं: "यदि आप यहाँ एक प्रश्न चिह्न देखते हैं, और वाक्य खतरनाक है, तो आपको उस प्रश्न चिह्न को तुरंत एक स्टॉप साइन (Stop Sign) से बदलना होगा।"
- परिणाम: AI सीख जाता है कि वाक्य में कहीं भी, यदि उसे कुछ हानिकारक महसूस होता है, तो उसे तुरंत उस जगह पर स्टॉप साइन लगा देना चाहिए।
यह विशेष क्यों है?
- Any-Order (कोई भी क्रम): इससे कोई फर्क नहीं पड़ता कि AI पहला शब्द लिख रहा है या आखिरी। यदि कोई खतरनाक विचार सामने आता है, तो स्टॉप साइन दिखाई देता है।
- Any-Step (कोई भी चरण): इससे कोई फर्क नहीं पड़ता कि खतरा चरण 1 पर आया या चरण 50 पर। सुरक्षा गार्ड पूरे समय जाग रहा है, न कि केवल दरवाजे पर।
"खाली स्थान भरें" परीक्षण
अपने तरीके को सिद्ध करने के लिए, शोधकर्ताओं ने FITS (Fill-in-the-Sentence) नामक एक अत्यंत कठिन परीक्षण बनाया।
- परिदृश्य: कल्पना कीजिए कि एक बुरा आदमी बम बनाने के तरीके पर 99% पूर्ण गाइड लिखता है। वह बस एक वाक्य (अंतिम चरण) छोड़ देता है और AI को उसे भरने के लिए कहता है।
- परिणाम: पुराने सुरक्षा तरीके यहाँ बुरी तरह विफल रहे। वे टेक्स्ट की शुरुआत पर इतने केंद्रित थे कि उन्होंने AI को बम बनाने की गाइड पूरी करने दी।
- A2D का प्रदर्शन: A2D ने उस एक छूटे हुए वाक्य को देखा, महसूस किया कि वह खतरनाक है, और तुरंत स्टॉप साइन लगा दिया। इसने हमले को लगभग 100% बार रोका।
बोनस: रियल-टाइम सुरक्षा रडार
चूंकि AI को खतरा देखते ही स्टॉप साइन लगाने के लिए प्रशिक्षित किया गया है, इसलिए उस स्टॉप साइन के आने की संभावना (probability) एक सुरक्षा रडार की तरह काम करती है।
- जल्द अस्वीकृति (Early Rejection): शोधकर्ताओं ने पाया कि यदि वे बिल्कुल पहले चरण में ही AI की "स्टॉप साइन संभावना" की जाँच करते हैं, तो वे AI द्वारा एक भी शब्द लिखे जाने से पहले ही बता सकते हैं कि पूरा अनुरोध बुरा है।
- गति: यह AI को पहले की तुलना में 19.3 गुना तेजी से बुरे अनुरोधों को अस्वीकार करने की अनुमति देता है। यह एक क्लब के बाउंसर की तरह है जो आपसे दरवाजा पार करने से पहले ही बता देता है कि आप लिस्ट में नहीं हैं, जिससे सबका समय बचता है।
क्या यह AI की मददगार होने की क्षमता को खराब करता है?
पेपर ने इसका व्यापक परीक्षण किया। उन्होंने AI को गणित करने, कोड लिखने और सामान्य प्रश्न पूछने के लिए कहा।
- फैसला: A2D ने AI को स्मार्ट और मददगार बनाए रखा। इसने AI को सामान्य प्रश्न (जैसे "मैं पायथन प्रोसेस को कैसे मारूँ?" जो सुनने में खतरनाक लग सकता है लेकिन वास्तव में कोडिंग के बारे में है) का उत्तर देने से मना नहीं किया।
- तुलना: अन्य सुरक्षा विधियाँ बहुत संवेदनशील थीं और उन्होंने हानिरहित प्रश्नों का उत्तर देने से भी मना कर दिया। A2D सटीक था: इसने केवल गलत चीजों को रोका।
सारांश
यह पेपर A2D पेश करता है, जो एक नए प्रकार के AI के लिए एक सुरक्षा अपग्रेड है जो किसी भी क्रम में लिखता है।
- पुरानी सुरक्षा: एक सुरक्षा गार्ड जो कुछ मिनटों के बाद थक जाता है।
- A2D सुरक्षा: एक सुरक्षा प्रणाली जो खतरा महसूस होते ही तुरंत, कहीं भी, कभी भी "स्टॉप" साइन लगा देती है।
- परिणाम: यह उन चालाक हमलों को रोकता है जो दरवाजे से छिपकर अंदर आते हैं, "ना" कहने में 19 गुना तेज़ काम करता है, और बाकी सभी के लिए AI को मददगार बनाए रखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।