← नवीनतम पेपर
🤖 AI

DLM-SWAI: Steering Diffusion Language Models Before They Unmask

यह शोध पत्र DLM-SWAI का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त इन्फरेंस-टाइम विधि है जो डीनोइजिंग के दौरान पूर्व-निर्धारित स्कोर के साथ टोकन वितरण को पक्षपाती बनाकर डिफ्यूजन लैंग्वेज मॉडल्स को वांछित शैलियों और सुरक्षा गुणों की ओर निर्देशित करती है, जिससे बिना पुनरप्रशिक्षण या महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के प्रभावी नियंत्रण प्राप्त होता है।

मूल लेखक: Hyeseon An, Yo-Sub Han

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyeseon An, Yo-Sub Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, लेकिन थोड़ी जिद्दी कलाकार है (डिफ्यूजन लैंग्वेज मॉडल) जो शोर (static noise) से भरी एक पूरी पन्ने की सतह से शुरू करके, शब्द दर शब्द, एक स्पष्ट वाक्य उभरने तक उसे साफ करता है। इस प्रक्रिया को "डिनोइजिंग" (denoising) कहा जाता है।

समस्या यह है कि हालांकि यह कलाकार धाराप्रवाह वाक्य बनाने में माहिर है, लेकिन वे हमेशा आपकी विशिष्ट मांगों को नहीं सुनते, जैसे कि "इसे सरल तरीके से लिखें" या "सुनिश्चित करें कि यह विनम्र लगे।" आमतौर पर, उन्हें सुनने के लिए मजबूर करने के लिए, आपको उन्हें महीनों तक फिर से प्रशिक्षण (fine-tuning) के लिए आर्ट स्कूल भेजना पड़ता, जो महंगा और धीमा होता है।

DLM-SWAI एक नया, चतुर तरीका है जो आपको इस कलाकार को काम करते समय ही निर्देशित करने की अनुमति देता है, बिना उन्हें वापस स्कूल भेजे। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. "चीट शीट" (ऑफलाइन स्कोर कंस्ट्रक्शन)

कलाकार द्वारा चित्र बनाना शुरू करने से पहले ही, शोधकर्ता एक विशेष चीट शीट तैयार करते हैं।

  • वे "सरल" टेक्स्ट, "विनम्र" टेक्स्ट, या "विषाक्त" (toxic) टेक्स्ट के हजारों उदाहरण देखते हैं।
  • वे गिनते हैं कि प्रत्येक श्रेणी में कौन से शब्द सबसे अधिक बार आते हैं। उदाहरण के लिए, शब्द "being" जटिल, उन्नत लेखन में बहुत दिखाई दे सकता है, जबकि "people" सरल लेखन में दिखाई दे सकता है।
  • वे शब्दकोश के हर शब्द को एक "स्कोर" देते हैं कि वह एक विशिष्ट शैली से कितनी मजबूती से जुड़ा है। यह एक बार किया जाता है और सहेज लिया जाता है।

2. "धक्का" (डिनोइजिंग-टाइम स्टीयरिंग)

अब, कलाकार अपना काम शुरू करता है। वह कई खाली स्थानों (masked tokens) वाले एक अस्त-व्यस्त पन्ने को देख रहा है और अनुमान लगाने की कोशिश कर रहा है कि वहां कौन सा शब्द जाएगा।

  • सामान्य रूप से, कलाकार अपने स्वयं के प्रशिक्षण के आधार पर अनुमान लगाता है।
  • DLM-SWAI हस्तक्षेप करता है और कलाकार को एक हल्का धक्का (nudge) देता है। यह कहता है, "हे, यदि आप 'विनम्र' शैली में लिखने की कोशिश कर रहे हैं, तो आपको वास्तव में 'कृपया' जैसे शब्दों को पसंद करना चाहिए और शायद 'shut' जैसे शब्दों को नापसंद करना चाहिए।"
  • यह इस धक्का को पन्ने के हर खाली स्थान के लिए कलाकार के अनुमान में एक साथ जोड़ देता है।

3. "स्नोबॉल प्रभाव" (यह क्यों काम करता है)

यह जादुई हिस्सा है। अन्य प्रकार के AI (जो एक समय में बाएं से दाएं एक शब्द लिखते हैं) में, एक धक्का केवल अगले शब्द को प्रभावित करता है। लेकिन इस "डिफ्यूजन" कलाकार में, धक्का पूरे पन्ने पर एक साथ लगता है।

  • क्योंकि कलाकार पूरे वाक्य को एक साथ परिष्कृत (refine) कर रहा है, ये छोटे धक्के जुड़ते (compound) जाते हैं।
  • यदि कलाकार धक्के के कारण शुरुआत में ही एक "विनम्र" शब्द चुनता है, तो वह चुनाव अगले दौर के अनुमानों को और भी अधिक विनम्र होने की संभावना बना देता है।
  • यह एक पहाड़ी से लुढ़कते हुए स्नोबॉल (बर्फ के गोले) की तरह है: ऊपर से एक छोटा सा धक्का मिलने पर वह अधिक बर्फ (शैली) इकट्ठा करता जाता है, और वाक्य समाप्त होने तक वह वांछित शैली का एक बड़ा, स्पष्ट गोला बन जाता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने इसे तीन चीजों पर परखा:

  1. पढ़ने का स्तर: टेक्स्ट को ऐसा बनाना कि वह एक बच्चे (प्रारंभिक) बनाम एक कॉलेज छात्र (उन्नत) के लिए लिखा गया हो।
  2. विनम्रता: अनुरोधों को अच्छा बनाम रूखा बनाना।
  3. सुरक्षा: यह सुनिश्चित करना कि टेक्स्ट विषाक्त या हानिकारक न हो।

परिणाम:

  • यह सिर्फ अच्छे से कहने से बेहतर काम करता है: प्रॉम्प्ट में AI को "कृपया विनम्र रहें" कहना अक्सर विफल हो जाता है। DLM-SWAI वास्तव में आउटपुट को विनम्र बनाने के लिए बदल देता है।
  • यह कला को खराब नहीं करता: कभी-कभी, जब आप किसी AI को अपनी शैली बदलने के लिए मजबूर करते हैं, तो लेखन निरर्थक हो जाता है। DLM-SWAI शैली बदलते हुए भी वाक्यों को सुचारू और पठनीय बनाए रखता है।
  • यह तेज़ और मुफ्त है: इसके लिए मॉडल को फिर से प्रशिक्षित करने या अतिरिक्त कंप्यूटरों की आवश्यकता नहीं होती है। यह बस चीट शीट का उपयोग करके प्रक्रिया को दिशा देने के लिए धक्का देता है।

पकड़ (सीमाएं)

  • "बहुत कठिन" धक्का: यदि आप कलाकार को बहुत जोर से धक्का देते हैं (बहुत मजबूत धक्का), तो वे भ्रमित हो जाते हैं और एक टूटे हुए रिकॉर्ड की तरह शब्दों को दोहराने लगते हैं। आपको "गोल्डिलॉक्स" शक्ति ढूंढनी होगी—इतना पर्याप्त कि दिशा मिल सके, लेकिन इतना नहीं कि वे टूट जाएं।
  • "जिद्दी" कलाकार: यदि कलाकार पहले से ही बहुत सुरक्षित (विषाक्त होने से मना करने के लिए प्रशिक्षित) बनाया गया है, तो उन्हें सुरक्षित रखना आसान है। लेकिन यदि आप उन्हें विषाक्त होने के लिए मजबूर करने की कोशिश करते हैं, तो वे विरोध कर सकते हैं क्योंकि उनका आंतरिक प्रशिक्षण मुकाबला करता है। यह तरीका बुरी चीजों को रोकने में बेहतर है बजाय बुराई को जबरदस्ती थोपने के।

संक्षेप में

DLM-SWAI एक ड्राइवर को GPS देने जैसा है जो पहले से ही गाड़ी चला रहा है। उसे नया रास्ता सीखने (पुनः प्रशिक्षण) के बजाय, आप बस स्टीयरिंग व्हील को धीरे से उस दिशा में मोड़ देते हैं जहाँ आप चाहते हैं कि वह जाए, यह सुनिश्चित करते हुए कि वह बिना कार दुर्घटनाग्रस्त किए ठीक वहीं पहुंचे जहाँ उसे पहुंचना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →