← नवीनतम पेपर
💬 NLP

ILRR: Inference-Time Steering Method for Masked Diffusion Language Models

यह शोध पत्र ILRR को प्रस्तुत करता है, जो मास्कड डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक लर्निंग-फ्री इन्फरेंस-टाइम स्टीयरिंग फ्रेमवर्क है जो लचीले एट्रिब्यूट कंट्रोल और न्यूनतम कंप्यूटेशनल ओवरहेड के साथ काफी बेहतर स्टीयरिंग सटीकता प्राप्त करने के लिए आंतरिक एक्टिवेशन्स को एक रेफरेंस सीक्वेंस के साथ गतिशील रूप से संरेखित करता है।

मूल लेखक: Eden Avrahami, Eliya Nachmani

प्रकाशित 2026-01-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eden Avrahami, Eliya Nachmani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: एक मार्गदर्शक के साथ पेंटिंग करना

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार (AI मॉडल) है जो सुंदर चित्र बना सकता है (टेक्स्ट लिख सकता है)। हालाँकि, कभी-कभी आप चाहते हैं कि कलाकार एक विशिष्ट प्रकार की पेंटिंग बनाए, जैसे कि "तूफानी रात" के बजाय "खुशनुमा सूर्यास्त," बिना किसी नए कलाकार को काम पर रखे या वर्तमान वाले को महीनों तक फिर से प्रशिक्षित किए।

AI की दुनिया में, इसे कंट्रोलेबल जनरेशन (controllable generation) कहा जाता है। यह पेपर एक नई विधि पेश करता है जिसे ILRR (इटरेटिव लेटेंट रिप्रेजेंटेशन रिफाइनमेंट) कहा जाता है, जो एक एकल उदाहरण चित्र (रेफरेंस) का उपयोग करके, वास्तविक समय में कलाकार के ब्रश स्ट्रोक्स को निर्देशित करने वाले एक "भूतिया हाथ" (ghost hand) की तरह कार्य करता है।

समस्या: "अनुमान लगाने का खेल"

वर्तमान AI टेक्स्ट जेनरेटर जो "डिफ्यूजन" (शोर को धीरे-धीरे हटाकर टेक्स्ट बनाना, जैसे परिदृश्य देखने के लिए धुंध को साफ करना) की तरह काम करते हैं, वे लिखने में तो बेहतरीन हैं, लेकिन उन्हें नियंत्रित करना कठिन है।

  • पुराने तरीके: AI को कुछ विशिष्ट लिखने (जैसे कि कोई जहरीली टिप्पणी या बहुत खुशहाल कहानी) के लिए प्रेरित करने के लिए, शोधकर्ताओं को अक्सर AI को समानांतर में कई बार चलाना पड़ता था, सबसे अच्छे परिणाम को चुनना पड़ता था, या AI को थोड़ा बदलने के लिए जटिल गणित का उपयोग करना पड़ता था। यह कलाकार को 10 अलग-अलग सूर्यास्त पेंट करने के लिए कहने और फिर सबसे अच्छे को रखने के लिए 9 को फेंक देने जैसा है। यह धीमा और महंगा है।

समाधान: ILRR (द "घोस्ट हैंड")

लेखक एक स्मार्ट तरीका प्रस्तावित करते हैं। कलाकार को बार-बार प्रयास करने के लिए कहने के बजाय, वे कलाकार को एक रेफरेंस फोटो (एक छोटा टेक्स्ट उदाहरण) और एक गाइड देते हैं जो पेंटिंग की प्रक्रिया के दौरान कलाकार के कान में फुसफुसाता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "डिनोइजिंग" (Denoising) की प्रक्रिया

कल्पना कीजिए कि AI एक वाक्य लिखने की कोशिश कर रहा है, लेकिन यह स्टैटिक (शोर) के एक बादल के रूप में शुरू होता है। यह धीरे-धीरे स्टैटिक को साफ करता है, शब्द दर शब्द, ताकि अंतिम वाक्य दिखाई दे सके। यह कई छोटे चरणों में होता है।

2. दो-ट्रैक प्रणाली (Two-Track System)

स्टैटिक को साफ करने के हर एक चरण में, ILRR दो चीजें एक साथ करता है:

  • ट्रैक A: यह नया वाक्य उत्पन्न करने के लिए AI को चलाता है।
  • ट्रैक B: यह रेफरेंस टेक्स्ट (आपके द्वारा दिए गए उदाहरण) पर AI को चलाता है, लेकिन यह उस रेफरेंस टेक्स्ट को नए वाक्य के समान ही मात्रा में स्टैटिक के साथ "करप्ट" (खराब) कर देता है।

3. "अलाइनमेंट" (जादुई क्षण)

यही मुख्य नवाचार है। टेक्स्ट की एक लेयर को प्रोसेस करने के बाद, ILRR दोनों ट्रैक्स के "ब्रेन एक्टिविटी" (आंतरिक गणितीय नंबरों) को देखता है।

  • यह पूछता है: "इस चरण पर रेफरेंस टेक्स्ट कैसा दिखता है?"
  • इसके बाद यह नए वाक्य की "ब्रेन एक्टिविटी" को रेफरेंस के अनुरूप होने के लिए धीरे से नज (nudge/धक्का) देता है।

उपमा (Analogy): कल्पना कीजिए कि आप एक धुंधले जंगल (टेक्स्ट जनरेशन) से गुजर रहे हैं। आपका एक दोस्त (रेफरेंस टेक्स्ट) उसी धुंध में आपके बगल में चल रहा है। हर कुछ कदमों के बाद, आप अपने दोस्त की दिशा देखते हैं। यदि वे एक "खुशहाल" रास्ते की ओर चल रहे हैं, तो आप अपने पैरों को भी उसी दिशा में चलने के लिए धीरे से मोड़ते हैं। आप उनके कदमों की नकल नहीं करते (आप उनके शब्द नहीं चुराते), बल्कि आप अपने इरादे को उनके साथ संरेखित (align) करते हैं।

विशेष विशेषताएं

1. ट्यूनेबल स्ट्रेंथ (वॉल्यूम नॉब)

इस विधि में एक "स्टीयरिंग स्केल" (एक संख्या जिसे आप बदल सकते हैं) होता है।

  • लो सेटिंग: AI रेफरेंस को सुनता है लेकिन अपना व्यक्तित्व बनाए रखता है।
  • हाई सेटिंग: AI रेफरेंस का बहुत बारीकी से पालन करता है।
  • परिणाम: आप टेक्स्ट को खराब किए बिना "खुशहाल" या "जहरीले" वाइब को नियंत्रित कर सकते हैं।

2. "छोटा रेफरेंस, लंबी कहानी" वाला ट्रिक

क्या होगा यदि आप एक पूरा उपन्यास (लंबा टेक्स्ट) लिखना चाहते हैं लेकिन आपके पास केवल एक वाक्य का उदाहरण (छोटा रेफरेंस) है?

  • समस्या: यदि आप एक वाक्य के वाइब को 500 पन्नों तक खींचने की कोशिश करते हैं, तो यह आमतौर पर अजीब या दोहराव वाला हो जाता है।
  • ILRR का समाधान: उन्होंने स्पेशियली मॉड्यूलेटेड स्टीयरिंग (Spatially Modulated Steering) का आविष्कार किया। कल्पना कीजिए कि छोटा रेफरेंस एक ब्लूप्रिंट है। ILRR इस ब्लूप्रिंट को पूरी लंबी कहानी पर एक लहर की तरह सुचारू रूप से फैला देता है। यह सुनिश्चित करता है कि पूरी कहानी में "वाइब" महसूस की जाए, लेकिन यह स्वाभाविक रूप से घटता-बढ़ता रहे ताकि कहानी एक टूटे हुए रिकॉर्ड की तरह न लगे।

परिणाम: तेज़ और सटीक

पेपर ने दो अलग-अलग AI मॉडल्स (LLaDA और MDLM) पर दो कार्यों के साथ इसका परीक्षण किया:

  1. टॉक्सिसिटी (Toxicity): AI को अपमानजनक/हानिकारक चीजें लिखने के लिए प्रेरित करना (एक कठिन कार्य क्योंकि AI आमतौर पर दयालु रहने की कोशिश करता है)।
  2. सेंटिमेंट (Sentiment): AI को खुशहाल चीजें लिखने के लिए प्रेरित करना।

निष्कर्ष:

  • बेहतर नियंत्रण: ILRR मौजूदा सर्वोत्तम तरीकों की तुलना में लक्षित वाइब को हिट करने में 10% से 60% अधिक सटीक था।
  • सस्ता: इसके लिए प्रति चरण केवल एक अतिरिक्त गणना की आवश्यकता थी। इसे AI को कई बार चलाने या खराब प्रयासों को फेंकने की आवश्यकता नहीं थी।
  • कॉपी नहीं करना: AI ने केवल रेफरेंस टेक्स्ट को कॉपी-पेस्ट नहीं किया। इसने भावना या शैली को सीखा और उसे नए शब्दों पर लागू किया।

सारांश

ILRR को AI टेक्स्ट जनरेशन के लिए एक रियल-टाइम GPS के रूप में समझें। AI को बिना किसी दिशा के गाड़ी चलाने देने और उम्मीद करने के बजाय कि वह सही मंजिल तक पहुँच जाएगा, या उसे सही रास्ता खोजने के लिए लाखों अलग-अलग रास्ते खोजने के लिए मजबूर करने के बजाय, ILRR उसे एक लाइव मैप (रेफरेंस) देता है और हर मोड़ पर स्टीयरिंग व्हील को धीरे से घुमाता है ताकि वह बिल्कुल वहीं पहुँचे जहाँ आप चाहते हैं, और इसमें बहुत कम अतिरिक्त ईंधन खर्च होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →