← नवीनतम पेपर
🤖 machine learning

NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment

यह शोध पत्र नॉइज़-टिल्टेड रिवर्स कर्नेल्स (NTRK) को प्रस्तुत करता है, जो एक नवीन रिवॉर्ड-गाइडेड डिफ्यूजन सैंपलर है जो बेहतर संरेखण (alignment) प्राप्त करने के लिए एक व्हाइटनिंग ऑपरेटर के माध्यम से सीधे रिवॉर्ड ग्रेडिएंट्स को नॉइज़ टर्म में इंजेक्ट करता है, जिससे नमूना गुणवत्ता से समझौता किए बिना या मध्यवर्ती अवस्थाओं को प्रशिक्षण वितरण से दूर ले जाए बिना कंप्यूट में 20 गुना कमी आती है।

मूल लेखक: Jisung Hwang, Yunhong Min, Jaihoon Kim, I-Chao Shen, Minhyuk Sung

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jisung Hwang, Yunhong Min, Jaihoon Kim, I-Chao Shen, Minhyuk Sung

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ (डिफ्यूजन मॉडल) है जो एक मानक रेसिपी के आधार पर स्वादिष्ट भोजन (इमेज या वीडियो) बनाने में अविश्वसनीय रूप से प्रतिभाशाली है। इस शेफ को एक विशिष्ट प्रकार के किचन वातावरण पर वर्षों तक प्रशिक्षित किया गया है।

अब, आप शेफ को एक नया निर्देश देना चाहते हैं: "इस भोजन को और अधिक एस्थेटिक (सुंदर) बनाओ," या "सुनिश्चित करो कि तस्वीर में ठीक 17 अंडे हों।" इसे रिवॉर्ड अलाइनमेंट (Reward Alignment) कहा जाता है। आप शेफ को बिना नौकरी से निकाले या उसे फिर से शून्य से खाना बनाना सिखाए बिना, एक बेहतर परिणाम की ओर निर्देशित करना चाहते हैं।

यह पेपर एक नई विधि पेश करता है जिसे NoiseTilt (या NTRK) कहा जाता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

समस्या: शेफ को गाइड करने के दो बुरे तरीके

NoiseTilt से पहले, शेफ को गाइड करने के दो मुख्य तरीके थे, और दोनों में एक बड़ी खामी थी:

  1. "धक्का देने" वाली विधि (Mean-Shifted):
    कल्पना कीजिए कि आप हर बार जब शेफ एक कदम उठाता है, तो उसे "परफेक्ट मील" की दिशा में शारीरिक रूप से धक्का देकर गाइड करने की कोशिश करते हैं।
  • खामी: यदि आप उन्हें बहुत ज़ोर से धकेलते हैं, तो वे अपने आरामदायक किचन से बाहर निकलकर एक अराजक, अपरिचित कमरे में जा गिरते हैं। वे अभी भी लक्ष्य की ओर बढ़ रहे हो सकते हैं, लेकिन वे फर्नीचर से टकराने लगते हैं, सामग्री गिराने लगते हैं और गंदगी फैला देते हैं। अंतिम व्यंजन अजीब या खराब दिखता है क्योंकि शेफ को ऐसी जगह जाने के लिए मजबूर किया गया था जहाँ वे काम करने के लिए प्रशिक्षित नहीं थे।
  1. "लॉटरी" वाली विधि (Search-Based):
    कल्पना कीजिए कि आप शेफ से एक ही समय में एक ही भोजन के 50 अलग-अलग संस्करण बनाने के लिए कहते हैं, उन सभी का स्वाद लेते हैं, और केवल उसी को परोसते हैं जो सबसे अच्छा दिखता है।
  • खामी: यह अच्छी तरह से काम करता है और शेफ को उनके आरामदायक किचन में रखता है, लेकिन यह अविश्वसनीय रूप से धीमा और महंगा है। आपको एक अच्छा भोजन पाने के लिए 50 भोजन बनाने पड़ते हैं। यह एक छोटा इनाम जीतने के लिए 50 लॉटरी टिकट खरीदने जैसा है।

समाधान: NoiseTilt (एक "फुसफुसाहट")

NoiseTilt इसे करके समाधान निकालता है: यह शेफ को धक्का नहीं देता; यह उनके कान में एक रहस्य फुसफुसाता है।

शेफ को धक्का देने (उनका रास्ता बदलने) या 50 भोजन बनाने के बजाय, NoiseTilt शेफ के दिमाग में मौजूद शोर (noise) को बदल देता है।

  • रूपक (Metaphor): कल्पना कीजिए कि शेफ एक धुंधले किचन में चल रहा है। "शोर" वह धुंध है। आमतौर पर, धुंध यादृच्छिक (random) और घनी होती है।
  • चाल: NoiseTilt "रिवॉर्ड" (निर्देश कि इसे सुंदर बनाएं) को एक विशिष्ट प्रकार की धुंध में बदल देता है। यह यह नहीं बदलता कि शेफ कहाँ खड़ा है (रास्ता सुरक्षित और परिचित रहता है), बल्कि यह धुंध को थोड़ा झुका (tilt) देता है ताकि शेफ स्वाभाविक रूप से एक सुंदर भोजन की ओर बढ़ सके, जबकि वह अभी भी अपने परिचित फर्श पर चल रहा है।

गुप्त नुस्खा: "व्हाइटनिंग ऑपरेटर" (Whitening Operator)

यहाँ एक पेच है। आप धुंध में "इसे सुंदर बनाओ!" चिल्लाकर नहीं बोल सकते। यदि आप एक संरचित, तार्किक वाक्य को रैंडम धुंध में चिल्लाते हैं, तो शेफ भ्रमित हो जाता है और परिणाम अभी भी एक कचरा होता है (इसे "अटिपिकल नॉइज़" कहा जाता है)।

NoiseTilt एक विशेष उपकरण का उपयोग करता है जिसे व्हाइटनिंग ऑपरेटर कहा जाता है।

  • उपमा: इसे एक अनुवादक (translator) के रूप में सोचें। निर्देश "इसे सुंदर बनाओ" एक संरचित, तार्किक वाक्य है। शेफ केवल "रैंडम स्टैटिक" (रैंडम शोर) को समझता है।
  • व्हाइटनिंग ऑपरेटर उस तार्किक निर्देश को इतना बिखेर (scramble) देता है कि वह शेफ के लिए रैंडम स्टैटिक जैसा दिखने लगे, लेकिन उसमें "सुंदरता" की छिपी हुई दिशा बनी रहे।
  • यह एक नक्शे को ऐसे स्टैटिक शोर में बदलने जैसा है कि जब शेफ उसे सुनता है, तो वह दाईं ओर जाने के बजाय बाईं ओर मुड़ जाता है, बिना यह महसूस किए कि वह एक नक्शे का पालन कर रहा है।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि NoiseTilt दोनों दुनियाओं का सबसे अच्छा विकल्प है:

  1. यह सुरक्षित है: क्योंकि यह शेफ को उनके कंफर्ट ज़ोन से बाहर नहीं धकेलता, इसलिए अंतिम इमेज और वीडियो उच्च गुणवत्ता वाले और प्राकृतिक दिखते हैं (कोई "गंदा किचन" जैसे आर्टिफैक्ट्स नहीं होते)।
  2. यह तेज़ है: इसके लिए 50 भोजन पकाने की आवश्यकता नहीं है। यह वही (या बेहतर) परिणाम प्राप्त करता है जो "लॉटरी" विधि देती है, लेकिन केवल एक प्रयास में।

परिणाम:
अपने परीक्षणों में, NoiseTilt केवल 25 स्टेप्स की गणना के साथ सुंदर, उच्च-रिवॉर्ड वाली इमेज जेनरेट कर सका। समान गुणवत्ता प्राप्त करने के लिए, पुराने "लॉटरी" तरीकों को 500 स्टेप्स की आवश्यकता थी। यह कंप्यूटिंग पावर में 20x की तेजी है, जबकि इमेज एकदम परफेक्ट दिखती हैं।

सारांश

NoiseTilt AI आर्ट जनरेटर को गाइड करने का एक नया तरीका है। AI को उसका रास्ता बदलने के लिए मजबूर करने (जिससे इमेज खराब हो जाती है) या उसे लाखों बार अनुमान लगाने के लिए कहने (जो कि धीमा है) के बजाय, यह प्रक्रिया में मौजूद रैंडमनेस को सूक्ष्मता से "टिल्ट" करता है। यह निर्देशों को उस रूप में बदलने के लिए एक विशेष अनुवादक (Whitening) का उपयोग करता है जिसे AI स्वाभाविक रूप से समझता है, जिसके परिणामस्वरूप बहुत पहले की तुलना में बहुत तेज़ गति से सुंदर, उच्च-गुणवत्ता वाली इमेज मिलती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →