← नवीनतम पेपर
💻 computer science

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

यह शोध पत्र AdaScope का प्रस्ताव करता है, जो डिफ्यूजन मॉडल के लिए एक अनुकूलित (adaptive) RL फाइन-ट्यूनिंग विधि है, जो केवल इष्टतम डिनोइजिंग चरणों के दौरान ही चुनितिक रूप से हस्तक्षेप करती है ताकि पूर्ण-ट्रैजेक्टरी अनुकूलन की अक्षमताओं से बचते हुए गणनात्मक लागत को 59% तक कम किया जा सके और जनरेशन प्रदर्शन में 66% तक सुधार किया जा सके।

मूल लेखक: Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai

प्रकाशित 2026-05-18
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को आपके द्वारा दिए गए विवरण के आधार पर एक चित्र बनाने के लिए सिखा रहे हैं। यह रोबोट एक विशेष तकनीक का उपयोग करता है जिसे "डिफ्यूजन मॉडल" (Diffusion Model) कहा जाता है। इस प्रक्रिया को एक कैनवास के बारे में सोचें जो पूरी तरह से स्टैटिक शोर (जैसे बिना सिग्नल वाला पुराना टीवी) से ढका हुआ है और धीरे-धीरे उसे साफ करके एक स्पष्ट छवि दिखाई देने तक साफ किया जा रहा है।

आमतौर पर, इस रोबोट को वह बनाने के लिए जो आप वास्तव में पसंद करते हैं (केवल सुंदर दिखने वाली यादृच्छिक तस्वीरों के बजाय), हम रीइन्फोर्समेंट लर्निंग (RL) नामक एक प्रणाली का उपयोग करते हैं। यह एक ऐसे शिक्षक की तरह है जो केवल अंत में ग्रेड देता है, जब पेंटिंग 100% पूरी हो जाती है।

समस्या: "अधिक करना, कम हासिल करना"

शोध पत्र का तर्क है कि वर्तमान तरीके अक्षम हैं। वे रोबोट को सफाई की प्रक्रिया के हर एक चरण में सिखाने की कोशिश करते हैं, भले ही शिक्षक का ग्रेड अंत में ही मिलता हो।

लेखक इस "हर-चरण" वाले दृष्टिकोण के दो मुख्य कारणों की पहचान करते हैं:

  1. "बहुत जल्दी" वाली समस्या (अराजक शुरुआत):

    • उपमा: कल्पना कीजिए कि आप एक छात्र को एक विशिष्ट पेड़ बनाना सिखाने की कोशिश कर रहे हैं जबकि कैनवास अभी भी केवल ग्रे स्टैटिक का एक धुंधला सा हिस्सा है। छात्र को अभी तक यह नहीं पता कि पेड़ कैसा दिखता है; वह बस अनुमान लगा रहा है।
    • समस्या: यदि आप इस चरण में छात्र को फीडबैक (पुरस्कार/रिवॉर्ड) देते हैं, तो यह भ्रमित करने वाला होता है। फीडबैक कार्य से मेल नहीं खाता क्योंकि छवि अभी तक बनी ही नहीं है। इसके कारण रोबोट भ्रमित हो जाता है, यादृच्छिक गलतियाँ करता है, और गलत चीजें सीखने में ऊर्जा बर्बाद करता है।
  2. "बहुत देर" वाली समस्या (अति-अनुकूलित अंत):

    • उपमा: अब कल्पना कीजिए कि पेंटिंग पहले से ही उत्तम है। शिक्षक इसे 'A+' देता है। लेकिन रुकने के बजाय, आप छात्र को घंटों तक पेंटिंग में बदलाव करने के लिए मजबूर करते रहते हैं।
    • समस्या: छात्र थोड़ा अधिक स्कोर पाने के लिए मामूली, अर्थहीन विवरणों पर ध्यान केंद्रित करने लगता है। वे शिक्षक को धोखा देने के लिए अजीब, अस्वाभाविक बनावट (textures) जोड़ सकते हैं। इसे "रिवॉर्ड हैकिंग" (Reward Hacking) कहा जाता है। रोबोट एक वास्तविक सुंदर छवि बनाने के बजाय शिक्षक के स्कोर को "धोखा" देने के लिए सीख जाता है, और इससे वह बहुत समय बर्बाद करता है।

समाधान: "एडास्कोप" (AdaScope - स्मार्ट टाइमर)

लेखक एक नया टूल प्रस्तावित करते हैं जिसे AdaScope कहा जाता है। रोबोट को हर एक चरण में सिखाने के बजाय, AdaScope एक स्मार्ट सुपरवाइजर की तरह काम करता है जो पेंटिंग की प्रक्रिया पर नज़र रखता है और केवल तभी हस्तक्षेप करता है जब इसकी आवश्यकता होती है।

  • शुरुआत कब करें: AdaScope तब तक इंतजार करता है जब तक कि "स्टैटिक" इतना साफ न हो जाए कि छवि का मूल आकार दिखाई देने लगे। यह अराजक शुरुआत को छोड़ देता है जहाँ रोबोट केवल अनुमान लगा रहा होता है।
  • कब रुकें: जैसे ही छवि स्थिर हो जाती है और शिक्षक का स्कोर महत्वपूर्ण रूप से सुधरना बंद हो जाता है, AdaScope रोबोट को रुकने के लिए कहता है। यह रोबोट को अत्यधिक छेड़छाड़ करने और सिस्टम को धोखा देने से रोकता है।

परिणाम: "कम करें, अधिक हासिल करें"

केवल "गोल्डिलॉक्स ज़ोन" (न बहुत जल्दी, न बहुत देर) के दौरान प्रशिक्षण देकर, पेपर का दावा है कि उन्होंने एक दुर्लभ "दोहरा लाभ" प्राप्त किया है:

  1. तेज़: उन्होंने कंप्यूटर समय (लागत) को 59% तक कम कर दिया क्योंकि वे बेकार चरणों पर ऊर्जा बर्बाद नहीं कर रहे हैं।
  2. बेहतर: अंतिम छवियां मानव प्राथमिकताओं से मेल खाने में 66% बेहतर हैं क्योंकि रोबोट ने सही क्षणों से सीखा, जिससे भ्रम और धोखाधड़ी से बचा जा सके।

सारांश में

इसे मैराथन के लिए प्रशिक्षण लेने की तरह समझें।

  • पुराना तरीका: हर दिन दौड़ें, जिसमें वे दिन भी शामिल हैं जब आप बीमार हैं (बहुत जल्दी) और वे दिन भी जब आप पहले से ही अपने चरम फिटनेस पर हैं और बस गोल-गोल घूम रहे हैं (बहुत देर)। आप थक जाते हैं और घायल हो जाते हैं।
  • एडास्कोप तरीका: केवल उन दिनों दौड़ें जब आप सुधार करने के लिए स्वस्थ हों और बर्नआउट होने से पहले रुक जाएं। आप कम प्रयास के साथ तेज़ और अधिक मजबूत बनते हैं।

यह पेपर साबित करता है कि शानदार परिणाम प्राप्त करने के लिए आपको AI की सोचने की प्रक्रिया के हर एक चरण को अनुकूलित करने की आवश्यकता नहीं है; आपको केवल सही चरणों को अनुकूलित करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →