← नवीनतम पेपर
🤖 AI

Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models

यह शोध पत्र LiDAR प्रस्तुत करता है, जो डिफ्यूजन मॉडल्स के लिए एक कुशल टेस्ट-टाइम स्केलिंग विधि है जो मार्जिनल सैंपल्स और फ्यू-स्टेप लुकअहेड सैंपलिंग का उपयोग करके क्लोज्ड-फॉर्म अपेक्षित भविष्य के रिवॉर्ड गाइडेंस की गणना करता है ताकि मौजूदा ग्रेडिएंट गाइडेंस दृष्टिकोणों की तुलना में 9.5x की गति वृद्धि के साथ उच्च मानव-संरेखित जनरेशन गुणवत्ता प्राप्त की जा सके।

मूल लेखक: Yeongmin Kim, Donghyeok Shin, Byeonghu Na, Minsang Park, Richard Lee Kim, Il-Chul Moon

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yeongmin Kim, Donghyeok Shin, Byeonghu Na, Minsang Park, Richard Lee Kim, Il-Chul Moon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार (एक डिफ्यूजन मॉडल) है जो शून्य से सुंदर चित्र बना सकता है। आप उसे "एक काली मोटरसाइकिल पर पीला पक्षी" जैसा प्रॉम्प्ट देते हैं, और वह पेंटिंग करना शुरू कर देता है। वह टीवी के शोर (static noise) जैसे एक कैनवास से शुरुआत करता है और धीरे-धीरे इसे एक स्पष्ट छवि में बदल देता है।

हालाँकि, कभी-कभी कलाकार थोड़ा भटक जाता है। वह शायद एक ऐसा पक्षी बना दे जो मुर्गे जैसा दिखता हो, या एक ऐसी मोटरसाइकिल जो टोस्टर जैसी दिखती हो। तकनीकी रूप से वे "पेंटिंग" के नियमों का पालन कर रहे हैं, लेकिन वे आपकी विशिष्ट दृष्टि (vision) से पूरी तरह मेल नहीं खा रहे हैं।

यह पेपर इस बारेв कलाकार को पेंटिंग करते समय ही मार्गदर्शन करने का एक नया तरीका पेश करता है, जिसमें कलाकार को फिर से प्रशिक्षित करने या नया शिक्षक नियुक्त करने की आवश्यकता नहीं है। इस विधि का नाम LiDAR (लुकअहेड सैंपल रिवॉर्ड गाइडेंस) है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "बैकवर्ड रोलआउट" बहुत धीमा है

कलाकार की गलतियों को सुधारने के लिए, पिछले तरीकों ने बहुत विस्तृत होने की कोशिश की। वे कहते थे, "आइए अभी रुकते हैं, कल्पना करें कि यह पेंटिंग कितने अलग-अलग तरीकों से पूरी हो सकती है, देखें कि कौन सी सबसे अच्छी दिखती है, और फिर वर्तमान पेंटिंग को उस सबसे अच्छे संस्करण की ओर मोड़ दें।"

  • दोष: हर एक ब्रशस्ट्रोक के लिए यह "100 अलग-अलग तरीके" करना बहुत समय लेने वाला है। यह ऐसा है जैसे कलाकार को अगला स्ट्रोक तय करने के लिए पूरी पेंटिंग को 100 बार पूरा करने के लिए कहना। यह बहुत महंगा और धीमा है।

2. पुराना शॉर्टकट: "भविष्य का अनुमान लगाना"

अन्य तरीकों ने तेज़ होने के लिए एक शॉर्टकट का उपयोग किया। वे वर्तमान बिखरी हुई पेंटिंग को देखते थे और अनुमान लगाते थे, "अगर हम इसे थोड़ा स्मूथ कर दें, तो अंतिम तस्वीर कैसी दिखेगी?" फिर वे उस अनुमान की तुलना एक रिवॉर्ड सिस्टम (एक स्कोर कि चित्र कितना अच्छा है) से करते थे।

  • दोष: यह अनुमान अक्सर गलत होता है। यदि कलाकार अभी भी "बिखरे हुए शोर" के चरण में है, तो अनुमान एक खराब सन्निकटन (approximation) होता है। यदि आप एक खराब अनुमान के आधार पर कलाकार को बहुत अधिक धकेलते हैं, तो पेंटिंग अजीब या विकृत हो सकती है। इसके अलावा, इस विधि के लिए अक्सर कलाकार को अपने ही मस्तिष्क (न्यूरल बैकप्रोपैगेशन) के माध्यम से "पीछे की ओर सोचने" की आवश्यकता होती है, जो गणनात्मक रूप से भारी है।

3. LiDAR समाधान: "लुकअहेड" रणनीति

इस पेपर के लेखकों ने एक चतुर तरकीब निकाली। वर्तमान बिखरी हुई पेंटिंग से भविष्य की भविष्यवाणी करने के बजाय, वे कुछ अलग करते हैं:

चरण A: "लुकअहेड" स्केच (फेज 1)
मुख्य पेंटिंग शुरू होने से पहले, कलाकार आपके प्रॉम्प्ट के आधार पर कुछ रफ ड्राफ्ट (मान लीजिए 50) जल्दी से स्केच करता है। ये "लुकअहेड सैंपल्स" हैं। ये एकदम सटीक नहीं हैं, लेकिन वे संकेत देते हैं कि अंतिम छवि कैसी हो सकती है।

  • रिवॉर्ड: एक जज (रिवॉर्ड फंक्शन) इन 50 रफ ड्राफ्ट्स को देखता है और उन्हें स्कोर देता है। "इस ड्राफ्ट में एक शानदार पक्षी है, लेकिन मोटरसाइकिल अजीब है। इसमें एक परफेक्ट मोटरसाइकिल है।"

चरण B: कंपास के साथ मुख्य पेंटिंग (फेज 2)
अब, कलाकार शून्य से वास्तविक पेंटिंग शुरू करता है। काम करते समय, वे न केवल अपने वर्तमान बिखरे हुए कैनवास को देखते हैं, बल्कि वे पहले बनाए गए उन 50 रफ ड्राफ्ट्स को भी देखते हैं।

  • जादू: पेंटिंग प्रक्रिया एक सरल नियम द्वारा निर्देशित होती है: "उन रफ ड्राफ्ट्स की ओर अपना ब्रश चलाएं जिन्हें उच्च स्कोर मिले हैं, और उनसे दूर हटें जिन्हें कम स्कोर मिले हैं।"

यह विशेष क्यों है?

  • कोई बैकट्रैकिंग नहीं: कलाकार को पूरी पेंटिंग को 50 बार फिर से सिम्युलेट करने की आवश्यकता नहीं है। वे बस पहले से बने रफ ड्राफ्ट्स का उपयोग एक मानचित्र के रूप में करते हैं।
  • भारी गणित की आवश्यकता नहीं: पेपर का दावा है कि यह विधि जटिल न्यूरल नेटवर्क गणनाओं के बजाय सरल गणित (जैसे दूरी मापना) का उपयोग करके मार्गदर्शन की गणना करती है। यह उत्तर खोजने के लिए सुपरकंप्यूटर के बजाय एक साधारण कंपास का उपयोग करने जैसा है।
  • गति: क्योंकि उन्होंने रफ ड्राफ्ट्स को तेजी से बनाया (एक फास्ट सॉल्वर का उपयोग करके), पूरी प्रक्रिया बहुत तेज है। पेपर का दावा है कि यह वर्तमान सर्वोत्तम तरीकों की तुलना में 9.5 गुना तेज़ है और समान उच्च गुणवत्ता प्राप्त करता है।

उदाहरण: मानचित्र के साथ हाइकिंग (Hiking)

  • पुरानी विधि (ग्रेडिएंट गाइडेंस): आप कोहरे में हाइकिंग कर रहे हैं। सबसे अच्छे रास्ते को खोजने के लिए, आप हर उस संभावित रास्ते की कल्पना करने की कोशिश करते हैं जो आप ले सकते हैं, प्रत्येक के स्कोर की गणना करते हैं, और फिर अपना कदम समायोजित करते हैं। यह थका देने वाला और धीमा है।
  • LiDAR विधि: हाइकिंग शुरू करने से पहले, आप ड्रोन भेजकर आगे के इलाके की 50 त्वरित तस्वीरें लेते हैं। आप मानचित्र पर सबसे अच्छे स्थानों को चिह्नित करते हैं। हाइकिंग करते समय, आप बस अपने मानचित्र को देखते हैं और "अच्छी" तस्वीरों की ओर और "खराब" तस्वीरों से दूर चलते हैं। आपको भविष्य की कल्पना करने की आवश्यकता नहीं है; आप बस पहले से बने मानचित्र का अनुसरण करते हैं।

परिणाम

इस पेपर का परीक्षण लोकप्रिय इमेज जनरेटर्स (जैसे SDXL) पर किया गया।

  • गुणवत्ता: छवियां प्रॉम्प्ट का पालन करने में (जैसे वस्तुओं की संख्या सही होना, रंगों का मिलान करना) पिछले तरीकों की तुलना में बेहतर थीं।
  • दक्षता: यह काफी तेज़ था और इसने बहुत कम कंप्यूटर मेमोरी का उपयोग किया।
  • बहुमुखी प्रतिभा: यह तब भी अच्छी तरह से काम करता है जब "रफ ड्राफ्ट्स" बहुत त्वरित और सरल थे, जिससे सिद्ध हुआ कि एक शानदार अंतिम परिणाम पाने के लिए आपको पूर्ण प्रीव्यू की आवश्यकता नहीं है।

संक्षेप में, LiDAR डिफ्यूजन मॉडल को ड्राइंग शुरू करने से पहले संभावित भविष्य का एक "चीट शीट" देने का एक तरीका है, जिससे यह बिना किसी भारी गणना के, तेजी से और कुशलता से खुद को सर्वोत्तम परिणाम की ओर मोड़ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →