← नवीनतम पेपर
⚡ electrical engineering

Amortized Guidance for Image Inpainting with Pretrained Diffusion Models

यह शोध पत्र एमोर्टाइज्ड इनपेंटिंग विद डिफ्यूजन (AID) को प्रस्तुत करता है, जो एक निश्चित प्रीट्रेन डिफ्यूजन बैकबोन पर एक छोटे, पुन: प्रयोज्य गाइडेंस मॉड्यूल को प्रशिक्षित करने की एक विधि है ताकि प्रति-इन्स्टेंस ऑप्टिमाइजेशन के बिना कुशल, उच्च-गुणवत्ता वाली इमेज इनपेंटिंग प्राप्त की जा सके, जो नियत (डिटरमिनिस्टिक) गाइडेंस और सीखने योग्य रैंडमाइज्ड उद्देश्यों के बीच सेतु बनाने के लिए एक नवीन गौसियन फॉर्मूलेशन और एक्टर-क्रिटिक एल्गोरिदम का लाभ उठाता है।

मूल लेखक: Yilie Huang, Xun Yu Zhou

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilie Huang, Xun Yu Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Amortized Guidance for Image Inpainting with Pretrained Diffusion Models" (AID) शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ स्पष्टीकरण दिया गया है।

समस्या: "ठीक करने वाला" दुविधा (The "Fix-It" Dilemma)

कल्पना कीजिए कि आपके पास एक मास्टर पेंटर (एक Pretrained Diffusion Model) है जो शून्य से सुंदर परिदृश्य (landscapes) बनाने में अविश्वसनीय रूप से प्रतिभाशाली है। अब, कल्पना कीजिए कि कोई आपको एक परिदृश्य की फोटो देता है जहाँ से एक बड़ा हिस्सा फाड़ दिया गया है (एक Masked Image)। आपका लक्ष्य उस गायब हिस्से को इस तरह भरना है कि वह एकदम सही लगे और बाकी चित्र के साथ मेल खाए।

वर्तमान में, इसे करने के दो मुख्य तरीके हैं, और दोनों में एक बड़ी कमी है:

  1. "कस्टम प्रशिक्षु" दृष्टिकोण (The "Custom Apprentice" Approach): आप एक नया, विशेष रूप से प्रशिक्षित प्रशिक्षु (apprentice) काम पर रखते हैं जो केवल फटी हुई तस्वीरों को ठीक करना सीखता है।
    • कमी: इस प्रशिक्षु को प्रशिक्षित करने में बहुत समय और संसाधनों की आवश्यकता होती है। इसके अलावा, यदि आप बाद में किसी अलग प्रकार की टूट-फूट को ठीक करना चाहते हैं, तो आपको एक अलग प्रशिक्षु की आवश्यकता हो सकती है।
  2. "ऑन-द-फ्लाई" दृष्टिकोण (The "On-the-Fly" Approach): आप मास्टर पेंटर से फोटो को ठीक करने के लिए कहते हैं। लेकिन क्योंकि पेंटर को विशेष रूप से "फटने" (tearing) के लिए प्रशिक्षित नहीं किया गया है, इसलिए उसे रुकना पड़ता है, बहुत गहराई से सोचना पड़ता है, और छेद को कैसे भरना है यह जानने के लिए हर एक फोटो के लिए एक जटिल, चरण-दर-चरण गणना करनी पड़ती है।
    • कमी: यह धीमा है। यदि आपके पास 1,000 फोटो हैं, तो पेंटर को हर फोटो के लिए यह भारी गणना 1,000 अलग-अलग बार करनी होगी।

समाधान: AID (द "स्मार्ट गाइड")

लेखक एक बीच का रास्ता प्रस्तावित करते हैं जिसे AID (Amortized Inpainting with Diffusion) कहा जाता है।

AID को एक स्मार्ट गाइड के रूप में सोचें जो मास्टर पेंटर के बगल में खड़ा होता है।

  • मास्टर पेंटर बिल्कुल वैसा ही रहता है। हम उन्हें फिर से प्रशिक्षित नहीं करते या उनके दिमाग को नहीं बदलते। वे वही करते हैं जो वे सबसे अच्छा करते हैं।
  • स्मार्ट गाइड एक छोटा, हल्का सहायक है। हम इस गाइड को पहले से (offline) हजारों फटी हुई तस्वीरों के उदाहरणों पर प्रशिक्षित करते हैं।
  • यह कैसे काम करता है: जब एक नई फटी हुई फोटो आती है, तो मास्टर पेंटर पेंटिंग शुरू करता है। स्मार्ट गाइड पेंटर को निर्देश फुसफुसाता है, जैसे, "हे, फोटो के दृश्य भाग को देखो; सुनिश्चित करो कि नया पेंट मौजूदा पेड़ों की शैली से मेल खाता हो।"

एक बार जब गाइड प्रशिक्षित हो जाता है, तो वह किसी भी फटी हुई फोटो को तुरंत ठीक करने में मदद कर सकता है। हमें हर नई फोटो के लिए रुककर सोचने की आवश्यकता नहीं है; गाइड बस अपना काम करता है।

गुप्त नुस्खा: "रैंडमाइज्ड रिहर्सल" (The "Randomized Rehearsal")

इस शोध पत्र का सबसे कठिन हिस्सा वह गणित है जिसके माध्यम से उन्होंने गाइड को प्रशिक्षित किया।

आमतौर पर, गाइड को सटीक निर्देश देने के लिए सिखाने हेतु, आपको हर एक फोटो के लिए एक विशाल, असंभव गणितीय पहेली को हल करना होगा। लेखकों ने महसूस किया कि सीधे "परफेक्ट" पहेली को हल करने की कोशिश करना बहुत कठिन है।

इसलिए, उन्होंने एक चतुर ट्रिक का आविष्कार किया:

  • उपमा: कल्पना कीजिए कि आप एक गाइड को एक विशिष्ट सड़क पर कार चलाने में माहिर बनाना चाहते हैं। हर सेकंड स्टीयरिंग का सटीक कोण (angle) निकालने की कोशिश करने के बजाय (जो कठिन है), आप गाइड को ऐसी ब्लिंडर्स (blinders) पहनकर सड़क पर गाड़ी चलाने की अनुमति देते हैं जो स्टीयरिंग व्हील को बेतरतीब ढंग से (randomly) डगमगाते (wobble) बनाते हैं।
  • जादू: लेखकों ने गणितीय रूप से सिद्ध किया कि यदि आप गाइड को इस "डगमगाते, रैंडम" ड्राइविंग को संभालने के लिए प्रशिक्षित करते हैं, तो उन सभी डगमगाती गतिविधियों का औसत (average) ठीक उसी चिकने रास्ते की ओर इशारा करेगा जिसे आप वास्तव में चाहते थे।
  • परिणाम: उन्होंने इस "रैंडम वबल" (random wobble) विधि का उपयोग करके गाइड को प्रशिक्षित करने के लिए Continuous-Time Actor-Critic (एक प्रकार का Reinforcement Learning) नामक विधि का उपयोग किया। एक बार प्रशिक्षण पूरा हो जाने के बाद, वे बस "औसत" (चिकना रास्ता) लेते हैं और उसे गाइड के निर्देशों के रूप में उपयोग करते हैं। यह प्रशिक्षण को संभव बनाता है और अंतिम परिणाम को सटीक बनाता है।

उन्होंने क्या पाया (परिणाम)

लेखकों ने प्रसिद्ध इमेज डेटासेट्स (AFHQv2, FFHQ, और ImageNet) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • गति बनाम गुणवत्ता: AID "ऑन-द-फ्लाई" विधियों (जैसे RePaint) की तुलना में बहुत तेज़ था क्योंकि इसे हर नई फोटो के लिए भारी गणना नहीं करनी पड़ी। वास्तव में, यह बेहतर गुणवत्ता वाली छवियां बनाने के साथ-साथ मौजूदा सर्वोत्तम विधि की तुलना में लगभग 10 गुना तेज़ था।
  • छोटा फुटप्रिंट: "स्मार्ट गाइड" (प्रशिक्षण योग्य हिस्सा) अविश्वसनीय रूप से छोटा है। यह मूल मास्टर पेंटर के आकार में 1% से भी कम जोड़ता है। यह एक लाइब्रेरी की किताब को फिर से लिखने के बजाय उस पर एक स्टिकी नोट लगाने जैसा है।
  • बहुमुखी प्रतिभा (Versatility): एक प्रकार के छेद (tear) पर प्रशिक्षित एक ही गाइड विभिन्न प्रकार के छेदों (केंद्र के छेद, स्ट्रिप के छेद) पर भी पूरी तरह से काम करता है, बिना पुन: प्रशिक्षित हुए।

सारांश

यह शोध पत्र एक शक्तिशाली AI मॉडल को धीमा किए बिना क्षतिग्रस्त छवियों को ठीक करने का एक तरीका पेश करता है। वे एक छोटे, पुन: प्रयोज्य (reusable) "गाइड" को प्रशिक्षित करके ऐसा करते हैं जो मुख्य AI को निर्देश फुसफुसाता है। उन्होंने गणितीय रूप से सिद्ध किया है कि वे इस गाइड को "रैंडमाइज्ड रिहर्सल" तकनीक का उपयोग करके प्रशिक्षित कर सकते हैं, जिससे यह सुनिश्चित होता है कि अंतिम निर्देश सटीक हों। परिणाम एक ऐसा सिस्टम है जो पिछले तरीकों की तुलना में तेज़, सस्ता और उच्च गुणवत्ता वाले सुधार प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →