InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting
InverFill एक वन-स्टेप इनवर्जन विधि है जो मास्क किए गए चित्रों से सिमेंटिक जानकारी को फ्यू-स्टेप डिफ्यूजन मॉडल्स के प्रारंभिक शोर (initial noise) में इंजेक्ट करती है, जिससे बिना मॉडल रिट्रेनिंग या रियल-इमेज सुपरविजन के हाई-फिडेलिटी और आर्टिफैक्ट-मुक्त इनपेंटिंग संभव हो पाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुंदर फोटो है, लेकिन किसी ने उसके एक हिस्से पर काले मार्कर से लकीरें खींच दी हैं। आप इसे ठीक करना चाहते हैं। आप एक AI से पूछते हैं, "इस खाली जगह को घास पर बैठे एक कुत्ते से भर दो।"
अतीत में, AI कलाकार धीमे, सूक्ष्म चित्रकारों की तरह थे। वे एक आदर्श कुत्ता बना सकते थे, लेकिन उन्हें वहां तक पहुँचने के लिए 50 या 100 ब्रशस्ट्रोक (कदम) लगते थे। यदि आप उनसे इसे केवल 5 स्ट्रोक में करने के लिए कहते, तो वे घबरा जाते। वे एक खाली, रैंडम कैनवास से शुरुआत करते, बेतरतीब ढंग से अनुमान लगाते और अंत में एक धुंधला सा परिणाम देते जो बाकी तस्वीर से मेल नहीं खाता। कुत्ता आलू जैसा दिख सकता था, या घास आसमान में तैरती हुई दिख सकती थी।
InverFill एक नया टूल है जो इन "तेज़ चित्रकारों" को सिखाता है कि कैसे केवल कुछ ही स्ट्रोक में एक बेहतरीन काम किया जाए।
यह कैसे काम करता है, यहाँ कुछ सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "खाली कैनवास" की गलती
सामान्य रूप से, जब कोई AI किसी फोटो को ठीक करने की कोशिश करता है, तो वह एक ऐसे कैनवास से शुरुआत करता है जो स्टैटिक नॉइज़ (जैसे पुराने टीवी पर दिखने वाली "झिलमिलाहट") से ढका होता है।
- धीमा तरीका: यदि AI के पास 50 स्टेप्स हैं, तो वह धीरे-धीरे उस स्टैटिक को एक कुत्ते में बदल सकता है, और जैसे-जैसे वह आगे बढ़ता है, आकार और रंग को एडजस्ट करता जाता है। वह आसपास की घास को देख सकता है और कह सकता है, "ओह, कुत्ते को घास के कारण हरा रंग मिलना चाहिए।"
- तेज़ तरीका: यदि AI के पास केवल 2 या 4 स्टेप्स हैं, तो उसके पास अपनी गलतियों को सुधारने का समय नहीं होता। यदि वह रैंडम स्टैटिक से शुरू करता है, तो वह तुरंत गलत अनुमान लगाता है, और उसे सुधारने का समय नहीं बचता। परिणाम एक ग्लिच वाला, बेमेल पैच होता है।
2. समाधान: "स्मार्ट ब्लूप्रिंट" (इनवर्जन)
रैंडम स्टैटिक से शुरुआत करने के बजाय, InverFill एक स्मार्ट ब्लूप्रिंट जनरेटर की तरह काम करता है।
AI द्वारा पेंटिंग शुरू करने से पहले ही, InverFill आपकी फोटो के मौजूदा हिस्सों को देखता है (वे हिस्से जो मार्कर से ढके नहीं हैं)। यह पूछता है: "इस विशिष्ट बैकग्राउंड को बनाने के लिए किस तरह का नॉइज़ होगा?"
इसके बाद यह एक कस्टमाइज्ड शुरुआती बिंदु (एक "नॉइज़ लेटेंट") बनाता है जो पहले से ही आपकी फोटो के टेक्सचर, लाइटिंग और स्टाइल को "जानता" है।
- उपमा: कल्पना कीजिए कि आप लेगो (Lego) का एक किला बना रहे हैं।
- पुराना तरीका: आप मेज पर मिक्स किए हुए लेगो का एक बाल्टी भर सामान डालते हैं और 5 सेकंड में एक टावर बनाने की कोशिश करते हैं। वह बिखर जाता है।
- InverFill का तरीका: आप किले के आधार को देखते हैं जो पहले से बना हुआ है। आप अगला लेयर शुरू करने से पहले लेगो को सॉर्ट (छाँटना) करते हैं, ताकि आपके पास केवल वही लाल ईंटें हों जिनकी आपको आवश्यकता है। अब, आप अगले 5 सेकंड में टावर का बाकी हिस्सा बना सकते हैं, और यह बिल्कुल फिट बैठता है।
3. सीक्रेट सॉस: "री-ब्लेंडिंग" और "गौसियन रेगुलराइजेशन"
पेपर में इसे काम करने के लिए दो चतुर तरीकों का उल्लेख किया गया है:
री-ब्लेंडिंग (The "Don't Leak" Rule - लीक न होने का नियम):
जब InverFill ब्लूप्रिंट बनाने के लिए फोटो को देखता है, तो उसे सावधान रहना पड़ता है। इसे अनजाने में दृश्य भागों से जानकारी छिपे हुए भागों में "लीक" नहीं करनी चाहिए।- उपमा: कल्पना कीजिए कि आप एक डिब्बे को देखकर यह अनुमान लगाने की कोशिश कर रहे हैं कि उसके अंदर क्या है। आप गलती से कागज के छेद से उपहार को नहीं देखना चाहते! InverFill के पास एक विशेष फ़िल्टर है जो कहता है, "ठीक है, मैं जानता हूँ कि बॉक्स कैसा दिखता है, लेकिन उस हिस्से के लिए जिसे मैं देख नहीं सकता, मैं बस कुछ रैंडम, न्यूट्रल नॉइज़ डाल दूँगा ताकि मैं नकल न करूँ।"
गौसियन रेगुलराइजेशन (The "Standard Shape" Rule - मानक आकार का नियम):
AI मॉडल उम्मीद करते हैं कि नॉइज़ एक विशिष्ट तरीके से दिखेगा (जैसे एक परफेक्ट बेल कर्व)। यदि ब्लूप्रिंट जो InverFill बनाता है वह बहुत अजीब दिखता है, तो AI भ्रमित हो जाता है।- उपमा: AI को एक ऐसे शेफ के रूप में सोचें जो केवल पूरी तरह से गोल अंडों के साथ खाना बनाना जानता है। यदि आप उन्हें एक चौकोर अंडा देते हैं, तो वे उसे जला देते हैं। InverFill यह सुनिश्चित करता है कि जो "नॉइज़ अंडा" वह बनाता है वह पूरी तरह से गोल और स्टैंडर्ड हो, ताकि शेफ (AI) बिना जलाए उसे पूरी तरह से पका सके।
4. परिणाम: बिना समझौते के गति
पेपर दिखाता है कि InverFill प्रक्रिया में लगभग शून्य समय (0.06 सेकंड, जो एक पलक झपकने से भी कम है) जोड़ता है।
- पहले: आपको हाई क्वालिटी (धीमा, 30 स्टेप्स) या फास्ट (कम क्वालिटी, 2 स्टेप्स) के बीच चुनना पड़ता था।
- InverFill के साथ: आपको 2 स्टेप्स में हाई क्वालिटी मिलती है।
यह तेज़ AI मॉडल्स (जैसे SDXL-Turbo या SANA-Sprint) को धीमे, विशेष विशेषज्ञों की तरह फोटो ठीक करने की अनुमति देता है, बिना उन्हें फिर से ट्रेन किए या नए कौशल सिखाए। यह एक धावक को पंख देने जैसा है; वे पहले से ही तेज़ थे, लेकिन अब वे उड़ सकते हैं।
सारांश
InverFill AI इमेज रिपेयर के लिए एक "प्री-गेम" टूल है। AI को रैंडम अंदाज़े लगाने देने के बजाय, यह AI को एक स्मार्ट, प्री-सॉर्टेड शुरुआती बिंदु देता है जो बाकी फोटो से मेल खाता है। यह AI को बिना किसी धुंधलेपन के, पूरी सामंजस्य के साथ, पलक झपकते ही काम पूरा करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।