← नवीनतम पेपर
💻 computer science

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow एक नवीन क्रॉस-स्पेस फ्लो फॉर्मूलेशन पेश करता है जो शोर वाले लेटेंट इनपुट्स को सीधे पिक्सेल-स्पेस आउटपुट में मैप करके एक-चरण वाली इमेज जनरेशन को सक्षम बनाता है, जिससे यह इन्फरेंस के दौरान एक अलग डिकोडर की आवश्यकता को समाप्त करने के लिए लेटेंट रिप्रेजेंटेशन की दक्षता को सीधे पिक्सेल-स्पेस सुपरविजन के साथ जोड़ देता है।

मूल लेखक: Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

प्रकाशित 2026-06-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उत्कृष्ट कृति (masterpiece) बनाने की कोशिश कर रहे हैं, लेकिन आपके पास एक बहुत ही विशिष्ट, जटिल कार्यप्रवाह (workflow) है।

पुराना तरीका: "अनुवादक" की समस्या

अधिकांश वर्तमान AI इमेज जनरेटर एक दो-चरणीय अनुवाद प्रक्रिया की तरह काम करते हैं।

  1. रेखाचित्र (लेटेंट स्पेस): पहले, AI एक गुप्त, अमूर्त भाषा (जिसे "लेटेंट स्पेस" कहा जाता है) में छवि का एक मोटा, संकुचित रेखाचित्र (sketch) बनाता है। यह कुशल है क्योंकि यह हर एक पिक्सेल को पेंट करने के बजाय व्यापक, सरल स्ट्रोक के साथ चित्र बनाने जैसा है।
  2. अनुवाद (डिकोडर): फिर, एक अलग टूल (जिसे "डिकोडर" कहा जाता है) को उस कच्चे रेखाचित्र को एक वास्तविक, हाई-डेफिनिशन फोटो में अनुवादित करना होता है।

समस्या: वह AI जो रेखाचित्र बनाता है, उसे "रेखाचित्र की भाषा" बोलने के लिए प्रशिक्षित किया गया है, और अनुवाद करने वाला टूल "साफ रेखाचित्रों" को पढ़ने के लिए प्रशिक्षित है। लेकिन जब AI एक रेखाचित्र बनाता है, तो वह अक्सर थोड़ा अव्यवस्थित या अपूर्ण होता है। अनुवाद करने वाला टूल उन अव्यवस्थित रेखाचित्रों से भ्रमित हो जाता है, जिससे अंतिम छवियां धुंधली या विकृत हो जाती हैं। यह एक ऐसे अनुवादक की तरह है जो केवल शुद्ध फ्रेंच बोलता है, लेकिन जब वक्ता बोलचाल की भाषा (slang) का उपयोग करता है या टाइपिंग में गलती करता है, तो वह उलझ जाता है।

नया तरीका: क्रॉसफ्लो (CrossFlow - "प्रत्यक्ष कलाकार")

यह शोध पत्र CrossFlow नामक एक नई विधि पेश करता है, जो अनुवादक को पूरी तरह से हटा देती है।

रेखाचित्र बनाने और फिर अनुवाद करने के बजाय, CrossFlow एक एकल कलाकार है जो एक अव्यवस्थ, अमूर्त विचार (शोर युक्त रेखाचित्र) लेता है और सीधे एक ही बार में अंतिम फोटो को पेंट करता है

यह इस प्रकार काम करता है, सरल रूपकों का उपयोग करते हुए:

1. "नो-ट्रांसलेशन" ब्रिज (अनुवाद-रहित सेतु)
आमतौर पर, AI मॉडल उन लोगों की तरह होते हैं जो केवल एक भाषा बोल सकते हैं। यदि आप भाषा A (रेखाचित्र) से भाषा B (फोटो) तक जाना चाहते हैं, तो आपको एक शब्दकोश की आवश्यकता होती है। CrossFlow एक प्रतिभाशाली बहुभाषी (polyglot) की तरह है जो भाषा A में एक अस्पष्ट वाक्य सुन सकता है और बिना किसी शब्दकोश के तुरंत भाषा B में एक सटीक वाक्य बोल सकता है।

2. "वन-स्टेप" जादू
अधिकांश इमेज जनरेटर एक छवि को परिष्कृत करने के लिए कई छोटे चरणों का उपयोग करते हैं, जैसे कि एक धुंधली फोटो को धीरे-धीरे स्पष्ट करना। CrossFlow एक "वन-स्टेप" जनरेटर है। यह अव्यवस्थित इनपुट को देखता है और तुरंत अंतिम, स्पष्ट छवि आउटपुट करता है। यह डार्करूम में फोटो को धीरे-धीरे विकसित करने और आधुनिक स्मार्टफोन के साथ तुरंत एक सटीक तस्वीर खींचने के बीच का अंतर है।

3. "वास्तविक" गलतियों के साथ प्रशिक्षण
पुराने तरीके में, "अनुवादक" टूल को पूर्ण, साफ रेखाचित्रों पर प्रशिक्षित किया गया था। लेकिन वास्तविक दुनिया में, उन्हें मिलने वाले रेखाचित्र अव्यवस्थित होते हैं। CrossFlow इसे ठीक करता है क्योंकि यह कलाकार को अव्यवस्थित रेखाचित्रों को देखते हुए प्रशिक्षित करता है। यह शोर (noise) को अनदेखा करना और अंतिम चित्र पर ध्यान केंद्रित करना सीख जाता है। क्योंकि यह प्रशिक्षण के दौरान अंतिम चित्र को देख सकता है, इसलिए यह "परसेप्शन" (क्या यह वास्तविक दिखता है?) और "एडवर्सरियल" (क्या यह एक आलोचक को मूर्ख बना सकता है?) जांचों से भी सीख सकता है, जो पुराना दो-चरणीय तरीका आसानी से नहीं कर सका।

परिणाम

शोधकर्ताओं ने इमेजनेट (ImageNet) के एक विशाल डेटासेट पर इसका परीक्षण किया।

  • गति: यह एक ही चरण (एक "फंक्शन इवैल्यूएशन") में छवियां उत्पन्न करता है।
  • गुणवत्ता: यह छवियों के समान ही तीक्ष्ण और यथार्थवादी चित्र बनाता है जैसा कि सर्वोत्तम मल्टी-स्टेप विधियां बनाती हैं, लेकिन बहुत अधिक तेजी से।
  • बहुमुखी प्रतिभा: यह मुख्य कलाकार (शून्य से छवियां बनाना) के रूप में कार्य कर सकता है या एक सुपर-चार्ज्ड अनुवादक (अन्य AI सिस्टम द्वारा बनाए गए अव्यवस्थित रेखाचित्रों को ठीक करना) के रूप में कार्य कर सकता है।

निचोड़

CrossFlow "मिसमैच" (मेल न खाने की) समस्या को यह समझकर हल करता है कि एक उत्कृष्ट कृति बनाने के लिए आपको एक ही भाषा बोलने की आवश्यकता नहीं है। आप एक मोटे, संकुचित विचार से शुरू कर सकते हैं और सीधे एक शानदार, हाई-डेफिनिशन छवि आउटपुट कर सकते हैं, जिससे उस मध्यस्थ (middleman) को छोड़ दिया जाता है जो आमतौर पर त्रुटियों का कारण बनता है। यह सरल रेखाचित्रों के साथ काम करने की गति और सीधे अंतिम फोटो पर काम करने की गुणवत्ता को जोड़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →