← नवीनतम पेपर
💻 computer science

ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

ImageRAGTurbo, रिट्रीवल-ऑगमेंटेड कंडीशनिंग के साथ डिफ्यूजन मॉडल्स को कुशलतापूर्वक फाइन-ट्यून करके वन-स्टेप टेक्स्ट-टू-इमेज जनरेशन में लेटेंसी और क्वालिटी के बीच के ट्रेड-ऑफ्स को संबोधित करता है, जो डीनोइजिंग प्रक्रिया को निर्देशित करने और एक ही स्टेप में हाई-फिडेलिटी इमेज बनाने के लिए प्रासंगिक टेक्स्ट-इमेज पेयर्स का लाभ उठाता है।

मूल लेखक: Peijie Qiu, Hariharan Ramshankar, Arnau Ramisa, René Vidal, Amit Kumar K C, Vamsi Salaka, Rahul Bhagat

प्रकाशित 2026-02-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Peijie Qiu, Hariharan Ramshankar, Arnau Ramisa, René Vidal, Amit Kumar K C, Vamsi Salaka, Rahul Bhagat

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी के द्वारा दिए गए विवरण के आधार पर एक चित्र बनाने की कोशिश कर रहे हैं, जैसे कि "पानी पर एक नाव और पृष्ठभूमि में एक लाइटहाउस।"

पुराना तरीका (मानक AI):
एक मानक AI इमेज जनरेटर को एक बहुत ही प्रतिभाशाली लेकिन धीमे चित्रकार के रूप में सोचें। आपका चित्र बनाने के लिए, यह चित्रकार एक कैनवास से शुरुआत करता है जो स्टैटिक (जैसे टीवी पर दिखने वाला शोर/झिलमिलाहट) से ढका होता है। उन्हें धीरे-धीरे, चरण-दर-चरण, उस शोर को हटाना होता है और विवरण जोड़ने होते हैं। एक अच्छा परिणाम पाने के लिए उन्हें ब्रश के 25 से 50 "फेरों" (sweeps) की आवश्यकता होती है। यदि वे जल्दबाजी करते हैं और केवल एक या दो फेरे लेते हैं, तो चित्र धुंधला आता है, या वे लाइटहाउस पेंट करना पूरी तरह से भूल सकते हैं।

"टर्बो" की समस्या:
हाल ही में, वैज्ञानिकों ने "टर्बो" चित्रकार बनाए जो केवल एक फेरे में एक चित्र पूरा कर सकते हैं। यह अविश्वसनीय रूप से तेज़ है! लेकिन एक पेंच है: क्योंकि वे इतनी तेज़ी से काम कर रहे हैं, वे अक्सर विवरणों को छोड़ देते हैं। वे एक नाव तो बना सकते हैं, लेकिन वह एक धब्बे जैसी दिखती है, या वे लाइटहाउस बनाना भूल जाते हैं। यह एक वीडियो गेम में स्पीडरनर की तरह है जो रिकॉर्ड समय में स्तर को पूरा करता है लेकिन सभी महत्वपूर्ण कटसीन और आइटम छोड़ देता है।

समाधान: ImageRAGTurbo (द "रेफरेंस लाइब्रेरी" पेंटर)
इस शोध पत्र के लेखकों ने एक चतुर तरकीब निकाली है जिससे "टर्बो" चित्रकार तेज़ और सटीक दोनों बन सके।

यह कैसे काम करता है, इस सरल उपमा का उपयोग करते हुए:

1. "रेफरेंस लाइब्रेरी" (रिट्रीवल/खोज)

कल्पना कीजिए कि टर्बो चित्रकार द्वारा ब्रश उठाने से पहले ही, उनके पास एक जादुई सहायक होता है। आप सहायक को अपना प्रॉम्प्ट बताते हैं: "पानी पर एक नाव और एक लाइटहाउस के साथ।"

याददाश्त से नाव कैसी दिखती है, इसका अनुमान लगाने के बजाय, सहायक तुरंत एक विशाल लाइब्रेरी में जाता है, आपके विवरण से मेल खाने वाली नावों और लाइटहाउस की कुछ वास्तविक तस्वीरें ढूंढता है, और उन्हें चित्रकार को सौंप देता है।

2. "सीक्रेट चीट शीट" (H-Space इंजेक्शन)

टर्बो चित्रकार शून्य से काम करने के आदी होते हैं। लेकिन अब, उनके पास संदर्भ तस्वीरें हैं।

  • पुराना तरीका: चित्रकार फोटो को याद करने की कोशिश करता है और फिर पेंट करता है।
  • ImageRAG-Turbo का तरीका: सिस्टम केवल फोटो नहीं दिखाता; यह वास्तव में फोटो के दृश्य रहस्यों को सीधे चित्रकार के मस्तिष्क में "फुसफुसाता" है। यह चित्रकार के आंतरिक "ब्लूप्रिंट" (जिसे H-space कहा जाता है) को समायोजित करता है ताकि चित्रकार को शुरू करने से पहले ही पता हो कि एक नाव और लाइटहाउस कैसा दिखना चाहिए।

3. "स्मार्ट अडैप्टर" (द ग्लू/गोंद)

शुरुआती प्रयोगों में, टीम ने संदर्भ तस्वीरों को चित्रकार के मस्तिष्क में पेस्ट करने की कोशिश की। इससे मदद मिली, लेकिन यह तेल और पानी को मिलाने जैसा था; कभी-कभी संदर्भ तस्वीरें आपके विशिष्ट अनुरोध के साथ टकरा जाती थीं।

इसलिए, उन्होंने एक स्मार्ट अडैप्टर बनाया। इसे एक सुपर-स्मार्ट अनुवादक या कंडक्टर के रूप में सोचें।

  • यह आपके अनुरोध को देखता है ("एक नाव...").
  • यह उन संदर्भ तस्वीरों को देखता है जो उसने खोजी हैं।
  • यह तय करता है कि संदर्भ का कितना हिस्सा उपयोग करना है। यदि आपका प्रॉम्प्ट बहुत विशिष्ट है, तो यह संदर्भ का भारी उपयोग करता है। यदि आपका प्रॉम्प्ट अद्वितीय है, तो यह संदर्भ का हल्का उपयोग करता है।
  • यह उन्हें पूरी तरह से मिला देता है ताकि चित्रकार एक बिल्कुल नया चित्र बनाए जो आपके विवरण में फिट बैठता हो और वास्तविक भी दिखे, और वह भी एक ही ब्रशस्ट्रोक में।

यह एक बड़ी बात क्यों है?

  • गति: इसमें उतना ही समय लगता है जितना "टर्बो" चित्रकार को (लगभग 100 मिलीसेकंड, या पलक झपकने से भी कम)।
  • गुणवत्ता: यह लगभग उन 50-चरण वाले धीमे चित्रकारों जितने अच्छे चित्र बनाता है, लेकिन इसकी गति तेज़ वाले चित्रकारों जैसी होती है।
  • सटीकता: यह AI को "भ्रमित" होने (लाइटहाउस को भूल जाने या नाव के बजाय कार बनाने) से रोकता है।

सारांश में:
ImageRAGTurbo एक रेस कार ड्राइवर को रेस शुरू होने से ठीक पहले GPS और ट्रैक का नक्शा देने जैसा है। उन्हें यह समझने के लिए धीमा होने की ज़रूरत नहीं है कि कहाँ जाना है; वे पूरी गति से (एक स्टेप में) चल सकते हैं जबकि उन्हें पता होता है कि हर मोड़ और बाधा कहाँ है, जिससे यह सुनिश्चित होता है कि वे दुर्घटनाग्रस्त न हों या फिनिश लाइन न चूकें।

यह तकनीक का अर्थ है कि भविष्य में, आप वीडियो गेम, फिल्मों या डिज़ाइन के लिए तुरंत जटिल चित्र बनाने के लिए AI से कह सकते हैं, बिना इसके इंतज़ार किए कि वह लंबे समय तक "सोचे" या आपको धुंधला परिणाम मिले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →