← नवीनतम पेपर
🤖 AI

NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices

NanoFLUX एक 2.4B पैरामीटर वाला टेक्स्ट-टू-इमेज मॉडल है जिसे ट्रांसफॉर्मर प्रूनिंग, ResNet-आधारित टोकन डाउनसैंपलिंग और विजुअल-सिग्नल-गाइडेड टेक्स्ट एनकोडर डिस्टिलेशन वाली एक प्रोग्रेसिव कंप्रेशन पाइपलाइन के माध्यम से 17B FLUX.1-Schnell से डिस्टिल किया गया है, जो मोबाइल उपकरणों पर लगभग 2.5 सेकंड में उच्च-गुणवत्ता वाली इमेज जनरेशन सक्षम बनाता है।

मूल लेखक: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है, FLUX.1-Schnell, जो सबसे स्वादिष्ट, जटिल और दृष्टिगत रूप से शानदार भोजन (चित्र) बनाने में सक्षम है। यह शेफ एक जीनियस है, लेकिन यह बहुत विशाल भी है: इसका वजन 17 अरब "इकाइयों" (पैरामीटर्स) के बराबर है और इसे संचालित करने के लिए एक विशाल, औद्योगिक आकार की रसोई (शक्तिशाली क्लाउड सर्वर) की आवश्यकता होती है। आप इस शेफ को अपने छोटे से अपार्टमेंट (एक मोबाइल फोन) में नहीं ले जा सकते क्योंकि रसोई बहुत बड़ी है, बिजली का बिल बहुत अधिक है, और शेफ बहुत धीरे काम करता है जिससे जल्दी खाना तैयार नहीं हो पाता।

NanoFLUX ही इसका समाधान है। यह एक नन्हे, अत्यंत कुशल प्रशिक्षु शेफ (apprentice chef) को बनाने जैसा है जो लगभग उसी तरह के स्वादिष्ट भोजन बना सकता है जैसे मास्टर शेफ बनाता है, लेकिन यह आपकी जेब में समा सकता है और कुछ ही सेकंड में खाना तैयार कर सकता है।

यहाँ यह पेपर बताता है कि उन्होंने इस नन्हे शेफ को कैसे बनाया, जिसमें तीन मुख्य तरकीबों का उपयोग किया गया है:

1. "कचरा सफाई" (अनावश्यक हिस्सों को हटाना - Pruning Redundant Parts)

मास्टर शेफ के पास 12 अरब "न्यूरॉन्स" (डिफ्यूजन ट्रांसफॉर्मर) वाला एक मस्तिष्क है। शोधकर्ताओं ने महसूस किया कि इनमें से कई न्यूरॉन्स या तो वही काम दोहरा रहे थे या वे कुछ खास काम नहीं कर रहे थे।

  • उपमा: कल्पना कीजिए कि एक पुस्तकालय में 12 मिलियन किताबें हैं, लेकिन उनमें से 10 मिलियन किताबें केवल उन्हीं तीन पन्नों की फोटोकॉपी हैं।
  • समाधान: उन्होंने एक स्मार्ट स्कैनर का उपयोग किया ताकि डुप्लिकेट किताबों को ढूँढा जा सके और उन्हें हटाया जा सके। उन्होंने यह भी महसूस किया कि कुछ "शेफ" (अटेंशन हेड्स) बिल्कुल एक ही काम कर रहे थे, इसलिए उन्होंने अतिरिक्त शेफ को निकाल दिया। उन्होंने अन्य शेफ जो समान कार्य कर रहे थे, उन्हें एक 'सुपर-शेफ' में मिला दिया।
  • परिणाम: उन्होंने इस मस्तिष्क को 12 अरब इकाइयों से घटाकर केवल 2 अरब कर दिया, बिना एक शानदार भोजन बनाने की क्षमता खोए।

2. "ज़ूम-आउट, ज़ूम-इन" रणनीति (टोकन डाउनसैंपलिंग - Token Downsampling)

जब शेफ किसी चित्र को फिर से बनाने के लिए उसे देखता है, तो वह आमतौर पर पूरे समय हर एक पिक्सेल (या "टोकन") को पूर्ण रिज़ॉल्यूशन पर देखता है। यह धीमा और थका देने वाला है।

  • उपमा: कल्पना कीजिए कि आप एक परिदृश्य (landscape) पेंट कर रहे हैं। शुरुआत में, आपको पेड़ के हर एक पत्ते को देखने की आवश्यकता नहीं है; आपको बस जंगल और पहाड़ों का सामान्य आकार देखने की आवश्यकता है। आपको केवल तभी ज़ूम इन करने और पत्तों को पेंट करने की आवश्यकता होती है जब आप बारीक विवरण जोड़ रहे हों।
  • समाधान: NanoFLUX एक विशेष "ResNet" लेंस का उपयोग करता है। चित्र बनाने के शुरुआती चरणों में, यह चित्र को दूर से (लो रिज़ॉल्यूशन में) देखता है, जो बहुत तेज़ है। यह केवल तभी उच्च-रिज़ॉल्यूशन, क्लोज-अप दृश्य पर स्विच करता है जब बारीकी से विवरण जोड़ने का समय आता है।
  • परिणाम: शेफ पूरी तस्वीर को घूरने में कम और उन चीजों पर अधिक ध्यान केंद्रित करने में अधिक समय बिताता है जो महत्वपूर्ण हैं, जिससे यह प्रक्रिया बहुत तेज़ हो जाती है।

3. "स्मार्ट सहायक" (टेक्स्ट एनकोडर डिस्टिलेशन - Text Encoder Distillation)

मास्टर शेफ के पास निर्देशों को समझने के लिए एक विशाल विश्वकोश (एक 5-बिलियन-यूनिट टेक्स्ट एनकोडर) भी है। यदि आप कहते हैं "टोपी पहने हुए एक बिल्ली," तो विश्वकोश को सटीक रूप से पता होना चाहिए कि इसका क्या अर्थ है।

  • उपमा: मास्टर शेफ के पास 5-बिलयन पृष्ठों का शब्दकोश है। प्रशिक्षु के पास केवल 330-मिलियन पृष्ठों का शब्दकोश है।
  • समाधान: प्रशिक्षु को केवल एक छोटा शब्दकोश देने के बजाय, उन्होंने प्रशिक्षु को मास्टर के नोट्स को पढ़ना सिखाया। उन्होंने प्रशिक्षु को वे दृश्य संकेत दिखाए जो मास्टर शेफ ने निर्देशों को पढ़ते समय देखे थे। इस तरह, छोटा शब्दकोश विशाल शब्दकोश की तरह ही शब्दों के "भाव" और अर्थ को समझना सीख जाता है, बिना सभी अतिरिक्त पृष्ठों की आवश्यकता के।
  • परिणाम: मॉडल का टेक्स्ट समझने वाला हिस्सा 5 बिलियन इकाइयों से घटकर 330 मिलियन हो गया, लेकिन फिर भी यह आपके प्रॉम्प्ट्स को पूरी तरह से समझता है।

अंतिम परिणाम

इन तीन तरकीबों को मिलाकर, शोधकर्ताओं ने NanoFLUX बनाया।

  • आकार: यह एक विशाल 17 बिलियन पैरामीटर वाले मॉडल से एक छोटे 2.4 बिलियन पैरामीटर वाले मॉडल में बदल गया (लगभग 7 गुना छोटा)।
  • गति: एक मोबाइल फोन पर, यह लगभग 2.5 सेकंड में एक उच्च-गुणवत्ता वाला चित्र (512x512 पिक्सेल) बना सकता है।
  • गुणवत्ता: पेपर का दावा है कि इसके द्वारा बनाए गए चित्र विशाल, महंगे क्लाउड संस्करण द्वारा बनाए गए चित्रों के लगभग समान दिखते हैं।

संक्षेप में, उन्होंने केवल मॉडल को छोटा नहीं किया; उन्होंने इसे इस बारे में अधिक स्मार्ट बनाया कि यह कैसे काम करता है, यह साबित करते हुए कि सुंदर AI आर्ट बनाने के लिए अब आपको सुपरकंप्यूटर की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →