← नवीनतम पेपर
💻 computer science

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image एक नवीन टेक्स्ट-टू-इमेज फाउंडेशन मॉडल है जो एक सिमेंटिक-फर्स्ट डिफ्यूजन प्रतिमान का उपयोग करता है जो पिछले मॉडलों की तुलना में काफी कम प्रशिक्षण कंप्यूट (125K A800 GPU घंटे) के साथ कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जबकि विविध परिनियोजन आवश्यकताओं के लिए स्केलेबल वेरिएंट और डिस्टिल्ड फ्यू-स्टेप संस्करण भी प्रदान करता है।

मूल लेखक: SeFi-Team

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: SeFi-Team

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: दीवारों को पेंट करने से पहले घर बनाना

कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि आपके द्वारा दिए गए विवरण के आधार पर एक उत्कृष्ट कृति (masterpiece) कैसे बनाई जाए।

पुराना तरीका (पारंपरिक AI):
आमतौर पर, ये रोबोट सब कुछ एक साथ सीखने की कोशिश करते हैं। उन्हें एक ही पल में यह समझना पड़ता है कि पेड़ कहाँ जाएगा, आसमान का रंग क्या होगा, पत्तियाँ कैसी दिखेंगी, और छाल का अहसास कैसा होगा। यह एक घर बनाने, दीवारों को पेंट करने और प्लंबिंग लगाने को एक ही समय में करने जैसा है। इसे सही करने में बहुत अधिक समय, ऊर्जा और पैसा (कंप्यूटिंग पावर) लगता है।

SeFi-Image का तरीका (Semantic-First Diffusion):
SeFi-Image की टीम ने महसूस किया कि इंसान इस तरह से पेंट नहीं करते। हम आमतौर पर पहले रूपरेखा (outline) खींचते हैं, फिर विवरण भरते हैं।

  • चरण 1: ब्लूप्रिंट (Semantics): पहले, AI "बड़ी तस्वीर" को समझता है। सूरज कहाँ है? क्या वहाँ एक बिल्ली है? क्या बिल्ली छत पर है? यह छवि का एक साफ, संरचनात्मक ढांचा (skeleton) बनाता है।
  • चरण 2: विवरण (Texture): एक बार जब ढांचा मजबूत हो जाता है, तो AI बिल्ली के बालों, आसमान में बादलों और छत की बनावट को उसमें भर देता है।

यह पेपर Semantic-First Diffusion नामक एक नई विधि पेश करता है। यह AI को "पेंट" की चिंता करने से पहले "ब्लूप्रिंट" वाले हिस्से को हल करने के लिए मजबूर करता है। क्योंकि ब्लूप्रिंट पहले से ही स्पष्ट है, इसलिए विवरण जोड़ने वाले हिस्से का काम आसान हो जाता है।

यह एक बड़ी बात क्यों है

1. यह एक "बजट-अनुकूल" सुपरस्टार है
आमतौर पर, AI को बहुत अच्छी तरह से चित्र बनाने के लिए आपको महीनों तक चलने वाले सुपरकंप्यूटर की आवश्यकता होती है।

  • तुलना: पेपर में Z-Image नामक एक प्रसिद्ध मॉडल का उल्लेख है जिसे प्रशिक्षित करने में एक बड़ी राशि खर्च हुई (314,000 GPU घंटे)।
  • SeFi-Image का परिणाम: उनके सबसे बड़े मॉडल (5 बिलियन पैरामीटर्स) ने केवल 125,000 GPU घंटों का उपयोग करके समान या बेहतर परिणाम प्राप्त किए। यह ऐसा है जैसे आपने केवल 10-20% बिजली के बिल के साथ उतना ही काम किया हो। उन्होंने साबित किया कि यदि आप सीखने की प्रक्रिया को बेहतर तरीके से व्यवस्थित करते हैं, तो उच्च गुणवत्ता वाला परिणाम प्राप्त करने के लिए आपको बहुत अधिक पैसा खर्च करने की आवश्यकता नहीं है।

2. "तीन आकारों" वाला दृष्टिकोण
टीम ने केवल एक विशाल रोबोट नहीं बनाया; उन्होंने तीन बनाए:

  • छोटा वाला (1B): छोटा, तेज़ और आश्चर्यजनक रूप से स्मार्ट। छोटा होने के बावजूद यह निर्देशों का पालन अच्छी तरह से कर सकता है।
  • मध्यम वाला (2B): एक संतुलित विकल्प।
  • बड़ा वाला (5B): भारी काम संभालने वाला।
    यह इसलिए महत्वपूर्ण है क्योंकि अलग-अलग लोगों के पास अलग-अलग कंप्यूटर होते हैं। यदि आपके पास एक शक्तिशाली सर्वर है, तो आप 'बड़े वाले' का उपयोग करेंगे। यदि आपके पास लैपटॉप है, तो आप 'छोटे वाले' का उपयोग कर सकते हैं।

3. यह टेक्स्ट पढ़ने और लिखने में अच्छा है
AI के लिए सबसे कठिन चीजों में से एक है छवि के अंदर टेक्स्ट (जैसे दुकान का साइन या किताब का कवर) बनाना।

  • समस्या: अधिकांश AI में अक्षर उलझे हुए या गलत वर्तनी वाले होते हैं।
  • SeFi-Image का समाधान: उन्होंने AI को "सिंथेटिक डेटा" का एक विशेष आहार दिया। कल्पना कीजिए कि एक मशीन है जो सादे बैकग्राउंड या जटिल लेआउट पर टेक्स्ट की लाखों छवियां उत्पन्न करती है, जिससे AI को ठीक से पता चलता है कि अक्षर कैसे दिखते हैं और उन्हें कहाँ बैठना चाहिए। इसके कारण, SeFi-Image टेक्स्ट को सटीक रूप से दिखाने में बहुत अच्छा है, यहाँ तक कि लंबे और जटिल वाक्यों में भी।

उन्होंने इसे कैसे प्रशिक्षित किया (द "करिकुलम")

पेपर एक स्मार्ट प्रशिक्षण कार्यक्रम का वर्णन करता है, जैसे एक छात्र प्राथमिक विद्यालय से कॉलेज जाता है:

  1. प्रारंभिक शिक्षा (Pre-training): उन्होंने AI को आकृतियों और वस्तुओं की बुनियादी बातें सीखने के लिए लाखों छवियों के साथ सरल विवरण दिखाए।
  2. हाई स्कूल (Continual Training): वे अधिक विशिष्ट निर्देशों का पालन करने के लिए उच्च-गुणवत्ता वाली छवियों पर स्विच कर गए।
  3. कॉलेज (Fine-Tuning): उन्होंने एक बहुत ही सख्त फिल्टर का उपयोग किया ताकि केवल AI को सर्वश्रेष्ठ संभव छवियां दिखाई जा सकें, जिससे उसे केवल एक स्केचर के बजाय एक कलाकार बनना सिखाया जा सके।

उन्होंने मॉडल का एक "टर्बो" संस्करण भी बनाया। इसे एक "फास्ट-फॉरवर्ड" बटन के रूप में सोचें। आमतौर पर AI को एक छवि बनाने में 50 स्टेप्स लगते हैं। उन्होंने मॉडल को केवल 4 स्टेप्स में यह करने के लिए सिखाने के लिए डिस्टिलेशन (distillation) नामक तकनीक का उपयोग किया, जिससे बिना गुणवत्ता खोए वास्तविक समय के उपयोग के लिए यह बहुत तेज़ हो गया।

उन्होंने क्या पाया (परिणाम)

  • यह काम करता है: मॉडल ने कई परीक्षणों (benchmarks) को पास किया जहाँ इसे जटिल निर्देशों का पालन करना था (जैसे "एक नीली कुर्सी के पास पेड़ के बगल में एक लाल बिल्ली रखें")।
  • यह स्केल होता है: भले ही "बड़ा वाला" (5B) सबसे अच्छा है, लेकिन "छोटा वाला" (1B) अन्य कंपनियों के बहुत बड़े मॉडलों के लगभग बराबर प्रदर्शन करता है। यह साबित करता है कि "ब्लूप्रिंट फर्स्ट" विधि बहुत कुशल है।
  • यह द्विभाषी है: यह अंग्रेजी और चीनी दोनों में अच्छी तरह से काम करता है।

सीमाएं (उन्होंने क्या नहीं किया)

लेखक ईमानदार हैं कि उनका मॉडल अभी क्या नहीं कर सकता:

  • आकार की सीमा: उनका सबसे बड़ा मॉडल 5 बिलियन पैरामीटर्स का है। वे इसे और बड़ा बनाना चाहते थे, लेकिन उनके पास कंप्यूटर पावर (विशेष रूप से, वे NVIDIA A800 GPU तक सीमित थे) खत्म हो गई।
  • शैली की विविधता: क्योंकि उन्होंने प्राकृतिक छवियों और टेक्स्ट पर बहुत अधिक ध्यान केंद्रित किया, इसलिए यह बहुत विशिष्ट कलात्मक शैलियों (जैसे जटिल ग्राफिक डिज़ाइन या इन्फोग्राफिक्स) के लिए उतना अच्छा नहीं है जितना कि सामान्य चित्रों के लिए है।
  • वीडियो और संपादन: उन्होंने इसे टेक्स्ट से नई छवियां बनाने के लिए बनाया है। उन्होंने अभी तक मौजूदा फोटो को एडिट करने या वीडियो बनाने के लिए इसका परीक्षण नहीं किया है।

सारांश

SeFi-Image AI को चित्र बनाना सिखाने का एक नया तरीका है। सब कुछ एक साथ सीखने के बजाय, यह AI को पहले "कंकाल" (skeleton) और फिर "त्वचा" (skin) बनाना सिखाता है। यह सरल बदलाव उन्हें एक ऐसा मॉडल बनाने की अनुमति देता है जो सिखाने में सस्ता, चलाने में तेज़ और वर्तमान में उपलब्ध सबसे महंगे मॉडलों के समान या उनसे बेहतर है। उन्होंने अपना कोड और मॉडल जारी कर दिया है ताकि कोई भी इनका उपयोग कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →