← नवीनतम पेपर
🤖 AI

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

यह शोध पत्र CSGen को प्रस्तुत करता है, जो एक पदानुक्रमित मल्टीमॉडल डिफ्यूजन मॉडल है जो विविध मल्टीमीडिया अनुप्रयोगों में सटीक वक्राकार संरचनाओं वाली उच्च-गुणवत्ता वाली, नियंत्रणीय इमेज जनरेशन प्राप्त करने के लिए एक बड़े पैमाने के मल्टी-डोमेन डेटासेट, एक प्रोग्रेसिव कंट्रोल स्ट्रैटेजी और एक स्पैरसिटी-अवेयर लॉस मैकेनिज्म का लाभ उठाता है।

मूल लेखक: Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

प्रकाशित 2026-08-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को दुनिया का चित्र बनाना सिखाने की कोशिश कर रहे हैं। आपने उसे बिल्लियों, कारों और सूर्यास्त के लाखों चित्र दिखाए हैं, इसलिए वह एक रोएँदार कुत्ते या चमकदार कार को पूरी तरह से चित्रित करना जानता है। लेकिन फिर आप उससे कुछ बहुत अलग बनाने के लिए कहते हैं: फुटपाथ में एक अकेली, छोटी, घुमावदार दरार, या एक आँख के भीतर रक्त वाहिकाओं का एक नाजुक जाल। अचानक, रोबोट भ्रमित हो जाता है। वह पूरे फुटपाथ या पूरी आँख को चित्रित करने की कोशिश करता है, जिससे वह छोटी सी दरार जिसे आप चाहते थे, दब जाती है। यह "कर्वीलीनियर स्ट्रक्चर्स" (curvilinear structures) यानी घुमावदार संरचनाओं की समस्या है—लंबी, पतली, घुमावदार रेखाएं जो मेडिकल स्कैन, सड़क मानचित्रों और पुलों की सुरक्षा की जांच करने जैसी चीजों के लिए अत्यंत महत्वपूर्ण हैं। ये रेखाएं इतनी पतली और विरल हैं कि वे पृष्ठभूमि के शोर (noise) में खो जाती हैं।

इस समस्या को हल करने के लिए, वैज्ञानिक "डिफ्यूजन मॉडल्स" (diffusion models) का उपयोग करते हैं। इन मॉडल्स को एक ऐसे मूर्तिकार की तरह समझें जो शोर से भरे, स्थिर मिट्टी के एक ब्लॉक से शुरू करता है और धीरे-धीरे शोर को हटाकर एक स्पष्ट छवि प्रकट करता है। आमतौर पर, यह बड़ी, ठोस वस्तुओं के लिए बहुत अच्छा काम करता है। लेकिन जब वस्तु एक नाजुक, बाल जैसी पतली रेखा होती है, तो मूर्तिकार अक्सर उसे मिटा देता है या टुकड़ों में तोड़ देता है क्योंकि बाकी चित्र की तुलना में वह रेखा बहुत छोटी होती है। मुख्य सवाल यह है कि हम इस डिजिटल मूर्तिकार को इन छोटी, नाजुक रेखाओं के साथ अविश्वसनीय रूप से कोमल और सटीक होने के लिए कैसे सिखाएं, बिना बड़े चित्र को खोए?

यहाँ CSGen आता है, एक नया मॉडल जिसे विशेष रूप से इन कठिन, घुमावदार रेखाओं में महारत हासिल करने के लिए डिज़ाइन किया गया है। इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने महसूस किया कि इन पतली संरचनाओं के लिए इन AI कलाकारों को प्रशिक्षित करने का सामान्य तरीका काम नहीं कर रहा था। उन्होंने एक बिल्कुल नई प्रशिक्षण प्रणाली बनाई जो एक सख्त लेकिन सहायक कला शिक्षक की तरह कार्य करती है। सबसे पहले, उन्होंने पांच अलग-अलग दुनियाओं से इन घुमावदार रेखाओं के 24,000 से अधिक उदाहरणों का एक विशाल पुस्तकालय एकत्र किया: आपकी आँख की नसें, आपके हृदय की धमनियां, कंक्रीट में दरारें, पत्तियों की नसें और मानचित्र पर सड़कें। इसने AI को सीखने के लिए "पतली रेखा" वाले पैटर्न का एक विशाल विविध संग्रह दिया।

लेकिन केवल चित्रों का होना ही पर्याप्त नहीं था। शोधकर्ताओं ने AI को ध्यान केंद्रित करने में मदद करने के लिए दो चतुर तरकीबें ईजाद कीं। पहली तरकीब एक "चरण-दर-चरण" पाठ योजना की तरह है। पूरी जटिल दृश्य को एक साथ बनाने के लिए कहने के बजाय, वे पहले इसे रेखाओं के बुनियादी आकार और जुड़ाव (कंकाल/skeleton) को सिखाते हैं, और केवल बाद में रंग और बनावट जैसे विवरण जोड़ते हैं। यह AI को भ्रमित होने और रेखाओं को तोड़ने से रोकता है। दूसरी तरकीब प्रशिक्षण प्रक्रिया के लिए एक विशेष "स्पॉटलाइट" है। चूंकि रेखाएं बहुत पतली होती हैं, इसलिए AI आमतौर पर उन्हें अनदेखा कर देता है। शोधकर्ताओं ने मॉडल को ड्राइंग के सबसे पतले, सबसे नाजुक हिस्सों पर अतिरिक्त ध्यान देने के लिए प्रोग्राम किया, जो अनिवार्य रूप से इसे कह रहा है, "इन छोटे हिस्सों को छोड़ना मत; ये सबसे महत्वपूर्ण हैं!"

परिणाम दिखाते हैं कि यह नया दृष्टिकोण काम करता है। जब उन्होंने CSGen का परीक्षण किया, तो इसने ऐसी छवियां बनाईं जहाँ घुमावदार रेखाएं पिछली विधियों की तुलना में बहुत अधिक सटीक और जुड़ी हुई थीं। यह केवल दिखने में बेहतर नहीं था; जब अन्य कंप्यूटर प्रोग्रामों ने इन उत्पन्न छवियों का उपयोग दरारों या रक्त वाहिकाओं को खोजने के लिए सीखने हेतु किया, तो वे भी अपने काम में बेहतर हो गए। शोध पत्र सुझाव देता है कि एक विशाल, विविध डेटासेट को इन स्मार्ट प्रशिक्षण चरणों के साथ जोड़कर, हम अंततः AI को उन नाजुक, घुमावदार संरचनाओं को संभालने में सक्षम बना सकते हैं जो हमारी सड़कों को सुरक्षित रखने और हमारे चिकित्सा निदान को सटीक रखने के लिए इतने महत्वपूर्ण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →