← नवीनतम पेपर
💻 computer science

Diffusion Model as a Generalist Segmentation Learner

यह शोध पत्र DiGSeg को प्रस्तुत करता है, जो एक ऐसा ढांचा (framework) है जो प्रीट्रेन्ड डिफ्यूजन मॉडल्स को एक एकीकृत, सामान्यज्ञ सेगमेंटेशन लर्नर के रूप में पुनरुद्देश्यित करता है, जो डोमेन-विशिष्ट आर्किटेक्चरल परिवर्तनों की आवश्यकता के बिना विविध डोमेन में मानक और ओपन-वोकैबुलरी दोनों कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम है।

मूल लेखक: Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जिसने शून्य से एकदम सटीक, वास्तविक दिखने वाले भोजन बनाने में वर्षों बिताए हैं। यह शेफ भोजन की तस्वीरें (जैसे कि एक डिफ्यूजन मॉडल) बनाने (generating) में विशेषज्ञ है। आमतौर पर, यदि आप इस शेफ से "पिज्जा की एक तस्वीर बनाओ" कहते हैं, तो वे बिना किसी आधार के एक पूरी नई छवि बनाएंगे।

लेकिन क्या होगा अगर आप इस शेफ से एक अलग सवाल पूछें: "यहाँ एक बिखरी हुई किचन टेबल की फोटो है। कृपया इस पर पिज्जा के हर एक स्लाइस के चारों ओर एक रेखा खींचिए"?

परंपरागत रूप से, जो शेफ केवल खाना बनाना सीखने के लिए प्रशिक्षित किए गए हैं, वे मौजूदा प्लेटों का विश्लेषण करने में बहुत अच्छे नहीं होते हैं। वे अपनी "सोचने की प्रक्रिया" (अटेंशन मैप्स) को देखकर यह अनुमान लगाने की कोशिश कर सकते हैं कि पिज्जा कहाँ है, लेकिन इससे अक्सर धुंधली और बिखरी हुई रूपरेखा (outlines) बनती है जिसे बहुत अधिक सफाई की आवश्यकता होती है।

DiGSeg (डिफ्यूजन एज़ अ जनरलिस्ट सेगमेंटेशन लर्नर) से मिलिए।

इस पेपर के पीछे के शोधकर्ताओं ने तय किया कि वे उस मास्टर शेफ (प्री-ट्रेन्ड डिफ्यूजन मॉडल) को एक त्वरित, विशिष्ट प्रशिक्षण पाठ्यक्रम देंगे। केवल चित्र बनाने के बजाय, उन्होंने उन्हें मौजूदा चित्रों पर सीमाएं (boundaries) खींचना सिखाया।

उन्होंने इसे कैसे किया, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "घोस्ट" (Ghost) ट्रेनिंग विधि

शेफ के पुराने कौशल को फेंकने के बजाय, उन्होंने उन्हें बरकरार रखा। उन्होंने एक दृश्य की फोटो ली (जैसे कि एक सड़क या जंगल) और वह "सही" ड्राइंग भी ली कि सब कुछ कहाँ है (ग्राउंड ट्रुथ मास्क)। उन्होंने इन दोनों को एक गुप्त कोड (लेटेंट स्पेस) में बदल दिया जिसे शेफ पहले से ही समझता है।

फिर, उन्होंने "शोर का अनुमान लगाएं" (Guess the Noise) का खेल खेला। उन्होंने सही ड्राइंग ली, उसमें स्टैटिक नॉइज़ (noise) मिला दी (जैसे कि एक साफ़ फोटो को पुराने टीवी के 'स्नो' में बदलना), और शेफ से पूछा: "इस शोर भरी तस्वीर और मूल फोटो को देखते हुए, क्या आप सही ड्राइंग को प्रकट करने के लिए इस शोर को साफ कर सकते हैं?"

इसे बार-बार करके, शेफ ने सीखा कि उन्हें जिस "शोर" को हटाना था वह केवल रैंडम स्टैटिक नहीं था; वह एक कार, एक पेड़ या एक व्यक्ति का विशिष्ट आकार था। उन्होंने केवल एक कार बनाना नहीं सीखा; उन्होंने एक बिखरी हुई तस्वीर में कार को ढूँढना सीखा।

2. "भाषा अनुवादक" (Language Translator)

एक बहुत ही शानदार ट्रिक यह है कि यह मॉडल यह समझने के लिए कि क्या देखना है, कैसे काम करता है। आमतौर पर, यदि आप चाहते हैं कि कोई कंप्यूटर "लाल रंग के फायर हाइड्रेंट" को खोजे, तो आपको इसे विशेष रूप से यह सिखाना होगा कि एक फायर हाइड्रेंट कैसा दिखता है।

DiGSeg एक CLIP-aligned text pathway का उपयोग करता है। इसे एक ऐसे अनुवादक के रूप में सोचें जो "छवि" और "अंग्रेजी" दोनों बोलता है।

  • आप टाइप करते हैं "fire hydrant"।
  • अनुवादक उन शब्दों को एक गुप्त संकेत में बदल देता है।
  • यह संकेत सफाई की प्रक्रिया के हर चरण में शेफ के मस्तिष्क में इंजेक्ट किया जाता है।

इसका मतलब है कि शेफ को हर नई वस्तु के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यदि आप कहते हैं "बिल्ली को खोजो," तो शेफ लाखों छवियों पर अपने प्रशिक्षण से प्राप्त बिल्ली के बारे में अपने मौजूदा ज्ञान का उपयोग करता है और उसे आपकी दी गई विशिष्ट फोटो पर लागू करता है। यह उन चीजों को भी ढूंढ सकता है जिन्हें इसने पहले कभी नहीं देखा है, जब तक कि आप उन्हें शब्दों में वर्णित कर सकें।

3. "मल्टी-स्केल" सफाई (Multi-Scale Cleanup)

कभी-कभी, जब आप एक धुंधली छवि को साफ करने की कोशिश करते हैं, तो हो सकता है कि आप बड़े आकार तो ठीक कर लें लेकिन छोटे विवरणों को छोड़ दें, या इसके विपरीत।
शोधकर्ताओं ने एक मल्टी-स्केल नॉइज़ रणनीति का उपयोग किया। कल्पना कीजिए कि एक कमरा साफ कर रहे हैं:

  • पहले, आप बड़े फर्नीचर (लो-फ्रीक्वेंसी नॉइज़) को हिलाते हैं ताकि लेआउट सही हो सके।
  • फिर, आप मेजों को पोंछते हैं (मीडियम डिटेल्स)।
  • अंत में, आप कोनों की धूल झाड़ते हैं (हाई-फ्रीक्वेंसी डिटेल्स)।

DiGSeg यह सब स्वचालित रूप से करता है। यह पहले बड़े आकारों को ठीक करना सीखता है और फिर सूक्ष्म किनारों को परिष्कृत करता है, जिसके परिणामस्वरूप बहुत ही स्पष्ट और सटीक रूपरेखा मिलती है, बिना किसी इंसान द्वारा गलतियों को सुधारने की आवश्यकता के।

उन्होंने क्या हासिल किया?

पेपर का दावा है कि यह "रिट्रेन्ड शेफ" अविश्वसनीय रूप से बहुमुखी है:

  • यह एक जनरलिस्ट है: यह सामान्य तस्वीरों (जैसे शहर की सड़कें), मेडिकल इमेज (जैसे रेटिनल स्कैन), और यहाँ तक कि खेतों के सैटेलाइट फोटो पर भी काम करता है। आपको हर काम के लिए एक नया मॉडल बनाने की आवश्यकता नहीं है; आप बस एक ही मॉडल का उपयोग कर सकते हैं।
  • यह ओपन-वोकैबुलरी (Open-Vocabulary) है: आप इसे "एक उदास कुत्ता" या "एक जंग लगा ट्रैक्टर" खोजने के लिए कह सकते हैं, और यह उन्हें खोजने की कोशिश करेगा, भले ही इसे विशेष रूप से उन वाक्यांशों के लिए प्रशिक्षित न किया गया हो।
  • यह सटीक है: परीक्षणों में, इसने कई विशेष मॉडलों को पछाड़ दिया जो केवल एक विशिष्ट कार्य के लिए डिज़ाइन किए गए थे।

एक कमी (गति का ट्रेड-ऑफ)

पेपर एक नुकसान के बारे में ईमानदार है: क्योंकि यह मॉडल "डिनोइजिंग" (चरण-दर-चरण छवि को साफ करना) के माध्यम से काम करता है, इसलिए यह उन मॉडलों की तुलना में धीमा है जो केवल तस्वीर को एक बार देखते हैं और उत्तर दे देते हैं। यह एक फास्ट-फूड वर्कर (तुरंत लेकिन शायद कम विस्तृत) और एक मास्टर शेफ (जो परोसने से पहले पांच बार स्वाद लेता है और व्यंजन को एडजस्ट करता है - धीमा लेकिन उच्च गुणवत्ता वाला) के बीच के अंतर जैसा है।

सारांश

संक्षेप में, DiGSeg एक शक्तिशाली इमेज-जेनेरेटर AI को एक मास्टर इमेज-एनालाइज़र बनने के लिए प्रशिक्षित करता है। यह सिद्ध करता है कि वही "मस्तिष्क" जो शून्य से एक दुनिया की कल्पना कर सकता है, उसे भाषा का उपयोग करके प्रक्रिया को निर्देशित करने और नियमों को सीखने के लिए एक चतुर नॉइज़-क्लीनिंग गेम के माध्यम से, हमारे द्वारा देखी जाने वाली दुनिया को समझने और लेबल करने के लिए भी सिखाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →