← नवीनतम पेपर
💻 computer science

ClustViT: Clustering-based Token Merging for Semantic Segmentation

ClustViT एक प्रशिक्षण योग्य क्लस्टर मॉड्यूल (Cluster module) को पेश करके सिमेंटिक सेगमेंटेशन में विज़न ट्रांसफॉर्मर्स की द्विघातीय जटिलता (quadratic complexity) को संबोधित करता है जो छद्म-क्लस्टर्स (pseudo-clusters) द्वारा निर्देशित होकर समान टोकन को मर्ज करता है और एक पुनरुद्धारक मॉड्यूल (Regenerator module) जो सूक्ष्म विवरणों को पुनर्स्थापित करता है, जिससे सटीकता से समझौता किए बिना महत्वपूर्ण कम्प्यूटेशनल दक्षता और तेज़ इन्फरेंस प्राप्त होता है।

मूल लेखक: Fabio Montello, Ronja Güldenring, Lazaros Nalpantidis

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fabio Montello, Ronja Güldenring, Lazaros Nalpantidis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप फोन पर अपने एक दोस्त को एक जटिल पेंटिंग का वर्णन करने की कोशिश कर रहे हैं। उस पेंटिंग में एक विशाल, उबाऊ नीला आसमान है, कुछ अलग पेड़ हैं, और एक छोटा सा, विस्तृत पक्षी है।

एक मानक "विज़न ट्रांसफार्मर" (वह AI मॉडल जिसे यह पेपर बेहतर बनाता है) उस पेंटिंग के हर एक इंच को समान विवरण के साथ समझाने की कोशिश करता है। वह खाली नीले आसमान का वर्णन करने में उतना ही समय और दिमागी शक्ति खर्च करता है जितना कि उस छोटे से पक्षी के लिए। यह अविश्वसनीय रूप से सटीक है, लेकिन यह धीमा है और इसमें बहुत ऊर्जा खर्च होती है—जैसे कि मेलबॉक्स तक जाने के लिए केवल पैदल चलने के लिए भारी बैग में पत्थर भरकर ले जाना।

इस पेपर के लेखकों ने पूछा: "यदि हमें पहले से पता है कि कौन से हिस्से एक जैसे हैं, तो हम हर पिक्सेल का वर्णन क्यों करें?"

यहाँ उनका समाधान बताया गया है, जिसे सरल चरणों में विभाजित किया गया है:

1. समस्या: बहुत अधिक शोर (Noise)

वर्तमान AI मॉडल "सिमेंटिक सेगमेंटेशन" (जो केवल एक फैंसी शब्द है जिसका अर्थ है "छवि के हर पिक्सेल को लेबल करना") के लिए बेहतरीन हैं। लेकिन वे धीमे हैं क्योंकि वे छवि के हर हिस्से को समान रूप से महत्वपूर्ण मानते हैं। यदि आप एक खेत के माध्यम से चलने वाले रोबोट हैं, तो आपको घास के हर एक तिनके का व्यक्तिगत रूप से विश्लेषण करने की आवश्यकता नहीं है; आपको बस इतना जानने की आवश्यकता है कि "यह घास है।"

2. समाधान: "ग्रुपिंग" रणनीति

लेखकों ने ClustViT नामक एक नया सिस्टम बनाया है। इसे एक स्मार्ट संपादक के रूप में सोचें जो छवि को देखता है और कहता है, "ठीक है, ये 100 पिक्सेल सभी केवल 'आसमान' हैं, इसलिए आइए उन्हें एक साथ समूहबद्ध करें और उन्हें एक एकल सूचना के रूप में मानें।"

वे इसे उनके AI के मस्तिष्क के भीतर दो विशेष उपकरणों का उपयोग करके करते हैं:

  • द क्लस्टर मॉड्यूल (समूह बनाने वाला टूल):
    कल्पना कीजिए कि आपके पास मिश्रित लेगो ब्रिक्स (Lego bricks) का एक ढेर है। हर एक ईंट को देखने के बजाय, आप उन्हें जल्दी से बाल्टियों में छाँटते हैं: "लाल," "नीले," और "विशेष टुकड़े।"
    AI में, यह मॉड्यूल छवि को देखता है और एक "चीट शीट" (जो ग्राउंड ट्रुथ लेबल से सीखी गई है) का उपयोग करता है ताकि उन पिक्सेल्स को खोजा जा सके जो एक ही सिमेंटिक श्रेणी (जैसे "पानी" या "घास") से संबंधित हैं। यह उन सभी समान पिक्सेल्स को एक प्रतिनिधि टोकन में मिला देता है।

    • परिणाम: अब AI को 100 पिक्सेल्स को ऐसे प्रोसेस करना पड़ता है जैसे वे केवल 1 हों। यह गणित को बहुत तेज़ बना देता है।
  • द रीजेनरेटर मॉड्यूल (विवरण पुनर्स्थापक):
    यहाँ पेचीदा हिस्सा है: यदि आप केवल पिक्सेल्स को मर्ज कर देते हैं, तो आप अंतिम चित्र को पूरी तरह से बनाने के लिए आवश्यक सूक्ष्म विवरण खो देंगे।
    इसलिए, AI द्वारा तेज़, समूहबद्ध प्रोसेसिंग करने के बाद, रीजेनरेटर कदम रखता है। यह उस एकल "समूहबद्ध" जानकारी को लेता है और कहता है, "ठीक है, मैं जानता हूँ कि यह आसमान का प्रतिनिधित्व करता है, इसलिए मैं इसे वापस मूल स्थान को भरने के लिए फैला दूँगा।"

    • परिणाम: AI को समूह की गति मिलती है, लेकिन अंतिम आउटपुट अभी भी ऐसा दिखता है जैसे उसमें मूल बारीक विवरण मौजूद हों।

3. "चीट शीट" (स्यूडो-क्लस्टर्स)

AI को कैसे पता चलता है कि किन पिक्सेल्स को समूहबद्ध करना है? यह एक चतुर प्रशिक्षण तकनीक का उपयोग करता है। प्रशिक्षण के दौरान, AI को "सही उत्तर" (छवि का सटीक मानचित्र) दिखाया जाता है। यह इस मानचित्र का उपयोग करके एक "स्यूडो-क्लस्टर" गाइड बनाता है। यह सीखता है: "ओह, मैं देख रहा हूँ कि इन सभी पल्स को 'पानी' के रूप में लेबल किया गया है, इसलिए मुझे इन्हें मर्ज करना चाहिए।" यह चीजों को केवल समानता के आधार पर नहीं, बल्कि अर्थ के आधार पर समूहबद्ध करना सीखता है।

4. परिणाम: तेज़, हल्का, फिर भी स्मार्ट

लेखकों ने तीन अलग-अलग प्रकार की छवियों पर परीक्षण किया:

  • ADE20K: इनडोर और आउटडोर दृश्यों का मिश्रण (बहुत जटिल)।
  • SUIM: पानी के नीचे के दृश्य (ज्यादातर पानी, कुछ वस्तुएं)।
  • RumexWeeds: कृषि क्षेत्र (ज्यादातर घास/खरपतवार)।

क्या हुआ?

  • गति: नया मॉडल मानक मॉडल की तुलना में 1.64 गुना तेज़ था।
  • दक्षता: इसने 2.18 गुना कम कंप्यूटिंग पावर (ऊर्जा) का उपयोग किया।
  • सटीकता: यह धीमे, भारी मॉडल के लगभग उतना ही सटीक रहा।

स्वीट स्पॉट (Sweet Spot):
पेपर नोट करता है कि यह "रोबोटिक" परिदृश्यों में सबसे अच्छा काम करता है जहाँ बहुत सारा बैकग्राउंड होता है (जैसे कि एक रोबोट खेत या पानी के नीचे देख रहा हो)। इन मामलों में, AI बैकग्राउंड के बड़े हिस्सों को सिंगल टोकन में मर्ज कर सकता है, जिससे भारी मात्रा में ऊर्जा बचती है। बहुत अराजक, जटिल छवियों में, बचत कम होती है, लेकिन मॉडल फिर भी अच्छा काम करता है।

सारांश

ClustViT एक स्मार्ट सहायक की तरह है जो महसूस करता है कि जब किसी कमरे का वर्णन किया जा रहा हो, तो आपको फर्श पर धूल के हर एक कण को सूचीबद्ध करने की आवश्यकता नहीं है। आप कह सकते हैं "फर्श" (धूल को समूहबद्ध करना) और फिर केवल महत्वपूर्ण फर्नीचर पर ज़ूम इन कर सकते हैं। यह विवरण को उत्पन्न करने के लिए बहुत तेज़ बनाता है, लेकिन सुनने वाले को फिर भी कमरे की स्पष्ट तस्वीर मिल जाती है।

यह रोबोटों को महत्वपूर्ण विवरणों को पहचानने की क्षमता खोए बिना, बहुत तेज़ी से और कम बैटरी पावर के साथ अपनी दुनिया को "देखने" और समझने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →