← नवीनतम पेपर
🤖 AI

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

ActiveSAM एक प्रशिक्षण-मुक्त (training-free), ज़ीरो-शॉट फ्रेमवर्क है जो SAM 3 के साथ पूर्ण-रिज़ॉल्यूशन डिकोडिंग के लिए वर्गों के एक सक्रिय उपसमुच्चय (active subset) की पहचान करने के लिए कम-रिज़ॉल्यूशन प्रीव्यू का उपयोग करके ओपन-वोकैबुलरी सिमेंटिक सेगमेंटेशन की गति और सटीकता को बढ़ाता है, जिससे यह दक्षता और मजबूती दोनों में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Tran Dinh Tien, Zhiqiang Shen

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tran Dinh Tien, Zhiqiang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय के लाइब्रेरियन हैं जिसमें अब तक लिखी गई हर किताब मौजूद है। आपका काम विशिष्ट विषयों के बारे में सवालों के जवाब देना है।

पुराना तरीका (अकुशल):
जब भी कोई सवाल पूछता है, आप पूरी लाइब्रेरी में, शेल्फ दर शेल्फ, हर एक किताब को पढ़ते हुए घूमते हैं ताकि यह देख सकें कि क्या उसमें उत्तर है। भले ही सवाल सिर्फ यह हो कि "क्या हमारे पास बिल्लियों के बारे में कोई किताबें हैं?", फिर भी आप क्वांटम फिजिक्स, प्राचीन इतिहास और कुकिंग रेसिपी वाले सेक्शन की जांच करते हैं। यह अविश्वसनीय रूप से विस्तृत है, लेकिन यह बहुत धीमा और थका देने वाला भी है।

वर्तमान AI के साथ समस्या:
"ओपन-वोकैबुलरी सेगमेंटेशन" (इमेज में वस्तुओं की पहचान करना) के लिए काम करने वाले वर्तमान AI मॉडल उसी अक्षम लाइब्रेरियन की तरह काम करते हैं। जब आप उन्हें एक सड़क के दृश्य की फोटो दिखाते हैं और उनसे 100 संभावित वस्तुओं (कारें, पेड़, बादल, जेब्रा, आदि) की सूची से चीजों को पहचानने के लिए कहते हैं, तो वे हर पिक्सेल में उन 100 चीजों में से हर एक को खोजने की कोशिश करते हैं। लेकिन उस विशेष सड़क की फोटो में, कोई जेब्रा नहीं है। AI उन्हें खोजने में ऊर्जा बर्बाद करता भी रहता है जो वहां मौजूद ही नहीं हैं।

समाधान: ActiveSAM
शोधकर्ताओं ने एक सिस्टम बनाया है जिसे ActiveSAM कहा जाता है। यह उस लाइब्रेरियन को गहरी खोज शुरू करने से पहले एक त्वरित "प्रीव्यू" टूल देने जैसा है।

ActiveSAM कैसे काम करता है, इसे तीन सरल चरणों में नीचे दिया गया है:

1. "त्वरित नज़र" (Preview-Driven Class Selection)

भारी काम करने से पहले, ActiveSAM इमेज का एक लो-रिज़ॉल्यूशन, धुंधला स्नैपशॉट लेता है। यह एक सरल प्रश्न पूछता है: "इस तस्वीर में मोटे तौर पर क्या है?"

  • यह यह अनुमान लगाने के लिए AI के एक हल्के हिस्से का उपयोग करता है कि कौन सी वस्तुएं वास्तव में मौजूद होने की संभावना है।
  • यदि इमेज एक सड़क की है, तो यह कह सकता है: "मुझे कारें, सड़कें और इमारतें दिख रही हैं। मुझे जेब्रा या पनडुब्बी नहीं दिख रही है।"
  • परिणाम: यह केवल उन वस्तुओं की एक छोटी "एक्टिव लिस्ट" बनाता है जो वास्तव में वहां मौजूद हैं। यह बाकी चीजों को अनदेखा कर देता है। इससे बहुत सारा समय बचता क्योंकि AI उन चीजों को खोजने में ऊर्जा बर्बाद नहीं करता जो वहां नहीं हैं।

2. "स्मार्ट सर्च" (Contextual Prompt Expansion)

कभी-कभी साधारण शब्द भ्रमित करने वाले हो सकते हैं। यदि आप AI को "विंडो पेन" (खिड़की का कांच) खोजने के लिए कहते हैं, तो यह भ्रमित हो सकता है। ActiveSAM निर्देशों को स्मार्ट बनाने के लिए संदर्भ (context) जोड़ता है।

  • यह लाइब्रेरियन को यह बताने जैसा है: "सिर्फ 'विंडो पेन' मत ढूंढो। इसके साथ 'ग्लास', 'फ्रेम' और 'आर्किटेक्चर' भी ढूंढो।"
  • यह प्रत्येक वस्तु के लिए अधिक समृद्ध, विस्तृत विवरण बनाने के लिए एक डिक्शनरी (WordNet) और समान शब्दों का उपयोग करता है। यह गहरी खोज के दौरान AI को वस्तुओं को अधिक सटीकता से खोजने में मदद करता है।

3. "गहरी खोज" (Full-Resolution Decoding)

अब, AI उच्च-गुणवत्ता वाली, स्पष्ट इमेज पर वापस जाता है। लेकिन 100 चीजों को खोजने के बजाय, यह केवल "एक्टिव लिस्ट" (जैसे, केवल कारें और पेड़) की खोज करता है।

  • यह वस्तुओं को तेजी से प्रोसेस करने के लिए उन्हें एक साथ ग्रुप करता है।
  • यह मिली हुई वस्तुओं के चारों ओर सटीक आउटलाइन खींचता है।

4. "कॉन्फिडेंस चेक" (Margin-Aware Background Calibration)

अंत में, AI तय करता है कि क्या "बैकग्राउंड" (खाली स्थान) है और क्या एक "ऑब्जेक्ट" (वस्तु) है।

  • पुराने तरीके बस इतना कहते थे: "अगर मैं पक्का नहीं हूँ, तो यह बैकग्राउंड है।"
  • ActiveSAM अधिक स्मार्ट है। यह पूछता है: "क्या मेरा सबसे अच्छा अनुमान, मेरे दूसरे सबसे अच्छे अनुमान से स्पष्ट रूप से बेहतर है?"
  • यदि AI 90% आश्वस्त है कि यह एक कार है और केवल 10% आश्वस्त है कि यह एक ट्रक है, तो वह आत्मविश्वास से इसे कार कहता है। यदि वह 50% आश्वस्त है कि यह एक कार है और 49% आश्वस्त है कि यह एक ट्रक है, तो वह कम आश्वस्त है और गलतियों से बचने के लिए इसे बैकग्राउंड के रूप में लेबल कर सकता है। यह त्रुटियों को कम करता है।

यह बेहतर क्यों है?

  • तेज़: क्योंकि यह अप्रासंगिक वस्तुओं को अनदेखा करता है, यह वस्तुओं की बड़ी सूचियों पर पिछले तरीकों की तुलना में 5.5 गुना तेज़ चलता है।
  • अधिक सटीक: स्मार्ट शब्द विवरण और बेहतर कॉन्फिडेंस चेक का उपयोग करके, यह वास्तव में वस्तुओं को अधिक सही ढंग से पहचानता है (+1.4% सटीकता में सुधार)।
  • मजबूत (Robust): यह तब भी अच्छी तरह काम करता है जब इमेज धुंधली, शोर वाली (noisy), या कोहरे वाली हो (जैसे खराब मौसम में सेल्फ-ड्राइविंग कार का कैमरा)।
  • कोई ट्रेनिंग की आवश्यकता नहीं: आपको इसे नए करतब सिखाने या नया डेटा खिलाने की आवश्यकता नहीं है। यह मौजूदा AI मॉडल के साथ सीधे काम करता है।

संक्षेप में:
ActiveSAM एक स्मार्ट लाइब्रेरियन की तरह है जो पूरी किताब पढ़ने से पहले सही सेक्शन खोजने के लिए कवर को जल्दी से स्कैन करता है। यह समय बचाता है, त्रुटियों को कम करता है, और बिना किसी नए कौशल को सीखे, खराब परिस्थितियों में भी अच्छी तरह काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →