← नवीनतम पेपर
🤖 machine learning

DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery

यह शोध पत्र DiffuSAM का प्रस्ताव करता है, जो एक हाइब्रिड पाइपलाइन है जो रिमोट सेंसिंग इमेजरी में मजबूत, ज़ीरो-शॉट ऑब्जेक्ट ग्राउंडिंग प्राप्त करने के लिए डिफ्यूजन-आधारित लोकलाइजेशन संकेतों को RemoteSAM और SAM3 जैसे उन्नत सेगमेंटेशन मॉडलों के साथ एकीकृत करता है, जो मौजूदा अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Geet Sethi, Panav Shah, Ashutosh Gandhe, Soumitra Darshan Nayak

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Geet Sethi, Panav Shah, Ashutosh Gandhe, Soumitra Darshan Nayak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अंतरिक्ष से ली गई एक विशाल, हाई-रिज़ॉल्यूशन फोटो देख रहे हैं, जिसमें पूरा शहर या कोई जंगल दिख रहा है। कोई आपसे पूछता है, "क्या आप दाईं ओर स्थित नीले रंग के टेनिस कोर्ट की ओर इशारा कर सकते हैं?" या "बीच में मौजूद बड़े लाल जहाज को ढूंढें।"

यह करना कठिन है। छवियां बहुत बड़ी हैं, मौसम धुंधला हो सकता है, और वहां हजारों सूक्ष्म विवरण हो सकते हैं। आमतौर पर, आपको एक ऐसे सुपर-स्मार्ट कंप्यूटर की आवश्यकता होगी जिसे जहाजों या टेनिस कोर्ट के हजारों उदाहरणों पर विशेष रूप से प्रशिक्षित किया गया हो। लेकिन क्या होगा अगर आपके पास वे उदाहरण न हों? क्या होगा अगर आप चाहते हों कि कंप्यूटर इसे तुरंत "समझ" जाए, ठीक वैसे ही जैसे एक इंसान करता है?

यही वह चीज़ है जिसे DiffuSAM पेपर हल करने की कोशिश कर रहा है। यह कैसे किया गया, इसकी कहानी यहाँ सरल रूप में दी गई है।

समस्या: "अंधा" जासूस

पारंपरिक AI मॉडल उन जासूसों की तरह हैं जिन्होंने केवल एक विशिष्ट पड़ोस का अध्ययन किया है। यदि आप उन्हें किसी दूसरे शहर की तस्वीर दिखाते हैं, तो वे भ्रमित हो जाते हैं। उन्हें यह सीखने के लिए कि "जहाज" या "इमारत" क्या होती है, भारी मात्रा में प्रशिक्षण डेटा (जैसे लाखों तस्वीरों का पुस्तकालय) की आवश्यकता होती है। उपग्रह इमेजरी (satellite imagery) की दुनिया में, उन लेबल किए गए फोटो को प्राप्त करना महंगा और धीमा है।

समाधान: एक तीन-चरणीय जासूसी टीम

लेखकों ने एक नया सिस्टम बनाया जिसे DiffuSAM कहा जाता है। इसे एक जासूस के रूप में नहीं, बल्कि एक तीन-सदस्यीय जासूसी टीम के रूप में सोचें जो वस्तु को खोजने के लिए मिलकर काम करती है।

चरण 1: "कल्पनाशील कलाकार" (डिफ्यूजन मॉडल)

सबसे पहले, टीम एक AI कलाकार (एक डिफ्यूजन मॉडल) को लाती है।

  • यह क्या करता है: आप इसे उपग्रह फोटो और टेक्स्ट प्रॉम्प्ट देते हैं ("नीले टेनिस कोर्ट को खोजें")।
  • जादू: केवल निर्देशांक (coordinates) का अनुमान लगाने के बजाय, यह कलाकार दृश्य की कल्पना करता है। यह फोटो लेता है और डिजिटल रूप से उस जगह के चारों ओर एक लाल बॉक्स "पेंट" करता है जहाँ उसे लगता है कि टेनिस कोर्ट है।
  • सावधानी: यह कलाकार बहुत रचनात्मक है लेकिन कभी-कभी थोड़ा अनियंत्रित भी हो सकता है। यदि वस्तु को देखना कठिन है, तो कलाकार "भ्रम" (hallucinate) का शिकार हो सकता है और ऐसी जगह लाल बॉक्स पेंट कर सकता है जहाँ कुछ नहीं है (जैसे पानी की जगह जहाज बना देना)। लेकिन, यह देखने के लिए एक रफ आइडिया पाने में बेहतरीन है।

चरण 2: "फोटो एनहांसर" (प्री-प्रोसेसिंग)

टीम के शुरू करने से पहले, वे फोटो को साफ करते हैं। बादलों या प्रदूषण के कारण उपग्रह चित्र अक्सर धुंधले या फीके दिखाई देते हैं।

  • उपमा: कल्पना कीजिए कि आपने हाई-टेक चश्मा पहना है जो धुंध को काट देता है और इमारतों के किनारों को स्पष्ट कर देता है। यह चरण छवि को इतना सटीक बनाता है कि अन्य जासूस इसे स्पष्ट रूप से देख सकें।

चरण 3: "विशेषज्ञ फॉरेंसिक टीम" (SAM मॉडल्स)

अब जब कलाकार ने एक रफ लाल बॉक्स दे दिया है, तो टीम दो विशेषज्ञ फॉरेंसिक विशेषज्ञों (जिन्हें SAM3 और RemoteSAM कहा जाता है) को लाती है।

  • काम: वे उस क्षेत्र में ज़ूम करते हैं जिसे कलाकार ने इशारा किया था। उनका काम बैकग्राउंड को अनदेखा करते हुए वस्तु की सटीक रूपरेखा को ट्रेस करना है।
  • स्मार्ट स्विच: सिस्टम स्मार्ट है कि उसे पता है कि किस विशेषज्ञ का उपयोग करना है:
    • यदि क्षेत्र विशाल है (जैसे कई चीजों वाला पूरा शहर ब्लॉक), तो यह RemoteSAM को बुलाता है, जो विशेष रूप से उपग्रह फोटो पर प्रशिक्षित एक विशेषज्ञ है।
    • यदि क्षेत्र छोटा है (जैसे एक छोटी कार), तो यह SAM3 को बुलाता है, जो बारीक विवरणों में माहिर है।
  • परिणाम: वे कलाकार के रफ लाल बॉक्स को लेते हैं और उसे एक परफेक्ट, टाइट हरे बॉक्स में बदल देते हैं जो वस्तु में बिल्कुल फिट बैठता है।

यह एक बड़ी बात क्यों है?

अधिकांश AI सिस्टम को काम करने से पहले हजारों उदाहरणों के साथ "सिखाने" की आवश्यकता होती है। DiffuSAM एक बहुज्ञ (polymath) की तरह है—यह बिना किसी क्रैश कोर्स के तुरंत नई चीजों को समझ सकता है।

  • कोई प्रशिक्षण आवश्यक नहीं: यह "Zero-Shot" काम करता है, जिसका अर्थ है कि यह आपके टेक्स्ट विवरण को पढ़कर उन वस्तुओं को भी ढूंढ सकता है जिन्हें इसने पहले कभी नहीं देखा है।
  • बेहतर सटीकता: पेपर दिखाता है कि कलाकार की रचनात्मकता को फॉरेंसिक टीम की सटीकता के साथ जोड़कर, उन्होंने वर्तमान सर्वोत्तम तरीकों की तुलना में वस्तुओं को 14% बेहतर तरीके से पाया।

कमजोरी ( "भ्रम" का जोखिम)

सिस्टम परफेक्ट नहीं है। क्योंकि पहला चरण एक ऐसे "कलाकार" पर निर्भर करता है जो कल्पना का उपयोग करता है, इसलिए कभी-कभी यह बहुत अधिक रचनात्मक हो जाता है। यदि आप इसे एक "अद्वितीय जहाज" खोजने के लिए कहते हैं और वहां कोई नहीं है, तो यह आपकी रिक्वेस्ट को पूरा करने के लिए एक नकली जहाज बना सकता है। लेखक स्वीकार करते हैं कि यह एक दोष है जिसे वे भविष्य में ठीक करने की उम्मीद करते हैं।

निचोड़

DiffuSAM एक चतुर तरीका है जो जेनेरेटिव AI की कल्पना (जो चीजों के होने का स्थान "सपना" देख सकती है) को विशेष सेगमेंटेशन टूल्स (जो सटीक रूप से "ट्रेस" कर सकते हैं) की सटीकता के साथ जोड़ता है। यह उपग्रह कंप्यूटरों को स्मार्ट, तेज़ और बिना किसी विशाल प्री-लेबल वाले फोटो लाइब्रेरी की आवश्यकता के, हमारी प्राकृतिक भाषा के अनुरोधों को समझने में सक्षम बनाने का एक तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →