← नवीनतम पेपर
💻 computer science

SAM3 Self-Distillation for Fine-Grained GOOSE 2D Semantic Segmentation

यह शोध पत्र ICRA 2026 GOOSE 2D फाइन-ग्रेन्ड सिमेंटिक सेगमेंटेशन समाधान प्रस्तुत करता है, जिसने एक लाइटवेट डिकोडर के साथ SAM3 फाउंडेशन मॉडल को अनुकूलित करके और सेल्फ-डिस्टिलेशन स्कीम, इमेज-लेवल मल्टी-स्केल टेस्ट-टाइम ऑगमेंटेशन और आक्रामक फोटोमेट्रिक डिस्टॉर्शन के माध्यम से प्रदर्शन को बढ़ाकर 69.73% mIoU प्राप्त किया है।

मूल लेखक: Xuesong Wang

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuesong Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को ऑफ-रोड गाड़ी चलाना सिखा रहे हैं, लेकिन केवल "एक पेड़" या "एक पत्थर" देखने के बजाय, रोबोट को 64 विशिष्ट प्रकार की चीजों के बीच अंतर करने की आवश्यकता है, जैसे "कम घास", "झाड़ियाँ", "काई" (moss), और "किक-स्कूटर"। यह वही चुनौती है जिसे लेखक, ज़्यूसोंग वांग (Xuesong Wang) ने ICRA 2026 GOOSE प्रतियोगिता के लिए हल किया। लक्ष्य एक ऐसा सिस्टम बनाना था जो कैमरा इमेज के हर एक पिक्सेल को सही ऑब्जेक्ट नाम के साथ लेबल कर सके।

लेखक की प्रविष्टि ने 69.73% के स्कोर के साथ चौथा स्थान प्राप्त किया। उन्होंने यह कैसे किया, इसे सरल उपमाओं के माध्यम से समझाया गया है।

मुख्य विचार: एक स्मार्ट छात्र और एक सुपर-टीचर

टीम ने अपने रोबोट का मस्तिष्क शून्य से नहीं बनाया। इसके बजाय, उन्होंने एक प्री-ट्रेंड "सुपर-टीचर" का उपयोग किया जिसे SAM3 (सेगमेंट एनीथिंग मॉडल 3) कहा जाता है। SAM3 को एक जीनियस कलाकार के रूप में सोचें जिसने लाखों चित्र देखे हैं और जानता है कि यदि आप उसकी ओर इशारा करें तो लगभग किसी भी वस्तु की रूपरेखा (outline) कैसे बनानी है।

हालाँकि, यह जीनियस कलाकार थोड़ा कठोर है; यह केवल विशिष्ट प्रॉम्प्ट्स पर अच्छी तरह काम करता है और इसे उन विशिष्ट 64 "ऑफ-रोड" क्लासेस के बारे में नहीं पता जिन्हें रोबोट को सीखने की आवश्यकता है।

समाधान:

  1. छात्र: उन्होंने जीनियस टीचर (SAM3) के "मस्तिष्क" (इमेज एनकोडर) को लिया और उसे एक छोटा, सरल "हेड" (डिकोडर) दिया ताकि वह विशिष्ट ऑफ-रोड क्लासेस को सीख सके।
  2. आंशिक प्रशिक्षण (Partial Training): उन्होंने पूरे जीनियस मस्तिष्क को फिर से प्रशिक्षित नहीं किया। उन्होंने केवल ऊपरी परतों (जो जटिल विवरणों को संभालती हैं) को थोड़ा बदला, जबकि निचली परतों (जो बुनियादी आकृतियों और किनारों को जानती हैं) को स्थिर (frozen) छोड़ दिया। यह एक मास्टर शेफ को नए रेस्टोरेंट को सिखाने जैसा है; आप उन्हें प्याज काटने के लिए फिर से प्रशिक्षित नहीं करते (वे पहले से ही यह जानते हैं), आप बस उन्हें अपना विशिष्ट गुप्त सॉस सिखाते हैं।

तीन गुप्त सामग्रियां

पेपर उन तीन विशिष्ट ट्रिक्स पर प्रकाश डालता है जिन्होंने स्कोर को बढ़ाया:

1. "ओरेकल बॉक्स" सेल्फ-डिस्टिलेशन (शिक्षक छात्र की मदद करता है)

आमतौर पर, एक छात्र शिक्षक से सीखता है जब वह समस्या को हल करते हुए देखता है। यहाँ, छात्र (रोबोट) और शिक्षक (SAM3) वास्तव में एक ही मॉडल परिवार के हैं।

  • ट्रिक: प्रशिक्षण से पहले, टीम ने "जीनियस टीचर" (SAM3) से सही ग्राउंड-ट्रुथ बॉक्स (जैसे कि एक चीट शीट) का उपयोग करके वस्तुओं के चारों ओर सटीक रूपरेखा बनाने के लिए कहा।
  • कैच: टीचर हर चीज़ में परफेक्ट नहीं है। वह "ट्रक" या "पेड़" बनाने में बहुत अच्छा है, लेकिन "बाड़" (fences) या "काई" (moss) के मामले में खराब है (वह लाइनों से बाहर निकल जाता है)।
  • सुधार: टीम ने केवल उन्हीं क्लासेस के लिए टीचर की मदद ली जहाँ वह छात्र की तुलना में स्पष्ट रूप से बेहतर था। उन 22 विशिष्ट क्लासेस के लिए (जैसे ट्रक, बस और ट्रैफिक कोन), छात्र को टीचर की सटीक ड्राइंग की नकल करने के लिए मजबूर किया गया। अन्य क्लासेस के लिए, छात्र ने अपने आप सीखा।

2. "आक्रामक कलर मेकओवर" (सबसे कठिन सबक)

ऑफ-रोड दृश्य नाटकीय रूप से बदलते हैं: सर्दियों में बर्फ, वसंत में कीचड़, गर्मियों में तेज धूप और शरद ऋतु में बारिश। एक रोबोट जो "हरा मतलब घास" पर निर्भर करता है, वह विफल हो जाएगा जब घास बर्फ से ढकी हो या सर्दियों में भूरी दिखे।

  • ट्रिक: प्रशिक्षण के दौरान, टीम ने हर इमेज के रंगों के साथ आक्रामक रूप से छेड़छाड़ की। उन्होंने रैंडम तरीके से ब्राइटनेस, कंट्रास्ट, सैचुरेशन और ह्यू (hue) को बदला।
  • उपमा: कल्पना कीजिए कि आप एक छात्र को केवल उसके लाल रंग से नहीं, बल्कि उसके अष्टकोणीय आकार से "स्टॉप साइन" को पहचानने के लिए प्रशिक्षित कर रहे हैं। आप उन्हें साइन ब्लैक एंड व्हाइट में, नियॉन ग्रीन में, सेपिया में और अंधेरे में दिखाते हैं।
  • परिणाम: यह सबसे बड़ा सुधार (+0.86 अंक) था। इसने रोबोट को रंग के आधार पर अनुमान लगाने के बजाय आकार और बनावट (texture) को पहचानने के लिए मजबूर किया।

3. "ज़ूम-इन, ज़ूम-आउट" ट्रिक (मल्टी-स्केल टेस्टिंग)

अधिकांश आधुनिक AI मॉडल एक निश्चित लेंस वाले कैमरों की तरह होते; वे केवल एक विशिष्ट आकार पर इमेज देख सकते हैं। यदि आप उन्हें छोटी इमेज देते हैं, तो वे धुंधली हो जाती हैं; यदि आप उन्हें बड़ी इमेज देते हैं, तो वे पिक्सेलेटेड हो जाती हैं।

  • समस्या: इस समस्या को ठीक करने का मानक तरीका मॉडल के लेंस को अलग-अलग आकार में बदलना है, लेकिन यह मॉडल बदलने के लिए बहुत कठोर था।
  • जुगाड़: मॉडल को बदलने के बजाय, उन्होंने इमेज को बदल दिया। मॉडल को फीड करने से पहले, उन्होंने इसे 75% आकार तक छोटा किया और 125% आकार तक बड़ा किया।
  • प्रक्रिया:
    1. मूल फोटो लें।
    2. इसे छोटा करें, इसे रोबोट के मस्तिष्क से गुजारें, और उत्तर रिकॉर्ड करें।
    3. इसे बड़ा करें, इसे मस्तिष्क से गुजारें, और उत्तर रिकॉर्ड करें।
    4. मूल आकार को भी चलाएं।
    5. परिणामों का औसत निकालें।
  • यह क्यों काम करता है: दूर से (छोटा करके) "ट्रैफिक कोन" को देखने से रोबोट को पूरी वस्तु देखने में मदद मिलती है। करीब से (बड़ा करके) देखने से उसे बारीक विवरण देखने में मदद मिलती है। दोनों दृश्यों को मिलाने से अनुमान बहुत अधिक सटीक हो जाता है। इसने बिना किसी अतिरिक्त प्रशिक्षण के +0.34 अंक जोड़े।

क्या काम नहीं आया?

लेखक ईमानदार थे कि उन्होंने क्या आजमाया जो विफल रहा:

  • भारी मस्तिष्क (Heavier Brains): उन्होंने मॉडल के लिए अधिक जटिल "हेड" (डिकोडर) का उपयोग करने की कोशिश की, लेकिन इससे वास्तव में रोबोट छोटी और दुर्लभ वस्तुओं को पहचानने में खराब हो गया।
  • अन्य शिक्षक: उन्होंने अन्य प्रसिद्ध AI मॉडल (जैसे DINOv2) का परीक्षण किया, लेकिन इस विशिष्ट कार्य के लिए SAM3 जितना कोई भी अच्छा नहीं था।
  • रैंडम रिसाइज़िंग: प्रशिक्षण के दौरान इमेज को रैंडम तरीके से रीसाइज करने से आक्रामक रंग परिवर्तनों जितना लाभ नहीं हुआ।

निष्कर्ष

रोबोट ने एक शक्तिशाली प्री-ट्रेंड AI को आधार के रूप में उपयोग करके, एक "जीनियस टीचर" को आसान क्लासेस सीखने में मदद करने देकर, उसे रंग के संकेतों को अनदेखा करने के लिए मजबूर करके ताकि वह आकार सीख सके, और अंतिम टेस्ट के दौरान वस्तुओं को विभिन्न दूरियों से देखने के लिए एक चतुर "ज़ूम ट्रिक" का उपयोग करके चौथा स्थान प्राप्त किया।

वह अभी भी किस चीज़ के साथ संघर्ष कर रहा है? "काई" (Moss)। रोबोट काई को कम घास या जंगल के फर्श के साथ भ्रमित करता रहता है, संभवतः इसलिए क्योंकि डेटासेट में काई बहुत दुर्लभ है और अन्य चीजों के समान दिखती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →