SAM3 Self-Distillation for Fine-Grained GOOSE 2D Semantic Segmentation
यह शोध पत्र ICRA 2026 GOOSE 2D फाइन-ग्रेन्ड सिमेंटिक सेगमेंटेशन समाधान प्रस्तुत करता है, जिसने एक लाइटवेट डिकोडर के साथ SAM3 फाउंडेशन मॉडल को अनुकूलित करके और सेल्फ-डिस्टिलेशन स्कीम, इमेज-लेवल मल्टी-स्केल टेस्ट-टाइम ऑगमेंटेशन और आक्रामक फोटोमेट्रिक डिस्टॉर्शन के माध्यम से प्रदर्शन को बढ़ाकर 69.73% mIoU प्राप्त किया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को ऑफ-रोड गाड़ी चलाना सिखा रहे हैं, लेकिन केवल "एक पेड़" या "एक पत्थर" देखने के बजाय, रोबोट को 64 विशिष्ट प्रकार की चीजों के बीच अंतर करने की आवश्यकता है, जैसे "कम घास", "झाड़ियाँ", "काई" (moss), और "किक-स्कूटर"। यह वही चुनौती है जिसे लेखक, ज़्यूसोंग वांग (Xuesong Wang) ने ICRA 2026 GOOSE प्रतियोगिता के लिए हल किया। लक्ष्य एक ऐसा सिस्टम बनाना था जो कैमरा इमेज के हर एक पिक्सेल को सही ऑब्जेक्ट नाम के साथ लेबल कर सके।
लेखक की प्रविष्टि ने 69.73% के स्कोर के साथ चौथा स्थान प्राप्त किया। उन्होंने यह कैसे किया, इसे सरल उपमाओं के माध्यम से समझाया गया है।
मुख्य विचार: एक स्मार्ट छात्र और एक सुपर-टीचर
टीम ने अपने रोबोट का मस्तिष्क शून्य से नहीं बनाया। इसके बजाय, उन्होंने एक प्री-ट्रेंड "सुपर-टीचर" का उपयोग किया जिसे SAM3 (सेगमेंट एनीथिंग मॉडल 3) कहा जाता है। SAM3 को एक जीनियस कलाकार के रूप में सोचें जिसने लाखों चित्र देखे हैं और जानता है कि यदि आप उसकी ओर इशारा करें तो लगभग किसी भी वस्तु की रूपरेखा (outline) कैसे बनानी है।
हालाँकि, यह जीनियस कलाकार थोड़ा कठोर है; यह केवल विशिष्ट प्रॉम्प्ट्स पर अच्छी तरह काम करता है और इसे उन विशिष्ट 64 "ऑफ-रोड" क्लासेस के बारे में नहीं पता जिन्हें रोबोट को सीखने की आवश्यकता है।
समाधान:
- छात्र: उन्होंने जीनियस टीचर (SAM3) के "मस्तिष्क" (इमेज एनकोडर) को लिया और उसे एक छोटा, सरल "हेड" (डिकोडर) दिया ताकि वह विशिष्ट ऑफ-रोड क्लासेस को सीख सके।
- आंशिक प्रशिक्षण (Partial Training): उन्होंने पूरे जीनियस मस्तिष्क को फिर से प्रशिक्षित नहीं किया। उन्होंने केवल ऊपरी परतों (जो जटिल विवरणों को संभालती हैं) को थोड़ा बदला, जबकि निचली परतों (जो बुनियादी आकृतियों और किनारों को जानती हैं) को स्थिर (frozen) छोड़ दिया। यह एक मास्टर शेफ को नए रेस्टोरेंट को सिखाने जैसा है; आप उन्हें प्याज काटने के लिए फिर से प्रशिक्षित नहीं करते (वे पहले से ही यह जानते हैं), आप बस उन्हें अपना विशिष्ट गुप्त सॉस सिखाते हैं।
तीन गुप्त सामग्रियां
पेपर उन तीन विशिष्ट ट्रिक्स पर प्रकाश डालता है जिन्होंने स्कोर को बढ़ाया:
1. "ओरेकल बॉक्स" सेल्फ-डिस्टिलेशन (शिक्षक छात्र की मदद करता है)
आमतौर पर, एक छात्र शिक्षक से सीखता है जब वह समस्या को हल करते हुए देखता है। यहाँ, छात्र (रोबोट) और शिक्षक (SAM3) वास्तव में एक ही मॉडल परिवार के हैं।
- ट्रिक: प्रशिक्षण से पहले, टीम ने "जीनियस टीचर" (SAM3) से सही ग्राउंड-ट्रुथ बॉक्स (जैसे कि एक चीट शीट) का उपयोग करके वस्तुओं के चारों ओर सटीक रूपरेखा बनाने के लिए कहा।
- कैच: टीचर हर चीज़ में परफेक्ट नहीं है। वह "ट्रक" या "पेड़" बनाने में बहुत अच्छा है, लेकिन "बाड़" (fences) या "काई" (moss) के मामले में खराब है (वह लाइनों से बाहर निकल जाता है)।
- सुधार: टीम ने केवल उन्हीं क्लासेस के लिए टीचर की मदद ली जहाँ वह छात्र की तुलना में स्पष्ट रूप से बेहतर था। उन 22 विशिष्ट क्लासेस के लिए (जैसे ट्रक, बस और ट्रैफिक कोन), छात्र को टीचर की सटीक ड्राइंग की नकल करने के लिए मजबूर किया गया। अन्य क्लासेस के लिए, छात्र ने अपने आप सीखा।
2. "आक्रामक कलर मेकओवर" (सबसे कठिन सबक)
ऑफ-रोड दृश्य नाटकीय रूप से बदलते हैं: सर्दियों में बर्फ, वसंत में कीचड़, गर्मियों में तेज धूप और शरद ऋतु में बारिश। एक रोबोट जो "हरा मतलब घास" पर निर्भर करता है, वह विफल हो जाएगा जब घास बर्फ से ढकी हो या सर्दियों में भूरी दिखे।
- ट्रिक: प्रशिक्षण के दौरान, टीम ने हर इमेज के रंगों के साथ आक्रामक रूप से छेड़छाड़ की। उन्होंने रैंडम तरीके से ब्राइटनेस, कंट्रास्ट, सैचुरेशन और ह्यू (hue) को बदला।
- उपमा: कल्पना कीजिए कि आप एक छात्र को केवल उसके लाल रंग से नहीं, बल्कि उसके अष्टकोणीय आकार से "स्टॉप साइन" को पहचानने के लिए प्रशिक्षित कर रहे हैं। आप उन्हें साइन ब्लैक एंड व्हाइट में, नियॉन ग्रीन में, सेपिया में और अंधेरे में दिखाते हैं।
- परिणाम: यह सबसे बड़ा सुधार (+0.86 अंक) था। इसने रोबोट को रंग के आधार पर अनुमान लगाने के बजाय आकार और बनावट (texture) को पहचानने के लिए मजबूर किया।
3. "ज़ूम-इन, ज़ूम-आउट" ट्रिक (मल्टी-स्केल टेस्टिंग)
अधिकांश आधुनिक AI मॉडल एक निश्चित लेंस वाले कैमरों की तरह होते; वे केवल एक विशिष्ट आकार पर इमेज देख सकते हैं। यदि आप उन्हें छोटी इमेज देते हैं, तो वे धुंधली हो जाती हैं; यदि आप उन्हें बड़ी इमेज देते हैं, तो वे पिक्सेलेटेड हो जाती हैं।
- समस्या: इस समस्या को ठीक करने का मानक तरीका मॉडल के लेंस को अलग-अलग आकार में बदलना है, लेकिन यह मॉडल बदलने के लिए बहुत कठोर था।
- जुगाड़: मॉडल को बदलने के बजाय, उन्होंने इमेज को बदल दिया। मॉडल को फीड करने से पहले, उन्होंने इसे 75% आकार तक छोटा किया और 125% आकार तक बड़ा किया।
- प्रक्रिया:
- मूल फोटो लें।
- इसे छोटा करें, इसे रोबोट के मस्तिष्क से गुजारें, और उत्तर रिकॉर्ड करें।
- इसे बड़ा करें, इसे मस्तिष्क से गुजारें, और उत्तर रिकॉर्ड करें।
- मूल आकार को भी चलाएं।
- परिणामों का औसत निकालें।
- यह क्यों काम करता है: दूर से (छोटा करके) "ट्रैफिक कोन" को देखने से रोबोट को पूरी वस्तु देखने में मदद मिलती है। करीब से (बड़ा करके) देखने से उसे बारीक विवरण देखने में मदद मिलती है। दोनों दृश्यों को मिलाने से अनुमान बहुत अधिक सटीक हो जाता है। इसने बिना किसी अतिरिक्त प्रशिक्षण के +0.34 अंक जोड़े।
क्या काम नहीं आया?
लेखक ईमानदार थे कि उन्होंने क्या आजमाया जो विफल रहा:
- भारी मस्तिष्क (Heavier Brains): उन्होंने मॉडल के लिए अधिक जटिल "हेड" (डिकोडर) का उपयोग करने की कोशिश की, लेकिन इससे वास्तव में रोबोट छोटी और दुर्लभ वस्तुओं को पहचानने में खराब हो गया।
- अन्य शिक्षक: उन्होंने अन्य प्रसिद्ध AI मॉडल (जैसे DINOv2) का परीक्षण किया, लेकिन इस विशिष्ट कार्य के लिए SAM3 जितना कोई भी अच्छा नहीं था।
- रैंडम रिसाइज़िंग: प्रशिक्षण के दौरान इमेज को रैंडम तरीके से रीसाइज करने से आक्रामक रंग परिवर्तनों जितना लाभ नहीं हुआ।
निष्कर्ष
रोबोट ने एक शक्तिशाली प्री-ट्रेंड AI को आधार के रूप में उपयोग करके, एक "जीनियस टीचर" को आसान क्लासेस सीखने में मदद करने देकर, उसे रंग के संकेतों को अनदेखा करने के लिए मजबूर करके ताकि वह आकार सीख सके, और अंतिम टेस्ट के दौरान वस्तुओं को विभिन्न दूरियों से देखने के लिए एक चतुर "ज़ूम ट्रिक" का उपयोग करके चौथा स्थान प्राप्त किया।
वह अभी भी किस चीज़ के साथ संघर्ष कर रहा है? "काई" (Moss)। रोबोट काई को कम घास या जंगल के फर्श के साथ भ्रमित करता रहता है, संभवतः इसलिए क्योंकि डेटासेट में काई बहुत दुर्लभ है और अन्य चीजों के समान दिखती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।