← नवीनतम पेपर
💻 computer science

Mine-JEPA: In-Domain Self-Supervised Learning for Mine-Like Object Classification in Side-Scan Sonar

यह शोध पत्र Mine-JEPA को पेश करता है, जो एक इन-डोमेन सेल्फ-सुपरवाइज्ड लर्निंग पाइपलाइन है जो केवल 1,170 अनलेबल छवियों पर प्रशिक्षण देकर और काफी कम मापदंडों (पैरामीटर्स) के साथ साइड-स्कैन सोनार माइन वर्गीकरण में DINOv3 जैसे बड़े सामान्य-उद्देश्य वाले फाउंडेशन मॉडल्स की तुलना में बेहतर सटीकता प्राप्त करते हुए उन्हें पीछे छोड़ देता है।

मूल लेखक: Taeyoun Kwon, Youngwon Choi, Hyeonyu Kim, Myeongkyun Cho, Junhyeok Choi, Moon Hwan Kim

प्रकाशित 2026-04-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taeyoun Kwon, Youngwon Choi, Hyeonyu Kim, Myeongkyun Cho, Junhyeok Choi, Moon Hwan Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो समुद्र के तल पर छिपे हुए खजाने (पानी के नीचे लगे माइन्स/बारूदी सुरंगों) को खोजने की कोशिश कर रहे हैं, जिसके लिए आप एक विशेष कैमरे का उपयोग कर रहे हैं जिसे साइड-स्कैन सोनार (Side-Scan Sonar) कहा जाता है।

समस्या क्या है? समुद्र का तल हमारी आँखों से दिखने वाली दुनिया से बिल्कुल अलग दिखता है। एक इंसान के लिए, एक माइनी (mine) एक काली-सफेद फोटो में एक धुंधले, दानेदार धब्बे जैसा दिखता है। एक मानक कंप्यूटर विज़न AI (जिसे करोड़ों बिल्लियों, कारों और सूर्यास्त की तस्वीरों पर प्रशिक्षित किया गया है) के लिए, यह पूरी तरह से निरर्थक या समझ से बाहर जैसा दिखता है।

इसके अलावा, हमारे पास "लेबल वाली" (labeled) तस्वीरों की भारी कमी है। हमारे पास हर तस्वीर में हर माइनी के चारों ओर बॉक्स बनाने के लिए हजारों विशेषज्ञों की फौज नहीं है। हमारे पास केवल लगभग 1,170 छवियों की एक छोटी सी स्क्रैपबुक है।

यहीं पर Mine-JEPA काम आता है। यह एक नया, चतुर तरीका है जिससे कंप्यूटर को बिना किसी विशाल लाइब्रेरी की आवश्यकता के माइनी का जासूस बनने के लिए सिखाया जा सकता है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं के साथ:

1. समस्या: "विदेशी भाषा" की बाधा

मान लीजिए कि मानक AI मॉडल (जैसे प्रसिद्ध DINOv3) वे प्रतिभाशाली छात्र हैं जिन्होंने दुनिया की सबसे बड़ी लाइब्रेरी की हर किताब पढ़ ली है (1.7 बिलियन चित्र)। वे प्राकृतिक चीजों को पहचानने में विशेषज्ञ हैं।

लेकिन यदि आप उन्हें एक सोनार इमेज थमा देते हैं, तो यह एक शेक्सपियर विशेषज्ञ को पूरी तरह से एक विदेशी भाषा में लिखी गई किताब देने जैसा है। भले ही वह विशेषज्ञ बुद्धिमान हो, लेकिन वह सोनार की "व्याकरण" (ध्वनिक छाया और बनावट) को नहीं समझता। यदि आप उन्हें केवल कुछ पन्नों का उपयोग करके इस नई भाषा को सीखने के लिए मजबूर करते हैं, तो वे भ्रमित हो सकते हैं और वास्तव में पहले की तुलना में बदतर प्रदर्शन कर सकते हैं।

2. समाधान: "शिक्षु" (Apprentice) दृष्टिकोण

एक "सुपर एक्सपर्ट" (DINOv3) को काम पर रखने और उन्हें फिर से प्रशिक्षित करने के बजाय, लेखकों ने एक नया सिस्टम बनाया जिसे Mine-JEPA कहा जाता है।

Mine-JEPA को एक चतुर शिक्षु (Apprentice) के रूप में सोचें जो आकृतियों और किनारों की बुनियादी समझ (एक मानक इमेज लाइब्रेरी 'ImageNet' से) के साथ शुरू होता है, लेकिन उसे विशेष रूप से समुद्र के तल की "बोली" सीखने के लिए प्रशिक्षित किया गया है।

उन्होंने SIGReg नामक एक विशेष शिक्षण पद्धति का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आप एक नया गाना सीखने की कोशिश कर रहे हैं। गाने को बार-बार सुनने के बजाय (जो उबाऊ और कम उदाहरणों के साथ कठिन है), आपको धुन का एक "कच्चा स्केच" दिया जाता है और खाली स्थानों को भरने के लिए कहा जाता है।
  • यह कैसे काम करता है: AI एक सोनार पैच को देखता है, उसके कुछ "विकृत" (distorted) संस्करण बनाता है (जैसे उसे पलटना या उसकी चमक बदलना), और यह सुनिश्चित करने की कोशिश करता है कि उसका मस्तिष्क उन सभी को एक ही वस्तु के रूप में पहचान ले। साथ ही, यह सुनिश्चित करता है कि वह केवल शोर (noise) को याद न कर ले। यह आकार के सार को सीखता है।

3. गुप्त नुस्खा: "सोनार-विशिष्ट" प्रशिक्षण

लेखकों ने महसूस किया कि आप सोनार AI को उन्हीं तरीकों से नहीं सिखा सकते जिनका उपयोग नियमित तस्वीरों के लिए किया जाता है।

  • गलती: यदि आप एक बिल्ली की फोटो लेते हैं और बेतरतीब ढंग से उसके रंग (hue/saturation) बदलते हैं, तो वह अभी भी एक बिल्ली ही रहती है। लेकिन सोनार इमेज ग्रेस्केल ध्वनिक मानचित्र (acoustic maps) होते हैं। "रंगों" (जो वास्तव में सिग्नल की ताकत हैं) को बदलने से जानकारी नष्ट हो जाती है।
  • सुधार: उन्होंने AI के लिए एक "सोनार जिम" बनाया। उन्होंने केवल उन्हीं बदलावों की अनुमति दी जो समुद्र के लिए तर्कसंगत हों: जैसे इमेज को उल्टा करना (क्योंकि सोनार ऊपर या नीचे से देख रहा हो सकता है) या इसे थोड़ा घुमाना। उन्होंने रंगों के साथ छेड़छाड़ करना बंद कर दिया क्योंकि सोनार में "रंग" का अस्तित्व नहीं होता।

4. आश्चर्यजनक खोज: "कम ही अधिक है"

यहाँ कहानी का सबसे आश्चर्यजनक हिस्सा है।

शोधकर्ताओं ने "सुपर एक्सपर्ट" (DINOv3) को लेने की कोशिश की और उन्हें अपने नए तरीके का उपयोग करके सोनार की भाषा सिखाने का प्रयास किया। यह विफल रहा। विशेषज्ञ भ्रमित हो गया और उसका प्रदर्शन 10-13% तक गिर गया। यह पता चला कि जब आप पहले से ही एक क्षेत्र के विशेषज्ञ होते हैं, तो एक पूरी तरह से नए, अजीब क्षेत्र को सीखने के लिए मजबूर करना आपके दिमाग को खराब कर सकता है।

हालाँकि, शिक्षु (Mine-JEPA), जो एक सरल आधार से शुरू हुआ और विशेष रूप से समुद्र के लिए सीखा, सुपर एक्सपर्ट को हरा गया।

  • परिणाम: केवल 1,170 छवियों पर प्रशिक्षित होने के बावजूद, Mine-JEPA ने DINOv3 (जो 1.7 बिलियन छवियों पर प्रशिक्षित था) की तुलना में उच्च सटीकता प्राप्त की।
  • दक्षता: उन्होंने अपने मॉडल का एक छोटा संस्करण (ViT-Tiny) भी परीक्षण किया। यह विशाल फाउंडेशन मॉडलों की तुलना में 4 गुना छोटा था, फिर भी इसने उतना ही अच्छा काम किया।

5. "नकली डेटा" का बूस्ट

शिक्षु को और भी बेहतर बनाने के लिए, उन्होंने प्रशिक्षण मिश्रण में 256,000 सिंथेटिक (नकली) सोनार चित्र जोड़े।

  • उपमा: कल्पना कीजिए कि आप ड्राइविंग सीख रहे हैं। आपके पास 10 वास्तविक ड्राइविंग सबक हैं। अधिक अभ्यास करने के लिए, आपको एक ड्राइविंग सिम्युलेटर मिलता है। भले ही सिम्युलेटर में सड़क वास्तविक नहीं है, लेकिन यह आपको सड़क के नियम सिखाता है।
  • परिणाम: वास्तविक सोनार डेटा को इस "सिम्युलेटर" डेटा के साथ मिलाने से AI और भी सटीक हो गया, जिससे यह सिद्ध हुआ कि यदि AI को सही तरीके से प्रशिक्षित किया जाए तो आप नकली डेटा से भी सीख सकते हैं।

मुख्य निष्कर्ष

यह शोध पत्र हमें कठिन क्षेत्रों (जैसे चिकित्सा या समुद्री अन्वेषण) में AI के भविष्य के लिए एक मूल्यवान सबक सिखाता है:

आपको हमेशा सबसे बड़े, सबसे महंगे AI मॉडल की आवश्यकता नहीं होती।

यदि आपके पास बहुत कम डेटा है और एक बहुत ही विशिष्ट, अजीब वातावरण है, तो एक छोटा, सावधानीपूर्वक डिज़ाइन किया गया मॉडल जो विशेष रूप से उस वातावरण के लिए सीखा गया है, अक्सर एक विशाल, सामान्य-उद्देश्य वाले मॉडल को हरा देगा। एक ऐसे विशेषज्ञ का होना बेहतर है जो स्थानीय बोली जानता हो, बजाय एक ऐसे सामान्य व्यक्ति के जो सब कुछ जानता है लेकिन गलत भाषा बोलता है।

Mine-JEPA वही विशेषज्ञ है, और वह माइन्स को पहले से कहीं अधिक तेज़ी से और अधिक सटीकता से खोजकर हमारे जहाजों को सुरक्षित रखने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →