← नवीनतम पेपर
💻 computer science

ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling

exPLoRe एक नवीन मल्टी-ऑब्जेक्टिव मास्क्ड इमेज मॉडलिंग फ्रेमवर्क पेश करता है जो ग्रेडिएंट-कपल्ड डिस्पैच वेट्स के माध्यम से प्रति-पैच लॉस कोफिशिएंट्स को गतिशील रूप से रूट करने के लिए सॉफ्ट मिक्सचर ऑफ एक्सपर्ट्स का उपयोग करता है, जिससे स्थानिक विषमता (spatial heterogeneity) को संबोधित किया जाता है और ImageNet-1K एवं ADE20K बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

मूल लेखक: Konstantinos Georgiou, Maofeng Tang, Hairong Qi

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Konstantinos Georgiou, Maofeng Tang, Hairong Qi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को फोटो में वस्तुओं को पहचानना सिखा रहे हैं, जैसे कि एक कुत्ता या एक पक्षी। कंप्यूटर विजन की दुनिया में, इसे मास्क्ड इमेज मॉडलिंग (MIM) कहा जाता है। शिक्षक छवि के कुछ हिस्सों को ढक देता है (उन्हें मास्क कर देता है) और छात्र से पूछता है कि क्या गायब है इसका अनुमान लगाने या पूरी तस्वीर का वर्णन करने के लिए।

इसे अच्छी तरह से करने के लिए, छात्र को एक साथ तीन अलग-अलग चीजें सीखने की आवश्यकता होती है:

  1. बड़ी तस्वीर (The Big Picture): छवि के सामान्य भाव को समझना (जैसे कि "यह एक कुत्ता है")।
  2. विवरण (The Details): छिपे हुए हिस्सों के सटीक रंगों और बनावट (textures) का अनुमान लगाना।
  3. संदर्भ (The Context): छात्र की समझ को एक "सुपर-टीचर" (एक प्री-ट्रेंड AI) के साथ मिलाना जो पहले से ही जानता है कि चीजें कैसी दिखती हैं।

समस्या: एक ही आकार सबके लिए सही नहीं होता (One Size Does Not Fit All)

पेपर वर्तमान AI मॉडल को सिखाने के तरीके में एक दोष की ओर इशारा करता है। आमतौर पर, शिक्षक छात्र को एक वैश्विक निर्देश देता है: "बड़ी तस्वीर पर 50% ध्यान दें और विवरण पर 50% ध्यान दें।"

लेकिन यह एक शेफ को यह बताने जैसा है कि एक नाजुक सूप और एक भारी स्टेक दोनों पर समान मात्रा में नमक का उपयोग करें। यह अच्छी तरह से काम नहीं करता क्योंकि छवि के विभिन्न हिस्सों को अलग-अलग प्रकार की मदद की आवश्यकता होती है:

  • कुत्ता (फोरग्राउंड/अग्रभूमि): यह समझने के लिए कि यह एक कुत्ता है, इसे "बड़ी तस्वीर" और "संदर्भ" की मदद की आवश्यकता है।
  • घास (बैकग्राउंड/पृष्ठभूमि): इसकी बनावट को सही ढंग से समझने के लिए इसे "विवरण" की मदद की आवश्यकता है।

वर्तमान विधियाँ पूरी छवि के साथ एक जैसा व्यवहार करती हैं, यह अनदेखा करते हुए कि "कुत्ते" वाले हिस्से और "घास" वाले हिस्से को अलग-अलग पाठों की आवश्यकता है।

समाधान: ExPLoRe (स्मार्ट ट्यूटर)

लेखकों ने ExPLoRe (एक्सपर्ट पैच-लेवल लॉस रूटिंग) नामक एक नई विधि बनाई है। उन्होंने मिक्सचर ऑफ एक्सपर्ट्स (MoE) का उपयोग करने वाली एक चतुर तकनीक का इस्तेमाल किया।

सोचिए कि AI मॉडल विशेषज्ञों (Experts) के दो विशिष्ट ट्यूटर्स (Tutors) वाला एक क्लासरूम है:

  • ट्यूटर A "बड़ी तस्वीर" की अवधारणाओं को पढ़ाने में माहिर है।
  • ट्यूटर B "बनावट के विवरण" (Texture Details) पढ़ाने में माहिर है।

पुरानी विधियों में, शिक्षक बस कक्षा को दो भागों में विभाजित कर देता और कहता, "तुम ट्यूटर A के पास जाओ, तुम ट्यूटर B के पास जाओ।"

ExPLoR में, शिक्षक बहुत स्मार्ट है। वे छवि के हर एक पैच (छोटा वर्ग) को देखते हैं और पूछते हैं: "क्या यह पैच एक कुत्ते जैसा दिखता है? तो इसे ट्यूटर A के पास भेजें। क्या यह घास जैसा दिखता है? इसे ट्यूटर B के पास भेजें।"

गुप्त नुस्खा: "लॉस-कपलिंग" (Loss-Coupling)

पेपर की सबसे बड़ी खोज एक तंत्र है जिसे लॉस-कपलिंग कहा जाता है।

कल्पना कीजिए कि ट्यूटर्स छात्र के होमवर्क को ग्रेड कर रहे हैं। ExPLoR में, ट्यूटर्स केवल काम को ग्रेड नहीं करते; वे यह भी तय करने का अधिकार रखते हैं कि अगला पाठ कौन पढ़ाएगा।

  • यदि छात्र "कुत्ते" वाले हिस्से में संघर्ष करता है, तो सिस्टम नोटिस करता है और राउटर को बताता है: "हे, हमें इस विशिष्ट स्थान पर ट्यूटर A से अधिक मदद की आवश्यकता है।"
  • राउटर फिर अपने वेट्स (weights) को एडजस्ट करता है ताकि भविष्य में अधिक "कुत्ते" वाले पैच को ट्यूटर A के पास भेजा जा सके।

पेपर यह सिद्ध करता है कि यह फीडबैक लूप महत्वपूर्ण है। उन्होंने इस फीडबैक लूप को बंद करके (जिसे "डिटैचिंग" कहा जाता है) परीक्षण किया, और मॉडल का प्रदर्शन गिर गया। यह जानने की क्षमता के बिना कि किस विशेषज्ञ के लिए कौन सा पैच सबसे अच्छा है, सिस्टम बस भ्रमित हो जाता है।

जब उन्होंने इसका परीक्षण किया तो क्या हुआ?

शोधकर्ताओं ने छवियों के एक विशाल डेटासेट (ImageNet) पर इसका परीक्षण किया।

  • परिणाम: मॉडल बहुत तेज़ी से सीखा और वस्तुओं को पहचानने में बेहतर हो गया।
  • उपमा: यह एक ऐसे छात्र की तरह है जो, पूरे टेक्स्टबुक को एक ही तरह से पढ़ने के बजाय, "इतिहास" के अध्यायों को इतिहास के शिक्षक के साथ और "गणित" के अध्यायों को गणित के शिक्षक के साथ पढ़ना सीखता है। वे उच्च अंकों के साथ परीक्षा पास करते हैं।
  • विशिष्ट विवरण: उन्होंने छवियों की पहचान करने में शीर्ष-स्तरीय स्कोर (80.6% सटीकता) प्राप्त किया और यहाँ तक कि छवियों की सीमाओं (boundaries) को खोजने जैसे अन्य कार्यों के लिए मॉडल को "फाइन-ट्यूनिंग" करने में भी शानदार काम किया।

"फाइन-ट्यूनिंग" रेसिपी

पेपर ने यह भी देखा कि जब उन्होंने इस स्मार्ट, विशिष्ट मॉडल को किसी नए, विशिष्ट कार्य (जैसे मेडिकल इमेज या स्ट्रीट सीन की पहचान करना) के लिए उपयोग करने की कोशिश की, तो यह कभी-कभी भ्रमित हो जाता था क्योंकि यह बहुत अधिक विशिष्ट हो गया था।

उन्होंने इसे ठीक करने के लिए एक "रेसिपी" विकसित की, जिसमें शामिल हैं:

  1. राउटर को फ्रीज करना (Freezing the Router): "कौन कहाँ जाएगा" के निर्णय को लॉक करना ताकि मॉडल अपनी विशेषज्ञता को न भूले।
  2. एक्सपर्ट ड्रॉपआउट (Expert Dropout): कभी-कभी एक ट्यूटर को बेतरतीब ढंग से बंद कर देना ताकि दूसरे ट्यूटर्स आगे बढ़ सकें, जिससे मॉडल केवल एक ही विशेषज्ञ पर बहुत अधिक निर्भर न रहे।

निचोड़ (The Bottom Line)

ExPLoR तस्वीरों को देखने के लिए AI को प्रशिक्षित करने का एक स्मार्ट तरीका है। पूरी छवि को एक सामान्य पाठ देने के बजाय, यह एक व्यक्तिगत ट्यूटर की तरह कार्य करता है, जो छवि के विभिन्न हिस्सों को उस विशिष्ट विशेषज्ञ के पास भेजता है जो उन्हें संभालने के लिए सबसे उपयुक्त है। यह AI को तेज़ी से सीखने, बेहतर समझने और बिना कंप्यूटिंग पावर में भारी वृद्धि के शीर्ष स्तर पर प्रदर्शन करने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →