← नवीनतम पेपर
💻 computer science

MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration

यह शोध पत्र MED-DSLC का प्रस्ताव करता है, जो एक हल्का ढांचा (lightweight framework) है जो मल्टी-एक्सपर्ट विजन-लैंग्वेज मॉडल्स में ग्लोबल लॉजिट कंपैरेबिलिटी (global logit comparability) को बहाल करने के लिए डोमेन-सुपरवाइज्ड ट्रेनिंग और लॉजिट स्केलिंग को जोड़ता है, जिससे क्रॉस-डोमेन इंटरफेरेंस को हल किया जाता है और फाइन-ग्रेन्ड मल्टी-डोमेन ज़ीरो-शॉट क्लासिफिकेशन में सटीकता और स्केलेबिलिटी में महत्वपूर्ण सुधार होता है।

मूल लेखक: Zheng Zeng, Deepak Sridhar, Nuno Vasconcelos

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Zeng, Deepak Sridhar, Nuno Vasconcelos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास CLIP नाम का एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है। इस लाइब्रेरियन ने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं, इसलिए यदि आप उसे एक "गोल्डन रिट्रीवर" की फोटो दिखाते हैं, तो वह "कुत्ता" होने का अनुमान लगा सकता है, भले ही उसने उस विशिष्ट कुत्ते को पहले कभी न देखा हो। यह एक सूची से तुलना करके काम करता है जो उसके दिमाग में शब्दों के रूप में मौजूद है। समस्या क्या है? यदि आप उससे किसी बहुत ही विशिष्ट प्रकार के हवाई जहाज, जैसे कि "F-18 जेट" को पहचानने के लिए कहते हैं, तो वह केवल "मिलिट्री परेड" का अनुमान लगा सकता है क्योंकि उसकी सामान्य ट्रेनिंग से वह उसके सबसे करीब है।

इसे ठीक करने के लिए, वैज्ञानिकों ने विशेषज्ञों की एक टोली बनाई। प्रत्येक एक छोटा अपग्रेड (जिसे LoRA कहा जाता है) है जिसे केवल एक विशिष्ट विषय, जैसे कि हवाई जहाज, फूल या बनावट (textures) पर प्रशिक्षित किया गया है। यदि आप हवाई जहाज विशेषज्ञ को एक F-18 दिखाते हैं, तो वह बिल्कुल जानता है कि वह क्या है। लेकिन यहाँ एक पेंच है: यदि आपके पास 10 अलग-अलग विशेषज्ञ हैं, तो आपको अपनी जेब में 10 अलग-अलग मॉडल रखने पड़ेंगे। यह बहुत अव्यवस्थित है!

इसलिए, शोधकर्ताओं ने इन विशेषज्ञों को एक बड़े "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) मॉडल में मिलाने की कोशिश की। वे एक ऐसा रोबोट चाहते थे जो एक साथ हवाई जहाज विशेषज्ञ, फूल विशेषज्ञ और बनावट विशेषज्ञ के बीच स्विच कर सके। लेकिन जब उन्होंने उन्हें आपस में जोड़ने की कोशिश की, तो रोबोट भ्रमित हो गया।

द ग्रेट लॉजिट केओस (The Great Logit Chaos)
सोचिए कि "लॉजिट्स" (logits) रोबोट के आंतरिक आत्मविश्वास स्कोर की तरह हैं। जब हवाई जहाज विशेषज्ञ कहता है, "मुझे 90% यकीन है कि यह एक F-18 है," और फूल विशेषज्ञ कहता है, "मुझे 80% यकीन है कि यह एक गुलाब है," तो रोबोट आमतौर पर उच्चतम संख्या चुनता है।

लेकिन यहाँ एक गड़बड़ी है: क्योंकि प्रत्येक विशेषज्ञ को अकेले प्रशिक्षित किया गया था, वे आत्मविश्वास की एक ही भाषा नहीं बोलते हैं। हवाई जहाज विशेषज्ञ एक "ज़ोर से बोलने वाला" हो सकता है जो हमेशा बहुत बड़े नंबर देता है (जैसे 999), जबकि फूल विशेषज्ञ एक "धीमी आवाज़ वाला" हो सकता है जो छोटे नंबर देता है (जैसे 5)। भले ही फूल विशेषज्ञ वास्तव में सही हो, रोबोट हवाई जहाज विशेषज्ञ को चुन लेता है क्योंकि उसके नंबर अधिक ज़ोरदार हैं। इसे लॉजिट मिसकैलिब्रेशन (logit miscalibration) कहा जाता है। यह एक चिल्लाने वाली बहस की तरह है जहाँ सबसे तेज़ आवाज़ जीत जाती है, न कि सबसे सटीक आवाज़।

पेपर का तर्क है कि इसे ठीक करने के पिछले प्रयास (जैसे कि "MoLE" विधि) विफल रहे क्योंकि उन्होंने विशेषज्ञों को बिना किसी रेफरी के एक-दूसरे पर चिल्लाने दिया। उन्होंने रोबोट को खुद यह तय करने देने की कोशिश की कि किस विशेषज्ञ का उपयोग करना है, लेकिन बिना किसी शिक्षक के जो उसे बताए कि, "हे, यह तस्वीर एक हवाई जहाज के डोमेन से है," रोबलेट गलत और तेज़ आवाज़ को ही चुनता रहा।

समाधान: MED-DSLC
लेखक MED-DSLC नामक एक नया सिस्टम प्रस्तावित करते हैं। यह चिल्लाने वाली बहस में एक सख्त रेफरी और एक वॉल्यूम कंट्रोलर को काम पर रखने जैसा है।

  1. रेफरी (डोमेन सुपरविजन): विशेषज्ञ का अनुमान लगाने के बजाय, सिस्टम को स्पष्ट रूप से सिखाया जाता है कि कौन सा विशेषज्ञ किस डोमेन से संबंधित है। यदि तस्वीर एक विमान की है, तो रेफरी हवाई जहाज विशेषज्ञ की ओर इशारा करता है। यह रोबोट को उलझन में पड़ने से रोकता है।
  2. वॉल्यूम कंट्रोलर (लॉजिट स्केलिंग): यह जादू है। इससे पहले कि रोबोट स्कोर की तुलना करे, यह "ज़ोर से बोलने वाले" विशेषज्ञों की आवाज़ कम कर देता है और "धीमी आवाज़ वाले" विशेषज्ञों की आवाज़ बढ़ा देता है। यह प्रत्येक डोमेन के लिए एक विशेष "तापमान" (temperature) नॉब का उपयोग करता है ताकि यह सुनिश्चित हो सके कि हर कोई समान स्तर पर बोल रहा है। अब, रोबोट वास्तव में तुलना कर सकता है कि कौन सही है, न कि केवल कौन ज़ोर से बोल रहा है।

आंकड़े क्या कहते हैं
शोधकर्ताओं ने नौ अलग-अलग फाइन-ग्रेन्ड डेटासेट्स (जैसे कारें, फूल और बनावट) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • जब उन्होंने नए तरीके के बिना विशेषज्ञों को मिलाया, तो औसत सटीकता केवल लगभग 70.12% थी।
  • MED-DSLC के साथ, "बेस" स्प्लिट (एक विशिष्ट टेस्ट सेट) पर औसत सटीकता बढ़कर 85.51% हो गई। यह एक विशाल +15.39% का सुधार है।
  • और भी अधिक प्रभावशाली बात यह है कि उनकी नई विधि एक "परफेक्ट ओरकल" (perfect oracle) से भी थोड़ा बेहतर प्रदर्शन करती है, जो बिल्कुल जानता है कि हर बार किस विशेषज्ञ को चुनना है (जिसका स्कोर 85.48% था)।

उन्होंने यह भी दिखाया कि यह तब भी काम करता है जब डेटा असंतुलित हो। यदि एक डोमेन में केवल 2 क्लास हैं और दूसरे में 100, तो वॉल्यूम कंट्रोलर (लॉजिट स्केलिंग) बड़े डोमेन को छोटे डोमेन को दबाने से रोकता है।

उन्होंने क्या नहीं किया
पेपर बहुत स्पष्ट है कि यह क्या नहीं है। यह कोई जादुई छड़ी नहीं है जो रोबोट को बिना प्रशिक्षण के सब कुछ तुरंत समझने में मदद करती है। विशेषज्ञों को अभी भी अपने विशिष्ट डोमेन पर प्रशिक्षित होने की आवश्यकता है। इसके अलावा, पेपर यह दावा नहीं करता कि यह हर संभावित भविष्य की AI समस्या के लिए काम करेगा; यह विशेष रूप से विज़न-लैंग्वेज मॉडल्स के लिए इन विशिष्ट "LoRA" एडैप्टर्स को मिलाने की समस्या को हल करता है।

निर्णय (The Verdict)
लेखक अपने परिणामों को लेकर काफी आश्वस्त हैं क्योंकि उन्होंने कई अलग-अलग डेटासेट्स पर मापा है और कई अन्य विधियों के साथ तुलना की है। उन्होंने दिखाया कि केवल एक "रेफरी" और एक "वॉल्यूम नॉब" जोड़कर, वे विशेषज्ञों को लड़ने से रोक सकते हैं और उन्हें मिलकर काम करने दे सकते हैं। परिणाम यह है कि एक एकल, एकीकृत मॉडल जो एक हज़ार अलग-अलग मॉडलों के बराबर अच्छा है, लेकिन बिना किसी भ्रम के। यह एक हल्का, डेटा-कुशल समाधान है जो बताता है कि "ग्लोबल कंपैरेबिलिटी" (वैश्विक तुलनीयता) को बहाल करना ही मल्टी-डोमेन AI को वास्तव में सफल बनाने की कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →