← नवीनतम पेपर
🤖 machine learning

Bayesian Model Merging

यह शोध पत्र बेयसियन मॉडल मर्जिंग (BMM) को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले द्वि-स्तरीय अनुकूलन ढांचा है जो बिना संयुक्त पुनरप्रशिक्षण या सहायक डेटा के, कई कार्य-विशिष्ट मॉडलों को एक एकल उच्च-प्रदर्शन वाले मॉडल में कुशलतापूर्वक मिलाने के लिए मजबूत एंकर प्रायर्स (anchor priors) को बेयसियन अनुकूलन के साथ जोड़ता है।

मूल लेखक: Kaiyang Li, Shaobo Han, Qing Su, Shihao Ji

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaiyang Li, Shaobo Han, Qing Su, Shihao Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास आठ अलग-अलग विशेषज्ञों की एक टीम है। एक कारों को पहचानने में माहिर है, दूसरा फूलों को पहचानने में, तीसरा ट्रैफिक संकेतों को पढ़ने में, और इसी तरह अन्य। प्रत्येक विशेषज्ञ ने अपने एक विशिष्ट कार्य के लिए वर्षों तक प्रशिक्षण लिया है।

अब, कल्पना कीजिए कि आप एक एकल "सुपर-एक्सपर्ट" (Super-Expert) बनाना चाहते हैं जो कारों, फूलों और ट्रैफिक संकेतों के बारे में सब कुछ एक साथ जानता हो।

समस्या:
आमतौर पर, इस सुपर-एक्सपर्ट को बनाने के लिए, आपको हर एक कार्य के लिए सभी मूल प्रशिक्षण डेटा (training data) को इकट्ठा करना होगा और पूरे सिस्टम को फिर से प्रशिक्षित करना होगा। लेकिन क्या होगा यदि आपके पास वह डेटा नहीं है? शायद वह डेटा निजी है, खो गया है, या उसे स्टोर करना बहुत महंगा है।

मौजूदा तरीके इन विशेषज्ञों के "मस्तिष्क" को बस एक साथ "औसत" (average) निकालने की कोशिश करते हैं। इसे ऐसे समझें जैसे कि आपने सूप की आठ अलग-अलग रेसिपी ली और उन्हें एक ही बर्तन में मिला दिया। कभी-कभी यह काम करता है, लेकिन अक्सर स्वाद आपस में टकरा जाते हैं, या परिणाम एक फीका और औसत दर्जे का सूप होता है जो मूल रेसिपी में से किसी भी एक जितनी अच्छी नहीं होती।

समाधान: बेयसियन मॉडल मर्जिंग (Bayesian Model Merging - BMM)
यह पेपर एक नई विधि पेश करता है जिसे बेयसियन मॉडल मर्जिंग (BMM) कहा जाता है। विशेषज्ञों को अंधाधुंध मिलाने के बजाय, BMM विशेषज्ञों को संयोजित करने के लिए एक स्मार्ट, दो-चरणीय प्रक्रिया का उपयोग करता है।

चरण 1: "एंकर" और "करेक्शन" (इनर लूप/Inner Loop)

कल्पना कीजिए कि आपके पास एक बहुत ही विश्वसनीय, लेकिन थोड़ा पुराना "बेस मैप" (यह एंकर मॉडल है) है। आपके पास विशेषज्ञों से मिले आठ नए, विशिष्ट मानचित्र भी हैं जो अलग-अलग मोहल्लों को दर्शाते हैं।

पुराने तरीकों ने शुरू से एक नया नक्शा बनाने की कोशिश की। BMM कहता है, "आइए बेस मैप से शुरुआत करें और केवल विशेषज्ञों से मिलने वाले अंतरों (करेक्शन) को जोड़ें।"

हालाँकि, यदि आप सभी सुधारों को बस जोड़ देते हैं, तो आप शोर (noise) में खो सकते हैं। इसलिए, BMM इसे एक गणितीय पहेली की तरह मानता है। यह पूछता है: "सबसे संभावित सुधार क्या है जो ओवरफिटिंग (overfitting) किए बिना सभी विशेषज्ञों के डेटा में फिट बैठता है?"

  • जादुई ट्रिक: पेपर ने विशेषज्ञों द्वारा देखे गए "डेटा" और उनके द्वारा सीखे गए "वेट्स" (weights) के बीच एक छिपा हुआ संबंध खोजा है। इस संबंध के कारण, BMM इस गणितीय पहेली को एक सरल फॉर्मूले ("क्लोज्ड-फॉर्म सॉल्यूशन") के साथ तुरंत हल कर सकता है। इसे अनुमान लगाने और बार-बार जांचने की आवश्यकता नहीं है; यह तुरंत सटीक मिश्रण की गणना करता है।

चरण 2: "ट्यूनिंग नॉब" की खोज (आउटर लूप/Outer Loop)

यहाँ एक पेच है: मस्तिष्क के अलग-अलग हिस्से (या नेटवर्क की अलग-अलग परतें) अलग-अलग मात्रा में "करेक्शन" की आवश्यकता रखते हैं। कुछ परतों को एक भारी धक्के की आवश्यकता हो सकती है, जबकि कुछ को एक हल्की सी फुसफुसाहट की।

पुराने तरीके पूरे मस्तिष्क के लिए एक ही "वॉल्यूम नॉब" का उपयोग करते थे। BMM महसूस करता है कि यह अक्षम है। यह हर एक हिस्से के लिए एकदम सही वॉल्यूम सेटिंग खोजने के लिए बेयसियन ऑप्टिमाइज़ेशन नामक एक स्मार्ट सर्च टूल का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप 100 अलग-अलग नॉब वाले एक विशाल साउंड सिस्टम को ट्यून कर रहे हैं। सभी को रैंडमली घुमाने या उन सभी को एक ही वॉल्यूम पर सेट करने के बजाय, BMM एक स्मार्ट ऑडियो इंजीनियर की तरह है जो आउटपुट को सुनता है और जल्दी से यह पता लगा लेता है कि बेहतरीन साउंड पाने के लिए प्रत्येक विशिष्ट नॉब को कितना घुमाना है।

"नो-डेटा" (No-Data) की महाशक्ति

आमतौर पर, इन नॉब्स को ट्यून करने के लिए, आपको यह देखने के लिए थोड़े से टेस्ट डेटा की आवश्यकता होती है कि नया सुपर-एक्सपर्ट कैसा प्रदर्शन कर रहा है।

लेकिन यह पेपर एक आश्चर्यजनक ट्रिक प्रकट करता है: आपको वास्तव में उस टेस्ट डेटा की आवश्यकता नहीं है।

जैसा कि ऊपर बताए गए गणितीय संबंध के कारण, BMM यह अनुमान लगा सकता है कि विशेषज्ञ कैसे प्रदर्शन करेंगे, केवल उनके अंतिम "वेट्स" (उनके मस्तिष्क के अंदर के नंबर) को देखकर। यह एक शेफ के कौशल को उसके चाकू और सामग्री को देखकर आंकने जैसा है, बिना भोजन को चखे। यह इसे तब भी काम करने में सक्षम बनाता है जब आपके पास मदद के लिए कोई अतिरिक्त डेटा न हो।

परिणाम

लेखकों ने विजन कार्यों (जैसे फोटो में वस्तुओं की पहचान करना) और भाषा कार्यों (जैसे सवालों के जवाब देना) पर इसका परीक्षण किया।

  • परिणाम: लगभग हर परीक्षण में, BMM ने पिछले तरीकों की तुलना में काफी बेहतर सुपर-एक्सपर्ट बनाया।
  • मुख्य आकर्षण: 8 अलग-अलग विजन कार्यों वाले एक कठिन टेस्ट पर, उनके एकल मर्ज किए गए मॉडल ने 95.1% स्कोर किया। आठ व्यक्तिगत विशेषज्ञों का औसत स्कोर 95.8% था। इसका मतलब है कि उन्होंने बिना दोबारा प्रशिक्षण दिए या मूल डेटा देखे, आठ विशेषज्ञों को एक व्यक्ति में संयोजित किया जो लगभग उन सभी के बराबर अच्छा है।

संक्षेप में:
BMM एक प्लग-एंड-प्ले टूल है जो कई विशिष्ट AI मॉडल्स को लेता है और उन्हें एक में मर्ज कर देता है। यह कुशलतापूर्वक मिश्रण करने के लिए एक स्मार्ट गणितीय फॉर्मूले का उपयोग करता है और मिश्रण को पूरी तरह से ट्यून करने के लिए एक स्मार्ट सर्च एल्गोरिदम का उपयोग करता है। सबसे अच्छी बात यह है कि यह तब भी काम कर सकता है जब आपके पास मदद के लिए कोई अतिरिक्त डेटा न हो, जो इसे वास्तविक दुनिया में AI मॉडल्स को संयोजित करने के लिए एक शक्तिशाली उपकरण बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →