← नवीनतम पेपर
🤖 machine learning

Model Merging by Output-Space Projection

यह शोध पत्र एक नवीन मॉडल मर्जिंग फ्रेमवर्क प्रस्तावित करता है जो फाइन-ट्यून्ड चेकपॉइंट्स के संयोजन को रेसिडुअल अपडेट्स पर एक उत्तल द्विघातीय प्रोग्राम (convex quadratic program) के रूप में सूत्रबद्ध करता है, जो मर्ज की गुणवत्ता का पूर्वानुमान लगाने के लिए एक सैद्धांतिक रूप से आधारित, क्लोज्ड-फॉर्म डायग्नोस्टिक प्रदान करता है और भाषा एवं विजन बेंचमार्क पर मौजूदा ह्यूरिस्टिक विधियों से अनुभवजन्य रूप से बेहतर प्रदर्शन करता है।

मूल लेखक: Bethan Evans, Benjamin Etheridge, Stephen Roberts, Jared Tanner

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bethan Evans, Benjamin Etheridge, Stephen Roberts, Jared Tanner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पाँच विशेषज्ञ शेफ की एक टीम है। प्रत्येक ने एक विशिष्ट व्यंजन को महीनों तक निखारने में समय बिताया है: एक पिज्जा का उस्ताद है, दूसरा सुशी का, तीसरा पास्ता का, और इसी तरह। अब, आप एक एकल "सुपर शेफ" बनाना चाहते हैं जो इन पाँचों व्यंजनों को पूरी तरह से बना सके, लेकिन आपके पास एक नए व्यक्ति को शुरू से प्रशिक्षित करने का समय नहीं है।

वर्तमान विधियों के साथ समस्या
अभी, इन शेफ को संयोजित करने का मानक तरीका एक समिति के वोट की तरह है।

  • टास्क अरिथमेटिक (Task Arithmetic): आप बस उनके व्यंजनों का औसत लेते हैं।
  • मॉडल सूप्स (Model Soups): आप उनके अवयवों को एक बड़े बर्तन में मिला देते हैं और उम्मीद करते हैं कि स्वाद अच्छा होगा।
  • TIES/DARE: आप उन अवयवों को हटाने की कोशिश करते हैं जिन पर वे असहमत हैं या यादृच्छिक रूप से कुछ फेंक देते हैं।

ये विधियाँ ठीक काम करती हैं, लेकिन ये केवल अनुमान लगाने जैसा है। वे सरल नियमों (जैसे "हर किसी को समान वोट मिलता है") पर निर्भर करती हैं बजाय इसके कि वे सुपर शेफ के लिए सटीक रेसिपी की गणना करें। उन्हें यह नहीं पता कि पिज्जा शेफ के ज्ञान में से कितना और सुशी शेफ के ज्ञान में से कितना रखना है।

पेपर का नया विचार: "आउटपुट-स्पेस प्रोजेक्शन" (Output-Space Projection)
लेखक इस तरह से मॉडलों को मिलाने का एक स्मार्ट तरीका प्रस्तावित करते हैं। वजन (सामग्री) को औसत निकालने के बजाय, वे परिणामों (तैयार व्यंजनों) को देखते हैं।

यहाँ इसका सादृश्य (Analogy) दिया गया है:
कल्पना कीजिए कि आपके पास एक "कैलिब्रेशन किचन" है जहाँ आप शेफ का परीक्षण करते हैं। आप उन्हें एक विशिष्ट सामग्री (इनपुट) देते हैं और एक विशिष्ट व्यंजन (आउटपुट) मांगते हैं।

  1. बेस मॉडल (The Base Model): यह आपका "कोरा स्लेट" वाला शेफ है जिसे कुछ नहीं पता।
  2. रेसिडुअल्स (The Residuals): यह बेस शेफ द्वारा बनाए गए व्यंजन और विशेषज्ञ शेफ द्वारा बनाए गए व्यंजन के बीच का अंतर है। यह वह "अतिरिक्त स्वाद" है जो प्रत्येक विशेषज्ञ जोड़ता है।
  3. लक्ष्य (The Goal): आप हर इनपुट के लिए सही व्यंजन प्राप्त करने के लिए इन "अतिरिक्त स्वादों" को मिलाना चाहते हैं।

पेपर कहता है: "आइए इसे एक गणितीय पहेली की तरह मानें।"

वे इसे एक क्वाड्रैटिक प्रोग्राम (QP) के रूप में फ्रेम करते हैं। सरल अंग्रेजी में, यह एक फैंसी तरीका है यह कहने का कि: "हम एक सटीक गणितीय समीकरण लिख सकते हैं जो हमें ठीक से बताता है कि प्रत्येक विशेषज्ञ के 'अतिरिक्त स्वाद' को कितना मिलाना है ताकि गलतियों को कम किया जा सके।"

यह कैसे काम करता है (प्रोजेक्शन का रूपक)
सोचिए कि "परफेक्ट डिश" डार्टबोर्ड पर एक लक्ष्य की तरह है।

  • प्रत्येक विशेषज्ञ शेफ एक डार्ट फेंकता (उनका अपडेट) जो लक्ष्य के पास कहीं गिरता है।
  • "रेसिड्यूल" वह दूरी है जहाँ वे गिरे और बुल्सआई (केंद्र) के बीच की।
  • वर्तमान विधियाँ बस इन डार्ट्स का औसत लगाने का अनुमान लगाती हैं।
  • यह पेपर की विधि पूछती है: "यदि मैं इन सभी डार्ट्स को एक विशिष्ट रेखा या तल (सबस्पेस) पर प्रोजेक्ट करूँ, तो कौन सा संयोजन हमें बुल्सआई के सबसे करीब ले जाएगा?"

उन्होंने पाया कि यदि आप गलतियों की "ऊर्जा" (डार्ट्स कितनी दूर हैं) को देखते हैं, तो आप गणितीय रूप से मिश्रण के लिए इष्टतम दिशा (optimal direction) की गणना कर सकते हैं।

  • डायगोनल मेथड (The Diagonal Method - सस्ता संस्करण): यह मानता है कि विशेषज्ञों के कौशल स्वतंत्र हैं। यह कहने जैसा है कि, "पिज्जा शेफ केवल पिज्जा को प्रभावित करता है, और सुशी शेफ केवल सुशी को।" यह तेज़ और गणना में आसान है।
  • ऑप्टिमल बेसिस मेथड (The Optimal Basis Method - महंगा संस्करण): यह महसूस करता है कि कौशल ओवरलैप हो सकते हैं। शायद पिज्जा शेफ की सॉस बनाने की तकनीक वास्तव में पास्ता में भी मदद करती है। यह सभी उपयोगी "ऊर्जा" को कैप्चर करने के लिए दिशाओं का सबसे अच्छा संभव मिश्रण ढूंढता है।

मुख्य निष्कर्ष

  1. यह एक एकीकृत सिद्धांत है: पेपर दिखाता है कि वर्तमान में लोग उपयोग करने वाले सभी लोकप्रिय तरीके (टास्क अरिथमेटिक, मॉडल सूप्स, TIES) वास्तव में इस नए गणितीय पहेली के विशेष, सरलीकृत संस्करण हैं। वे "ह्यूरिस्टिक" (नियम-आधारित अनुमान) हैं, जबकि यह नया तरीका वास्तविक गणितीय समाधान ढूंढता है।
  2. यह सफलता की भविष्यवाणी करता है: मॉडलों को मिलाने से पहले ही, लेखकों ने एक "नैदानिक उपकरण" (diagnostic tool) बनाया। कैलिब्रेशन डेटा को देखकर, वे एक स्कोर (कैप्चर की गई रेसिड्यूल एनर्जी का अंश) की गणना कर सकते हैं जो यह भविष्यवाणी करता है कि मर्ज किया गया मॉडल कैसा प्रदर्शन करेगा। यह खाना पकाने से पहले सामग्रियों की जांच करने जैसा है ताकि यह जाना जा सके कि व्यंजन कैसा होगा।
  3. यह बेहतर काम करता है: जब उन्होंने इमेज रिकग्निशन (जैसे कारों या जानवरों की पहचान करना) और लैंग्वेज मॉडल्स (जैसे LLMs) पर इसका परीक्षण किया, तो उनका गणित-आधारित तरीका मौजूदा "अनुमान लगाने वाली" विधियों के बराबर रहा या उनसे बेहतर रहा।
    • "सस्ता" डायगोनल संस्करण अक्सर पर्याप्त था और बहुत तेज़ था।
    • "महंगा" ऑप्टिमल संस्करण तब और भी बेहतर था जब विशेषज्ञों के कौशल जटिल और ओवरलैपिंग थे।

निष्कर्ष (The Bottom Line)
यह पेपर केवल यह नहीं कहता कि "मॉडलों को मिलाएं।" यह मॉडलों को पूरी तरह से मिलाने के लिए एक गणितीय ब्लूप्रिंट प्रदान करता है। यह मॉडल मर्जिंग की कला को एक हल करने योग्य ज्यामितीय समस्या में बदल देता है, यह दिखाते हुए कि त्रुटियों को सही गणितीय स्थान पर प्रोजेक्ट करके, आप बिना दोबारा प्रशिक्षण के एक एकल, सुपर-परफॉर्मिंग मॉडल बना सकते हैं।

वे यह भी नोट करते हैं कि जबकि पूर्ण समाधान के लिए भारी गणित (आइजनवेक्टर्स को हल करना) की आवश्यकता होती है, सरल संस्करण (डायगोनल मास्किंग) अक्सर एक बेहतरीन, तेज़ शॉर्टकट है जो अभी भी पुराने तरीकों की तुलना में बेहतर प्रदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →