← नवीनतम पेपर
🤖 machine learning

Multi-Objective Bayesian Optimization for Model Merging

यह शोध पत्र MOBO-Merge प्रस्तुत करता है, जो एक ऐसा ढांचा (framework) है जो वेट स्पेस (weight space) में कई मॉडलों को संयोजित करने के लिए मर्ज मापदंडों को कुशलतापूर्वक चुनने हेतु मल्टी-ऑब्जेक्टिव बायेसियन ऑप्टिमाइज़ेशन का उपयोग करता है, जो विभिन्न मर्ज ऑपरेटर्स और मॉडल कॉन्फ़िगरेशन में रैंडम सर्च की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Utkarsh Agarwal, Vamshi Bonagiri, Raul Astudillo, Monojit Choudhury

प्रकाशित 2026-08-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Utkarsh Agarwal, Vamshi Bonagiri, Raul Astudillo, Monojit Choudhury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जिसने दो अलग-अलग व्यंजनों को सिद्ध करने में वर्षों बिताए हैं: एक दुनिया का सबसे अच्छा चॉकलेट केक है, और दूसरा सबसे स्वादिष्ट, जटिल लासग्ना (lasagna) है। आपके पास एक जादुई रसोई है जहाँ आप केवल सामग्री को एक कटोरे में मिला नहीं सकते और उम्मीद नहीं कर सकते कि सब ठीक हो जाएगा; इसके बजाय, आपको तैयार केक और लासग्ना के पूरे परतों (layers) को एक नए व्यंजन में मिलाना होगा। यह आर्टिफिशियल इंटेलिजेंस (AI) मॉडल मर्जिंग की दुनिया है। इस कंप्यूटर विज्ञान के कोने में, शोधकर्ता दो या अधिक AI मॉडलों को लेते हैं जो पहले से ही विशिष्ट कार्यों के लिए प्रशिक्षित किए गए हैं—जैसे एक जो गणित की समस्याओं को हल करने में बहुत अच्छा है और दूसरा जो कोड लिखने में उत्कृष्ट है—और वे उन्हें फिर से शुरू से प्रशिक्षित किए बिना एक एकल, सुपर-स्मार्ट मॉडल में मिलाने का प्रयास करते हैं।

tricky हिस्सा यह पता लगाना है कि उन्हें कैसे मिलाया जाए। यदि आप उन्हें 50-50 मिलाते हैं, तो आपको एक औसत दर्जे का केक-लासग्ना मिल सकता है जो न तो पूरी तरह केक है और न ही लासग्ना। यदि आप उन्हें 90-10 मिलाते हैं, तो आप लासग्ना का स्वाद पूरी तरह से खो सकते हैं। इसे मर्ज पैरामीटर (merge parameter) समस्या कहा जाता है। आमतौर पर, सही मिश्रण खोजना घास के ढेर में सुई खोजने जैसा है, जहाँ आप केवल हाथों से घास के ढेर को उठा रहे हैं। यह महंगा, समय लेने वाला और अक्सर निराशाजनक होता है क्योंकि आप मार्गदर्शन के लिए "रेसिपी" (AI के पीछे का गणित) को देख नहीं सकते। यह पेपर एक सरल लेकिन शक्तिशाली प्रश्न पूछता है: क्या हम केवल रैंडम अंदाज़ लगाने के बजाय कहीं अधिक तेज़ी से सबसे अच्छे मिश्रण खोजने के लिए एक स्मार्ट, अनुमान लगाने वाली रणनीति का उपयोग कर सकते हैं?


AI मॉडलों को मिलाने के लिए स्मार्ट शेफ की मार्गदर्शिका

MOBO-Merge से मिलिए, जो इस पेपर में पेश किया गया नया "स्मार्ट शेफ" है। लेखकों ने, जो मोहमद बिन जायद यूनिवर्सिटी ऑफ आर्टिफिशियल इंटेलिजेंस के एक दल हैं, महसूस किया कि AI मॉडलों को मिलाना दो प्रतिस्पर्धी स्वादों के बीच सही संतुलन खोजने जैसा है। आप चाहते हैं कि आपका नया AI दोनों में अच्छा हो (निर्देशों का पालन करना और गणितीय तर्क करना), लेकिन आमतौर पर, एक में बेहतर होने से दूसरे में थोड़ा कमज़ोर होने की संभावना रहती है।

एक एकल "परफेक्ट" मिश्रण खोजने के बजाय, लेखकों ने पारेटो फ्रंट (Pareto front) को खोजने का निर्णय लिया। इसे सभी "सर्वश्रेष्ठ संभावित समझौतों" के मानचित्र के रूप में सोचें। इस मानचित्र पर, प्रत्येक बिंदु एक ऐसे मिश्रण का प्रतिनिधित्व करता है जहाँ आप गणित कौशल प्राप्त किए बिना निर्देश कौशल को नहीं बढ़ा सकते, और इसके विपरीत भी। लक्ष्य केवल एक विजेता चुनना नहीं है, बल्कि बेहतरीन विकल्पों के पूरे परिदृश्य (landscape) को खोजना है ताकि आप अपनी ज़रूरत के अनुसार सबसे उपयुक्त विकल्प चुन सकें।

समस्या: एक "ब्लैक बॉक्स" रसोई

चुनौती यह है कि एक नया मिश्रण परीक्षण करना अविश्वसनीय रूप से महंगा है। यह देखने के लिए कि क्या कोई मिश्रण काम करता है, आपको नया AI मॉडल बनाना पड़ता है और उसे सैकड़ों परीक्षण प्रश्नों से गुज़ारना पड़ता है। यह एक पूरा केक बनाने और फिर केवल एक चम्मच चखने जैसा है। आप इसे बेक होते समय चख नहीं सकते (कोई "ग्रेडिएंट्स" नहीं जो आपका मार्गदर्शन कर सकें), और आपके पास परीक्षणों के लिए एक सीमित बजट है।

यदि आप केवल रैंडम मिश्रणों (जैसे बोर्ड पर तीर चलाना) का प्रयास करते हैं, तो आप भाग्यशाली हो सकते हैं, लेकिन आप बहुत सारा समय और सामग्री बर्बाद कर देंगे। यदि मिश्रण की रेसिपी सरल है (जैसे केवल एक नॉब के साथ दो मॉडलों को मिलाना), तो रैंडм अंदाज़ लगाना बहुत बुरा नहीं है। लेकिन यदि रेसिपी जटिल है—जैसे केक की विभिन्न परतों के लिए अलग-अलग नॉब होना—तो रैंडम अंदाज़ लगाना एक आपदा बन जाता है।

समाधान: "स्मार्ट गेसिंग" मशीन

लेखकों ने MOBO-Merge बनाया है, जो एक फ्रेमवर्क है जो मल्टी-ऑब्जेक्टिव बायेसियन ऑप्टिमाइज़ेशन (Multi-Objective Bayesian Optimization) का उपयोग करता है। सरल शब्दों में, यह एक "स्मार्ट गेसिंग" मशीन है।

यह कैसे काम करता है, यहाँ देखें:

  1. सरोगेट मॉडल (The Surrogate Model): हर बार केक बनाने के बजाय, मशीन उन कुछ मिश्रणों के आधार पर एक "भविष्यवाणी मानचित्र" बनाती है जिनका उसने पहले ही परीक्षण किया है। यह सीखता है, "ओह, जब हम मॉडल A का 30% और मॉडल B का 70% मिलाते हैं, तो गणित का स्कोर बढ़ता है, लेकिन निर्देश का स्कोर गिर जाता है।"
  2. अक्विजिशन फंक्शन (The Acquisition Function): यह मशीन का अंतर्ज्ञान (intuition) है। यह मानचित्र को देखता है और पूछता है, "मुझे अगला परीक्षण कहाँ करना चाहिए जिससे मैं सबसे अधिक सीख सकूँ?" यह केवल उच्चतम स्कोर नहीं खोजता; यह उन स्थानों को खोजता है जो इसे सबसे अच्छा "समझौता मानचित्र" (पारेटो फ्रंट) बनाने में मदद करेंगे।
  3. लूप (The Loop): यह एक नया मिश्रण चुनता है, उसका परीक्षण करता है, अपने मानचित्र को अपडेट करता है, और यही प्रक्रिया दोहराता है।

लेखकों ने इसे दो प्रसिद्ध AI परिवारों पर परखा: Qwen3-4B और Llama-3.1-8B। उन्होंने उन्हें विभिन्न तरीकों से मिलाने की कोशिश की:

  • लीनियर (Linear): एक सरल मिश्रण (एक नॉब)।
  • TIES: एक अधिक जटिल विधि जो मॉडलों के बीच "टकराव" वाले निर्देशों को ठीक करने की कोशिश करती है (चार नॉब)।
  • ब्लॉक-लीनियर (Block-Linear): एक विधि जो AI के विभिन्न परतों को अलग-अलग ब्लॉक्स के रूप में मानती है, जिससे बहुत सूक्ष्म स्तर पर मिश्रण संभव होता है (चार या आठ नॉब)।

उन्होंने क्या पाया

परिणाम एक स्मार्ट मानचित्र के साथ एक खजाने की खोज की तरह थे।

  • सरल मिश्रण: जब मिश्रण सरल था (केवल एक नॉब), तो "स्मार्ट गेसिंग" (MOBO-Merge) रैंडम गेसिंग की तुलना में केवल थोड़ा ही बेहतर था। वास्तव में, Qwen मॉडल के एक विशिष्ट परीक्षण के लिए, रैंडम गेसिंग वास्तव में थोड़ा बेहतर था। यह सुझाव देता है कि सरल रेसिपी के लिए, आपको एक सुपर-कंप्यूटर की आवश्यकता नहीं है।
  • जटिल मिश्रण: लेकिन जब मिश्रण जटिल हो गया (TIES या Block-Linear का उपयोग करके कई नॉब के साथ), तो MOBO-Merge चमक उठा। इसने रैंडम गेसिंग की तुलना में बहुत बेहतर मिश्रण खोजे। उदाहरण के लिए, TIES विधि का उपयोग करते हुए Llama मॉडल के साथ, MOBO-Merge ने एक ऐसा मिश्रण खोजा जो रैंडम सर्च द्वारा खोजे गए मिश्रण से काफी बेहतर था।
  • "तीन-मॉडल" चुनौती: लेखकों ने एक साथ तीन मॉडलों (निर्देश + गणित + कोड) को मिलाने की भी कोशिश की। यहाँ, स्मार्ट गेसिंग का लाभ बहुत बड़ा था। Llama मॉडल के एक मामले में, MOBO-Merge ने एक ऐसा मिश्रण खोजा जो सबसे अच्छे रैंडम मिक्स की तुलना में दोगुने से भी अधिक बेहतर था।

सबसे दिलचस्प खोजों में से एक यह थी कि कोई एक "सर्वश्रेष्ठ" मिश्रण विधि नहीं है। कभी-कभी सरल Linear विधि सबसे अच्छी होती है; अन्य समय में, जटिल TIES या Block-Linear विधियाँ जीत जाती हैं। यह पूरी तरह से इस पर निर्भर करता है कि आप किन AI मॉडलों को मिला रहे हैं और आप क्या हासिल करना चाहते हैं।

यह क्यों महत्वपूर्ण है

यह पेपर सुझाव देता है कि MOBO-Merge उन सभी के लिए एक शक्तिशाली उपकरण है जो AI मॉडलों को संयोजित करने का प्रयास कर रहे हैं। यह मॉडलों को मिलाने का नया तरीका नहीं बनाता है; इसके बजाय, यह सही मिश्रण खोजने का एक स्मार्ट तरीका प्रदान करता है।

इस पद्धति का उपयोग करके, शोधकर्ता हजारों महंगे परीक्षण किए बिना उच्च-गुणवत्ता वाले संयोजन खोज सकते हैं। यह एक ऐसी प्रक्रिया को बदल देता है जो पहले भाग्य का खेल थी, एक व्यवस्थित अन्वेषण में। लेखकों ने पाया कि 12 में से 11 विभिन्न परीक्षण परिदृश्यों में, MOBO-Merge ने रैंडम गेसिंग की तुलना में बेहतर "समझौता मानचित्र" खोजा।

हालाँकि, लेखक सावधानी से नोट करते हैं कि यह कोई जादुई छड़ी नहीं है जो सब कुछ हल कर दे। इसके लिए अभी भी परीक्षण चलाने की आवश्यकता होती है, जिसमें पैसा और समय लगता है। यह तब सबसे अच्छा काम करता है जब मिश्रण की रेसिपी जटिल हो, और यह गारंटी नहीं देता है कि मिश्रण हर एक कार्य पर पूरी तरह से काम करेगा। लेकिन उन लोगों के लिए जो उन्हें फिर से प्रशिक्षित किए बिना लचीले, बहु-कौशल वाले AI सिस्टम बनाना चाहते हैं, यह "स्मार्ट गेसिंग" दृष्टिकोण एक बहुत अधिक कुशल रास्ता प्रदान करता है।

अंत में, यह पेपर दिखाता है कि भले ही हम हमेशा एक सुपर-AI के लिए परफेक्ट रेसिपी की भविष्यवाणी नहीं कर सकते, लेकिन हम निश्चित रूप से अंधे होकर अंदाज़ा लगाना बंद कर सकते हैं और थोड़े से गणितीय अंतर्ज्ञान के साथ संभावनाओं को तलाशना शुरू कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →