← नवीनतम पेपर
🤖 machine learning

Tunable MAGMAX: Preference-Aware Model Merging for Continual Learning

यह शोध पत्र ट्यूनेबल MAGMAX (Tunable MAGMAX) को प्रस्तुत करता है, जो निरंतर सीखने (continual learning) के लिए एक प्राथमिकता-जागरूक मॉडल विलय ढांचा (preference-aware model merging framework) है जो कार्य-विशिष्ट प्रदर्शन को नियंत्रित करने के लिए स्वचालित रूप से प्राथमिकता वेक्टर (preference vectors) का निर्माण करता है, जिससे विलय किए गए मॉडलों को बिना किसी मैनुअल विनिर्देश के विविध परिनियोजन वातावरणों (deployment environments) के लिए प्रभावी अनुकूलन सक्षम बनाया जा सके।

मूल लेखक: Kei Hiroshima, Kento Uchida, Shinichi Shirakawa

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kei Hiroshima, Kento Uchida, Shinichi Shirakawa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जिसने पांच पूरी तरह से अलग व्यंजन बनाना सीख लिया है: इतालवी (Italian), जापानी (Japanese), मैक्सिकन (Mexican), भारतीय (Indian) और फ्रांसीसी (French)। आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह शेफ एक "कंटीन्यूअल लर्निंग" (Continual Learning) मॉडल है। समस्या यह है कि जब शेफ सुशी (Sushi) बनाना एकदम सटीक रूप से सीख लेता है, तो वह पिज्जा (Pizza) बनाना भूल सकता है। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (Catastrophic forgetting) कहा जाता है।

आमतौर पर, इसे ठीक करने के लिए, शोधकर्ता एक "सुपर शेफ" बनाने की कोशिश करते हैं जो सभी पांच व्यंजनों में बस "ठीक-ठाक" हो, जिसका लक्ष्य उच्चतम औसत स्कोर प्राप्त करना होता है। लेकिन वास्तविक दुनिया में, यह हमेशा काम नहीं करता है। टोक्यो में एक रेस्टोरेंट को केवल सुशी की परवाह हो सकती है और पिज्जा की बिल्कुल नहीं। मेक्सिको में एक रेस्टोरेंट को इसके विपरीत आवश्यकता हो सकती है। वे एक "सुपर शेफ" नहीं चाहते; वे एक ऐसा शेफ चाहते हैं जो सुशी का उस्ताद (Master) हो, लेकिन अन्य व्यंजनों के लिए बस "काफी अच्छा" हो।

यह पेपर ठीक इसी समस्या को हल करने के लिए Tunable MAGMAX नामक एक नया टूल पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. पुराने तरीके की समस्या (MAGMAX)

पिछना तरीका, जिसे MAGMAX कहा जाता था, एक "टैलेंट शो जज" की तरह था। इसने हर व्यंजन के लिए शेफ के कौशल को देखा और खाना पकाने के हर चरण के लिए सबसे अच्छा कदम चुना। यदि प्याज काटने के लिए शेफ का सबसे अच्छा कदम उनके इतालवी प्रशिक्षण से आया था, तो उसने उसे रखा। यदि मसाला डालने के लिए सबसे अच्छा कदम उनके जापानी प्रशिक्षण से आया था, तो उसने उसे रखा।

परिणाम? एक बेहतरीन "औसत" शेफ। लेकिन, पेपर एक कमी बताता है: शेफ ने आखिरी रूप से जो व्यंजन सीखा, वह अंतिम रेसिपी पर हावी हो जाता था। यदि शेफ ने अंत में फ्रांसीसी व्यंजन सीखा, तो अंतिम डिश का स्वाद बहुत अधिक फ्रांसीसी हो सकता था, भले ही रेस्टोरेंट इतालवी स्वाद चाहता हो। आप शेफ को आसानी से यह नहीं बता सकते थे कि, "हे, मुझे चाहिए कि आप 80% इतालवी हों और केवल 20% फ्रांसीसी।"

2. नया समाधान: Tunable MAGMAX

लेखक Tunable MAGMAX का प्रस्ताव देते हैं। इसे एक रेस्टोरेंट मालिक को प्रत्येक व्यंजन के लिए एक "स्लाइडर" वाला रिमोट कंट्रोल देने के रूप में समझें।

  • प्रेफरेंस वेक्टर (The Remote): यह नंबरों की एक सूची है जो सिस्टम को बताती है कि प्रत्येक "व्यंजन कौशल" का कितना हिस्सा रखना है। यदि आप सुशी-केंद्रित शेफ चाहते हैं, तो आप "जापानी" स्लाइडर को ऊपर करते हैं और "इतालवी" स्लाइडर को नीचे करते हैं।
  • मर्जिंग की प्रक्रिया (The Merging Process): केवल हर चरण के लिए एक ही सबसे अच्छा कदम चुनने के बजाय, Tunable MAGMAX "कौशल बजट" (skill budget) को देखता है। यदि आप जापानी स्लाइडर को उच्च सेट करते हैं, तो सिस्टम यह सुनिश्चित करता है कि शेफ के कदमों की एक बड़ी संख्या उनके जापानी प्रशिक्षण से आए। यदि आप इतालवी स्लाइडर को कम सेट करते हैं, तो यह केवल कुछ ही इतालवी कदमों को रखता है।

यह आपको पूरे शेफ को फिर से प्रशिक्षित किए बिना, किसी विशिष्ट वातावरण (जैसे किसी विशिष्ट शहर या अस्पताल) के लिए एक कस्टम मॉडल बनाने की अनुमति देता है।

3. हम रिमोट कैसे सेट करते हैं? ("जादुई" हिस्सा)

आप पूछ सकते हैं, "मुझे स्लाइडरों पर क्या नंबर रखने हैं, यह मैं कैसे जानूंगा? क्या मुझे अनुमान लगाना होगा?"

पेपर कहता है कि नहीं। उन्होंने नए वातावरण के एक छोटे से नमूने के आधार पर रिमोट को स्वचालित रूप से सेट करने का एक तरीका बनाया है।

  • उपमा: कल्पना कीजिए कि आप एक बरसाती शहर में एक नया रेस्टोरेंट खोल रहे हैं। आपको पूरी दुनिया के लिए खाना पकाने की आवश्यकता नहीं है; आपको बस यह जानने की आवश्यकता है कि स्थानीय लोग क्या खाते हैं।
  • विधि: सिस्टम आपके नए स्थान से डेटा का एक छोटा नमूना (जिसे "मेटा डेटासेट" कहा जाता है) लेता है। फिर यह इस नमूने की तुलना उस डेटा से करता है जो उसके पास पहले से मौजूद है।
    • यदि लेबल (व्यंजनों के नाम) उपलब्ध हैं: यह जांचता है, "क्या नया रेस्टोरेंट अधिक टैकोस (Tacos) परोसता है या अधिक सुशी?" यह समानता की गणना करता है और स्लाइडरों को उसी के अनुसार सेट करता है।
    • यदि केवल चित्र हैं (कोई नाम नहीं): यह "ऑप्टिमल ट्रांसपोर्ट" (Optimal Transport) नामक एक गणितीय उपकरण का उपयोग करके डेटा के "आकार" को देखता है। यह पूछता है, "क्या यहाँ के भोजन के चित्र इतालवी प्रशिक्षण सेट से अधिक मिलते-जुलते हैं या जापानी वाले से?"

एक बार जब यह समानता की गणना कर लेता है, तो यह स्वचालित रूप से उस विशिष्ट वातावरण के लिए सही "प्रेफरेंस वेक्टर" (रिमोट सेटिंग्स) तैयार करता है।

4. परिणाम

शोधकर्ताओं ने मानक AI बेंचमार्क (जैसे CIFAR-100 और ImageNet-R) पर इसका परीक्षण किया, जो मानक कुकिंग प्रतियोगिताओं की तरह हैं।

  • नियंत्रण (Control): उन्होंने दिखाया कि स्लाइडरों को बदलकर, वे मॉडल को विशिष्ट कार्यों (जैसे पहले या अंतिम व्यंजन) पर अविश्वसनीय रूप से अच्छा प्रदर्शन करने के लिए बना सकते हैं, जबकि अन्य कार्यों को थोड़ा कम होने दे सकते हैं।
  • अनुकूलन क्षमता (Adaptability): जब उन्होंने विभिन्न "लक्ष्य वातावरणों" (विभिन्न प्रकार के डेटा को मिलाकर) का अनुकरण किया, तो उनके स्वचालित तरीके ने पुराने तरीकों की तुलना में लगातार बेहतर शेफ बनाए। यह केवल एक शहर से डेटा का एक छोटा नमूना देखकर, एक "बरसाती शहर" या "धूप वाले शहर" के लिए पूरी तरह से ट्यून किया गया मॉडल बना सकता था।

सारांश

संक्षेप में, Tunable MAGMAX एक तरीका है जिससे आप एक सामान्य AI मॉडल जो कई चीजें सीख चुका है, उसे किसी विशिष्ट काम के लिए कस्टम-टेलर (विशेष रूप से तैयार) कर सकते हैं, बिना उसे फिर से प्रशिक्षित किए। यह यह तय करने के लिए "प्रेफरेंस वेक्टर" का उपयोग करता है कि प्रत्येक सीखे गए कौशल का कितना हिस्सा रखना है, और यह नए वातावरण के एक छोटे से नमूने को देखकर अपने आप सही सेटिंग्स का पता लगा सकता है। यह एक मास्टर शेफ होने जैसा है जो किसी भी नए पड़ोस में खुलने के लिए अपने पूरे मेनू को तुरंत समायोजित कर सकता है ताकि वह वहां के विशिष्ट स्वादों के अनुकूल हो सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →