← नवीनतम पेपर
🤖 AI

Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropy

यह शोध पत्र TARA-Merging को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो प्राथमिकता-भारित क्रॉस-एन्ट्रॉपी छद्म-हानि (preference-weighted cross-entropy pseudo-loss) और दिशा-वार पुन: भारण (direction-wise reweighting) का उपयोग करके कई LoRA मॉड्यूल को मर्ज करने की चुनौतियों, जैसे कि सबस्पेस कवरेज और दिशात्मक अनिसोट्रॉपी (directional anisotropy) को संबोधित करता है, ताकि विविध विजन और NLI बेंचमार्क पर बेहतर सामान्यीकरण प्राप्त किया जा सके।

मूल लेखक: Wooseong Jeong, Wonyoung Lee, Kuk-Jin Yoon

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wooseong Jeong, Wonyoung Lee, Kuk-Jin Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास आठ प्रतिभाशाली विशेषज्ञों की एक टीम है। एक कारों को पहचानने में माहिर है, दूसरा बनावट (textures) को पहचानने में विशेषज्ञ है, तीसरा ट्रैफिक संकेतों के बारे में सब कुछ जानता है, और इसी तरह। प्रत्येक विशेषज्ञ को अलग से एक बहुत ही कुशल विधि का उपयोग करके प्रशिक्षित किया गया है जिसे LoRA (Low-Rank Adaptation) कहा जाता है। LoRA को एक छोटी, हल्की "नोटबुक" या "चीट शीट" के रूप में समझें जिसे प्रत्येक विशेषज्ञ अपने साथ रखता है। वे अपने पूरे मस्तिष्क को फिर से नहीं लिखते; वे बस अपने मौजूदा ज्ञान में इन छोटी नोटबुक्स को जोड़ देते हैं।

अब, आप एक सामान्य-उद्देश्य वाला AI (General-Purpose AI) बनाना चाहते हैं जो एक साथ ये सभी काम कर सके। आप इन आठ विशेषज्ञों को एक सुपर-एजेंट में विलीन (merge) करना चाहते हैं।

समस्या: "खराब विलय" की आपदा (The "Bad Merging" Disaster)

यदि आप बस इन आठ नोटबुक्स को यादृच्छिक रूप से एक साथ टेप से चिपका देते हैं (जैसा कि पुराने तरीकों में किया जाता था), तो आपको एक कचरा मिलेगा।

  • सबस्पेस की समस्या (The Subspace Problem): कल्पना कीजिए कि विशेषज्ञ एक ही नोटबुक में लिखने की कोशिश कर रहे हैं, लेकिन वे अलग-अलग भाषाओं और लिखावट शैलियों का उपयोग कर रहे हैं। जब आप उन्हें मिलाते हैं, तो उनके नोट्स ओवरलैप होते हैं और एक-दूसरे को काट देते हैं। "कार विशेषज्ञ" अनजाने में "ट्रैफिक साइन" के नोट्स को मिटा सकता है क्योंकि वे एक ही स्थान के लिए लड़ रहे हैं। आप प्रत्येक कार्य के अद्वितीय विवरण खो देते हैं।
  • एनिसोट्रॉपी की समस्या (The Anisotropy Problem): भले ही नोट्स ओवरलैप न हों, कुछ विशेषज्ञ दूसरों की तुलना में बहुत अधिक मुखर (loud) होते हैं। यदि "कार विशेषज्ञ" बहुत ज़ोर से चिल्लाता है, तो उसके नोट्स "टेक्चर विशेषज्ञ" को दबा सकते हैं। यह असंतुलन एनिसोट्रॉपी (anisotropy) कहलाता है।

समाधान: TARA (स्मार्ट मध्यस्थ)

लेखकों ने TARA (Task-Rank Anisotropy Alignment) नामक एक नई विधि प्रस्तावित की है। TARA को एक अत्यधिक कुशल कंडक्टर (Conductor) या प्रोजेक्ट मैनेजर के रूप में समझें जो जानता है कि विशेषज्ञों की अनूठी आवाज़ों को खोए बिना उन्हें कैसे मिलाया जाए।

TARA इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "सबस्पेस" को सुरक्षित रखना (कमरे को बड़ा बनाए रखना)

कल्पना कीजिए कि विशेषज्ञ एक भित्ति चित्र (mural) बनाने की कोशिश कर रहे हैं। यदि आप बस उनकी पेंट को एक बाल्टी में मिला देते हैं, तो वह कीचड़ बन जाएगा।

  • पुरानी विधि: सभी को एक ही छोटे कैनवास पर पेंट करने के लिए मजबूर करती है।
  • TARA का दृष्टिकोण: TARA महसूस करता है कि प्रत्येक विशेषज्ञ को काम करने के लिए कमरे के अपने विशिष्ट कोने की आवश्यकता है। यह सुनिश्चित करता है कि जब वे विलय करें, तो "कमरा" (गणितीय स्थान) उनके सभी अद्वितीय विचारों को रखने के लिए पर्याप्त बड़ा बना रहे। यह सुनिश्चित करके "कीचड़" प्रभाव को रोकता है कि किसी भी व्यक्ति की अनूठी दिशा को दूसरे द्वारा कुचला न जाए। यह पूरी टीम के कवरेज (coverage) को सुरक्षित रखता है।

2. "एनिसोट्रॉपी" को ठीक करना (वॉल्यूम को संतुलित करना)

कल्पना कीजिए कि एक बैंड है जहाँ ड्रमर 100% वॉल्यूम पर बजा रहा है, लेकिन वायलिन वादक फुसफुसा रहा है। गाना भयानक लगता है।

  • पुरानी विधि: केवल वॉल्यूम का औसत निकाल देती है। ड्रमर अभी भी वायलिन को दबा देता है।
  • TARA का दृष्टिकोण: TARA आपकी दी गई "वरीयता" (preference) को सुनता है (जैसे, "मैं चाहता हूँ कि कार विशेषज्ञ 30% तेज़ हो, लेकिन टेक्चर विशेषज्ञ 20% धीमा हो")। इसके बाद यह प्रत्येक विशेषज्ञ के वॉल्यूम को व्यक्तिगत रूप से री-वेट (re-weight) करता है। यह तेज़ ड्रम बजाने वालों की आवाज़ कम करता है और शांत वायलिन वादकों की आवाज़ बढ़ाता है ताकि अंतिम संगीत एक पूर्ण सामंजस्य हो, चाहे आप AI से कोई भी कार्य पूछें।

यह व्यवहार में कैसे काम करता है

पेपर ने इसे दो बहुत अलग दुनियाओं में परखा:

  1. विज़न (Vision): कारों, ट्रैफिक संकेतों और बनावट को पहचानने वाले मॉडल्स को मिलाना।
  2. भाषा (Language): तर्क (logic), विज्ञान के प्रश्नों और पठन बोध (reading comprehension) को समझने वाले मॉडल्स को मिलाना।

परिणाम:

  • "वैनिला" विलय (The "Vanilla" Mergers) (पुराना, सरल तरीका) एक अराजक ग्रुप प्रोजेक्ट की तरह थे जहाँ हर कोई एक-दूसरे के ऊपर बोल रहा था। वे खराब प्रदर्शन करते थे।
  • "लोरा-अवेयर" विलय (The "LoRA-Aware" Mergers) (पिछले स्मार्ट प्रयास) बेहतर थे लेकिन अभी भी वॉल्यूम नियंत्रण की बारीकियों को चूक गए थे।
  • TARA स्पष्ट विजेता था। इसने एक ऐसा मॉडल बनाया जो न केवल उन कार्यों में अच्छा था जिनके लिए इसे प्रशिक्षित किया गया था, बल्कि नए, अनदेखे कार्यों के लिए भी बेहतर तरीके से सामान्यीकृत (generalized) हुआ। यह मजबूत था, जिसका अर्थ है कि जब आपने इसे कार्यों के बीच स्विच करने के लिए कहा, तो यह टूटा नहीं।

निचोड़ (The Bottom Line)

AI मॉडल्स को मिलाना आइसक्रीम के विभिन्न स्वादों को मिलाने जैसा है। यदि आप उन्हें बस एक बाल्टी में डाल देते हैं, तो आपको एक अजीब, गांठदार मिश्रण मिलेगा।

  • TARA वह मास्टर शेफ है जो जानता है कि प्रत्येक स्वाद का कितना स्कूप लेना है और उन्हें कैसे मिलाना है ताकि आप एक ही स्कूप में स्ट्रॉबेरी, मिंट और चॉकलेट को पूरी तरह से चख सकें।

कवरेज (Subspace Coverage) और एनिसोट्रॉपी (Anisotropy) पर ध्यान देकर, TARA एक स्मार्ट, अधिक बहुमुखी AI बनाता है जो कई काम एक साथ संभाल सकता है बिना यह भूले कि उन्हें कैसे करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →