← नवीनतम पेपर
🤖 AI

From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging

यह शोध पत्र प्रेफरेंस डेल्टा एग्रीगेशन (PDA) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो कमजोर-कमजोर मॉडल युग्मों से कई "कमजोर" पर्यवेक्षण संकेतों को LoRA एडेप्टर में परिवर्तित करके और उन्हें एक नवीन ज्योमेट्रिक एलाइनमेंट मर्जिंग (GAM) विधि के माध्यम से संयोजित करके उन्हें एकत्रित करता है, जिससे एकल संकेतों या मौजूदा बेसलाइन की तुलना में मजबूत लार्ज लैंग्वेज मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

मूल लेखक: Qi Sun, Siyue Zhang, Yulin Chen, Yuxiang Xue, Ru Peng, Chen Zhao

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qi Sun, Siyue Zhang, Yulin Chen, Yuxiang Xue, Ru Peng, Chen Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: हमें बेहतर शिक्षकों की आवश्यकता है, लेकिन उन्हें ढूंढना कठिन है

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र (एक शक्तिशाली AI मॉडल) को जटिल पहेलियाँ हल करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, उन्हें सिखाने का सबसे अच्छा तरीका यह है कि एक सटीक विशेषज्ञ (perfect expert) उन्हें सही उत्तर दिखाए। लेकिन वास्तविक दुनिया में, सटीक विशेषज्ञ दुर्लभ होते हैं, महंगे होते हैं, या कुछ कठिन कार्यों के लिए मौजूद ही नहीं होते।

हाल ही में, शोधकर्ताओं ने एक चतुर समाधान खोजा है: "कमजोर" शिक्षकों का उपयोग करना।
कल्पना कीजिए कि आपके पास एक स्मार्ट हाई स्कूलर (एक "कमजोर" मॉडल) है और एक थोड़ा कम स्मार्ट मिडिल स्कूलर (एक "और भी कमजोर" मॉडल) है। भले ही हाई स्कूलर कोई जीनियस नहीं है, फिर भी वह मिडिल स्कूलर से बेहतर है। यदि आप दोनों से गणित का एक सवाल हल करने के लिए कहते हैं, तो हाई स्कूलर का उत्तर आमतौर पर बेहतर होता है।

इस पेपर का मुख्य विचार है: क्या हम अपने प्रतिभाशाली छात्र को सिखाने के लिए इन दो कमजोर मॉडलों के बीच के अंतर से सीख सकते हैं?
इसका उत्तर है हाँ। दो कमजोर मॉडलों के बीच गुणवत्ता का "गैप" एक संकेत (signal) के रूप में कार्य करता है। यह प्रतिभाशाली छात्र को बताता है, "हे, यह सोचने का तरीका उस दूसरे तरीके से बेहतर है।" शोधकर्ता इसे "वीक सिग्नल" (Weak Signal) कहते हैं।

नई चुनौती: एक संकेत पर्याप्त नहीं है

शोधकर्ताओं ने एक अनुवर्ती प्रश्न पूछा: क्या होगा यदि हमारे पास कई अलग-अलग कमजोर शिक्षकों के जोड़े हों?
उदाहरण के लिए:

  • जोड़ा A: एक कमजोर मैथ बॉट बनाम एक और भी कमजोर मैथ बॉट।
  • जोड़ा B: एक कमजोर कोडिंग बॉट बनाम एक और भी कमजोर कोडिंग बॉट।
  • जोड़ा C: एक कमजोर लॉजिक बॉट बनाम एक और भी कमजोर लॉजिक बॉट।

प्रत्येक जोड़ा प्रतिभाशाली छात्र को कुछ अलग सिखाता है। लक्ष्य इन सभी पाठों को मिलाकर छात्र को सुपर-स्मार्ट बनाना है।

हालाँकि, एक पेच है। यदि आप छात्र को ये सभी पाठ एक के बाद एक सिखाने की कोशिश करते हैं, तो हो सकता है कि अंतिम पाठ सीखने तक वह पहला पाठ भूल जाए (इसे "कैटास्ट्रॉफ़िक फॉरगेटिंग" कहा जाता है)। यदि आप इन सभी पाठों को एक साथ मिलाने की कोशिश करते हैं, तो निर्देश एक-दूसरे के विरोधाभासी हो सकते हैं, जिससे छात्र भ्रमित हो सकता है।

समाधान: PDA (द "लेसन कलेक्टर")

लेखक प्रिफरेंस डेल्टा एग्रीगेशन (PDA) नामक एक फ्रेमवर्क प्रस्तावित करते हैं। इसे विभिन्न जूनियर कुक्स (सहायक रसोइयों) से रेसिपी एकत्र करने वाले एक मास्टर शेफ की तरह समझें।

  1. पाठों को अलग करें: सामग्री (डेटा) को आपस में मिलाने के बजाय, शेफ प्रत्येक जूनियर कुक की रेसिपी लेता है और छात्र को उन्हें अलग-अलग सिखाता है।
  2. "डेल्टा" एडॉप्टर बनाएं: प्रत्येक पाठ के लिए, छात्र को एक छोटा, हल्का "नोटबुक" (जिसे LoRA एडॉप्टर कहा जाता है) मिलता है जिसमें केवल वह विशिष्ट सुधार होता है जो कमजोर शिक्षकों के उस जोड़े से सीखा गया है। यह छात्र के पूरे मस्तिष्क को ओवरराइट नहीं करता है; यह केवल एक विशिष्ट "डेल्टा" (एक परिवर्तन या अपडेट) जोड़ता है।
  3. मर्जिंग की समस्या: अब छात्र के पास पांच अलग-अलग नोटबुक हैं। यदि आप उन्हें बस बेतरतीब ढंग से एक साथ चिपका देते हैं, तो उनके पन्ने अलग-अलग भाषाओं या ओरिएंटेशन में लिखे हो सकते हैं, जिससे किताब को पढ़ना असंभव हो जाएगा। "नोट्स" एक-दूसरे को रद्द कर सकते हैं।

सीक्रेट सॉस: GAM (द "जियोमेट्रिक अलाइनर")

यहीं पर पेपर का दूसरा बड़ा नवाचार आता है: जियोमेट्रिक अलाइनमेंट मर्जिंग (GAM)

कल्पना कीजिए कि आपके पास एक ही शहर के पांच अलग-अलग मानचित्र (maps) हैं, लेकिन प्रत्येक मानचित्र एक अलग कोण पर घुमा हुआ है।

  • पुराना तरीका (नाइव एवरेजिंग): आप बस मानचित्रों को एक के ऊपर एक रखते हैं और उन्हें पढ़ने की कोशिश करते हैं। सड़कें आपस में मेल नहीं खातीं, जिससे एक धुंधला, भ्रमित करने वाला दृश्य बनता है।
  • GAM का तरीका: उन्हें जोड़ने से पहले, आप एक प्रोटेक्टर लेते हैं और प्रत्येक मानचित्र को तब तक घुमाते हैं जब तक कि उन सभी पर "उत्तर" (North) दिशा बिल्कुल एक ही दिशा में न हो जाए। आप मानचित्रों की ज्यामिति (geometry) को संरेखित करते हैं।

एक बार जब मानचित्र संरेखित हो जाते हैं, तो आप उन्हें सुरक्षित रूप से संयोजित कर सकते हैं। परिणाम एक एकल, सुपर-क्लियर मैप होता है जो सभी अलग-अलग जूनियर कुक्स से सर्वोत्तम मार्ग कैप्चर करता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने दो प्रकार के कार्यों पर इसका परीक्षण किया:

  1. नॉलेज रीजनिंग (ज्ञान तर्क): कठिन गणित और विज्ञान की समस्याओं को हल करना।
  2. एजेंटिक सर्च (एजेंटिक खोज): AI से इंटरनेट खोजने, लेख पढ़ने और जटिल प्रश्नों के उत्तर खोजने के लिए कहना (एक जासूस की तरह)।

परिणाम:

  • किसी भी एकल शिक्षक से बेहतर: छात्र मॉडल, GAM के साथ कई "कमजोर" संकेतों से सीखने के बाद, उस प्रदर्शन से बेहतर था जो उसने केवल सबसे अच्छे एकल कमजोर शिक्षक से सीखा होता।
  • अधिक संकेत = अधिक शक्ति: जैसे-जैसे उन्होंने कमजोर शिक्षकों के जोड़े बढ़ाए, छात्र और अधिक स्मार्ट होता गया।
  • प्रतिद्वंद्वियों को पछाड़ना: उनके तरीके (PDA + GAM) ने सभी अन्य तरीकों को हरा दिया, जिसमें वे तरीके भी शामिल थे जो सभी डेटा पर एक साथ प्रशिक्षित करने की कोशिश करते थे या बिना अलाइन करने के अपडेट को औसत निकालते थे।

यह क्यों काम करता है?

पेपर सुझाव देता है कि अलग-अलग कमजोर शिक्षक अलग-अलग चीजों में अच्छे होते हैं।

  • एक जोड़ा छात्र को बेहतर खोज (search) करना सिखा सकता है।
  • दूसरा जोड़ा छात्र को तथ्यों को सत्यापित (verify) करना सिखा सकता है।
  • तीसरा जोड़ा छात्र को फंस जाने पर रिकवर (recover) करना सिखा सकता है।

इन अलग-अलग "सुधार की दिशाओं" को संरेखित और मर्ज करके, छात्र एक बहुमुखी विशेषज्ञ बन जाता है जो एक ही समय में ये सभी चीजें कर सकता है, न कि केवल एक संकीर्ण क्षेत्र में विशेषज्ञ।

सारांश

संक्षेप में, यह पेपर दिखाता है कि एक परफेक्ट AI बनाने के लिए आपको एक परफेक्ट शिक्षक की आवश्यकता नहीं है। आप कई "अपूर्ण" शिक्षकों का उपयोग कर सकते हैं, उनके द्वारा सिखाए गए विशिष्ट पाठ निकाल सकते हैं, उन पाठों को संरेखित कर सकते हैं ताकि वे संघर्ष न करें, और उन्हें एक ऐसे मॉडल को बनाने के लिए संयोजित कर सकते हैं जो अपने हिस्सों के योग से भी अधिक मजबूत हो। यह एक चैंपियन एथलीट को प्रशिक्षित करने जैसा है, जिसमें कोचों की एक टीम होती है, जिनमें से प्रत्येक एक अलग कौशल में विशेषज्ञ होता है, और यह सुनिश्चित करना कि सभी कोच खेल की योजना पर सहमत हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →