← नवीनतम पेपर
💬 NLP

Advancing General-Purpose Reasoning Models with Modular Gradient Surgery

मल्टी-टास्क रिइन्फोर्समेंट लर्निंग में क्रॉस-डोमेन इंटरफेरेंस की समस्या को संबोधित करने के लिए, यह शोध पत्र **मॉड्यूलर ग्रेडिएंट सर्जरी (MGS)** पेश करता है, जो एक ऐसी विधि है जो विविध डोमेन में सामान्य-उद्देश्य वाले बड़े रीजनिंग मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए ट्रांसफार्मर मॉड्यूल स्तर पर ग्रेडिएंट संघर्षों को हल करती है।

मूल लेखक: Min Cai, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Xi Ye, Daiting Shi

प्रकाशित 2026-02-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Min Cai, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Xi Ye, Daiting Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विश्व-स्तरीय बहुज्ञ (polymath) को प्रशिक्षित करने की कोशिश कर रहे हैं—एक ऐसा व्यक्ति जिसे उच्च-स्तरीय गणित में जीनियस, एक आकर्षक वक्ता और एक आदर्श सहायक (जो जटिल निर्देशों का पालन कर सके) बनने की आवश्यकता है।

यह शोध पत्र, "मॉड्यूलर ग्रेडिएंट सर्जरी" (Modular Gradient Surgery), ठीक उसी समस्या का समाधान करता है जिसका सामना शोधकर्ता "लार्ज रीजनिंग मॉडल्स" (AI के दिमाग, जैसे ChatGPT या DeepSeek) को प्रशिक्षित करते समय करते हैं।

यहाँ समस्या का विवरण और रोजमर्रा के उदाहरणों का उपयोग करते हुए उनका शानदार समाधान दिया गया है।


1. समस्या: "विरोधाभासी कोच" की दुविधा (The "Conflicting Coach" Dilemma)

जब शोधकर्ता एक AI को एक साथ कई चीजें करने के लिए प्रशिक्षित करने की कोशिश करते हैं, तो वे आमतौर पर दो में से एक विधि का उपयोग करते हैं, जिनमें से दोनों के बड़े दोष हैं:

  • "एक बार में एक" विधि (Sequential RL): यह एक एथलीट को प्रशिक्षित करने जैसा है जहाँ आप जनवरी में सारा समय गणित पर, फरवरी में सामाजिक कौशल पर और मार्च में आदेशों का पालन करने पर बिताते हैं।
    • दोष: मार्च तक आते-आते, एथलीट गणित करना "भूल" जाता है (इसे Forgetting कहा जाता है), या वे अपने गणित के अभ्यासों में इतने कठोर हो जाते हैं कि वे सामाजिक कौशल प्रभावी ढंग से नहीं सीख पाते (इसे Rigidity कहा जाता है)।
  • "कक्षा में अराजकता" विधि (Mixed RL): यह एक छात्र को गणित की किताब, कविता की किताब और एक नियम पुस्तिका एक कमरे में फेंक देने और यह कहने जैसा है, "सब कुछ एक साथ सीखो!"
    • दोष: निर्देश एक-दूसरे का विरोध करने लगते हैं। मस्तिष्क का "गणित" वाला हिस्सा एक दिशा में जाना चाहता है, जबकि "चैट" वाला हिस्सा दूसरी दिशा में। AI की भाषा में, उनके ग्रेडिएंट्स (gradients) (वे दिशाएँ जिनमें वे सीखते हैं) आपस में लड़ रहे हैं। यह एक ही समय में अलग-अलग दिशाओं में चिल्लाने वाले दो कोचों की तरह है; छात्र अंततः हर चीज़ में औसत दर्जे का रह जाता है।

2. खोज: मस्तिष्क मॉड्यूलर है (The Brain is Modular)

शोधकर्ताओं ने एक महत्वपूर्ण बात समझी: एक AI केवल एक विशाल, एकसमान बुद्धि का ढेर नहीं है। यह विभिन्न हिस्सों वाली एक हाई-टेक मशीन की तरह बना है:

  • "मेमोरी" मॉड्यूल (MLP layers): ये एक पुस्तकालय की तरह कार्य करते हैं, जो तथ्यों और ज्ञान को संग्रहीत करते हैं।
  • "लॉजिक" मॉड्यूल (Attention layers): ये तर्क इंजन (reasoning engine) की तरह कार्य करते हैं, जो विचारों को जोड़ने का तरीका तय करते हैं।
  • "रेगुलेटर्स" (LayerNorm): ये तंत्रिका तंत्र की तरह कार्य करते हैं, जो सब कुछ स्थिर रखते हैं।

उन्होंने पाया कि जब AI "भ्रमित" होता है, तो लड़ाई हर जगह नहीं हो रही होती है। यह आमतौर पर स्थानीयकृत (localized) होती है। "गणित" वाला कोच और "चैट" वाला कोच लॉजिक मॉड्यूल पर लड़ सकते हैं, लेकिन वे वास्तव में मेमोरी मॉड्यूल पर पूरी तरह सहमत होते हैं।


3. समाधान: "मॉड्यूलर ग्रेडिएंट सर्जरी" (MGS)

पूरे मस्तिष्क को सहमत होने के लिए मजबूर करने के बजाय (जो बहुत आक्रामक है और सब कुछ धीमा कर देता है), शोधकर्ताओं ने मॉड्यूलर ग्रेडिएंट सर्जरी का आविष्कार किया।

उपमा: एक विशेषज्ञ सर्जन (The Specialized Surgeon)
कल्पना कीजिए कि एक मरीज के शरीर में एक संघर्ष है—उसका हृदय तेजी से धड़कना चाहता है, लेकिन उसके फेफड़े धीरे सांस लेना चाहते हैं। एक "ग्लोबल" डॉक्टर पूरे शरीर को सुस्त करने की कोशिश कर सकता है ताकि संघर्ष रुक जाए, जिससे मरीज बेकार हो जाएगा।

एक "मॉड्यूलर सर्जन" बहुत अधिक स्मार्ट होता है। वे शरीर के अंगों को एक-एक करके देखते हैं।

  1. वे हृदय की जाँच करते हैं: "क्या यहाँ संकेत टकरा रहे हैं?" यदि हाँ, तो वे केवल उस हिस्से के विरोधाभासी संकेत को हटाने के लिए एक सूक्ष्म "सर्जरी" करते हैं।
  2. वे फेफड़ों की जाँच करते हैं: "क्या संकेत यहाँ पहले से ही मिलकर काम कर रहे हैं?" यदि संकेत पहले से ही साथ मिलकर काम कर रहे हैं, तो वे उन्हें छोड़ देते हैं और उन्हें पूरी गति से सीखने देते हैं।

केवल उन विशिष्ट मॉड्यूल्स पर "सर्जरी" करके जहाँ "कोच" आपस में लड़ रहे हैं, AI गणित और चैट को एक साथ सीख सकता है बिना एक-दूसरे को नष्ट किए।


4. परिणाम: एक सच्चा बहुज्ञ (A True Polymath)

परिणाम प्रभावशाली थे। जब उन्होंने प्रसिद्ध AI मॉडलों (जैसे Llama और Qwen) पर इस "सर्जरी" को लागू किया:

  • हर चीज़ में बेहतर: मॉडल केवल एक चीज़ में बेहतर नहीं हुए; वे गणित, चैट और निर्देशों का पालन करने में एक साथ बेहतर बन गए।
  • कोई भूलने की समस्या नहीं: "एक बार में एक" विधि के विपरीत, AI ने सामाजिक कौशल सीखते समय अपना गणित कौशल नहीं खोया।
  • स्केलेबल (Scalable): जितना अधिक उन्होंने प्रशिक्षण दिया, यह उतना ही बेहतर काम करता गया।

संक्षेप में: AI को गणितज्ञ या कवि में से किसी एक को चुनने के लिए मजबूर करने के बजाय, मॉड्यूलर ग्रेडिएंट सर्जरी इसे दोनों होने की अनुमति देती है, इसके अपने डिजिटल मस्तिष्क के भीतर होने वाले "तर्कों" को सर्जिकल तरीके से हल करके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →