← नवीनतम पेपर
🤖 machine learning

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

यह शोध पत्र तर्क कौशल (reasoning skills) के बीच स्विच करने की कठिनाई को मापने के लिए एक नए मीट्रिक के रूप में स्किल एंट्रॉपी (Skill Entropy) का परिचय देता है, क्रॉस-स्किल लॉन्ग-होरिज़न कार्यों का मूल्यांकन करने के लिए स्किल²-बेंच (Skill²-Bench) बेंचमार्क का प्रस्ताव करता है, और यह प्रदर्शित करता है कि एक स्किल-एंट्रॉपी आरएल (Skill-Entropy RL) प्रशिक्षण ढांचा इन जटिल बहु-चरणीय समस्याओं पर मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

प्रकाशित 2026-08-06
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: स्किल-नेटिव LLMs की ओर: बेंचमार्किंग और लॉन्ग-होरिज़न रीजनिंग के लिए स्किल एंट्रॉपी (Skill Entropy)

1. समस्या विवरण (Problem Statement)

हाल के लार्ज लैंग्वेज मॉडल्स (LLMs) ने लॉन्ग-होरिज़न रीजनिंग (long-horizon reasoning) में मजबूत क्षमताएं प्रदर्शित की हैं, जो गहन अनुसंधान, एजेंटिक कोडिंग और मल्टी-स्टेप प्लानिंग को आगे बढ़ा रही हैं। हालांकि, वास्तविक दुनिया के लॉन्ग-होरिज़न कार्यों के लिए क्रॉस-स्किल रीजनिंग (cross-skill reasoning) की आवश्यकता होती है: एक सिंगल चेन ऑफ थॉट को विभिन्न विशिष्ट कौशलों (skills) के बीच सहजता से स्विच करना चाहिए (जैसे, गणितीय व्युत्पत्ति से शेड्यूल प्लानिंग, फिर सूचना निष्कर्षण तक)।

मौजूदा बेंचमार्क आमतौर पर व्यक्तिगत कौशलों का अलग-अलग मूल्यांकन करते हैं या एक ही डोमेन के भीतर चरणों को जोड़ते हैं। उनमें एक रीजनिंग चेन के भीतर विभिन्न कौशलों के बीच स्विच करने की कठिनाई को मापने या संबोधित करने के लिए कोई सिद्धांतगत तंत्र नहीं है। अनुभवजन्य अवलोकन (Empirical observations) बताते हैं कि जबकि फ्रंटियर मॉडल्स सिंगल-स्किल बेंचमार्क्स पर अच्छा प्रदर्शन करते हैं, वे कंपोजिशनल, क्रॉस-स्किल कार्यों में नाजुकता (brittleness) प्रदर्शित करते हैं। यह "स्किल-स्विचिंग गैप" तब भी बना रहता है जब मॉडल आइसोलेशन में प्रत्येक घटक कौशल को अच्छी तरह से संभाल लेता है, जो यह दर्शाता है कि कौशल बदलने की क्षमता डोमेन-विशिष्ट सक्षमता से एक ऑर्थोगोनल (orthogonal) क्षमता है।

2. कार्यप्रणाली (Methodology)

2.1 स्किल एंट्रॉपी (SkE)

लेखक स्किल एंट्रॉपी (Skill Entropy) पेश करते हैं, जो एक निर्देशित युग्म माप (directed pairwise measure) है जो एक कौशल sas_a से दूसरे कौशल sbs_b में स्विच करने की कठिनाई को मापता है।

  • परिभाषा: स्किल एंट्रॉपी को एक निश्चित संदर्भ मॉडल के तहत औसत सिंगल-स्किल सटीकता और क्रॉस-स्किल सटीकता के बीच एक स्मूदनिंग रेशियो के रूप में परिभाषित किया गया है।
    SkE(sa,sb)=12(Accuracy(sa)+Accuracy(sb))+αAccuracy(sa,sb)+α \text{SkE}(s_a, s_b) = \frac{\frac{1}{2}(\text{Accuracy}(s_a) + \text{Accuracy}(s_b)) + \alpha}{\text{Accuracy}(s_a, s_b) + \alpha}
    जहाँ α\alpha एक लैप्लेस स्मूथिंग कांस्टेंट है।
  • व्याख्या: यदि मान >1>1 है, तो इसका अर्थ है कि दोनों कौशलों को जोड़ने से उन्हें आइसोलेशन में संभालने की तुलना में महत्वपूर्ण कठिनाई बढ़ती है (स्विच करना कठिन है)। यदि मान 1\le 1 है, तो इसका अर्थ है कि स्विच आसान है।
  • टास्क-लेवल मेट्रिक: एक क्रॉस-स्किल टास्क τ\tau के लिए जिसमें स्किल सीक्वेंस (s1,,sL)(s_1, \dots, s_L) है, टास्क-लेवल स्किल एंट्रॉपी सीक्वेंस के साथ युग्मवार एंट्रॉपी का औसत है:
    SkE(τ)=1L1i=1L1SkE(si,si+1) \text{SkE}(\tau) = \frac{1}{L-1} \sum_{i=1}^{L-1} \text{SkE}(s_i, s_{i+1})

2.2 Skill2-Bench

स्किल एंट्रॉपी फ्रेमवर्क के आधार पर, लेखक क्रॉस-स्किल लॉन्ग-होरिज़न रीजनिंग के लिए एक बेंचमार्क Skill2-Bench का निर्माण करते हैं।

  • दायरा: यह 9 डोमेन में 558 कौशलों को कवर करता है: मैथ, साइंस, कोडिंग, लॉजिक, इंफॉर्मेशन एक्सट्रैक्शन, प्लानिंग, क्रिएटिव राइटिंग, कॉन्टेक्स्ट रिट्रीवल, और इंस्ट्रक्शन फॉलोइंग।
  • निर्माण: कार्यों को विशिष्ट एंट्रॉपी स्तरों (लो, मीडियम, हाई) पर स्किल सीक्वेंस को सैंपल करके और सीड प्रश्नों को एक सुसंगत परिदृश्य (scenario) में फिर से लिखकर सिंथेसाइज किया जाता है, जहाँ प्रत्येक चरण पिछले आउटपुट पर निर्भर करता है।
  • मूल्यांकन प्रोटोकॉल: मॉडल्स का मूल्यांकन दो मोड में किया जाता है:
    1. सिंगल-स्किल मोड: चरणों का उत्तर आइसोलेशन में दिया जाता है।
    2. क्रॉस-स्किल मोड: पूरा लॉन्ग-होरिज़न टास्क प्रस्तुत किया जाता है, जिसमें क्रमिक स्विचिंग की आवश्यकता होती है।

2.3 Skill-Entropy RL

पहचाने गए गैप को संबोधित करने के लिए, लेखक Skill-Entropy RL प्रस्तावित करते हैं, जो एक सुदृढीकरण शिक्षण (Reinforcement Learning) फ्रेमवर्क है जो स्किल एंट्रॉपी को एक ट्रेनिंग सिग्नल के रूप में उपयोग करता है।

  • आउटपुट फॉर्मेट: मॉडल को प्रत्येक चरण के लिए एक स्ट्रक्चर्ड रिस्पॉन्स देने के लिए प्रशिक्षित किया जाता है, जो स्पष्ट रूप से उपयोग किए गए स्किल और उत्तर दोनों की भविष्यवाणी करता है:
    <skill> Domain_Skill </skill><answer> Step Answer </answer>
  • रिवॉर्ड फंक्शन: कुल रिवॉर्ड rr स्टेप-लेवल करेक्टनेस (ransr_{ans}) को स्किल-एंट्रॉपी रिवॉर्ड (rentr_{ent}) के साथ जोड़ता है:
    r=λansrans+λentrent r = \lambda_{ans} r_{ans} + \lambda_{ent} r_{ent}
    • ransr_{ans}: डोमेन-विशिष्ट स्कोरर्स के आधार पर औसत प्रति-चरण सटीकता।
    • rentr_{ent}: गोल्ड स्किल सीक्वेंस के साथ प्रेडिक्टेड स्किल सीक्वेंस के संरेखण (alignment) को मापता है, जो मॉडल को एक ऐसा स्किल चेन प्रेडिक्ट करने के लिए प्रोत्साहित करता है जो ग्राउंड ट्रुथ के कठिनाई प्रोफाइल से मेल खाता हो।
  • ट्रेनिंग पाइपलाइन: यह तरीका स्किल-एनोटेटेड ट्रेसेस पर सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) के बाद कंपोजिट रिवॉर्ड का उपयोग करके ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग करते हुए दो-चरणीय प्रक्रिया का उपयोग करता है।

3. मुख्य परिणाम (Key Results)

3.1 बेंचमार्किंग निष्कर्ष (Skill2-Bench)

  • स्किल-स्विचिंग गैप: 8 फ्रंटियर और 4 ओपन-सोर्स मॉडल्स के मूल्यांकन से पता चलता है कि जैसे-जैसे टास्क-लेवल स्किल एंट्रॉपी बढ़ती है, प्रदर्शन में लगातार गिरावट आती है। लो से हाई एंट्रॉपी वाले कार्यों में सटीकता लगभग मोनोटोनिक रूप से घटती है।
  • क्रॉस-स्किल पेनल्टी: जब समान कौशलों का उपयोग क्रॉस-स्किल टास्क के भीतर किया जाता है बजाय आइसोलेशन के, तो मॉडल्स में सटीकता 4% से 13% तक गिर जाती है। यह पेनल्टी उन कौशलों के लिए भी बनी रहती है जिनमें मॉडल आइसोलेशन में अत्यधिक कुशल है (जैसे, लॉजिक)।
  • फेलियर मोड विश्लेषण: प्रमुख फेलियर मोड स्किल इनरशिया (skill inertia) है। टास्क के बाद के चरणों में, मॉडल्स पिछले चरण के स्किल और उत्तर मोडलिटी का ही पुन: उपयोग करने की प्रवृत्ति रखते हैं, बजाय आवश्यक स्किल में स्विच करने के। उदाहरण के लिए, एक मॉडल "मैथ" स्किल और न्यूमेरिक आंसर फॉर्मेट का उपयोग जारी रख सकता है जब अगला चरण "क्रिएटिव राइटिंग" और टेक्स्ट पैसेज की आवश्यकता वाला हो।

3.2 ट्रेनिंग प्रदर्शन (Skill-Entropy RL)

  • महत्वपूर्ण सुधार: Qwen3-4B-Instruct पर, Skill-Entropy RL ने Skill2-Bench स्कोर को 34.4% से बढ़ाकर 68.4% कर दिया। Qwen3-1.7B पर, स्कोर 14.6% से बढ़कर 40.1% हो गया।
  • तुलना: यह विधि प्रतिस्पर्धी बेसलाइन्स, जिसमें स्टैंडर्ड GRPO (बिना एंट्रॉपी रिवॉर्ड के), SFT, और अन्य स्किल-अवेयर पोस्ट-ट्रेनिंग मेथड्स (Skill-Distill, SkillRL, STAT) शामिल हैं, से बेहतर प्रदर्शन करती है।
  • सामान्यीकरण (Generalization):
    • ओपन-एंडेड डोमेन्स: केवल वेरीफिएबल डोमेन्स पर प्रशिक्षण के बावजूद, मॉडल ने ओपन-एंडेड डोमेन्स (क्रिएटिव राइटिंग, कॉन्टेक्स्ट रिट्रीवल) में लाभ दिखाया, जो सुझाव देता है कि स्किल-एंट्रॉपी सिग्नल अनदेखे डोमेन्स में भी ट्रांसफर होता है।
    • ऑफ-द-शेल्फ डेटा: इस पाइपलाइन को सफलतापूर्वक OpenR1-Math पर लागू किया गया, जो मूल रूप से स्पष्ट स्किल सीक्वेंस के साथ स्ट्रक्चर्ड नहीं था। मौजूदा ट्रेसेस को स्किल्स के साथ एनोटेट करके, स्किल-एंट्रॉपी रिवॉर्ड ने प्रदर्शन में सुधार करना जारी रखा, जो इसकी पुन: प्रयोज्यता (reusability) को प्रदर्शित करता है।

4. महत्व और दावे (Significance and Claims)

यह पेपर जटिल रीजनिंग के लिए LLMs के मूल्यांकन और प्रशिक्षण में एक महत्वपूर्ण अंतर को संबोधित करने का दावा करता है:

  1. नया मेट्रिक: यह स्किल एंट्रॉपी को एक सिद्धांतगत, निर्देशित युग्म माप के रूप में पेश करता है जो सिंगल-डोमेन मूल्यांकन से आगे बढ़कर स्किल स्विचिंग की कठिनाई को मापता है।
  2. बेंचमार्क: Skill2-Bench इस मेट्रिक द्वारा कैलिब्रेटेड पहला बड़े पैमाने का बेंचमार्क (558 स्किल्स, 9 डोमेन्स) प्रदान करता है, जो एक संरचनात्मक "स्किल-स्विचिंग गैप" को उजागर करता है जिसे सिंगल-डोमेन मूल्यांकन मिस कर देते हैं।
  3. ट्रेनिंग सिग्नल: यह प्रदर्शित करता है कि स्किल एंट्रॉपी केवल एक डायग्नोस्टिक टूल नहीं है बल्कि एक पुन: प्रयोज्य ट्रेनिंग सिग्नल है। इसे RL रिवॉर्ड फंक्शन में शामिल करके, मॉडल्स स्पष्ट रूप से स्किल ट्रांजिशन को प्रबंधित करना सीखते हैं, जिससे लॉन्ग-होरिज़न रीजनिंग क्षमताओं में महत्वपूर्ण सुधार होता है।
  4. फेलियर मोड की पहचान: यह कार्य स्पष्ट रूप से "स्किल इनरशिया" (पिछले स्टेप के स्किल/मोडलिटी का पुन: उपयोग करना) को क्रॉस-स्किल टास्क में विफलता के प्राथमिक कारण के रूप में पहचानता है और इसे कम करने के लिए एक तंत्र प्रदान करता है।

लेखक निष्कर्ष निकालते हैं कि स्किल स्विच को संभालना डोमेन सक्षमता से एक ऑर्थोगोनल क्षमता है और "स्किल-नेटिव" LLMs—वे मॉडल्स जिन्हें अपने स्वयं के स्किल सीक्वेंस को स्पष्ट रूप से प्रेडिक्ट और मैनेज करने के लिए प्रशिक्षित किया गया है—मजबूत लॉन्ग-होरिज़न रीजनिंग की दिशा में एक व्यवहार्य मार्ग हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →