Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
यह शोध पत्र तर्क कौशल (reasoning skills) के बीच स्विच करने की कठिनाई को मापने के लिए एक नए मीट्रिक के रूप में स्किल एंट्रॉपी (Skill Entropy) का परिचय देता है, क्रॉस-स्किल लॉन्ग-होरिज़न कार्यों का मूल्यांकन करने के लिए स्किल²-बेंच (Skill²-Bench) बेंचमार्क का प्रस्ताव करता है, और यह प्रदर्शित करता है कि एक स्किल-एंट्रॉपी आरएल (Skill-Entropy RL) प्रशिक्षण ढांचा इन जटिल बहु-चरणीय समस्याओं पर मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: स्किल-नेटिव LLMs की ओर: बेंचमार्किंग और लॉन्ग-होरिज़न रीजनिंग के लिए स्किल एंट्रॉपी (Skill Entropy)
1. समस्या विवरण (Problem Statement)
हाल के लार्ज लैंग्वेज मॉडल्स (LLMs) ने लॉन्ग-होरिज़न रीजनिंग (long-horizon reasoning) में मजबूत क्षमताएं प्रदर्शित की हैं, जो गहन अनुसंधान, एजेंटिक कोडिंग और मल्टी-स्टेप प्लानिंग को आगे बढ़ा रही हैं। हालांकि, वास्तविक दुनिया के लॉन्ग-होरिज़न कार्यों के लिए क्रॉस-स्किल रीजनिंग (cross-skill reasoning) की आवश्यकता होती है: एक सिंगल चेन ऑफ थॉट को विभिन्न विशिष्ट कौशलों (skills) के बीच सहजता से स्विच करना चाहिए (जैसे, गणितीय व्युत्पत्ति से शेड्यूल प्लानिंग, फिर सूचना निष्कर्षण तक)।
मौजूदा बेंचमार्क आमतौर पर व्यक्तिगत कौशलों का अलग-अलग मूल्यांकन करते हैं या एक ही डोमेन के भीतर चरणों को जोड़ते हैं। उनमें एक रीजनिंग चेन के भीतर विभिन्न कौशलों के बीच स्विच करने की कठिनाई को मापने या संबोधित करने के लिए कोई सिद्धांतगत तंत्र नहीं है। अनुभवजन्य अवलोकन (Empirical observations) बताते हैं कि जबकि फ्रंटियर मॉडल्स सिंगल-स्किल बेंचमार्क्स पर अच्छा प्रदर्शन करते हैं, वे कंपोजिशनल, क्रॉस-स्किल कार्यों में नाजुकता (brittleness) प्रदर्शित करते हैं। यह "स्किल-स्विचिंग गैप" तब भी बना रहता है जब मॉडल आइसोलेशन में प्रत्येक घटक कौशल को अच्छी तरह से संभाल लेता है, जो यह दर्शाता है कि कौशल बदलने की क्षमता डोमेन-विशिष्ट सक्षमता से एक ऑर्थोगोनल (orthogonal) क्षमता है।
2. कार्यप्रणाली (Methodology)
2.1 स्किल एंट्रॉपी (SkE)
लेखक स्किल एंट्रॉपी (Skill Entropy) पेश करते हैं, जो एक निर्देशित युग्म माप (directed pairwise measure) है जो एक कौशल से दूसरे कौशल में स्विच करने की कठिनाई को मापता है।
- परिभाषा: स्किल एंट्रॉपी को एक निश्चित संदर्भ मॉडल के तहत औसत सिंगल-स्किल सटीकता और क्रॉस-स्किल सटीकता के बीच एक स्मूदनिंग रेशियो के रूप में परिभाषित किया गया है।
जहाँ एक लैप्लेस स्मूथिंग कांस्टेंट है। - व्याख्या: यदि मान है, तो इसका अर्थ है कि दोनों कौशलों को जोड़ने से उन्हें आइसोलेशन में संभालने की तुलना में महत्वपूर्ण कठिनाई बढ़ती है (स्विच करना कठिन है)। यदि मान है, तो इसका अर्थ है कि स्विच आसान है।
- टास्क-लेवल मेट्रिक: एक क्रॉस-स्किल टास्क के लिए जिसमें स्किल सीक्वेंस है, टास्क-लेवल स्किल एंट्रॉपी सीक्वेंस के साथ युग्मवार एंट्रॉपी का औसत है:
2.2 Skill2-Bench
स्किल एंट्रॉपी फ्रेमवर्क के आधार पर, लेखक क्रॉस-स्किल लॉन्ग-होरिज़न रीजनिंग के लिए एक बेंचमार्क Skill2-Bench का निर्माण करते हैं।
- दायरा: यह 9 डोमेन में 558 कौशलों को कवर करता है: मैथ, साइंस, कोडिंग, लॉजिक, इंफॉर्मेशन एक्सट्रैक्शन, प्लानिंग, क्रिएटिव राइटिंग, कॉन्टेक्स्ट रिट्रीवल, और इंस्ट्रक्शन फॉलोइंग।
- निर्माण: कार्यों को विशिष्ट एंट्रॉपी स्तरों (लो, मीडियम, हाई) पर स्किल सीक्वेंस को सैंपल करके और सीड प्रश्नों को एक सुसंगत परिदृश्य (scenario) में फिर से लिखकर सिंथेसाइज किया जाता है, जहाँ प्रत्येक चरण पिछले आउटपुट पर निर्भर करता है।
- मूल्यांकन प्रोटोकॉल: मॉडल्स का मूल्यांकन दो मोड में किया जाता है:
- सिंगल-स्किल मोड: चरणों का उत्तर आइसोलेशन में दिया जाता है।
- क्रॉस-स्किल मोड: पूरा लॉन्ग-होरिज़न टास्क प्रस्तुत किया जाता है, जिसमें क्रमिक स्विचिंग की आवश्यकता होती है।
2.3 Skill-Entropy RL
पहचाने गए गैप को संबोधित करने के लिए, लेखक Skill-Entropy RL प्रस्तावित करते हैं, जो एक सुदृढीकरण शिक्षण (Reinforcement Learning) फ्रेमवर्क है जो स्किल एंट्रॉपी को एक ट्रेनिंग सिग्नल के रूप में उपयोग करता है।
- आउटपुट फॉर्मेट: मॉडल को प्रत्येक चरण के लिए एक स्ट्रक्चर्ड रिस्पॉन्स देने के लिए प्रशिक्षित किया जाता है, जो स्पष्ट रूप से उपयोग किए गए स्किल और उत्तर दोनों की भविष्यवाणी करता है:
<skill> Domain_Skill </skill><answer> Step Answer </answer> - रिवॉर्ड फंक्शन: कुल रिवॉर्ड स्टेप-लेवल करेक्टनेस () को स्किल-एंट्रॉपी रिवॉर्ड () के साथ जोड़ता है:
- : डोमेन-विशिष्ट स्कोरर्स के आधार पर औसत प्रति-चरण सटीकता।
- : गोल्ड स्किल सीक्वेंस के साथ प्रेडिक्टेड स्किल सीक्वेंस के संरेखण (alignment) को मापता है, जो मॉडल को एक ऐसा स्किल चेन प्रेडिक्ट करने के लिए प्रोत्साहित करता है जो ग्राउंड ट्रुथ के कठिनाई प्रोफाइल से मेल खाता हो।
- ट्रेनिंग पाइपलाइन: यह तरीका स्किल-एनोटेटेड ट्रेसेस पर सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) के बाद कंपोजिट रिवॉर्ड का उपयोग करके ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग करते हुए दो-चरणीय प्रक्रिया का उपयोग करता है।
3. मुख्य परिणाम (Key Results)
3.1 बेंचमार्किंग निष्कर्ष (Skill2-Bench)
- स्किल-स्विचिंग गैप: 8 फ्रंटियर और 4 ओपन-सोर्स मॉडल्स के मूल्यांकन से पता चलता है कि जैसे-जैसे टास्क-लेवल स्किल एंट्रॉपी बढ़ती है, प्रदर्शन में लगातार गिरावट आती है। लो से हाई एंट्रॉपी वाले कार्यों में सटीकता लगभग मोनोटोनिक रूप से घटती है।
- क्रॉस-स्किल पेनल्टी: जब समान कौशलों का उपयोग क्रॉस-स्किल टास्क के भीतर किया जाता है बजाय आइसोलेशन के, तो मॉडल्स में सटीकता 4% से 13% तक गिर जाती है। यह पेनल्टी उन कौशलों के लिए भी बनी रहती है जिनमें मॉडल आइसोलेशन में अत्यधिक कुशल है (जैसे, लॉजिक)।
- फेलियर मोड विश्लेषण: प्रमुख फेलियर मोड स्किल इनरशिया (skill inertia) है। टास्क के बाद के चरणों में, मॉडल्स पिछले चरण के स्किल और उत्तर मोडलिटी का ही पुन: उपयोग करने की प्रवृत्ति रखते हैं, बजाय आवश्यक स्किल में स्विच करने के। उदाहरण के लिए, एक मॉडल "मैथ" स्किल और न्यूमेरिक आंसर फॉर्मेट का उपयोग जारी रख सकता है जब अगला चरण "क्रिएटिव राइटिंग" और टेक्स्ट पैसेज की आवश्यकता वाला हो।
3.2 ट्रेनिंग प्रदर्शन (Skill-Entropy RL)
- महत्वपूर्ण सुधार: Qwen3-4B-Instruct पर, Skill-Entropy RL ने Skill2-Bench स्कोर को 34.4% से बढ़ाकर 68.4% कर दिया। Qwen3-1.7B पर, स्कोर 14.6% से बढ़कर 40.1% हो गया।
- तुलना: यह विधि प्रतिस्पर्धी बेसलाइन्स, जिसमें स्टैंडर्ड GRPO (बिना एंट्रॉपी रिवॉर्ड के), SFT, और अन्य स्किल-अवेयर पोस्ट-ट्रेनिंग मेथड्स (Skill-Distill, SkillRL, STAT) शामिल हैं, से बेहतर प्रदर्शन करती है।
- सामान्यीकरण (Generalization):
- ओपन-एंडेड डोमेन्स: केवल वेरीफिएबल डोमेन्स पर प्रशिक्षण के बावजूद, मॉडल ने ओपन-एंडेड डोमेन्स (क्रिएटिव राइटिंग, कॉन्टेक्स्ट रिट्रीवल) में लाभ दिखाया, जो सुझाव देता है कि स्किल-एंट्रॉपी सिग्नल अनदेखे डोमेन्स में भी ट्रांसफर होता है।
- ऑफ-द-शेल्फ डेटा: इस पाइपलाइन को सफलतापूर्वक OpenR1-Math पर लागू किया गया, जो मूल रूप से स्पष्ट स्किल सीक्वेंस के साथ स्ट्रक्चर्ड नहीं था। मौजूदा ट्रेसेस को स्किल्स के साथ एनोटेट करके, स्किल-एंट्रॉपी रिवॉर्ड ने प्रदर्शन में सुधार करना जारी रखा, जो इसकी पुन: प्रयोज्यता (reusability) को प्रदर्शित करता है।
4. महत्व और दावे (Significance and Claims)
यह पेपर जटिल रीजनिंग के लिए LLMs के मूल्यांकन और प्रशिक्षण में एक महत्वपूर्ण अंतर को संबोधित करने का दावा करता है:
- नया मेट्रिक: यह स्किल एंट्रॉपी को एक सिद्धांतगत, निर्देशित युग्म माप के रूप में पेश करता है जो सिंगल-डोमेन मूल्यांकन से आगे बढ़कर स्किल स्विचिंग की कठिनाई को मापता है।
- बेंचमार्क: Skill2-Bench इस मेट्रिक द्वारा कैलिब्रेटेड पहला बड़े पैमाने का बेंचमार्क (558 स्किल्स, 9 डोमेन्स) प्रदान करता है, जो एक संरचनात्मक "स्किल-स्विचिंग गैप" को उजागर करता है जिसे सिंगल-डोमेन मूल्यांकन मिस कर देते हैं।
- ट्रेनिंग सिग्नल: यह प्रदर्शित करता है कि स्किल एंट्रॉपी केवल एक डायग्नोस्टिक टूल नहीं है बल्कि एक पुन: प्रयोज्य ट्रेनिंग सिग्नल है। इसे RL रिवॉर्ड फंक्शन में शामिल करके, मॉडल्स स्पष्ट रूप से स्किल ट्रांजिशन को प्रबंधित करना सीखते हैं, जिससे लॉन्ग-होरिज़न रीजनिंग क्षमताओं में महत्वपूर्ण सुधार होता है।
- फेलियर मोड की पहचान: यह कार्य स्पष्ट रूप से "स्किल इनरशिया" (पिछले स्टेप के स्किल/मोडलिटी का पुन: उपयोग करना) को क्रॉस-स्किल टास्क में विफलता के प्राथमिक कारण के रूप में पहचानता है और इसे कम करने के लिए एक तंत्र प्रदान करता है।
लेखक निष्कर्ष निकालते हैं कि स्किल स्विच को संभालना डोमेन सक्षमता से एक ऑर्थोगोनल क्षमता है और "स्किल-नेटिव" LLMs—वे मॉडल्स जिन्हें अपने स्वयं के स्किल सीक्वेंस को स्पष्ट रूप से प्रेडिक्ट और मैनेज करने के लिए प्रशिक्षित किया गया है—मजबूत लॉन्ग-होरिज़न रीजनिंग की दिशा में एक व्यवहार्य मार्ग हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।