← नवीनतम पेपर
💻 computer science

From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models

यह शोध पत्र इंटरप्रिटेबिलिटी-गाइडेड डेटा सिलेक्शन (IGDS) का परिचय देता है, जो एक नवीन फ्रेमवर्क है जो फाइन-ट्यूनिंग के लिए "फीचर-रेजोनेंट डेटा" की पहचान करने और उसे चुनने के लिए मैकेनिस्टिक इंटरप्रिटेबिलिटी का लाभ उठाता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण फुल-डेटासेट ट्रेनिंग और मौजूदा बेसलाइन्स की तुलना में बेहतर डेटा दक्षता के साथ गणित और अनुवाद जैसे कार्यों पर लार्ज लैंग्वेज मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Ling Shi, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ling Shi, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) है, जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और भाषाओं का अनुवाद कर सकता है। लेकिन अभी, यह एक ऐसे छात्र की तरह है जिसने पुस्तकालय की हर किताब पढ़ ली है लेकिन उसे यह नहीं सिखाया गया है कि किसी विशिष्ट परीक्षा के लिए कैसे अध्ययन करना है। वह बहुत कुछ जानता है, लेकिन वह उस ज्ञान का उपयोग किसी विशिष्ट कार्य के लिए कुशलतापूर्वक करने में सक्षम नहीं है।

आमतौर पर, इस रोबोट को नया कौशल सिखाने के लिए, हम इसे भारी मात्रा में डेटा खिलाते हैं, इस उम्मीद में कि यह पैटर्न को समझ लेगा। यह पियानो बजाना सीखने के लिए रिकॉर्ड किए गए हर गाने को सुनने जैसा है, बजाय इसके कि आप उन विशिष्ट स्केल्स (scales) का अभ्यास करें जिनकी आपको आवश्यकता है।

यह शोध पत्र इस रोबोट को सिखाने का एक स्मार्ट तरीका प्रस्तावित करता है। वे इसे IGDS (इंटरप्रिटेबिलिटी-गाइडेड डेटा सिलेक्शन) कहते हैं। यह कैसे काम करता है, यहाँ इसके सरल चरणों में विवरण दिया गया है:

1. समस्या: "ब्लैक बॉक्स" का अंतर

वैज्ञानिकों ने ऐसे उपकरण विकसित किए हैं (जिन्हें स्पार्स ऑटोएनकोडर्स या SAEs कहा जाता है) जो रोबोट के मस्तिष्क के भीतर झाँक सकते हैं। ये उपकरण देख सकते हैं कि कौन से "न्यूरॉन्स" सक्रिय हो रहे हैं और उन विशिष्ट पैटर्नों की पहचान कर सकते हैं जिनका उपयोग रोबोट गणित हल करने या शब्दों का अनुवाद करने जैसे काम करने के लिए करता है।

हालाँकि, एक अंतर है: वैज्ञानिक इन पैटर्नों को देख तो सकते हैं (अंतर्दृष्टि/Insight), लेकिन उन्होंने यह नहीं खोजा है कि इस दृश्य का उपयोग वास्तव में रोबोट को बेहतर तरीके से सिखाने के लिए कैसे किया जाए (कार्रवाई/Action)। यह एक धावक के पैर की मांसपेशियों का एक्स-रे देखने जैसा है, लेकिन यह न जानने जैसा है कि उन्हें तेज़ बनाने के लिए कौन से व्यायाम देने हैं।

2. समाधान: "इनसाइट-टू-एक्शन" लूप

लेखकों ने इस अंतर को पाटने के लिए एक फ्रेमवर्क बनाया है। इसे दो चरणों वाली रेसिपी के रूप में समझें:

चरण 1: "मैजिक स्विचेस" खोजना (टास्क फीचर आइडेंटिफिकेशन)
सबसे पहले, टीम रोबोट के मस्तिष्क के अंदर देखती है जब वह एक विशिष्ट कार्य (जैसे गणित) करने की कोशिश करता है। वे विशिष्ट "स्विचों" (फीचर्स) की तलाश कर रहे हैं जो गणित के बारे में सोचते समय चमकते हैं।

  • फ़िल्टर: वे केवल अनुमान नहीं लगाते। वे दो-चरणीय फ़िल्टर का उपयोग करते हैं। पहले, वे उन स्विचों को ढूंढते हैं जो अक्सर चमकते हैं (हाई-फ्रीक्वेंसी)। फिर, वे एक "स्ट्रेस टेस्ट" (इंटरवेंशनल फ़िल्टरिंग) करते हैं: वे कृत्रिम रूप से एक विशिष्ट स्विच की आवाज़ को तेज़ करते हैं ताकि यह देखा जा सके कि क्या रोबोट वास्तव में उस कार्य में बेहतर होता है।
  • परिणाम: वे उन कुछ "मैजिक स्विचेस" को अलग करते हैं जो वास्तव में समस्या को हल करने की रोबोट की क्षमता के लिए जिम्मेदार हैं। यदि किसी स्विच को बढ़ाने से मदद नहीं मिलती है, तो वे उसे अनदेखा कर देते हैं।

चरण 2: "रेजोनेंट डेटा" खोजना (फीचर-बेस्ड डेटा स्कोरिंग)
अब जब वे जानते हैं कि कौन से स्विच रोबोट को गणित में अच्छा बनाते हैं, तो वे प्रशिक्षण डेटा के एक विशाल ढेर (हजारों गणित की समस्याओं) के माध्यम से जाते हैं।

  • परीक्षण: गुणवत्ता के लिए समस्याओं को पढ़ने के बजाय, वे पूछते हैं: "कौन सी समस्या 'मैजिक स्विचेस' को सबसे अधिक चमकाती है?"
  • चयन: वे केवल उस डेटा को चुनते हैं जो उन विशिष्ट स्विचों से सबसे मजबूत प्रतिक्रिया उत्पन्न करता है। वे इसे "फीचर-रेजोनेंट डेटा" कहते हैं। यह एक संगीतकार द्वारा केवल उन गानों को चुनने जैसा है जो उसके पसंदीदा गिटार के तार को सबसे अधिक कंपन कराते हैं, बाकी को अनदेखा करते हुए।

3. परिणाम: कम में अधिक करना

टीम ने तीन अलग-अलग रोबोट दिमागों (Gemma, LLaMA, और Qwen) और तीन अलग-अलग कार्यों (गणित, सारांश बनाना, और अनुवाद) पर इसका परीक्षण किया।

  • गणित का चमत्कार: Gemma रोबोट पर, इस पद्धति का उपयोग करके केवल 50% डेटा के साथ, उन्होंने मानक प्रशिक्षण विधियों के 100% डेटा की तुलना में रोबोट को गणित में 17.4% बेहतर बनाया।
  • प्रतिस्पर्धा को पछाड़ना: उनका तरीका डेटा चयन के अन्य लोकप्रिय तरीकों (जैसे "सबसे कठिन" प्रश्न या "सबसे विविध" प्रश्न चुनना) को लगातार पछाड़ता है।
  • प्रमाण: उन्होंने दिखाया कि प्रशिक्षण के दौरान "मैजिक स्विचेस" जितनी अधिक बार चमके, रोबोट का प्रदर्शन उतना ही बेहतर हुआ। इसने मस्तिष्क की कार्यप्रणाली को समझने और इसके प्रदर्शन में सुधार के बीच एक सीधा संबंध सिद्ध किया।

4. यह क्यों महत्वपूर्ण है

शोध पत्र का तर्क है कि हमें रोबोट के साथ एक रहस्यमय ब्लैक बॉक्स के रूप में व्यवहार करने की आवश्यकता नहीं है। इसके आंतरिक तंत्र (विशिष्ट स्विचों) को समझकर, हम एक छोटा, उच्च-गुणवत्ता वाला "स्टडी गाइड" तैयार कर सकते हैं जो एक विशाल, अव्यवस्थित पाठ्यपुस्तक की तुलना में बहुत अधिक प्रभावी है।

संक्षेप में: रोबोट को यादृच्छिक डेटा का पहाड़ खिलाने और यह उम्मीद करने के बजाय कि वह सीख जाएगा, यह विधि हमें उसके मस्तिष्क के भीतर झाँकने, उन सटीक लीवरों को खोजने की अनुमति देती है जो एक विशिष्ट कौशल को नियंत्रित करते हैं, और फिर केवल वही डेटा खिलाने की अनुमति देती है जो उन लीवरों को सबसे ज़ोर से खींचता है। परिणाम एक स्मार्ट रोबोट है जिसे आधे समय और आधे डेटा के साथ प्रशिक्षित किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →