Unified Data Selection for LLM Reasoning
यह शोध पत्र हाई-एंट्रॉपी सम (HES) को प्रस्तुत करता है, जो एक ट्रेनिंग-मुक्त मीट्रिक है जो टॉप टोकन के एंट्रॉपी को जोड़कर उच्च-गुणवत्ता वाले रीजनिंग डेटा की कुशलतापूर्वक पहचान करता है, जिससे कंप्यूटेशनल लागत को कम करते हुए सुपरवाइज्ड फाइन-ट्यूनिंग, रिजेक्शन फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग प्रतिमानों में लार्ज लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत कम उम्र के छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल पहेलियाँ, जैसे कि उन्नत गणित की समस्याएँ हल करना, सिखाने की कोशिश कर रहे हैं। छात्र हजारों उदाहरण समाधानों को पढ़कर सीखता है। लेकिन यहाँ एक समस्या है: सभी समाधान समान नहीं होते। कुछ स्पष्ट, तार्किक उत्कृष्ट कृतियाँ हैं, जबकि कुछ उलझे हुए, भ्रमित करने वाले बड़बड़ाते हुए अंश हैं। यदि आप छात्र को उन अच्छे उदाहरणों के साथ उन बिखरे हुए उदाहरणों को भी खिला देते हैं, तो वे भ्रमित हो सकते हैं या बुरी आदतें सीख सकते हैं।
लंबे समय तक, शोधकर्ताओं ने सरल चीजों को देखकर खराब उदाहरणों को बाहर निकालने की कोशिश की, जैसे कि समाधान कितना लंबा था या मॉडल लिखते समय औसतन कितना "आश्चर्यचकित" (surprised) महसूस कर रहा था। लेकिन यह पेपर तर्क देता है कि ये तरीके एक पूरी फिल्म को उसकी औसत चमक के आधार पर आंकने जैसे हैं; वे सबसे महत्वपूर्ण, नाटकीय क्षणों को छोड़ देते हैं।
मुख्य विचार: "प्लॉट ट्विस्ट" (Plot Twists) को खोजना
लेखक एक नया तरीका प्रस्तावित करते हैं जिससे सबसे अच्छा प्रशिक्षण डेटा पाया जा सके, जिसे हाई-एंट्रॉपी सम (High-Entropy Sum - HES) कहा जाता है।
एक तर्क प्रक्रिया (जैसे गणित की समस्या हल करना) को एक लंबी सड़क यात्रा की तरह समझें।
- लो-एंट्रॉपी टोकन (Low-Entropy Tokens): ये यात्रा के उबाऊ, अनुमानित हिस्से हैं। "बाएं मुड़ें," "सीधे चलें," "आसमान नीला है।" मॉडल जानता है कि आगे क्या आने वाला है। यह ऑटोपायलट है।
- हाई-एंट्रॉपी टोकन (High-Entropy Tokens): ये महत्वपूर्ण निर्णय बिंदु हैं। "रुको, क्या मुझे यहाँ मुड़ना चाहिए? या शायद कोई दूसरा रास्ता लेना चाहिए? क्या होगा अगर मैं इस अजीब रास्ते को आज़माऊं?" यहीं पर मॉडल वास्तव में सोच रहा है, विकल्पों को तौल रहा है, और एक कठिन निर्णय ले रहा है।
पेपर की बड़ी खोज यह है कि एक तर्क पथ (reasoning path) की गुणवत्ता इस बारे में नहीं है कि उसमें कितने "उबाऊ" चरण हैं, बल्कि इस बारे में है कि वह इन "महत्वपूर्ण निर्णय बिंदुओं" को कितनी सफलतापूर्वक पार करता है।
नया मीट्रिक: "हाई-एंट्रॉपी सम" (The High-Entropy Sum)
पूरे सफर के "आश्चर्य" के स्तर का औसत निकालने के बजाय (जो उबाऊ हिस्सों के कारण महत्वपूर्ण क्षणों को कम कर देता है), लेखकों ने एक नया स्कोर बनाया जिसे HES कहा जाता है।
उपमा: कल्पना कीजिए कि आप एक फिल्म समीक्षक के रूप में फिल्म की समीक्षा कर रहे हैं।
- पुराना तरीका (औसत एंट्रॉपी): आप फिल्म को उसके हर एक सेकंड के औसत उत्साह के स्तर के आधार पर रेट करते हैं। यदि फिल्म में 90 मिनट की उबाऊ बातचीत और 5 मिनट का विस्फोट है, तो औसत स्कोर कम होगा। आप इस तथ्य को मिस कर सकते हैं कि वह विस्फोट एक मास्टरपीस था।
- HES तरीका: आप उबाऊ 90 मिनट को अनदेखा कर देते हैं। आप केवल सबसे रोमांचक, अप्रत्याशित क्षणों के शीर्ष 0.5% (विस्फोट, प्लॉट ट्विस्ट) को देखते हैं। आप केवल उन क्षणों की तीव्रता को जोड़ते हैं। यदि किसी फिल्म में कुछ अविश्वसनीय, उच्च-दांव वाले दृश्य हैं, तो उसे उच्च स्कोर मिलता है। यदि यह केवल एक सपाट, उबाऊ यात्रा है जिसमें कोई आश्चर्य नहीं है, तो इसे कम स्कोर मिलता है।
पेपर दिखाता है कि यह "सर्वश्रेष्ठ क्षणों का योग" एक उच्च-गुणवत्ता वाले तर्क पथ को निम्न-गुणवत्ता वाले पथ से अलग करने का एकदम सही तरीका है।
उन्होंने इसका उपयोग कैसे किया (तीन प्रशिक्षण शैलियाँ)
टीम ने इस "HES फ़िल्टर" का परीक्षण AI को सिखाने के तीन अलग-अलग तरीकों पर किया, और यह सभी में बहुत अच्छा रहा:
सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) - "टेक्स्टबुक विधि":
- परिदृश्य: आपके पास हल की गई समस्याओं का एक विशाल पुस्तकालय है। आप चुनना चाहते हैं कि AI को सिखाने के लिए कौन से बेहतरीन उदाहरण चुनें।
- परिणाम: जब उन्होंने केवल सर्वश्रेष्ठ 20% उदाहरणों को चुनने के लिए HES का उपयोग किया, तो AI उतना ही अच्छा सीखा जितना कि पूरे पुस्तकालय को पढ़ने के बाद सीखता। वास्तव में, यदि उन्होंने सबसे खराब 20% (सबसे कम HES) को चुना, तो AI बहुत खराब प्रदर्शन करने लगा। इसने साबित कर दिया कि कम ही अधिक है (less is more), जब तक कि आप सही "कम" को चुनते हैं।
- बोनस: उन्होंने पाया कि वे एक विशाल, महंगे मॉडल के लिए फ़िल्टरिंग करने के लिए एक छोटे, सस्ते कंप्यूटर मॉडल का उपयोग कर सकते हैं, जिससे भारी मात्रा में पैसा बचता है।
रिजेक्शन फाइन-ट्यूनिंग (RFT) - "बहुविकल्पीय विधि":
- परिदृश्य: AI एक ही प्रश्न के 32 अलग-अलग उत्तर उत्पन्न करता है। आपको उनमें से सबसे अच्छा चुनने की आवश्यकता है।
- परिणाम: रैंडम तरीके से चुनने या सबसे लंबे उत्तर को चुनने के बजाय, उन्होंने HHS का उपयोग करके उस उत्तर को चुना जिसमें सबसे अधिक "क्रिटिकल थिंकिंग मोमेंट्स" थे। इसने रैंडम गेसिंग को लगातार मात दी।
रीइन्फोर्समेंट लर्निंग (RL) - "ट्रायल एंड एरर विधि":
- परिदृश्य: AI एक समस्या को हल करने का प्रयास करता है, यदि वह सही है तो उसे इनाम मिलता है, और वह अनुभव से सीखता है।
- परिणाम: उन्होंने AI को कई प्रयास करने दिया। उन्होंने केवल सर्वश्रेष्ठ 50% सफल प्रयासों को चुनने के लिए HES का उपयोग किया ताकि AI को सिखाया जा सके। इससे AI बहुत तेज़ी से और बेहतर तरीके से सीखा, बजाय इसके कि वे सभी प्रयासों (मध्यम दर्जे के प्रयासों सहित) का उपयोग करते।
यह क्यों मायने रखता है (बिना किसी बढ़ा-चढ़ाकर कहे)
पेपर का दावा है कि यह विधि एक "यूनिफाइड" (एकीकृत) समाधान है। इसके लिए फ़िल्टरिंग करने के लिए किसी नए, महंगे AI को प्रशिक्षित करने की आवश्यकता नहीं है। यह मॉडल के अपने आंतरिक "सरप्राइज" स्तरों पर आधारित एक सरल गणितीय गणना है।
- यह तेज़ है: यह प्रशिक्षण प्रक्रिया को धीमा नहीं करता है।
- यह सस्ता है: आप एक बड़े मॉडल के लिए डेटा को फ़िल्टर करने के लिए एक छोटे मॉडल का उपयोग कर सकते हैं।
- यह प्रभावी है: यह लगातार AI को बेहतर तर्क कौशल सीखने में मदद करता है क्योंकि यह उबाऊ, अनुमानित हिस्सों के बजाय उन "महत्वपूर्ण मोड़" पर ध्यान केंद्रित करता है जहाँ वास्तविक सोच होती है।
संक्षेप में, पेपर कहता है: तर्क पथ को उसकी लंबाई या उसके औसत गुण से न आंकें। इसे उसके सबसे कठिन, सबसे महत्वपूर्ण क्षणों की तीव्रता से आंकें। केवल उन क्षणों पर ध्यान केंद्रित करके, हम AI को बेहतर, तेज़ और सस्ते तरीके से सोचना सिखा सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।