LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models
यह शोध पत्र LEAD को प्रस्तुत करता है, जो एक नवीन विधि है जो सुदृढीकरण शिक्षण (reinforcement learning) के दौरान शुद्धता और दक्षता को गतिशील रूप से संतुलित करने के लिए ऑनलाइन, स्व-अनुकूली तंत्रों का उपयोग करती है, जिससे बड़े रीजनिंग मॉडल को विविध गणितीय बेंचमार्क में सटीकता से समझौता किए बिना काफी छोटे चेन-ऑफ-थॉट (Chain-of-Thought) आउटपुट उत्पन्न करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन अत्यधिक बातूनी छात्र है जो गणित की परीक्षा दे रहा है। यह छात्र, जो आधुनिक लार्ज लैंग्वेज मॉडल्स (LLMs) का प्रतिनिधित्व करता है, अविश्वसनीय रूप से स्मार्ट है और कठिन समस्याओं को हल कर सकता है। हालाँकि, उसकी एक बुरी आदत है: वह "ज़रूरत से ज़्यादा सोचने" (overthinking) लगता है। यहाँ तक कि "2+2 क्या है?" जैसे सरल प्रश्न के लिए भी, वह संख्याओं के इतिहास, जोड़ के दर्शन और संख्या '2' की जीवन कहानी पर 10 पन्नों का निबंध लिख सकता है, और अंत में "4" उत्तर दे सकता है।
यह "ज़रूरत से ज़्यादा सोचना" समय, ऊर्जा और कंप्यूटर संसाधनों को बर्बाद करता है। यह शोध पत्र LEAD (Length-Efficient Adaptive and Dynamic Reasoning) नामक एक नई प्रशिक्षण विधि पेश करता है, जो इस छात्र को अपनी बुद्धिमत्ता खोए बिना संक्षिप्त होना सिखाने के लिए है।
LEAD कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल
इस बातूनी व्यवहार को ठीक करने के पिछले प्रयास एक सख्त शिक्षक की तरह थे जो कहता है, "चाहे सवाल कुछ भी हो, आपका उत्तर ठीक 50 शब्दों का होना चाहिए।"
- समस्या: यह अनुचित है। एक सरल प्रश्न छोटा होना चाहिए, लेकिन एक जटिल ओलंपियाड-स्तर की गणित की समस्या के लिए लंबे स्पष्टीकरण की आवश्यकता होती है। यदि आप एक कठिन समस्या पर छोटा उत्तर देने के लिए मजबूर करते हैं, तो छात्र गलत हो जाएगा। यदि आप एक आसान समस्या पर लंबा उत्तर देने के लिए मजबूर करते हैं, तो वे समय बर्बाद करते हैं।
- परिणाम: पुराने तरीके या तो छात्र को बहुत संक्षिप्त (और गलत) बना देते थे या उन्हें पर्याप्त रूप से छोटा नहीं कर पाते थे।
समाधान: LEAD के दो स्मार्ट तरीके
LEAD एक बुद्धिमान कोच की तरह काम करता है जो वास्तविक समय में उनकी शिक्षण शैली को समायोजित करता है। यह दो मुख्य तरीकों का उपयोग करता है:
1. "डायनामिक वॉल्यूम नॉब" (अनुकूली पुरस्कार/Adaptive Rewards)
कल्पना कीजिए कि छात्र का मूल्यांकन दो चीजों पर किया जा रहा है: सटीकता (सही उत्तर देना) और संक्षिप्तता (छोटा रखना)।
- पुराना तरीका: शिक्षक एक निश्चित नियम सेट करता है: "50% अंक सही होने के लिए हैं, और 50% अंक संक्षिप्त होने के लिए हैं।" यह अच्छी तरह से काम नहीं करता क्योंकि प्रशिक्षण के शुरुआती चरण में, छात्र को समस्या को हल करने का तरीका सीखने के लिए पूरी तरह से सोचने पर ध्यान केंद्रित करने की आवश्यकता होती है। यदि आप उन्हें बहुत जल्दी संक्षिप्त होने के लिए दबाव डालते हैं, तो वे सोचना बंद कर देते हैं और अनुमान लगाने लगते हैं। बाद में, एक बार जब वे समस्या को हल करना सीख जाते हैं, तो आप उन्हें छोटा होने के लिए प्रेरित करना चाहते हैं।
- LEAD का तरीका: LEAD एक स्मार्ट वॉल्यूम नॉब का उपयोग करता है।
- प्रशिक्षण के दौरान: नॉब "सटीकता" (Correctness) के लिए ऊपर की ओर होता है। छात्र को समाधान खोजने के लिए जितनी आवश्यकता हो, उतना विस्तार से बोलने की अनुमति दी जाती है।
- प्रशिक्षण के बाद: एक बार जब छात्र सही उत्तर देने लगता है, तो यह स्वचालित रूप से बदल जाता है। "संक्षिप्तता" (Brevity) का वॉल्यूम बढ़ जाता है, और "सटीकता" का वॉल्यूम कम हो जाता है (क्योंकि वे पहले से ही जानते हैं कि समस्या को कैसे हल करना है)।
- जादू: सिस्टम लगातार जाँचता है: "क्या छात्र अभी भी छोटा होना सीख रहा है?" यदि हाँ, तो यह उन पर दबाव डालता है। यदि छात्र पहले से ही संक्षिप्त है, तो यह दबाव डालना बंद कर देता है और यह सुनिश्चित करने पर ध्यान केंद्रित करता है कि उत्तर अभी भी सही है।
2. "व्यक्तिगत लक्ष्य" (प्रति-प्रश्न बजट/Per-Problem Budget)
हर प्रश्न के लिए एक निश्चित शब्द सीमा देने के बजाय, LEAD प्रत्येक प्रश्न के लिए अपना व्यक्तिगत लक्षित लंबाई देता है।
- यह कैसे काम करता है: सिस्टम छात्र के सफल प्रयासों को देखता है।
- यदि छात्र ने एक कठिन समस्या को 2,000 शब्दों में सही हल किया, तो LEAD कहता है, "ठीक है, इस विशिष्ट कठिन समस्या के लिए, लक्ष्य 2,000 शब्द है। इससे नीचे न जाएँ, अन्यथा आप शायद कुछ स्टेप्स छोड़ रहे हैं।"
- यदि छात्र ने एक आसान समस्या को 200 शब्दों में हल किया, तो LEAD कहता है, "बहुत अच्छा, इस एक के लिए लक्ष्य 200 शब्द है।"
- सममित पुरस्कार (Symmetric Reward): LEAD निष्पक्ष है। यह केवल लंबे उत्तरों को दंडित नहीं करता है। यह बहुत छोटे उत्तरों को भी दंडित करता है। यदि छात्र एक कठिन समस्या का 10 शब्दों में उत्तर देता है, तो LEAD कहता है, "यह बहुत छोटा है; आपने शायद नकल की है या अनुमान लगाया है।" यह छात्र को आलसी शॉर्टकट लेने से रोकता है।
परिणाम: "गोल्डिलॉक्स" (Goldilocks) छात्र
पाँच अलग-अलग गणितीय बेंचमार्क पर परीक्षण किए जाने पर, LEAD ने एक ऐसा छात्र तैयार किया जो:
- अन्य तरीकों की तुलना में अधिक सही उत्तर प्राप्त करता है जिन्होंने प्रतिक्रियाओं को छोटा करने की कोशिश की थी।
- मूल, बातूनी मॉडल की तुलना में काफी कम बोलता है।
- स्मार्ट होने और संक्षिप्त होने के बीच सर्वश्रेष्ठ संतुलन (जिसे "सटीकता-दक्षता स्कोर" कहा जाता है) प्राप्त करता है।
संक्षेप में एक उपमा
मूल मॉडल को एक टूर गाइड के रूप में सोचें जो लगातार बोलता रहता है, भले ही पर्यटक किसी स्थल को जल्दी से देखना चाहते हों।
- पुराने तरीके ने गाइड पर एक टाइमर लगाने की कोशिश की: "5 मिनट के बाद बोलना बंद करें।" इसका मतलब था कि गाइड जटिल संग्रहालयों के माध्यम से जल्दबाजी करेगा (गलत हो जाएगा) या साधारण पार्क भ्रमण को खींच देगा (समय बर्बाद करेगा)।
- LEAD एक स्मार्ट मैनेजर की तरह है जो गाइड पर नज़र रखता है।
- यदि गाइड एक जटिल पेंटिंग को समझाने में संघर्ष कर रहा है, तो मैनेजर कहता है, "समय लें, इसे पूरी तरह से समझाएं।"
- यदि गाइड एक साधारण मूर्ति की व्याख्या कर रहा है, तो मैनेजर कहता है, "आपने अपनी बात कह दी है, इसे दो वाक्यों में समाप्त करें।"
- मैनेजर टूर के दौरान ही नियमों को समायोजित करता है, यह सुनिश्चित करता है कि गाइड हमेशा बिल्कुल सही मात्रा में बातूनी हो।
संक्षेप में, LEAD एआई मॉडल्स को यह सिखाता है कि कब गहराई से सोचना है और कब संक्षिप्त होना है, जो कार्य की कठिनाई और उनकी अपनी प्रगति के अनुसार अनुकूलित होता है, न कि एक कठोर, एक ही आकार के नियम का पालन करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।