Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking
यह शोध पत्र जस्ट-इनफ थिंकिंग (JET) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ट्राजेक्टरी ट्रंकेशन (trajectory truncation) और गुणवत्ता-नियंत्रित लंबाई पुरस्कारों (quality-controlled length rewards) का लाभ उठाकर बड़े रीजनिंग मॉडलों को अनावश्यक रीजनिंग चरणों को सक्रिय रूप से समाप्त करने के लिए प्रशिक्षित करता है, जिससे सटीकता से समझौता किए बिना कम्प्यूटेशनल दक्षता में उल्लेखनीय सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
ओवरथिंकिंग को रोकें: हमने AI को "जरूरत भर सोचना" कैसे सिखाया
कल्पना कीजिए कि आप एक कठिन पहेली सुलझाने की कोशिश कर रहे हैं। आप सोचना शुरू करते हैं, "ठीक है, उत्तर शायद X है... रुकिए, लेकिन क्या यह Y हो सकता है? नहीं, यह फिट नहीं बैठता। मुझे Z को चेक करना चाहिए। और शायद W? ओह, और आसमान का रंग? क्या इससे कोई फर्क पड़ता है? चलिए, मैं तीन कदम पहले की अपनी गणित दोबारा देख लेता हूँ..."
आप चलते रहते हैं, बिना वजह चक्कर काटते रहते हैं, जब तक कि अंत में आपको उत्तर नहीं मिल जाता। लेकिन यहाँ एक पेच है: आपको पहले दो विचारों के बाद ही उत्तर मिल गया था। बाकी सब बस खुद से बातें करना था, जिससे समय और ऊर्जा बर्बाद हुई।
आज के सबसे उन्नत "रीज़निंग AI" मॉडल्स (जिन्हें लार्ज रीज़निंग मॉडल्स या LRM कहा जाता है) के साथ भी बिल्कुल यही होता है। वे अविश्वसनीय रूप से बुद्धिमान हैं, लेकिन वे एक ऐसी स्थिति से जूझते हैं जिसे हम "ओवरथिंकिंग" (ज़रूरत से ज़्यादा सोचना) कहते हैं। वे सरल समस्याओं को हल करने के लिए बहुत लंबी और थकाऊ 'चेन ऑफ थॉट' (विचारों की श्रृंखला) बनाते हैं, जिससे भारी मात्रा में कंप्यूटर पावर और समय बर्बाद होता है।
जिस पेपर को आपने साझा किया है, वह JET (Just-Enough Thinking - ज़रूरत भर सोचना) नामक एक नई विधि पेश करता है। यह AI के लिए एक पर्सनल ट्रेनर की तरह है, जो उसे यह सिखाता है कि जब उसे उत्तर पता चल जाए, तो बात करना कब बंद करना है।
यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: वह AI जो बात करना बंद नहीं कर पाता
वर्तमान AI मॉडल उस छात्र की तरह हैं, जब उनसे पूछा जाता है "2+2 क्या है?", तो वे केवल "4" नहीं कहते। इसके बजाय, वे संख्या की परिभाषा, जोड़ के दर्शन और संख्या 4 की आणविक संरचना के बारे में 5 पन्नों का निबंध लिखते हैं, और अंत में "4" लिखते हैं।
- लागत: यह "ओवरथिंकिंग" महंगी है। यह बहुत अधिक बिजली का उपयोग करती है और इसमें काफी समय लगता है।
- मुद्दा: जब शोधकर्ताओं ने AI को छोटा (संक्षिप्त) होने के लिए प्रशिक्षित करने की कोशिश की, तो वे आमतौर पर इसे रुकने के लिए मजबूर करते थे या इसे नकल करने के लिए छोटे उत्तर देते थे। लेकिन यह एक मैराथन धावक को स्प्रिंट (तेज़ दौड़) लगाने के लिए मजबूर करने जैसा था; AI भ्रमित हो गया क्योंकि छोटे उत्तर उसके स्वाभाविक सोचने के तरीके से मेल नहीं खाते थे।
2. खोज: "अहा!" वाला क्षण जल्दी आता है
शोधकर्ताओं ने एक दिलचस्प बात देखी। यदि आप एक लंबा, भटका हुआ AI उत्तर लेते हैं और उसे बीच में ही काट देते हैं, तो AI अक्सर अभी भी सही उत्तर दे देता है!
- उपमा: कल्पना कीजिए कि आप एक छिपे हुए खजाने को खोजने के लिए जंगल में चल रहे हैं। आप 100 कदम चलते हैं, और आपको खजाना मिल जाता है। लेकिन आप "पक्का होने के लिए" अगले 500 कदम और चलते रहते हैं।
- अंतर्दृष्टि (Insight): AI अपने सोचने के पहले 25% से 50% हिस्से में ही आवश्यक जानकारी एकत्र कर लेता है। बाकी के कदम केवल अनावश्यक शोर (redundant noise) हैं। AI ने पहले ही "खजाना देख लिया है," लेकिन उसे पता नहीं है कि उसे अब रुकने की अनुमति है।
3. समाधान: JET (Just-Enough Thinking - ज़रूरत भर सोचना)
JET एक प्रशिक्षण पद्धति है जो AI को उस "अहा!" वाले क्षण को पहचानने और तुरंत रुकने के लिए सिखाती है। यह दो चतुर तरीकों से ऐसा करता है:
A. "कट-एंड-पेस्ट" प्रशिक्षण (ट्रैजेक्टरी ट्रंकेशन)
AI को छोटा होने के लिए मजबूर करने के बजाय, JET AI के अपने लंबे उत्तरों को लेती है और उन्हें अलग-अलग बिंदुओं पर (जैसे 25%, 50%, 75%) काट देती है।
- यह कैसे काम करता है: कल्पना कीजिए कि आप एक कुत्ते को चीज़ लाने (fetch) के लिए सिखा रहे हैं। किनारे से "रुको!" चिल्लाने के बजाय, आप धीरे से डंडा कुत्ते के हाथ से तब हटा लेते हैं जब डंडा उसके मुँह में होता है, और कहते हैं, "गुड बॉय, इसे छोड़ दो।"
- परिणाम: AI सीखता है कि वह अलग-अलग बिंदुओं पर रुक सकता है और फिर भी इनाम पा सकता है। वह सीखता है कि जल्दी रुकना एक वैध रणनीति है, कोई गलती नहीं।
B. "गोल्डिलॉक्स" रिवॉर्ड सिस्टम (Goldilocks Reward System)
पुराने समय में, AI को केवल सही होने के लिए पुरस्कृत किया जाता था। अब, JET एक दूसरा नियम जोड़ता है: "सही बनो, लेकिन संक्षिप्त रहो।"
- उपमा: कल्पना कीजिए कि एक प्रतियोगिता है जहाँ आपको एक पहेली सुलझानी है।
- पुराना नियम: जो भी इसे सुलझा लेगा वह जीत जाएगा, चाहे इसमें कितना भी समय लगे।
- JET नियम: जो भी इसे सुलझा लेगा वह जीतेगा, लेकिन यदि आप इसे 10 मिनट में सुलझाते हैं, तो आपको गोल्ड मेडल मिलता है। यदि आप इसे 1 घंटे में सुलझाते हैं, तो आपको केवल भागीदारी का रिबन मिलता है। यदि आप इसे 5 मिनट में सुलझाते हैं, तो आपको एक सुपर गोल्ड मेडल मिलता है।
- सावधानी: AI को "संक्षिप्तता का बोनस" तभी मिलता है जब उत्तर वास्तव में सही हो। यह AI को समय बचाने के लिए जल्दी से तुक्का लगाने से रोकता है।
4. परिणाम: स्मार्ट और तेज़
प्रयोगों ने दिखाया कि JET एक गेम-चेंजर है:
- कम सोचना, अधिक काम: कठिन गणितीय समस्याओं पर, AI ने अपने आउटपुट की लंबाई में लगभग 50% की कमी की (शब्दों की संख्या आधी कर दी!)।
- बेहतर सटीकता: आश्चर्यजनक रूप से, "ओवरथिंकिंग" को रोककर, AI ने वास्तव में अधिक प्रश्न सही हल किए। क्यों? क्योंकि लंबी विचार श्रृंखलाएं अक्सर नई गलतियाँ पैदा करती हैं। जल्दी रुककर, AI ने बाद के चरणों में गलतियाँ करने से खुद को बचा लिया।
- सामान्यीकरण (Generalization): यह तकनीक न केवल गणित, बल्कि विज्ञान, तर्क और यहाँ तक कि सामान्य ज्ञान के सवालों पर भी काम करती है।
बड़ी तस्वीर (The Big Picture)
JET को AI को दक्षता (efficiency) की कला सिखाने के रूप में देखें। यह एक ऐसे छात्र के बीच का अंतर है जो बहुविकल्पीय प्रश्न का उत्तर देने के लिए उपन्यास लिखता है और उस छात्र के बीच का अंतर है जो जानता है कि उसे क्या कहना है और वह इसे स्पष्ट रूप से कहता है।
Large Reasoning Models को "ज़रूरत भर सोचना" सिखाकर, हम उन्हें कम बुद्धिमान नहीं बना रहे हैं; हम उन्हें अधिक स्मार्ट, तेज़ और चलाने में सस्ता बना रहे हैं। यह पर्यावरण के लिए एक जीत है (कम ऊर्जा का उपयोग), जेब के लिए एक जीत है (कम कंप्यूटिंग लागत), और उपयोगकर्ता के लिए एक जीत है (तेज़ उत्तर)।
संक्षेप में: AI ने आखिरकार सीख लिया है कि कभी-कभी, किसी समस्या को हल करने का सबसे अच्छा तरीका बहुत अधिक सोचने से पहले ही रुक जाना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।