Learning to Reason Efficiently with Discounted Reinforcement Learning
यह शोध पत्र एक डिस्काउंटेड रिइन्फोर्समेंट लर्निंग दृष्टिकोण प्रस्तावित करता है जो तर्क संबंधी टोकन (reasoning tokens) को दंडित करता है ताकि बड़े रीजनिंग मॉडल्स को सटीकता से समझौता किए बिना संक्षिप्त चेन्स ऑफ थॉट (chains of thought) उत्पन्न करने के लिए प्रोत्साहित किया जा सके, जो प्रभावी रूप से रीजनिंग को एक स्टोकेस्टिक शॉर्टेस्ट पाथ समस्या के रूप में मानता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Learning to Reason Efficiently with Discounted Reinforcement Learning" पेपर का सरल भाषा में अनुवाद दिया गया है:
बड़ी समस्या: "ज़रूरत से ज़्यादा सोचने वाला" AI
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र (एक Large Reasoning Model, या LRM) है जो गणित के सवाल हल करने में माहिर है। हालाँकि, इस छात्र की एक बुरी आदत है: अंतिम उत्तर देने से पहले, वे अपनी विचार प्रक्रिया का एक विशाल, बिना सिर-पैर का निबंध लिखते हैं। वे कह सकते हैं, "ठीक है, मुझे इस बारे में सोचने दें... शायद मुझे यह आज़माना चाहिए... नहीं, रुको, यह गलत है... चलो फिर से कोशिश करता हूँ..."
हालाँकि यह "Chain of Thought" (सोच की श्रृंखला) उन्हें सही उत्तर पाने में मदद करती है, लेकिन इसमें बहुत समय लगता है और बहुत अधिक ऊर्जा (कंप्यूटेशनल लागत) खर्च होती है। यह पेपर एक सरल प्रश्न पूछता है: क्या छात्र को 'A' ग्रेड पाने के लिए 10 पन्नों का निबंध लिखने की ज़रूरत है, या क्या वे उसी 'A' को 2 पन्नों के सारांश के साथ भी प्राप्त कर सकते हैं?
कई लोग मानते हैं कि "ज़्यादा सोचना = बेहतर सटीकता।" यह पेपर इस विचार को चुनौती देता है। यह तर्क देता है कि आप अक्सर बहुत कम सोच (reasoning) के साथ भी उतनी ही उच्च सटीकता प्राप्त कर सकते हैं, बशर्ते आप AI को कुशलता (efficiency) को महत्व देना सिखाएं।
समाधान: "डिस्काउंटेड रिवॉर्ड" (छूट वाला इनाम) का तरीका
लेखक Discounted Reinforcement Learning नामक एक अवधारणा का उपयोग करके इन AI छात्रों को प्रशिक्षित करने का एक चतुर तरीका प्रस्तावित करते हैं।
उपमा: पिज्जा डिलीवरी ड्राइवर
कल्पना कीजिए कि आप एक पिज्जा डिलीवरी ड्राइवर को प्रशिक्षित कर रहे हैं।
- लक्ष्य: ग्राहक तक पिज्जा पहुँचाना और टिप (इनाम) प्राप्त करना।
- पुराना तरीका: आप ड्राइवर को कहते हैं, "बस पिज्जा पहुँचा दो। तुम चाहे जितने चक्कर लगाओ, जब तक तुम अंततः वहाँ पहुँच जाते हो।" ड्राइवर यह सुनिश्चित करने के लिए कि वह सही रास्ते पर है, ब्लॉक के चारों ओर पाँच बार घूम सकता है, जिससे पेट्रोल और समय बर्बाद होता है।
- नया तरीका (डिस्काउंटिंग): आप ड्राइवर से कहते हैं, "तुम्हें टिप मिलेगी, लेकिन तुम पिज्जा पहुँचाने में जितना अधिक समय लोगे, टिप उतनी ही घटती जाएगी।"
- यदि आप 10 मिनट में पहुँचाते हैं, तो आपको 100% टिप मिलेगी।
- यदि आप 20 मिनट में पहुँचाते हैं, तो टिप थोड़ी छोटी होगी।
- यदि आप 30 मिनट में पहुँचाते हैं, तो वह और भी छोटी होगी।
यह ड्राइवर के लिए सबसे छोटे सफल मार्ग को खोजने के लिए एक स्वाभाविक प्रोत्साहन पैदा करता है। वे अभी भी टिप (सटीकता) चाहते हैं, लेकिन अब उनके पास अनावश्यक चक्करों से बचने का एक मजबूत कारण है (छोटा तर्क/reasoning)।
यह पेपर में कैसे काम करता है
शोधकर्ताओं ने इस "घटती हुई टिप" के विचार को AI रीजनिंग पर लागू किया:
- सेटअप: उन्होंने AI की रीजनिंग प्रक्रिया को एक खेल की तरह माना। हर बार जब AI एक "सोचने वाला" टोकन (उसकी आंतरिक बातचीत में एक शब्द) उत्पन्न करता है, तो यह एक कदम उठाने जैसा होता है।
- डिस्काउंट (छूट): उन्होंने इनाम पर एक गणितीय "डिस्काउंट फैक्टर" (1 से थोड़ा कम संख्या) लागू किया।
- यदि AI समस्या को सही ढंग से हल करता है, तो उसे इनाम मिलता है।
- हालाँकि, उस इनाम को उसके द्वारा उपयोग किए गए प्रत्येक "सोचने वाले" टोकन के लिए डिस्काउंट फैक्टर से गुणा किया जाता है।
- महत्वपूर्ण विवरण: उन्होंने केवल रीजनिंग (तर्क) वाले टोकन को ही डिस्काउंट किया। उन्होंने फॉर्मेटिंग के लिए आवश्यक टोकन (जैसे "Answer:" लिखना या टैग्स बंद करना) को डिस्काउंट नहीं किया। यह सुनिश्चित करता है कि AI अपने विचारों में संक्षिप्त होने के लिए सीखता है, लेकिन उत्तर प्रस्तुत करने के नियमों का पालन करना भी जारी रखता है।
- परिणाम: AI सीख जाता है कि पूर्ण इनाम पाने का सबसे तेज़ तरीका सही उत्तर तक पहुँचने का सबसे छोटा रास्ता खोजना है।
सैद्धांतिक "जादू" (Blackwell Optimality)
पेपर यह सिद्ध करने के लिए कि यह क्यों काम करता है, कुछ भारी गणित का उपयोग करता है। वे Blackwell Optimality की अवधारणा पर भरोसा करते हैं।
इसे ऐसे समझें: कल्पना कीजिए कि आपके पास किसी गंतव्य तक पहुँचने के विभिन्न मार्गों की एक सूची है।
- कुछ मार्ग तेज़ लेकिन जोखिम भरे हैं (हो सकता है कि आप रास्ता भटक जाएँ)।
- कुछ सुरक्षित लेकिन अविश्वसनीय रूप से लंबे हैं।
- कुछ मार्ग सुरक्षित और छोटे दोनों हैं।
गणित यह सिद्ध करता है कि यदि आप अपनी "अधीरता" (डिस्काउंट) को बिल्कुल सही सेट करते हैं (1 के बहुत करीब, लेकिन ठीक 1 नहीं), तो AI स्वाभाविक रूप से उन मार्गों में से सबसे छोटा मार्ग चुनेगा जो सफलता की गारंटी देते हैं।
पेपर का दावा है कि कुछ सेटिंग्स की सीमा के लिए, यहाँ कोई समझौता (trade-off) नहीं है। आपको "छोटा और मूर्ख" या "लंबा और स्मार्ट" के बीच चुनाव करने की आवश्यकता नहीं है। आप "छोटा और स्मार्ट" पा सकते हैं। AI उस सबसे छोटे मार्ग को खोज लेता है जो अभी भी सही उत्तर की गारंटी देता है।
प्रयोगों ने क्या दिखाया
टीम ने कई गणितीय बेंचमार्क (जैसे GSM8K और MATH) पर विभिन्न AI मॉडल (जैसे Qwen और Llama) का उपयोग करके इसका परीक्षण किया।
- सटीकता (Accuracy): "डिस्काउंटेड" मॉडल्स ने "अन-डिस्काउंटेड" मॉडल्स के समान ही सही उत्तर दिए।
- लंबाई (Length): "डिस्काउंटेड" मॉडल्स ने काफी छोटे रीजनिंग चेन लिखे।
- एक परीक्षण में, बिना सटीकता खोए औसत रिस्पॉन्स की लंबाई 22% कम हो गई।
- दूसरे परीक्षण में, यह 13% कम हो गई।
कुछ मामलों में, छोटे मॉडल्स ने थोड़ा बेहतर प्रदर्शन भी किया, जिससे पता चलता है कि "फालतू बातों" को हटाने से वास्तव में AI को बेहतर ध्यान केंद्रित करने में मदद मिल सकती है।
सारांश
यह पेपर एक सरल लेकिन शक्तिशाली प्रशिक्षण तकनीक पेश करता है: AI को उसके द्वारा सोचे गए हर अतिरिक्त शब्द के लिए एक छोटा सा "टैक्स" चुकाने के लिए कहें।
ऐसा करके, AI एक "कुशल विचारक" (efficient thinker) बनना सीख जाता है। वह बिना वजह की बातें करना बंद कर देता है और सही उत्तर तक पहुँचने का सबसे सीधा रास्ता खोजने लगता है, जिससे उसकी बुद्धिमत्ता से समझौता किए बिना समय और कंप्यूटिंग शक्ति की बचत होती है। लेखक गणितीय रूप से सिद्ध करते हैं कि यह काम करता है और प्रयोगों के माध्यम से दिखाते हैं कि यह बिल्कुल वैसा ही करता है जैसा उन्होंने भविष्यवाणी की थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।