Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
यह शोध पत्र मल्टी-टोकन पॉलिसी ग्रेडिएंट ऑप्टिमाइज़ेशन (MPO) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो K क्रमिक टोकन के अनुक्रमों को एकीकृत अर्थपूर्ण क्रियाओं (unified semantic actions) के रूप में मानता है ताकि जटिल तर्क संबंधी कार्यों के ब्लॉक-स्तरीय संरचना के साथ पॉलिसी ग्रेडिएंट अनुकूलन को बेहतर ढंग से संरेखित किया जा सके, जो गणितीय और कोडिंग बेंचमार्क पर मानक टोकन-स्तरीय विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत ही शाब्दिक (literal) रोबोट को कहानी लिखना या गणित की समस्या हल करना सिखा रहे हैं।
पुराना तरीका: "एक-कदम" वाला रोबोट (The "One-Step" Robot)
वर्तमान में, अधिकांश AI प्रशिक्षण विधियाँ (जैसे PPO) रोबोट को एक बार में एक शब्द सिखाती हैं।
- उपमा: कल्पना कीजिए कि आप एक बच्चे को लेगो (Lego) का किला बनाना सिखा रहे हैं। पुराना तरीका कहता है, "एक ईंट उठाओ। बहुत अच्छे! अब अगली ईंट उठाओ। बहुत अच्छे!"
- समस्या: रोबट यह नहीं समझ पाता कि एक "दीवार" 10 ईंटों के एक साथ मिलकर काम करने से बनती है। वह हर एक ईंट को एक अलग निर्णय के रूप में देखता है। यदि रोबोट को "if x equals 5" वाक्यांश लिखना है, तो वह "if" को तो सही कर सकता है, लेकिन फिर "x equals 5" के तर्क (logic) को भूल सकता है क्योंकि वह केवल अगले शब्द को देख रहा है। यह एक वाक्य को केवल एक समय में एक अक्षर देखकर समझने की कोशिश करने जैसा है।
नया विचार: "ब्लॉक" वाला रोबोट (The "Block" Robot - MPO)
यह पेपर एक नई विधि प्रस्तावित करता है जिसे मल्टी-टोकन पॉलिसी ग्रेडिएंट ऑप्टिमाइजेशन (MPO) कहा जाता है। एक-एक शब्द देखने के बजाय, रोबोट शब्दों के एक समूह (एक "ब्लॉक") को विचार की एक एकल इकाई के रूप में देखना सीखता है।
- उपमा: अब आप बच्चे से कहते हैं, "एक ही चाल में पूरी दीवार का एक हिस्सा (लग लगभग 10 ईंटें) बनाओ।"
- यह कैसे काम करता है: जब रोबोट एक वेरिएबल को परिभाषित करने का निर्णय लेता है (जैसे
a = 5) या गणित का समीकरण लिखता है, तो वह पूरे वाक्यांशa = 5को एक एकल क्रिया (single action) के रूप में मानता है। वह केवल अगले अक्षर का अनुमान नहीं लगाता; वह पूरे अर्थपूर्ण "ब्लॉक" की योजना एक साथ बनाता है।
यह एक बड़ी बात क्यों है?
1. यह रोबोट की "टनल विजन" (सीमित दृष्टि) को रोकता है।
जटिल तर्क (जैसे गणित या कोडिंग) में, अर्थ अक्सर कई शब्दों तक फैला होता है।
- पुराना तरीका: रोबोट "if" देखता है और सोचता है, "ठीक है, आगे क्या आता है?" वह ऐसा शब्द चुन सकता है जो व्याकरण की दृष्टि से तो सही हो लेकिन समीकरण के तर्क (logic) को तोड़ दे।
- नया तरीका: रोबोट पूरे ब्लॉक "if a equals 5" को देखता है और सोचता है, "यह एक पूर्ण तार्किक चरण है।" यह सुनिश्चित करता है कि आगे बढ़ने से पहले पूरा समूह एक साथ अर्थपूर्ण हो।
2. यह "पिक्सेल" के बजाय "चंक्स" (chunks) में गाड़ी चलाना सीखने जैसा है।
कल्पना कीजिए कि आप कार चला रहे हैं।
- टोकन-लेवल (पुराना): आप सड़क को एक बार में एक पिक्सेल देखते हैं। "पिक्सेल लाल है। पिक्सेल लाल है। पिक्सेल हरा है।" आप यह मिस कर सकते हैं कि पूरा ट्रैफिक लाइट लाल है।
- ब्लॉक-लेवल (नया): आप पूरे ट्रैफिक लाइट को एक वस्तु के रूप में देखते हैं। आप "लाल बत्ती" देखते हैं और रुक जाते हैं। आप संकेत के इरादे (intent) को समझते हैं, न कि केवल व्यक्तिगत रंगों को।
3. यह रोबोट को गणित और कोडिंग में स्मार्ट बनाता है।
शोधकर्ताओं ने कठिन गणितीय समस्याओं (जैसे बीजगणित को हल करना) और कोडिंग कार्यों पर इसका परीक्षण किया।
- परिणाम: "ब्लॉक" वाले रोबोट (MPO) ने "एक-कदम" वाले रोबोट की तुलना में काफी बेहतर स्कोर प्राप्त किया। इसने कम गलतियाँ कीं क्योंकि इसने अलग-थलग रहकर अगले शब्द का अनुमान लगाने के बजाय अगला विचार (thought) प्लान करना शुरू कर दिया।
"सीक्रेट सॉस" (उन्होंने यह कैसे किया)
शोधकर्ताओं ने रोबोट को केवल बड़ा सोचना नहीं सिखाया; उन्होंने उसे MTP (मल्टी-टोकन प्रेडिक्शन) नामक एक विशेष प्रशिक्षण उपकरण दिया।
- इसे ऐसे समझें कि आपने रोबोट को ऐसे चश्मे दिए हैं जो उसे पहले कदम पर खड़े होकर भी 5 कदम आगे देख पाने की क्षमता देते हैं।
- प्रशिक्षण के दौरान, रोबोट एक बार में एक पूरे वाक्य के टुकड़े (chunk) की भविष्यवाणी करने का अभ्यास करता है। एक बार जब वह पूरी तस्वीर देखने में कुशल हो जाता है, तो वे उस कौशल का उपयोग उसके निर्णय लेने की क्षमता को सुधारने के लिए करते हैं।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर सुझाव देता है कि AI को वास्तव में तर्क करने में सक्षम बनाने के लिए, हमें इसे केवल अगले अक्षर की भविष्यवाणी करने वाली मशीन के रूप में मानना बंद करना होगा। इसके बजाय, हमें इसे अर्थपूर्ण टुकड़ों (meaningful chunks) में सोचने के लिए प्रशिक्षित करना चाहिए, ठीक वैसे ही जैसे हम इंसान समस्या सुलझाते समय करते हैं। हम शब्द-दर-शब्द नहीं सोचते; हम विचारों, समीकरणों और कोड ब्लॉक्स में सोचते हैं। MPO AI को भी यही करने की शिक्षा देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।