CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning
यह शोध पत्र CLEANER का प्रस्ताव करता है, जो त्रुटि-मुक्त प्रशिक्षण प्रक्षेपवक्र (training trajectories) उत्पन्न करने के लिए एक समानता-जागरूक अनुकूलन रोलबैक (Similarity-Aware Adaptive Rollback) तंत्र के माध्यम से एक मॉडल की अंतर्निहित स्व-सुधार क्षमताओं का लाभ उठाता है, जिससे क्रेडिट असाइनमेंट की समस्याओं का समाधान होता है और पैरामीटर-प्रतिबंधित एजेंटिक सुदृढीकरण शिक्षण (Agentic Reinforcement Learning) के प्रदर्शन और दक्षता में उल्लेखनीय वृद्धि होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक युवा प्रशिक्षु (एक छोटा AI मॉडल) को एक शक्तिशाली लेकिन जटिल उपकरण—कंप्यूटर कोड इंटरप्रेटर—का उपयोग करके जटिल पहेलियाँ हल करना सिखा रहे हैं। लक्ष्य यह है कि प्रशिक्षु कोड लिखे, उसे चलाए और सही उत्तर प्राप्त करे।
हालाँकि, एक समस्या है। क्योंकि प्रशिक्षु अभी सीख रहा है, वह बहुत सारी गलतियाँ करता है। वह ऐसा कोड लिखता है जो क्रैश हो जाता है, जिससे कंप्यूटर लंबे, भ्रमित करने वाले एरर मैसेज (error messages) उगलने लगता है। एक मानक प्रशिक्षण सेटअप में, प्रशिक्षु इन उलझे हुए एरर मैसेज को अपनी याददाश्त में रखता है, और उन्हें चरण-दर चरण ठीक करने की कोशिश करता है। अंततः, वे सही उत्तर तक पहुँच सकते हैं, लेकिन जिस रास्ते का उन्होंने सफर किया वह शोर, भ्रम और गलत रास्तों से भरा था।
यह "अव्यवस्थित रास्ता" (messy path) वास्तव में सीखने की प्रक्रिया को नुकसान पहुँचा रहा है। जब प्रशिक्षु अंततः सफल होता है, तो शिक्षक (ट्रेनिंग एल्गोरिदम) उसे पूरी यात्रा के लिए "अच्छा काम किया" का पुरस्कार देता है। यह अनुचित है क्योंकि यह उनकी गलतियों को भी उतनी ही अहमियत देता है जितनी कि उनकी सही सोच को। यह एक शेफ को प्रशंसा करने जैसा है जिसने सूप जला दिया लेकिन अंत में एक चम्मच से उसे ठीक कर लिया; शेफ यह सीख जाता है कि चीजें जलाना ठीक है जब तक कि वह बाद में उन्हें ठीक कर सके।
समाधान: CLEANER (एक "स्व-शुद्ध करने वाला" शेफ)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे CLEANER कहा जाता है। प्रशिक्षु को उनकी गलतियों के अव्यवस्थित इतिहास को रखने देने के बजाय, CLEANER एक स्मार्ट संपादक की तरह कार्य करता है जो प्रशिक्षु के सीखते समय कहानी को साफ करता है।
यह इस प्रकार काम करता है, एक रचनात्मक उपमा का उपयोग करते हुए:
1. "ओह!" का क्षण (The Trigger)
प्रशिक्षु कोड की एक पंक्ति लिखता है, उसे चलाता है, और कंप्यूटर चिल्लाता है "ERROR!" एक सामान्य कक्षा में, प्रशिक्षु बस इस त्रुटि को अपनी नोटबुक में जोड़ देगा और फिर से प्रयास करेगा।
2. "रिवाइंड" बटन (SAAR मैकेनिज्म)
CLEANER तुरंत हस्तक्षेप करता है। यह प्रक्रिया को रोकता है और प्रशिक्षु से पूछता है: "ठीक है, तुमने एक गलती की। क्या तुम इसे अभी ठीक कर सकते हो?" प्रशिक्षु फिर से प्रयास करता है और सफल होता है।
3. "संपादन" (Similarity-Aware Adaptive Rollback)
यही जादुई हिस्सा है। CLEANER गलती और उसके सुधार को देखकर यह तय करता है कि नोटबुक को कैसे साफ किया जाए:
- परिदृश्य A (टाइपिंग की गलतियाँ): यदि सुधार एक छोटा सा बदलाव है (जैसे एक छूटे हुए कॉमा को ठीक करना), तो CLEANER मानता है कि प्रशिक्षु की सोच वास्तव में अच्छी थी, बस एक टाइपिंग की गलती हुई थी। यह चुपचाप त्रुटि और सुधार को मिटा देता है, और उस अव्यवस्थ वाली पंक्ति को साफ, सही कोड से बदल देता है। नोटबुक अब एक सुचारू, सफल विचार प्रक्रिया दिखाती है।
- परिदृश्य B (तर्क संबंधी दोष): यदि सुधार मूल प्रयास से पूरी तरह से अलग है (जैसे यह महसूस करना कि पूरा दृष्टिकोण ही गलत था), तो CLEANER जानता है कि मूल सोच त्रुटिपूर्ण थी। वह पूरे गलत प्रयास और एरर मैसेज को मिटा देता है, और उसे तर्क की नई, सही पंक्ति के साथ बदल देता है।
4. परिणाम: एक "शुद्ध की गई" यात्रा (A "Purified" Trajectory)
जब तक प्रशिक्षण समाप्त होता है, प्रशिक्षु ने कभी भी अपने काम के अव्यवस्थित, त्रुटि-पूर्ण संस्करणों को "देखा" नहीं होता है। उन्होंने केवल "स्व-शुद्ध" कहानियों से सीखा है जहाँ उन्होंने पहली बार में ही समस्या को सही ढंग से हल किया था (या बिना कोई निशान छोड़े तुरंत ठीक कर लिया था)।
यह क्यों महत्वपूर्ण है
- कम शोर, अधिक सीखना: क्योंकि प्रशिक्षु अपनी गलतियों के इतिहास से विचलित नहीं होता है, वह सही तर्क को बहुत तेज़ी से सीखता है।
- दक्षता: पेपर का दावा है कि यह विधि अविश्वसनीय रूप से कुशल है। उन्होंने एक छोटे AI मॉडल को बहुत बड़े, अधिक महंगे मॉडलों के समान प्रदर्शन करने के लिए प्रशिक्षित किया, लेकिन उन्होंने यह सब केवल एक-तिहाई प्रशिक्षण चरणों का उपयोग करके किया। यह एक मास्टर शेफ के कौशल को एक साल के बजाय तीन महीने में हासिल करने जैसा है।
- बेहतर परिणाम: कठिन गणित और कोडिंग परीक्षणों (जैसे AIME और LiveCodeBench) पर, इस विधि ने मानक विधियों की तुलना में सटीकता में लगभग 3% से 6% का सुधार किया।
संक्षेप में
मानक प्रशिक्षण को व्हाइटबोर्ड पर मिटाए गए, धब्बेदार और भ्रमित करने वाले रेखाचित्रों से अभ्यास करने वाले छात्र के रूप में देखें। CLEANER एक जादुई इरेज़र की तरह है जो तुरंत धब्बों को साफ कर देता है, जिससे केवल समाधान के सटीक, स्पष्ट चरण बचते हैं। यह छात्र को केवल उस गलत तरीके को अपनाने के बजाय, जो उन्होंने पहले आज़माया था, सही तरीके से सोचने को आत्मसात करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।