Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification
यह शोध पत्र लेस नॉइज़ सैंपलिंग फ्रेमवर्क (LENS) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण है जो पॉलिसी ऑप्टिमाइज़ेशन को निर्देशित करने के लिए प्रॉम्प्ट्स से हस्तक्षेप करने वाले टोकन्स की पहचान करता है और उन्हें हटाता है, जिससे GRPO जैसी मौजूदा विधियों की तुलना में जटिल कार्यों पर LLM रीजनिंग की दक्षता, प्रदर्शन और अभिसरण गति (convergence speed) में उल्लेखनीय सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बुद्धिमान लेकिन आसानी से विचलित होने वाले छात्र (AI) को जटिल गणित की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। आप उन्हें एक वर्कशीट (प्रॉम्प्ट) देते हैं और कहते हैं, "इसे हल करने की कोशिश करो। यदि तुम इसे सही कर लेते हो, तो तुम्हें एक गोल्ड स्टार मिलेगा। यदि तुम गलत करते हो, तो तुम्हें कुछ नहीं मिलेगा।"
Reinforcement Learning with Verifiable Rewards (RLVR) इसी तरह काम करता है। AI कई अलग-अलग समाधानों (जिन्हें "rollouts" कहा जाता है) को आज़माता है। यदि उसे गोल्ड स्टार मिलता है, तो वह सीखता है। यदि उसे कुछ नहीं मिलता, तो वह कुछ नहीं सीख पाता।
समस्या: कमरे में "शोर" (The "Noise" in the Room)
पेपर का तर्क है कि AI अक्सर इसलिए विफल नहीं होता क्योंकि गणित बहुत कठिन है, बल्कि इसलिए होता है क्योंकि वर्कशीट में कुछ भटकाने वाले शब्द होते हैं।
इसे ऐसे समझें: आप छात्र से पूछते हैं, "2+2 हल करो, लेकिन इस बात को अनदेखा करो कि आसमान हरा है और यूनिकोर्न (एक काल्पनिक जीव) मौजूद हैं।"
- गणित (2+2) आसान है।
- लेकिन छात्र यूनिकोर्न और हरे आसमान के बारे में अजीब अतिरिक्त वाक्यों से भ्रमित हो जाता है। वह विचलित हो जाता है, घबरा जाता है, और गलत उत्तर दे देता है।
AI की दुनिया में, इन अजीब अतिरिक्त शब्दों को "Interference Tokens" कहा जाता है। ये निर्देश का वह छोटा हिस्सा हैं जो मॉडल को भ्रमित करते हैं, जिससे वह उन समस्याओं में भी विफल हो जाता है जिन्हें वह हल कर सकता था।
चूंकि AI इन टोकन से बार-बार विचलित होता रहता है, इसलिए उसे शायद ही कभी "गोल्ड स्टार" मिलता है। गोल्ड स्टार के बिना, शिक्षक (ट्रेनिंग एल्गोरिदम) AI को कुछ भी नहीं सिखा पाता, और पूरी प्रक्रिया रुक जाती है।
पुराने तरीके (और वे क्यों बेकार हैं)
पिछले प्रयास इन्हें ठीक करने के प्रयासों की तरह थे:
- छात्र को 1 बात के बजाय 100 वर्कशीट देना: "शायद अगर तुम पर्याप्त बार कोशिश करोगे, तो तुम भाग्यशाली हो जाओगे!" (यह महंगा और धीमा है)।
- कठिन वर्कशीट्स को फेंक देना: "आइए हम उसे यूनिकोर्न वाली समस्याएं देना बंद कर दें।" (यह छात्र को वास्तविक दुनिया में विकर्षणों को संभालने के लिए सीखने से रोकता है)।
नया समाधान: LENS (Less Noise, More Voice)
लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे LENS कहा जाता है। LENS को एक सुपर-स्मार्ट संपादक (Editor) के रूप में सोचें जो छात्र को दो चतुर चरणों में सीखने में मदद करता है:
चरण 1: "क्लीन रूम" अभ्यास (The "Clean Room" Practice)
सबसे पहले, संपादक भ्रमित करने वाली वर्कशीट को देखता है। वे "Interference Tokens" (यूनिकॉर्न वाले वाक्य) की पहचान करते हैं और उन्हें अस्थायी रूप से मिटा देते हैं।
- परिणाम: अब छात्र के सामने एक साफ, सरल "2+2" की समस्या है। वह इसे तुरंत हल करता है और एक गोल्ड स्टार प्राप्त करता है।
- अंतर्दृष्टि: पेपर ने पाया कि केवल थोड़े से शब्दों (5% से कम) को हटाने से एक असफल प्रयास 20% से अधिक बार एक सफल प्रयास में बदल जाता है!
चरण 2: "मेंटल जिम" ट्रांसफर (The "Mental Gym" Transfer)
यही असली जादू है। AI केवल साफ समस्या को हल करना नहीं सीखता है।
- संपादक कहता है: "ठीक है, तुमने साफ संस्करण को पूरी तरह से हल कर लिया है। अब, मूल बिखरी हुई (messy) वर्कशीट के साथ वापस जाओ जिसमें यूनिकोर्न हैं।"
- AI "क्लीन रूम" की सफलता से मिले आत्मविश्वास और तर्क का उपयोग बिखरी हुई (messy) वर्शन से निपटने के लिए करता है। यह शोर को अनदेखा करना और गणित पर ध्यान केंद्रित करना सीखता है।
यह एक मुक्केबाज को प्रशिक्षित करने जैसा है। पहले, आप उसे बिना किसी व्याकुलता के एक शांत जिम में अभ्यास करने देते हैं (क्लीन रूम)। एक बार जब वह चालों में महारत हासिल कर लेता है, तो आप उसे एक शोर-शराबे वाले, अराजक अखाड़े में डालते हैं और कहते हैं, "याद रखो कि तुमने शांत जिम में कैसे मूव किया था? यहाँ भी वैसा ही करो, और भीड़ को अनदेखा करो।"
यह क्यों मायने रखता है
- तेजी से सीखना: AI विकर्षणों पर समय बर्बाद करना बंद कर देता है। वह बहुत तेजी से सीखता है (1.6x की गति वृद्धि)।
- बेहतर परिणाम: AI कठिन समस्याओं को हल करने में बेहतर होता है क्योंकि वह शोर से बचने के बजाय उसे फिल्टर करना सीखता है।
- सस्ता: आपको कंप्यूटर को लंबे समय तक चलाने या उतनी बिजली का उपयोग करने की आवश्यकता नहीं है क्योंकि AI बिना किसी दिशा के घूम नहीं रहा है।
निष्कर्ष (The Bottom Line)
पेपर यह खोजता है कि AI अक्सर इसलिए विफल होता है क्योंकि प्रॉम्प्ट में कुछ "बुरे सेब" (भ्रमित करने वाले शब्द) होते हैं, न कि इसलिए कि कार्य असंभव है। LENS AI को उन बुरे सेबों को पहचानने, उन्हें मानसिक रूप से हटाने, समाधान सीखने और फिर उस सबक को बिखरी हुई, वास्तविक दुनिया के निर्देशों पर लागू करने के लिए प्रशिक्षित करता है।
यह AI को शोर को अनसुना करना सिखाने के बारे में है ताकि वह अपनी आवाज़ (अपने तर्क) को स्पष्ट रूप से सुन सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।