Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information
यह शोध पत्र ऑफ-कॉन्टेक्स्ट GRPO (OC-GRPO) को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो कठिन तर्क संबंधी समस्याओं पर लर्निंग क्लिफ्स (learning cliffs) को दूर करने के लिए प्रशिक्षण के दौरान विशेषाधिकार प्राप्त मार्गदर्शन (privileged guidance) का लाभ उठाता है और यह सुनिश्चित करने के लिए महत्व सुधार (importance correction) का उपयोग करता है कि मॉडल मूल अनिर्देशित उद्देश्य (unguided objective) के लिए अनुकूलित हो, जिसके परिणामस्वरूप गणितीय बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोट को कठिन गणित की पहेलियाँ हल करने के लिए प्रशिक्षित किया जा रहा है, और उसके साथ एक शिक्षक है जो तुरंत जांच सकता है कि रोबोट द्वारा दिया गया कोई भी उत्तर सही है या गलत। यह सेटअप, जिसमें एक शिक्षार्थी और एक स्वचालित निर्णायक होता है जो सही या गलत का स्पष्ट निर्णय देता है, जिसे AI शोधकर्ता "Reinforcement Learning with Verifiable Rewards" कहते हैं। रोबोट एक पहेली हल करने का प्रयास करता है, सही होने पर "थम्स अप" (इनाम) अर्जित करता है और अन्यथा "थम्स डाउन" (शून्य इनाम) प्राप्त करता है, और कई प्रयासों के बाद अधिक "थम्स अप" एकत्र करना सीखता है।
पेच यह है कि कुछ पहेलियाँ रोबोट की क्षमता से इतनी दूर होती हैं कि हर एक प्रयास विफल हो जाता है। जब हर प्रयास विफल हो जाता है, तो सभी निर्णय एक जैसे होते हैं, तुलना करने के लिए कुछ भी नहीं होता, और शिक्षक के पास काम करने के लिए कोई संकेत (signal) नहीं बचता। यह साइकिल चलाना सीखने जैसा है, जहाँ पेडल घुमाते ही आप गिर जाते हैं: बिना एक बार भी संतुलन महसूस किए, आगे बढ़ने के लिए कुछ भी आधार नहीं बचता। इसे "लर्निंग क्लिफ" (learning cliff) कहा जाता है।
इसका स्पष्ट समाधान एक "चीट शीट" (cheat sheet) है, यानी एक संकेत या हल के पहले कुछ चरण, ताकि रोबोट कम से कम कभी-कभार तो सफल हो सके। यह काम तो करता है, लेकिन एक अजीब सवाल खड़ा करता है: उस जीत के लिए रोबोट वास्तव में कितना श्रेय (credit) पाने का हकदार है जो उसे थमा दी गई थी?
यह शोध पत्र इस प्रश्न का उचित उत्तर देता है। यह पद्धति, Off-Context GRPO (OC-GRPO), एक सुधार लागू करती है जो यह पूछता है कि चीट शीट के बिना उस सटीक समाधान तक पहुँचने की रोबोट की कितनी संभावना थी। श्रेय कभी भी पूर्ण रूप से नहीं दिया जाता, उसका कुछ हिस्सा हमेशा संकेत (hint) का होता है, और कितना श्रेय बचता है यह इस पर निर्भर करता है कि रोबro पहले से ही कितना सक्षम था। एक रोबोट जो इसे अकेले हल करने के करीब था, वह अधिकांश श्रेय अपने पास रखता है, क्योंकि चीट शीट ने केवल उस क्षमता को उजागर किया जो पहले से ही वहां मौजूद थी। एक रोबोट जिसके पास वास्तव में कोई संभावना नहीं थी, वह लगभग कुछ भी नहीं रखता, क्योंकि चीट शीट ने कौशल को प्रकट करने के बजाय उसकी जगह ले ली थी। चीट शीट उस कौशल से प्रगति पैदा नहीं कर सकती जो वहां मौजूद ही नहीं है। गलतियाँ इसके विपरीत काम करती हैं: यदि आधा उत्तर सामने होने के बावजूद पहेली गलत होती है, तो यह एक साधारण गलती की तुलना में अधिक दंड (penalty) आकर्षित करती है, क्योंकि मदद के साथ विफल होना, बिना मदद के विफल होने की तुलना में अधिक गंभीर प्रमाण है। सबसे कठिन पहेलियों में, जहाँ बिना सहायता की क्षमता शून्य के करीब होती है, वास्तविक सीख उस बढ़े हुए दंड के माध्यम से आती है, न कि सहायता प्राप्त जीत के माध्यम से। रोबोट को वह करने से रोका जाता है जो वह स्पष्ट रूप से अभी तक नहीं कर सकता, बजाय इसके कि उसे केवल पढ़ने के लिए बधाई दी जाए।
इसका परिणाम यह है कि मदद के साथ अभ्यास करने के बावजूद, रोबोट का स्कोर हमेशा वास्तविक पहेली पर ही लगाया जाता है, न कि संकेत वाली पहेली पर।
मानक गणितीय बेंचमार्क पर, OC-GRPO ने औसत सटीकता को मानक प्रशिक्षण पद्धति की तुलना में 27.8% से बढ़ाकर 31.7% कर दिया, जो लगभग 13.8% की सापेक्ष वृद्धि है, और यह बिना किसी अतिरिक्त लागत के हुआ। यह सुधार छोटे मॉडलों के लिए सबसे अधिक महत्वपूर्ण है: वहां, पुराने संकेत-आधारित तरीके वास्तव में साधारण प्रशिक्षण से भी खराब प्रदर्शन करते हैं, क्योंकि एक कमजोर शिक्षार्थी संकेत वाली और बिना संकेत वाली पहेली के बीच के अंतर को नहीं समझ पाता, जबकि OC-GRPO परीक्षण किए गए हर आकार में अपनी बढ़त बनाए रखता है। व्यापक सबक यह है कि "विशेषाधिकार प्राप्त संकेत" (privileged hints) अन्वेषण (exploration) को निर्देशित करने का एक बेहतरीन तरीका हैं। बस श्रेय को ईमानदारी से आवंटित किया जाना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।