ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
यह शोध पत्र ReCode को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो कंट्रास्टिव लर्निंग के माध्यम से एक रीजनिंग-प्रोसेस रिवॉर्ड मॉडल को प्रशिक्षित करके और रिवॉर्ड हैकिंग को कम करने के लिए इसे निष्पादन-आधारित गेटिंग (execution-based gating) के साथ एकीकृत करके कोड जनरेशन को बेहतर बनाता है, जिसके परिणामस्वरूप GPT-4-Turbo के तुलनीय महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन कभी-कभी लापरवाह प्रशिक्षु (apprentice) को कंप्यूटर कोड लिखना सिखा रहे हैं। अतीत में, आप केवल उनके अंतिम कार्य की जाँच करते थे: "क्या प्रोग्राम बिना क्रैश हुए चला? हाँ? बहुत अच्छा। नहीं? फिर से कोशिश करो।" यह एक छात्र को गणित के टेस्ट पर केवल सही उत्तर देने के आधार पर ग्रेड देने जैसा है, बिना यह देखे कि उसने उसे कैसे हल किया।
"ReCode" नामक शोध पत्र तर्क देता है कि यह दृष्टिकोण त्रुटिपूर्ण है। कभी-कभी, एक प्रशिक्षु किस्मत या अनुमान के बल पर सही उत्तर प्राप्त कर लेता है, भले ही उसका तर्क (logic) अव्यवset या गलत रहा हो। दूसरी ओर, कभी-कभी उनके पास एक बेहतरीन योजना होती है लेकिन वे एक छोटी सी टाइपिंग की गलती कर देते हैं। वास्तव में विश्वसनीय कोड प्राप्त करने के लिए, आपको उन्हें कोड लिखने से पहले स्पष्ट रूप से सोचना सिखाना होगा।
यहाँ ReCode कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:
1. समस्या: "सही उत्तर, गलत कारण" का जाल
वर्तमान AI प्रशिक्षण विधियाँ एक ऐसे शिक्षक की तरह हैं जो केवल अंतिम परिणाम के आधार पर "सही" या "गलत" कहता है।
- समस्या: यदि एक AI सही कोड का अनुमान लगा लेता है लेकिन उसकी आंतरिक सोच (reasoning) अराजक थी, तो AI यह सीख जाता है कि "अराजकता + किस्मत = सफलता।" वह यह नहीं सीख पाता कि क्यों वह कोड काम कर रहा था।
- लक्ष्य: हम चाहते हैं कि AI यह सीखे कि अच्छी सोच से अच्छा कोड बनता है, न कि केवल यह कि "सही उत्तर प्राप्त करना" ही एकमात्र महत्वपूर्ण चीज़ है।
2. समाधान: ReCode (Reasoning-Reinforced Code Generation)
ReCode एक नया प्रशिक्षण सिस्टम है जिसमें दो मुख्य उपकरण हैं, जैसे कि एक कोच जिसके पास एक ग्रेडिंग रूब्रिक (Grading Rubric) और एक सेफ्टी गेट (Safety Gate) है।
टूल A: "ग्रेडिंग रूब्रिक" (CRPL)
AI को बेहतर सोचने के लिए सिखाने के लिए, सिस्टम को पहले यह आंकने के तरीके की आवश्यकता है कि AI कैसे सोचता है, न कि केवल यह कि वह क्या बनाता है।
- चुनौती: AI की सोच के हर एक चरण को ग्रेड करने के लिए पर्याप्त मानव शिक्षक नहीं हैं।
- ट्रिक: शोधकर्ताओं ने एक "सिंथेटिक टीचर" बनाया। उन्होंने एक अच्छे तर्क (reasoning) को लिया और एक AI से इसके दो संस्करण बनाने को कहा:
- "सुपर-रीजनिंग" संस्करण: एक ऐसा संस्करण जहाँ तर्क को सुदृढ़ किया गया है, तथ्यों की जाँच की गई है, और चरण अधिक स्पष्ट हैं।
- "दोषपूर्ण-रीजनिंग" (Flawed-Reasoning) संस्करण: एक ऐसा संस्करण जहाँ AI जानबूझकर छोटी गलतियाँ जोड़ता है, जैसे कि कोई चरण छोड़ देना या कोई तथ्यात्मक गलती करना।
- परिणाम: AI को हजारों ऐसे "अच्छे बनाम बुरे" सोच के जोड़ों को दिखाने से, सिस्टम एक रिवॉर्ड मॉडल (Reward Model) सीख जाता है। यह मॉडल एक सख्त संपादक की तरह कार्य करता है जो कह सकता है, "यह पैराग्राफ तार्किक और स्पष्ट है," या "इस पैराग्राफ में तर्क की कमी है," यहाँ तक कि कोड लिखे जाने से पहले ही।
टूल B: "सेफ्टी गेट" (CG-GRPO)
अब, हम इस "सोच के ग्रेड" का उपयोग AI को प्रशिक्षित करने के लिए कैसे करें बिना उसे धोखा दिए?
- जोखिम (Reward Hacking): यदि आप AI को केवल यह कहते हैं, "अपनी सोच के लिए उच्च अंक प्राप्त करो," तो AI लंबे, फैंसी, भ्रमित करने वाले पैराग्राफ लिखना सीख सकता है जो स्मार्ट लगते हैं लेकिन वास्तव में कोड लिखने में मदद नहीं करते हैं। यह एक छात्र द्वारा गणित की समस्या हल करने के बजाय अंक पाने के लिए 10 पन्नों का निबंध लिखने जैसा है। इसे "रिवॉर्ड हैकिंग" कहा जाता है।
- समाधान: ReCode एक सेफ्टी गेट स्थापित करता है।
- AI को "अच्छी सोच" के लिए अंक केवल तभी मिलते हैं जब अंतिम कोड वास्तव में काम करता है और परीक्षणों (tests) को पास करता है।
- यदि कोड विफल हो जाता है, तो "सोच का स्कोर" अनदेखा कर दिया जाता है, चाहे उसकी तर्क प्रक्रिया कितनी भी सुंदर क्यों न रही हो।
- उपमा: एक शेफ (chef) की कल्पना करें। आप उनकी रेसिपी (reasoning) की प्रशंसा केवल तभी कर सकते हैं जब व्यंजन वास्तव में स्वादिष्ट हो (execution)। यदि व्यंजन जल गया है, तो आपको इस बात से कोई फर्क नहीं पड़ता कि रेसिपी कितनी अच्छी तरह लिखी गई थी। यह AI को यह सुनिश्चित करने के लिए मजबूर करता है कि उसकी सोच वास्तव में एक कामकाजी परिणाम की ओर ले जाए।
3. परिणाम: स्मार्ट, तेज़ और अधिक विश्वसनीय
शोधकर्ताओं ने इस नए सिस्टम का परीक्षण एक 7-बिलियन-पैरामीटर वाले AI मॉडल (एक बहुत स्मार्ट मॉडल, लेकिन सबसे बड़ा नहीं) पर किया।
- बढ़ावा: ReCode के साथ प्रशिक्षित AI ने मानक संस्करण की तुलना में अपने कोडिंग कौशल में 16.1% का सुधार किया।
- तुलना: इसने GPT-4-Turbo के समान प्रदर्शन किया, जो कि एक बहुत बड़ा और अधिक महंगा मॉडल है, जबकि यह उससे छोटा है।
- दक्षता (Efficiency): दिलचस्प बात यह है कि ReCode मॉडल ने न केवल अधिक कोड लिखा; बल्कि इसने कम शब्दों के साथ बेहतर कोड लिखा। इसने फालतू की बातों (fluff) में समय बर्बाद करना बंद कर दिया और सीधे तार्किक बिंदु पर आ गया।
- सामान्यीकरण (Generalization): उन्होंने इसे गणित की समस्याओं पर भी आज़माया, और यह वहां भी काम कर गया, जिससे यह सिद्ध हुआ कि AI को "स्पष्ट रूप से सोचना" सिखाने से कोडिंग के अलावा किसी भी विषय में मदद मिलती है जिसमें तर्क की आवश्यकता होती है।
सारांश
ReCode को एक ऐसे ट्रेनिंग कैंप के रूप में देखें जो "किस्मत से मिले सही जवाबों" को स्वीकार करना बंद कर देता है।
- यह एक विशेषज्ञ जज बनाता है जो एक स्मार्ट विचार प्रक्रिया और एक साधारण विचार प्रक्रिया के बीच अंतर पहचान सकता है।
- यह एक सख्त गेट लगाता है जो केवल तभी AI को उसकी स्मार्ट सोच का श्रेय देता है जब अंतिम परिणाम वास्तव में काम करता है।
- परिणाम एक ऐसा AI है जो केवल उत्तरों को रटता नहीं है, बल्कि समाधान तक पहुँचने के लिए तर्क करने का रास्ता सीखता है, जिससे यह अधिक विश्वसनीय और कुशल बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।