MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
यह शोध पत्र MURPHY को प्रस्तुत करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का एक मल्टी-टर्न विस्तार है, जो फीडबैक-कंडीशन्ड रोलआउट ट्रीज़ और रेट्रोस्पेक्टिव क्रेडिट असाइनमेंट का उपयोग करता है ताकि सफल सुधारों से पहले के सूचनात्मक प्रयासों तक पुरस्कारों को प्रसारित करके सेल्फ-करेक्टिंग कोड जनरेशन में महत्वपूर्ण सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल पहेली हल करना सिखा रहे हैं, जैसे कि कंप्यूटर प्रोग्राम लिखना।
पुराना तरीका ("वन-शॉट" की गलती)
परंपरागत रूप से, आप रोबोट से पहेली हल करने के लिए कहते। यदि वह गलत होता, तो आप शायद बस कहते, "फिर से कोशिश करो," और उसे शून्य से एक बिल्कुल नया समाधान खोजने के लिए छोड़ देते। या, अधिक उन्नत सेटअपों में, रोबोट अपनी गलती देखता और टेस्ट के दौरान ही उसे ठीक करने की कोशिश करता, लेकिन रोबोट वास्तव में भविष्य में गलतियों को बेहतर तरीके से सुधारने का तरीका नहीं सीख पाता। यह एक छात्र की तरह था जो एक परीक्षा दे रहा है, जिसे एक प्रश्न पर लाल "X" मिलता है, और फिर वह अगले टेस्ट से पहले उस सबक को तुरंत भूल जाता है।
वर्तमान "लर्निंग" विधियों के साथ समस्या
नई विधियाँ रोबोट को प्रयास करने, विफल होने, त्रुटि संदेश देखने और फिर से प्रयास करने की अनुमति देती हैं। यह काम करता है, लेकिन "शिक्षक" (प्रशिक्षण एल्गोरिदम) थोड़ा अनाड़ी है। यह पूरे प्रयास को एक एकल इकाई के रूप में मानता है।
- परिदृश्य: रोबोट एक समाधान आज़माता है, विफल होता है, और त्रुटि संदेश उसे बताता है कि वह क्यों विफल हुआ (उदाहरण के लिए, "आप ऋणात्मक संख्याओं को संभालना भूल गए")। रोबोट उस सुराग का उपयोग कोड को ठीक करने के लिए करता है और सफल हो जाता है।
- अनाड़ी शिक्षक: पुराना प्रशिक्षण तरीका कहता है, "शानदार काम, अंतिम सफलता के लिए बधाई!" लेकिन यह पहले विफल प्रयास को शून्य श्रेय देता है। यह महसूस नहीं कर पाता कि पहला विफल प्रयास वास्तव में उपयोगी था क्योंकि उसने समस्या को हल करने के लिए आवश्यक विशिष्ट सुराग प्रदान किया था। यह विफलता को समय की पूरी बर्बादी मानता है।
MURPHY से मिलिए: एक "स्मार्ट डिटेक्टिव" शिक्षक
यह शोध पत्र MURPHY को पेश करता है, जो इन रोबोट्स को प्रशिक्षित करने का एक नया तरीका है। MURPHY को एक जासूस के रूप में सोचें जो केवल अंत को नहीं, बल्कि पूरी कहानी को देखता है।
"ट्र्री ऑफ एटेम्पट्स" (प्रयासों का वृक्ष) बनाना: केवल एक प्रयास के बजाय, MURPHY रोबोट को शाखाएं बनाने की अनुमति देता है।
- शाखा A: रोबोट एक समाधान आज़माता है। वह विफल होता है।
- ट्विस्ट: MURPHY उस विफलता, त्रुटि संदेश और मूल प्रश्न को लेता है, और रोबोट से विशेष रूप से उस त्रुटि को ठीक करने के लिए फिर से प्रयास करने को कहता है।
- शाखा B: रोबोट त्रुटि के सुराग का उपयोग करके कोड को ठीक करता है और सफल होता है।
टेप को रिवाइंड करना (रेट्रोस्पेक्टिव क्रेडिट): यही असली जादू है। एक बार जब रोबोट शाखा B पर सफल हो जाता है, तो MURPHY पीछे जाकर समय में घूमता है। वह कहता है, "रुको! शाखा B इसलिए सफल हुई क्योंकि शाखा A ने हमें वह विशिष्ट त्रुटि सुराग दिया था। इसलिए, शाखा A भी श्रेय पाने की हकदार है!"
- यह एक जासूस की तरह है जो महसूस करता है कि संदिग्ध की शुरुआती गलती (उंगलियों के निशान छोड़ना) वास्तव में वह मुख्य सबूत थी जो गिरफ्तारी तक ले गई। उंगलियों का निशान एक "बुरा" कदम नहीं था; वह समाधान के लिए एक आवश्यक कदम था।
श्रेय देने के दो तरीके:
- MARS (आशावादी): यदि रोबोट के किसी भी फॉलो-अप प्रयास सफल होते हैं, तो MARS उस शुरुआती विफलता को पूर्ण श्रेय देता है जिसने श्रृंखला शुरू की थी। यह कहने जैसा है कि, "यदि आप अंततः खजाना ढूंढ लेते हैं, तो जब आप खो गए थे तब आपने जो नक्शा बनाया था वह मूल्यवान था।"
- MERS (यथार्थवादी): यह विधि औसत सफलता के आधार पर श्रेय देती है। यह थोड़ा अधिक सतर्क है, और श्रेय को फैला देता है।
मृत शाखाओं को काटना (प्रूनिंग): कभी-कभी, रोबंड इतने सारे बदलाव आज़माता है कि "वृक्ष" बहुत बड़ा और धीमा हो जाता है जिसे प्रोसेस करना मुश्किल हो। MURPHY के पास एक स्मार्ट "माली" टूल है। यह शाखाओं को देखता है और उन्हें काट देता है जो एक ही चीज़ कर रहे हैं (कुछ नया नहीं सीख रहे हैं)। यह उन शाखाओं को रखता है जो सबसे अधिक विविधता और सीखने की क्षमता दिखाते हैं, जिससे समय और कंप्यूटर पावर बचती है।
परिणाम
लेखकों ने दो अलग-अलग रोबोट "मस्तिष्क" (मॉडल्स) के साथ तीन अलग-अलग कोडिंग चुनौतियों पर इसका परीक्षण किया।
- निष्कर्ष: MURPHY ने रोबोट को अपने कोड को ठीक करने में काफी बेहतर बनाया।
- सही संतुलन: सुधार सबसे अधिक कठिन समस्याओं पर हुआ। आसान समस्याओं पर, रोबोट पहले से ही अच्छे थे। लेकिन कठिन समस्याओं पर जहाँ रोबोट को विफल होना, त्रुटि से सीखना और फिर से प्रयास करना ही था, MURPHY ने उन्हें पिछले तरीकों की तुलना में लगभग 6% अधिक बार सफल होने में मदद की।
संक्षेप में
MURPHY AI को सिखाता है कि विफलता डेटा है। यह विफल प्रयास को एक "बुरे" परिणाम के रूप में देखना बंद करता है और इसे एक "आवश्यक कदम" के रूप में मानना शुरू करता है यदि उस विफलता ने वह जानकारी प्रदान की जो अंततः सफल होने के लिए आवश्यक थी। यह AI को केवल अंतिम उत्तर के बजाय आत्म-सुधार की प्रक्रिया को महत्व देने के लिए पुनर्गठित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।