← नवीनतम पेपर
🤖 AI

CODESKILL: Learning Self-Evolving Skills for Coding Agents

CODESKILL एक सुदृढीकरण अधिगम (reinforcement learning) आधारित ढांचा है जो कोडिंग एजेंट प्रक्षेप पथों (trajectories) से बहु-स्तर की प्रक्रियात्मक कौशलों (multi-granularity procedural skills) के एक संक्षिप्त बैंक को निकालने, विकसित करने और बनाए रखने के लिए सीखता है, जो मौजूदा प्रॉम्प्ट-आधारित या मेमोरी दृष्टिकोणों की तुलना में SWE-Bench Verified जैसे बेंचमार्क पर डाउनस्ट्रीम कार्य प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट सहायक को सॉफ़्टवेयर बग्स ठीक करना सिखा रहे हैं। हर बार जब रोबोट किसी समस्या को ठीक करने की कोशिश करता है, तो वह एक लंबी प्रक्रिया से गुजरता है: वह कोड को देखता है, एक कमांड आज़माता है, एक त्रुटि (error) देखता है, फिर से प्रयास करता है, और अंततः (उम्मीद है) उसे ठीक कर देता है। इस पूरी यात्रा को "ट्रैजेक्टरी" (trajectory) कहा जाता है।

समस्या यह है कि यदि आप रोबोट को उसके द्वारा की गई हर एक चीज़ का डायरी रखने के लिए छोड़ देते हैं, तो वह डायरी कागज़ के एक अव्यवस्थित, भारी ढेर में बदल जाएगी। इसमें से अधिकांश विवरण किसी एक विशेष बग के बारे में होंगे जो अगले बग के काम नहीं आएंगे।

CODESKILL एक नया सिस्टम है जिसे उस कागज़ के अव्यवस्थित ढेर को एक चिकने, व्यवस्थित निर्देश मैनुअल (instruction manual) में बदलने के लिए डिज़ाइन किया गया है जिसे रोबोट वास्तव में उपयोग कर सके।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: बहुत अधिक शोर, पर्याप्त संकेत की कमी

वर्तमान में, जब रोबोट अपने पिछले अनुभवों से सीखने की कोशिश करते हैं, तो वे अक्सर कठोर नियमों या निश्चित प्रॉम्प्ट्स (जैसे एक शिक्षक जो कहता है, "Y दिखने पर हमेशा X करो") पर निर्भर होते हैं। लेकिन सॉफ़्टवेयर इंजीनियरिंग जटिल है। कभी-कभी रोबोट सफलता संयोग से प्राप्त करता है, और कभी-कभी वह किसी अजीब कारण से विफल हो जाता है। यह बताना कठिन है कि क्या यह एक पुन: प्रयोज्य कौशल (reusable skill) है (जैसे "टूटे हुए इंटरनेट कनेक्शन को कैसे ठीक करें") बनाम केवल एक एकमुश्त घटना (one-time fluke) है (जैसे "इस विशिष्ट फ़ाइल में टाइपो को कैसे ठीक करें")।

मौजूदा तरीके एक ऐसे लाइब्रेरियन की तरह हैं जो किताबों को बिना व्यवस्थित किए फर्श पर ढेर लगा देता है। उन्हें नहीं पता कि अगली बार पढ़ने वाले के लिए कौन सी किताबें वास्तव में उपयोगी होंगी।

2. समाधान: "स्व-विकसित लाइब्रेरियन" (The Self-Evolving Librarian)

CODESKILL एक स्मार्ट लाइब्रेरियन की तरह कार्य करता है जो रोबोट के ज्ञान आधार (जिसे स्किल बैंक कहा जाता है) का प्रबंधन करता है। केवल कच्ची कहानियों को संग्रहीत करने के बजाय, यह:

  • कौशल निकालता है (Extracts Skills): यह रोबोट की पिछली यात्राओं को पढ़ता है और उनमें से "सुनहरे अंशों" को निकालता है—वे सामान्य नियम जो कई स्थितियों में लागू होते हैं।
  • कौशल विकसित करता है (Evolves Skills): यदि रोबोट एक कौशल आज़माता है और विफल हो जाता है, तो लाइब्रेरियन उस कौशल को केवल फेंक नहीं देता है। वह निर्देश मैनुअल को अपडेट करता है कि, "ओह, यह नियम काम करता है, जब तक कि आप यह विशिष्ट त्रुटि संदेश न देखें।"
  • लाइब्रेरी का रखरखाव करता है: यह लगातार लाइब्रेरी की जाँच करता रहता है। यदि दो किताबें एक ही बात कहती हैं, तो यह उन्हें मिला देता है। यदि कोई किताब बहुत अधिक विशिष्ट या बेकार है, तो यह उसे बाहर निकाल देता है। यह लाइब्रेरी को छोटा और कुशल बनाए रखता है।

3. यह कैसे सीखता है: "कोच और एथलीट"

CODESKILL का सबसे अनूठा हिस्सा यह है कि यह एक अच्छा लाइब्रेरियन बनने के लिए कैसे सीखता है। यह केवल अनुमान नहीं लगाता; इसे एक "फ्रीज़्ड" (frozen) एथलीट (कोडिंग रोबोट) से फीडबैक मिलता है।

  • एथलीट (The Athlete): यह कोडिंग रोबोट है जो वास्तविक समस्याओं को हल करता है। इसका मस्तिष्क नहीं बदलता; यह बस कार्यों को हल करने का प्रयास करता है।
  • कोच (CODESKILL): यह वह सिस्टम है जो कौशलों का प्रबंधन करता है।
  • प्रशिक्षण लूप (The Training Loop):
    1. कोच पिछले अनुभव के आधार पर एक नया नियम बनाता है।
    2. कोच इस नियम को एथलीट को देता है।
    3. परीक्षण: क्या एथलीट इस नए नियम के साथ समस्या को तेज़ी से या बेहतर तरीके से हल करता है?
    4. पुरस्कार (Reward): यदि एथलीट सफल होता है, तो कोच को उच्च स्कोर मिलता है। यदि एथलीट विफल होता है, तो कोच को कम स्कोर मिलता है।
    5. कोच इस स्कोर का उपयोग सीखता है: "ठीक है, मुझे अगली बार बेहतर नियम लिखने की आवश्यकता है।"

पेपर में इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा गया है। यह एक कुत्ते को प्रशिक्षित करने जैसा है: आप केवल कुत्ते को यह नहीं बताते कि क्या करना है; आप उसे सही होने पर इनाम देते हैं, ताकि वह उस व्यवहार को दोहराना सीख जाए जिससे उसे इनाम मिलता है।

4. दो प्रकार के कौशल

CODESKILL ज्ञान को दो प्रकार के निर्देशों में व्यवस्थित करता है, जैसे कि एक कुकबुक के दो भाग हों:

  • टास्क-लेवल स्किल्स (बड़ी तस्वीर): ये उच्च-स्तरीय रणनीतियाँ हैं। उदाहरण: "जब आप जावा बिल्ड फेल होते देखें, तो पहले अपना इंटरनेट कनेक्शन जांचें, फिर अपनी डिपेंडेंसीज़ (dependencies) की जाँच करें।"
  • इवेंट-ड्रिवन स्किल्स (त्वरित समाधान): ये विशिष्ट क्षणों के प्रति प्रतिक्रियाएँ हैं। उदाहरण: "यदि आप 'File Not Found' त्रुटि देखते हैं, तो तुरंत जाँचें कि क्या फ़ाइल पाथ में कोई टाइपो है।"

5. परिणाम: एक स्मार्ट, तेज़ रोबोट

शोधकर्ताओं ने CODESKILL का परीक्षण तीन अलग-अलग "परीक्षा कक्षों" (benchmarks) पर किया जहाँ कोडिंग रोबोट को वास्तविक दुनिया की सॉफ़्टवेयर समस्याओं को हल करना होता है।

  • बेसलाइन (The Baseline): एक रोबोट जिसके पास कोई निर्देश मैनुअल नहीं है (केवल कच्ची बुद्धिमत्ता)।
  • प्रतिस्पर्धा (The Competition): पुराने तरीकों (जैसे केवल डायरी पढ़ना या निश्चित प्रॉम्प्ट्स का उपयोग करना) का उपयोग करके पिछले कार्यों को याद रखने वाले रोबोट।
  • CODESKILL: स्व-विकसित स्किल लाइब्रेरी का उपयोग करने वाला रोबोट।

परिणाम:
CODESKILL के रोबोट ने अन्य सभी की तुलना में काफी अधिक समस्याओं को हल किया।

  • इसने बिना किसी कौशल के मुकाबले सफलता दर में लगभग 9.7% का सुधार किया।
  • इसने सबसे मजबूत मौजूदा "मेमोरी" विधियों को लगभग 4% से पीछे छोड़ दिया।
  • इसने समस्याओं को तेज़ी से भी हल किया, क्योंकि इसके पास पालन करने के लिए बेहतर निर्देश थे, जिससे यह समाधान तक पहुँचने के लिए कम कदम लेता है।

निचोड़ (The Bottom Line)

CODESKILL एक ऐसा फ्रेमवर्क है जो कोडिंग रोबोट को सीखना कैसे है, यह सिखाता है। केवल यह याद करने के बजाय कि क्या हुआ, यह उन अनुभवों को नियमों के एक संक्षिप्त, विकसित सेट में बदलने के लिए सीखता है। यह एक कोच की तरह कार्य करता है जो टीम के जीतने या हारने के आधार पर लगातार प्लेबुक को परिष्कृत करता है, यह सुनिश्चित करता है कि रोबोट को शून्य से पुन: प्रोग्राम किए बिना समय के साथ बेहतर और अधिक कुशल बनाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →