Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills
Socratic-SWE एक क्लोज्ड-लूप सेल्फ-इवोल्यूशन फ्रेमवर्क पेश करता है जो एक एजेंट के ऐतिहासिक समाधान ट्रैसेस को संरचित कौशलों में परिवर्तित करता है ताकि लक्षित, सत्यापन योग्य मरम्मत कार्य उत्पन्न किए जा सकें, जिससे निरंतर सुधार सक्षम होता है और निश्चित उत्परिवर्तन प्रक्रियाओं पर निर्भर किए बिना SWE बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को टूटे हुए सॉफ़्टवेयर को ठीक करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आपको रोबोट के लिए हज़ारों विशिष्ट "होमवर्क असाइनमेंट" लिखने होते हैं, उनके उत्तर खोजने होते हैं और फिर उन्हें ग्रेड देना होता है। यह महंगा है, धीमा है, और अक्सर होमवर्क रोबोट की वास्तविक कमजोरियों से मेल नहीं खाता है।
यह पेपर Socratic-SWE का परिचय देता है, जो इन कोडिंग रोबोट्स को प्रशिक्षित करने का एक नया तरीका है। एक शिक्षक द्वारा होमवर्क बांटने के बजाय, रोबोट अपनी गलतियों और सफलताओं का विश्लेषण करके खुद को सिखाता है, और उन्हें एक व्यक्तिगत अध्ययन मार्गदर्शिका (study guide) में बदल देता है।
यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:
1. पुराना तरीका: एक स्थिर पाठ्यपुस्तक (The Static Textbook)
कल्पत्वना कीजिए कि एक छात्र बढ़ईगिरी (carpentry) सीखने की कोशिश कर रहा है। पुराने तरीके में, एक शिक्षक उसे मरम्मत करने के लिए पहले से लिखे गए 1,000 ब्लूप्रिंट का एक ढेर देता है।
- समस्या: कुछ ब्लूप्रिंट बहुत आसान हैं (छात्र पहले से ही जानता है कि उन्हें कैसे ठीक करना है), और कुछ असंभव हैं (छात्र के पास अभी सही उपकरण नहीं हैं)। शिक्षक को यह नहीं पता होता कि छात्र इस समय किस चीज़ के साथ संघर्ष कर रहा है।
- परिणाम: छात्र अपना समय उन चीजों पर बर्बाद करता है जिन्हें वह पहले से जानता है या उन चीजों पर अटक जाता है जिन्हें वह हल नहीं कर सकता, और अंततः, वह सुधार करना बंद कर देता है।
2. नया तरीका: Socratic-SWE (स्व-शिक्षण प्रशिक्षु - The Self-Teaching Apprentice)
Socratic-SWE खेल बदल देता है। यह एक लूप (closed loop) बनाता है जहाँ रोबोट छात्र और शिक्षक दोनों की भूमिका निभाता है।
चरण 1: "ट्रेस" (वीडियो रीप्ले - The Trace)
हर बार जब रोबट एक बग (bug) को ठीक करने की कोशिश करता है, तो वह एक डिजिटल "पदचिह्न" छोड़ता है जिसे ट्रेस (trace) कहा जाता है। यह रोबोट की पूरी विचार प्रक्रिया के वीडियो रीप्ले की तरह है:
- उसने कहाँ देखा?
- उसने कौन सा कोड बदला?
- क्या टेस्ट पास हुआ या फेल?
- क्या उसने गलती से कुछ और तोड़ दिया?
अतीत में, शोधकर्ता केवल इन रीप्ले का उपयोग एक साधारण "पास" या "फेल" ग्रेड देने के लिए करते थे और फिर उस वीडियो को फेंक देते थे। Socratic-SWE कहता है, "रुको! चलो इस वीडियो को फिर से देखते हैं।"
चरण 2: "कौशल" को निचोड़ना (अध्ययन मार्गदर्शिका - Distilling Skills)
सिस्टम सभी रीप्ले को देखता है और पैटर्न खोजता है।
- यदि रोबोट विफल रहा: वह देखता है, "ओह, हर बार जब मैं तीन टैब खुले होने वाली फ़ाइल को ठीक करने की कोशिश करता हूँ, तो मैं पहला टैब सेव करना भूल जाता हूँ।"
- यदि रोबोट सफल रहा: वह देखता है, "जब मैं कोड एडिट करने से पहले एरर लॉग चेक करता हूँ, तो मैं आमतौर पर इसे सही कर लेता हूँ।"
यह इन पैटर्न को एक संरचित "एजेंट स्किल रजिस्ट्री" (Agent Skill Registry) में बदल देता है। इसे एक व्यक्तिगत "स्टडी गाइड" या "कोच की चीट शीट" के रूप में सोचें। यह स्पष्ट रूप से सूचीबद्ध करता है कि रोबोट किस चीज़ में बुरा है (जैसे, "साइड इफेक्ट्स की जांच करना न भूलें") और वह किस चीज़ में अच्छा है।
चरण 3: नया होमवर्क बनाना (कस्टम क्विज़ - Generating New Homework)
अब, रोबोट इस स्टडी गाइड का उपयोग करके नया होमवर्क बनाता है।
- रैंडम बग चुनने के बजाय, रोबोट पूछता है: "मेरी स्टडी गाइड के आधार पर, मैं 'मल्टी-फाइल एडिट्स' में बार-बार असफल हो रहा हूँ। चलिए मैं एक नया, कठिन बग बनाता हूँ जिसके लिए मुझे विशेष रूप से एक साथ तीन फ़ाइलों को एडिट करने की आवश्यकता हो।"
- यह सुनिश्चित करता है कि होमवर्क रोबोट की वर्तमान कमजोरियों के लिए पूरी तरह से लक्षित हो।
चरण 4: "वेरिफायर" गेटकीपर (The Verifier Gatekeeper)
रोबोट को नया होमवर्क देने से पहले, एक सख्त गेटकीपर इसकी जाँच करता है।
- क्या वास्तव में वह बग मौजूद है?
- क्या रोबोट वास्तव में इसे ठीक कर सकता है?
- क्या टेस्ट विश्वसनीय है?
यदि होमवर्क टूटा हुआ या असंभव है, तो इसे बाहर कर दिया जाता है। केवल उच्च-गुणवत्ता वाले, हल करने योग्य कार्य ही ट्रेनिंग पूल तक पहुँचते हैं।
"ग्रेडिएंट अलाइनमेंट" (द कंपास - The Gradient Alignment)
इसमें एक और चतुर ट्रिक है। सिस्टम केवल यह नहीं चाहता कि रोबोट कोई भी समस्या हल करे; यह चाहता है कि रोबोट सही चीजों में बेहतर बने।
- कल्पना कीजिए कि एक दिशा-सूचक यंत्र (compass) है। सिस्टम के पास एक "विश्वसनीय दिशा" (ज्ञात, उच्च-गुणवत्ता वाले कार्यों का एक सेट) है।
- जब रोबोट एक नया कार्य बनाता है, तो सिस्टम पूछता है: "क्या इस नए कार्य को हल करने से रोबोट हमारे विश्वसनीय कंपास की दिशा में आगे बढ़ता है?"
- यदि हाँ, तो कार्य को रखा जाता है। यदि नहीं, तो इसे हटा दिया जाता है। यह रोबोट को ऐसे "ट्रिक्स" सीखने से रोकता है जो केवल नकली समस्याओं पर काम करते हैं।
परिणाम: तेजी से स्मार्ट बनना (Getting Smarter Faster)
शोधकर्ताओं ने चार प्रमुख बेंचमार्क (कोडिंग एजेंटों के लिए फाइनल एग्जाम की तरह) पर इसका परीक्षण किया।
- बेसलाइन (The Baseline): एक मानक रोबोट जिसे फिक्स्ड डेटा पर प्रशिक्षित किया गया है।
- प्रतिस्पर्धा (The Competition): अन्य रोबोट जो इस विशिष्ट "स्किल रजिस्ट्री" पद्धति के बिना खुद को सिखाने की कोशिश करते हैं।
- Socratic-SWE: केवल तीन राउंड के स्व-शिक्षण के बाद, इसने सबसे कठिन टेस्ट (SWE-bench Verified) पर 50.4% स्कोर किया। यह अन्यों की तुलना में एक बड़ी छलांग थी, जो या तो अटक गए थे या बहुत धीरे-धीरे सुधार कर रहे थे।
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि Socratic-SWE यह साबित करता है कि आपको अंतहीन नया होमवर्क लिखने के लिए इंसान की ज़रूरत नहीं है। रोबोट के अपने इतिहास (ट्रेस) का उपयोग करके स्किल गाइड बनाने से, रोबोट अपना स्वयं का पाठ्यक्रम (curriculum) लगातार तैयार कर सकता है। यह रोबोट के पिछले असफलताओं को उसके भविष्य के ईंधन में बदल देता है, जिससे वह निरंतर मानव शिक्षकों की आवश्यकता के बिना विकसित और बेहतर हो सकता है।
संक्षेप में: यह एक ऐसे रोबोट की तरह है जो अपने गेम के रीप्ले देखता है, अपनी खुद की स्टडी गाइड लिखता है, अपने अभ्यास ड्रिल बनाता है, और फिर यह देखने के लिए टेस्ट देता है कि क्या उसने वास्तव में सुधार किया है। और यह साबित हुआ है कि यह स्व-कोचिंग विधि मानव द्वारा वर्कशीट बांटने से बेहतर काम करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।