From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
यह शोध पत्र SWE-ZERO से SWE-HERO को प्रस्तुत करता है, जो एक दो-चरणीय फाइन-ट्यूनिंग फ्रेमवर्क है जो बड़े पैमाने पर निष्पादन-मुक्त (execution-free) सिमेंटिक प्रशिक्षण को लक्षित निष्पादन-समर्थित (execution-backed) परिशोधन के साथ जोड़कर ओपन-वेट फ्रंटियर LLMs को अत्याधुनिक सॉफ्टवेयर इंजीनियरिंग एजेंटों में आसत (distill) करता है, जिससे SWE-bench Verified पर 62.2% रिज़ॉल्यूशन दर प्राप्त होती है और मजबूत बहुभाषी स्थानांतरणीयता (multilingual transferability) प्रदर्शित होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन प्रशिक्षु (apprentice) को एक विशाल, प्राचीन पुस्तकालय (सॉफ्टवेयर कोडबेस) की जटिल समस्याओं को ठीक करना सिखाने की कोशिश कर रहे हैं।
लंबे समय तक, इस प्रशिक्षु को सिखाने का एकमात्र तरीका उन्हें पुस्तकालय की एक भौतिक चाबी, औजारों का एक पूरा सेट देना और एक सख्त नियम देना था: "आप तब तक कुछ भी ठीक नहीं कर सकते जब तक आपने उसे आज़माया न हो, देखा न हो कि क्या वह टूट गया, और उस टूट-फूट को ठीक न कर लिया हो।"
आज के अधिकांश AI सॉफ्टवेयर इंजीनियर इसी तरह काम करते हैं। वे एक सुधार (fix) आज़माते हैं, कोड चलाते हैं, देखते हैं कि क्या वह क्रैश हो जाता है, और फिर से प्रयास करते हैं। हालांकि यह प्रभावी है, लेकिन यह अविश्वसनीय रूप से धीमा, महंगा और बहुत अधिक कंप्यूटर पावर की मांग करने वाला है (जैसे एक किताब का परीक्षण करने के लिए एक नया पुस्तकालय भवन किराए पर लेना)। यदि पुस्तकालय के पुराने और अजीब नियम हैं, तो वे प्रवेश करने में भी सक्षम नहीं हो पाते।
इस शोध पत्र के लेखकों ने, NVIDIA ने, एक अलग, अधिक स्मार्ट दृष्टिकोण अपनाने का निर्णय लिया। उन्होंने एक दो-चरणीय प्रशिक्षण कार्यक्रम बनाया जिसे SWE-ZERO से SWE-HERO कहा जाता है।
यहाँ इसका सरल विवरण दिया गया है:
चरण 1: SWE-ZERO (द "मेंटल जिम")
उपमा: कल्पना कीजिए कि एक शतरंज का ग्रैंडमास्टर जिसने कभी बोर्ड पर वास्तविक खेल नहीं खेला है, लेकिन उसने लाखों गेम बुक्स का अध्ययन किया है और अपने दिमाग में हर संभावित चाल की कल्पना कर सकता है।
- यह क्या है: AI को डेटा के एक विशाल भंडार (3,00,000 उदाहरणों) पर प्रशिक्षित किया जाता है जहाँ उसे कोड वास्तव में चलाने से वर्जित किया जाता है। वह केवल कोड को पढ़ सकता है और सोच सकता है।
- लक्ष्य: यह AI को सॉफ्टवेयर कैसे काम करता है, इसकी एक गहरी "मानसिक मॉडल" (mental model) बनाने के लिए मजबूर करता है। यह बिना समय और पैसा बर्बाद किए कोड के तर्क (logic) और संरचना को समझना सीखता है।
- लाभ: यह वैसा ही है जैसे एक वास्तुकार (architect) के सिद्धांत सीखने के लिए पहले से घर बनाने की आवश्यकता नहीं होती। यह तेज़, सस्ता है और AI को उन लाखों उदाहरणों से सीखने की अनुमति देता है जिन्हें स्थापित करना बहुत कठिन होता।
चरण 2: SWE-HERO (द "कंस्ट्रक्शन साइट")
उपमा: अब जब प्रशिक्षु एक मास्टर थ्योरिस्ट बन गया है, तो हम उसे औजारों के एक पूर्ण सेट और एक सुरक्षा निरीक्षक के साथ एक वास्तविक निर्माण स्थल पर ले जाते हैं।
- यह क्या है: AI अपने "मानसिक मॉडल" (चरण 1 से) को समस्याओं के एक छोटे, उच्च-गुणवत्ता वाले सेट (13,000 उदाहरणों) पर लागू करता है जहाँ इसे कोड चलाने, परीक्षण करने और यह देखने की अनुमति है कि क्या यह वास्तव में काम करता है।
- लक्ष्य: यह AI की अंतर्दृष्टि (intuition) को परिष्कृत करता है। यह अपने काम की दोबारा जांच करना, सॉफ्टवेयर बग्स की जटिल वास्तविकता को संभालना और यह सुनिश्चित करना सीखता है कि सुधार ठोस है।
- लाभ: यह चरण 1 की "अंतर्ज्ञान" (gut feeling) को एक कठोर, सत्यापित इंजीनियरिंग कौशल में बदल देता है।
यह एक बड़ी बात क्यों है?
1. यह एक "हीरो" अपग्रेड है:
शोध पत्र दिखाता है कि यह दो-चरणीय विधि ऐसे AI एजेंट बनाती है जो पिछले एजेंटों की तुलना में काफी बेहतर हैं। उनके सर्वश्रेष्ठ मॉडल, SWE-HERO-32B ने SWE-bench नामक एक प्रसिद्ध परीक्षण पर वास्तविक दुनिया के 62.2% सॉफ्टवेयर बग्स को हल किया। यह उनके आकार के ओपन-सोर्स मॉडल्स के लिए एक नया रिकॉर्ड है।
2. यह एक भाषा सीखने जैसा है:
सबसे आश्चर्यजनक बात यह है कि उन्होंने AI को लगभग पूरी तरह से Python कोड पर प्रशिक्षित किया। फिर भी, जब उन्होंने अन्य भाषाओं (जैसे JavaScript या Go) पर इसका परीक्षण किया, तो इसने अद्भुत प्रदर्शन किया (44.1% सफलता दर)।
- रूपक: यह वैसा ही है जैसे किसी को अंग्रेजी के व्याकरण और तर्क को इतनी अच्छी तरह से सिखाना कि वह बिना कभी विशेष रूप से अध्ययन किए अचानक फ्रेंच या स्पेनिश में पढ़ और लिख सके। AI ने केवल विशिष्ट शब्दों को नहीं, बल्कि तर्क की सार्वभौमिक भाषा को सीखा।
3. यह दुनिया (और क्लाउड) को बचाता है:
पारंपरिक तरीकों के लिए कोड का परीक्षण करने के लिए हजारों वर्चुअल कंप्यूटर (Docker कंटेनर) स्थापित करने की आवश्यकता होती है। यह एक ईंट का परीक्षण करने के लिए एक नया घर बनाने जैसा है।
- SWE-ZERO सीखने के चरण के दौरान इन महंगे "घरों" की आवश्यकता को समाप्त कर देता है। यह शोधकर्ताओं को बहुत बड़े AI मॉडल को बहुत तेज़ी से और सस्ते में प्रशिक्षित करने की अनुमति देता है।
मुख्य निष्कर्ष (The Bottom Line)
लेखकों ने महसूस किया कि आपको चीजों को ठीक करना सीखने के लिए उन्हें भौतिक रूप से तोड़ने की आवश्यकता नहीं है। पहले AI को एक इंजीनियर की तरह सोचना (SWE-ZERO) सिखाकर और फिर उसे एक इंजीनियर की तरह अभ्यास (SWE-HERO) करने देकर, उन्होंने एक ऐसी प्रणाली बनाई जो वर्तमान में उपलब्ध ओपन-सोर्स दुनिया में किसी भी अन्य चीज़ की तुलना में तेज़, सस्ती और स्मार्ट है।
वे अनिवार्य रूप से कह रहे हैं: "केवल कोड चलाएं नहीं; पहले कोड के पीछे की कहानी को समझें।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।