Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents
यह शोध पत्र Open-SWE-Traces को प्रस्तुत करता है, जो वास्तविक दुनिया के पुल रिक्वेस्ट (pull requests) से प्राप्त 207,489 सॉफ्टवेयर इंजीनियरिंग एजेंट प्रक्षेपवक्रों (trajectories) का एक बड़े पैमाने का, बहुभाषी डेटासेट है, जो विविध SWE-bench मूल्यांकनों पर अत्याधुनिक परिणाम प्राप्त करने में सक्षम उच्च-प्रदर्शन वाले, ओपन-सोर्स मॉडलों के डिस्टिलेशन (distillation) को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सॉफ्टवेयर की एक विशाल लाइब्रेरी में टूटे हुए कोड को ठीक करना सिखाना चाहते हैं। समस्या यह है कि आप रोबोट को केवल यह नहीं बता सकते कि क्या ठीक करना है; आपको उसे यह सिखाना होगा कि समस्या के बारे में कैसे सोचना है, गलतियाँ कैसे करनी हैं, फिर से प्रयास कैसे करना है और अंततः सफल कैसे होना है। अब तक, रोबोटों को अच्छी तरह से सिखाने के लिए इस प्रक्रिया का पर्याप्त "फुटेज" (footage) उपलब्ध नहीं था, विशेष रूप से कई अलग-अलग प्रोग्रामिंग भाषाओं के लिए।
यह पेपर OPEN-SWE-TRACES पेश करता है, जो "फुटेज" की एक विशाल नई लाइब्रेरी है जिसे AI एजेंटों को सॉफ्टवेयर इंजीनियर बनने के लिए प्रशिक्षित करने हेतु डिज़ाइन किया गया है।
यहाँ उन्होंने क्या किया, इसका सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "प्रशिक्षण वीडियो" की कमी
सॉफ्टवेयर इंजीनियरिंग को एक जटिल खेल की तरह समझें। एक नए खिलाड़ी (AI) को प्रशिक्षित करने के लिए, आपको चालें सीखने के लिए पेशेवर खेलों के हजारों घंटों के "गेम टेप" देखने की आवश्यकता होती है।
- बाधा (The Bottleneck): पहले, शोधकर्ताओं के पास केवल कुछ घंटों का "गेम टेप" था। उनके पास विभिन्न भाषाओं (जैसे Python, Java, या C++) में बग्स को ठीक करने के विविध उदाहरणों की पर्याप्त संख्या नहीं थी ताकि एक वास्तव में स्मार्ट AI को प्रशिक्षित किया जा सके।
- समाधान: लेखकों ने OPEN-SWE-TRACES बनाया, जिसमें 207,489 रिकॉर्ड किए गए "खेल" शामिल हैं। ये वास्तविक दुनिया के परिदृश्य हैं जहाँ एक AI ने एक वास्तविक सॉफ्टवेयर प्रोजेक्ट में बग को ठीक करने का प्रयास किया।
2. प्रशिक्षण विधि: सोचने के दो मोड
यह पेपर AI को सिखाने का एक चतुर तरीका पेश करता है, जो इस बात से प्रेरित है कि इंसान कैसे काम करते हैं। वे इसे "Dual-Mode Distillation" कहते हैं।
- मोड A: "विचारक" (धीमा और सावधान - The Thinker)
कल्पना कीजिए कि एक शतरंज का ग्रैंडमास्टर किसी भी मोहरे को छूने से पहले हर संभावित चाल की गणना करने के लिए रुकता है। डेटासेट में ऐसे ट्रेस (traces) शामिल हैं जहाँ AI कार्य करने से पहले स्पष्ट रूप से "बोलकर सोचता है" (Chain-of-Thought)।- जादू: पेपर में पाया गया कि जब AI सोचने के लिए समय लेता है, तो वह वास्तव में समस्या को हल करने के लिए कुल कम चालें चलता है। यह ऐसा है जैसे किसी रास्ते की योजना बनाने के लिए एक क्षण लेना ताकि आप रास्ता न भटकें और चक्कर न काटने पड़ें। यह लंबे समय में समय और प्रयास बचाता है।
- मोड B: "कर्ता" (तेज़ और सीधा - The Doer)
कल्पना कीजिए कि एक मैकेनिक एक ढीले बोल्ट को देखता है और बिना किसी लंबी व्याख्या के तुरंत उसे कस देता है। डेटासेट में ऐसे ट्रेस भी शामिल हैं जहाँ AI बिना आंतरिक मोनोलॉग (internal monologue) के तेज़ी से कार्य करता है।- लक्ष्य: AI इन मोड के बीच स्विच करना सीखता है: कठिन समस्याओं के लिए "सोचें" (Think), और सरल कार्यों के लिए "करें" (Do)।
3. उन्होंने डेटासेट कैसे बनाया
उन्होंने केवल नकली समस्याएँ नहीं बनाईं। वे वास्तविक दुनिया में गए:
- स्रोत (The Source): उन्होंने ओपन-सोर्स प्रोजेक्ट्स से 20,000 वास्तविक पुल रिक्वेस्ट (Pull Requests) (वास्तविक मानव द्वारा किए गए कोड परिवर्तन) को देखा।
- अभिनेता (The Actors): उन्होंने दो शक्तिशाली AI "कोच" (MiniMax-M2.5 और Qwen3.5) का उपयोग किया जिन्होंने इन वास्तविक समस्याओं को देखा और सिम्युलेट किया कि एक एजेंट उन्हें कैसे हल करेगा।
- सुरक्षा जांच (The Safety Check): लाइब्रेरी में कोई रिकॉर्ड जोड़ने से पहले, उन्होंने एक सख्त सुरक्षा फ़िल्टर चलाया। उन्होंने सुनिश्चित किया कि AI उत्तर कुंजी (answer key) को देखकर "चीटिंग" न करे (git history को हैक करके) या नियमों को न तोड़े। यदि AI ने चीटिंग करने की कोशिश की, तो उस रिकॉर्डिंग को हटा दिया गया।
4. परिणाम: एक नया चैंपियन
इस विशाल लाइब्रेरी को एक छात्र AI (Qwen3-30B मॉडल पर आधारित) को खिलाने के बाद, उन्होंने इसे तीन प्रसिद्ध "परीक्षाओं" (benchmarks) पर परखा जो वास्तविक बग्स को ठीक करने की AI की क्षमता को मापते हैं:
- SWE-bench Verified: छात्र ने 61.7% समस्याओं को सही हल किया।
- SWE-bench Multilingual: छात्र ने कई अलग-अलग भाषाओं में 57.1% सफलता प्राप्त की।
- SWE-bench Pro: छात्र ने बहुत कठिन, पेशेवर स्तर के कार्यों पर 36.8% सफलता प्राप्त की।
यह एक बड़ी बात क्यों है?
यह पेपर अपने नए छात्र की तुलना अन्य शीर्ष-स्तरीय AI मॉडलों से करता है। इस विशिष्ट डेटासेट पर प्रशिक्षित नया मॉडल कई अन्य ओपन-सोर्स मॉडलों से बेहतर प्रदर्शन करता है और कुछ सबसे महंगे, "क्लोज्ड-सोर्स" सुपर-इंटेलिजेंस के बहुत करीब पहुँच जाता है।
5. मुख्य सीख
लेखकों ने यह देखने के लिए प्रयोग किए कि क्या चीज़ AI को स्मार्ट बनाती है:
- भाषा मायने रखती है: AI को केवल Python पर प्रशिक्षित करना ठीक था, लेकिन इसे नौ भाषाओं (Python, Go, Java, आदि) पर प्रशिक्षित करने से यह सभी प्रकार की समस्याओं को हल करने में काफी बेहतर हो गया, यहाँ तक कि Python वाली समस्याओं में भी। यह ऐसा है जैसे बारिश, बर्फ और रेत में गाड़ी चलाना सीखने से आप शहर में बेहतर ड्राइवर बन जाते हैं।
- असफलता भी अच्छी है: उन्होंने पाया कि उन रिकॉर्डिंग्स को शामिल करना जहाँ AI बग को ठीक करने में विफल रहा, वास्तव में मददगार था। इसने AI को यह सिखाया कि क्या नहीं करना है। यदि आप एक छात्र को केवल जीतने वाले खेल ही दिखाते हैं, तो वे हारने से बचने का तरीका नहीं सीख पाते।
- "सोचने" का ट्रेड-ऑफ: जबकि "सोचने" वाले ट्रेस ने AI को कठिन समस्याओं को हल करने में मदद की, AI ने मानक कार्यों पर तेज़ी से कार्य करने ("no-think") पर समग्र रूप से थोड़ा बेहतर प्रदर्शन किया। सबसे अच्छा दृष्टिकोण दोनों का मिश्रण है।
सारांश
यह पेपर सॉफ्टवेयर इंजीनियरिंग के "रीप्ले" की एक विशाल, उच्च-गुणवत्ता वाली लाइब्रेरी प्रस्तुत करता है जो AI एजेंटों को मानव डेवलपर्स की तरह सोचने और कार्य करने के लिए प्रशिक्षित करती है। कई प्रोग्रामिंग भाषाओं में "धीमी सोच" और "तेज़ क्रिया" के उदाहरणों के मिश्रण का उपयोग करके, उन्होंने एक ओपन-सोर्स AI बनाया जो अब वास्तविक दुनिया के सॉफ्टवेयर बग्स को ठीक करने में सर्वश्रेष्ठ में से एक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।