← नवीनतम पेपर
💻 computer science

Immersion in the GitHub Universe: Scaling Coding Agents to Mastery

यह शोध पत्र ScaleSWE को प्रस्तुत करता है, जो एक स्वचालित मल्टी-एजेंट सिस्टम है जो 6 मिलियन पुल रिक्वेस्ट से अब तक का सबसे बड़ा सत्यापित वास्तविक दुनिया का सॉफ्टवेयर इंजीनियरिंग डेटासेट तैयार करता है, जिसका उपयोग एक ऐसे एजेंट को प्रशिक्षित करने के लिए किया जाता है जो SWE Bench Verified पर 64% रिज़ॉल्यूशन दर प्राप्त करता है—जो कि बेस मॉडल की तुलना में लगभग तीन गुना सुधार है।

मूल लेखक: Jiale Zhao, Guoxin Chen, Fanzhe Meng, Minghao Li, Jie Chen, Hui Xu, Yongshuai Sun, Wayne Xin Zhao, Ruihua Song, Yuan Zhang, Peng Wang, Cheng Chen, Jirong Wen, Kai Jia

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiale Zhao, Guoxin Chen, Fanzhe Meng, Minghao Li, Jie Chen, Hui Xu, Yongshuai Sun, Wayne Xin Zhao, Ruihua Song, Yuan Zhang, Peng Wang, Cheng Chen, Jirong Wen, Kai Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मास्टर सॉफ्टवेयर इंजीनियर बनने के लिए सिखाना चाहते हैं। आप उसे केवल एक पाठ्यपुस्तक नहीं दे सकते; आपको उसे वास्तविक दुनिया के स्विमिंग पूल के गहरे पानी में झोंकना होगा और उसे करके सीखने देना होगा। लेकिन एक समस्या है: असली स्विमिंग पूल मिलना कठिन है, और उन्हें बनाना महंगा है।

यह शोध पत्र, जिसका शीर्षक है "Immersion in the GitHub Universe: Scaling Coding Agents to Mastery," एक विशाल, स्वचालित स्विमिंग पूल फैक्ट्री बनाने के बारे में है ताकि AI एजेंट वास्तविक दुनिया के सॉफ्टवेयर बग्स को ठीक करना सीख सकें।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल अवधारणाओं में विभाजित किया गया है।

1. समस्या: "डेटा की कमी" (The Data Famine)

वर्तमान में, AI कोडिंग असिस्टेंट (जैसे वे जो आपको कोड लिखने में मदद करते हैं) स्मार्ट तो हैं, लेकिन वे अभी तक मास्टर नहीं हुए हैं। क्यों? क्योंकि उन्होंने वास्तविक दुनिया की समस्याओं को हल करने के लिए पर्याप्त अनुभव नहीं देखा है।

अधिकांश मौजूदा प्रशिक्षण डेटा अभ्यास ड्रिल (practice drills) की तरह है:

  • बहुत सरल: "दो संख्याओं को जोड़ने के लिए एक फंक्शन लिखें।"
  • नकली: कंप्यूटर द्वारा बनाया गया, न कि वास्तविक मनुष्यों द्वारा।
  • अधूरा: वे AI को बताते हैं कि क्या ठीक करना है, लेकिन वे उसे यह साबित करने के लिए उपकरण (टेस्ट एनवायरनमेंट) नहीं देते कि उसने उसे ठीक कर दिया है।

वास्तविक सॉफ्टवेयर इंजीनियरिंग बिखरी हुई और जटिल होती है। इसमें जटिल वातावरण सेट करना, टूटी हुई डिपेंडेंसीज़ से निपटना और यह सुनिश्चित करने के लिए टेस्ट लिखना शामिल है कि कुछ और खराब न हो जाए। अब तक, इस तरह का "मेसी और असली" प्रशिक्षण डेटा बनाने के लिए मनुष्यों को इसे हाथ से करना पड़ता था, जो धीमा और महंगा था।

2. समाधान: "रोबोट फैक्ट्री" (Scale-SWE)

लेखकों ने Scale-SWE नामक एक प्रणाली बनाई है। इसे एक पूरी तरह से स्वचालित, सेल्फ-ड्राइविंग फैक्ट्री के रूप में समझें जो कच्चे इंटरनेट कोड को उच्च गुणवत्ता वाले प्रशिक्षण पाठों में बदल देती है।

प्रत्येक पाठ को मैन्युअल रूप से बनाने के लिए मनुष्यों का उपयोग करने के बजाय, उन्होंने तीन विशिष्ट AI एजेंटों की एक टीम बनाई जो एक "सैंडबॉक्स" (एक सुरक्षित, अलग डिजिटल कमरे जहाँ वे वास्तविक इंटरनेट को नुकसान पहुँचाए बिना चीजें तोड़ सकते हैं) में मिलकर काम करते हैं।

यहाँ फैक्ट्री के तीन कर्मचारी हैं:

  • द आर्किटेक्ट (एनवायरनमेंट बिल्डर एजेंट):

    • काम: जब आप कोई सॉफ्टवेयर डाउनलोड करते हैं, तो अक्सर यह इसलिए नहीं चलता क्योंकि इसमें विशिष्ट टूल्स या वर्ज़न की कमी होती है। आर्किटेक्ट स्वचालित रूप से एक कस्टम "कंटेनर" (एक डिजिटल शिपिंग बॉक्स की तरह) बनाता है जिसमें उस विशिष्ट सॉफ्टवेयर को चलाने के लिए आवश्यक सही टूल्स इंस्टॉल होते हैं।
    • उपमा: कल्पना कीजिए कि एक शेफ आपको केवल रेसिपी ही नहीं देता, बल्कि एक कस्टम किचन भी बनाता है जिसमें उस विशिष्ट व्यंजन को पकाने के लिए सटीक चूल्हा, बर्तन और सामग्रियां हों।
  • द इंस्पेक्टर (यूनिट-टेस्ट क्रिएटर एजेंट):

    • काम: हमें कैसे पता चलेगा कि AI ने बग को ठीक कर दिया है? हमें एक टेस्ट की आवश्यकता है। इंस्पेक्टर कोड परिवर्तन को देखता है और एक "पास/फेल" टेस्ट लिखता है। यह एक ऐसा टेस्ट बनाता है जो टूटे हुए कोड पर फेल होता है लेकिन ठीक किए गए कोड पर पास होता है।
    • उपमा: कल्पना कीजिए कि एक क्वालिटी कंट्रोल इंस्पेक्टर एक विशिष्ट चेकलिस्ट लिखता है। यदि उत्पाद टूटा हुआ है, तो चेकलिस्ट फेल हो जाती है। यदि उत्पाद ठीक हो गया है, तो चेकलिस्ट पास हो जाती है। AI को स्नातक होने के लिए इस चेकलिस्ट को पास करना होता है।
  • द स्टोरीटेलर (प्रॉब्लम स्टेटमेंट एजेंट):

    • काम: वास्तविक कोड परिवर्तन अक्सर अस्पष्ट विवरणों जैसे "Fixed bug" के साथ होते हैं। स्टोरीटेलर इसे एक स्पष्ट, मानव-पठनीय समस्या विवरण में फिर से लिखता है: "जब मैं बटन पर क्लिक करता हूँ, तो ऐप क्रैश हो जाता है।" यह सुनिश्चित करता है कि कहानी इंस्पेक्टर द्वारा लिखे गए टेस्ट से मेल खाती हो।
    • उपमा: एक अनुवादक जो एक रहस्यमय मैकेनिक के नोट ("इंजन की आवाज़, अजीब") को एक स्पष्ट ग्राहक शिकायत ("बाएं मुड़ते समय कार से रगड़ने की आवाज़ आती है") में बदल देता है।

3. पैमाना: "GitHub यूनिवर्स" की खोज (Mining the GitHub Universe)

फैक्ट्री ने केवल कुछ फाइलों को ही नहीं देखा। यह एक बड़े खजाने की खोज पर निकल पड़ी:

  • इसने 6 मिलियन पुल रिक्वेस्ट (कोड परिवर्तन) को स्कैन किया जो 5,200 विभिन्न वास्तविक-दुनिया के प्रोजेक्ट्स से थे।
  • इसने कचरे (ट्यूटोरियल, साधारण स्क्रिप्ट, टूटा हुआ कोड) को बाहर निकाल दिया।
  • इसने सफलतापूर्वक 100,000 सत्यापित, उच्च-गुणवत्ता वाले प्रशिक्षण उदाहरण बनाए।

यह अपने प्रकार का सबसे बड़ा डेटासेट है जो कभी बनाया गया है। यह 10 किताबों की एक छोटी लाइब्रेरी से जाने जैसा है और 100,000 टेक्स्टबुक वाली एक विशाल विश्वविद्यालय लाइब्रेरी तक पहुँचने जैसा है, जिनमें से सभी वास्तविक इंजीनियरों द्वारा लिखी गई हैं।

4. परिणाम: "सुपर-एजेंट"

एक बार जब उनके पास इन विशाल पाठों की लाइब्रेरी आ गई, तो उन्होंने इसका उपयोग एक नए AI मॉडल (Qwen नामक मॉडल पर आधारित) को प्रशिक्षित करने के लिए किया।

  • प्रशिक्षण से पहले: AI सबसे कठिन वास्तविक दुनिया की सॉफ्टवेयर समस्याओं में से लगभग 22% को हल कर सकता था।
  • प्रशिक्षण के बाद: AI उनमें से 64% को हल कर सकता था।

यह तीन गुना सुधार है। यह एक नौसिखिया प्रशिक्षु से एक अत्यधिक कुशल अनुभवी कर्मी के रूप में विकसित हुआ, केवल इसलिए क्योंकि इसके पास अधिक "वास्तविक-दुनिया" का अभ्यास था।

5. यह क्यों महत्वपूर्ण है

यह पेपर सिद्ध करता है कि डेटा की गुणवत्ता और मात्रा ही AI की महारत की कुंजी है।

  • "नकली" डेटा का अंत: उन्होंने दिखाया कि सिंथेटिक (नकली) डेटा वास्तविक डेटा जितना अच्छा नहीं है। वास्तविक बग अजीब और जटिल होते हैं; नकली बग बहुत सरल होते हैं।
  • स्वचालन ही भविष्य है: आप डेटा लिखने के लिए अधिक मनुष्यों को काम पर रखकर AI प्रशिक्षण को स्केल नहीं कर सकते। आपको डेटा उत्पन्न करने के लिए स्वचालित प्रणालियों (जैसे उनकी मल्टी-एजेंट फैक्ट्री) की आवश्यकता है।
  • कोडिंग का भविष्य: यह दृष्टिकोण हमें ऐसे AI एजेंट बनाने में मदद करता है जो वास्तव में उस सॉफ्टवेयर का रखरखाव और सुधार कर सकें जो हमारी दुनिया चलाता है, न कि केवल साधारण स्क्रिप्ट लिख सकें।

सारांश रूपक (Summary Metaphor)

कल्पना कीजिए कि आप एक पायलट को प्रशिक्षित करना चाहते हैं।

  • पुराना तरीका: आप उन्हें एक सिम्युलेटर देते हैं जो केवल आदर्श मौसम में और एक सीधे रनवे पर उड़ता है।
  • इस पेपर का तरीका: आप एक ऐसी मशीन बनाते हैं जो स्वचालित रूप से हजारों उड़ान सिमुलेशन उत्पन्न करती है जिसमें तूफान, इंजन की विफलता और जटिल हवाई अड्डे शामिल हैं, और फिर आप उन्हें उन सभी पर अभ्यास करने देते हैं।
  • परिणाम: "Scale-SWE" मशीन पर प्रशिक्षित पायलट किसी भी आपात स्थिति के लिए तैयार है, जबकि पुराना पायलट अभी भी रनवे पर फंसा हुआ है।

उन्होंने अनिवार्य रूप से सॉफ्टवेयर इंजीनियरों के लिए अंतिम फ्लाइट सिम्युलेटर बनाया है, और इसके परिणाम ऊंचाइयों को छू रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →