← नवीनतम पेपर
🤖 machine learning

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

यह शोध पत्र SWE Atlas प्रस्तुत करता है, जो एक नया बेंचमार्क सुइट है जिसे कोडबेस Q&A, टेस्ट राइटिंग और रिफैक्टरिंग जैसे कम प्रतिनिधित्व वाले पेशेवर वर्कफ़्लो पर कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो कार्यात्मक शुद्धता और सॉफ़्टवेयर इंजीनियरिंग गुणवत्ता दोनों का आकलन करके यह प्रकट करता है कि जबकि शीर्ष-स्तरीय मॉडल आगे हैं, एज केस (edge cases) को संभालने और सर्वोत्तम प्रथाओं का पालन करने में महत्वपूर्ण चुनौतियाँ बनी हुई हैं।

मूल लेखक: Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei
प्रकाशित 2026-05-12
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ SWE Atlas पेपर का विवरण दिया गया है, जिसे रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी तस्वीर: "पैच वर्कर्स" से "मास्टर आर्किटेक्ट्स" तक

कल्पना कीजिए कि आपने एक विशाल शहर (एक सॉफ्टवेयर कोडबेस) को बनाने और बनाए रखने में मदद करने के लिए अविश्वसनीय रूप से स्मार्ट, सुपर-फास्ट निर्माण रोबोटों (ये AI कोडिंग एजेंट हैं) की एक टीम को काम पर रखा है।

पिछले कुछ वर्षों से, हम इन रोबोटों का परीक्षण उन्हें सरल, विशिष्ट काम देकर कर रहे हैं: "इस टूटी हुई खिड़की को ठीक करो" या "यह नया दरवाज़ा लगाओ।" यदि रोबोट बिना फ्रेम को नुकसान पहुँचाए खिड़की ठीक कर देता है, तो हम उसे एक गोल्ड स्टार देते हैं। पिछले टेस्ट (जैसे SWE-Bench) यही करते थे। वे यह मापते थे कि क्या रोबोट चीज़ों को पैच (patch) कर सकता है।

SWE Atlas कहता है: "रुकिए। एक अच्छा निर्माण कार्यकर्ता होने का मतलब सिर्फ टूटी हुई खिड़कियों को ठीक करना नहीं है। इसका मतलब पूरे शहर को समझना, सुरक्षा नियमावली (manuals) लिखना और पुराने भवनों को फिर से डिज़ाइन करना भी है ताकि वे 10 साल में ढह न जाएँ।"

शोधकर्ताओं ने एक नया, कठिन टेस्ट बनाया जिसे SWE Atlas कहा जाता है, यह देखने के लिए कि क्या ये रोबोट प्रोफेशनल इंजीनियरों की तरह काम कर सकते हैं, न कि केवल पैच वर्कर्स की तरह।


तीन नई चुनौतियाँ (The "Atlas" Tasks)

केवल बग्स (bugs) को ठीक करने के बजाय, SWE Atlas रोबोटों को तीन प्रकार के पेशेवर काम देता है:

1. कोडबेस Q&A: "सिटी टूर गाइड"

  • पुराना तरीका: "यहाँ एक नक्शा है। मुझे बताओ कि लाइब्रेरी कहाँ है।" (रोबोट बस नक्शा पढ़ लेता है)।
  • SWE Atlas का तरीका: "मैं यहाँ नया हूँ। मुझे जानना है कि जब बारिश हो रही हो और पावर ग्रिड फेल हो रहा हो, तो ट्रैफिक लाइट कैसे व्यवहार करती है। मुझे सिर्फ एक नक्शा नहीं चाहिए; मैं चाहता हूँ कि आप कार चलाएं, लाइव ट्रैफिक लाइट को देखें, और मुझे सटीक रूप से बताएं कि चीजें खराब होने पर वास्तव में क्या होता है।"
  • चुनौती: रोबोट को वास्तव में सॉफ्टवेयर चलाना होगा, तनाव के तहत उसके संघर्ष को देखना होगा, और वास्तविक (live) व्यवहार को समझाना होगा। वह केवल कोड पढ़कर अनुमान नहीं लगा सकता।

2. टेस्ट राइटिंग: "सेफ्टी इंस्पेक्टर"

  • पुराना तरीका: "यह सुनिश्चित करने के लिए एक टेस्ट लिखें कि दरवाज़ा खुलता है।" (रोबोट एक ऐसा टेस्ट लिखता है जो यह जाँचता है कि दरवाज़ा खुलता है या नहीं)।
  • SWE Atlas का तरीका: "एक ऐसा टेस्ट लिखें जो दरवाज़े को तोड़ने की कोशिश करे। क्या होगा अगर कोई इसे तब खोलने की कोशिश करे जब यह लॉक हो? क्या होगा अगर कब्ज़े (hinges) जंग खा चुके हों? क्या होगा अगर तेज़ हवा चले?"
  • चुनौती: रोबोट को एक विरोधी (adversary) बनना होगा। उसे हर उस अजीब, 'एज-केस' (edge-case) परिदृश्य के बारे में सोचना होगा जो क्रैश का कारण बन सकता है। यदि रोबोट ऐसा टेस्ट लिखता है जो केवल "हैप्पी पाथ" (सब कुछ सही होने का रास्ता) की जाँच करता है, तो वह टेस्ट में फेल हो जाता है।

3. रिफैक्टरिंग (Refactoring): "रेनोवेशन एक्सपर्ट"

  • पुराना तरीका: "दीवार को नीला रंग दो।" (रोबोट रंग बदल देता है)।
  • SWE Atlas का तरीका: "यह कमरा अस्त-व्यस्त है। वायरिंग उलझी हुई है, प्लंबिंग गलत जगह पर है, और फर्नीचर दरवाजे को रोक रहा है। पूरे कमरे को फिर से व्यवस्थित करें ताकि यहाँ रहना आसान हो जाए, लेकिन फर्नीचर का एक भी टुकड़ा न हिलाएं और न ही कमरे के कामकाज को बदलें। साथ ही, हमारे सभी पुराने, टूटे हुए औजारों को फेंक दें जिनकी हमें ज़रूरत नहीं है।"
  • चुनौती: रोबोट को कोड को साफ (maintainable बनाना) करना होगा बिना गलती से किसी ऐसी चीज़ को तोड़े जो वर्तमान में काम कर रही है। यह वैसा ही है जैसे मरीज़ मैराथन दौड़ रहा हो और उसी दौरान हार्ट सर्जरी करना।

उन्होंने रोबोटों को कैसे ग्रेड किया (The "Rubric")

अतीत में, टेस्ट बहुविकल्पीय प्रश्न (multiple-choice quiz) की तरह थे: क्या कोड चला? हाँ/नहीं।

SWE Atlas एक शिक्षक के रूब्रिक (Teacher's Rubric) का उपयोग करता है। कल्पना कीजिए कि एक सख्त आर्ट टीचर छात्र की पेंटिंग को ग्रेड दे रहा है।

  • क्या आपने आकाश को पेंट किया? (हाँ/नहीं)
  • क्या आपने सही ब्रश स्ट्रोक का उपयोग किया? (हाँ/नहीं)
  • क्या आपने ब्रश फर्श पर छोड़ दिए? (हाँ/नहीं - यह एक "नेगेटिव रूब्रिक" है क्योंकि यह एक बुरी प्रथा है)।

शोधकर्ताओं ने एक दूसरे AI (एक "जज") का उपयोग किया जो रोबोट के काम को देखता था और इन विस्तृत बॉक्सों की जाँच करता था। उन्हें इन बातों की परवाह थी:

  • स्वच्छता (Cleanliness): क्या रोबोट ने पीछे "डेड कोड" (कचरा) छोड़ा?
  • संगठन (Organization): क्या नया कोड बाद में इंसान के पढ़ने के लिए आसान है?
  • पूर्णता (Completeness): क्या रोबोट ने किसी एज-केस (edge case) को छोड़ दिया?

उन्हें क्या मिला (परिणाम)

शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडल्स (जैसे GPT-5.4 और Opus 4.7) और कुछ ओपन-सोर्स मॉडल्स का परीक्षण किया। यहाँ निर्णय है:

  1. "पैच वर्कर्स" बेहतरीन हैं, लेकिन "इंजीनियर" संघर्ष कर रहे हैं:
    शीर्ष AI मॉडल साधारण बग्स को ठीक करने में उत्कृष्ट हैं (यानी "पैच" का काम)। लेकिन जब उन्हें पेशेवर इंजीनियरिंग (जैसे गहरा रिफैक्टरिंग या मजबूत टेस्ट लिखना) का जटिल काम करने के लिए कहा जाता है, तो उनके स्कोर काफी गिर जाते हैं।

  2. "निरंतरता" (Consistency) की समस्या:
    यदि आप एक शीर्ष रोबोट को 3 बार एक समस्या हल करने के लिए कहते हैं, तो हो सकता है कि वह एक बार सही करे और बाकी दो बार विफल हो जाए। वे अभी तक महत्वपूर्ण बुनियादी ढांचे (critical infrastructure) के भरोसे किए जाने लायक विश्वसनीय नहीं हैं।

  3. "एक्सप्लोरेशन" (Exploration) का अंतर:
    सबसे अच्छे रोबोट इसलिए सफल हुए क्योंकि उन्होंने केवल कोड पढ़ा नहीं; उन्होंने कोड चलाया। उन्होंने सॉफ्टवेयर सेटअप किया, उसे तोड़ा, उसे ठीक किया, और लॉग्स को देखा। जो रोबोट बिना चलाए केवल कोड "पढ़ते" रहे, वे "कोडबेस Q&A" कार्यों में विफल रहे।

  4. "हैप्पी पाथ" का जाल:
    टेस्ट लिखते समय, रोबोट अक्सर ऐसे टेस्ट लिखते थे जो केवल यह जाँचते थे कि चीजें सामान्य रूप से कैसे काम करती हैं। वे आपदाओं की जाँच करने वाले (एडवर्सरियल माइंडसेट वाले) टेस्ट लिखने में विफल रहे।

  5. ओपन बनाम क्लोज्ड मॉडल्स:
    सबसे शक्तिशाली, महंगे, "क्लोज्ड" मॉडल्स (बड़ी टेक कंपनियों के) ने फ्री, "ओपन" मॉडल्स की तुलना में बहुत बेहतर प्रदर्शन किया। ओपन मॉडल्स अक्सर जटिल, बहु-चरणीय कार्यों को संभालने के लिए बहुत भ्रमित थे।

मुख्य निष्कर्ष (The Bottom Line)

SWE Atlas एक चेतावनी है। यह हमें बताता है कि हालांकि AI कोड के छोटे टुकड़े लिखने या सरल त्रुटियों को ठीक करने में बहुत अच्छा हो रहा है, लेकिन यह अभी तक एक प्रोफेशनल सॉफ्टवेयर इंजीनियर बनने के लिए तैयार नहीं है।

यह अभी भी इनसे जूझ रहा है:

  • यह सोचना कि आगे क्या गलत हो सकता है।
  • काम करने वाली चीज़ों को तोड़े बिना बिखरे हुए कोड को साफ करना।
  • यह समझना कि एक सिस्टम वास्तविक दुनिया में (सिर्फ कागज़ पर नहीं) कैसे व्यवहार करता है।

पेपर निष्कर्ष निकालता है कि हमें केवल यह पूछना बंद करना चाहिए कि "क्या यह काम कर गया?" और यह पूछना शुरू करना चाहिए कि "क्या यह अच्छी इंजीनियरिंग है?" क्योंकि AI कोडिंग का भविष्य इसी पर निर्भर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →