Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance
यह अनुभवजन्य अध्ययन 7,156 पुल रिक्वेस्ट का विश्लेषण करता है यह प्रकट करने के लिए कि जहाँ Devin स्वीकृति में एक अद्वितीय सकारात्मक अस्थायी रुझान दिखाता है, वहीं कार्य का प्रकार सफलता दरों को प्रभावित करने वाला प्रमुख कारक है, जिसमें OpenAI Codex विविध श्रेणियों में सबसे सुसंगत उच्च प्रदर्शन प्रदर्शित करता है, बावजूद इसके कि कोई भी एकल एजेंट सभी कार्य प्रकारों में उत्कृष्ट नहीं है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त निर्माण स्थल (construction site) के प्रबंधक हैं। मानव श्रमिकों के बजाय, आपके पास पाँच अलग-अलग AI रोबोट हैं (OpenAI Codex, GitHub Copilot, Devin, Cursor, और Claude Code) जो कोड लिख सकते हैं, बग्स ठीक कर सकते हैं और डॉक्यूमेंटेशन लिख सकते हैं। आपका लक्ष्य यह देखना है कि कौन सा रोबोट साइट निरीक्षकों (साइट इंस्पेक्टरों) से अपना काम पास करवाने में सबसे अच्छा है (जिसे "पुल रिक्वेस्ट एक्सेप्टेंस रेट" कहा जाता है)।
यह पेपर एक विस्तृत रिपोर्ट कार्ड की तरह है जो इन पाँचों रोबोटों की तुलना कई महीनों तक करता है। यहाँ उन्होंने क्या पाया, जिसे सरल भाषा में समझाया गया है:
1. "काम का प्रकार" रोबोट से अधिक महत्वपूर्ण है
सबसे बड़ा आश्चर्य यह नहीं था कि कौन सा रोबोट सबसे तेज़ था, बल्कि यह था कि वे किस तरह का काम कर रहे थे।
- उपमा: कल्पना कीजिए कि आप एक रोबोट से "कविता लिखने" के लिए कहते हैं बनाम "एक पुल बनाने" के लिए। कविता लिखना आमतौर पर स्वीकृत कराना आसान होता है बजाय एक पुल बनाने के।
- निष्कर्ष: पेपर में पाया गया कि कार्य का प्रकार सबसे महत्वपूर्ण कारक है।
- जब रोबotों को डॉक्यूमेंटेशन (जैसे मैनुअल या कमेंट्स लिखना) करने के लिए कहा गया, तो उन्हें 82% बार स्वीकृति मिली।
- जब उन्हें नए फीचर्स बनाने के लिए कहा गया (जैसे घर में एक नया कमरा जोड़ना), तो उन्हें केवल 66% बार स्वीकृति मिली।
- सबक: यदि आप किसी रोबोट को केवल उसके समग्र स्कोर से आंकते हैं, तो आप धोखा खा सकते हैं। एक ऐसा रोबोट जो ज्यादातर आसान "कविता लिखने" वाले कार्य करता है, वह सुपरस्टार लग सकता है, भले ही वह "पुल बनाने" में बहुत खराब हो।
2. कोई भी एक रोबोट हर श्रेणी में नहीं जीतता
हर चीज़ के लिए कोई एक "सर्वश्रेष्ठ रोबोट" नहीं है। प्रत्येक के पास एक विशिष्ट सुपरपावर है।
- OpenAI Codex: यह एक भरोसेमंद ऑल-राउंडर है। इसने लगभग हर प्रकार के काम में लगातार अच्छा प्रदर्शन किया, और इसका स्कोर कभी भी बहुत नीचे नहीं गिरा।
- Claude Code: यह डॉक्यूमेंटेशन विशेषज्ञ है। यह मैनुअल लिखने और नए फीचर्स बनाने में सर्वश्रेष्ठ था, लेकिन हमें सावधान रहना होगा क्योंकि इस अध्ययन में इसने अन्य बहुत कम कार्य किए।
- Cursor: यह बग फिक्सर (Bug Fixer) है। जब बात टूटी हुई चीजों को ठीक करने की आई, तो यह शीर्ष प्रदर्शन करने वाला रहा।
- Devin: इस रोबोट ने धीमी शुरुआत की लेकिन समय के साथ बेहतर हुआ। यह एकमात्र ऐसा रोबोट था जिसने सप्ताह दर सप्ताह सुधार का स्पष्ट रुझान दिखाया, जो लगभग 60% स्वीकृति से बढ़कर 80% तक पहुँच गया।
3. समय चीजें बदल देता है (लेकिन सभी के लिए नहीं)
शोधकर्ताओं ने यह देखने के लिए महीनों तक इन रोबोटों को देखा कि क्या वे सीखते हैं या सुधार करते हैं।
- उपमा: इसे एक छात्र की तरह समझें जो हर सप्ताह परीक्षा देता है।
- Devin उस छात्र की तरह है जो कड़ी मेहनत करता है और हर सप्ताह उच्च अंक प्राप्त करता है।
- बाकी अन्य उन छात्रों की तरह हैं जो पहले से ही बुद्धिमान हैं; वे ऊंचे स्तर से शुरू करते हैं और ऊंचे स्तर पर ही रहते हैं, लेकिन वे समय के साथ बहुत अधिक सुधार नहीं दिखाते। वे बस निरंतर बने रहते हैं।
4. "ग्लोबल स्कोर" भ्रामक क्यों है
पेपर चेतावनी देता है कि किसी रोबोट के एकल "औसत स्कोर" को न देखें।
- उपमा: कल्पना कीजिए कि दो शेफ हैं। शेफ A केवल साधारण सलाद बनाता है (जिसे हर कोई पसंद करता है)। शेफ B केवल जटिल, मसालेदार स्टू (stew) बनाता है (जिसे सही बनाना कठिन होता है)। यदि आप केवल "औसत ग्राहक रेटिंग" देखते हैं, तो शेफ A बेहतर लग सकता है। लेकिन इसका मतलब यह नहीं है कि शेफ A एक बेहतर शेफ है; इसका मतलब सिर्फ यह है कि उन्हें आसान सामग्री दी गई थी।
- निष्कर्ष: शोधकर्ताओं को एक निष्पक्ष तुलना करने के लिए रोबोटों को काम के प्रकार के आधार पर अलग करना पड़ा। एक बार जब उन्होंने ऐसा किया, तो उन्होंने पाया कि काम के प्रकार के आधार पर "सर्वश्रेष्ठ" रोबोट बदल जाता था, चाहे वह बग ठीक करना हो, टेस्ट लिखना हो, या डॉक्यूमेंट अपडेट करना हो।
सारांश
यदि आप एक AI कोडिंग असिस्टेंट किराए पर लेना चाहते हैं, तो केवल यह न पूछें, "कौन सबसे अच्छा है?"
- यदि आपको बग फिक्स (bug fixes) की आवश्यकता है, तो Cursor या OpenAI Codex को देखें।
- यदि आपको नए फीचर्स या डॉक्यूमेंटेशन की आवश्यकता है, तो Claude Code या OpenAI Codex आपके लिए सबसे अच्छा विकल्प हो सकते हैं।
- यदि आप एक ऐसा रोबोट चाहते हैं जो समय के साथ सीखता और सुधरता हुआ प्रतीत हो, तो Devin वह है जिस पर नज़र रखनी चाहिए।
मुख्य बात यह है कि संदर्भ (context) ही सर्वोपरि है। आप किसी उपकरण को बिना यह जाने नहीं आंक सकते कि उसे वास्तव में क्या काम करने के लिए कहा जा रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।