← नवीनतम पेपर
🤖 machine learning

DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models

DevBench एक यथार्थवादी, टेलीमेट्री-संचालित बेंचमार्क है जिसमें छह भाषाओं में 1,800 इंस्टेंस शामिल हैं जो पारिस्थितिक वैधता (ecological validity), संदूषण-मुक्त मूल्यांकन और व्यावहारिक मॉडल चयन एवं विकास के मार्गदर्शन के लिए विस्तृत नैदानिक अंतर्दृष्टि पर ध्यान केंद्रित करते हुए कोड पूर्णता कार्यों पर LLMs का मूल्यांकन करता है।

मूल लेखक: Pareesa Ameneh Golnari, Adarsh Kumarappan, Wen Wen, Xiaoyu Liu, Gabriel Ryan, Yuting Sun, Shengyu Fu, Elsie Nallipogu

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pareesa Ameneh Golnari, Adarsh Kumarappan, Wen Wen, Xiaoyu Liu, Gabriel Ryan, Yuting Sun, Shengyu Fu, Elsie Nallipogu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सॉफ्टवेयर लिखने में मदद के लिए एक नया प्रशिक्षु (apprentice) रख रहे हैं। आपके पास चुनने के लिए कई अलग-अलग "AI प्रशिक्षु" (लार्ज लैंग्वेज मॉडल्स) उपलब्ध हैं। कुछ प्रसिद्ध हैं, कुछ नए हैं, और कुछ छोटे और सस्ते हैं।

समस्या यह है कि हम उन्हें काम पर रखने के लिए जिन परीक्षणों का उपयोग करते हैं, वे एक बंद ट्रैक पर ड्राइविंग टेस्ट की तरह हैं। वे AI को एक विशिष्ट, बनावटी पहेली हल करने के लिए कहते हैं (जैसे "संख्याओं की एक सूची को सॉर्ट करने के लिए एक फंक्शन लिखें")। लेकिन वास्तविक दुनिया में, डेवलपर्स केवल पहेलियाँ हल नहीं करते; वे लगातार बाधित होते हैं, उन्हें विशिष्ट उपकरणों का उपयोग करना पड़ता है, उन्हें यह समझना होता है कि वे कोड क्यों लिख रहे हैं, और उन्हें अक्सर उस वाक्य को पूरा करना होता है जिसे किसी और ने शुरू किया है।

DevBench एक नया, वास्तविक "ड्राइविंग टेस्ट" है जिसे माइक्रोसॉफ्ट के शोधकर्ताओं द्वारा डिज़ाइन किया गया है ताकि यह देखा जा सके कि उनके AI प्रशिक्षु वास्तव में सॉफ्टवेयर विकास के वास्तविक, अव्यवस्थित ट्रैफिक में कैसा प्रदर्शन करते हैं।

यह कैसे काम करता है, इसे सरल उपमाओं के साथ यहाँ समझाया गया है:

1. स्रोत सामग्री: डेवलपर की आदतों का "ब्लैक बॉक्स"

अधिकांश पुराने परीक्षण इंसानों द्वारा अनुमान लगाए गए थे कि डेवलपर्स को क्या आवश्यकता हो सकती है। DevBench अलग है। यह टेलीमेट्री (डेटा लॉग्स) पर आधारित है।

इसे एक ट्रैफिक कैमरे की तरह समझें। शोधकर्ताओं ने एक अरब से अधिक वास्तविक क्षणों का अध्ययन किया जहाँ एक मानव डेवलपर ने AI से मदद मांगी, देखा कि AI ने क्या सुझाव दिया, और क्या मानव ने उसे स्वीकार किया, अस्वीकार किया, या उसमें बदलाव किया। उन्होंने वास्तविक कोड चुराया नहीं (वह गोपनीयता का उल्लंघन होगा); इसके बजाय, उन्होंने उस डेटा का उपयोग पैटर्न समझने के लिए किया।

  • उपमा: ड्राइवरों के व्यवहार का अनुमान लगाने के बजाय, उन्होंने लाखों घंटों के ट्रैफिक को देखा ताकि यह देख सकें कि लोग वास्तव में कहाँ फंसते हैं, वे कहाँ गलतियाँ करते हैं, और वे सबसे अधिक किन उपकरणों का उपयोग करते हैं।

2. परीक्षण: छह वास्तविक दुनिया के परिदृश्य

एक सामान्य परीक्षण के बजाय, DevBench मूल्यांकन को छह विशिष्ट "ड्राइविंग परिदृश्यों" में विभाजित करता है जो हर दिन एक डेवलपर के जीवन में होते हैं:

  • API उपयोग (टूलबॉक्स): क्या AI एक विशाल टूलबॉक्स से सही रिंच (wrench) चुन सकता है और उसका सही उपयोग कर सकता है? (जैसे, "इन सटीक नियमों का उपयोग करके इस विशिष्ट डेटाबेस से कनेक्ट करें।")
  • कोड का उद्देश्य (कहानी): क्या AI व्याकरण के बजाय कहानी के सार को समझ सकता है? यदि कोड बैंकिंग के बारे में है, तो AI जानता है कि आप वह पैसा नहीं निकाल सकते जो आपके पास नहीं है, भले ही सिंटैक्स एकदम सही हो।
  • कोड-से-भाषा (अनुवादक): क्या AI मानव निर्देशों के एक अव्यवस्थित पैराग्राफ को साफ कोड में बदल सकता है, या कोड के एक ब्लॉक को स्पष्ट व्याख्या में बदल सकता है?
  • लो कॉन्टेक्स्ट (एक त्वरित झलक): जब आप केवल एक छोटा सा संकेत देते हैं, तो क्या AI एक वाक्य को पूरा कर सकता है? (जैसे, जब आप केवल सेटअप सुनते हैं तो एक चुटकुले को पूरा करना)।
  • पैटर्न मिलान (लय): यदि एक डेवलपर एक विशिष्ट शैली में कोड की तीन लाइनें लिखता है, तो क्या AI बिना लय बिगाड़े उस लय को पूरी तरह से जारी रख सकता है?
  • सिंटैक्स पूर्णता (ग्रामर पुलिस): क्या AI प्रोग्रामिंग के कठिन विराम चिह्नों (ब्रैकेट, सेमीकोलन, इंडेंटेशन) को संभाल सकता है ताकि कोड क्रैश न हो?

3. जज: ग्रेड देने के तीन अलग तरीके

पुराने परीक्षण आमतौर पर केवल यह जांचते थे: "क्या कोड चला?" DevBench एक पूर्ण रिपोर्ट कार्ड देने के लिए तीन-जजों के पैनल का उपयोग करता है:

  1. कार्यात्मक जज (मैकेनिक): क्या कोड वास्तव में काम करता है? क्या यह टेस्ट पास करता है? (हाँ/नहीं)।
  2. समानता जज (कॉपी एडिटर): क्या AI का कोड वैसा ही दिखता और महसूस होता है जैसा एक मानव विशेषज्ञ लिखेगा? यह जांचता है कि यदि शब्द थोड़े अलग हों, तो भी क्या "वाइब" और संरचना मेल खाती है।
  3. LLM जज (सीनियर डेवलपर): एक उन्नत AI एक मानव समीक्षक के रूप में कार्य करता है। वह पूछता है: "क्या यह सहायक है? क्या यह संदर्भ में फिट बैठता है? क्या एक मानव वास्तव में इसका उपयोग करेगा?"

4. परिणाम: कौन जीता?

जब उन्होंने 9 शीर्ष AI मॉडल्स का परीक्षण किया:

  • विजेता: Claude 4 Sonnet और GPT-4o जैसे मॉडल्स ने बहुत अच्छा प्रदर्शन किया, लेकिन उनकी ताकत अलग-अलग थी। कुछ सख्त नियमों (सिंटैक्स) का पालन करने में बेहतरीन थे, जबकि अन्य "कहानी" (लॉजिक) को समझने में बेहतर थे।
  • आश्चर्य: कुछ मॉडल्स पैटर्न याद रखने में (जैसे एक डांस स्टेप को दोहराना) बहुत अच्छे थे, लेकिन जब उन्हें यह सोचने की आवश्यकता थी कि वे ऐसा क्यों कर रहे हैं, तो वे विफल रहे।
  • रियलिटी चेक: बेहतरीन मॉडल्स भी TypeScript (एक जटिल भाषा) और मानव भाषा एवं कोड के बीच अनुवाद करने में संघर्ष करते हैं। वे अभी भी केवल 'ऑटोकंप्लीट बटन' बनने के बजाय सच्चे साथी बनने की दिशा में सीख रहे हैं।

यह क्यों महत्वपूर्ण है

DevBench से पहले, एक AI कोडर चुनना ब्रोशर के आधार पर कार खरीदने जैसा था। आपको नहीं पता था कि वह गड्ढों या भारी बारिश को कैसे संभालता है।

DevBench वह टेस्ट ड्राइव है। यह कंपनियों और डेवलपर्स को बताता है:

  • "यदि आपको एक बड़े प्रोजेक्ट में बग ठीक करने की आवश्यकता है, तो मॉडल A का उपयोग करें।"
  • "यदि आपको डेटा के लिए त्वरित स्क्रिप्ट लिखने की आवश्यकता है, तो मॉडल B का उपयोग करें।"
  • "बैंकिंग ऐप्स के लिए मॉडल C का उपयोग न करें; यह लॉजिक को अच्छी तरह से नहीं समझता है।"

यह हमें यह पूछने से आगे ले जाता है कि "क्या यह AI एक पहेली हल कर सकता है?" से कि "क्या यह AI मेरे घर की छत गिरने दिए बिना घर बनाने में मेरी मदद कर सकता है?"

निचोड़

DevBench एक वास्तविक, डेटा-संचालित रिपोर्ट कार्ड है जो AI मॉडल्स को नकली परीक्षणों पर "चीटिंग" करने से रोकता है और उन्हें यह साबित करने के लिए मजबूर करता है कि वे वास्तविक सॉफ्टवेयर विकास की जटिल और रचनात्मक वास्तविकता को संभालने में सक्षम हैं। यह ऐसे AI की ओर एक कदम है जो केवल कोड नहीं लिखता, बल्कि ऐसा अच्छा कोड लिखता है जिस पर इंसान भरोसा कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →