Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
यह शोध पत्र PRDBench प्रस्तुत करता है, जो संरचित आवश्यकताओं वाले 50 वास्तविक-विश्व पायथन प्रोजेक्ट्स का एक स्केलेबल बेंचमार्क है, और PRDJudge, जो एक विशेष रूप से फाइन-ट्यून किया गया मूल्यांकन मॉडल है जो 90% से अधिक मानव संरेखण (human alignment) प्राप्त करता है, जो सामूहिक रूप से मौजूदा कोड एजेंट बेंचमार्क की उच्च एनोटेशन लागत और मूल्यांकन संबंधी अशुद्धियों को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बॉस हैं जो AI सॉफ्टवेयर इंजीनियरों की एक टीम को काम पर रखना चाहते हैं। आप यह जानना चाहते हैं कि कौन केवल एक लाइन का कोड लिखने में नहीं, बल्कि पूरे एप्लिकेशन बनाने में सबसे बेहतर है।
समस्या यह है कि इन AI इंजीनियरों का परीक्षण करना अविश्वसनीय रूप से कठिन है। यहाँ इस पेपर के लेखकों ने इस समस्या को कैसे हल किया, इसे सरल भाषा में समझाया गया है।
1. समस्या: "ग्रेडिंग करने में कठिन" होमवर्क
वर्तमान में, AI कोडर्स का परीक्षण करना एक छात्र के फाइनल ईयर थीसिस को बिना किसी स्पष्ट रूब्रिक (मानदंड) के ग्रेड देने जैसा है।
- पुराना तरीका (बहुत महंगा): एक AI का परीक्षण करने के लिए, आपको आमतौर रूप से एक मानव विशेषज्ञ (जैसे कि एक पीएचडी प्रोफेसर) की आवश्यकता होती है जो हर एक फीचर के लिए एक विशिष्ट परीक्षण लिखे। इसमें बहुत समय लगता है और बहुत पैसा खर्च होता है। यह एक घर की हर ईंट की जांच करने के लिए एक अलग आर्किटेक्ट को काम पर रखने जैसा है।
- नया तरीका (बहुत अस्थिर): हाल ही में, लोगों ने काम को ग्रेड करने के लिए अन्य AI का उपयोग करने की कोशिश की (जिसे "एजेंट-एज़-ए-जज" कहा जाता है)। लेकिन ये सामान्य AI एक बुद्धिमान लेकिन विचलित छात्र की तरह हैं: वे अक्सर भ्रमित हो जाते हैं, मतिभ्रम (hallucinate) का शिकार होते हैं, या सूक्ष्म विवरणों को मिस कर देते हैं। वे अंतिम निर्णायक बनने के लिए पर्याप्त विश्वसनीय नहीं हैं।
2. समाधान: PRDBench (द "ब्लूप्रिंट" सिस्टम)
लेखकों ने एक नया परीक्षण मैदान बनाया जिसे PRDBench कहा जाता है। इसे एक विशाल निर्माण स्थल के रूप में सोचें जिसमें 50 अलग-अलग निर्माण परियोजनाएं (जैसे कि लॉजिस्टिक्स सेंटर, एक गेम, या एक डेटा टूल) हैं।
उन्होंने 50 पीएचडी विशेषज्ञों को काम पर रखे बिना इन परीक्षणों को कैसे बनाया:
उन्होंने एक चतुर "ह्यूमन-इन-द-लूप" असेंबली लाइन का उपयोग किया:
- आर्किटेक्ट (AI): एक अत्यंत बुद्धिमान AI ब्लूप्रिंट (जिसे प्रोडक्ट रिक्वायरमेंट डॉक्यूमेंट या PRD कहा जाता है) लिखता है। यह निर्देशों की सूची है: "एक ऐसा सिस्टम बनाएं जो वजन के आधार पर पैकेज को छाँट सके।"
- इंस्पेक्टर (मानव): बुनियादी कंप्यूटर ज्ञान वाला एक इंसान (जैसे कि एक कॉलेज ग्रेजुएट) केवल ब्लूप्रिंट की जांच करता है। वे कोड नहीं लिखते; वे बस कहते हैं, "क्या यह योजना समझ में आती है? क्या इसे बनाना संभव है?"
- बिल्डर (AI): एक अन्य AI मचान (कोड का ढांचा) और चेकलिस्ट (यह जांचने का तरीका कि यह कैसे काम करता है) बनाता है।
- लूप: यदि चेकलिस्ट गलत है, तो इंसान कहता है "इसे ठीक करो," और AI उसे ठीक करता है। वे इसे तब तक दोहराते हैं जब तक कि ब्लूप्रिंट और चेकलिस्ट एकदम सही न हो जाए।
परिणाम: उन्होंने विस्तृत ब्लूप्रिंट और चेकलिस्ट के साथ 50 वास्तविक दुनिया के प्रोजेक्ट बनाए, लेकिन इसमें मनुष्यों को केवल प्रति प्रोजेक्ट लगभग 8 घंटे का पर्यवेक्षण (supervision) करना पड़ा, जबकि इसमें हफ्तों लग सकते थे।
3. जज: PRDJudge (द "स्पेशलाइज्ड रेफरी")
अब जब उनके पास परीक्षण तैयार हैं, तो उन्हें AI इंजीनियरों को ग्रेड देने के लिए एक रेफरी की आवश्यकता है।
- समस्या: यदि आप एक सामान्य AI (जैसे कि एक मानक चैटबॉट) से एक जटिल प्रोजेक्ट को ग्रेड करने के लिए कहते हैं, तो वह अभिभूत (overwhelmed) हो सकता है। यह एक जनरल प्रैक्टिशनर से हार्ट सर्जरी करने के लिए कहने जैसा है।
- समाधान: उन्होंने एक विशेषज्ञ रेफरी प्रशिक्षित किया जिसे PRDJudge कहा जाता है।
- उन्होंने एक शक्तिशाली कोडिंग AI को लिया और उसे केवल इन विशिष्ट ब्लूप्रिंट्स को ग्रेड करने के लिए सिखाया।
- उन्होंने इसे "अच्छे कोड बनाम बुरे कोड" के हजारों उदाहरण दिखाए और अंतर को पहचानने का तरीका सिखाया।
- उपमा: PRDJudge को एक मास्टर कारपेंटर के रूप में सोचें जिसने विशेष रूप से एक प्रकार के घर का निरीक्षण करने के लिए 10 साल तक प्रशिक्षण लिया है। जब एक सामान्य AI किसी घर को देखता है और एक "डगमगाते फर्श" को देखता है, तो वह अनुमान लगा सकता है। लेकिन PRDJude जानता है कि वह फर्श क्यों डगमगा रहा है और सटीक स्कोर देता है।
परिणाम: PRDJudge, मानव विशेषज्ञों के साथ 90% बार सहमत होता है, जो किसी भी अन्य AI जज की तुलना में बहुत बेहतर है।
4. उन्होंने क्या पाया (द "रेस रिजल्ट्स")
उन्होंने यह देखने के लिए 12 अलग-अलग AI कोडिंग एजेंटों (कुछ मुफ्त, कुछ महंगे कमर्शियल) के साथ एक दौड़ आयोजित की कि कौन इन 50 परियोजनाओं को बना सकता है।
- "कच्ची प्रतिभा" बनाम "टूलबॉक्स":
- कच्ची प्रतिभा (Raw Talent): सबसे बड़े, सबसे स्मार्ट AI मॉडल (द "जीनियस") एक प्रोजेक्ट को शून्य से शुरू करने में सबसे अच्छे थे। वे एक ब्लूप्रिंट देख सकते थे और तुरंत एक ठोस ढांचा बना सकते थे।
- टूलबॉक्स (The Toolbox): कमर्शियल एजेंट (जैसे कि "Claude Code" या "Gemini CLI") शुरुआत में धीमे थे लेकिन डिबगिंग में अद्भुत थे। वे एक बेहतरीन टूल किट वाली टीम की तरह थे; जब कुछ टूट जाता था, तो वे बाकी घर को खराब किए बिना उसे ठीक कर सकते थे।
- जाल (The Trap): कुछ "जीनियस" मॉडल एक छोटी सी गलती को ठीक करने के लिए पूरे घर को फिर से लिखने की कोशिश करते थे, जिससे अनजाने में वे चीजें भी टूट जाती थीं जो पहले से ठीक काम कर रही थीं।
- सबक: सॉफ्टवेयर बनाने के लिए, आपको एक स्मार्ट दिमाग (शुरुआत करने के लिए) और एक सावधानीपूर्ण, संरचित दृष्टिकोण (ठीक करने के लिए) दोनों की आवश्यकता होती है।
सारांश
यह पेपर AI कोडर्स को टेस्ट करने का एक निष्पक्ष, सस्ता और सटीक तरीका बनाने के बारे में है।
- उन्होंने परीक्षण लिखने में मदद करने के लिए AI का उपयोग किया (समय बचाया)।
- उन्होंने काम को ग्रेड करने के लिए एक विशेष AI रेफरी को प्रशिक्षित किया (पैसा बचाया और सटीकता बढ़ाई)।
- उन्होंने पाया कि जबकि कच्ची AI बुद्धिमत्ता प्रोजेक्ट शुरू करने के लिए महान है, लेकिन उन्हें पूरा करने के लिए संरचित उपकरण (structured tools) बेहतर हैं।
यह एक शहर बनाने के लिए एक अकेले जीनियस को काम पर रखने से, एक पूरी टीम को एक मानकीकृत निरीक्षण प्रक्रिया के साथ काम पर रखने की ओर बढ़ने जैसा है ताकि यह सुनिश्चित किया जा सके कि शहर वास्तव में काम करे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।