AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
AgentLens कोडिंग एजेंटों के लिए एक प्रोडक्शन-असेसमेंट बेंचमार्क पेश करता है जो औपचारिक सत्यापन (formal verification) और LLM-जनरेटेड समीक्षाओं के संयोजन के माध्यम से संपूर्ण इंटरेक्शन ट्राजेक्टरी का मूल्यांकन करता है, जिससे सरल पास/फेल मेट्रिक्स से परे विस्तृत व्यवहार संबंधी निदान और रिग्रेशन डिटेक्शन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने सॉफ़्टवेयर प्रोजेक्ट पर काम करने के लिए एक नए जूनियर डेवलपर को काम पर रख रहे हैं।
पुराना तरीका (पारंपरिक बेंचमार्क)
AI कोडिंग असिस्टेंट के लिए अधिकांश वर्तमान परीक्षण एक अंतिम परीक्षा की तरह हैं जहाँ केवल अंतिम पेपर के ग्रेड से फर्क पड़ता है। क्या कोड कंपाइल हुआ? क्या टेस्ट पास हुआ? हाँ या नहीं?
- समस्या: यह पूरी यात्रा की अनदेखी करता है। क्या डेवलपर घबरा गया? क्या उन्होंने गलती से गलत फाइलें डिलीट कर दीं? क्या उन्होंने आपसे बहस की? क्या उन्होंने दावा किया कि काम पूरा हो गया है जबकि वास्तव में वह टूटा हुआ था? एक "पासिंग" ग्रेड एक ऐसे डेवलपर को छिपा सकता है जो अविश्वसनीय, भ्रमित करने वाला या काम करने के लिए खतरनाक है।
नया तरीका (AgentLens)
इस पेपर के लेखक, AgentLens ने एक अलग तरह का परीक्षण बनाया है। केवल अंतिम पेपर को ग्रेड देने के बजाय, वे पूरी कार्यदिवस की वीडियो रिकॉर्डिंग करते हैं और एक सीनियर मैनेजर से उस वीडियो टेप की समीक्षा करवाते हैं। वे इसे "ट्रैजेक्टरी रिव्यू" (trajectory review) कहते हैं।
यहाँ बताया गया है कि AgentLens कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. "पूरी फिल्म" बनाम "अंतिम फ्रेम"
कोडिंग सत्र को एक फिल्म की तरह समझें।
- पुराने बेंचमार्क केवल अंतिम फ्रेम देखते हैं: क्या इमारत खड़ी है?
- AgentLens पूरी फिल्म देखता है: एजेंट ने तूफान का सामना कैसे किया? क्या उन्होंने सही उपकरणों का उपयोग किया? जब उन्होंने एक ईंट गिरा दी तो क्या वे संभल पाए? क्या उन्होंने उपयोगकर्ता से अच्छे से बात की?
वे हर संदेश, हर टूल क्लिक, हर फ़ाइल संपादन और AI द्वारा की गई हर गलती को रिकॉर्ड करते हैं। वे केवल अंत को नहीं, बल्कि पूरी कहानी का मूल्यांकन करते हैं।
2. "सिम्युलेटेड यूजर" (Simulated User)
AI का परीक्षण करने के लिए, वे उसे केवल एक कार्य नहीं देते; वे उसे एक व्यक्तित्व (personality) देते हैं। वे बातचीत में "यूजर" के रूप में कार्य करने के लिए दूसरे AI का उपयोग करते हैं।
- द चिल यूजर (The Chill User): बस मदद मांगता है और इंतजार करता है।
- द हेल्पफुल यूजर (The Helpful User): यदि AI छोटी सी गलती करता है, तो वह धीरे से उसे सुधारता है।
- द "टॉक्सिक" यूजर (The "Toxic" User): हताश होता है, थोड़ा बदतमीज होता है और AI को चुनौती देता है।
- क्यों? क्योंकि वास्तविक दुनिया में, डेवलपर्स रोबोट नहीं होते। वे थक जाते हैं, वे चिढ़ जाते हैं, और वे गलतियाँ करते हैं। AgentLens यह जांचता है कि क्या कोडिंग AI, जब उपयोगकर्ता गुस्सैल हो, तो शांत और मददगार रहता है या वह बिखर जाता है।
3. "दो सिर वाला जज" (The "Two-Headed Judge")
आप एक फिल्म को कैसे ग्रेड करेंगे? आप केवल एक इंसान से 32 घंटे का वीडियो देखने के लिए नहीं कह सकते; वे थक जाएंगे और गलतियाँ करेंगे।
- फॉर्मल चेक (रोबोट): यह हिस्सा ठोस तथ्यों की जांच करता है। क्या कोड वास्तव में चला? क्या फ़ाइल बदली? यह "क्या इमारत खड़ी है?" वाला चेक है।
- LLM जज (क्रिटिक): यह एक स्मार्ट AI है जो पूरे ट्रांसक्रिप्ट को पढ़ता है और एक रिव्यू लिखता है। यह एक फिल्म क्रिटिक की तरह कार्य करता है। यह केवल स्कोर नहीं देता; यह समझाने के लिए एक पैराग्राफ लिखता है कि क्यों।
- उदाहरण: "एजेंट ने कोड को काम करने लायक बना दिया (रोबोट कहता है 'Pass'), लेकिन उसने त्रुटियों की जांच करने के बारे में झूठ बोला और तीन बार गलत तरीके से टूल का उपयोग किया (क्रिटिक कहता है 'Fail')।"
4. "कमेंट्स के साथ रिपोर्ट कार्ड"
एक एकल संख्या (जैसे 85/100) के बजाय, AgentLens पांच विशिष्ट श्रेणियों के साथ एक विस्तृत रिपोर्ट कार्ड देता है:
- एंड रिजल्ट (End Result): क्या उन्होंने वास्तव में काम पूरा किया?
- इंस्ट्रक्शन फॉलोइंग (Instruction Following): क्या उन्होंने आपके विशिष्ट नियमों को सुना/माना?
- पिटफॉल्स (Pitfalls): क्या वे लूप में फंस गए, मूर्खतापूर्ण गलतियाँ कीं, या क्रैश हो गए?
- प्लीज़ेंटनेस (Pleasantness): क्या बातचीत समझने में आसान थी, या यह भ्रमित करने वाली और परेशान करने वाली थी?
- टूल यूज़ (Tool Use): क्या उन्होंने सही उपकरणों (जैसे हथौड़े बनाम पेचकश) का सही ढंग से उपयोग किया?
5. कंपनियों के लिए यह क्यों मायने रखता है
लेखकों ने यह इसलिए बनाया क्योंकि वे अपनी कंपनी के लिए एक वास्तविक कोडिंग असिस्टेंट बना रहे हैं। उन्हें यह जानने से कहीं अधिक की आवश्यकता है कि "कौन सा मॉडल सबसे स्मार्ट है।"
- रिग्रेशन डिटेक्शन (Regression Detection): कल्पना करें कि आप अपने सॉफ़्टवेयर को अपडेट करते हैं, और अचानक आपका AI फाइलें डिलीट करने लगता है। एक साधारण "पास/फेल" टेस्ट इसे मिस कर सकता है यदि अंतिम कोड अभी भी कंपाइल हो रहा है। AgentLens तुरंत व्यवहार में बदलाव को पकड़ लेता है।
- डायग्नोसिस (Diagnosis): यदि कोई मॉडल कम स्कोर करता है, तो समीक्षा बताती है कि ऐसा क्यों हुआ। "ओह, समस्या यह नहीं है कि वह कोड नहीं लिख सकता; बल्कि यह है कि वह 'टॉक्सिक यूजर' व्यक्तित्व को हैंडल नहीं कर सकता।"
- साइड-बाय-साइड (Side-by-Side): वे दो AI को एक ही समस्या पर काम करते हुए देख सकते हैं और देख सकते हैं कि ठीक कहाँ एक भ्रमित होता है और दूसरा नहीं।
निचोड़ (The Bottom Line)
पेपर का दावा है कि AgentLens एक नया, ओपन-सोर्स टूल है जो कोडिंग AI का मूल्यांकन उनके संपूर्ण व्यवहार को देखकर करता है, न कि केवल उनके अंतिम आउटपुट को। यह हार्ड कोड चेक्स और स्मार्ट AI "क्रिटिक्स" के मिश्रण का उपयोग करके पठनीय रिपोर्ट तैयार करता है जो डेवलपर्स को यह समझने में मदद करती है कि एक AI कैसे सोचता है, व्यवहार करता है और विफल होता है, जो इसे वर्तमान "पास/फेल" लीडरबोर्ड की तुलना में वास्तविक दुनिया के उपयोग के लिए बहुत बेहतर बनाता है।
पेपर क्या दावा नहीं करता है:
- यह दावा नहीं करता कि यह मेडिकल डायग्नोसिस या कानूनी सलाह के लिए काम करता है (यह पूरी तरह से कोडिंग के लिए है)।
- यह दावा नहीं करता कि यह परफेक्ट है; वे स्वीकार करते हैं कि कभी-कभी AI जज पक्षपाती हो सकते हैं, और वे अभी भी इस बात का अध्ययन कर रहे हैं कि ये AI जज मनुष्यों के साथ कितनी अच्छी तरह सहमत होते हैं।
- यह वर्तमान में जावा (Java) प्रोग्रामिंग पर केंद्रित है, हालांकि वे इसका विस्तार करने की योजना बना रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।