← नवीनतम पेपर
🤖 AI

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

AgentLens कोडिंग एजेंटों के लिए एक प्रोडक्शन-असेसमेंट बेंचमार्क पेश करता है जो औपचारिक सत्यापन (formal verification) और LLM-जनरेटेड समीक्षाओं के संयोजन के माध्यम से संपूर्ण इंटरेक्शन ट्राजेक्टरी का मूल्यांकन करता है, जिससे सरल पास/फेल मेट्रिक्स से परे विस्तृत व्यवहार संबंधी निदान और रिग्रेशन डिटेक्शन सक्षम होता है।

मूल लेखक: Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko

प्रकाशित 2026-07-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने सॉफ़्टवेयर प्रोजेक्ट पर काम करने के लिए एक नए जूनियर डेवलपर को काम पर रख रहे हैं।

पुराना तरीका (पारंपरिक बेंचमार्क)
AI कोडिंग असिस्टेंट के लिए अधिकांश वर्तमान परीक्षण एक अंतिम परीक्षा की तरह हैं जहाँ केवल अंतिम पेपर के ग्रेड से फर्क पड़ता है। क्या कोड कंपाइल हुआ? क्या टेस्ट पास हुआ? हाँ या नहीं?

  • समस्या: यह पूरी यात्रा की अनदेखी करता है। क्या डेवलपर घबरा गया? क्या उन्होंने गलती से गलत फाइलें डिलीट कर दीं? क्या उन्होंने आपसे बहस की? क्या उन्होंने दावा किया कि काम पूरा हो गया है जबकि वास्तव में वह टूटा हुआ था? एक "पासिंग" ग्रेड एक ऐसे डेवलपर को छिपा सकता है जो अविश्वसनीय, भ्रमित करने वाला या काम करने के लिए खतरनाक है।

नया तरीका (AgentLens)
इस पेपर के लेखक, AgentLens ने एक अलग तरह का परीक्षण बनाया है। केवल अंतिम पेपर को ग्रेड देने के बजाय, वे पूरी कार्यदिवस की वीडियो रिकॉर्डिंग करते हैं और एक सीनियर मैनेजर से उस वीडियो टेप की समीक्षा करवाते हैं। वे इसे "ट्रैजेक्टरी रिव्यू" (trajectory review) कहते हैं।

यहाँ बताया गया है कि AgentLens कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "पूरी फिल्म" बनाम "अंतिम फ्रेम"

कोडिंग सत्र को एक फिल्म की तरह समझें।

  • पुराने बेंचमार्क केवल अंतिम फ्रेम देखते हैं: क्या इमारत खड़ी है?
  • AgentLens पूरी फिल्म देखता है: एजेंट ने तूफान का सामना कैसे किया? क्या उन्होंने सही उपकरणों का उपयोग किया? जब उन्होंने एक ईंट गिरा दी तो क्या वे संभल पाए? क्या उन्होंने उपयोगकर्ता से अच्छे से बात की?

वे हर संदेश, हर टूल क्लिक, हर फ़ाइल संपादन और AI द्वारा की गई हर गलती को रिकॉर्ड करते हैं। वे केवल अंत को नहीं, बल्कि पूरी कहानी का मूल्यांकन करते हैं।

2. "सिम्युलेटेड यूजर" (Simulated User)

AI का परीक्षण करने के लिए, वे उसे केवल एक कार्य नहीं देते; वे उसे एक व्यक्तित्व (personality) देते हैं। वे बातचीत में "यूजर" के रूप में कार्य करने के लिए दूसरे AI का उपयोग करते हैं।

  • द चिल यूजर (The Chill User): बस मदद मांगता है और इंतजार करता है।
  • द हेल्पफुल यूजर (The Helpful User): यदि AI छोटी सी गलती करता है, तो वह धीरे से उसे सुधारता है।
  • द "टॉक्सिक" यूजर (The "Toxic" User): हताश होता है, थोड़ा बदतमीज होता है और AI को चुनौती देता है।
  • क्यों? क्योंकि वास्तविक दुनिया में, डेवलपर्स रोबोट नहीं होते। वे थक जाते हैं, वे चिढ़ जाते हैं, और वे गलतियाँ करते हैं। AgentLens यह जांचता है कि क्या कोडिंग AI, जब उपयोगकर्ता गुस्सैल हो, तो शांत और मददगार रहता है या वह बिखर जाता है।

3. "दो सिर वाला जज" (The "Two-Headed Judge")

आप एक फिल्म को कैसे ग्रेड करेंगे? आप केवल एक इंसान से 32 घंटे का वीडियो देखने के लिए नहीं कह सकते; वे थक जाएंगे और गलतियाँ करेंगे।

  • फॉर्मल चेक (रोबोट): यह हिस्सा ठोस तथ्यों की जांच करता है। क्या कोड वास्तव में चला? क्या फ़ाइल बदली? यह "क्या इमारत खड़ी है?" वाला चेक है।
  • LLM जज (क्रिटिक): यह एक स्मार्ट AI है जो पूरे ट्रांसक्रिप्ट को पढ़ता है और एक रिव्यू लिखता है। यह एक फिल्म क्रिटिक की तरह कार्य करता है। यह केवल स्कोर नहीं देता; यह समझाने के लिए एक पैराग्राफ लिखता है कि क्यों
    • उदाहरण: "एजेंट ने कोड को काम करने लायक बना दिया (रोबोट कहता है 'Pass'), लेकिन उसने त्रुटियों की जांच करने के बारे में झूठ बोला और तीन बार गलत तरीके से टूल का उपयोग किया (क्रिटिक कहता है 'Fail')।"

4. "कमेंट्स के साथ रिपोर्ट कार्ड"

एक एकल संख्या (जैसे 85/100) के बजाय, AgentLens पांच विशिष्ट श्रेणियों के साथ एक विस्तृत रिपोर्ट कार्ड देता है:

  1. एंड रिजल्ट (End Result): क्या उन्होंने वास्तव में काम पूरा किया?
  2. इंस्ट्रक्शन फॉलोइंग (Instruction Following): क्या उन्होंने आपके विशिष्ट नियमों को सुना/माना?
  3. पिटफॉल्स (Pitfalls): क्या वे लूप में फंस गए, मूर्खतापूर्ण गलतियाँ कीं, या क्रैश हो गए?
  4. प्लीज़ेंटनेस (Pleasantness): क्या बातचीत समझने में आसान थी, या यह भ्रमित करने वाली और परेशान करने वाली थी?
  5. टूल यूज़ (Tool Use): क्या उन्होंने सही उपकरणों (जैसे हथौड़े बनाम पेचकश) का सही ढंग से उपयोग किया?

5. कंपनियों के लिए यह क्यों मायने रखता है

लेखकों ने यह इसलिए बनाया क्योंकि वे अपनी कंपनी के लिए एक वास्तविक कोडिंग असिस्टेंट बना रहे हैं। उन्हें यह जानने से कहीं अधिक की आवश्यकता है कि "कौन सा मॉडल सबसे स्मार्ट है।"

  • रिग्रेशन डिटेक्शन (Regression Detection): कल्पना करें कि आप अपने सॉफ़्टवेयर को अपडेट करते हैं, और अचानक आपका AI फाइलें डिलीट करने लगता है। एक साधारण "पास/फेल" टेस्ट इसे मिस कर सकता है यदि अंतिम कोड अभी भी कंपाइल हो रहा है। AgentLens तुरंत व्यवहार में बदलाव को पकड़ लेता है।
  • डायग्नोसिस (Diagnosis): यदि कोई मॉडल कम स्कोर करता है, तो समीक्षा बताती है कि ऐसा क्यों हुआ। "ओह, समस्या यह नहीं है कि वह कोड नहीं लिख सकता; बल्कि यह है कि वह 'टॉक्सिक यूजर' व्यक्तित्व को हैंडल नहीं कर सकता।"
  • साइड-बाय-साइड (Side-by-Side): वे दो AI को एक ही समस्या पर काम करते हुए देख सकते हैं और देख सकते हैं कि ठीक कहाँ एक भ्रमित होता है और दूसरा नहीं।

निचोड़ (The Bottom Line)

पेपर का दावा है कि AgentLens एक नया, ओपन-सोर्स टूल है जो कोडिंग AI का मूल्यांकन उनके संपूर्ण व्यवहार को देखकर करता है, न कि केवल उनके अंतिम आउटपुट को। यह हार्ड कोड चेक्स और स्मार्ट AI "क्रिटिक्स" के मिश्रण का उपयोग करके पठनीय रिपोर्ट तैयार करता है जो डेवलपर्स को यह समझने में मदद करती है कि एक AI कैसे सोचता है, व्यवहार करता है और विफल होता है, जो इसे वर्तमान "पास/फेल" लीडरबोर्ड की तुलना में वास्तविक दुनिया के उपयोग के लिए बहुत बेहतर बनाता है।

पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह मेडिकल डायग्नोसिस या कानूनी सलाह के लिए काम करता है (यह पूरी तरह से कोडिंग के लिए है)।
  • यह दावा नहीं करता कि यह परफेक्ट है; वे स्वीकार करते हैं कि कभी-कभी AI जज पक्षपाती हो सकते हैं, और वे अभी भी इस बात का अध्ययन कर रहे हैं कि ये AI जज मनुष्यों के साथ कितनी अच्छी तरह सहमत होते हैं।
  • यह वर्तमान में जावा (Java) प्रोग्रामिंग पर केंद्रित है, हालांकि वे इसका विस्तार करने की योजना बना रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →