AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
यह शोध पत्र AgentLens प्रस्तुत करता है, जो यह प्रदर्शित करके कि केवल बाइनरी टेस्ट परिणामों पर निर्भर रहना समाधान की गुणवत्ता में महत्वपूर्ण अंतरों को छिपा देता है, SWE-agent मूल्यांकन में "लकी पास" (Lucky Pass) घटनाओं की व्यापकता को उजागर करता है, और मॉडल प्रदर्शन को अधिक सटीक रूप से रैंक करने के लिए टास्क-लेवल प्रिफिक्स ट्री एक्सेप्टर (Prefix Tree Acceptor) संदर्भों का उपयोग करते हुए एक प्रोसेस-लेवल मूल्यांकन पद्धति का प्रस्ताव करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपनी कार ठीक करने के लिए एक मैकेनिक को काम पर रख रहे हैं। AI सॉफ्टवेयर इंजीनियरों (जिन्हें "SWE agents" कहा जाता है) को टेस्ट करने का वर्तमान तरीका बहुत सरल है: आप उन्हें एक खराब कार देते हैं, वे एक ठीक की हुई कार लेकर वापस आते हैं, और आप चेक करते हैं कि क्या वह स्टार्ट होती है। यदि वह स्टार्ट हो जाती है, तो आप उन्हें एक गोल्ड स्टार देते हैं। यदि नहीं, तो उन्हें रेड X मिलता है।
यह एक "पास/फेल" (Pass/Fail) सिस्टम है। इस पेपर के अनुसार, समस्या यह है कि यह सिस्टम दो बहुत ही अलग तरह के मैकेनिकों के साथ बिल्कुल एक जैसा व्यवहार करता है:
- मास्टर मैकेनिक: समस्या का जल्दी निदान करता है, सही पुर्जा मंगवाता है, कुशलतापूर्वक मरम्मत करता है, और अपने काम की दोबारा जांच करता है।
- किस्मत का धनी (The Lucky Gambler): 50 रैंडम पुर्जे आजमाता है, बिना सोचे-समझे उन्हें बदलता रहता है, रास्ते में कुछ और चीजें भी तोड़ देता है, निराश होता है, और अंत में—सिर्फ किस्मत के सहारे—सही पुर्जा लगा देता है। कार स्टार्ट हो जाती है।
पुराने सिस्टम के तहत, दोनों को गोल्ड स्टार मिलता है। लेकिन यह पेपर तर्क देता है कि यह एक गलती है। "किस्मत का धनी" वास्तव में एक बुरा कर्मचारी है क्योंकि उसकी प्रक्रिया अराजक, बर्बादी भरी और अप्रत्याशित है।
समस्या: "लकी पास" (The Lucky Pass)
शोधकर्ताओं ने वास्तविक सॉफ्टवेयर बग्स को ठीक करने के 2,600 से अधिक प्रयासों का अध्ययन किया। उन्होंने पाया कि "सफल" सुधारों में से 10.7% वास्तव में "लकी पास" थे।
इन एजेंटों ने समस्या को तार्किक रूप से हल नहीं किया था। इसके बजाय, उन्होंने:
- अंधाधुंध कोशिश की: जैसे कोई बच्चा तब तक पियानो बजाता है जब तक कि कोई धुन सही न सुनाई देने लगे।
- चेक करना भूल गए: कोड तो ठीक कर दिया लेकिन यह देखने के लिए टेस्ट नहीं चलाए कि क्या वह वास्तव में काम कर रहा है।
- समय बर्बाद किया: गलत फाइलों को खंगाला या बिना किसी दिशा के चक्कर काटते रहे और फिर अचानक सही उत्तर तक पहुँच गए।
समाधान: AGENTLENS (द "प्रोसेस कैमरा")
इस समस्या को ठीक करने के लिए, टीम ने AGENTLENS नामक एक नया टूल बनाया है। इसे एक हाई-डेफिनिशन कैमरे की तरह समझें जो केवल तैयार कार को ही नहीं देखता; बल्कि यह पूरी मरम्मत प्रक्रिया को स्लो मोशन में रिकॉर्ड करता है।
AGENTLENS दो मुख्य काम करता है:
1. "अच्छे समाधानों का मानचित्र" (PTA)
केवल एक "परफेक्ट" उदाहरण से तुलना करने के बजाय, AGENTLENS एक प्रिफिक्स ट्री एक्सेप्टर (Prefix Tree Acceptor - PTA) बनाता है।
- उपमा: एक पेड़ की कल्पना करें जहाँ तना काम की शुरुआत है। शाखाएं मरम्मत के विभिन्न वैध तरीकों का प्रतिनिधित्व करती हैं। कुछ शाखाएं इंजन रूम से होकर जाती हैं; अन्य ट्रंक (तने) से होकर जाती हैं।
- यदि कोई AI ऐसे पथ पर चलता है जो पेड़ पर मौजूद है, तो वह समझदारी भरा काम कर रहा है। यदि वह पेड़ से भटककर जंगल में चला जाता है, तो वह समय बर्बाद कर रहा है।
2. "इन्टेंट ट्रांसलेटर" (The Intent Translator)
यह टूल AI जो कर रहा है उसे देखता है और हर कदम को एक "विचार" (thought) के साथ लेबल करता है:
- एक्सप्लोरेशन (Exploration): "मैं समस्या की तलाश कर रहा हूँ।"
- इम्प्लीमेंटेशन (Implementation): "मैं पुर्जे को ठीक कर रहा हूँ।"
- वेरिफिकेशन (Verification): "मैं जाँच रहा हूँ कि क्या यह काम कर रहा है।"
- ऑर्केस्ट्रेशन (Orchestration): "मैं अपने विचारों को व्यवस्थित कर रहा हूँ।"
यदि कोई AI कोड लिखने से पहले ही एक टेस्ट चलाता है, तो यह टूल उसे भ्रमित घोषित कर देता है। यदि वह कोड ठीक करता है लेकिन कभी टेस्ट नहीं चलाता, तो यह उसे जोखिम भरा घोषित कर देता है।
उन्होंने क्या पाया
जब उन्होंने इस "प्रोसेस कैमरा" को डेटा पर लागू किया, तो परिणाम आश्चर्यजनक थे:
- सभी विजेता समान नहीं हैं: उन्होंने सफल सुधारों को तीन समूहों में विभाजित किया:
- आदर्श (Ideal) (20%): साफ, तार्किक और कुशल।
- ठोस (Solid) (69%): अच्छे, लेकिन शायद थोड़े अव्यवस्थित।
- किस्मत वाले (Lucky) (10.7%): "गैम्बलर" समूह। उन्हें सही उत्तर मिला, लेकिन अराजकता के माध्यम से।
- रैंकिंग बदल गई: जब उन्होंने AI मॉडल्स को उनके द्वारा समस्याओं को हल करने के तरीके के आधार पर रैंक किया (न कि केवल इस आधार पर कि उन्होंने हल किया या नहीं), तो लीडरबोर्ड पलट गया।
- एक मॉडल (GPT-4o) 8वें स्थान से 3रे स्थान पर आ गया क्योंकि, जब भी वह सफल हुआ, उसने बहुत ही सफाई से काम किया।
- दूसरा मॉडल (Opus 4.6) पहले स्थान से छठे स्थान पर गिर गया। इसकी सफलता दर अधिक थी, लेकिन इसकी कई जीत "लकी पास" थीं जो व्यर्थ के प्रयासों से भरी हुई थीं।
- किस्मत की लागत: "लकी" एजेंट अविश्वसनीय रूप से महंगे थे। कुछ एजेंटों ने समान परिणाम प्राप्त करने के लिए कुशल एजेंटों की तुलना में 40 गुना अधिक कंप्यूटिंग पावर (टोकन) बर्बाद किया। यह अखरोट तोड़ने के लिए अखरोट तोड़ने वाले औजार के बजाय हथौड़े का उपयोग करने जैसा है क्योंकि उन्हें सही उपकरण का पता नहीं है।
"लकी" के पांच प्रकार
पेपर ने यह भी वर्गीकृत किया कि एजेंटों ने किस तरह से किस्मत का सहारा लिया:
- अति-आत्मविश्वासी (The Overconfident): ठीक किया लेकिन यह नहीं देखा कि क्या यह काम कर रहा है।
- ब्रूट-फोर्सर (The Brute-Forcer): तब तक रैंडम चीजें आजमाते रहे जब तक कि एक काम नहीं कर गया।
- आधे-अधूरे (The Half-Hearted): समस्या के केवल एक हिस्से को ठीक किया, लेकिन टेस्ट इतने सख्त नहीं थे कि बाकी हिस्से को पकड़ सकें।
- भटकने वाला (The Wanderer): एक्सप्लोरेशन में खो गया और वास्तव में ध्यान केंद्रित नहीं कर पाया।
- रचनात्मक जीनियस (The Creative Genius): एक पूरी तरह से अलग, वैध तरीका खोजा जिसकी "मैप" को उम्मीद नहीं थी (यह "लकी" होने का एकमात्र "अच्छा" प्रकार है)।
निष्कर्ष
पेपर का निष्कर्ष है कि हम केवल AI से यह नहीं पूछ सकते कि, "क्या आपने इसे ठीक किया?" हमें यह पूछना होगा, "क्या आपने इसे सही तरीके से ठीक किया?"
AGENTLENS का उपयोग करके, हम AI मॉडल्स को भाग्यशाली या बर्बादी भरे होने के लिए पुरस्कृत करना बंद कर सकते हैं। इसके बजाय, हम उन्हें प्रशिक्षित कर सकते हैं कि वे मास्टर मैकेनिक की तरह बनें: कुशल, तार्किक और विश्वसनीय। शोधकर्ताओं ने अपने टूल्स और डेटा को जारी कर दिया है ताकि अन्य लोग इस "प्रोसेस कैमरा" का उपयोग करके AI इंजीनियरों का बेहतर मूल्यांकन कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।