TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis
यह शोधपत्र TRAJEVAL को पेश करता है, जो एक नैदानिक ढांचा (diagnostic framework) है जो कोड एजेंट के प्रक्षेप पथों (trajectories) को खोज (search), पढ़ने (read) और संपादन (edit) चरणों में विभाजित करता है ताकि सूक्ष्म-स्तरीय विफलता विश्लेषण प्रदान किया जा सके, जिससे सार्वभौमिक अक्षमताओं और विशिष्ट मॉडल-विशिष्ट कमजोरियों का खुलासा होता है और साथ ही ऐसा सुधारात्मक फीडबैक सक्षम होता है जो एजेंट के प्रदर्शन में उल्लेखनीय सुधार करता है और लागत को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अनाड़ी रोबोटिक सहायक को एक विशाल गोदाम (एक सॉफ्टवेयर कोडबेस) में एक टूटी हुई मशीन को ठीक करने के लिए काम पर रखा है। आपका लक्ष्य रोबोट को वह टूटा हुआ हिस्सा खोजने और उसे ठीक करने के लिए निर्देशित करना है।
वर्तमान में, जब हम इन रोबोटों का परीक्षण करते हैं, तो हम अंत में केवल एक ही प्रश्न पूछते हैं: "क्या यह काम कर गया?"
- यदि मशीन चल जाती है, तो हम कहते हैं "अच्छा काम किया!"
- यदि नहीं चलती, तो हम कहते "विफल।"
यह एक छात्र को गणित की परीक्षा में केवल अंतिम उत्तर सही होने के आधार पर ग्रेड देने जैसा है, बिना उसके काम को देखे। यदि वह गलत होता है, तो आपको पता नहीं चलेगा कि:
- वह पाठ्यपुस्तक का सही पृष्ठ नहीं ढूँढ सका।
- उसे पृष्ठ तो मिल गया लेकिन वह सूत्र (formula) को नहीं समझ पाया।
- वह सूत्र को समझ गया लेकिन उसने गलत संख्याएँ लिख दीं।
TRAJEVAL एक नया "आवर्धक लेंस" (magnifying glass) है जो हमें रोबोट की पूरी यात्रा को चरण-दर-चरण देखने देता है ताकि हम देख सकें कि वह वास्तव में कहाँ अटक गया था।
तीन-चरणीय यात्रा
लेखक रोबोट के काम को तीन सरल चरणों में विभाजित करते हैं, जैसे कोई जासूस रहस्य सुलझा रहा हो:
खोज (अपराध स्थल ढूँढना):
- रूपक (Metaphor): रोबोट को गोदाम के उस विशिष्ट कमरे को खोजना होगा जहाँ टूटी हुई मशीन है।
- समस्या: कभी-कभी रोबोट उस एक कमरे को खोजने के लिए 100 दरवाजे खोल देता है जो वास्तव में महत्वपूर्ण है। यह पूरे घर में खोई हुई चाबी खोजने जैसा है जबकि वह केवल रसोई में ही थी।
- TRAJEVAL का दृष्टिकोण: यह रिकॉल (Recall) (क्या आपने सही कमरा ढूँढा?) और प्रिसिजन (Precision) (क्या आपने गलत दरवाजे खोलकर समय बर्बाद किया?) को मापता है।
पढ़ना (ब्लूप्रिंट पढ़ना):
- रूपक: कमरे में पहुँचने के बाद, रोबोट को निर्देश पुस्तिका (instruction manual) पढ़नी होगी ताकि वह समझ सके कि मशीन कैसे काम करती है।
- समस्या: रोबोट मैनुअल तो खोल सकता है लेकिन केवल उसका कवर पढ़ता है, या गलत अध्याय पढ़ लेता है।
- TRAJEVAL का दृष्टिकोण: क्या रोबोट ने वास्तव में उस विशिष्ट पैराग्राफ को पढ़ा जो मरम्मत की व्याख्या करता है?
संपादन (रिंच घुमाना):
- रूपक: रोबोट ढीले पेंच को कसने की कोशिश करता है।
- समस्या: रोबोट समस्या को पूरी तरह से समझ सकता है लेकिन गलत पेंच को कसने की कोशिश करता है, या सही पेंच को गलत जगह पर कस देता है।
- TRAJEVAL का दृष्टिकोण: क्या रोबोट ने ठीक उसी हिस्से को छुआ जिसकी मरम्मत की आवश्यकता थी?
उन्होंने क्या खोजा
इन 16,000 रोबोट यात्राओं को देखकर, शोधकर्ताओं ने कुछ आश्चर्यजनक चीजें पाईं:
- "अति-खोजी" (The Over-Explorers): लगभग हर रोबोट अविश्वसनीय रूप से अक्षम है। वे वास्तव में जितनी आवश्यकता है उससे 22 गुना अधिक कोड देखते हैं। वे ऐसे हैं जैसे कोई "बिल्ली" की परिभाषा खोजने के लिए पूरी डिक्शनरी पढ़ रहा हो।
- अलग-अलग रोबोट, अलग-अलग खामियाँ:
- रोबोट A (GPT-5): यह सही कमरा खोजने और मैनुअल पढ़ने में बहुत अच्छा है, लेकिन रिंच चलाने में अनाड़ी है। इसे पता है कि क्या ठीक करना है लेकिन कहाँ ठीक करना है।
- रोबोट B (Qwen-32B): यह कमरा खोजने में बहुत बुरा है। यह गोदाम में इधर-उधर भटकता रहता है और कभी भी टूटी हुई मशीन तक नहीं पहुँच पाता।
- सफलता का रहस्य: एक रोबोट की सफलता के लिए सबसे महत्वपूर्ण बात उसकी गति (Precision) नहीं है, बल्कि सही चीजों को खोजने के लिए पर्याप्त गहनता (Recall) है। यदि एक रोबोट गोदाम की हर एक फाइल पढ़ लेता है लेकिन अंततः सही पेंच को ठीक कर देता है, तो वह जीत जाता है। यदि वह बहुत तेज़ है लेकिन गलत पेंच को ठीक करता है, तो वह हार जाता है।
"जादुई इशारा" (The Magic Nudge)
इस पेपर का सबसे दिलचस्प हिस्सा यह है कि उन्होंने केवल रोबोट्स को देखा ही नहीं; उन्होंने उनकी मदद भी की।
कल्पना कीजिए कि रोबोट गोदाम में खोज कर रहा है। हर बार जब वह एक ऐसे कमरे में प्रवेश करता है जिसमें वास्तव में टूटी हुई मशीन मौजूद है, तो एक छोटी सी आवाज़ फुसफुसाती है: "हे, तुम सही जगह पर हो! यहीं देखते रहो!"
- परिणाम: इस साधारण इशारे ने रोबलों को बेहतर (उन्होंने अधिक बग्स ठीक किए) और सस्ता (उन्होंने कम कंप्यूटर पावर का उपयोग किया) बना दिया क्योंकि उन्होंने गलत कमरों में समय बर्बाद करना बंद कर दिया।
यह क्यों मायने रखता है
इससे पहले, यदि कोई रोबोट विफल हो जाता था, तो हमें केवल इतना पता चलता था कि वह विफल हो गया। अब, हमारे पास एक डायग्नोस्टिक डैशबोर्ड है।
- यदि कोई रोबोट विफल हो रहा है, तो हम कह सकते हैं, "ओह, यह फाइलें खोजने में खराब है," और उसे एक बेहतर नक्शा दे सकते हैं।
- या, "यह फाइलें खोजने में अच्छा है लेकिन संपादन (editing) में बुरा है," और उसे बेहतर रिंच दे सकते हैं।
संक्षेप में: TRAJEVAL AI कोडिंग के 'ब्लैक बॉक्स' को एक पारदर्शी प्रक्रिया में बदल देता है। यह हमें यह अनुमान लगाने के बजाय कि AI क्यों विफल हुआ, हमें उसे ठीक करने का एक रोडमैप प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।