← नवीनतम पेपर
💻 computer science

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

यह शोधपत्र TrajAudit प्रस्तुत करता है, जो एक नया ढांचा (framework) है जिसे शोरयुक्त, लंबी ट्रैजेक्टरीज को फ़िल्टर करने और पूर्व ज्ञान का लाभ उठाने के माध्यम से रिपॉजिटरी-स्तरीय एजेंटिक कोडिंग सिस्टम में विफलता निदान (failure diagnosis) में सुधार करने के लिए डिज़ाइन किया गया है, जो मौजूदा बेसलाइनों की तुलना में नए RootSE बेंचमार्क पर काफी उच्च लोकलाइजेशन सटीकता और टोकन दक्षता प्राप्त करता है।

मूल लेखक: Minxing Wang, Xiaofei Xie, Yintong Huo

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minxing Wang, Xiaofei Xie, Yintong Huo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, स्वचालित रोबोट सहायक (एक "AI एजेंट") है जिसका काम एक विशाल, जटिल सॉफ़्टवेयर लाइब्रेरी में बग्स को ठीक करना है। कभी-कभी, यह रोबोट काम को पूरी तरह से सफलतापूर्वक करता है। लेकिन अन्य समय में, यह किसी समस्या को ठीक करने की कोशिश करता है, गड़बड़ी कर देता है, और सॉफ़्टवेयर फिर से क्रैश हो जाता है।

बड़ा सवाल यह है: रोबोट वास्तव में कहाँ गलत हुआ, और क्यों?

यह वह समस्या है जिसे "TrajAudit" नामक पेपर हल करने की कोशिश करता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर के विचारों का विवरण दिया गया है।

समस्या: "भूसे के ढेर में सुई" (The Needle in a Haystack)

जब रोबोट एक बग को ठीक करने की कोशिश करता है, तो वह अपने पीछे डिजिटल पदचिह्नों का एक लंबा निशान छोड़ जाता है जिसे ट्रैजेक्टरी (trajectory) कहा जाता है। इस निशान में रोबोट का हर विचार, उसके द्वारा खोली गई हर फ़ाइल, उसके द्वारा टाइप किया गया हर कमांड और उसके द्वारा देखी गई हर त्रुटि संदेश (error message) शामिल होती है।

  • भूसे का ढेर (The Haystack): ये निशान अविश्वसनीय रूप से लंबे (कभी-कभी 100+ स्टेप्स) होते हैं और "शोर" (noise) से भरे होते हैं। कल्पना कीजिए कि रोबोट एक 500 पन्नों की नियमावली पढ़ रहा है, कोड के उन पूरे अध्यायों को कॉपी कर रहा है जिनका कोई महत्व नहीं है, और एक फोल्डर में मौजूद हर एक फ़ाइल की सूची बना रहा है। यह "भूसे का ढेर" है।
  • सुई (The Needle): उस विशाल जानकारी के ढेर में कहीं न कहीं वह एक विशिष्ट क्षण है जहाँ रोबोट ने एक गलत निर्णय लिया (वह "सुई" है)।
  • पुराना तरीका: पिछले तरीके इस पूरे 500-पन्नों के मैनुअल को एक साथ पढ़ने की कोशिश करते थे ताकि गलती ढूंढी जा सके। लेकिन एक इंसान की तरह, AI इतने सारे टेक्स्ट से अभिभूत (overwhelmed) हो जाता है और स्पष्ट सुरागों को भी मिस कर देता है। यह एक उपन्यास में टाइपो (typo) खोजने के लिए एक ही सांस में पूरी किताब पढ़ने की कोशिश करने जैसा है।

समाधान: TrajAudit (जासूस)

लेखकों ने TrajAudit नामक एक नया सिस्टम बनाया है। एक रोबोट द्वारा सब कुछ एक साथ पढ़ने के बजाय, उन्होंने एक डिटेक्टिव एजेंट (Detective Agent) बनाया है जिसके पास दो विशेष सहायक हैं।

डिटेक्टिव एजेंट को एक अनुभवी अन्वेषक के रूप में समझें जो तुरंत पूरी फाइल नहीं पढ़ता है। इसके बजाय, वे दो स्मार्ट टूल्स का उपयोग करते हैं:

1. "पूर्व ज्ञान" सहायक (The Prior Knowledge Assistant - अंतर्ज्ञान)

इससे पहले कि जासूस बिखरे हुए निशान को देखे, यह सहायक त्रुटि संदेश (error message) (क्रैश रिपोर्ट) और टेस्ट कोड (नियम जिनका रोबot पालन करने में विफल रहा) को देखता है।

  • उपमा: कल्पना कीजिए कि एक जासूस अपराध स्थल पर पहुँचता है। कमरे को देखने से पहले, वह पुलिस रिपोर्ट पढ़ता है जिसमें लिखा है: "पीड़ित को जहर दिया गया था।" अब जासूस के पास एक अंतर्ज्ञान (hunch) है: "ठीक है, मुझे फर्नीचर देखने की जरूरत नहीं है; मुझे रसोई और पेय पदार्थों पर ध्यान देना चाहिए।"
  • पेपर में: यह मॉड्यूल AI को एक "प्रारंभिक निदान" (preliminary diagnosis) देता है। यह मुख्य एजेंट को बताता है, "उस हिस्से पर ध्यान केंद्रित करें जहाँ रोबोट डेटाबेस देख रहा था, न कि उस हिस्से पर जहाँ वह केवल फ़ाइलें सूचीबद्ध कर रहा था।" यह AI को शोर में खो जाने से रोकता है।

2. "सिमेंटिक सैलिएंसी फोल्डिंग" सहायक (The Semantic Saliency Folding Assistant - सारांशकर्ता)

यह सहायक लंबे, बिखरे हुए निशान को देखता है और पूछता है: "क्या जानकारी का यह टुकड़ा वास्तव में क्रैश के लिए महत्वपूर्ण है?"

  • उपमा: कल्पना कीजिए कि आपके पास एक बातचीत का 100-पन्नों का ट्रांसक्रिप्ट है। इसमें अधिकांश हिस्सा लोगों के "नमस्ते," "आप कैसे हैं," और "मुझे यह फ़ाइल चेक करने दें" कहने का है। लेकिन पेज 42 पर, कोई कहता है, "मैंने गलत फ़ाइल डिलीट कर दी!"
    • पुराना तरीका पेज 1–100 पढ़ता है।
    • यह सहायक पेज 1–41 और 43–100 को फोल्ड (छिपा) देता है, जिससे केवल महत्वपूर्ण वाक्य ही दिखाई देता है। यह "एरर लॉग्स" और "कोड बदलावों" को रखता है लेकिन उबाऊ "फ़ाइल लिस्टिंग" वाले शोर को छिपा देता है। यह निशान को छोटा और साफ बनाता है।
  • पेपर में: यह कोड परिवर्तनों और "error" या "exception" जैसे कीवर्ड्स को खोजने के लिए पैटर्न मिलान (pattern matching) का उपयोग करता है। बाकी सब कुछ एक छोटे से प्लेसहोल्डर में कंप्रेस कर दिया जाता है। यह निशान को छोटा और साफ बनाता है।

3. डिटेक्टिव एजेंट (The Detective Agent - अन्वेषक)

अब, मुख्य डिटेक्टिव एजेंट पहले सहायक से मिले अंतर्ज्ञान (hunch) और इस छोटे, साफ सारांश को देखता है।

  • "ऑन-डिमांड" ट्रिक: यदि सारांश पर्याप्त नहीं है, तो डिटेक्टिव कह सकता है, "रुको, मुझे स्टेप 3 का पूरा विवरण देखना है।" इसके बाद वह सिस्टम से उस विशिष्ट भाग को "अनफोल्ड" (खोलने) करने के लिए कहता है।
  • परिणाम: एजेंट ठीक उस स्टेप को ढूंढ लेता है जहाँ रोबोट गलत हुआ था, समझाता है कि वह क्यों गलत था, और यह सब बिना शोर से भ्रमित हुए करता है।

प्रमाण: RootSE (परीक्षा)

अपने सिस्टम को सिद्ध करने के लिए, लेखक केवल आसान कार्यों पर परीक्षण नहीं कर सकते थे। उन्हें वास्तव में एक कठिन परीक्षा की आवश्यकता थी।

  • उन्होंने RootSE नामक एक नया बेंचमार्क बनाया।
  • परीक्षा: उन्होंने 93 वास्तविक दुनिया के उदाहरण लिए जहाँ AI एजेंट सॉफ़्टवेयर बग्स को ठीक करने में विफल रहे। ये साधारण कार्य नहीं थे; ये जटिल, मल्टी-फ़ाइल काम थे जिन्होंने हजारों स्टेप्स का डेटा जेनरेट किया।
  • स्कोर: जब उन्होंने अपने नए "डिटेक्टिव" सिस्टम का पुराने तरीकों के मुकाबले परीक्षण किया:
    • सटीकता (Accuracy): नए सिस्टम ने पिछले सबसे अच्छे तरीके की तुलना में 24% अधिक बार सटीक गलती ढूंढी।
    • दक्षता (Efficiency): इसने 18% कम कंप्यूटर संसाधन (tokens) का उपयोग किया क्योंकि इसने उबाऊ हिस्सों को पढ़ने में समय बर्बाद नहीं किया।

सारांश

यह पेपर तर्क देता है कि जब AI एजेंट जटिल कोडिंग कार्यों में विफल होते हैं, तो हम उन्हें उनकी गलतियों का पूरा इतिहास नहीं दे सकते। वे अभिभूत हो जाते हैं।

TrajAudit एक AI को पढ़ने शुरू करने से पहले एक स्मार्ट फ़िल्टर और एक अच्छा अंतर्ज्ञान देने जैसा है। यह उबाऊ शोर को छिपा देता है, महत्वपूर्ण सुरागों को उजागर करता है, और AI को उस विशिष्ट क्षण पर ज़ूम करने देता है जहाँ गलती हुई थी। यह इसे यह समझने में बहुत तेज़ और सटीक बनाता है कि रोबोट क्यों विफल हुआ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →