← नवीनतम पेपर
💬 NLP

TraceSIR: A Multi-Agent Framework for Structured Analysis and Reporting of Agentic Execution Traces

TraceSIR एक मल्टी-एजेंट फ्रेमवर्क है जो डेटा को कंप्रेस करने, सूक्ष्म-स्तरीय मूल कारण विश्लेषण (root cause analysis) करने और कार्रवाई योग्य रिपोर्ट तैयार करने के लिए विशिष्ट एजेंटों का उपयोग करके जटिल एजेंटिक निष्पादन ट्रेसेस (execution traces) के विश्लेषण की चुनौतियों का समाधान करता है, जो नए पेश किए गए TraceBench और ReportEval बेंचमार्क पर उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Shu-Xun Yang, Cunxiang Wang, Haoke Zhang, Wenbo Yu, Lindong Wu, Jiayi Gui, Dayong Yang, Yukuo Cen, Zhuoer Feng, Bosi Wen, Yidong Wang, Lucen Zhong, Jiamin Ren, Linfeng Zhang, Jie Tang

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shu-Xun Yang, Cunxiang Wang, Haoke Zhang, Wenbo Yu, Lindong Wu, Jiayi Gui, Dayong Yang, Yukuo Cen, Zhuoer Feng, Bosi Wen, Yidong Wang, Lucen Zhong, Jiamin Ren, Linfeng Zhang, Jie Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ TraceSIR पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

🕵️‍♀️ समस्या: AI एजेंट्स का "ब्लैक बॉक्स" (Black Box)

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान रोबोट सहायक (एक AI Agent) को एक जटिल रहस्य सुलझाने के लिए काम पर रखा है, जैसे कि किसी धुंधले विवरण के आधार पर एक विशिष्ट टीवी शो ढूँढना।

वह रोबोट तुरंत उत्तर नहीं देता। वह एक लंबी यात्रा पर निकलता है:

  1. वह सोचता है, "शायद यह वह शो है?"
  2. वह इंटरनेट पर खोज करता है।
  3. वह एक विकिपीडिया पेज पढ़ता है।
  4. वह भ्रमित हो जाता है, एक अलग खोज करने की कोशिश करता है, और 50 और पेज पढ़ता है।
  5. अंत में, वह आपको उत्तर देता है: "Tell Me What You Saw."

समस्या: कभी-कभी वह रोबोट गलत हो जाता है। यदि आप केवल अंतिम उत्तर देखते हैं, तो आपको पता नहीं चलता कि वह क्यों विफल हुआ। क्या उसने गलत चीज़ खोजी? क्या उसने किसी सुराग को गलत समझा? क्या उसका ध्यान भटक गया था?

वास्तविक दुनिया में, ये "यात्राएँ" (जिन्हें execution traces कहा जाता है) हजारों पन्नों लंबी हो सकती हैं।

  • मानवीय समीक्षक (Human Reviewers) हर गलती के लिए 50,000 पन्नों के लॉग्स नहीं पढ़ सकते। इसमें बहुत समय लगता है।
  • मानक AI टूल्स (Standard AI Tools) एक बार में ही पूरी चीज़ पढ़ने की कोशिश करते हैं, लेकिन वे अभिभूत (overwhelmed) हो जाते हैं (जैसे आग की बौछार से पानी पीने की कोशिश करना) और गलत जानकारी देने लगते हैं या बकवास जवाब देने लगते हैं।
  • वर्तमान तरीके (Current Methods) अक्सर केवल अंतिम स्कोर (पास/फेल) देखते हैं, बिना उस व्यवहार को समझे जिसके कारण विफलता हुई।

🛠️ समाधान: TraceSIR (जासूसी टीम)

लेखकों ने TraceSIR बनाया है, जो AI की गलतियों के लिए एक विशेष जासूसी एजेंसी की तरह काम करता है। एक व्यक्ति द्वारा सब कुछ करने के बजाय, वे मिलकर काम करने वाले तीन विशेष AI एजेंट्स की एक टीम का उपयोग करते हैं।

इसे एक तीन-सदस्यीय जांच इकाई (investigative unit) के रूप में समझें:

1. सारांशकर्ता (Summarizer - StructureAgent) 📝

कार्य: कच्चा डेटा (raw data) एक अव्यवस्थित, 50,000 पन्नों का उपन्यास है। सारांशकर्ता वह संपादक है जो इसे एक संरचित कॉमिक बुक (structured comic book) में बदल देता है।

  • यह कैसे काम करता है: यह लंबे, उबाऊ लॉग्स को लेता है और उन्हें एक साफ, 3-कॉलम प्रारूप में बदल देता है: Thought (रोबोट क्या सोच रहा था), Action (उसने क्या किया), और Observation (आगे क्या हुआ)।
  • जादू: यह अनावश्यक चीज़ों (जैसे लंबे कोड स्निपेट्स या दोहराव वाली खोजों) को हटा देता है लेकिन महत्वपूर्ण सुरागों को बनाए रखता है। यह डेटा की "आग की बौछार" को एक "पानी की बोतल" में बदल देता है जिसे पीना आसान है।

2. निदानकर्ता (Diagnostician - InsightAgent) 🩺

कार्य: यह वह डॉक्टर है जो सारांशकर्ता द्वारा बनाए गए "कॉमिक बुक" की जांच करता है।

  • यह कैसे काम करता है: यह विशिष्ट मामले को देखता है और पूछता है: "रोबोट कहाँ गलत हुआ?"
    • क्या उसने कोई तार्किक छलांग (logical leap) लगाई?
    • क्या उसने अपने द्वारा उपयोग किए जा रहे टूल को गलत समझा?
    • मूल कारण (Root Cause) क्या है? (जैसे, "रोबोट इसलिए विफल हुआ क्योंकि उसने शो के शीर्षक के बजाय अभिनेता के नाम को खोजा।")
  • आउटपुट: यह केवल "त्रुटि (Error)" नहीं कहता। यह निदान और इसे ठीक करने के नुस्खे के साथ एक विस्तृत मेडिकल रिपोर्ट देता है।

3. रिपोर्टर (Reporter - ReportAgent) 📊

कार्य: कल्पना कीजिए कि आपके पास 100 अलग-अलग कार्यों में विफल होने वाले 100 रोबोट हैं। रिपोर्टर उन सभी को एक साथ देखता है ताकि पैटर्न खोज सके।

  • यह कैसे काम करता है: यह निदानकर्ता से प्राप्त निदानों को एकत्रित करता है।
    • "हे, 40% रोबेक्ट्स इसलिए विफल हुए क्योंकि वे तारीखों से भ्रमित हो गए थे।"
    • "यहाँ एक ट्रेंड है: जब कार्य को कोडिंग से संबंधित होता है, तो रोबोट बहुत जल्दी हार मान लेते हैं।"
  • आउटपुट: यह एक व्यापक उद्योग रिपोर्ट (Markdown में) लिखता है जिसका उपयोग इंजीनियर सिस्टम को बेहतर बनाने के लिए कर सकते हैं। इसमें सांख्यिकी, सामान्य विफलता पैटर्न और सुधार के लिए विशिष्ट सुझाव शामिल होते हैं।

🏆 प्रमाण: TraceBench और ReportEval

अपने सिस्टम को सिद्ध करने के लिए, टीम ने TraceBench नामक एक परीक्षण मैदान बनाया।

  • उन्होंने तीन अलग-अलग प्रकार के AI कार्यों से 150 वास्तविक दुनिया के विफलता मामलों को लिया: Deep Research (जानकारी ढूँढना), Function Calling (टूल्स का उपयोग करना), और Coding (सॉफ्टवेयर लिखना)।
  • उन्होंने रिपोर्टों को ग्रेड करने का एक नया तरीका बनाया जिसे ReportEval कहा जाता है। केवल यह जाँचने के बजाय कि रिपोर्ट मौजूद है या नहीं, उन्होंने पूछा: "क्या यह रिपोर्ट उपयोगी है? क्या मूल कारण सटीक है? क्या सुझाव कार्रवाई योग्य (actionable) हैं?"

परिणाम:
जब उन्होंने वर्तमान उद्योग मानक (ClaudeCode) के साथ TraceSIR की तुलना की, तो TraceSIR ने स्पष्ट जीत हासिल की।

  • बेहतर निदान: इसने विफलता के वास्तविक कारणों को पाया, न कि केवल सतही त्रुटियों को।
  • बेहतर रिपोर्ट: उनकी रिपोर्ट अधिक स्पष्ट, तार्किक थी और वास्तव में इंजीनियरों को समस्याओं को ठीक करने में मदद करती थी।
  • स्केलेबिलिटी (Scalability): यह भारी मात्रा में डेटा को संभाल सकता था जिससे अन्य सिस्टम क्रैश हो सकते थे।

💡 बड़ी तस्वीर

TraceSIR एक "ब्लैक बॉक्स" (जहाँ चीजें बस होती हैं और हम अनुमान लगाते हैं कि क्यों हुईं) से "ग्लास बॉक्स" (जहाँ हम चलते हुए गियर्स को देख सकते हैं, टूटे हुए गियर को पहचान सकते हैं और उसे ठीक कर सकते हैं) में अपग्रेड करने जैसा है।

यह बहुत अधिक डेटा की समस्या को सारांशित करके, बहुत अधिक जटिलता को विभाजित करके और बहुत अधिक शोर (noise) को सिग्नल में बदलकर हल करता है। यह AI लॉग्स के अराजक ढेर को बेहतर AI सिस्टम बनाने के लिए एक स्पष्ट, कार्रवाई योग्य रोडमैप में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →