← नवीनतम पेपर
💬 NLP

Process-Centric Analysis of Agentic Software Systems

यह शोध पत्र 'ग्राफैक्ट्री' (Graphectory) को पेश करता है, जो एजेंटिक सॉफ्टवेयर सिस्टम के स्टोकेस्टिक निष्पादन प्रक्षेप पथों (stochastic execution trajectories) का विश्लेषण करने के लिए एक ग्राफ-आधारित ढांचा है, जो यह प्रकट करता है कि समृद्ध प्रॉम्प्ट और अधिक शक्तिशाली मॉडल जटिल तर्क पैटर्न उत्पन्न करते हैं, जबकि वास्तविक समय की निगरानी और हस्तक्षेप को सक्षम करते हैं जो समस्या समाधान दरों और दक्षता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Shuyang Liu, Yang Chen, Rahul Krishna, Saurabh Sinha, Jatin Ganhotra, Reyhan Jabbarvand

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuyang Liu, Yang Chen, Rahul Krishna, Saurabh Sinha, Jatin Ganhotra, Reyhan Jabbarvand

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टीम को काम पर रख रहे हैं जो बहुत ही प्रतिभाशाली लेकिन बिल्कुल नए इंटर्न हैं, ताकि वे कंपनी के कोडबेस में एक बहुत बड़े और जटिल सॉफ्टवेयर बग को ठीक कर सकें।

पुराने तरीके में (जिसे पेपर "Outcome-Centric" कहता है), आप केवल अंतिम परिणाम देखते। क्या उन्होंने आपको एक ठीक की हुई फाइल थमा दी? हाँ? बहुत बढ़िया, उन्हें एक स्टार मिला। नहीं? उन्हें निकाल दिया गया। आपको इस बात से कोई फर्क नहीं पड़ता कि वे वहां तक कैसे पहुंचे। क्या उन्होंने तीन दिन तक गलत फाइल को घूरते हुए बिताए? क्या उन्होंने गलत कोड डिलीट कर दिया और फिर उसे वापस डालने की कोशिश की? क्या वे घबराकर गोल-गोल चक्कर काटते रहे? अगर अंतिम फाइल ठीक हो गई, तो आपको कभी पता ही नहीं चला।

यह पेपर इन "AI इंटर्न्स" (जिन्हें Agentic Systems कहा जाता है) के काम करने के तरीके को देखने का एक नया तरीका पेश करता है। इसे "Process-Centric Analysis" कहा जाता है। केवल उनका होमवर्क चेक करने के बजाय, लेखकों ने Graphectory नामक एक टूल बनाया है ताकि वे यह देख सकें कि AI कैसे सोचता है और कार्य करता है—जैसे कि पूरी फिल्म देखना।

यहाँ पेपर के विचारों का रोजमर्रा के उदाहरणों का उपयोग करके एक सरल विवरण दिया गया है:

1. समस्या: AI का "ब्लैक बॉक्स" (Black Box)

वर्तमान AI एजेंट (जैसे SWE-agent या OpenHands) जादू के डिब्बों की तरह हैं। आप उन्हें एक समस्या देते हैं, और वे एक समाधान देते हैं। लेकिन उस डिब्बे के अंदर, वे ये सब कर सकते हैं:

  • बिना लक्ष्य के भटकना: औजार खोजने के लिए गलत दराजों में हाथ मारना।
  • गोल-गोल घूमना: जब कोई सुधार काम नहीं करता, तो बार-बार उसी को ठीक करने की कोशिश करना।
  • कदमों को छोड़ देना: कोड को ठीक करना लेकिन उसे टेस्ट करना भूल जाना।

यदि वे किस्मत से इसे ठीक कर लेते हैं, तो हम जश्न मनाते हैं। यदि वे असफल होते हैं, तो हम बस कहते हैं "यह काम नहीं किया।" हम यह सीखने का मौका खो देते हैं कि वे संघर्ष क्यों कर रहे थे।

2. समाधान: Graphectory (द "फ्लाइट रिकॉर्डर")

लेखकों ने Graphectory बनाया है। इसे AI के दिमाग का एक फ्लाइट रिकॉर्डर (ब्लैक बॉक्स) समझें, लेकिन यह केवल "क्रैश" या "सुरक्षित लैंडिंग" रिकॉर्ड करने के बजाय, पूरे उड़ान पथ (flight path) का मानचित्र बनाता है।

  • मैप (Map): यह AI के कार्यों की रैखिक सूची (Step 1, Step 2, Step 3...) को एक 3D मैप में बदल देता है।
  • कनेक्शन (Connections): यह कार्यों के बीच रेखाएं खींचता है।
    • समय की रेखाएं (Time Lines): "मैंने फाइल देखी, फिर मैंने उसे एडिट किया।"
    • संरचनात्मक रेखाएं (Structure Lines): "मैंने मुख्य फोल्डर देखा, फिर मैं एक सब-फोल्डर के अंदर गया।"
  • परिणाम: आप तुरंत देख सकते हैं कि क्या AI समाधान की ओर सीधे हाईवे पर जा रहा है या वह लूप, बैकट्रैकिंग और गलत मोड़ों के ट्रैफिक जाम में फंसा हुआ है।

3. यात्रा की "भाषा": Langutory

एक विशाल मैप को देखना भारी पड़ सकता है। इसलिए, लेखकों ने Langutory भी बनाया है।

  • उपमा: कल्पना करें कि AI की यात्रा एक लंबा वाक्य है। Langutory उस वाक्य का सारांश (Summary) है।
  • 50 स्टेप्स पढ़ने के बजाय, Langutory कहता है: "एजेंट ने 5 मिनट देखने (Localization) में बिताया, फिर 2 मिनट ठीक करने (Patching) में, फिर 1 मिनट चेक करने (Validation) में बिताया।"
  • इससे शोधकर्ता जल्दी से पहचान सकते हैं कि क्या AI ने "चेकिंग" वाला हिस्सा छोड़ दिया या उसने बिना कुछ ठीक किए 90% समय सिर्फ "देखने" में बिता दिया।

4. उन्होंने क्या खोजा (The "Aha!" Moments)

टीम ने इन 4,000 AI यात्राओं को देखा और कुछ आश्चर्यजनक बातें पाईं:

  • सफलता हमेशा कुशल नहीं होती: भले ही AI ने बग को ठीक कर दिया था, लेकिन अक्सर वह बहुत लंबा और घुमावदार रास्ता लेता था। यह एक ऐसे ड्राइवर की तरह था जो अंततः मंजिल पर तो पहुँच गया, लेकिन उसने तीन अलग-अलग राज्यों की यात्रा की और दो बार रास्ता भी भटका।
  • "स्मार्ट" AI ज्यादा भटकता है: आश्चर्यजनक रूप से, "स्मार्ट" AI मॉडल (वे जिनके पास बड़े दिमाग हैं) अक्सर अधिक खोजबीन करते थे और लंबे रास्ते लेते थे। वे उन जासूसों की तरह थे जो सुराग खोजने से पहले लाइब्रेरी की हर किताब पढ़ डालते हैं। हालांकि इससे कभी-कभी कठिन समस्याओं को हल करने में मदद मिलती थी, लेकिन यह अक्सर समय की बर्बादी थी।
  • असफलता अव्यवस्थित दिखती है: जब AI विफल हुआ, तो मैप ने अराजक पैटर्न दिखाए: बहुत सारे लूप (गोल-गोल घूमना), फाइलों के बीच बार-बार आना-जाना, और उन चीजों को ठीक करने की कोशिश करना जो टूटी नहीं थीं।

5. सुपरपावर: रियल-टाइम हस्तक्षेप (Real-Time Intervention)

इस पेपर का सबसे शानदार हिस्सा यह है कि उन्होंने केवल फिल्में नहीं देखीं; उन्होंने एक लाइव कोच (Live Coach) बनाया।

  • यह कैसे काम करता है: जैसे-जैसे AI काम कर रहा होता है, Graphectory सिस्टम वास्तविक समय में निगरानी करता है।
  • हस्तक्षेप (Intervention): यदि सिस्टम देखता है कि AI गोल-गोल घूम रहा है या कोई महत्वपूर्ण कदम (जैसे टेस्टिंग) छोड़ रहा है, तो यह AI को रोक देता है और एक डायग्नोस्टिक संदेश भेजता है: "हे, तुम 10 मिनट से इस फाइल को देख रहे हो और कुछ बदल नहीं रहे हो। तुम शायद फंस गए हो। इसके बजाय एक टेस्ट चलाने की कोशिश करो।"
  • परिणाम: जब उन्होंने इस "लाइव कोच" का उपयोग किया, तो AI ने अधिक बग्स (23% तक अधिक) ठीक किए और यह बहुत तेजी से किया। यह एक ऐसे GPS की तरह था जो कहता है, "आप गोल-गोल घूम रहे हैं, अब वापस मुड़ें," बजाय इसके कि ड्राइवर के दुर्घटनाग्रस्त होने तक इंतजार किया जाए।

सारांश

यह पेपर "क्या यह काम किया?" से बदलकर "यह कैसे काम किया?" पूछने के बारे में है।

AI की उलझी हुई विचार प्रक्रिया को एक स्पष्ट मानचित्र (Graphectory) और एक सरल सारांश (Langutory) में बदलकर, शोधकर्ता बुरी आदतों को पहचान सकते हैं, उन्हें AI के काम करते समय ही ठीक कर सकते हैं, और भविष्य के लिए स्मार्ट, अधिक कुशल सॉफ्टवेयर एजेंट बना सकते हैं। यह एक शेफ को केवल अंतिम व्यंजन के स्वाद से आंकने के बजाय, उसे काटते, पकाते और सीजन करते हुए देखने जैसा है ताकि उसकी तकनीक में सुधार किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →