AgentTrails: Towards Trust and Reuse for Agentic Tasks
AgentTrails एक प्रोटोटाइप सिस्टम है जो LLM-संचालित एजेंटों के कच्चे कालानुक्रमिक लॉग्स को संरचित प्रोवेनेंस ग्राफ में बदल देता है ताकि छिपे हुए डेटा डिपेंडेंसीज को प्रकट करके, निष्पादन तुलना को सक्षम करके, और पैटर्न एक्सट्रैक्शन एवं स्किल एब्स्ट्रैक्शन का समर्थन करके विश्वास और पुन: उपयोग को बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े अराजक शेफ को एक जटिल भोजन बनाते हुए देख रहे हैं। आप देख सकते हैं कि शेफ सामग्री उठा रहा है, काट रहा है, मिला रहा है और प्लेट सजा रहा है, लेकिन आपके पास केवल शेफ के बाएं से दाएं चलते हाथों का एक वीडियो है। आप जानते हैं कि क्या हुआ, लेकिन आप यह नहीं जानते कि शेफ ने काली मिर्च के बाद नमक क्यों उठाया, या क्या तीसरे चरण में उन्होंने जो सॉस बनाया था उसका वास्तव में अंतिम व्यंजन में उपयोग किया गया था, या क्या उन्होंने बस सूप का एक पूरा अतिरिक्त बैच बना दिया जिसे किसी ने नहीं खाया। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन "शेफ" को LLM-पावर्ड एजेंट कहा जाता है। ये कंप्यूटर प्रोग्राम हैं जो कठिन समस्याओं को हल करने के लिए टूल्स (जैसे वेब खोजना, कोड चलाना, या फाइलें पढ़ना) का उपयोग करते हैं—ठीक वैसे ही जैसे एक इंसान करता है।
जब ये एजेंट काम करते हैं, तो वे अपने द्वारा किए गए हर एक काम की एक लंबी, अस्त-व्यset सूची पीछे छोड़ देते हैं, जो क्रमवार लिखी होती है। इसे एक ट्रैजेक्टरी (trajectory) कहा जाता है। इसे एक डायरी प्रविष्टि की तरह समझें जो कहती है, "पहले मैंने यह किया, फिर मैंने वह किया, फिर मैंने यह अन्य चीज़ की।" समस्या यह है कि जबकि यह डायरी घटनाओं का क्रम बताती है, यह असली कहानी को छिपा देती है: एक क्रिया को अगली क्रिया से जोड़ने वाले अदृश्य धागे। यह देखना कठिन है कि कौन सा कदम पिछले कदम पर निर्भर था, या क्या एजेंट भ्रमित हो गया और गलत रास्ते पर निकल गया। इन कनेक्शनों को देखे बिना, एजेंट की गलतियों को ठीक करना, अच्छे उदाहरणों से सीखना, या यह विश्वास करना कि एजेंट ने वास्तव में अपना काम सही ढंग से किया है, लगभग असंभव है।
यहीं पर AgentTrails नामक एक नया प्रोजेक्ट आता है। इसके पीछे के शोधकर्ताओं ने, जो न्यूयॉर्क यूनिवर्सिटी की एक टीम है, महसूस किया कि केवल कालानुक्रमिक (chronological) डायरी पढ़ना पर्याप्त नहीं है। वे उस अव्यवस्थित सूची को एक स्पष्ट, दृश्य मानचित्र (visual map) में बदलना चाहते थे। उनका लक्ष्य एक ऐसा सिस्टम बनाना था जो एजेंट के कार्यों के कच्चे, उबाऊ लॉग को देख सके और स्वचालित रूप से छिपे हुए "फैमिली ट्री" (निर्भरता के ढांचे) का पुनर्निर्माण कर सके। वे दिखाना चाहते थे कि किस टूल कॉल ने एक विशिष्ट फ़ाइल बनाई, उस फ़ाइल का उपयोग अगले चरण के लिए एक सामग्री के रूप में कहाँ किया गया, और एजेंट कहाँ से पटरी से उतर गया।
यह पेपर AgentTrails को प्रस्तुत करता है, जो इन AI एजेंटों के लिए एक जासूस की तरह काम करने वाला एक प्रोटोटाइप सिस्टम है। केवल घटनाओं की सूची दिखाने के बजाय, AgentTrails कच्चे टेक्स्ट लॉग को एक प्रोवेनेंस ग्राफ (provenance graph) में बदल देता है। कल्पना कीजिए कि आप उस अराजक किचन वीडियो को एक फ्लोचार्ट में बदल रहे हैं जहाँ प्रत्येक सामग्री एक 'नोड' है और प्रत्येक खाना पकाने का चरण उन्हें जोड़ने वाला एक 'एरो' (तीर) है। यह अदृश्य निर्भरताओं को दृश्यमान बनाता है। सिस्टम केवल अनुमान नहीं लगाता; यह टेक्स्ट में सुराग ढूंढता है, जैसे फ़ाइल नाम, आईडी, या विशिष्ट मान (values) जो एक चरण में दिखाई देते हैं और बाद के चरण में संदर्भित होते हैं, ताकि उनके बीच रेखाएं खींची जा सकें।
लेकिन जादू केवल एक एजेंट तक ही सीमित नहीं है। शोधकर्ताओं ने विभिन्न एजेंटों की तुलना करने या एक ही एजेंट द्वारा एक ही कार्य को कई बार करने की समस्या को भी हल किया। चूंकि AI थोड़ा इंसान जैसा है, इसलिए यह एक ही पहेली को थोड़े अलग क्रम में हल कर सकता है या एक बार रास्ता भटक सकता है और अगली बार शॉर्टकट ले सकता है। AgentTrails इन कई "मानचित्रों" को ले सकता है और उन्हें एक जॉइंड कॉशिएंट ग्राफ (joined quotient graph) में जोड़ सकता है। इसे एक ही पहाड़ पर हाइकर्स द्वारा लिए गए विभिन्न रास्तों को एक के ऊपर एक रखने के रूप में सोचें। सिस्टम मुख्य मार्ग को उजागर करता है जिसका उपयोग सभी ने किया (सामान्य, सफल वर्कफ़्लो) और उन छोटे साइड पाथ्स को दिखाता है जहाँ कुछ हाइकर्स खो गए या अनावश्यक चक्कर काटते रहे। यह डेवलपर्स को उन "सर्वोत्तम प्रथाओं" और "बुरी आदतों" को पहचानने में मदद करता है जो केवल एक-एक करके लॉग देखने पर छिपी रहती हैं।
टीम ने वास्तविक दुनिया के उदाहरणों पर इस सिस्टम का परीक्षण किया। एक परिदृश्य में, उन्होंने हाइड्रोजन परमाणुओं के बारे में भौतिकी की समस्या को हल करने वाले एक एजेंट को देखा। कच्चा लॉग केवल संख्याओं और टूल कॉल्स की एक लंबी स्ट्रिंग थी, लेकिन AgentTrails ने एक स्पष्ट पैटर्न दिखाया: एजेंट ने कई स्वतंत्र स्थिरांक (constants) की गणना की, एक विशिष्ट मान खोजने के लिए उन्हें मिलाया, और फिर उस मान का उपयोग अंतिम उत्तर की गणना करने के लिए किया। दूसरे परीक्षण में, उन्होंने जीन डेटा का पता लगाने वाले एक एजेंट का विश्लेषण किया। एक "हाई-स्कोरिंग" (सफल) रन की तुलना एक "लो-स्कोरिंग" (विफल) रन से करके, जॉइंड ग्राफ ने दिखाया कि सफल एजेंट ने एक सीधा रास्ता अपनाया, जबकि विफल एजेंट ने अनावश्यक साइड ट्रिप्स लीं और ऐसे अतिरिक्त टूल कॉल्स किए जिनसे कोई मदद नहीं मिली।
पेपर सुझाव देता है कि यह दृष्टिकोण AI एजेंटों को अधिक विश्वसनीय और डिबग करने में आसान बनाने की दिशा में एक आशाजनक कदम है। हालाँकि, लेखक सावधानीपूर्वक नोट करते हैं कि यह अभी प्रारंभिक कार्य है। उन्होंने अभी तक यह साबित नहीं किया है कि उनका सिस्टम हर एक कनेक्शन खोजने में पूरी तरह सक्षम है, और वे अभी भी इस पर काम कर रहे हैं कि इसे एक साथ हजारों जटिल कार्यों को संभालने के लिए कैसे स्केल किया जाए। उन्होंने यह दिखाने के लिए उदाहरणों के एक छोटे सेट को मैन्युअल रूप से एनोटेट किया है कि यह काम करता है, लेकिन इन मानचित्रों को बड़े पैमाने पर स्वचालित रूप से सत्यापित करने का बड़ा सवाल अभी भी खुला है।
अंततः, AgentTrails AI को देखने का एक नया तरीका प्रदान करता है। इन एजेंटों को ब्लैक बॉक्स के रूप में मानने के बजाय जो केवल उत्तर उगलते हैं, यह बॉक्स को खोलने और उसके अंदर घूमते गियर्स को दिखाने का प्रयास करता है। एक साधारण टाइमलाइन को एक समृद्ध, परस्पर जुड़े मानचित्र में बदलकर, यह डेवलपर्स को यह समझने, तुलना करने और उनके सोचने और काम करने के तरीके को बेहतर बनाने के उपकरण देता है। यह केवल शो देखने से हटकर पर्दे के पीछे की स्क्रिप्ट को समझने की ओर एक कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।