FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search
यह शोध पत्र FALAT का प्रस्ताव करता है, जो एक नैदानिक ढांचा (diagnostic framework) है जो LLM एजेंट प्रक्षेप पथों (trajectories) में विफलता के आरोपण (failure attribution) में सुधार करता है, जो समस्या को त्रुटि-प्रवर्तक चरणों और उन चरणों के बीच अंतर करने के लिए एक निर्भरता-निर्देशित खोज (dependency-guided search) के रूप में रूपरेखा देता है जो केवल पूर्व की गलतियों को प्रसारित कर रहे हैं, जिससे जिम्मेदार एजेंटों और निर्णायक विफलता चरणों की पहचान करने में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक जटिल पहेली को हल करने के लिए काम करने वाले अत्यधिक बुद्धिमान रोबोटों की एक टीम है, जैसे कि कोई सॉफ़्टवेयर लिखना या यात्रा की योजना बनाना। वे एक-दूसरे से बात करते हैं, उपकरणों का उपयोग करते हैं और घटनाओं की एक लंबी श्रृंखला में निर्णय लेते हैं। हम इस श्रृंखला को एक "ट्रैजेक्टरी" (trajectory) कहते हैं।
कभी-कभी, टीम विफल हो जाती है। अंतिम परिणाम गलत होता है। लेकिन क्योंकि श्रृंखला बहुत लंबी है और रोबोट बहुत अधिक बातें करते हैं, यह समझना अविश्वसनीय रूप से कठिन हो जाता है कि किसने गलती की और यह कब हुई।
यहाँ समस्या है: यदि रोबोट A शुरुआत में एक छोटी सी गलती करता है, तो रोबोट B उस गलती के आधार पर कुछ ऐसा कर सकता है जो पूरी तरह से तार्किक लगे। फिर रोबोट C कुछ और कर सकता है जो तार्किक भी दिखता है, लेकिन वास्तव में वह गलत है क्योंकि वह रोबोट B की त्रुटि पर निर्मित है। अंत तक पहुँचते-पहुँचते, पूरी चीज़ खराब हो जाती है, लेकिन हर एक कदम उस समय बिल्कुल उचित लग रहा था। यह "टेलीफोन" के खेल जैसा है जहाँ संदेश बिगड़ जाता है, लेकिन हर कोई आश्वस्त है कि उसने सही सुना है।
समाधान: FALAT (डिटेक्टिव फ्रेमवर्क)
लेखकों ने एक उपकरण बनाया जिसे FALAT कहा जाता है ताकि इन रोबोट टीमों के लिए एक जासूस के रूप में कार्य किया जा सके। केवल अंतिम गड़बड़ी को देखकर और अनुमान लगाने के बजाय, FALAT मूल कारण का पता लगाने के लिए एक चतुर चार-चरणीय प्रक्रिया का उपयोग करता है।
FALAT कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:
1. "आदर्श पटकथा" (खोज स्थान का निर्माण) - The "Ideal Script" (Constructing the Search Space)
मेसी वास्तविकता को देखने से पहले, FALAT एक "आदर्श पटकथा" लिखता है कि कार्य कैसे होना चाहिए था। यह लक्ष्य, नियम और एक अच्छे रोबोट को क्या करना चाहिए, यह जानता है।
- उपमा: कल्पना कीजिए कि एक फिल्म निर्देशक जानता है कि फिल्म का दृश्य वास्तव में कैसा होना चाहिए। जब अभिनेता गलती करते हैं, तो निर्देशक केवल अराजकता को नहीं देखता; वे वास्तविक फिल्मांकन की तुलना पटकथा से करते हैं ताकि यह देख सकें कि अभिनेता पथ से कहाँ भटक गए।
- यह क्यों महत्वपूर्ण है: यदि आप केवल रोबोटों के अपने तर्क को देखते हैं, तो आप एक ही गलती के लिए तर्क देने के कारण धोखा खा सकते हैं। FALAT एक बाहरी दृष्टिकोण (पटकथा) का उपयोग करता है ताकि वस्तुनिष्ठ बना रहे।
2. "ज़ूम लेंस" (पदानुक्रमित प्रतिनिधित्व) - The "Zoom Lens" (Hierarchical Representation)
रोबोट का इतिहास सैकड़ों चरणों लंबा हो सकता है। हर एक शब्द पढ़ना धीमा और भ्रमित करने वाला है। FALAT पहले ज़ूम आउट करता है, फिर ज़ूम इन करता है।
- उपमा: एक जंगल को देखने के बारे में सोचें। पहले, आप पूरे जंगल को हेलीकॉप्टर से देखते हैं ताकि यह देख सकें कि कौन सा क्षेत्र बीमार दिख रहा है (उच्च स्तर)। फिर आप ज़ूम करते हैं ताकि यह देख सकें कि कौन सा पेड़ों का समूह प्रभावित है (मध्य स्तर)। अंत में, आप विशिष्ट पत्तों का निरीक्षण करने के लिए नीचे उतरते हैं (निम्न स्तर)।
- यह क्यों महत्वपूर्ण है: यह FALAT को विवरणों में खो जाने से रोकता है। यह खोज को पहले संदिग्ध "पड़ोसों" तक सीमित कर देता है।
3. "कस्टडी की श्रृंखला" (टाइप्ड डिपेंडेंसीज़) - The "Chain of Custody" (Typed Dependencies)
यह सबसे महत्वपूर्ण हिस्सा है। FALAT केवल आखिरी बोलने वाले व्यक्ति को दोष नहीं देता है। यह डिपेंडेंसीज़ (कौन किस पर निर्भर था) का पता लगाता है।
- उपमा: एक रिले रेस की कल्पना करें जहाँ कोई बैटन गिरा देता है।
- स्रोत (The Source): वह धावक जिसने इसे गिराया।
- प्रसारक (The Propagator): अगला धावक जिसने बैटन उठाया और दौड़ना जारी रखा, भले ही वह टूटा हुआ था।
- लक्षण (The Symptom): फिनिश लाइन पर पहुँचने वाला धावक जो देरी से पहुँचा।
FALAT विशेष लेबल (जैसे "फॉलो-अप," "सुधार," या "डेड-एंड") का उपयोग यह अंतर करने के लिए करता है कि किसने बैटन गिराया और वे लोग जिन्होंने केवल टूटे हुए बैटन को लेकर दौड़ा। यह उन लोगों को अनदेखा कर देता है जो केवल वही दोहरा रहे थे जो पहले कहा जा चुका था या जिन्होंने वास्तव में अंतिम परिणाम को प्रभावित नहीं किया।
4. "क्या-अगर" परीक्षण (सत्यापन) - The "What-If" Test (Verification)
एक बार जब FALAT के पास एक संदिग्ध आ जाता है, तो वह केवल उसे गिरफ्तार नहीं करता। वह एक सिमुलेशन चलाता है।
- उपमा: जासूस पूछता है, "यदि हम पीछे जाकर केवल इस एक चरण को ठीक कर देते, तो क्या पूरी फिल्म सही हो जाती?"
- यदि चरण 3 को ठीक करने से अंतिम परिणाम एकदम सही हो जाता है, तो चरण 3 निर्णायक चरण (Decisive Step) है।
- यदि चरण 3 को ठीक करने के बाद भी फिल्म खराब रहती है, तो चरण 3 असली अपराधी नहीं था; त्रुटि इससे पहले हुई थी।
क्या यह काम करता है?
लेखकों ने FALAT का परीक्षण "Who & When" नामक एक बेंचमार्क पर किया, जिसमें रोबोट टीमों की विफलता के कई उदाहरण शामिल हैं।
- परिणाम: अन्य तरीकों की तुलना में FALAT सटीक रूप से उस चरण को खोजने में बहुत बेहतर था जहाँ त्रुटि शुरू हुई थी।
- संख्या: जटिल, हाथ से बनाए गए विफलता के मामलों में, FALAT लगभग 29% बार सही चरण ढूंढ पाया, जबकि अगली सबसे अच्छी विधि केवल लगभग 17% बार सफल रही। सरल, कंप्यूटर-जनरेटेड कहानियों पर, यह 46% बार सही रहा।
- निष्कर्ष: भले ही 29% कम सुनाई दे, लेकिन "घास के ढेर में सुई खोजने" के इस क्षेत्र में, यह एक बड़ा सुधार है। यह साबित करता है कि आप केवल एक स्मार्ट AI से यह अनुमान लगाने के लिए नहीं कह सकते कि किसने गलती की; आपको डिपेंडेंसीज़ को ट्रैक करने और "क्या-अगर" परिदृश्यों का परीक्षण करने के लिए एक संरचित तरीके की आवश्यकता है।
सारांश
FALAT एक डायग्नोस्टिक टूल है जो श्रृंखला के अंतिम व्यक्ति को दोष देने से रोकता है। इसके बजाय, यह:
- जानता है कि चीजें कैसे काम करनी चाहिए।
- संदिग्ध क्षेत्रों पर ज़ूम करता है।
- सूचना के प्रवाह को ट्रैक करता है ताकि मूल त्रुटि को उसके परिणामों से अलग किया जा सके।
- परीक्षण करता है कि क्या उस एक चरण को ठीक करने से काम बन जाएगा।
यह एक बिखरी हुई, भ्रमित करने वाली विफलता को एक तार्किक जांच में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।