Real-Time Detection and Repair of LLM Agent Failures
यह शोध पत्र माइक्रोसेकंड-स्केल टेलीमेट्री मॉनिटर्स और नियत सत्यापन (deterministic verification) का उपयोग करके LLM एजेंट विफलताओं का पता लगाने और उन्हें सुधारने के लिए एक कम-विलंबता (low-latency), दो-परतीय प्रणाली प्रस्तुत करता है, जो पारंपरिक LLM-आधारित जजिंग की तुलना में बहुत कम लागत पर कार्य सफलता दरों में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए एक ऐसी दुनिया की जहाँ कंप्यूटर केवल सवालों के जवाब ही नहीं देते, बल्कि वास्तव में काम भी करते हैं। वे डिजिटल इंटर्न या "एजेंट्स" की तरह हैं जो वेब ब्राउज़ कर सकते हैं, नंबरों का हिसाब लगा सकते हैं, और जटिल समस्याओं को हल करने के लिए टूल्स का उपयोग कर सकते हैं। लेकिन एक मानव इंटर्न की तरह, ये AI एजेंट विचलित हो सकते हैं, एक ही गलती को दोहराने के लूप में फंस सकते हैं, या आत्मविश्वास के साथ ऐसे तथ्य बना सकते हैं जो सच नहीं हैं। यह LLM एजेंट्स (लार्ज लैंग्वेज मॉडल एजेंट्स) की दुनिया है।
इन्हें ट्रैक पर रखने के लिए, हमें आमतौर पर एक सुपरवाइजर की आवश्यकता होती है। एजेंटों की निगरानी करने का पारंपरिक तरीका एक दूसरे, महंगे AI को काम पर रखना है जो पहले AI द्वारा उठाए गए हर कदम को पढ़े और कहे, "अच्छा काम किया" या "रुको, यह गलत है।" लेकिन यह एक कर्मचारी को एक-एक अक्षर टाइप करते हुए देखने के लिए एक फुल-टाइम मैनेजर रखने जैसा है; इसमें बहुत अधिक समय और पैसा खर्च होता है। वैज्ञानिक एक ही बड़ा सवाल पूछ रहे हैं: क्या हम एक छोटा, सुपर-फास्ट "वॉचडॉग" (रखवाली करने वाला) बना सकते हैं जो दूसरे AI द्वारा भारी काम किए बिना, केवल एजेंट के व्यवहार को देखकर गड़बड़ी को पकड़ ले? यह पेपर ठीक इसी समस्या में गहराई से उतरता है, यह खोजने की कोशिश करता है कि AI की गलतियों को जल्दी, सस्ते में और स्वचालित रूप से कैसे पकड़ा जाए।
पेपर की कहानी: एक माइक्रोसेकंड वॉचडॉग
यह पेपर एक चतुर सिस्टम पेश करता है जिसे AI एजेंटों के लिए एक रियल-टाइम वॉचडॉग के रूप में कार्य करने के लिए डिज़ाइन किया गया है। हर चाल का न्याय करने के लिए दूसरे AI को काम पर रखने के बजाय, लेखक ने एक हल्का मॉनिटर बनाया है जो एजेंट के "टेलीमेट्री" (telemetry) पर नज़र रखता है—यानी उसके द्वारा छोड़े गए डिजिटल पदचिह्न, जैसे कि उसने क्या कहा, उसका आत्मविश्वास कैसा था, और उसने किन टूल्स का उपयोग किया।
AI एजेंट को एक जंगल में चलने वाले हाइकर (हाइकर) के रूप में सोचें। मानक तरीका यह है कि एक हेलीकॉप्टर पायलट (दूसरा AI) ऊपर से उड़ता रहे और यह देखता रहे कि हाइकर सही रास्ते पर है या नहीं। यह पेपर एक अलग दृष्टिकोण प्रस्तावित करता है: एक छोटा, अत्यंत तीव्र ड्रोन जो हाइकर के सिर से कुछ ही फीट ऊपर उड़ता है। इस ड्रोन को पूरे जंगल को समझने की आवश्यकता नहीं है; यह केवल परेशानी के विशिष्ट संकेतों को देखता है, जैसे कि हाइकर का गोल-गोल घूमना, एक ही पत्थर से बार-बार टकराना, या अचानक रास्ते से भटक जाना।
वॉचडॉग कैसे काम करता है
लेखक ने एक ऐसा सिस्टम बनाया है जो माइक्रोसेकंड्स (लगभग 200 माइक्रोसेकंड प्रति स्टेप, जो पलक झपकने से भी तेज़ है) में चलता है। यह एक तकनीक का उपयोग करता है जिसे इको-स्टेट नेटवर्क (ESN) कहा जाता है। कल्पना कीजिए कि यह एक ड्रम है जो उसे थपथपाने पर कंपन करता है। AI एजेंट के कार्य वे थपकी (taps) हैं। यदि एजेंट सही ढंग से काम कर रहा है, तो ड्रम एक अनुमानित, लयबद्ध पैटर्न में कंपन करता है। यदि एजेंट विफल होने लगता है—शायद वह लूप में फंस रहा है या भ्रमित हो रहा है—तो लय अव्यवस्थित हो जाती है। वॉचडॉग इस लय को सुनता है और जैसे ही ताल बिगड़ती है, अलार्म बजा देता है।
पेपर का परीक्षण 2,823 वास्तविक एपिसोड्स पर किया गया जहाँ AI एजेंट कार्यों को हल करने की कोशिश कर रहे थे। उन्होंने पाया कि यह "ड्रम" विधि कुछ प्रकार की गलतियों को पकड़ने में अविश्वसनीय रूप से अच्छी है:
- लूप्स (Loops): जब एजेंट खुद को दोहराने में फंस जाता है, तो वॉचडॉग लगभग हर बार उसे पकड़ लेता है।
- टूल एरर्स (Tool Errors): जब एजेंट टूल कॉल करने में गलती करता है, तो उसे अक्सर पकड़ा जाता है।
- गोल ड्रिफ्ट (Goal Drift): जब एजेंट भूल जाता है कि उसे क्या करना है, तो वॉचडॉग इसे पकड़ लेता है।
हालाँकि, पेपर इस बारे में बहुत ईमानदार है कि वॉचडॉग क्या नहीं कर सकता है। इसकी एक "अंध बिंदु" (blind spot) है कंटेंट करप्शन (सामग्री भ्रष्टाचार) के लिए। कल्पना कीजिए कि एजेंट एक दस्तावेज़ पढ़ रहा है, लेकिन दस्तावेज़ के अंदर का टेक्स्ट गुप्त रूप से बदलकर बकवास (gibberish) से बदल दिया गया है। यदि एजेंट उस बकवास के प्रति असामान्य प्रतिक्रिया नहीं देता है (क्योंकि उसका व्यवहार—वह जो कहता है और जो करता है—अपरिवर्तित रहता है), तो वॉचडॉग इस त्रुटि के प्रति अंधा होता है। पेपर दिखाता है कि अतिरिक्त मदद के बिना, वॉचडॉग इन कंटेंट त्रुटियों को लगभग 72% बार मिस कर देता है (डिटेक्शन को परफेक्ट स्कोर से घटाकर केवल 0.28 पूल डिटेक्शन तक ले आता है)।
"ब्लाइंड स्पॉट" का समाधान
इसे ठीक करने के लिए, लेखक ने एक दूसरा स्तर जोड़ा जिसे कंटेंट-ग्राउंडिंग चैनल कहा जाता है। यह वॉचडॉग को एक आवर्धक लेंस (magnifying glass) देने जैसा है ताकि वह एजेंट द्वारा पढ़े जा रहे वास्तविक टेक्स्ट की जांच कर सके। इस जुड़ाव के साथ, कंटेंट त्रुटियों का पता लगाने की दर पूल टेस्ट में 0.28 से बढ़कर 0.59 हो गई (और विशिष्ट शोध मामलों में जहाँ भ्रष्टाचार टेक्स्ट में दिखाई दे रहा था, यह 1.00 तक पहुँच गई)।
लेकिन एक पेच है: पेपर ने पाया कि यह वॉडॉग उस AI के प्रति बहुत विशिष्ट है जिसकी वह निगरानी कर रहा है। यदि आप इसे एक प्रकार के AI (जैसे qwen2.5 मॉडल) पर प्रशिक्षित करते हैं और फिर इसे दूसरे प्रकार (जैसे llama3.1) पर उपयोग करने का प्रयास करते हैं, तो यह काम करना बंद कर देता है और रैंडम गेसिंग से बेहतर प्रदर्शन नहीं करता है। लेखक का तर्क है कि आपको हर नए AI मॉडल के लिए वॉचडॉग को "रीकैलिब्रेट" (recalibrate) करना होगा, ठीक वैसे ही जैसे आपको किसी अलग घर के लिए थर्मोस्टेट को एडजस्ट करना पड़ता है।
"ईमानदार" सीमाएँ
पेपर वादे करने में बहुत सावधान है। वे स्वीकार करते हैं कि कुछ बहुत ही पेचीदा गलतियों के लिए, जैसे कि जब कोई AI हैलुसिनेट (hallucinate) करता है (ऐसा नंबर या तथ्य बनाना जो सुनने में असली लगे लेकिन वास्तव में फर्जी हो), तो सांख्यिकीय वॉचडॉग बेकार है। एक प्री-रजिस्टर्ड अध्ययन में, उन्होंने पाया कि ये मॉडल स्वयं तथ्य कम ही बनाते हैं, और जब वे ऐसा करते हैं, तो वॉचडॉग इसे देख नहीं पाता है।
इसके बजाय, लेखक एक अलग उपकरण का सुझाव देते हैं: एक डिटरमिनिस्टिक वेरीफायर (deterministic verifier)। यह कोई स्मार्ट AI नहीं है; यह एक सरल गणित जाँचकर्ता है। यदि एजेंट कहता है, "कुल लागत 50 प्राप्त करने के लिए रसीदों को जोड़ा है?" यदि गणित मेल नहीं खाता है, तो वह इसे फ्लैग करता है। इस पद्धति ने उनके प्रेरित परीक्षणों में 100% निर्मित संख्याओं (fabricated numbers) को पकड़ा, जिसमें शून्य गलत अलार्म (false alarms) थे। (नोट: प्राकृतिक, अनप्रोवोक्ड सेटिंग्स में, अध्ययन इतना छोटा था कि निश्चित दावा नहीं किया जा सके, लेकिन विधि को इन त्रुटियों के होने पर उन्हें पकड़ने के लिए डिज़ाइन किया गया है)।
"रिपेयर" (मरम्मत) तंत्र
पेपर का सबसे अच्छा हिस्सा केवल त्रुटि को पकड़ना नहीं है; बल्कि उसे ठीक करना है। जब वॉचडॉग अलार्म बजाता है, तो सिस्टम केवल एजेंट को रोकता नहीं है। यह एजेंट को उस अंतिम चरण पर रोल बैक (rollback) करता है जहाँ सब कुछ सही था और इसे फिर से प्रयास करने देता है।
इसे एक वीडियो गेम के "चेकपॉइंट" (checkpoint) की तरह समझें। यदि आप गड्ढे में गिर जाते हैं, तो आप पूरा लेवल फिर से शुरू नहीं करते; आप पिछले सुरक्षित स्थान पर वापस जाते हैं और एक अलग रास्ता आज़माते हैं।
- वॉचडॉग और रिपेयर के साथ: एजेंट 73% बार सफल होता है।
- रिपेयर के बिना (केवल रीसैंपलिंग): एजेंट केवल 52% बार सफल होता है।
लेखक ने पाया कि एजेंट को सुधारने का सबसे प्रभावी तरीका उसे ठीक से बताना है कि कौन सा चेक विफल हुआ (उदाहरण के लिए, "आपने एक टूल कॉल मिस कर दिया") न कि केवल यह कहना कि "फिर से प्रयास करें।" इस विशिष्ट निर्देश ने केवल 45% विफलताओं को रिकवर करने में मदद की, जबकि केवल अंधे होकर फिर से प्रयास करने पर यह केवल 16% था।
निष्कर्ष
यह पेपर साबित करता है कि हमें अपने एजेंटों की निगरानी के लिए दूसरे, महंगे AI की आवश्यकता नहीं है। हम एक छोटा, तेज़, माइक्रोसेकंड-स्पीड मॉनिटर उपयोग कर सकते हैं जो अधिकांश गलतियों को पकड़ने के लिए एजेंट की लय को सुनता है। यह परफेक्ट नहीं है—इसे हर नए AI मॉडल के लिए रीकैलिब्रेट करने की आवश्यकता होती है, और यह हर झूठ को नहीं पकड़ सकता—लेकिन जब यह काम करता है, तो यह बहुत सारा समय और पैसा बचाता है। और जब यह किसी गलती को पकड़ लेता है, तो यह एजेंट को एक सुरक्षित स्थान पर रोल बैक कर सकता है और उसे सफल होने में मदद कर सकता है, जिससे सफलता दर 52% से बढ़कर 73% हो जाती है।
लेखक का निष्कर्ष है कि हालांकि यह वॉचडॉग एक शक्तिशाली पहली रक्षा पंक्ति है, यह उन विशिष्ट प्रकार के झूठों के लिए सरल, गैर-AI जाँचों (जैसे गणित वेरीफायर) के साथ मिलकर सबसे अच्छा काम करता है जिन्हें वह देख नहीं सकता। यह एक टीम वर्क है: तेज़ वॉचडॉग व्यवहार को संभालता है, और सरल गणित जाँच तथ्यों को संभालती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।