From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws
यह शोध पत्र HarnessFix को प्रस्तुत करता है, जो एक ट्रेस-निर्देशित (trace-guided) फ्रेमवर्क है जो निष्पादन ट्रेसेस (execution traces) और हार्नेस कोड का विश्लेषण करके एजेंट की विफलताओं का निदान करता है ताकि लक्षित, सत्यापित पैच उत्पन्न किए जा सकें जो कई बेंचमार्क में LLM एजेंट की विश्वसनीयता में महत्वपूर्ण सुधार करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन कभी-कभी भ्रमित होने वाला सहायक (LLM Agent) है जो जटिल पहेलियों को हल करने की कोशिश कर रहा है, जैसे कि एक खराब कंप्यूटर प्रोग्राम को ठीक करना या यात्रा की योजना बनाना। यह सहायक अकेले काम नहीं करता है; यह इंजीनियरों द्वारा बनाए गए एक "कंट्रोल रूम" के भीतर काम करता है। इस कंट्रोल रूम को Harness कहा जाता है।
Harness उन नियमों, उपकरणों और सुरक्षा जांचों का समूह है जो सहायक को बताते हैं:
- वह किन उपकरणों का उपयोग कर सकता है (जैसे कि पेचकस या सर्च इंजन)।
- वह क्या जानकारी देख सकता है (जैसे कि मानचित्र या मैनुअल)।
- अपनी प्रगति की रिपोर्ट कैसे देनी है।
- कब रुकना है और कहना है, "मेरा काम पूरा हुआ।"
समस्या: विफलता का "ब्लैक बॉक्स"
कभी-कभी सहायक विफल हो जाता है। अतीत में, जब चीजें गलत होती थीं, तो इंजीनियर इसे ठीक करने के लिए निम्नलिखित प्रयास करते थे:
- सहायक के निर्देशों में बदलाव करना: "हे, थोड़ा अधिक सावधान रहने की कोशिश करो!" (यह एक ड्राइवर को "बेहतर गाड़ी चलाने" के लिए कहने जैसा है बिना ब्रेक ठीक किए)।
- अनुमान लगाना: अंतिम परिणाम को देखना और उम्मीद करना कि कोई यादृच्छिक (random) परिवर्तन मदद करेगा।
समस्या यह है कि ये तरीके अक्सर वास्तविक मुद्दे को पकड़ने में विफल रहते हैं। विफलता सहायक की गलती नहीं हो सकती; यह संभव है कि Harness ने सहायक को गलत उपकरण दिया हो, किसी महत्वपूर्ण त्रुटि संदेश को छिपा दिया हो, या सहायक को काम पूरा करने से पहले ही छोड़ने दिया हो। क्योंकि सहायक की क्रियाएं घटनाओं की एक लंबी, उलझी हुई श्रृंखला में होती हैं, इसलिए यह पता लगाना कठिन होता है कि कंट्रोल रूम कहाँ टूटा।
समाधान: HARNESSFIX (जासूस)
लेखकों ने इस पेपर में एक नया सिस्टम बनाया है जिसे HARNESSFIX कहा जाता है। इसे कंट्रोल रूम के लिए एक फॉरेंसिक डिटेक्टिव (फोरेंसिक जासूस) के रूप में समझें। अनुमान लगाने के बजाय, यह अपराध स्थल (विफल प्रयास) की चरण-दर-चरण जांच करता है ताकि Harness के सटीक टूटे हुए हिस्से को पाया जा सके।
यहाँ बताया गया है कि HARNESSFIX कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. "अनुवादक" (HTIR)
सबसे पहले, जासूस जो कुछ भी हुआ उसका एक अस्त-व्यस्त, भ्रमित करने वाला लॉग (जिसे "ट्रेस" कहा जाता है) और कंट्रोल रूम के कोड को लेता है और उन्हें एक साफ, व्यवस्थित मानचित्र में अनुवादित करता है जिसे HTIR कहा जाता है।
- उपमा: कल्पना करें कि एक अराजक अपराध स्थल है जहाँ सुराग बिखरे पड़े हैं। जासूस उन्हें एक स्पष्ट टाइमलाइन में व्यवस्थित करता है: "10:00 बजे, एजेंट ने एक टूल मांगा। 10:01 बजे, टूल ने एक एरर दिया। 10:02 बजे, एजेंट ने एरर को अनदेखा कर दिया।" यह मानचित्र एजेंट की क्रियाओं को सीधे उन नियमों से जोड़ता है जो उन्हें नियंत्रित करते थे।
2. "निदान" (दोषी को ढूंढना)
इसके बाद, जासूस मानचित्र को देखकर यह पता लगाता है कि श्रृंखला कहाँ टूटी।
- उपमा: जासूस पूछता है: "क्या एजेंट इसलिए विफल हुआ क्योंकि उसे पासवर्ड नहीं पता था? या इसलिए क्योंकि सुरक्षा प्रणाली (Harness) द्वारा दरवाजा बंद कर दिया गया था?"
- HARNESSFIX पहचानता है कि समस्या Tool Interface (गलत निर्देश), Lifecycle (एजेंट को बहुत जल्दी छोड़ने देना), या Observability (त्रुटि संदेशों को छिपाना) में से किसमें थी। यह आवर्ती समस्याओं के लिए एक विशिष्ट "Flaw Report" बनाता है।
3. "रिपेयर शॉप" (सीमित सुधार)
एक बार दोष की पहचान हो जाने के बाद, HARNESSFIX केवल किसी को भी पूरे कंट्रोल रूम को फिर से लिखने की अनुमति नहीं देता है। ऐसा करना खतरनाक होगा और अन्य चीजों को खराब कर सकता है। इसके बजाय, यह Repair Operators के एक सेट का उपयोग करता है।
- उपमा: इन्हें एक मैकेनिक के किट में विशिष्ट उपकरणों के रूप में सोचें। यदि समस्या एक ढीला बोल्ट है, तो मैकेनिक रिंच (wrench) का उपयोग करता है। यदि समस्या फ्लैट टायर है, तो वे जैक का उपयोग करते हैं। HARNESSFIX केवल उस विशिष्ट "रिंच" का उपयोग करता है जिसकी उस विशिष्ट दोष के लिए आवश्यकता है। यह केवल उस टूटे हुए हिस्से को ठीक करने के लिए एक छोटा, सटीक पैच लिखता है, जिससे यह सुनिश्चित होता है कि यह गलती से इंजन को खराब न कर दे।
4. "सुरक्षा निरीक्षक" (सत्यापन)
नया पैच स्थापित करने से पहले, एक सुरक्षा निरीक्षक इसकी जांच करता है।
- उपमा: निरीक्षक दो प्रश्न पूछता है:
- "क्या इस सुधार ने उस विशिष्ट समस्या को ठीक किया जिसे हमने पाया था?"
- "क्या इस सुधार ने गलती से किसी ऐसी चीज़ को खराब कर दिया जो ठीक चल रही थी?"
- यदि दूसरे प्रश्न का उत्तर "हाँ" है, तो पैच को खारिज कर दिया जाता है। यह सिस्टम को बेहतर बनाने की कोशिश में और खराब होने से रोकता है।
उन्होंने क्या पाया?
शोधकर्ताओं ने कठिन कार्यों के चार अलग-अलग प्रकारों (सॉफ्टवेयर ठीक करना, कमांड लाइन का उपयोग करना, अनुसंधान करना और ऐप्स को ऑटोमेट करना) पर इस डिटेक्टिव सिस्टम का परीक्षण किया।
- परिणाम: HARNESSFIX ने मूल सेटअप की तुलना में एजेंटों की सफलता दर में 15% से 50% तक सुधार किया।
- तुलना: इसने निम्नलिखित से बेहतर प्रदर्शन किया:
- मानव विशेषज्ञ जिन्होंने मैन्युअल रूप से कंट्रोल रूम को डिजाइन किया था।
- अन्य AI सिस्टम जिन्होंने केवल निर्देशों को बदलकर या अनुमान लगाकर खुद को ठीक करने की कोशिश की।
- खोज: उन्होंने पाया कि कई विफलताएं इसलिए नहीं थीं क्योंकि AI "मूर्ख" था, बल्कि इसलिए थीं क्योंकि "कंट्रोल रूम" में छिपे हुए दोष थे, जैसे त्रुटि संदेशों को छिपाना या AI को बहुत जल्दी छोड़ देना। HARNESSFIX ने इन छिपे हुए दोषों को खोजा और उन्हें ठीक किया।
सारांश में
HARNESSFIX एक ऐसा सिस्टम है जो एक विफल AI प्रयास को एक अपराध स्थल की तरह मानता है। यह केवल AI को दोष नहीं देता; यह उस वातावरण की जांच करता है जिसमें AI काम कर रहा था, उस विशिष्ट टूटे हुए नियम या टूल को ढूंढता है, और एक सटीक, सुरक्षित सुधार लागू करता है। यह AI के मस्तिष्क को फिर से प्रशिक्षित किए बिना या यह अनुमान लगाए बिना कि क्या गलत हुआ, इसे बहुत अधिक विश्वसनीय बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।