Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents
यह शोध पत्र 'इनसाइट्स जनरेटर' (IG) को प्रस्तुत करता है, जो एक मल्टी-एजेंट सिस्टम है जो बड़े पैमाने पर निष्पादन ट्रेस कॉर्पोरा (execution trace corpora) का व्यवस्थित रूप से विश्लेषण करके साक्ष्य-आधारित प्राकृतिक भाषा अंतर्दृष्टि (natural language insights) उत्पन्न करके LLM एजेंट विफलताओं के निदान को स्वचालित करता है, जो यह दिखाया गया है कि यह एजेंट के प्रदर्शन में महत्वपूर्ण सुधार करता है और गहराई एवं कवरेज में मैन्युअल नैदानिक विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप बहुत बुद्धिमान, लेकिन कभी-कभी भ्रमित होने वाले रोबोट सहायकों की एक टीम के प्रबंधक हैं। ये रोबोट जटिल पहेलियाँ सुलझाने की कोशिश कर रहे हैं, जैसे स्प्रेडशीट को व्यवस्थित करना या कठिन विज्ञान संबंधी प्रश्नों के उत्तर देना। कभी-कभी वे सही उत्तर देते हैं; अन्य बार वे विफल हो जाते हैं।
समस्या: "भूसे के ढेर में सुई" (Needle in a Haystack) डिबगिंग
अभी, जब कोई रोबोट विफल होता है, तो मानव प्रबंधक यह समझने की कोशिश करते हैं कि ऐसा क्यों हुआ, लेकिन वे रोबोट के काम के कुछ विशिष्ट उदाहरणों को देखकर ऐसा करते हैं। यह एक कार के इंजन से आने वाली अजीब आवाज़ को समझने की कोशिश करने जैसा है जैसे कि केवल एक कार को चलते हुए सुनकर। आप एक झटके की आवाज़ सुन सकते हैं, लेकिन आप उस पैटर्न को मिस कर देते हैं जो सभी कारों में तब आता है जब वे बारिश के दिन बाएं मुड़ती हैं।
क्योंकि रोबट भारी मात्रा में डेटा (प्रत्येक कार्य के लिए "विचारों" और कार्यों के हजारों पृष्ठ) उत्पन्न करते हैं, इसलिए मनुष्य इसे पूरा नहीं पढ़ सकते। वे एक छोटे से नमूने के आधार पर अनुमान लगाते हैं। इसका मतलब है कि वे "साइलेंट फेलियर्स" (silent failures) को मिस कर देते हैं—ऐसी गलतियाँ जहाँ रोबोट कार्य को बिना क्रैश हुए पूरा तो कर देता है, लेकिन वह गलत तरीके से करता है।
समाधान: "इनसाइट्स जनरेटर" (Insights Generator - IG)
लेखकों ने एक नया सिस्टम बनाया है जिसे इनसाइट्स जनरेटर (IG) कहा जाता है। इसे एक अकेले जासूस के रूप में नहीं, बल्कि एक विशेषज्ञ जासूसी एजेंसी के रूप में सोचें जिसके पास "भूसे के ढेर में सुई" वाली समस्या को हल करने के लिए एक विशिष्ट वर्कफ़्लो है।
यह एजेंसी इस प्रकार काम करती है:
- द ऑर्केस्ट्रेटर (एजेंसी मैनेजर): यह बॉस है। यह खुद खुदाई नहीं करता है। इसके बजाय, यह बड़े परिदृश्य को देखता है और तय करता है कि किस प्रकार की जांच की आवश्यकता है।
- द स्काउट्स (एक्सप्लोरर्स): इन एजेंटों को रोबोट के काम के एक छोटे, यादृच्छिक नमूने को देखने के लिए भेजा जाता है। इनका काम व्यापक और जिज्ञासु होना है। वे अजीब पैटर्न देखते हैं और सिद्धांत (theories) बनाते हैं।
- उदाहरण सिद्धांत: "अरे, मैंने देखा कि 80% बार जब रोबोट गणित में विफल होता है, तो वह फॉर्मूला गलत लिखता है लेकिन क्रैश नहीं होता। यह एक 'साइलेंट फेलियर' है।"
- द इन्वेस्टिगेटर्स (फोरेंसिक ऑडिटर्स): एक बार जब एक स्काउट एक सिद्धांत बना लेता है, तो इन्वेस्टिगेटर्स कार्यभार संभाल लेते हैं। वे केवल कुछ उदाहरणों को नहीं देखते; वे रोबोट के काम के पूरे विशाल डेटाबेस (कॉर्पस) की जांच करते हैं। वे पूरे समूह के लिए सिद्धांत को सच या झूठ साबित करने के लिए गणना करने, तुलना करने और शक्तिशाली उपकरणों का उपयोग करने के लिए आते हैं।
- परिणाम: एक अनुमान के बजाय, वे एक रिपोर्ट तैयार करते हैं जो कहती है: "हमने 1,000 असफल प्रयासों की जाँच की। 84% में यह विशिष्ट गणितीय त्रुटि थी। यहाँ वे सटीक पृष्ठ दिए गए हैं जहाँ यह हुआ था।"
यह अलग क्यों है?
अधिकांश अन्य सिस्टम एक बार में एक रोबोट को ठीक करने की कोशिश करते हैं या त्रुटियों को एक पूर्व-निर्धारित सूची (जैसे "टूल एरर" या "लॉजिक एरर") में वर्गीकृत करते हैं। IG अलग है क्योंकि यह नए पैटर्न की खोज करता है जिन्हें पहले कोई नहीं जानता था। यह "अनुमान लगाने" (स्काउट्स) को "सिद्ध करने" (इन्वेस्टिगेटर्स) से अलग करता है ताकि यह डेटा के विशाल आकार से अभिभूत न हो जाए।
जब उन्होंने इसका परीक्षण किया तो क्या हुआ?
शोधकर्ताओं ने इस सिस्टम का दो तरीकों से परीक्षण किया:
- "जज" टेस्ट: उन्होंने एक सुपर-स्मार्ट AI जज से IG द्वारा बनाई गई रिपोर्टों की तुलना अन्य सिस्टमों द्वारा बनाई गई रिपोर्टों से करवाई। IG की रिपोर्टों को उच्च रेटिंग दी गई क्योंकि उनमें बेहतर साक्ष्य और गहरे स्पष्टीकरण थे। यह एक रिपोर्ट की तुलना करने जैसा था जो कहती है "कार खराब है" (अन्य सिस्टम) बनाम एक रिपोर्ट जो कहती है "कार विशेष रूप से बारिश में बाएं मुड़ते समय खराब होती है क्योंकि एक तार ढीला है, और यहाँ उसका वीडियो प्रमाण है" (IG)।
- "ह्यूमन फिक्सर" टेस्ट: यह सबसे महत्वपूर्ण हिस्सा था। उन्होंने वास्तविक मानव इंजीनियरों (विशेषज्ञ जो इन रोबोटों को बनाते हैं) को IG और अन्य सिस्टमों की रिपोर्ट दी। फिर इंजीनियरों ने रोबोट को ठीक करने की कोशिश की।
- परिणाम: IG की रिपोर्टों का उपयोग करने वाले इंजीनियरों ने अगले सबसे अच्छे सिस्टम की तुलना में रोबोट को 30% बेहतर तरीके से ठीक किया। IG की रिपोर्टों ने उन्हें सटीक "कहाँ" और "क्यों" दिया जिसकी उन्हें सही बदलाव करने के लिए आवश्यकता थी, न कि केवल एक अस्पष्ट संकेत।
मुख्य निष्कर्ष (The Bottom Line)
पेपर का दावा है कि इस "स्काउट और इन्वेस्टिगेटर" टीम दृष्टिकोण का उपयोग करके, हम अंततः यह देख सकते हैं कि AI एजेंट कैसे विफल होते हैं। यह मानव विशेषज्ञों को मूल समस्याओं को बहुत अधिक प्रभावी ढंग से ठीक करने की अनुमति देता है, जिससे त्रुटि लॉगों के अराजक ढेर को एक स्पष्ट, साक्ष्य-आधारित सुधार रोडमैप में बदल दिया जाता है।
यह पेपर क्या दावा नहीं करता है:
- यह नहीं कहता कि यह सिस्टम बिना मानवीय सहायता के रोबोट को स्वचालित रूप से ठीक करता है (हालांकि उन्होंने एक स्वचालित "पैचर लूप" का भी परीक्षण किया था, लेकिन मुख्य सफलता मानव विशेषज्ञों के साथ थी)।
- यह दावा नहीं करता कि यह दुनिया की हर AI समस्या के लिए काम करता है, केवल AI एजेंटों के "ट्रेस" (लॉग्स) के विश्लेषण के लिए।
- यह सभी त्रुटियों को समाप्त करने का वादा नहीं करता है, बल्कि यह सुधार की प्रक्रिया को बहुत अधिक कुशल और सटीक बनाने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।