Supporting System Testing with a Multi-Agent LLM-based Framework for Knowledge Graph Extraction: A Case Study with Ethernet Switch Systems
यह शोध पत्र एक मल्टी-एजेंट LLM-आधारित फ्रेमवर्क प्रस्तुत करता है जो सटीक सिस्टम टेस्ट केस स्पेसिफिकेशन के स्वचालित निर्माण में सहायता के लिए सेमी-स्ट्रक्चर्ड एथरनेट स्विच कॉन्फ़िगरेशन मैनुअल से नॉलेज ग्राफ को निकालता है और उन्हें पुनरावृत्ति (iteratively) के माध्यम से परिष्कृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।
बड़ी तस्वीर: एक अव्यवस्थित मैनुअल को एक स्मार्ट मानचित्र में बदलना
कल्प_ना कीजिए कि आपके पास किसी जटिल मशीनरी (इस मामले में, एक ईथरनेट स्विच, जो इंटरनेट डेटा के लिए एक ट्रैफिक कंट्रोलर की तरह है) के लिए एक विशाल, 500 पन्नों का निर्देश मैनुअल है। यह मैनुअल इंसानों के पढ़ने के लिए लिखा गया है, न कि कंप्यूटरों के समझने के लिए। यह "सेमी-स्ट्रक्चर्ड" (अर्ध-संरचित) टेक्स्ट से भरा है—जिसका अर्थ है कि इसमें हेडिंग और सूचियाँ तो हैं, लेकिन महत्वपूर्ण विवरण अक्सर पैराग्राफों में छिपे होते हैं, नोट्स के साथ मिले होते हैं, या स्पष्ट रूप से लिखे जाने के बजाय केवल संकेत मात्र होते हैं।
समस्या क्या है? एक कंप्यूटर जो इस मशीन को सही ढंग से काम करने के लिए स्वचालित रूप से टेस्ट करने की कोशिश कर रहा है, वह भ्रमित हो जाता है। वह आसानी से यह नहीं समझ पाता कि: "यदि मैं स्टेप A करता हूँ, तो क्या इसका मतलब है कि मुझे अगला स्टेप B करना चाहिए? और काम पूरा होने के बाद मशीन कैसी दिखनी चाहिए?"
इस शोध पत्र के लेखकों ने एक स्मार्ट रोबोट टीम (एक मल्टी-एजेंट LLM फ्रेमवर्क) बनाई है जो इन अव्यवस्थित मैनुअल्स को पढ़ सकती है और उन्हें एक परफेक्टली संगठित मानचित्र (नॉलेज ग्राफ) में बदल सकती है। यह मानचित्र कंप्यूटरों को यह जांचने के लिए टेस्ट स्क्रिप्ट बनाने की अनुमति देता है कि मशीन सही ढंग से काम कर रही है या नहीं, जिससे इंसानों को यह उबाऊ और दोहराव वाला काम मैन्युअल रूप से करने से मुक्ति मिलती है।
पात्रों का परिचय: विशेषज्ञ रोबोटों की एक टीम
एक विशाल रोबोट बनाने के बजाय जो सब कुछ एक साथ करने की कोशिश करे, लेखकों ने तीन विशेषज्ञ "एजेंट्स" (AI सहायक) की एक टीम बनाई है, जिनमें से प्रत्येक का एक विशिष्ट कार्य है, साथ ही दो सुपरवाइज़र भी हैं।
- द रोडमैप एजेंट (The Roadmap Agent): यह रोबोट मैनुअल के "बड़ी तस्वीर" वाले हिस्से को पढ़ता है। यह उच्च-स्तरीय लक्ष्यों को समझता है (जैसे, "हमें नेटवर्क में लूप का पता लगाना है")।
- द प्रोसीजर एजेंट (The Procedure Agent): यह रोबोट "बारीक विवरण" वाले हिस्से को पढ़ता है। यह सटीक कमांड, दबाने वाले बटन और अपेक्षित परिणाम निकालता है (जैसे, "यह विशिष्ट कोड टाइप करें, और आपको यह विशिष्ट एरर मैसेज दिखना चाहिए")।
- द मैपर एजेंट (The Mapper Agent): यह एक महत्वपूर्ण कड़ी है। यह "बड़ी तस्वीर" के लक्ष्यों को "बारीक विवरण" वाले स्टेप्स से जोड़ता है। यह इस सवाल का जवाब देता है: "कौन से विशिष्ट कमांड वास्तव में उस उच्च-स्तरीय लक्ष्य को प्राप्त करते हैं?"
सुपरवाइज़र:
- द जज (EvalAgent): टीम अपना काम पूरा करने के बाद, जज उनके होमवर्क की जाँच करता है। वह रोबोट के आउटपुट की तुलना मूल मैनुअल से करता है ताकि यह देख सके कि उन्होंने कुछ छोड़ा तो नहीं या कोई गलती तो नहीं की।
- द कोच (ImprovAgent): यदि जज को गलतियाँ मिलती हैं, तो कोच केवल उत्तर को ठीक नहीं करता; बल्कि वह रोबोट्स को दिए जाने वाले निर्देशों (प्रॉम्प्ट्स) को फिर से लिखता है ताकि वे अगली बार वही गलती न दोहराएं।
प्रक्रिया: "ट्राई, चेक, फिक्स" लूप
यह सिस्टम एक चतुर चक्र का उपयोग करता है जिसे एक्सट्रैक्ट-इवैल्यूएट-इम्प्रूव (EEI) लूप कहा जाता है। इसे एक छात्र द्वारा प्रैक्टिस टेस्ट देने की तरह समझें:
- एक्सट्रैक्ट (Extract): रोबोट टीम मैनुअल को पढ़ती है और मानचित्र (नॉलेज ग्राफ) बनाती है।
- इवैल्यूएट (Evaluate): जज मानचित्र को देखता है और कहता है, "आपने यहाँ एक विवरण छोड़ दिया है," या "आपने इस नोट को गलत बॉक्स में रख दिया है।" वह एक स्कोर देता है।
- इम्प्रूव (Improve): यदि स्कोर बहुत कम है, तो कोच हस्तक्षेप करता है। वह जज के फीडबैक को देखता है और कहता है, "ठीक है, अगली बार, 'लक्ष्य' और 'नोट' के बीच अंतर करने में अधिक सावधान रहें।" यह रोबोट के निर्देशों को अपडेट करता है।
- रिपीट (Repeat): रोबोट नए निर्देशों के साथ फिर से प्रयास करते हैं। वे तब तक इसे दोहराते रहते हैं जब तक कि मानचित्र परफेक्ट न हो जाए या उन्होंने पर्याप्त प्रयास न कर लिए हों।
परिणाम: यह कितना सफल रहा?
टीम ने एक प्रमुख टेक कंपनी (Huawei) के 50 वास्तविक दुनिया के मैनुअल्स पर इस सिस्टम का परीक्षण किया।
- "पहली कोशिश" भी अद्भुत थी: बिना "कोच" की मदद के भी, रोबोट पहली बार में ही 97% से 99% बार सही उत्तर दे रहे थे।
- "कोच" ने कठिन मामलों में मदद की: उन मैनुअल्स के लिए जो विशेष रूप से कठिन या भ्रमित करने वाले थे, EEI लूप सक्रिय हुआ। इसने निर्देशों को परिष्कृत किया, और सटीकता और भी बढ़ गई, जो लगभग पूर्ण स्कोर तक पहुँच गई।
- इंसान भी रोबोट्स से सहमत हैं: लेखकों ने काम की जाँच करने के लिए मानव विशेषज्ञों का भी उपयोग किया। उन्होंने पाया कि "जज" रोबोट और मानव विशेषज्ञ आपस में 72% से 80% बार सहमत थे। अधिकांश असहमति बहुत छोटी चीजें थीं (जैसे एक स्पेस का छूटना या नोट को वर्गीकृत करने का थोड़ा अलग तरीका), न कि कोई बड़ी गलती।
- वास्तविक दुनिया में उपयोगिता: टीम ने इस जनरेटेड मैप्स को पांच अनुभवी मानव परीक्षकों को दिया। परीक्षकों ने कहा कि मैप्स बहुत उपयोगी, स्पष्ट और सटीक थे। उन्हें लगा कि मैप्स सफलतापूर्वक टेस्ट केस बनाने में मार्गदर्शन कर सकते हैं, हालांकि उन्होंने उल्लेख किया कि कभी-कभी "प्री-कंडीशन्स" (काम शुरू करने से पहले क्या सेटअप करना है) को पूरी तरह से स्पष्ट करने के लिए थोड़े मानवीय सुधार की आवश्यकता होती है।
मुख्य निष्कर्ष (The Bottom Line)
यह शोध पत्र दिखाता है कि हम एक जटिल, अव्यवस्थित तकनीकी मैनुअल को पढ़ने और उसे साफ, संरचित डेटा में बदलने के लिए AI रोबोट की एक टीम का उपयोग कर सकते हैं। यह डेटा इतना अच्छा है कि यह नेटवर्क उपकरणों के परीक्षण को स्वचालित करने में मदद कर सकता है, जो एक ऐसा कार्य है जो आमतौर पर धीमा, महंगा और पूरी तरह से हाथों से किया जाता है। यह सिस्टम अपनी गलतियों से सीखने और विशिष्ट प्रकार के मैनुअल्स को पढ़ने में बेहतर होने में सक्षम है, जो इसे सॉफ्टवेयर टेस्टिंग के भविष्य के लिए एक शक्तिशाली उपकरण बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।