← नवीनतम पेपर
💻 computer science

Read, Extract, Classify: A Tool for Smarter Requirements Engineering

यह शोध पत्र ReXCL को प्रस्तुत करता है, जो एक स्वचालित उपकरण है जो अर्ध-संरचित दस्तावेजों से डेटा निकालने और प्रेडिक्टिव मॉडलिंग एवं एडेप्टिव फाइन-ट्यूनिंग का उपयोग करके आवश्यकताओं को वर्गीकृत करके आवश्यकताओं के इंजीनियरिंग (requirements engineering) को बढ़ाता है, जिससे सॉफ्टवेयर विकास जीवन चक्र में दक्षता और सटीकता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Paheli Bhattacharya, Manojit Chakraborty, Santhosh Kumar Arumugam, Rishabh Gupta

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Paheli Bhattacharya, Manojit Chakraborty, Santhosh Kumar Arumugam, Rishabh Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो ग्राहकों के पत्रों के एक विशाल, अव्यवस्थित ढेर को व्यवस्थित करने की कोशिश कर रहे हैं। कुछ पत्र फैंसी लेटरहेड पर लिखे गए हैं, कुछ नैपकिन पर लिखे गए हैं, और कुछ बस लंबे, बिखरे हुए पैराग्राफ हैं। आपका काम हर एक को पढ़ना, यह पता लगाना कि उसका "विषय पंक्ति" (subject line) वाला हिस्सा कौन सा है, "बॉडी" (body) वाला हिस्सा कौन सा है, और फिर उन्हें चार विशिष्ट डिब्बों में छाँटना है: Info, Header, Functional Request (उत्पाद को क्या करना ही चाहिए), और Non-Functional Request (उत्पाद को कैसे प्रदर्शन करना चाहिए)।

इसे हाथ से करना धीमा, उबाऊ और गलतियों से भरा है। यहीं पर ReXCL टूल काम आता है। ReXCL को एक सुपर-स्मार्ट, स्वचालित रोबोटिक लाइब्रेरियन के रूप में सोचें जिसे विशेष रूप से ऑटोमोटिव उद्योग के लिए डिज़ाइन किया गया है।

यह इस प्रकार काम करता है, जिसे दो मुख्य चरणों में विभाजित किया गया है:

चरण 1: "एक्सट्रैक्शन" (Extraction) रोबोट (सफाई और संगठन)

सबसे पहले, रोबोट एक अस्त-व्यस्त दस्तावेज़ (जैसे PDF या Word फ़ाइल) लेता है और उसके लेआउट को समझने की कोशिश करता है।

  • द नॉइज़ फ़िल्टर (The Noise Filter): कल्पना कीजिए कि दस्तावेज़ में पेज नंबर, तारीखें और ऊपर-नीचे "Page 1 of 5" जैसे निशान हैं। ये ध्यान भटकाने वाली चीजें हैं। रोबोट एक सरल, तेज़ दिमाग (जिसे Random Forest classifier कहा जाता है) का उपयोग करता है ताकि इन दोहराव वाले पैटर्न को पहचान सके और उन्हें हटा सके, ठीक वैसे ही जैसे एक छलनी रेत से सोना अलग करती है।
  • द स्ट्रक्चर बिल्डर (The Structure Builder): शोर हटने के बाद, रोबोट दस्तावेज़ के "कंकाल" (skeleton) को खोजता है। यह सेक्शन नंबर (जैसे "1.1") और शीर्षक (जैसे "Main Task") को ढूंढता है। फिर यह उस टेक्स्ट को निकाल लेता है जो उन शीर्षकों के अंतर्गत आता है।
  • परिणाम: यह बिखरे हुए दस्तावेज़ को एक साफ, संरचित तालिका (table) में बदल देता है। यह लेगो (LEGO) ब्लॉक्स के एक उलझे हुए बॉक्स को एक स्पष्ट निर्देश पुस्तिका में जोड़ने जैसा है जहाँ हर टुकड़े का अपना लेबल वाला स्थान होता है।

चरण 2: "क्लासिफिकेशन" (Classification) रोबोट (छँटाई और लेबलिंग)

अब कि टेक्स्ट साफ और व्यवस्थित है, दूसरा रोबोट कार्यभार संभालता है। यह बहुत अधिक स्मार्ट है और इसे विशेष रूप से प्रशिक्षित किया गया है।

  • विशेषज्ञ प्रशिक्षण (The Specialist Training): एक सामान्य भाषा विशेषज्ञ (जैसे एक मानक BERT मॉडल) की कल्पना करें जो अंग्रेजी तो अच्छी जानता है लेकिन कारों के बारे में ज्यादा नहीं जानता। यह रोबोट उस विशेषज्ञ को लेता है और उसे हजारों बिना लेबल वाले कार आवश्यकता दस्तावेजों को पढ़कर "ऑटोमोटिव की भाषा" का क्रैश कोर्स देता है। इसे Adaptive Fine-Tuning कहा जाता है। यह एक सामान्य शेफ को इतालवी व्यंजन में विशेषज्ञ बनाने के लिए वैसा ही है जैसे उसे काम शुरू करने से पहले हजारों इतालवी रेसिपी चखाकर और उन्हें पढ़ाकर सिखाया जाता है।
  • छँटाई (The Sorting): अब, रोबोट प्रत्येक टेक्स्ट को पढ़ता है और पूछता है, "क्या यह एक तथ्य है? क्या यह एक हेडर है? क्या यह एक नियम है कि कार को क्या करना चाहिए (Functional), या यह एक नियम है कि वह कितनी तेज़ चलनी चाहिए (Non-Functional)?"
  • परिणाम: यह हर वाक्य पर एक डिजिटल लेबल लगा देता है। यह पेपर दावा करता है कि यह रोबोट अविश्वसनीय रूप से सटीक है, खासकर उन कठिन श्रेणियों के लिए जिन्हें अन्य उपकरण मिस कर देते हैं।

प्रमाण: क्या यह काम कर गया?

शोधकर्ताओं ने अपने रोबोट का परीक्षण मानव विशेषज्ञों के विरुद्ध किया।

  • एक्सट्रैक्शन के लिए: तीन विशेषज्ञों ने 445 वाक्यों पर रोबट के काम की जांच की। रोबोट को 4.45 में से 5 का स्कोर मिला। यह उन परेशान करने वाले पेज हेडर और फुटर को पहचानने और हटाने में 96% सटीक भी था।
  • क्लासिफिकेशन के लिए: जब रोबोट ने टेक्स्ट को छाँटने की कोशिश की, तो यह एक मानक, अप्रशिक्षित मॉडल की तुलना में एक बड़ा सुधार था।
    • एक मानक मॉडल संघर्ष करता दिखा, जिसका स्कोर कठिन श्रेणियों के लिए 0.22 (1.0 में से) जितना कम था।
    • ReXCL रोबोट ने, अपने विशेष प्रशिक्षण के बाद, 0.93 और 0.99 के बीच स्कोर किया। यह "फंक्शनल रिक्वायरमेंट" और "नॉन-फंक्शनल रिक्वायरमेंट" के बीच अंतर बताने में लगभग पूर्ण था।

बड़ी तस्वीर (The Big Picture)

पेपर निष्कर्ष निकालता है कि ReXCL एक ऐसा टूल है जो बिखरे हुए ग्राहक दस्तावेजों को साफ, संरचित डेटा में बदलने के उबाऊ और त्रुटिपूर्ण काम को स्वचालित करता है।

  • यह क्या करता है: यह कच्ची फाइलों को लेता है, उन्हें साफ करता है, उन्हें व्यवस्थित करता है और लेबल करता है।
  • यह क्या नहीं करता (अभी तक): यह वर्तमान में केवल टेक्स्ट दस्तावेज़ों को संभालता है। लेखक उल्लेख करते हैं कि भविष्य में, वे इसे चित्र, टेबल और स्प्रेडशीट को समझने के लिए भी प्रशिक्षित करना चाहते हैं, लेकिन अभी, यह केवल टेक्स्ट तक सीमित है।
  • आउटपुट: एक बार जब रोबोट अपना काम पूरा कर लेता है, तो आप परिणामों को एक साफ फाइल (जैसे Excel या CSV) के रूप में डाउनलोड कर सकते हैं और इसे सीधे IBM DOORS जैसे पेशेवर इंजीनियरिंग टूल्स में फीड कर सकते हैं।

संक्षेप में, ReXCL एक डिजिटल सहायक है जो ग्राहक आवश्यकता दस्तावेजों के अराजक ढेर को एक पूरी तरह से व्यवस्थित, लेबल की गई फाइलिंग कैबिनेट में बदल देता है, जिससे इंजीनियरों को मैन्युअल छँटाई के घंटों के काम से मुक्ति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →