← नवीनतम पेपर
💬 NLP

Enhancing BiGRU with a KAN Block for Legal Document Classification and Summarization

यह शोध पत्र बांग्लादेश के कम-संसाधन वाले, बहुभाषी कानूनी दस्तावेजों को वर्गीकृत करने और सारांशित करने के लिए एक नवीन KAN-संवर्धित BiGRU आर्किटेक्चर प्रस्तावित करता है, जो यह प्रदर्शित करता है कि कोलमोगोरोव-आर्नोल्ड नेटवर्क को एकीकृत करने से बेसलाइन मॉडल की तुलना में वर्गीकरण सटीकता 57.34% से बढ़कर 67.96% हो जाती है।

मूल लेखक: Ahmed Faizul Haque Dhrubo, Souvik Pramanik, Most. Aysha Siddika Sumona, Shahnewaz Siddique, Mohammad Ashrafuzzaman Khan, Mohammad Abdul Qayum, Mohsin Sajjad

प्रकाशित 2026-06-02
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ahmed Faizul Haque Dhrubo, Souvik Pramanik, Most. Aysha Siddika Sumona, Shahnewaz Siddique, Mohammad Ashrafuzzaman Khan, Mohammad Abdul Qayum, Mohsin Sajjad

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बांग्लादेश के कानूनी दस्तावेजों का एक विशाल, अस्त-व्यस्त पुस्तकालय है। ये केवल सामान्य किताबें नहीं हैं; ये तीन "बोलियों" के भ्रमित करने वाले मिश्रण में लिखी गई हैं: मानक बंगाली, अंग्रेजी, और अंग्रेजी अक्षरों का उपयोग करके लिखी गई बंगाली (लिप्यंतरित)। इसके अलावा, यह पुस्तकालय अव्यवस्थित भी है: कुछ प्रकार के मामलों की हजारों फाइलें हैं, जबकि कुछ के केवल कुछ ही अंश हैं।

इस शोध का लक्ष्य एक स्मार्ट रोबोट सहायक बनाना है जो इन अस्त-व्यस्त फाइलों के साथ दो काम कर सके:

  1. वर्गीकरण (Classify): उन्हें सही ढेर में छाँटना (जैसे, "अपील स्वीकार की गई" बनाम "मामला खारिज किया गया")।
  2. सारांश (Summarize): एक लंबे, जटिल मामले को पढ़ना और यह लिखना कि क्या हुआ उसका एक छोटा, स्पष्ट सारांश।

लेखकों ने अपना समाधान कैसे बनाया, इसे सरल रूप में यहाँ समझाया गया है:

समस्या: "पुराने स्कूल" वाला रोबोट भ्रमित था

शोधकर्ताओं ने मानक AI उपकरणों (जैसे BiGRUs, जो बाएं-से-दाएं और दाएं-से-बाएं पढ़कर संदर्भ समझने वाले रोबोट की तरह हैं) का उपयोग करने की कोशिश की। हालांकि, ये रोबोट संघर्ष कर रहे थे क्योंकि:

  • भाषा का मिश्रण: बंगाली, अंग्रेजी और "रोमनकृत" बंगाली के बीच स्विच करना रोबोट को भ्रमित कर रहा था।
  • असमानता (Imbalance): रोबोट बार-बार "लोकप्रिय" केस के प्रकारों का अनुमान लगा रहा था क्योंकि उसने उन्हें बहुत बार देखा था, जिससे वह दुर्लभ मामलों को अनदेखा कर रहा था।
  • जटिलता: कानूनी पाठ सूक्ष्म बारीकियों और लंबे वाक्यों से भरा होता है जिन्हें जोड़ना कठिन होता है।

समाधान: "KAN" अपग्रेड

एक नया रोबोट शुरू से बनाने के बजाय, लेखकों ने मौजूदा रोबोट को लिया और उसे एक विशेष अपग्रेड दिया जिसे KAN ब्लॉक (Kolmogorov-Arnold Network) कहा जाता है।

उपमा (Analogy):
मान लीजिए कि मानक रोबोट (BiGRU) एक जूनियर वकील की तरह है जो तथ्यों को पढ़ने में अच्छा है लेकिन कभी-कभी उनके बीच के गहरे, छिपे हुए संबंधों को मिस कर देता है।
KAN ब्लॉक एक वरिष्ठ कानूनी मेंटर (परामर्शदाता) की तरह है जो जूनियर वकील के ठीक बगल में बैठा है।

  • जूनियर वकील मामला पढ़ता है और अपने नोट्स मेंटर को सौंप देता है।
  • मेंटर (KAN) उन नोट्स को देखता है और सोचने के एक विशेष, लचीले तरीके (कठोर नियमों के बजाय गणितीय वक्रों का उपयोग करके) का उपयोग करके उन पैटर्न और कनेक्शनों को पहचानता है जिन्हें जूनियर वकील मिस कर गया था।
  • मेंटर फिर अंतिम निर्णय लेने से पहले नोट्स को परिष्कृत करता है।

उन्होंने इसका परीक्षण कैसे किया

उन्होंने इस "जूनियर + मेंटर" टीम को बांग्लादेशी कानूनी डेटासेट पर प्रशिक्षित किया।

  • छंटनी के लिए (Classification): टीम को किसी मामले के परिणाम का अनुमान लगाना था।
  • सारांश के लिए (Summarizing): टीम को मामले का एक संक्षिप्त संस्करण लिखना था।

उन्होंने अपनी "जूनियर + मेंटर" टीम की तुलना निम्नलिखित से की:

  1. पुराने स्कूल के तरीके: जैसे कि स्प्रेडशीट का उपयोग करने वाला एक इंसान (मशीन लर्निंग एल्गोरिदम)।
  2. अन्य AI रोबोट: जैसे कि BERT या RoBERTa (प्री-ट्रेन्ड मॉडल)।
  3. केवल "जूनियर": वही रोबोट बिना KAN मेंटर के।

परिणाम

  • वर्गीकरण में जीत (Sorting Wins): "जूनियर + मेंटर" टीम ने 67.96% बार सही अनुमान लगाया। यह अकेले "जूनियर" की तुलना में एक बड़ी छलांग थी, जो केवल 57.34% सही था। मेंटर ने रोबोट को कानून के पेचीदा हिस्सों को बेहतर ढंग से समझने में मदद की। इसने पुराने स्कूल के स्प्रेडशीट तरीकों को भी पछाड़ दिया।
  • सारांश में जीत (Summarizing Wins): सारांश लिखते समय, टीम ने ऐसा टेक्स्ट तैयार किया जो मानव-लिखित सारांशों से बेहतर मेल खाता था। उन्होंने मुख्य बिंदुओं (जैसे "वादी हर्जाना चाहता है") को पकड़ा बिना शोर में खोए।

कमी (सीमाएं)

अपग्रेड के बावजूद, रोबट अभी भी पूर्ण नहीं है:

  • दुर्लभ मामले: चूंकि पुस्तकालय में कुछ केस प्रकार बहुत दुर्लभ हैं, इसलिए टीम (WeightedRandomSampler नामक एक ट्रिक का उपयोग करने के बावजूद, जो रोबोट को दुर्लभ मामलों पर विशेष ध्यान देने के लिए मजबूर करती है) अभी भी उन्हें गलत कर सकती है।
  • भाषाई बाधा: तीन लेखन शैलियों का मिश्रण अभी भी पूरी तरह से महारत हासिल करने के लिए बहुत कठिन है।
  • विवरणों की कमी: कभी-कभी, सारांश बनाते समय, रोबोट मुख्य कहानी पर बहुत अधिक ध्यान केंद्रित करने के कारण महत्वपूर्ण प्रक्रियात्मक विवरणों को छोड़ देता है।

निचोड़ (Bottom Line)

यह शोध पत्र यह सिद्ध करता है कि कठिन समस्याओं को हल करने के लिए आपको हमेशा शून्य से एक विशाल, नया AI बनाने की आवश्यकता नहीं होती है। कभी-कभी, एक मानक AI को लेने और उसमें एक विशेष "मेंटर" मॉड्यूल (KAN ब्लॉक) जोड़ने से जटिल, अस्त-व्यस्त और बहुभाषी कानूनी दस्तावेजों को समझने की उसकी क्षमता में काफी वृद्धि हो सकती है। यह सीमित संसाधनों और कई भाषाओं वाले स्थानों के लिए कानूनी तकनीक को बेहतर बनाने की दिशा में एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →