Retrieval-Augmented Large Language Models as Components of Cognitive Computing architecture for Regulatory Knowledge Management
यह शोध पत्र यह प्रदर्शित करता है कि उपभोक्ता-ग्रेड हार्डवेयर पर रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के साथ स्थानीय रूप से तैनात लार्ज लैंग्वेज मॉडल्स को एकीकृत करना उन्हें बिना मॉडल पुनरप्रशिक्षण के तथ्यात्मक सटीकता, ऑडिटेबिलिटी और गतिशील नियामक ज्ञान प्रबंधन को बढ़ाने में सक्षम विश्वसनीय संज्ञानात्मक कंप्यूटिंग घटकों में बदल देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल संख्याओं की गणना ही नहीं करते, बल्कि जटिल नियमों पर "सोचते" भी हैं, जैसे एक वकील अनुबंध (contract) पढ़ता है या एक डॉक्टर निदान (diagnosis) की जाँच करता है। यह कॉग्निटिव कंप्यूटिंग (Cognitive Computing) का क्षेत्र है, जो ऐसी मशीनें बनाने की कोशिश कर रहा है जो केवल कठोर निर्देशों का पालन करने के बजाय मानवीय तर्क की नकल कर सकें। इस नई लहर के केंद्र में लार्ज लैंग्वेज मॉडल्स (LLMs) हैं, जो सुपर-स्मार्ट, सुशिक्षित रोबोट की तरह हैं जो वाक्य में अगले शब्द की भविष्यवाणी करके लिख सकते हैं, सारांश निकाल सकते हैं और बातचीत कर सकते हैं। हालाँकि, इन रोबोटों की एक अजीब आदत है: कभी-कभी वे पूरे आत्मविश्वास के साथ चीजें बना देते हैं, जिसे "हैलुसिनेशन" (hallucination) नामक एक त्रुटि के रूप में जाना जाता है। इसे ठीक करने के लिए, वैज्ञानिक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) नामक एक तरकीब का उपयोग करते हैं। RAG को एक रोबोट को लाइब्रेरी कार्ड देने और एक सख्त नियम देने के रूप में समझें: "तुम तब तक किसी प्रश्न का उत्तर नहीं दे सकते जब तक कि तुम पहले किताब का वह सटीक पृष्ठ न ढूँढ लो जो उसे सिद्ध करता हो।" यह शोध पत्र इस बात की पड़ताल करता है कि क्या इन दो विचारों को जोड़ना—स्मार्ट रोबोट और सख्त लाइब्रेरी नियम—जटिल कानूनी नियमों को प्रबंधित करने के लिए एक विश्वसनीय प्रणाली बना सकता है, और वह भी डेटा को क्लाउड पर भेजने के बजाय कंपनी की अपनी सीमाओं के भीतर सुरक्षित रखते हुए।
शोधकर्ताओं ने, जिनका नेतृत्व पोलैंड के WSB यूनिवर्सिटी से डारियस नोवाक-नोवा (Dariusz Nowak-Nova) ने किया, यह परीक्षण करने के लिए हाथ में लिया कि क्या यह "रोबोट प्लस लाइब्रेरी" संयोजन एक मानक AI को एक भरोसेमंद कॉग्निटिव कंप्यूटिंग सिस्टम का हिस्सा बना सकता है। उन्होंने इन कार्यों के लिए आमतौर पर आवश्यक विशाल, महंगे सुपरकंप्यूटरों का उपयोग नहीं किया। इसके बजाय, उन्होंने एक मानक उपभोक्ता लैपटॉप पर प्रयोग चलाया जिसमें एप्पल M4 प्रोसेसर और 24 GB मेमोरी थी, और इसमें पोलिश भाषा के ओपन-सोर्स मॉडल बिएलिक (Bielik) और PLLuM का उपयोग किया गया। उन्होंने एक स्थानीय "कॉग्निटिव आर्किटेक्चर" स्थापित किया जहाँ AI प्रशिक्षण के दौरान याद किए गए ज्ञान पर पूरी तरह निर्भर रहने के बजाय, वास्तविक समय में कानूनी दस्तावेजों की एक विशाल डिजिटल लाइब्रेरी से विशिष्ट कानूनों को खोज सकता था। उन्होंने कंप्यूटर पर ही 17,377 कानूनी दस्तावेजों (कुल 22.84 GB) की एक विशाल डिजिटल लाइब्रेरी के साथ यह सेटअप बनाया। इस सेटअप ने AI को जवाब देने से पहले वास्तविक समय में कानूनों को खोजने की अनुमति दी।
टीम ने AI से पोलिश कानून में "रियल एस्टेट" (अचल संपत्ति) की परिभाषा के बारे में चार विशिष्ट प्रश्न पूछे, पहले AI को अपने स्वयं के मेमोरी से उत्तर देने दिया, और फिर उसे RAG सिस्टम का उपयोग करके कानूनी दस्तावेजों को खोजने के बाद उत्तर देने दिया। परिणाम बेहद दिलचस्प थे। जब AI ने RAG सिस्टम का उपयोग किया, तो उसके उत्तर बहुत अधिक सटीक और सही कानूनी शब्दावली से भरपूर हो गए, जिससे वह एक सामान्य विश्वकोश के बजाय एक अनुभवी वकील की तरह लगने लगा। पाठ अधिक सघन और विशिष्ट हो गया, जो कि सख्त कानूनों के मामले में बिल्कुल वैसा ही है जैसा आप चाहते हैं। उदाहरण के लिए, RAG-संवर्धित उत्तरों ने सिविल कोड और अन्य अधिनियमों के विशिष्ट अनुच्छेदों का सही ढंग से उल्लेख किया, जबकि स्टैंडअलोन AI कभी-कभी अस्पष्ट या अधूरे सारांश देता था।
हालाँकि, अध्ययन में यह भी पाया गया कि यह प्रणाली अभी भी पूर्ण नहीं है। जबकि RAG सिस्टम ने उत्तरों की शैली और विशिष्टता में सुधार किया, इसने त्रुटियों को पूरी तरह से समाप्त नहीं किया। एक उदाहरण में, RAG सिस्टम का उपयोग करने वाले AI ने एक मौलिक कानूनी गलती की, यह सुझाव देते हुए कि कुछ शर्तों के तहत रियल एस्टेट "चल संपत्ति" (movable) हो सकती है, जो संपत्ति कानून की बुनियादी परिभाषा के विरुद्ध है। शोधकर्ताओं ने नोट किया कि हालांकि AI सही दस्तावेज़ ढूंढ सकता था, लेकिन उसे कभी-कभी उस कानून के बीच अंतर करने में कठिनाई हुई जो किसी अवधारणा को परिभाषित करता है और उस कानून के बीच जो केवल उस अवधारणा का किसी अन्य उद्देश्य, जैसे कराधान (taxation) के लिए उपयोग करता है। यह सुझाव देता है कि हालांकि सिस्टम जानकारी खोजने में बेहतर हो रहा है, लेकिन इसे नियमों के पीछे के गहरे तर्क को समझने के लिए अभी भी मदद की आवश्यकता है।
अंततः, यह शोध पत्र सुझाव देता है कि क्लाउड पर डेटा लीक होने के जोखिम के बिना नियामक ज्ञान को संभालने के लिए स्थानीय कंप्यूटरों पर इन AI मॉडलों को RAG सिस्टम के साथ रखना एक शक्तिशाली तरीका है। यह AI को एक "ब्लैक बॉक्स" से बदलकर, जो उत्तरों का अनुमान लगाता है, एक "कॉग्निटिव मॉड्यूल" में बदल देता है जिसे ऑडिट किया जा सकता है, जांचा जा सकता है और कानून बदलने के साथ अपडेट किया जा सकता है, और वह भी पूरे मॉडल को पुन: प्रशिक्षित किए बिना। लेखक निष्कर्ष निकालते हैं कि यह दृष्टिकोण कानूनी और नियामक कार्यों के लिए विश्वसनीय AI सहायक बनाने की दिशा में एक आशाजनक कदम है, बशर्ते हम याद रखें कि AI सूचना खोजने और व्यवस्थित करने के लिए एक शक्तिशाली उपकरण है, लेकिन अंतिम तर्क को सत्यापित करने के लिए इसे अभी भी मानव विशेषज्ञों की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।