Exploring Structural Complexity in Normative RAG with Graph-based approaches: A case study on the ETSI Standards
यह शोध पत्र ETSI मानकों के लिए एक विशिष्ट ग्राफ RAG पद्धति का प्रस्ताव और मूल्यांकन करता है, जो यह प्रदर्शित करता है कि संरचनात्मक और शाब्दिक जानकारी को रिट्रीवल इंडेक्स में एम्बेड करने से जटिल मानदंडात्मक दस्तावेजों (normative documents) को संसाधित करने के लिए पारंपरिक वेक्टर-आधारित दृष्टिकोणों की तुलना में प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल मशीन बनाने के लिए 3,000 पन्नों की एक विशाल निर्देश नियमावली (instruction manual) में एक विशिष्ट नियम खोजने की कोशिश कर रहे हैं। यह नियमावली केवल शब्दों का ढेर नहीं है; यह एक जीवित जीव की तरह है जहाँ हर अध्याय दूसरे अध्याय को संदर्भित करता है, हर अनुभाग एक उप-अनुभाग पर निर्भर है, और इसकी भाषा तकनीकी शब्दावली (jargon) से भरी है जिसे केवल विशेषज्ञ ही समझ सकते हैं।
यह औद्योगिक मानकों (जैसे कि पेपर में उल्लेखित ETSI दस्तावेज़) के साथ काम करने की चुनौती है।
इस पेपर के लेखकों ने एक सरल प्रश्न पूछा: क्या हम आधुनिक AI (विशेष रूप से लार्ज लैंग्वेज मॉडल्स) का उपयोग इन नियमावलियों को पढ़ने और उनके बारे में प्रश्नों के उत्तर देने के लिए कर सकते हैं, या वर्तमान तरीका बहुत ही अनाड़ी है?
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।
1. समस्या: "अंधा खोज" बनाम "स्मार्ट लाइब्रेरियन"
पुराना तरीका (वैनिला RAG):
कल्पना कीजिए कि आपके पास इन नियमावलियों का एक विशाल पुस्तकालय है। वर्तमान AI विधि (जिसे "वैनिला RAG" कहा जाता है) एक अंधे लाइब्रेरियन की तरह काम करती है। जब आप कोई प्रश्न पूछते हैं, तो लाइब्रेरियन किताबें पढ़ता नहीं है; वह बस पन्ने पर मौजूद शब्दों को देखता है।
- यदि आप "सुरक्षा" (safety) के बारे में पूछते हैं, तो लाइब्रेरियन उन पन्नों को ढूँढता है जहाँ "सुरक्षा" शब्द लिखा है।
- दोष: ये नियमावलियाँ पेचीदा होती हैं। वे बहुत विशिष्ट शब्दों (जार्गन) का उपयोग करती हैं और एक सख्त पदानुक्रम (hierarchy) का पालन करती हैं (अध्याय 1, अनुभाग 1.2 की ओर ले जाता है, जो 1.2.1 की ओर ले जाता है)। एक अंधा खोज अक्सर संदर्भ (context) को खो देता है। यह एक ऐसा पन्ना ढूँढ सकता है जिसमें "सुरक्षा" शब्द हो लेकिन वह वास्तव में किसी अलग मशीन के बारे में हो, या यह एक महत्वपूर्ण नियम को छोड़ सकता है क्योंकि सटीक शब्द का उपयोग नहीं किया गया था, भले ही उसका अर्थ वहाँ मौजूद था।
नया विचार (ग्राफ RAG):
लेखक एक स्मार्ट लाइब्रेरियन बनाने का सुझाव देते हैं जो पुस्तकालय की संरचना को समझता है।
- केवल शब्दों को देखने के बजाय, यह लाइब्रेरियन संबंधों को देखता है। वह जानता है कि "अध्याय 1", "अनुभाग 1.2" का जनक (parent) है, और कि "अनुभाग 1.2" स्पष्ट रूप से "परिशिष्ट B" (Appendix B) को संदर्भित करता है।
- वे पूरी नियमावली को एक मकड़ी के जाल (एक ग्राफ) के रूप में मैप करते हैं। जानकारी का हर टुकड़ा एक नोड (बिंदु) है, और संबंध (संदर्भ, अनु sección, उद्धरण) उन्हें जोड़ने वाले धागे हैं।
2. प्रयोग: "स्मार्ट लाइब्रेरियन" का परीक्षण
टीम ने ETSI मानकों का एक विशिष्ट सेट (लग लगभग 50 दस्तावेज़, 3,000 पन्ने) लिया और एक परीक्षण बनाया।
- परीक्षण: उन्होंने टेक्स्ट के आधार पर 800+ नकली प्रश्न और उत्तर (जैसे कि एक अभ्यास परीक्षा) बनाए।
- लक्ष्य: यह देखना कि कौन सी विधि सबसे सटीक रूप से सही उत्तर ढूँढ सकती है।
उन्होंने कई रणनीतियों का परीक्षण किया:
- फ्लैट दृष्टिकोण (The Flat Approach): टेक्स्ट को यादृच्छिक टुकड़ों में काट देना (जैसे केक को यादृच्छिक स्लाइस में काटना)।
- संरचित दृष्टिकोण (The Structured Approach): अध्यायों और अनुभागों को बरकरार रखना (जैसे केक की परतों को अलग रखना)।
- ग्राफ दृष्टिकोण (The Graph Approach): संबंधित जानकारी को खींचने के लिए मकड़ी के जाल का उपयोग करना।
- "स्मूथिंग" ट्रिक (The "Smoothing" Trick): एक चतुर तकनीक जहाँ उन्होंने एक अनुभाग के "अर्थ" को उसके पड़ोसियों के साथ मिला दिया। कल्पना कीजिए कि "पहियों" के बारे में एक पैराग्राफ को बगल में स्थित "ब्रेक" के पैराग्राफ से थोड़ा प्रभावित किया गया था, ताकि AI समझ सके कि वे एक साथ संबंधित हैं।
3. परिणाम: क्या काम आया?
परिणाम "हाँ, यह मदद करता है" और "हमें इसमें सुधार करने की आवश्यकता है" का मिश्रण थे।
- संरचना ही सर्वोपरि है (Structure is King): सबसे महत्वपूर्ण निष्कर्ष यह था कि मूल संरचना (अध्याय और अनुभाग) को बनाए रखने से AI को सटीकता (precision) प्राप्त करने में मदद मिली। यह लाइब्रेरियन को यह बताने जैसा था कि, "केवल शब्द मत खोजो; विषय-सूची (Table of Contents) को देखो।" इससे उत्तर अधिक सटीक हुए और भ्रम कम हुआ।
- उपकरणों का मिश्रण: "कीवर्ड खोज" (सटीक शब्दों को ढूँढना) को "सिमेंटिक खोज" (अर्थ को ढूँढना) के साथ मिलाने से बहुत अच्छा काम किया। यह खजाना खोजने के लिए मेटल डिटेक्टर और मानचित्र दोनों का उपयोग करने जैसा है।
- ग्राफ विस्तार (The "Neighbor" Problem): टीम ने यह आज़माया कि क्या AI अधिक संदर्भ खोजने के लिए ग्राफ में अपने "पड़ोसियों" से जुड़ सकता है। आश्चर्यजनक रूप से, यह उम्मीद के मुताबिक अच्छा काम नहीं किया। यह लाइब्रेरियन के अगले गलियारे में दौड़ने और यादृच्छिक किताबें उठाने जैसा था, जिसने कभी-कभी उत्तर को भ्रमित कर दिया। उन्होंने महसूस किया कि उन्हें यह तय करने के लिए एक बेहतर तरीके की आवश्यकता है कि कौन से पड़ोसी वास्तव में सहायक हैं।
- स्मूथिंग (Smoothing): "मिश्रण" तकनीक ने AI को अधिक प्रासंगिक जानकारी (Recall) खोजने में मदद की, जो एक सुरक्षा जाल की तरह कार्य करता है ताकि यह सुनिश्चित हो सके कि कोई भी महत्वपूर्ण चीज़ छूट न जाए।
4. निष्कर्ष (The Takeaway)
पेपर निष्कर्ष निकालता है कि हालांकि AI शक्तिशाली है, लेकिन इसे जटिल तकनीकी नियमावलियों पर केवल "डंप" नहीं किया जा सकता है।
- उपमा: आप एक बच्चे को केवल एक शब्दकोश दिखाकर कानूनी अनुबंध पढ़ना नहीं सिखा सकते। आपको उन्हें यह सिखाना होगा कि अनुबंध कैसे व्यवस्थित है।
- निर्णय: AI को मानकों और नियमों के लिए काम करने योग्य बनाने के लिए, हमें पदानुक्रम (विषय-सूची) और संबंधों (क्रॉस-रेफरेंस) का सम्मान करना चाहिए। दस्तावेज़ के "पारिवारिक वृक्ष" (family tree) को समझने वाला सिस्टम बनाकर, हमें बहुत बेहतर उत्तर मिलते हैं।
संक्षेप में: लेखकों ने तकनीकी नियमावलियों को कागजों के ढेर के बजाय एक जुड़े हुए मानचित्र के रूप में मानकर, उन्हें खोजने का एक स्मार्ट तरीका बनाया। इसने अभी तक सब कुछ पूरी तरह से हल नहीं किया है, लेकिन इसने साबित कर दिया कि संरचना मायने रखती है और विनियमों (regulations) में AI का भविष्य यह समझने में निहित है कि दस्तावेज़ एक-दूसरे से कैसे बात करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।