Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models
यह शोध पत्र स्टेप-लेवल प्रोसीजरल रूल रीजनिंग (step-level procedural rule reasoning) के मूल्यांकन के लिए एक बड़े पैमाने के बेंचमार्क, RuleWorld को प्रस्तुत करता है, और DynaRule का प्रस्ताव देता है, जो एक एंड-टू-एंड फ्रेमवर्क है जो KV कैश के भीतर नियमों को गतिशील रूप से इंजेक्ट करके और उन पर पुनः ध्यान केंद्रित (re-attending) करके जटिल मल्टी-स्टेप रीजनिंग कार्यों पर LLM के प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लार्ज लैंग्वेज मॉडल्स (LLMs) कृत्रिम बुद्धिमत्ता की एक नई पीढ़ी के इंजन हैं, जो आश्चर्यजनक प्रवाह के साथ कहानियाँ लिखने, गणित की समस्याओं को हल करने और भाषाओं का अनुवाद करने में सक्षम हैं। वे बड़ी मात्रा में टेक्स्ट को आत्मसात करके काम करते हैं, जिससे वे इस सांख्यिकीय पैटर्न को सीख लेते हैं कि शब्द अर्थ बनाने के लिए एक साथ कैसे जुड़ते हैं। वर्षों से, शोधकर्ताओं ने इन मॉडल्स का परीक्षण तथ्यों को याद रखने की उनकी क्षमता पर किया है, जैसे यह जानना कि पेरिस फ्रांस की राजधानी है। लेकिन एक अलग प्रकार का ज्ञान भी है जो वास्तविक दुनिया की सोच के लिए उतना ही महत्वपूर्ण है: प्रक्रियात्मक ज्ञान (procedural knowledge)। यह इस बारे में नहीं है कि क्या सत्य है, बल्कि इस बारे में है कि निर्देशों के एक सेट के आधार पर कैसे कार्य करना है या तर्क देना है। एक ऐसे वकील की कल्पना करें जिसे एक नए मामले पर विशिष्ट, जटिल कानूनों के समूह को लागू करना होता है, या एक डॉक्टर जो दुर्लभ स्थिति का निदान करने के लिए एक विस्तृत प्रोटोकॉल का पालन करता है। इन स्थितियों में, उत्तर स्मृति में संग्रहीत नहीं होता है; इसे एक बड़े, बाहरी नियमकोश (rulebook) से चरण-दर-चरण खोजा, चुना और लागू किया जाना चाहिए। सवाल यह है कि क्या ये शक्तिशाली मॉडल्स वास्तव में इसे करना सीख सकते हैं, या वे केवल अपने आंतरिक अनुमानों पर भरोसा करते हुए नियमों को समझने का ढोंग करते हैं।
इसका उत्तर देने के लिए, शोधकर्ताओं की एक टीम ने 'रूलवर्ल्ड' (RuleWorld) नामक एक विशाल परीक्षण क्षेत्र बनाया। मॉडल्स को एक एकल पहेली को हल करने के लिए कुछ नियम देने के बजाय, उन्होंने लगभग पचास लाख अमूर्त नियमों वाला एक पुस्तकालय बनाया। ये नियम जानबूझकर अजीब और रोजमर्रा की जिंदगी से असंबंधित बनाए गए थे, जैसे कि "यदि कोई जीव जंगल में प्रवेश करता है, तो वह आग पकड़ लेता है," ताकि मॉडल्स अपने आंतरिक ज्ञान का उपयोग न कर सकें। ये नियम दो तरह से लिखे गए हैं: औपचारिक तार्किक कथनों के रूप में और साधारण अंग्रेजी वाक्यों के रूप में। शोधकर्ताओं ने मॉडल्स का परीक्षण करने के लिए तीन प्रकार की चुनौतियाँ डिज़ाइन कीं। पहली सरल थी: एक प्रश्न का उत्तर देने के लिए एक नियम ढूँढना। दूसरी अधिक जटिल थी: एक साथ कई प्रश्नों के उत्तर देना, जिनमें से प्रत्येक के लिए अलग-अलग नियमों की आवश्यकता होती है। तीसरी सबसे कठिन थी: समस्याओं की एक श्रृंखला को हल करना जहाँ पहले चरण का उत्तर अगले चरण के लिए शुरुआती बिंदु बन जाता है, जिसमें मॉडल को एक लंबी तार्किक श्रृंखला के माध्यम से अपनी प्रगति को ट्रैक करने की आवश्यकता होती है।
जब उन्होंने इस नए बेंचमार्क पर मौजूदा मॉडल्स का परीक्षण किया, तो परिणाम स्पष्ट थे। जब उपलब्ध नियमों की संख्या बढ़ गई, तो सबसे उन्नत मॉडल्स भी संघर्ष करने लगे। जब हजारों नियमों के पूल में से चुनने के लिए मजबूर किया गया, तो वे अक्सर गलत नियमों को चुन लेते थे या बहु-चरणीय श्रृंखला के बीच में खो जाते थे। मानक तरीके जो उत्तर देने से पहले प्रासंगिक टेक्स्ट खोजने में मॉडल्स की मदद करने की कोशिश करते हैं, वे नाजुक साबित हुए; वे पहले चरण के लिए सही नियम तो ढूंढ लेते थे लेकिन दूसरे चरण के लिए अपनी खोज को अपडेट करने में विफल रहते थे, जिससे त्रुटियों की एक श्रृंखला बन जाती थी। मॉडल्स अनिवार्य रूप से पूरे नियमकोश को एक साथ अपने दिमाग में रखने की कोशिश कर रहे थे, एक ऐसा कार्य जिसने उनकी उस क्षमता को अभिभूत कर दिया जो प्रत्येक विशिष्ट क्षण में महत्वपूर्ण चीज़ों पर ध्यान केंद्रित करने के लिए आवश्यक है।
इसे हल करने के लिए, शोधकर्ताओं ने 'डायनारूल' (DynaRule) नामक एक नई प्रणाली विकसित की। नियमों को एक बार पढ़े जाने वाली स्थिर सूची के रूप में मानने के बजाय, डायना-रूल मॉडल को नियमों को एक गतिशील संसाधन के रूप में मानने के लिए सिखाता है जिसे वह सोचते समय उसमें पहुँच सकता है और उसे अपडेट कर सकता है। यह प्रणाली नियमों को मॉडल की आंतरिक स्मृति संरचना में सीधे एम्बेड (embed) करके काम करती है, एक ऐसी प्रक्रिया जो मॉडल को बिना धीमे हुए उन तक पहुँचने की अनुमति देती है। महत्वपूर्ण रूप से, मॉडल को यह पहचानने के लिए प्रशिक्षित किया जाता है कि उसे कब अपनी दिशा बदलने की आवश्यकता है। यह एक विशेष आंतरिक संकेत, एक मानसिक "खोज" (search) कमांड उत्सर्जित करना सीखता है, जब भी वह तर्क के एक चरण को पूरा करता है और उसे अगले नियम को खोजने की आवश्यकता होती है। जब यह संकेत सक्रिय होता है, तो मॉडल तुरंत नियमों के पूरे पुस्तकालय का पुनर्मूल्यांकन करता है, उन नियमों को त्याग देता है जिनका उसने पहले उपयोग किया था और अपना ध्यान उन नए नियमों पर केंद्रित करता है जो वर्तमान चरण के लिए आवश्यक हैं। यह नियम खोजने के कार्य को एक बार की खोज से एक निरंतर, सीखने योग्य प्रक्रिया में बदल देता है जो तर्क की श्रृंखला के साथ विकसित होती है।
इस दृष्टिकोण के परिणाम महत्वपूर्ण थे। रूलवर्ल्ड बेंचमार्क पर, डायना-रूल ने शक्तिशाली बाहरी खोज उपकरणों का उपयोग करने वाले अन्य सभी तरीकों को लगातार पछाड़ दिया। दस हजार नियमों के पूल का सामना करते समय, नई प्रणाली ने उच्च स्तर की सटीकता बनाए रखी, पहले प्रयास में अस्सी प्रतिशत से अधिक बार सही नियम को सफलतापूर्वक पहचान लिया, जबकि अन्य तरीकों का प्रदर्शन गिर गया। कई चरणों वाली कार्यों में, डायना-रूल ने सर्वश्रेष्ठ मौजूदा विकल्पों की तुलना में औसत सटीकता में लगभग बीस अंकों का सुधार किया। इस प्रणाली ने सिद्ध किया कि मॉडल को निर्देशों के एक बड़े सेट के प्रति अपने स्वयं के ध्यान को सक्रिय रूप से प्रबंधित करना सिखाकर, वह जटिल तार्किक परिदृश्यों को विश्वसनीय रूप से नेविगेट कर सकता है। शोधकर्ताओं ने पाया कि मॉडल ने केवल नियमों को याद नहीं किया; इसने उन्हें खोजने और लागू करने की एक सामान्य विधि सीखी, यहाँ तक कि उन नियमों पर परीक्षण किए जाने पर भी जिन्हें उसने पहले कभी नहीं देखा था। यह सुझाव देता है कि मॉडल के विशाल आंतरिक ज्ञान और बाहरी निर्देशों का पालन करने की उसकी क्षमता के बीच के अंतर को पाटा जा सकता है, बशर्ते मॉडल को कार्य के दौरान अपने फोकस को गतिशील रूप से अपडेट करने का एक तरीका दिया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।