Amortizing intractable inference in large language models
यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में जटिल अनुमान (इंट्रैक्टेबल इन्फरेंस) को अमोर्टाइज करने के लिए GFlowNets का उपयोग करने का प्रस्ताव देता है, जिससे वे कंस्ट्रेंड जनरेशन और चेन-ऑफ-थॉट रीजनिंग जैसे कार्यों के लिए जटिल पोस्टीरियर वितरणों से नमूने (सैंपल) ले सकें, जो पारंपरिक मैक्सिमम-लाइक्लीहुड या रिवॉर्ड-मैक्सिमाइजिंग ट्रेनिंग के एक डेटा-कुशल विकल्प के रूप में कार्य करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लार्ज लैंग्वेज मॉडल्स (LLMs) मानव ज्ञान के विशाल पुस्तकालय हैं, जिन्हें डिजिटल नेटवर्क में संकुचित किया गया है जो अपने से पहले आए शब्दों के आधार पर एक वाक्य में अगले शब्द की भविष्यवाणी करते हैं। उन्हें किसी कहानी को आगे बढ़ाने या किसी शुरुआती बिंदु के दिए जाने पर प्रश्न का उत्तर देने में उत्कृष्ट होने के लिए प्रशिक्षित किया जाता है, एक ऐसी प्रक्रिया जो स्वाभाविक रूप से बाएं से दाएं की ओर बहती है। हालाँकि, हम इन मॉडल्स से जो सबसे दिलचस्प कार्य करवाना चाहते हैं, उनमें से कई के लिए उल्टा सोचने या कहानी के बीच के हिस्से को भरने की आवश्यकता होती है। कल्पना कीजिए कि आपको एक कहानी की शुरुआत और अंत दिया गया है और आपसे बीच का हिस्सा रचने के लिए कहा गया है, या आपसे किसी विशिष्ट उत्तर के पीछे के तर्क को समझाने के लिए कहा गया है। इन परिदृश्यों में, मॉडल केवल अगले शब्द का अनुमान नहीं लगा सकता; इसे शुरुआत को अंत से जोड़ने वाले विशिष्ट पथ को खोजने के लिए संभावनाओं के एक विशाल और जटिल परिदृश्य में खोज करनी होगी। यह एक कठिन गणितीय समस्या है क्योंकि संभावित पथों की संख्या इतनी अधिक है कि उन्हें एक-एक करके जाँचना असंभव है, और इस परिदृश्य में नेविगेट करने के तरीके अक्सर केवल एक या दो सामान्य मार्गों पर ही अटक जाते हैं, जिससे मौजूद वैध समाधानों की समृद्ध विविधता छूट जाती है।
मिला - क्यूबेक एआई इंस्टीट्यूट और ऑक्सफोर्ड यूनिवर्सिटी के शोधकर्ताओं ने इन मॉडल्स को उस जटिल परिदृश्य में नेविगेट करना सिखाने का एक नया तरीका विकसित किया है। मॉडल को केवल "सर्वश्रेष्ठ" उत्तर के लिए एक स्कोर को अधिकतम करने के लिए प्रशिक्षित करने के बजाय, जो अक्सर दोहरावदार और संकीर्ण सोच की ओर ले जाता है, उन्होंने 'एमोर्टाइज्ड इन्फरेंस' (amortized inference) नामक पद्धति का उपयोग किया। यह दृष्टिकोण समस्या को एक एकल पूर्ण उत्तर के बजाय सही पथों के एक विविध सेट की खोज के रूप में देखता है। ऐसा करने के लिए, उन्होंने 'जेनरेटिव फ्लो नेटवर्क' (generative flow network) नामक तकनीक का उपयोग किया, जो एक मार्गदर्शक की तरह कार्य करता है जो समाधानों की पूरी श्रृंखला से नमूने (sample) लेने के लिए सीखता है, यह सुनिश्चित करते हुए कि मॉडल एक ही बार उपयोग किए गए पैटर्न में सिमटने के बजाय विभिन्न वैध तर्क श्रृंखलाओं का अन्वेषण करे।
टीम ने इन मॉडल्स को बहु-चरणीय तर्क (multi-step reasoning) वाली समस्याओं को हल करने के लिए फाइन-ट्यून करके इसका प्रदर्शन किया, जैसे कि अंकगणितीय गणनाएँ या यह वर्गीकृत करना कि मूवी रिव्यू एक राय व्यक्त करता है या एक तथ्य। एक प्रयोग में, उन्होंने मॉडल को एक छोटी कहानी का लुप्त मध्य वाक्य भरने के लिए कहा, जिसमें शुरुआत और अंत दिया गया था। मानक तरीके अक्सर ऐसे वाक्य उत्पन्न करते थे जो व्याकरण की दृष्टि से सही तो थे लेकिन कथा के प्रवाह में फिट नहीं बैठते थे। हालाँकि, नई पद्धति ने सफलतापूर्वक ऐसे मध्य वाक्य उत्पन्न किए जो शुरुआत और अंत को सुसंगत रूप से जोड़ते थे, जिससे पूर्ण संदर्भ को समझने की उनकी उच्च क्षमता प्रदर्शित हुई। एक अन्य परीक्षण में, जिसमें सरल गणितीय समस्याएं शामिल थीं, मॉडल को एक कैलकुलेटर टूल से लैस किया गया और गणना को चरणों में तोड़ने के लिए कहा गया। जबकि अन्य प्रशिक्षण विधियों के कारण मॉडल संख्याओं को दोहराने लगा या टूल का सही उपयोग करने में विफल रहा, नए दृष्टिकोण ने मॉडल को अपने चरणों की सावधानीपूर्वक योजना बनाना सिखाया, जिससे सटीकता में नाटकीय सुधार हुआ, विशेष रूप से उन समस्याओं पर जो उसने पहले कभी नहीं देखी थीं।
परिणाम बताते हैं कि यह विधि विशेष रूप से तब शक्तिशाली होती है जब डेटा कम हो। केवल दस मूवी रिव्यूज के उदाहरणों से सीखने के परीक्षण में, नई पद्धति ने मानक प्रशिक्षण तकनीकों की तुलना में काफी अधिक सटीकता प्राप्त की, और यह पचास उदाहरणों के साथ भी उन्हें पछाड़ना जारी रखती है। शोधकर्ताओं ने पाया कि मॉडल को विविध तर्क पथों के नमूने लेने और फिर उनके निष्कर्षों को संयोजित करने के लिए प्रोत्साहित करके, सिस्टम अधिक मजबूत और विश्वसनीय हो गया। यह एक महत्वपूर्ण अंतर है क्योंकि इसका अर्थ है कि मॉडल केवल समस्या को हल करने के एक तरीके को याद नहीं कर रहा है, बल्कि यह सोचने के अंतर्निर्निहित ढांचे को सीख रहा है। अध्ययन इंगित करता है कि लक्ष्य को एकल सबसे संभावित उत्तर खोजने से बदलकर सही उत्तरों की पूर्ण विविधता का अन्वेषण करने की ओर स्थानांतरित करके, हम इन शक्तिशाली उपकरणों को अधिक लचीला और जटिल तर्क कार्यों के लिए बेहतर बना सकते हैं।
यह कार्य इस सीमा को भी उजागर करता है कि वर्तमान मॉडल्स को अक्सर कैसे प्रशिक्षित किया जाता है। जब मॉडल्स को रिवॉर्ड (पुरस्कार) को अधिकतम करने के लिए प्रेरित किया जाता है, तो वे शॉर्टकट खोजने लगते हैं, जैसे कि उच्च स्कोर पाने के लिए एक ही वाक्यांश को दोहराना या समस्या के वास्तविक तर्क को अनदेखा करना। शोधकर्ताओं ने दिखाया कि उनका तरीका इस जाल से बचता है क्योंकि यह संभावित समाधानों के पूरे वितरण (distribution) से मेल खाता है, यह सुनिश्चित करता है कि मॉडल सोच के एक एकल, त्रुटिपूर्ण मोड में न सिमट जाए। यह दृष्टिकोण मॉडल को नई स्थितियों में बेहतर सामान्यीकरण (generalize) करने की अनुमति देता है, जैसे कि उन अंकगणितीय समस्याओं को हल करना जिनमें प्रशिक्षण के दौरान उपयोग किए गए नंबरों से अधिक नंबर थे, जहाँ अन्य विधियाँ विफल रहीं। निष्कर्ष आर्टिफिशियल इंटेलिजेंस को वास्तविक तर्क करने में अधिक सक्षम बनाने के लिए एक आशाजनक मार्ग प्रदान करते हैं, जो सरल पैटर्न मिलान से आगे बढ़कर तर्क बनाने और चरण-दर-चरण समस्याओं को हल करने की सूक्ष्म समझ की ओर ले जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।