Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
यह शोध पत्र नेटिव पैरेलल रीज़नर (NPR) को प्रस्तुत करता है, जो एक टीचर-फ्री फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को सेल्फ-डिस्टिल्ड प्रोग्रेसिव ट्रेनिंग, पैरेलल-अवेयर पॉलिसी ऑप्टिमाइज़ेशन और एक रिफैक्टर्ड एक्जीक्यूशन इंजन के माध्यम से वास्तविक समानांतर तर्क (पैरेलल रीजनिंग) क्षमताओं को स्वयं विकसित करने में सक्षम बनाता है, जिससे ऑटोरिग्रेसिव डिकोडिंग पर वापस जाए बिना महत्वपूर्ण प्रदर्शन लाभ और 4.6 गुना तक इन्फरेंस स्पीडअप प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक अत्यंत प्रतिभाशाली लेकिन बहुत ही पारंपरिक छात्र है। यह छात्र समस्याओं को हल करने में माहिर है, लेकिन वह इसे एक समय में एक कदम करके करता है, जैसे कि एक किताब को बाएं से दाएं पढ़ना। वह कभी भी आगे नहीं बढ़ता, और न ही कभी एक साथ दो अलग-अलग समाधानों को आज़माता है। अधिकांश वर्तमान AI मॉडल इसी तरह काम करते हैं: वे एक सीधी रेखा में सोचते हैं।
यह शोध पत्र नेटीव पैरेलल रेज़नर (Native Parallel Reasonizer - NPR) नामक एक नई प्रणाली का परिचय देता है। NPR को उस छात्र के रूप में न देखें जो एक किताब पढ़ रहा है, बल्कि इसे एक ही कमरे में काम करने वाली जासूसों की एक टीम के रूप में देखें। इसमें यह नहीं होता कि जासूस A के सुराग खोजने के पूरा होने का इंतज़ार किया जाए ताकि जासूस B शुरू कर सके; इसके बजाय, वे सभी एक साथ रहस्य के विभिन्न हिस्सों पर काम करते हैं, और फिर मामला सुलझाने के लिए एक साथ आते हैं।
यहाँ यह बताया गया है कि उन्होंने इस "टीम" को मिलकर काम करना कैसे सिखाया, जिसे तीन चरणों में विभाजित किया गया है:
1. वर्तमान AI के साथ समस्या
लेखकों का कहना है कि वर्तमान AI को समानांतर (parallel) रूप से सोचने के लिए तीन बड़ी मुश्किलें आती हैं:
- गलत उपकरण: AI चलाने के लिए उपयोग किए जाने वाले सॉफ़्टवेयर इंजन सीधी रेखाओं के लिए बनाए गए हैं। उन्हें शाखाओं में बँटने के लिए मजबूर करना वैसा ही है जैसे किसी कार को ट्रेन की पटरी पर चलाने की कोशिश करना; इससे सिस्टम टूट जाता है या अटक जाता है।
- बर्बाद प्रयास: समानांतर सोच के शुरुआती प्रयास अनाड़ी थे। यह ऐसा था जैसे पाँच लोगों को गणित की समस्या हल करने के लिए कहा जाए, लेकिन बजाय इसके कि वे अपने रफ वर्क (scratch paper) साझा करें, प्रत्येक को पूरी समस्या फिर से लिखनी पड़े। इससे वे तेज़ होने के बजाय धीमे हो गए।
- "शिक्षक" का जाल: पिछले तरीकों में एक अत्यंत बुद्धिमान "शिक्षक" AI पर निर्भरता थी जो छात्र को समानांतर रूप से सोचना सिखाता था। लेकिन छात्र ने केवल शिक्षक की रैखिक (linear) सोच की नकल की और उसे समानांतर प्रारूप में फिट करने की कोशिश की। यह वैसा ही था जैसे किसी व्यक्ति को, जो केवल पैदल चलता है, उसे मैराथन दौड़ने के लिए कहना और यह बताना कि "तेज़ चलो।" वे चलने का एक नया तरीका नहीं खोज सके।
2. समाधान: एक तीन-चरणीय प्रशिक्षण शिविर (Three-Stage Training Camp)
NPR सिस्टम AI को बिना किसी शिक्षक के एक सच्चा समानांतर विचारक बनने के लिए प्रशिक्षित करता है। वे एक "सेल्फ-डिस्टिल्ड" (स्व-निर्मित) दृष्टिकोण का उपयोग करते हैं, जिसका अर्थ है कि AI खुद को खुद ही सिखाता है।
चरण 1: नियम सीखना ("फॉर्मेट" चरण)
कल्पना कीजिए कि AI एक अराजक कलाकार है। इस चरण में, शोधकर्ता उसे एक पुरस्कार प्रणाली देते हैं: "यदि आप अपना चित्र एक विशिष्ट, व्यवस्थित ग्रिड में बनाते हैं, तो आपको एक गोल्ड स्टार मिलेगा। यदि आप बेतरतीब ढंगट scribbles करते हैं, तो आपको दंड मिलेगा।" AI अभी यह नहीं जानता कि समस्या को कैसे हल करना है; वह बस अपने विचारों को एक संरचित "मैप-प्रोसेस-रिड्यूस" (योजना -> क्रिया -> सारांश) प्रारूप में व्यवस्थित करना सीखता है। वह समानांतर सोच के आकार को सीखता है।चरण 2: वार्म-अप ("अभ्यास" चरण)
अब जब AI नियम जान चुका है, तो वह अभ्यास करना शुरू करता है। शोधकर्ता AI को हजारों उत्तर उत्पन्न करने देते हैं, लेकिन वे गलत उत्तरों (जो गलत हैं या नियमों का पालन नहीं करते) को हटा देते हैं। वे केवल पूर्ण, संरचित उत्तरों को रखते हैं और उनका उपयोग AI को "फाइन-ट्यून" करने के लिए करते हैं। यह एक कोच की तरह है जो टीम को उनके अभ्यास सत्र से केवल बेहतरीन खेल दिखाते हैं ताकि वे उस सटीक फॉर्मेशन को याद कर सकें।चरण 3: असली खेल ("सुदृढ़ीकरण" चरण)
यह एक बड़ी छलांग है। अब AI को एक वास्तविक खेल में डाला जाता है जहाँ उसे कठिन समस्याओं को हल करना होता है। वह विभिन्न समानांतर रणनीतियों को आजमाता है। यदि उसे कोई समाधान जल्दी मिल जाता है, तो उसे इनाम मिलता है। यदि वह फंस जाता है, तो वह एक अलग शाखा (branch) आज़माना सीखता है। महत्वपूर्ण बात यह है कि शोधकर्ताओं ने एक विशेष "NPR इंजन" (एक नए प्रकार का सॉफ़्टवेयर) बनाया है जो एक रेफरी की तरह कार्य करता है। यह सुनिश्चित करता है कि AI "एक-एक करके" सोचने वाली पद्धति पर वापस जाकर धोखाधड़ी न करे और यह मेमोरी का प्रबंधन करता है ताकि टीम के पास जगह खत्म न हो जाए।
3. परिणाम: तेज़ और स्मार्ट
इस नए "जासूसों की टीम" का परीक्षण आठ अलग-अलग प्रकार के कठिन तर्क परीक्षणों (जैसे गणित प्रतियोगिताएं और तर्क पहेलियाँ) पर किया गया।
- वास्तविक समानांतरता (True Parallelism): अन्य मॉडलों के विपरीत जो कभी-कभी समानांतर होने का दिखावा करते हैं लेकिन वास्तव में एक रेखा में सोचते हैं (एक "फेक-आउट"), NPR ने 100% वास्तविक समानांतर सोच प्रदर्शित की। उसने कभी भी धोखाधड़ी नहीं की।
- गति: क्योंकि यह वास्तव में समानांतर रूप से सोच रहा था, इसलिए यह बहुत तेज़ था। सबसे कठिन समस्याओं पर, यह पुराने रैखिक (linear) मॉडलों की तुलना में 4.6 गुना तेज़ था। यह एक गंतव्य तक पहुँचने के लिए एक अकेले व्यक्ति के पैदल चलने बनाम कारों के एक काफिले के एक साथ चलने के बीच के अंतर जैसा है।
- सटीकता: इसने मानव शिक्षकों या अन्य समानांतर तरीकों द्वारा प्रशिक्षित मॉडलों की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
मुख्य निष्कर्ष
शोध पत्र का दावा है कि AI को अपने ध्यान को विभाजित करने और एक साथ कई रास्तों पर काम करने के लिए खुद को सिखाने देकर, हम ऐसे AI बना सकते हैं जो न केवल जटिल पहेलियों को सुलझाने में स्मार्ट है, बल्कि काफी तेज़ भी है। उन्होंने केवल AI को समानांतर दिखने के लिए मजबूर नहीं किया; उन्होंने इसे समानांतर सोचने की एक नेटिव (जन्मजात) क्षमता विकसित करने में मदद की, जैसे कि एक मांसपेशी जिसे अंततः सही ढंग से व्यायाम कराया गया हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।