Recursive Concept Evolution for Compositional Reasoning in Large Language Models
यह शोध पत्र रिकर्सिव कॉन्सेप्ट इवोल्यूशन (RCE) का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो फिक्स्ड लेटेंट रिप्रेजेंटेशन स्पेस की सीमाओं को दूर करने के लिए इन्फरेंस के दौरान नए कॉन्सेप्ट सबस्पेस को गतिशील रूप से उत्पन्न और अनुकूलित करके लार्ज लैंग्वेज मॉडल्स में कंपोजिशनल रीजनिंग को बढ़ाता है, जिसके परिणामस्वरूप ARC-AGI-2 और GPQA जैसे चुनौतीपूर्ण बेंचमार्क्स पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "रिकर्सिव कॉन्सेप्ट इवोल्यूशन" (RCE) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।
बड़ी समस्या: "जमी हुई मानचित्र" (The Frozen Map)
कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (जैसे कि वह जो इस चैट को संचालित कर रहा है) एक प्रतिभाशाली खोजकर्ता है जिसके पास दुनिया का एक विशाल, विस्तृत मानचित्र है। यह मानचित्र उसके "बचपन" (प्री-ट्रेनिंग) के दौरान बनाया गया था। वह जानता है कि जंगलों में कैसे घूमना है, नदियों को कैसे पार करना है और पहाड़ों पर कैसे चढ़ना है क्योंकि उसने उन सबको पहले देखा है।
हालाँकि, शोधकर्ताओं ने एक बड़ी खामी पाई है: यह मानचित्र जमी हुआ है।
यदि खोजकर्ता को एक ऐसे पहेली को हल करने के लिए कहा जाता है जिसमें एक नए प्रकार के नेविगेशन की आवश्यकता हो—जैसे कि "उड़ना" या "टेलीपोर्ट करना"—तो मानचित्र में उन दिशाओं का विवरण नहीं है। खोजकर्ता मौजूदा रास्तों (पैटर्न जिन्हें वह पहले से जानता है) का उपयोग करके समस्या को हल करने की कोशिश करता है। वह अनुमान लगा सकता है, "शायद मैं उड़ने का अनुकरण करने के लिए बहुत तेज़ चल सकता हूँ?" लेकिन उत्तर संरचनात्मक रूप रूप से गलत होगा।
वर्तमान तरीके इसे ठीक करने के लिए खोजकर्ता को "कड़ी मेहनत करने" या "एक ही रास्ते पर दस बार चलने" (चेन-ऑफ-थॉट, सेल्फ-कंसिस्टेंसी) के लिए कहने की कोशिश करते हैं। लेकिन यदि मानचित्र में सही सड़कें ही गायब हैं, तो कड़ी मेहनत करना केवल एक अधिक आत्मविश्वासी गलत उत्तर की ओर ले जाता है।
समाधान: रिकर्सिव कॉन्सेप्ट इवोल्यूशन (RCE)
लेखकों ने रिकर्सिव कॉन्सेप्ट इवोल्यूशन (RCE) नामक एक नया ढांचा प्रस्तावित किया है।
खोजकर्ता को केवल कड़ी मेहनत करने के लिए कहने के बजाय, RCE खोजकर्ता को एक जादुई टूलकिट देता है जो उन्हें चलते समय अपने मानचित्र पर नई सड़कें बनाने की अनुमति देता है।
यहाँ बताया गया है कि यह टूलकिट कैसे काम करता है, जिसे चार सरल चरणों में विभाजित किया गया है:
1. "आह!" का संकेत (स्पॉनिंग - Spawning)
कल्पना कीजिए कि खोजकर्ता चल रहा है और अचानक एक ऐसी दीवार से टकरा जाता है जिसे वह पार नहीं कर सकता। वह भ्रमित और अनिश्चित महसूस करता है। AI की दुनिया में, इसे "उच्च अनिश्चितता" (high uncertainty) कहा जाता है।
- क्या होता है: जब AI भ्रमित होता है, तो RCE सिस्टम कहता है, "ठीक है, हमारा वर्तमान मानचित्र काम नहीं कर रहा है। हमें एक नए उपकरण की आवश्यकता है।"
- उपमा: यह एक बढ़ई की तरह है जिसे एहसास होता है कि उसका हथौड़ा एक नाजुक काम के लिए बहुत भारी है, इसलिए वह तुरंत एक नए, हल्के पेचकश (screwdriver) का डिज़ाइन तैयार करता है।
2. "ड्राफ्टिंग" चरण (जेनरेशन - Generation)
सिस्टम केवल शेल्फ से कोई भी रैंडम टूल नहीं निकालता। यह उस विशिष्ट समस्या के लिए एक नया उपकरण बनाता है।
- क्या होता है: यह एक छोटा, विशिष्ट "कॉन्सेप्ट" (डेटा को देखने का एक नया तरीका) बनाता है जो उस विशिष्ट भ्रम के अनुकूल हो।
- उपमा: यदि खोजकर्ता को दलदल पार करने की आवश्यकता है, तो सिस्टम उसे केवल एक नाव नहीं देता; बल्कि वह एक विशेष प्रकार का बेड़ा (raft) डिजाइन करता है जो दलदल की चौड़ाई के अनुकूल हो।
3. "सख्त संपादक" (MDL सिलेक्शन - MDL Selection)
सिर्फ इसलिए कि एक नया उपकरण बनाया गया है, इसका मतलब यह नहीं है कि वह अच्छा है। सिस्टम के पास एक सख्त संपादक है (जो मिनिमम डिस्क्रिप्शन लेंथ नामक नियम पर आधारित है)।
- नियम: "क्या यह नया उपकरण पर्याप्त सरल है, और क्या यह वास्तव में काम को आसान बनाता है?"
- उपमा: यदि बढ़ई एक ऐसा नया उपकरण बनाता है जो बहुत जटिल है और केवल 1 सेकंड का काम बचाता है, तो संपादक उसे कचरे में फेंक देता है। उपकरण को सरल और उपयोगी होना चाहिए। यदि यह बहुत जटिल है, तो इसे खारिज कर दिया जाता है। यह AI को बेकार के कचरे से भरने से रोकता है।
4. "टीम अप" (मर्जिंग - Merging)
कभी-कभी, AI दो छोटे उपकरण बनाता है जो अपने आप में तो बेहतरीन हैं, लेकिन एक साथ उपयोग किए जाने पर और भी बेहतर होते हैं।
- क्या होता है: यदि AI देखता है कि "टूल A" और "टूल B" हमेशा एक साथ उपयोग किए जाते हैं, तो वह उन्हें एक शक्तिशाली "सुपर टूल" में मिला देता है।
- उपमा: कल्पना कीजिए कि आपके पास एक "पेचकश" और एक "इंच टेप" है। यदि आप उनका लगातार एक साथ उपयोग करते हैं, तो आप एक "मेजरिंग पेचकश" का आविष्कार कर सकते हैं। यह सरल उपकरणों से लेकर जटिल रणनीतियों तक, उपकरणों का एक पदानुक्रम (hierarchy) बनाता है।
यह गेम-चेंजर क्यों है?
अन्य अधिकांश तरीके AI को उत्तर के लिए अधिक गहनता से खोज (search) करने की कोशिश करते हैं। RCE AI के मस्तिष्क को उत्तर को बेहतर ढंग से समझने के लिए बदल देता है।
- पुराना तरीका: "मुझे उत्तर नहीं पता, इसलिए मैं 100 बार अनुमान लगाऊंगा और उम्मीद करूंगा कि एक सही हो जाए।" (महंगा और धीमा)।
- RCE तरीका: "मुझे उत्तर नहीं पता, इसलिए मैं सोचने का एक नया तरीका बनाऊंगा जिससे उत्तर स्पष्ट हो जाए।" (कुशल और स्मार्ट)।
परिणाम: एक सुपर-एक्सप्लोरर
शोधकर्ताओं ने एक मानक AI मॉडल (Mistral-7B) पर इसका परीक्षण किया और इसे कई कठिन तर्क और गणितीय पहेलियाँ दीं।
- परिणाम: AI केवल थोड़ा बेहतर नहीं हुआ; यह काफी बेहतर हो गया।
- तर्क पहेलियों (ARC-AGI-2) पर, इसमें लगभग 12-18 अंक का सुधार हुआ।
- विज्ञान के प्रश्नों (GPQA) पर, इसमें 8-14 अंक का सुधार हुआ।
- लागत: इसने सामान्य से 100 गुना अधिक समय तक सोचने की आवश्यकता के बिना यह कर दिखाया। इसने सामान्य से केवल लगभग 4% अधिक कंप्यूटिंग पावर का उपयोग किया।
"क्रिस्टलाइजेशन" (दीर्घकालिक स्मृति - Long-Term Memory)
अंत में, पेपर उल्लेख करता है कि यदि कोई नया उपकरण बार-बार उपयोगी साबित होता है, तो उसे "क्रिस्टलाइज" (crystallized) कर दिया जाता है।
- उपमा: कल्पना कीजिए कि बढ़ई साल भर उस नए पेचकश का उपयोग करता रहता है। अंततः, वह उसे केवल अपने टूलकिट में नहीं रखता; वह उसे स्थायी रूप से अपनी बेल्ट पर वेल्ड (weld) कर देता है। AI इन सफल नए कॉन्सेप्ट्स को सहेज लेता है ताकि उसे उन्हें फिर से शून्य से आविष्कार न करना पड़े।
सारांश
रिकर्सिव कॉन्सेप्ट इवोल्यूशन एक स्थिर, जमी हुई मानचित्र को हर बार जब यात्री फंस जाता है, तो नए रास्ते विकसित करने की क्षमता देने जैसा है। केवल अधिक अनुमान लगाने के बजाय, AI सोचने के नए तरीके आविष्कार करना सीखता है, उनमें से सर्वश्रेष्ठ को रखता है, और खराब वाले को हटा देता है, जिससे वह हर समस्या को हल करने के साथ अधिक स्मार्ट और लचीला बनता जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।