The Ratchet Effect in Silico through Interaction-Driven Cumulative Intelligence in Large Language Models
यह शोध पत्र POLIS को प्रस्तुत करता है, जो एक ऐसा ढांचा है जहाँ विषम (heterogeneous) लार्ज लैंग्वेज मॉडल्स, पीयर वेरिफिकेशन और साझा मेमोरी में मान्य आर्टिफैक्ट्स के प्रतिधारण (retention) के माध्यम से मानव संचयी सांस्कृतिक विकास (cumulative cultural evolution) की नकल करके गणितीय तर्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त करते हैं, जो यह प्रदर्शित करता है कि संरचित सामाजिक संपर्क मॉडल के आकार के लंबवत (orthogonal) एक शक्तिशाली स्केलिंग लीवर के रूप में कार्य करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप जटिल गणित की समस्याओं को हल करना सीख रहे हैं।
पुराना तरीका (वर्तमान AI):
अभी, अधिकांश AI मॉडल एक ऐसे अकेले छात्र की तरह सीखते हैं जो एक विशाल, स्थिर विश्वकोश (encyclopedia) के साथ पुस्तकालय में बैठा है। वे सब कुछ एक बार पढ़ते हैं, उसे याद करते हैं, और फिर सवालों के जवाब देने की कोशिश करते हैं। यदि वे कहीं अटक जाते हैं, तो वे वास्तव में वास्तविक समय (real-time) में अपनी गलतियों से "सीख" नहीं सकते क्योंकि वे केवल एक एकल, अलग मस्तिष्क हैं। स्मार्ट बनने के लिए, एकमात्र विकल्प लाइब्रेरी को बड़ा बनाना (अधिक डेटा) या छात्र के मस्तिष्क को भौतिक रूप से बड़ा करना (अधिक कंप्यूटर चिप्स/पैरामीटर्स) है। यह महंगा है और एक सीमा तक पहुँचकर रुक जाता है।
नया तरीका (POLIS पेपर):
इस पेपर के पीछे के शोधकर्ताओं ने एक अलग सवाल पूछा: क्या होगा अगर AI एक मानव समाज की तरह सीखता?
उन्होंने एक "डिजिटल समाज" बनाया जहाँ कई छोटे AI मॉडल (छात्र) एक साथ काम करते हैं, एक-दूसरे से बात करते हैं, और समय के साथ एक-दूसरे से सीखते हैं। वे इसे "रैचेट प्रभाव" (Ratchet Effect) कहते हैं।
यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:
1. "रैचेट" की उपमा
एक रैचेट टूल (जैसे रिंच/wrench) के बारे में सोचें। यह आपको बोल्ट को आगे घुमाने देता है, लेकिन इसमें एक ऐसा तंत्र होता है जो इसे पीछे फिसलने से रोकता है।
- मानव संस्कृति में: हम कुछ नया आविष्कार करते हैं (पहिया, आग), और हम यह सुनिश्चित करते हैं कि वह खो न जाए। हम अगली पीढ़ी को सिखाते हैं, ताकि वे पहिये के साथ अपने नए विचारों के साथ शुरुआत करें। हम कभी भी प्रगति को खोते नहीं हैं।
- POLIS में: AI मॉडल विचार उत्पन्न करते हैं। वे एक-दूसरे के काम की जाँच करते हैं। यदि कोई विचार अच्छा है, तो वे उसे एक साझा स्मृति बैंक (shared memory bank) में "लॉक" कर देते हैं। अगली बार जब वे सीखते हैं, तो वे उस लॉक किए गए ज्ञान के साथ शुरुआत करते हैं। वे पीछे नहीं फिसल सकते; वे केवल आगे बढ़ सकते हैं।
2. डिजिटल समाज के चार चरण
पेपर एक चक्र का वर्णन करता है जो बार-बार होता है:
चरण 1: मंथन (विविधता - Variation)
कल्पना कीजिए कि एक स्टडी हॉल में छात्रों का एक समूह है। उन्हें एक कठिन गणित की समस्या दी जाती है। एक छात्र द्वारा अकेले इसे हल करने के बजाय, हर कोई स्वतंत्र रूप से इसे हल करने की कोशिश करता है। कुछ सही हो सकते हैं, कुछ गलत, कुछ का दृष्टिकोण अजीब लेकिन चतुर हो सकता है।- AI का मोड़: सिस्टम यह सुनिश्चित करता है कि समस्याएं बहुत आसान या बहुत कठिन न हों, उन्हें एक "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) में रखा जाए जहाँ सीखना सबसे अच्छा होता है।
चरण 2: सहकर्मी समीक्षा (चयन - Selection)
यह सबसे महत्वपूर्ण हिस्सा है। छात्र अपने पेपरों की अदला-बदली करते हैं। लेकिन वे केवल वोट नहीं देते; उन्हें सर्वसम्मति से सहमत होना पड़ता है कि समाधान सही है। यदि एक भी छात्र कहता है, "रुको, यह गलत है," तो समाधान को बाहर कर दिया जाता है।- यह क्यों मायने रखता है: यह "हलुसिनेशन" (AI का मनगढ़ंत बातें बनाना) को रोकता है। यह एक सख्त फिल्टर के रूप में कार्य करता है, यह सुनिश्चित करता है कि केवल सत्य ही सुरक्षित रहे। पेपर इसे "एपिस्टेमिक विजिलेंस" (ज्ञान के प्रति सतर्कता) कहता है।
चरण 3: साझा पुस्तकालय (प्रतिधारण - Retention)
वे समाधान जो सख्त सहकर्मी समीक्षा से पास हुए, उन्हें "साझा सांस्कृतिक स्मृति" (Shared Cultural Memory) यानी एक डिजिटल लाइब्रेरी में लिख दिया जाता है। यह वह "रैचेट" है जो प्रगति को अपनी जगह पर लॉक कर देता है।चरण 4: अध्ययन सत्र (आंतरिककरण - Internalization)
अब, प्रत्येक छात्र लाइब्रेरी से "विजेता" समाधानों को पढ़ता है और अपने स्वयं के मस्तिष्क को अपडेट करता है ताकि वे इससे सीख सकें। वे केवल उत्तर को याद नहीं करते; वे विधि को सीखते हैं ताकि अगली बार वे इसे खुद कर सकें।
3. परिणाम: छोटी टीमें विशाल दिग्गजों को हरा देती हैं
शोधकर्ताओं ने इसका परीक्षण छोटे AI मॉडलों के एक समूह के साथ किया (कुछ में केवल 1 बिलियन "मस्तिष्क कोशिकाएं" थीं, जो AI के संदर्भ में बहुत कम है)।
- आश्चर्य: भले ही ये मॉडल छोटे थे, इस "सामाजिक शिक्षण" के कुछ दौरों के बाद, वे एक विशाल, एकल AI मॉडल (जिसमें 70+ बिलियन पैरामीटर्स हैं) से भी अधिक स्मार्ट हो गए।
- उपमा: यह चार औसत छात्रों की एक टीम की तरह है, जो एक सप्ताह तक एक साथ काम करते हैं और एक-दूसरे से सीखते हैं, और एक ऐसे अकेले जीनियस को हरा देते हैं जिसने एक वर्ष तक अकेले पढ़ाई की है।
- विविधता मदद करती है: यह सिस्टम तब सबसे अच्छा काम करता है जब छात्र एक-दूसरे से अलग होते हैं (अलग ताकत और कमजोरियां)। यदि सभी एक जैसे होते, तो वे एक जैसी गलतियाँ करते। यदि वे अलग थे, तो वे एक-दूसरे की गलतियों को पकड़ लेते थे।
4. यह सब कुछ कैसे बदल देता है
वर्तमान में, टेक जगत यह मानता है कि AI को स्मार्ट बनाने का एकमात्र तरीका बड़े, महंगे कंप्यूटर बनाना है।
यह पेपर एक नया रास्ता सुझाता है: संगठन (Organization)।
केवल मस्तिष्क को बड़ा बनाने के बजाय, हम समाज को स्मार्ट बना सकते हैं। सामाजिक संपर्क, सत्यापन और साझा स्मृति की एक परत जोड़कर, हम बिना सुपरकंप्यूटर बनाए भारी बुद्धिमत्ता प्राप्त कर सकते हैं।
संक्षेप में:
पेपर यह सिद्ध करता है कि AI को केवल बड़ा होने की ज़रूरत नहीं है; इसे अधिक सामाजिक होने की ज़रूरत है। एक ऐसा सिस्टम बनाकर जहाँ AI एजेंट एक-दूसरे के काम की जाँच करते हैं और मिलकर सर्वश्रेष्ठ समाधानों से सीखते हैं, वे एक "रैचेट" बनाते हैं जो प्रगति को लॉक कर देता है और छोटे मॉडलों को उनकी क्षमता से कहीं अधिक प्रभावी बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।