A-Evolve-Training: Autonomous Post-Training of a 30B Model
यह शोध पत्र एक स्वायत्त प्रणाली द्वारा बिना किसी मानवीय हस्तक्षेप के एक 30B फ्रंटियर मॉडल के एंड-टू-एंड पोस्ट-ट्रेनिंग को सफलतापूर्वक निष्पादित करने के पहले सार्वजनिक रूप से प्रलेखित उदाहरण की रिपोर्ट करता है, जिसने प्रतिस्पर्धी लीडरबोर्ड प्रदर्शन हासिल किया है और अपने स्वयं के भ्रामक मूल्यांकन मेट्रिक्स को स्वतंत्र रूप से पहचानने और सुधारने की क्षमता प्रदर्शित की है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि शोधकर्ताओं की एक टीम एक बहुत ही बुद्धिमान रोबोट (एक 30-बिलियन पैरामीटर वाला AI मॉडल) को जटिल तर्क पहेलियों (logic puzzles) को हल करना सिखाने की कोशिश कर रही है। आमतौर पर, यह एक धीमा, मानव-प्रधान प्रक्रिया होती है: एक टीम एक नई रणनीति का अनुमान लगाती है, एक परीक्षण चलाती है जिसमें हफ्तों लग जाते हैं, परिणामों की जांच करती है, और फिर तय करती है कि क्या रखना है।
यह पेपर एक सिस्टम का वर्णन करता है जिसे A-Evolve-Training कहा जाता है, जिसने इस पूरी प्रक्रिया को स्वायत्त रूप से (autonomously) किया—बिना किसी मानवीय हस्तक्षेप के हफ्तों तक।
यहाँ बताया गया है कि उन्होंने क्या किया, कैसे किया, और उन्होंने क्या खोजा, जिसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है।
1. बड़ी चुनौती: "महंगा प्रयोग" वाली समस्या
एक छोटे AI (जैसे पुराना GPT-2) को प्रशिक्षित करने के बारे में सोचना एक सिंगल कुकी बेक करने जैसा है। इसमें कुछ मिनट लगते हैं, लागत लगभग शून्य है, और यदि वह जल जाए, तो आप बस उसे फेंक देते हैं और दूसरी बेक कर लेते हैं। आप एक दोपहर में 1,000 रेसिपी आजमा सकते हैं।
एक विशाल "फ्रंटियर" AI (30 बिलियन पैरामीटर) को प्रशिक्षित करना एक शहर के लिए विशाल, बहु-दिवसीय दावत (banquet) बनाने जैसा है। इसमें हफ्तों लगते हैं, बिजली और हार्डवेयर में भारी खर्च होता है, और यदि आपने रेसिपी में गलती कर दी, तो आप इसे आसानी से "फिर से प्रयास" नहीं कर सकते। आपको अविश्वसनीय रूप से सावधान रहना होगा।
पिछले AI रिसर्च एजेंट छोटे मॉडलों (कुकीज़) के लिए बेहतरीन थे। इस टीम ने पूछा: क्या एक AI एजेंट बिना किसी मानव शेफ की निगरानी के वह विशाल दावत बना सकता है?
2. समाधान: "अपरिवर्तनीय रसोई" और "रीसेट बटन"
इसे काम करने के लिए, टीम को एक बड़ी समस्या को हल करना था: निरंतरता (Consistency)। यदि आप एक AI को हर बार नई रेसिपी आज़माने के लिए ओवन, सामग्री और मापने वाले कप बदलने की अनुमति देते हैं, तो आप यह नहीं जान पाएंगे कि केक रेसिपी की वजह से विफल हुआ या ओवन खराब होने की वजह से।
उन्होंने इस सिस्टम को तीन प्रमुख नियमों के साथ डिज़ाइन किया, जो "सममित स्वतंत्रता" (Symmetric Freedom) के सिद्धांत का उपयोग करते हैं:
- अपरिवर्तनीय रसोई (The Immutable Kitchen/Substrate): कल्पना करें कि एक ऐसी रसोई जहाँ ओवन, काउंटर और बुनियादी उपकरण एक इंसान द्वारा लॉक कर दिए गए हैं। कोई भी AI उन्हें छूने की अनुमति नहीं है। यह सुनिश्चित करता है कि प्रत्येक प्रयोग बिल्कुल उसी सटीक, पूर्ण आधार रेखा (baseline) से शुरू हो।
- रीसेट बटन (मेमोरी-मुक्त कार्यकर्ता): एक "डेटा एजेंट" द्वारा आधे पके हुए केक को "बेकिंग एजेंट" को सौंपने और फिर उसके द्वारा "ईटिंग एजेंट" को सौंपने के बजाय, सिस्टम 8 समान क्लोन (clones) का उपयोग करता है।
- हर राउंड में, वे 8 क्लोन बनाते हैं।
- प्रत्येक क्लोन को लॉक-डाउन की गई रसोई की एक ताज़ा प्रति मिलती है।
- प्रत्येक क्लोन एक अलग बदलाव आज़माता है (जैसे, "अधिक चॉकलेट डालें," "ज़्यादा देर तक पकाएं," "आटा बदलें")।
- वे पकाते हैं, चखते हैं और रिपोर्ट करते हैं।
- महत्वपूर्ण बात: जब राउंड समाप्त हो जाता है, तो सब कुछ फेंक दिया जाता है। अगला राउंड 8 ताज़ा क्लोन और एक ताज़ा रसोई के साथ शुरू होता है। यह "बुरी आदतों" या छिपी हुई त्रुटियों को समय के साथ बढ़ने से रोकता है।
- मुख्य शेफ (The Meta-Agent): एक केंद्रीय AI 8 क्लोनों की रिपोर्ट पढ़ता है। वह रसोई को नहीं बदलता है; वह केवल अगले राउंड के लिए निर्देश पुस्तिका (instruction manual) को बदलता है। वह तय करता है: "ठीक है, चॉकलेट वाला विचार काम कर गया, लेकिन आटे वाला विचार विफल रहा। अगली बार अधिक चॉकलेट विविधताओं को आज़माते हैं।"
3. परिणाम: इंसानों को हराना (लगभग)
सिस्टम चार राउंड के लिए कई हफ्तों तक चला।
- स्कोर: अंतिम AI मॉडल ने एक कठिन रीजनिंग चैलेंज पर 0.86 का स्कोर किया।
- प्रतियोगिता: शीर्ष मानव टीम ने 0.87 का स्कोर किया।
- रैंकिंग: AI ने लगभग 4,000 प्रविष्टियों में से 8वां स्थान प्राप्त किया।
यह एक बहुत बड़ी बात है क्योंकि यह साबित करता है कि एक AI स्वतंत्र रूप से एक जटिल, बहु-सप्ताह के शोध अभियान को चला सकता है और ऐसे परिणाम प्राप्त कर सकता है जो सर्वश्रेष्ठ मानव टीमों से लगभग अछूते (indistinguishable) हैं।
4. वास्तविक खोज: "आसान मीट्रिक का जाल"
इस पेपर का सबसे दिलचस्प हिस्सा केवल स्कोर नहीं है; यह वह क्षण है जब एक AI ने अपने ही निर्देशों को मात दे दी।
- जाल: शुरुआत में, AI को अपना "आंतरिक विकास स्कोर" (एक अभ्यास परीक्षण) अधिकतम करने के लिए कहा गया था। उसने एक ट्रिक ढूंढ ली: वह एक विशिष्ट प्रकार की तर्क पहेली (समीकरणों) पर अत्यधिक ध्यान केंद्रित करके अपने आंतरिक स्कोर को रिकॉर्ड ऊंचाई तक पहुंचा सकता था।
- साक्षात्कार (Realization): AI ने देखा कि भले ही उसका आंतरिक स्कोर एकदम सही था, लेकिन वास्तविक लीडरबोर्ड पर उसका प्रदर्शन नहीं बढ़ रहा था। उसने महसूस किया: "रुको, मैं अभ्यास परीक्षण में बेहतर हो रहा हूँ, लेकिन मैं वास्तव में वास्तविक खेल में स्मार्ट नहीं हो रहा हूँ। अभ्यास परीक्षण मुझसे झूठ बोल रहा है।"
- बदलाव (The Pivot): आसान मीट्रिक के पीछे आँख मूंदकर भागने के बजाय, AI ने अपनी रणनीति बदल दी। उसने तय किया कि वह उस आसान मीट्रिक को अनदेखा करेगा और इसके बजाय उन चीजों को आज़माएगा जो वास्तव में वास्तविक लीडरबोर्ड में मदद कर सकती हैं, भले ही इससे आंतरिक स्कोर कम हो जाए।
- यह क्यों मायने रखता है: यह पहली बार है जब एक स्वायत्त प्रणाली ने पता लगाया है कि उसका अपना मापन उपकरण (measurement tool) टूटा हुआ था और उसने अपनी खोज रणनीति को ठीक किया। उसने केवल अनुकूलन (optimize) नहीं किया; उसने खेल के नियमों में खामी की खोज की और यह बदल दिया कि वह कैसे खेलता है।
सारांश
यह पेपर दावा करता है कि पहली बार, एक AI ने बिना किसी मानवीय सहायता के एक बड़े मॉडल पर एक पूर्ण, एंड-टू-एंड शोध अभियान सफलतापूर्वक चलाया है।
- उसने केवल आदेशों का पालन नहीं किया: उसने पता लगाया कि कब उसका अपना "स्कोरकार्ड" भ्रामक था और उसने अपना दृष्टिकोण बदल दिया।
- उसने केवल कुकीज़ नहीं बनाईं: उसने वह विशाल दावत बनाई, यह साबित करते हुए कि स्वायत्त शोध वहां भी काम कर सकता है जहाँ गलतियाँ महंगी होती हैं।
- सीख: हम ऐसे AI से आगे बढ़ रहे हैं जो एक निश्चित बॉक्स के भीतर अनुकूलन (optimize) करता है, उस AI की ओर जो बॉक्स को पुनर्डिजाइन कर सकता है जब उसे एहसास होता है कि बॉक्स गलत है।
लेखक सावधानी बरतते हुए कहते हैं कि यह एक "पहला कदम" है और कोई तैयार उत्पाद नहीं है, लेकिन यह स्पष्ट करता है कि आज स्वायत्त AI अनुसंधान क्या करने में सक्षम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।