Decentralised AI Training and Inference with BlockTrain
यह शोध पत्र स्फेरॉइड ब्लॉकट्रेन (Spheroid BlockTrain) को पेश करता है, जो एक विकेंद्रीकृत प्रशिक्षण प्रोटोकॉल है जो मॉडलों को स्वतंत्र रूप से अनुकूलित ब्लॉकों में विभाजित करता है ताकि केंद्रीयकृत एक्सेलेरेटर क्लस्टर्स की आवश्यकता के बिना वितरित, संसाधन-सीमित नेटवर्क में कुशल प्रशिक्षण और उच्च-थ्रूपुट अनुमान सक्षम करके फ्रंटियर एआई तक पहुंच का लोकतंत्रीकरण किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अविश्वसनीय रूप से बुद्धिमान विश्वकोश (encyclopedia) बनाना चाहते हैं। आधुनिक AI की दुनिया में, इसे करने का सामान्य तरीका एक बहुत ही अमीर निर्माण कंपनी (एक "हाइपरस्केलर") को काम पर रखना है, जिसके पास दुनिया के सबसे शक्तिशाली कंप्यूटरों से भरा एक विशाल गोदाम है। वे एक ही स्थान पर, एक साथ, पूरा विश्वकोश बनाते हैं। यदि आपके पास वह गोदाम नहीं है, तो आप विश्वकोश बनाने में मदद नहीं कर सकते।
Spheroid Labs का "BlockTrain" एक अलग तरीका प्रस्तावित करता है। एक विशाल टीम और एक गोदाम के बजाय, कल्पना करें कि एक वैश्विक पड़ोस है जहाँ हजारों लोग अपने सामान्य घरेलू कंप्यूटरों का उपयोग करके विश्वकोश का केवल एक छोटा सा अध्याय बनाते हैं।
यह शोध पत्र इस नई पद्धति को सरल उपमाओं (analogies) का उपयोग करके समझाता है:
1. समस्या: "विशाल गोदाम" की बाधा (Bottleneck)
वर्तमान में, उन्नत AI को प्रशिक्षित करने के लिए इतनी अधिक कंप्यूटिंग शक्ति की आवश्यकता होती है कि केवल कुछ बड़ी कंपनियाँ ही इसे वहन कर सकती हैं। यह ऐसा है जैसे यह कहना कि केवल एक अरब डॉलर की फैक्ट्री वाली कंपनी ही गगनचुंबी इमारत बना सकती है। इससे बाकी सब बाहर रह जाते हैं। शोध पत्र का तर्क है कि यदि हम अभी भी "पूरी इमारत" को एक ही स्थान पर बनाने की कोशिश करते रहेंगे, तो हम कभी भी वास्तविक विकेंद्रीकरण (decentralization) प्राप्त नहीं कर पाएंगे।
2. समाधान: "अध्याय-दर-अध्याय" दृष्टिकोण
BlockTrain खेल के नियम बदल देता है। प्रत्येक कंप्यूटर से पूरे विश्वकोश को अपनी मेमोरी में रखने के लिए कहने के बजाय (जो एक घरेलू कंप्यूटर के लिए असंभव है), यह AI मॉडल को ब्लॉक्स (blocks) नामक छोटे, स्वतंत्र टुकड़ों में तोड़ देता है।
- उपमा: AI मॉडल को एक लंबी रिले दौड़ के रूप में सोचें। पुराने तरीके में, प्रत्येक धावक को पूरे बैटन स्टैक को ले जाना पड़ता था। BlockTrain में, दौड़ को चरणों में विभाजित किया जाता है। प्रत्येक धावक (एक कार्यकर्ता का कंप्यूटर) केवल अपने विशिष्ट चरण को ले जाता है।
- यह कैसे काम करता है: प्रत्येक कंप्यूटर अपने स्वयं के "ब्लॉक" (AI का एक छोटा हिस्सा) को एक विशिष्ट, स्थानीय पहेली को हल करने के लिए प्रशिक्षित करता है। उसे अपना काम करने के लिए पूरी तस्वीर देखने की आवश्यकता नहीं है। उसे बस अपने विशिष्ट हिस्से को सही करने की आवश्यकता है।
3. गुप्त मंत्र: पहेली को "डीनॉइजिंग" (Denoising) करना
शोध पत्र एक विशिष्ट तकनीक का उपयोग करता है जिसे DiffusionBlocks कहा जाता है।
- उपमा: कल्पना कीजिए कि आप अनुमान लगाने की कोशिश कर रहे हैं कि एक तस्वीर कैसी दिखती है, लेकिन किसी ने उस पर 'स्टैटिक नॉइज़' (धुंधलापन/शोर) की परत चढ़ा दी है।
- पारंपरिक AI में, आप एक साथ पूरी तस्वीर का अनुमान लगाने की कोशिश करते हैं।
- BlockTrain में, "शोर" को चरणों में हटाया जाता है। AI का पहला ब्लॉक भारी, धुंधले शोर (बड़ी तस्वीर) को हटाना सीखता है। अगला ब्लॉक मध्यम शोर को हटाता है। अंतिम ब्लॉक धूल के सूक्ष्म कणों को हटाता है।
- जादू: प्रत्येक कंप्यूटर को केवल अपने विशिष्ट प्रकार के शोर को हटाना सीखना होता है। उसे अन्य ब्लॉक्स के लिए शोर हटाने की आवश्यकता नहीं है। यह कार्य को इतना छोटा बना देता है कि एक सामान्य घरेलू कंप्यूटर इसे संभाल सके।
4. पहेली को जोड़ना
एक बार जब सभी पड़ोसियों ने अपने विशिष्ट अध्यायों को प्रशिक्षित कर लिया, तो वे अपने अपडेट एक केंद्रीय "एग्रीगेटर" (aggregator) को भेजते हैं।
- असेंबली: सिस्टम ब्लॉक 1, ब्लॉक 2 और ब्लॉक 3 को लेता है और उन्हें LEGO ब्रिक्स की तरह एक साथ जोड़ देता है।
- परिणाम: भले ही किसी भी एक कंप्यूटर ने कभी पूरा मॉडल नहीं देखा हो, लेकिन असेंबल किया गया अंतिम मॉडल टेक्स्ट पढ़ने और लिखने में सक्षम है। शोध पत्र दिखाता है कि वास्तविक टेक्स्ट (WikiText) का उपयोग करके किए गए एक परीक्षण पर, इस असेंबल किए गए मॉडल ने एक विशाल डेटा सेंटर में प्रशिक्षित मॉडल के लगभग समान प्रदर्शन किया (एक विशिष्ट त्रुटि पैमाने पर 1.359 बनाम 1.32 स्कोर किया)।
5. "ट्रैफिक जाम" परीक्षण (वास्तविक दुनिया की गति)
शोधकर्ताओं ने केवल एक कंप्यूटर पर इसका परीक्षण नहीं किया; उन्होंने इसे इंटरनेट पर परखा।
- प्रयोग: उन्होंने यह देखने के लिए कंप्यूटरों को विभिन्न स्थानों पर जोड़ा (कुछ एक ही इमारत में, कुछ देश के दूसरे हिस्से में) कि क्या "अध्याय" (chapters) खो जाने या देरी के बिना इधर-उधर भेजे जा सकते हैं।
- परिणाम: यह सफल रहा। वे सार्वजनिक इंटरनेट का उपयोग करके "अध्यायों" (डेटा) को सफलतापूर्वक स्थानांतरित करने में सक्षम रहे। इंटरनेट की देरी और धीमी कनेक्शन गति के बावजूद, सिस्टम ने सीखना जारी रखा। इसने सिद्ध किया कि आपको AI को प्रशिक्षित करने के लिए कंप्यूटरों के बीच सुपर-फास्ट, निजी फाइबर-ऑप्टिक केबल की आवश्यकता नहीं है; यदि टुकड़े छोटे हैं, तो नियमित इंटरनेट पर्याप्त रूप से तेज़ है।
6. "एक-यात्रा" डिलीवरी (Inference)
आमतौर पर, जब आप एक विकेंद्रीकृत AI से कोई प्रश्न पूछते हैं, तो उसे एक प्रश्न को एक के बाद एक हर कंप्यूटर के माध्यम से गुजारना पड़ता है, जो "टेलीफोन गेम" की तरह धीमा होता है।
- BlockTrain की ट्रिक: शोध पत्र का दावा है कि उनका सिस्टम अलग है। एक बार मॉडल असेंबल हो जाने के बाद, यह नेटवर्क के माध्यम से एक ही बार में (single pass) पूरा वाक्य या पैराग्राफ बना सकता है।
- उपमा: एक पंक्ति में लोगों को एक-एक करके नोट पास करने के बजाय, BlockTrain पूरी शीट को लाइन को सौंप देता है, और लाइन एक साथ पूरी शीट को प्रोसेस करती है। यह उत्तर प्राप्त करने के लिए इसे बहुत तेज़ बनाता है।
दावों का सारांश
शोध पत्र उनके प्रयोगों के आधार पर तीन ठोस दावे करता है:
- यह सीखता है: आप इस "ब्लॉक-दर-ब्लॉक" विधि का उपयोग करके वास्तविक टेक्स्ट पर वास्तविक AI को प्रशिक्षित कर सकते हैं, और यह बड़े केंद्रीकृत मॉडलों जितना ही स्मार्ट हो जाता है।
- यह यात्रा करता है: आप प्रशिक्षण डेटा को सार्वजनिक इंटरनेट (मानक वेब कनेक्शन का उपयोग करके) के माध्यम से भेज सकते हैं और फिर भी प्रगति कर सकते हैं।
- यह सेवा देता है: आप प्रश्नों के उत्तर देने के लिए अलग-अलग कंप्यूटरों पर तैयार मॉडल को चला सकते हैं, और यह कुशलतापूर्वक करता है बिना किसी एक विशाल कंप्यूटर के सब कुछ रखने की आवश्यकता के।
शोध पत्र क्या दावा नहीं करता है:
- यह दावा नहीं करता कि यह आज व्यावसायिक उपयोग के लिए तैयार है।
- यह दावा नहीं करता कि यह सभी सुरक्षा या प्रोत्साहन (लोगों को भुगतान कैसे किया जाए) की समस्याओं को हल करता है।
- यह दावा नहीं करता कि यह अभी चिकित्सा निदान या अन्य विशिष्ट वास्तविक दुनिया के अनुप्रयोगों के लिए काम करता है।
- यह सख्ती से इस तकनीकी क्षमता पर केंद्रित है कि इस विशिष्ट "ब्लॉक" पद्धति का उपयोग करके मॉडल को कैसे प्रशिक्षित और संचालित किया जाए।
संक्षेप में, BlockTrain एक ब्लूप्रिंट है कि कैसे हजारों छोटे, स्वतंत्र दिमागों को एक साथ काम करने के लिए उपयोग करके एक विशाल AI मस्तिष्क बनाया जा सकता है, न कि एक ही कमरे में एक विशाल मस्तिष्क।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।