Efficient Pre-Training with Token Superposition
यह शोध पत्र टोकन-सुपरपोजिशन ट्रेनिंग (TST) को पेश करता है, जो एक ड्रॉप-इन विधि है जो मॉडल आर्किटेक्चर या पैरेललिज्म को संशोधित किए बिना, कुशल मल्टी-हॉट क्रॉस-एन्ट्रॉपी ट्रेनिंग के लिए शुरू में टोकन को बैग्स में संयोजित करके, प्री-ट्रेनिंग डेटा थ्रूपुट में महत्वपूर्ण सुधार करती है और कुल प्रशिक्षण समय को 2.5 गुना तक कम करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Efficient Pre-Training with Token Superposition" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी समस्या: AI को प्रशिक्षित करना रेत में मैराथन दौड़ने जैसा है
कल्पना कीजिए कि आप एक छात्र (एक Large Language Model) को पढ़ना और लिखना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपको उन्हें लाखों किताबें दिखानी होंगी। हालाँकि, सिखाने का वर्तमान तरीका अविश्वसनीय रूप से धीमा और महंगा है। यह छात्र को एक-एक करके हर शब्द पढ़ने के लिए कहने जैसा है, जबकि उसने पीठ पर एक भारी बैग भी उठा रखा हो। वे थक जाते हैं (कंप्यूटेशनल रूप से महंगा) और लाइब्रेरी खत्म करने में उन्हें बहुत समय लगता है।
शोधकर्ता इस प्रक्रिया को बिना छात्र के मस्तिष्क (मॉडल आर्किटेक्चर) या उनके द्वारा पढ़ी जाने वाली किताबों (डेटा) को बदले तेज़ करना चाहते हैं।
समाधान: "टोकन सुपरपोजिशन ट्रेनिंग" (TST)
लेखकों ने एक चतुर दो-चरणीय प्रशिक्षण विधि प्रस्तावित की है जिसे टोकन सुपरपोजिशन ट्रेनिंग (TST) कहा जाता है। इसे "स्पीड रीडिंग" चरण के बाद "फाइन-ट्यूनिंग" चरण के रूप में समझें।
चरण 1: "स्मूदी" चरण (सुपरपोजिशन)
मानक प्रशिक्षण में, AI एक समय में एक शब्द देखकर सीखता है (जैसे, "The," फिर "cat," फिर "sat")।
सुपरपोजिशन चरण में, AI को एक साथ शब्दों के एक पूरे "बैग" को देखने के लिए सिखाया जाता है।
- उपमा: कल्पना कीजिए कि "The cat sat on the mat" वाक्य को पढ़ने के बजाय, शिक्षक छात्र को उन शब्दों से भरा एक ब्लेंडर थमा देता है। छात्र व्यक्तिगत शब्द नहीं देखता; वह "The + cat + sat" से बनी एक "स्मूदी" देखता है।
- यह कैसे काम करता है: कंप्यूटर 8 शब्दों को लेता है (एक "बैग"), उनके अर्थों को एक एकल "सुपर-वर्ड" में मिला देता है, और AI से पूछता है कि अगले 8 शब्दों का "बैग" क्या होगा।
- लाभ: क्योंकि AI 8 शब्दों को एक शब्द की तरह प्रोसेस कर रहा है, वह बिना किसी अतिरिक्त कंप्यूटर पावर के डेटा के माध्यम से 8 गुना तेज़ी से "पढ़" सकता है। यह ऐसा है जैसे छात्र अब उस समय में 8 पेज पढ़ रहा है जितना पहले उसे 1 पेज पढ़ने में लगता था।
चरण 2: "बारीकी से जाँच" वाला चरण (रिकवरी)
यदि आप केवल "स्मूदी" पर AI को प्रशिक्षित करेंगे, तो वह सामान्य वाक्य लिखने में बहुत खराब होगा। उसे शब्दों का क्रम पता नहीं होगा, और उसका आउटपुट निरर्थक होगा।
इसलिए, एक निश्चित समय के बाद (आमतौर पर कुल प्रशिक्षण का लगभग 30%), शोधकर्ता "स्मूदी" चरण को रोक देते हैं।
- उपमा: वे मानक विधि पर वापस आ जाते हैं। वे AI के मस्तिष्क (जिसने अब भाषा की सामान्य संरचना बहुत तेज़ी से सीख ली है) को वापस एक सामान्य कक्षा में ले जाते हैं। वे ब्लेंडर का उपयोग करना बंद कर देते हैं और उसे फिर से व्यक्तिगत शब्द दिखाने लगते हैं।
- परिणाम: क्योंकि AI ने चरण 1 में "बड़ी तस्वीर" (big picture) को बहुत कुशलता से सीख लिया है, इसलिए वह बहुत तेज़ी से रिकवर करता है। वह उस प्रदर्शन को पकड़ लेता है और अक्सर उन मॉडलों से भी बेहतर प्रदर्शन करता है जिन्हें पूरे समय "धीमे तरीके" से प्रशिक्षित किया गया था।
यह एक बड़ी बात क्यों है
पेपर का दावा है कि यह विधि एक "ड्रॉप-इन" समाधान है। आपको AI का मस्तिष्क, कंप्यूटर चिप्स या किताबें बदलने की आवश्यकता नहीं है। आपको बस प्रशिक्षण के पहले भाग के दौरान डेटा देने के तरीके को बदलना है।
- गति (Speedup): एक बड़े मॉडल (10 बिलियन पैरामीटर्स) के साथ उनके परीक्षणों में, इस विधि ने उन्हें मानक प्रशिक्षण की तुलना में आधे समय में (2.5x स्पीडअप) समान स्तर की बुद्धिमत्ता प्राप्त करने में सक्षम बनाया।
- समझौता (Trade-off): वे "डेटा खपत" के बदले "गति" का व्यापार कर रहे हैं। AI एक ही समय में अधिक डेटा पढ़ता है, लेकिन क्योंकि वह "बैग" में पढ़ता है, इसलिए वह पैटर्न को तेज़ी से सीख लेता है।
यह पेपर क्या दावा नहीं करता है
यह महत्वपूर्ण है कि आप वही समझें जो लेखकों ने वास्तव में कहा है:
- यह अंतिम उत्पाद को नहीं बदलता है: प्रशिक्षण समाप्त होने के बाद, AI बिल्कुल एक सामान्य AI की तरह ही होता है। यह अभी भी सुसंगत वाक्य, कोड और कहानियाँ लिख सकता है। "स्मूदी" वाला ट्रिक केवल सीखने की प्रक्रिया के दौरान उपयोग किया जाता है।
- यह "तेज़ सोचने" के बारे में नहीं है: यह प्रशिक्षण के दौरान AI को तर्क करने या जटिल गणित समस्याओं को हल करने में स्मार्ट नहीं बनाता है; यह केवल प्रशिक्षण प्रक्रिया को अधिक कुशल बनाता है।
- यह हर चीज़ के लिए जादुई समाधान नहीं है: लेखकों ने छोटे (270 मिलियन पैरामीटर्स) से लेकर बड़े (10 बिलियन पैरामीटर्स) तक के मॉडलों पर इसका परीक्षण किया। यह सभी स्तरों पर अच्छी तरह से काम करता है, लेकिन वे नोट करते हैं कि यदि आपके पास अनंत डेटा और समय है, तो इसके लाभ अलग दिख सकते हैं।
सारांश
TST को AI के लिए एक स्पीड-रीडिंग कोर्स के रूप में समझें।
- पहले, आप इसे सरसरी नज़र से पढ़ना सिखाते हैं: आप इसे मिश्रित टेक्स्ट के हिस्से दिखाते हैं ताकि यह भाषा के सामान्य भाव (vibe) को बहुत तेज़ी से आत्मसात कर सके।
- फिर, आप इसे सामान्य रूप से पढ़ना सिखाते हैं: आप अपने कौशल को निखारने के लिए वापस शब्द-दर-शब्द पढ़ने पर आ जाते हैं।
परिणाम? AI अपनी "शिक्षा" रिकॉर्ड समय में पूरी करता है, समान ऊर्जा का उपयोग करता है, और पारंपरिक धीमे रास्ते पर चलने वालों जितना ही स्मार्ट (या उससे अधिक स्मार्ट) बनकर उभरता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।