Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding
यह शोध पत्र प्रूनड बीपीई (Pruned BPE) को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग विधि है जो कम-एक्सपोज़र वाले इंटरमीडिएट मर्ज टोकन्स को मॉडल के वोकैबुलरी से छिपाकर और उन स्लॉट्स को अधिक बार आने वाले उम्मीदवारों को पुनर्वितरित करके टोकेनाइज़ेशन दक्षता में सुधार करती है, जिससे मॉडल-दृश्य वोकैबुलरी आकार को बढ़ाए बिना एनकोडेड सीक्वेंस की लंबाई कम हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को पढ़ना सिखा रहे हैं। ऐसा करने के लिए, आप उसे ब्रह्मांड के हर शब्द का शब्दकोश नहीं दे सकते; वह उसके मस्तिष्क के लिए बहुत भारी हो जाएगा। इसके बजाय, आप उसे एक चतुर तरकीब सिखाते हैं: शब्दों को छोटे, पुन: उपयोग करने योग्य टुकड़ों में तोड़ना, जैसे कि LEGO ब्रिक्स। यदि रोबोट "unbelievable" देखता है, तो उसे पूरे शब्द के लिए एक विशेष ब्रिक की आवश्यकता नहीं है। वह बस "un," "believe," और "able" को आपस में जोड़ सकता है। आधुनिक AI इसी तरह दुनिया को पढ़ता है: यह टेक्स्ट को "टोकन" नामक छोटे टुकड़ों में काट देता है।
कौन से LEGO ब्रिक्स को रखना है, यह तय करने का सबसे लोकप्रिय तरीका Byte Pair Encoding (BPE) कहलाता है। BPE को एक बहुत ही सख्त, दोहराव वाले शिक्षक के रूप में सोचें। यह टेक्स्ट के एक विशाल ढेर को देखता है, उन दो टुकड़ों को ढूंढता है जो सबसे अधिक बार एक साथ दिखाई देते हैं, और उन्हें एक नया, बड़ा ब्रिक बनाने के लिए आपस में चिपका देता है। यह इसे बार-बार करता है, जिससे एकल अक्षरों से लेकर पूरे शब्दों तक की ब्रिक्स की एक लाइब्रेरी बन जाती है। समस्या यह है कि यह शिक्षक थोड़ा संग्रह करने वाला (hoarder) है। यह उन टुकड़ों को आपस में चिपका देता है जो केवल बड़े टुकड़े बनाने के लिए उपयोगी होते हैं, लेकिन वे अंतिम कहानी में अपने आप कभी नहीं दिखाई देते। यह एक ऐसे LEGO ब्रिक की तरह है जो केवल एक महल का टॉवर बनाने के लिए उपयोग किया जाता है, लेकिन अंतिम मॉडल में वह टॉवर कभी बनाया ही नहीं जाता। रोबोट को अभी भी इस बेकार ब्रिक को अपने बैग में ढोना पड़ता है, जिससे वह जगह घेर ली जाती है जिसका उपयोग कुछ अधिक दिलचस्प चीज़ के लिए किया जा सकता था।
यह शोध पत्र, जिसका शीर्षक "Pruned BPE" है, एक सरल प्रश्न पूछता है: क्या होगा यदि हम ब्रिक्स की लाइब्रेरी बनाने के बाद रोबोट के बैग की सफाई कर सकें? लेखक, केनी शाओ के नेतृत्व में, एक ऐसी विधि प्रस्तावित करते हैं जो उन सभी ब्रिक्स को देखती है जो शिक्षक ने बनाए हैं, उन सभी की पहचान करती है जो अंतिम टेक्स्ट में शायद ही कभी देखे जाते हैं, और उन्हें बेहतर, अधिक उपयोगी ब्रिक्स के साथ बदल देती है। वे बैग को छोटा नहीं करते हैं; वे बस उसकी सामग्री को पुनर्गठित करते हैं ताकि हर स्लॉट उस चीज़ से भरा हो जिसकी रोबोट को वास्तव में आवश्यकता है।
समस्या: "घोस्ट" (Ghost) ब्रिक्स
सुधार को समझने के लिए, पहले हमें गंदगी को देखना होगा। जब मानक BPE शिक्षक काम करता है, तो वह एक पदानुक्रम (hierarchy) बनाता है। वह "en" और "viron" को जोड़कर "environ" बना सकता है, और फिर "environ" और "ment" को जोड़कर "environment" बना सकता है। मानक प्रणाली में, इस प्रक्रिया के दौरान बनाया गया प्रत्येक ब्रिक रोबोट के अंतिम शब्दावली में एक स्थान पाता है।
लेकिन यहाँ एक पेंच है: ब्रिक "environ" "environment" बनाने के लिए एक शानदार सहायक हो सकता है, लेकिन यह वास्तविक वाक्यों में अपने आप शायद ही कभी दिखाई देता है। यह एक "घोस्ट" (भूतिया) ब्रिक है। यह रोबोट की मेमोरी में मौजूद है, एक मूल्यवान स्थान घेर रहा है, लेकिन रोबोट इसका उपयोग लगभग कभी भी अंतिम उत्तर के रूप में नहीं करता है। यह आपकी जेब में एक विशेष पेचकश रखने जैसा है जिसका उपयोग आप केवल साल में एक बार एक विशिष्ट खिलौना बनाने के लिए करते हैं, जबकि आपके पास हथौड़े या रिंच के लिए कोई जगह नहीं बची है।
लेखक का तर्क है कि ये घोस्ट ब्रिक्स जगह बर्बाद कर रहे हैं। क्योंकि वे दुर्लभ हैं, रोबोट उनके साथ पर्याप्त अभ्यास नहीं कर पाता है, इसलिए उनके बारे में उसकी समझ कमजोर होती है। इस बीच, अन्य उपयोगी शब्द खंड हैं जिन्हें रोबोट अक्सर देखता है, लेकिन उनके पास कोई स्थान नहीं है क्योंकि सभी स्लॉट इन बेकार घोस्ट्स द्वारा भरे गए हैं।
समाधान: द ग्रेट बैकपैक स्वैप (The Great Backpack Swap)
यह पेपर Pruned BPE पेश करता है, जो एक दो-चरणीय प्रक्रिया है जो एक पोस्ट-ट्रेनिंग सफाई दल की तरह कार्य करती है।
चरण 1: मानक निर्माण (The Standard Build)।
पहले, वे मानक BPE शिक्षक को बिल्कुल सामान्य रूप से अपना काम करने देते हैं। यह ब्रिक्स की पूरी लाइब्रेरी बनाता है, लक्ष्य आकार (मान लीजिए, 10,000 ब्रिक्स) तक पहुँचने के लिए जोड़ों को जोड़ता रहता है। इस बिंदु पर, लाइब्रेरी भरी हुई है, लेकिन यह उन "घोस्ट" ब्रिक्स से भरी हुई है।
चरण 2: दृश्यता की जाँच (The Visibility Check)।
अब, लेखक अंतिम लाइब्रेरी को देखते हैं और पूछते हैं: "यह ब्रिक वास्तव में तैयार टेक्स्ट में कितनी बार दिखाई देता है?" वे प्रत्येक ब्रिक के "एक्सपोज़र" (exposure) को गिनते हैं। यदि कोई ब्रिक जैसे "environ" केवल एक बहुत छोटे हिस्से के समय में दिखाई देता है, तो उसे "इंटरनल-ओनली" (आंतरिक-केवल) के रूप में चिह्नित किया जाता है। यह सिस्टम में एक छिपे हुए सहायक के रूप में रहता है—इसका उपयोग अभी भी बड़े शब्द बनाने के लिए किया जा सकता है, लेकिन इसे एक अंतिम उत्तर के रूप में दिखने की अनुमति नहीं है जिसे रोबोट देख सके।
चरण 3: पुनर्वितरण (The Reallocation)।
यही जादू वाला हिस्सा है। जब वे एक घोस्ट ब्रिक को "दृश्य" सूची से बाहर निकालते हैं, तो वे केवल एक खाली छेद नहीं छोड़ते हैं। वे वापस ट्रेनिंग डेटा पर जाते हैं और रोबोट को नए ब्रिक्स खोजने के लिए सिखाना जारी रखते हैं जो वास्तव में उपयोगी हैं। वे तब तक प्रशिक्षण जारी रखते हैं जब तक कि उन्हें पर्याप्त उच्च-गुणवत्ता वाले, बार-बार देखे जाने वाले ब्रिक्स न मिल जाएं जो खाली स्थानों को भर सकें।
तो, बैग का आकार वही रहता है (जैसे, 10,000 स्लॉट), लेकिन सामग्री पूरी तरह से अलग होती है। वे बेकार के घोस्ट ब्रिक्स को उच्च-दृश्यता वाले "स्टार" ब्रिक्स के साथ बदल देते हैं जिनका रोबोट वास्तव में उपयोग करता है। जब रोबोट एक शब्द पढ़ता है, तो वह संरचना बनाने के लिए छिपे हुए सहायक ब्रिक्स का उपयोग करता है, लेकिन वह टोकन की अंतिम सूची जो उसके मस्तिष्क को भेजी जाती है, उसमें केवल उपयोगी, उच्च-दृश्यता वाले टोकन होते हैं।
उन्होंने क्या पाया
लेखक ने दो अलग-अलग टेक्स्ट समूहों पर इस विचार का परीक्षण किया: एक मुख्य रूप से अंग्रेजी और एक मुख्य रूपely चीनी, साथ ही दोनों का मिश्रण। उन्होंने अपने "प्रून्ड" (Pruned) तरीके की तुलना मानक "होर्डिंग" (संग्रह करने वाले) तरीके से की, जिसमें बैग का आकार दोनों के लिए बिल्कुल समान रखा गया था।
परिणाम आश्चर्यजनक रूप से सुसंगत थे। घोस्ट्स को स्टार्स से बदलकर, प्रून्ड BPE विधि ने टेक्स्ट को थोड़ा बेहतर तरीके से कंप्रेस (संकुचित) किया।
- अंग्रेजी-प्रधान टेक्स्ट पर, उन्होंने टोकन की संख्या को लगभग 0.27% से 0.36% तक कम कर दिया (इस आधार पर कि वे "घोस्ट" नियम के प्रति कितने सख्त थे)।
- चीनी-प्रधान टेक्स्ट पर, सुधार समान था, जो 0.23% से 0.36% के बीच था।
इसे समझने के लिए, लेखक नोट करते हैं कि मानक BPE के साथ इस तरह का संपीड़न प्राप्त करने के लिए आमतौर पर बैग में अन्य 2,000 टोकन जोड़ने की आवश्यकता होती है। प्रून्ड BPE आपको बिना बैग बड़ा किए वही दक्षता लाभ प्राप्त करा देता है। यह एक बड़े सूटकेस को खरीदे बिना अधिक स्टोरेज स्पेस प्राप्त करने जैसा है।
उन्होंने यह सुनिश्चित करने के लिए एक विशेष परीक्षण भी चलाया कि सुधार केवल इस बात का परिणाम नहीं है कि मानक BPE शिक्षक अपने ब्रिक्स को कैसे व्यवस्थित करता है। उन्होंने एक अलग, सुपर-स्मार्ट "मिनिमम-टोकन" डिकोडर का उपयोग किया जो शिक्षक के मूल क्रम को अनदेखा करता है और केवल उपलब्ध ब्रिक्स की सूची को देखता है। इस निष्पक्ष, तटस्थ डिकोडर के साथ भी, प्रून्ड BPE सूची ने अभी भी छोटा, अधिक कुशल टेक्स्ट तैयार किया। यह सुझाव देता है कि सुधार ब्रिक्स की एक बेहतर सूची होने से आता है, न कि केवल उनके व्यवस्थित होने के तरीके से।
"घोस्ट" के उदाहरण
यह देखने के लिए कि ये "घोस्ट" ब्रिक्स कैसे दिखते हैं, लेखक ने कुछ विशिष्ट उदाहरण देखे:
- अंग्रेजी: "viron" जैसा एक अंश एक घोस्ट हो सकता है। यह "environment" बनाने के लिए महान है, लेकिन आप "viron" को अकेले शायद ही कभी देखते हैं।
- चीनी: "gan" जैसा एक अक्षर (जो "gan ga" का हिस्सा है, जिसका अर्थ है अजीब/awkward) एक घोस्ट हो सकता है। यह पूर्ण शब्द बनाने के लिए आवश्यक है, लेकिन यह अकेले शायद ही कभी उपयोग किया जाता है।
- कोड और बाइट्स: कुछ घोस्ट और भी अजीब हैं। क्योंकि कंप्यूटर टेक्स्ट को बाइट्स (छोटे नंबरों) के रूप में पढ़ते हैं, कुछ ब्रिक्स केवल एक अक्षर के आंशिक टुकड़े होते हैं। उदाहरण के लिए, एक विशिष्ट बाइट अनुक्रम चीनी अक्षर "क्षमता" (ability) को बनाने के लिए आवश्यक हो सकता है, लेकिन वह बाइट अनुक्रम अकेले कोई अर्थ नहीं रखता। यह एक घोस्ट है जो केवल वास्तविक चीज़ को बनाने में मदद करने के लिए मौजूद है।
यह क्यों मायने रखता है (और क्या नहीं रखता)
पेपर सावधानीपूर्वक कहता है कि यह क्या नहीं करता है। यह यह साबित नहीं करता है कि रोबोट अचानक कविता लिखने या गणित हल करने में अधिक स्मार्ट हो जाएगा। लेखक ने केवल यह मापा कि टेक्स्ट कितनी कुशलता से संकुचित (compress) किया गया था (एक ही बात कहने के लिए कम टोकन)। उन्होंने यह परीक्षण नहीं किया कि क्या रोबोट का मस्तिष्क इन नए ब्रिक्स के साथ वास्तव में बेहतर सीखता है। यह भविष्य के शोध का विषय है।
हालाँकि, यह पेपर इस विचार को खारिज करता है कि आपको जगह बचाने के लिए अपनी शब्दावली को छोटा करने की आवश्यकता है। कुछ पिछले विचारों ने सुझाव दिया था कि केवल दुर्लभ ब्रिक्स को हटा देना चाहिए, जिससे बैग छोटा हो जाता है लेकिन रोबंतु को एक ही बात कहने के लिए अधिक, छोटे ब्रिक्स का उपयोग करने के लिए मजबूर होना पड़ता है (जिससे टेक्स्ट लंबा हो जाता है)। प्रून्ड BPE सिद्ध करता है कि आप बैग का आकार स्थिर रख सकते हैं और फिर भी केवल सामग्री बदलकर अधिक संक्षिप्त, अधिक कुशल टेक्स्ट प्राप्त कर सकते हैं।
निष्कर्ष
अंत में, प्रून्ड BPE अव्यवस्था को साफ करने (decluttering) का एक सबक है। यह दिखाता है कि AI की दुनिया में, टोकन की एक विशाल लाइब्रेरी होना उतना महत्वपूर्ण नहीं है जितना कि सही टोकन होना। यह तय करने के लिए कि वास्तव में क्या उपयोगी है, अंत तक प्रतीक्षा करके, और फिर "घोस्ट" सहायकों को "स्टार" प्रदर्शन करने वालों के साथ बदलकर, हम रोबोट की पढ़ने की प्रक्रिया को थोड़ा अधिक कुशल बना सकते हैं। यह एक छोटा सा बदलाव है—0.5% से भी कम जगह बचाना—लेकिन विशाल AI मॉडल की दुनिया में, जहाँ हर बाइट मायने रखती है, यह एक सार्थक जीत है। रोबोट को अपने निर्माण के पूरे इतिहास को ढोने की आवश्यकता नहीं है; उसे बस काम के लिए सबसे अच्छे औजारों की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।