← नवीनतम पेपर
💬 NLP

Peek2: Regex-free Byte-level Byte-Pair Encoding Pretokenizer for LLM Inference on Edge Devices

यह शोध पत्र Peek2 को पेश करता है, जो Byte-level BPE के लिए एक अत्यधिक अनुकूलित, regex-free प्रीटोकनाइज़र है, जो मानक cl100k-आधारित टोकनाइज़र के समान आउटपुट बनाए रखते हुए एज डिवाइसेस (edge devices) पर 2.48× तक तेज़ माइक्रोबेंचमार्किंग थ्रूपुट और 1.14× समग्र एन्कोडिंग गति प्राप्त करता है।

मूल लेखक: Liu Zai, Iraklis Klampanos

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liu Zai, Iraklis Klampanos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को एक लंबा पत्र भेजना चाहते हैं, लेकिन आपका दोस्त केवल छोटे, विशिष्ट कोड शब्दों (code words) को ही समझता है। अपना पत्र भेजने से पहले, आपको अपने वाक्य को उन कोड शब्दों में तोड़ना होगा। इस प्रक्रिया को टोकनाइज़ेशन (tokenization) कहा जाता है, और इसी तरह GPT-3 या LLaMa जैसे कंप्यूटर मानव भाषा को समझते हैं।

आप जो शोध पत्र पढ़ रहे हैं, वह एक नया टूल पेश करता है जिसे Peek2 कहा जाता है। यह कैसे काम करता है, इसे सरल रूप में यहाँ समझाया गया है:

समस्या: "रेगेक्स" (Regex) का ट्रैफिक जाम

वर्तमान में, अधिकांश कंप्यूटर टेक्स्ट को इन कोड शब्दों में तोड़ने के लिए Regex (रेगुलर एक्सप्रेशंस) नामक एक विधि का उपयोग करते हैं। Regex को एक क्लब के प्रवेश द्वार पर खड़े एक बहुत ही सख्त और जटिल सुरक्षा गार्ड की तरह समझें।

  • गार्ड के पास नियमों की एक विशाल सूची (Branches) है।
  • जब कोई व्यक्ति (एक अक्षर) आता है, तो गार्ड उन्हें नियम 1 के विरुद्ध जाँचता है। यदि वे फिट नहीं बैठते, तो गार्ड नियम 2 की जाँच करता है। यदि वह भी विफल हो जाता है, तो वह नियम 3 की जाँच करता है, और इसी तरह।
  • यह "जाँचें, विफल हों, फिर से जाँचें" वाली प्रक्रिया धीमी है, खासकर लैपटॉप या टैबलेट जैसे छोटे, कम शक्ति वाले उपकरणों (Edge devices) पर। यह ऐसा है जैसे गार्ड हर बार किसी के आने पर एक विशाल नियम पुस्तिका पलटते हुए आपको इंतज़ार करवाता है।

समाधान: "Peek2" का शॉर्टकट

लेखकों ने इस काम को करने का एक नया तरीका बनाया है जो बहुत तेज़ है और इसमें मेमोरी का कम उपयोग होता है।

नियम पुस्तिका पलटने के बजाय, Peek2 एक चीट शीट (लुकअप टेबल) का उपयोग करता है।

  1. "पीक" (Peek): एक बार में एक अक्षर की जाँच करने के बजाय, Peek2 एक साथ दो अक्षरों को देखता है (जैसे आगे झाँकना या 'peeking ahead')।
  2. श्रेणियाँ (Categories): यह इन दो अक्षरों को तेज़ी से सरल बकेटों (buckets) में वर्गीकृत करता है (जैसे, "क्या यह एक स्पेस है?", "क्या यह एक नंबर है?", "क्या यह एक अक्षर है?")।
  3. चीट शीट (The Cheat Sheet): क्योंकि इसे केवल दो बकेटों को देखना होता है, इसलिए लेखकों ने एक छोटा 7x7 ग्रिड (जैसे सुडोकू बोर्ड) बनाया है। आप बस उन दो बकेटों को देखते हैं, ग्रिड पर उस वर्ग को ढूँढते हैं, और ग्रिड तुरंत आपको बताता है कि आगे क्या करना है।

उपमा (Analogy):

  • पुराना तरीका (Regex): आप एक भूलभुलैया (maze) के पास पहुँचते हैं। आप बाएँ दरवाजे को आज़माते हैं। वह बंद है। आप दाएँ दरवाजे को आज़माते हैं। वह भी बंद है। आप पीछे के दरवाजे को आज़माते हैं। वह खुला है। फिर आप हर एक व्यक्ति के लिए यही प्रक्रिया दोहराते हैं।
  • नया तरीका (Peek2): आप एक दीवार के पास पहुँचते हैं जहाँ एक बड़ा नक्शा लगा है। आप जहाँ हैं वहाँ इशारा करते हैं, और नक्शा तुरंत निकास (exit) तक जाने वाला रास्ता बना देता है। कोई अनुमान नहीं, कोई बंद दरवाजे नहीं, बस एक सीधा रास्ता।

यह क्यों महत्वपूर्ण है?

शोध पत्र का दावा है कि "भूलभुलैया" को "नक्शे" से बदलकर, उन्होंने इस प्रक्रिया को बहुत तेज़ बना दिया है:

  • गति (Speed): कुछ परीक्षणों में, केवल टेक्स्ट को तोड़ने के चरण में यह 2.48 गुना तेज़ था।
  • कुल मिलाकर (Overall): जब आप टेक्स्ट को कोड शब्दों में बदलने के पूरे काम को देखते हैं, तो यह कुल मिलाकर लगभग 14% तेज़ था।
  • सटीकता (Accuracy): यह पुराने तरीके के बिल्कुल समान परिणाम देता है। यह एक "ड्रॉप-इन रिप्लेसमेंट" है, जिसका अर्थ है कि आप सिस्टम को बदले बिना या उसे तोड़े बिना पुराने गार्ड को नए से बदल सकते हैं।

कमी (सीमाएँ)

शोध पत्र इस बारे में ईमानदार है कि यह टूल क्या नहीं करता है:

  • यह विशिष्ट उपकरणों के लिए है: इसका परीक्षण डेस्कटॉप कंप्यूटरों पर किया गया था। लेखकों को उम्मीद है कि यह फोन और टैबलेट पर भी काम करेगा, लेकिन उन्होंने अभी तक इसे साबित नहीं किया है।
  • यह विशिष्ट मॉडलों के लिए है: यह उन मॉडलों के लिए काम करता है जो "cl100k" शैली (जैसे GPT-3 और LLaMa-3) का उपयोग करते हैं। यह जादू से हर उपलब्ध AI मॉडल को ठीक नहीं करता है।
  • यह बग्स (Bugs) को भी रखता है: पुराने तरीके में कुछ अजीब गलतियाँ थीं (जैसे किसी शब्द को गलत तरीके से तोड़ना)। क्योंकि Peek2 को पुराने तरीके के व्यवहार की सटीक नकल करने के लिए डिज़ाइन किया गया है, इसलिए यह उन्हीं गलतियों को भी बरकरार रखता है। उन गलतियों को ठीक करने के लिए AI मॉडलों को फिर से प्रशिक्षित (retraining) करने की आवश्यकता होगी, जो केवल एक टूल बदलने की तुलना में बहुत बड़ा काम है।

संक्षेप में: Peek2, टेक्स्ट को काटने का एक स्मार्ट और तेज़ तरीका है, जिसे विशेष रूप से रोज़मर्रा के उपकरणों पर सुचारू रूप से चलने के लिए डिज़ाइन किया गया है ताकि इसके लिए सुपरकंप्यूटर की आवश्यकता न पड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →