← नवीनतम पेपर
💬 NLP

Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models

यह शोध पत्र तर्क देता है कि टोकनाइज़ेशन को एक स्थिर प्रीप्रोसेसिंग चरण के बजाय, मॉडल के साथ संदर्भ-जागरूक सह-डिज़ाइन (context-aware co-design) की आवश्यकता वाले एक मुख्य मॉडलिंग निर्णय के रूप में पुनर्कल्पित किया जाना चाहिए, ताकि लार्ज लैंग्वेज मॉडल्स में भाषाई विसंगति, पूर्वाग्रह और अक्षमता के मुद्दों को संबोधित किया जा सके।

मूल लेखक: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

प्रकाशित 2026-01-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र (एक लार्ज लैंग्वेज मॉडल) को दुनिया को पढ़ने और समझने का तरीका सिखाने की कोशिश कर रहे हैं। इससे पहले कि छात्र सीखना शुरू करे, आपको यह तय करना होगा कि वे जो किताबें पढ़ेंगे, उन्हें आप कैसे टुकड़ों में तोड़ेंगे। क्या आप टेक्स्ट को पूरे शब्दों में काटेंगे? व्यक्तिगत अक्षरों में? या अक्षरों के छोटे समूहों, जैसे कि शब्दांशों (syllables) या सामान्य अक्षर समूहों में?

टेक्स्ट को टुकड़ों में काटने की इस प्रक्रिया को टोकेनाइजेशन (tokenization) कहा जाता है।

इस शोध पत्र के अनुसार, हम वर्तमान में इसे करने का जो तरीका अपना रहे हैं, वह एक "सेट इट एंड फॉरगेट इट" (करो और भूल जाओ) वाली आदत की तरह है। हम आमतौर पर एक मानक कैंची (एक पूर्व-निर्मित टूल जिसे बाइट पेयर एनकोडिंग या BPE कहा जाता है) उठाते हैं और बस काटना शुरू कर देते हैं, यह मानकर कि यह सबके लिए काम करेगा। लेखक तर्क देते हैं कि यह एक गलती है। वे कहते हैं कि टोकेनाइजेशन केवल एक उबाऊ तैयारी का चरण नहीं है; यह वास्तव में उन सबसे महत्वपूर्ण डिजाइन निर्णयों में से एक है जो आप एक AI बनाते समय लेते हैं।

यहाँ शोध पत्र का तर्क दिया गया है, जिसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "एक ही आकार के लिए सभी" (One-Size-Fits-All) वाली कैंची

अभी, अधिकांश AI मॉडल एक ही मानक टोकेनाइजेशन पद्धति का उपयोग करते हैं। शोध पत्र इस पद्धति की तुलना सब कुछ काटने के लिए एक ही जोड़ी कैंची का उपयोग करने से करता है: एक नाजुक रेशमी स्कार्फ, एक मोटा ऊनी स्वेटर और धातु की एक शीट।

  • समस्या: यह मानक तरीका अक्सर चीजों को अजीब जगहों से काट देता है। उदाहरण के लिए, यह किसी गैर-अंग्रेजी भाषा के जटिल शब्द को छोटे, अर्थहीन टुकड़ों में काट सकता है, या यह किसी कोड कमांड को इस तरह से विभाजित कर सकता है जिससे AI भ्रमित हो जाए।
  • परिणाम: AI को समझने के लिए अधिक मेहनत करनी पड़ती है, यह कम कुशल हो जाता है, और यह पक्षपात भी सीख सकता है क्योंकि इसके "कट" कुछ भाषाओं या शब्दों के प्रकारों का पक्ष लेते हैं।

2. बदलाव: "तैयारी के कार्य" से "मुख्य डिजाइन" तक

लेखक चाहते हैं कि हम टोकेनाइजेशन को खाना पकाने से पहले बर्तन धोने जैसा मानना बंद करें। इसके बजाय, वे कहते हैं कि इसे रेसिपी का हिस्सा होना चाहिए।

  • उपमा: कल्पना कीजिए कि आप एक घर बना रहे हैं। आप जो भी ईंटें आसपास पड़ी हों, उन्हें उठाकर यह उम्मीद नहीं करेंगे कि वे फिट बैठ जाएंगी। इसके बजाय, आप जलवायु और डिजाइन के आधार पर नींव, दीवारों और छत के लिए विशेष रूप से चुनी गई ईंटों का चयन करेंगे।
  • दावा: टोकेनाइजेशन को सावधानीपूर्वक चुना जाना चाहिए कि AI को क्या करना है (जैसे, कोड लिखना, चिकित्सा संबंधी समस्याओं का निदान करना, या कई भाषाएं बोलना) और वह किससे बात कर रहा है।

3. समाधान: एक "संदर्भ-जागरूक" (Context-Aware) टूलकिट

शोध पत्र एक नया तरीका प्रस्तावित करता है जिसे संदर्भ-जागरूक ढांचा (context-aware framework) कहा जाता है। इसका अर्थ यह है कि आप केवल एक उपकरण नहीं चुनते; आप उस विशिष्ट कार्य के लिए उपकरण को डिजाइन करते हैं।

  • सह-डिजाइन (Co-Design): टोकेनाइजेशन चुनने और फिर AI को प्रशिक्षित करने के बजाय, आपको उन्हें एक साथ डिजाइन करना चाहिए। यदि AI मेडिकल जर्नल पढ़ रहा है, तो टोकेनाइज़र को मेडिकल टेक्स्ट पर प्रशिक्षित किया जाना चाहिए ताकि वह जान सके कि "immunohistochemistry" एक महत्वपूर्ण इकाई है, न कि यादृच्छिक अक्षरों का एक समूह।
  • अनुकूलन (Adaptation): यदि आप किसी विशिष्ट भाषा (जैसे अरबी) या किसी विशिष्ट क्षेत्र (जैसे कानून) के लिए AI का उपयोग कर रहे हैं, तो आपको अपने "कैंची" को सामान्य अंग्रेजी समाचारों की तुलना में अलग तरह से काटने के लिए ट्यून करने की आवश्यकता हो सकती है।

4. छिपे हुए खतरे: पूर्वाग्रह और सुरक्षा

शोध पत्र चेतावनी देता है कि खराब टोकेनाइजेशन केवल दक्षता के बारे में नहीं है; यह अनुचित या खतरनाक भी हो सकता है।

  • "मौन विफलता" (The Silent Failure): कुछ शब्द या वर्ण इतने खराब तरीके से काटे जा सकते हैं कि AI वास्तव में कभी समझ ही नहीं पाता कि उनका क्या अर्थ है। शोध पत्र इन्हें "अल्प-प्रशिक्षित टोकन" (undertrained tokens) कहता है। यह एक छात्र को ऐसी पाठ्यपुस्तक देने जैसा है जहाँ आधे शब्द धुंधले हैं; वे अनुमान तो लगाएंगे, लेकिन वे वास्तव में समझेंगे नहीं।
  • पूर्वाग्रह (Bias): यदि टोकेनाइज़र कुछ संस्कृतियों या भाषाओं के शब्दों को छोटे टुकड़ों में काट देता है जबकि अंग्रेजी शब्दों को पूरा रखता है, तो AI स्वाभाविक रूप से अंग्रेजी को बेहतर समझेगा और अन्य भाषाओं के साथ संघर्ष करेगा। यह कुछ समूहों के लिए अनुचित लाभ पैदा करता है।
  • सुरक्षा (Security): हैकर्स कभी-कभी AI द्वारा टेक्स्ट को काटने के अजीब तरीकों का फायदा उठाकर उसे वह करने के लिए मजबूर कर सकते हैं जो उसे नहीं करना चाहिए।

5. समाधान: एक नई चेकलिस्ट

लेखक किसी भी AI बनाने वालों के लिए एक संरचित प्रक्रिया का सुझाव देते हैं:

  1. केवल पुन: उपयोग न करें: यह जांचे बिना कि क्या यह आपकी आवश्यकताओं के अनुकूल है, स्वचालित रूप से किसी प्रसिद्ध मॉडल (जैसे LLaMA) से टोकेनाइज़र न उठाएं।
  2. काटों का ऑडिट करें: जांचें कि क्या टोकेनाइज़र विभिन्न भाषाओं में निष्पक्ष रूप से काट रहा है और क्या यह अजीब, बेकार टुकड़े बना रहा है।
  3. जो महत्वपूर्ण है उसे मापें: केवल यह गिनने के बजाय कि टेक्स्ट को कितने टुकड़ों में काटा गया है, यह मापें कि क्या इन कटों के साथ AI वास्तव में अर्थ को बेहतर ढंग से समझता है।

मुख्य निष्कर्ष (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि टोकेनाइजेशन AI की समझ की नींव है। यदि आप उस नींव को एक जेनेरिक, खराब डिज़ाइन किए गए टूल के साथ बनाते हैं, तो पूरा घर (AI) अस्थिर, अक्षम और अनुचित होगा। टोकेनाइजेशन को एक महत्वपूर्ण डिजाइन विकल्प के रूप में मानकर—विशिष्ट भाषा, कार्य और दर्शकों के लिए इसे कस्टमाइज़ करके—हम ऐसा AI बना सकते हैं जो सभी के लिए स्मार्ट, तेज़ और निष्पक्ष हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →