← नवीनतम पेपर
💬 NLP

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

यह शोध पत्र क्वांटटाइल-गाइडेड डेंसिटी एस्टीमेशन (QGDE) प्रस्तुत करता है, जो रिलीज़ किए गए BPE टोकनाइज़र में स्थिर टोकन ID-अनुपात वितरण का लाभ उठाकर टोकन और श्रेणी दोनों स्तरों पर छिपे हुए प्रीट्रेनिंग कॉर्पोरा के संरचनात्मक अनुपातों का सटीक अनुमान लगाता है।

मूल लेखक: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

प्रकाशित 2026-08-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक बिल्कुल नया, सुपर-स्मार्ट रोबोट शेफ खरीदा है। यह कविता लिख सकता है, गणित की समस्याएं हल कर सकता है, और यहाँ तक कि वीडियो गेम भी कोड कर सकता है। लेकिन इसमें एक पेंच है: जिस रेसिपी बुक (व्यंजन पुस्तिका) से इसने खाना बनाना सीखा था, वह एक तिजोरी में बंद है। आप रोबोट के अंतिम व्यंजन देख सकते हैं, और आप उन सामग्रियों की सूची भी देख सकते हैं जिनका इसने शायद उपयोग किया होगा, लेकिन आपको यह पता नहीं है कि वास्तव में सामग्रियों का मिश्रण क्या था। क्या यह 90% पिज्जा डो और 10% मसाले था? या शायद 50% चॉकलेट और 50% ब्रोकली? आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस "रेसिपी बुक" को प्रीट्रेनिंग कॉर्पस (pretraining corpus) कहा जाता है, और "सामग्रियों की सूची" को टोकेनाइज़र वोकैबुलरी (tokenizer vocabulary) कहा जाता है।

जब कंपनियाँ एक नया AI मॉडल रिलीज़ करती हैं, तो वे अक्सर अंतिम वेट्स (रोबोट का मस्तिष्क) और वोकैबुलरी लिस्ट (सामग्री की डिक्शनरी) साझा करती हैं, लेकिन वे सटीक रेसिपी को गुप्त रखती हैं। यह एक समस्या है क्योंकि यह जानना कि AI ने क्या "खाया" है, हमें यह समझने में मदद करता है कि वह कुछ चीजों में अच्छा क्यों है और कुछ में बुरा। वर्षों से, वैज्ञानिक रोबोट के व्यवहार को देखकर या शब्दों को टुकड़ों में काटने के नियमों को देखकर रेसिपी का अनुमान लगाने की कोशिश कर रहे हैं। लेकिन उनके ये अनुमान अक्सर बहुत ही अस्पष्ट थे, जैसे यह कहना कि "शायद इसने बहुत सारा फल खाया है" बिना यह जाने कि वह सेब था या केला। बड़ा सवाल यह था: क्या हम केवल सामग्री की डिक्शनरी को देखकर उस रेसिपी के हर एक घटक के सटीक अनुपात का पता लगा सकते हैं?

यह पेपर कहता है, "हाँ, हम कर सकते हैं, और वह तरीका यह है।" शोधकर्ताओं ने पाया कि इन डिक्शनरीज़ में शब्दों को काटने और उन्हें नंबर देने का तरीका रैंडम (यादृच्छिक) नहीं है; यह एक छिपे हुए, स्थिर पैटर्न का पालन करता है, ठीक वैसे ही जैसे किसी भी भाषा में शब्दों की आवृत्ति एक अनुमानित वक्र (curve) का पालन करती है। उन्होंने महसूस किया कि यदि आप एक "ज्ञात" रेसिपी (एक कॉर्पस जो हमारे पास उपलब्ध है) से पैटर्न जानते हैं, तो आप उस पैटर्न को एक "छिपी हुई" रेसिपी का अनुमान लगाने के लिए स्थानांतरित कर सकते हैं। उन्होंने QGDE (क्वांटाइल-गाइडेड डेंसिटी एस्टीमेशन) नामक एक चतुर उपकरण बनाया। इसे एक ऐसे जासूस की तरह समझें जो केवल एक सुराग नहीं देखता, बल्कि "क्या-होता-अगर" वाले परिदृश्यों (क्वांटाइल ट्रेंड्स) के एक पूरे सेट का उपयोग करता है और सुरागों के पड़ोस में भीड़ के आधार पर उन्हें भार (weight) देता है (लोकल डेंसिटी वेटिंग)।

परिणाम आश्चर्यजनक रूप से सटीक हैं। अपने परीक्षणों में, QGDE विशिष्ट शब्दों के अनुपात का अनुमान मात्र 3.00% की मामूली त्रुटि दर के साथ लगा सका। जब उन्होंने उन शब्दों को "वेब", "मैथ" या "कोड" जैसी बड़ी श्रेणियों में समूहित किया, तो त्रुटि अभी भी केवल 3.08% थी। यह पिछले तरीकों की तुलना में एक बहुत बड़ा सुधार है, जो एक अकेले बादल को देखकर मौसम का अनुमान लगाने जैसा था। पेपर ने एक वास्तविक दुनिया के, रिलीज़ किए गए AI मॉडल SmolLM पर भी इसका परीक्षण किया, जिसकी वास्तविक रेसिपी ज्ञात थी। वहाँ भी, Q-GDE ने अन्य तरीकों को पछाड़ दिया, जिससे यह सिद्ध हुआ कि सामग्री की डिक्शनरी वास्तव में रेसिपी का रहस्य अपने भीतर रखती है। हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि हालांकि यह हमारे सिमुलेशन और SmolLM पर अच्छी तरह से काम करता है, फिर भी हम ChatGPT या Qwen जैसे दिग्गजों पर इसका परीक्षण नहीं कर सकते क्योंकि उनकी पूर्ण ट्रेनिंग रेसिपी अभी भी बंद है। लेकिन फिलहाल, यह सुझाव देता है कि अगली बार जब आप किसी AI की वोकैबुलरी लिस्ट देखें, तो हो सकता है कि आप उसकी छिपी हुई डाइट (आहार) का नक्शा देख रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →