← नवीनतम पेपर
🤖 machine learning

Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits

यह शोध पत्र MTPC प्रस्तुत करता है, जो मल्टी-टोकन प्रेडिक्शन के लिए एक प्रोबेबिलिस्टिक सर्किट-आधारित फ्रेमवर्क है जो भविष्य के टोकन पर संयुक्त वितरण (joint distributions) को एनकोड करके अभिव्यक्ति (expressiveness) और लेटेंसी के बीच के संतुलन को अनुकूलित करता है, जिससे मूल मॉडल के प्रदर्शन को सुरक्षित रखते हुए बाइट-लेवल और सबवर्ड LLM जनरेशन को महत्वपूर्ण रूप से त्वरित किया जाता है।

मूल लेखक: Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत सख्त नियम है: आप एक बार में केवल एक अक्षर लिख सकते हैं। हर बार जब आप एक अक्षर टाइप करते हैं, तो आपको रुकना पड़ता है, सोचना पड़ता है, और अपने सुपर-स्मार्ट दिमाग (AI) से पूछना पड़ता है कि आगे क्या आना चाहिए। यह अधिकांश वर्तमान लार्ज लैंग्वेज मॉडल्स (LLMs) के काम करने का तरीका है। यह सटीक है, लेकिन यह अविश्वसनीय रूप से धीमा है, खासकर यदि आप "बाइट्स" (पाठ के कच्चे निर्माण खंड) में लिख रहे हैं न कि पूरे शब्दों में, क्योंकि एक वाक्य लिखने के लिए आपको हजारों अक्षर टाइप करने होंगे।

यह शोध पत्र इस गति की समस्या को हल करने के लिए MTPC (Multi-Token Prediction Circuits) नामक एक नई विधि पेश करता है।

यह यहाँ कैसे काम करता है, कुछ रोजमर्रा के उपमाओं का उपयोग करते हुए:

1. समस्या: "अनुमान लगाने वाला खेल" बनाम "क्रिस्टल बॉल"

चीजों को तेज करने के लिए, शोधकर्ताओं ने Multi-Token Prediction (MTP) नामक एक ट्रिक आज़माई। एक अक्षर का अनुमान लगाने के बजाय, AI एक साथ अक्षरों का एक पूरा समूह (जैसे एक शब्द के अगले 8 अक्षर) अनुमान लगाने की कोशिश करता है।

  • पुराना तरीका (स्वतंत्रता धारणा - Independence Assumption): कल्पना कीजिए कि आप एक शब्द के अगले 8 अक्षरों का अनुमान लगा रहे हैं, लेकिन आप प्रत्येक अक्षर के साथ ऐसा व्यवहार करते हैं जैसे कि अन्य अक्षरों के साथ उसका कोई संबंध नहीं है। आप पहला अक्षर अनुमान लगाते हैं, फिर दूसरा, फिर तीसरा, यह पूरी तरह से अनदेखा करते हुए कि यदि पहला अक्षर "C" है, तो दूसरा "Z" होने की संभावना कम है।

    • परिणाम: यह तेज़ है, लेकिन इससे निरर्थक बातें निकलती हैं। आपको "Pretoria" के बजाय "Cretoria" या "Craporia" मिल सकता है क्योंकि मॉडल को यह एहसास नहीं हुआ कि वे अक्षर एक साथ कैसे फिट होने चाहिए। यह बिना यह जांचे कि क्या वे फिट बैठते हैं, ईंटें चुनने जैसा है जैसे कि आप एक घर बनाने की कोशिश कर रहे हों।
  • नया तरीका (MTPC): लेखक कहते हैं, "आइए अक्षरों को अलग-थलग अनुमान लगाना बंद करें। आइए पूरे समूह को एक जुड़े हुए समूह के रूप में अनुमान लगाएं।" वे एक गणितीय उपकरण का उपयोग करते हैं जिसे प्रोबेबिलिस्टिक सर्किट (Probabilistic Circuit) कहा जाता है।

    • उपमा: पुराने तरीके को एक ऐसी पंक्ति के रूप में सोचें जहाँ लोग एक नोट पास कर रहे हैं, जहाँ हर कोई एक रैंडम शब्द फुसफुसाता है। नया तरीका एक ऑर्केस्ट्रा का संचालन करने वाले कंडक्टर की तरह है। कंडक्टर (सर्किट) जानता है कि यदि पहला वाद्य यंत्र C-मेजर कॉर्ड बजाता है, तो अगले वाद्य यंत्रों को उस कॉर्ड के अनुकूल नोट्स ही बजाने होंगे। यह अक्षरों के बीच के निर्भरताओं (dependencies) को समझता है।

2. टूलकिट: "सर्किट आर्किटेक्ट"

यह पेपर एक लचीला ढांचा (MTPC) प्रस्तावित करता है जो आपको यह चुनने देता है कि अक्षर कितने "जुड़े हुए" होने चाहिए। वे गति और बुद्धिमत्ता के बीच संतुलन बनाने के लिए विभिन्न "आर्किटेक्चर" (सर्किट के आकार) प्रदान करते हैं:

  • FF (Fully Factorised): "रैंडम गेस" मोड। तेज़, लेकिन मूर्ख। (ऑर्केस्ट्रा के सदस्य अकेले बजते हैं)।
  • CP (Canonical Polyadic): "ग्रुप गेस"। वे कुछ मुख्य थीम का अनुमान लगाते हैं और अक्षरों को उनके इर्द-गिर्द बनाते हैं। थोड़ा स्मार्ट।
  • HMM (Hidden Markov Model): "चेन रिएक्शन"। पहला अक्षर दूसरे को प्रभावित करता है, जो तीसरे को प्रभावित करता है, और इसी तरह। यह बहुत स्मार्ट है लेकिन धीमा है क्योंकि आपको एक के समाप्त होने का इंतज़ार करना पड़ता है इससे पहले कि दूसरा शुरू हो सके।
  • BTree (Binary Tree): "टीम हडल"। यह पेपर का सितारा है। कल्पना कीजिए कि 8 अक्षरों को दो समूहों में 4-4 के रूप में विभाजित किया गया है। मॉडल पहले समूह और दूसरे समूह का अनुमान एक ही समय में लगाता है, लेकिन वे एक "टीम लीडर" (एक छिपा हुआ चर/hidden variable) द्वारा जुड़े होते हैं जो यह सुनिश्चित करता है कि वे समग्र विषय पर सहमत हों।
    • यह क्यों महान है: यह "चेन रिएक्शन" की बुद्धिमत्ता प्राप्त करता है लेकिन "रैंडम गेस" की गति भी देता है क्योंकि यह एक साथ दो चीजें करता है।

3. सुरक्षा जाल: "स्पेक्टुलेटिव डिकोडिंग" (Speculative Decoding)

आप चिंतित हो सकते हैं: "यदि AI एक साथ अक्षरों का एक पूरा समूह अनुमान लगाता है, तो क्या होगा यदि वह गलत हो जाए?"

पेपर एक तकनीक का उपयोग करता है जिसे Speculative Decoding कहा जाता है।

  • उपमा: एक तेज़ धावक (ड्राफ्ट मॉडल) और एक धीमा, अत्यंत सटीक न्यायाधीश (वेरिफायर) की कल्पना करें।
    1. तेज़ धावक आगे दौड़ता है और अगले 8 अक्षरों का अनुमान लगाता है।
    2. धीमा न्यायाधीश उन्हें एक-एक करके जांचता है।
    3. यदि न्यायाधीश धावक के अनुमान से सहमत है, तो बहुत अच्छा! हम उन अक्षरों को रखते हैं।
    4. यदि न्यायाधीश असहमत है, तो हम वहीं रुक जाते हैं, गलत अनुमानों को हटा देते हैं, और केवल उन्हीं को रखते हैं जिन्हें न्यायाधीश ने अनुमोदित किया है।

क्योंकि ड्राफ्ट मॉडल (MTPC) अक्षरों के जुड़ने के तरीके को समझने में बहुत अच्छा है (BTree सर्किट के कारण), न्यायाधीश धावक के साथ बहुत अधिक बार सहमत होता है। इसका मतलब है कि हम उनके द्वारा किए गए अधिक अनुमानों को रख पाते हैं, जिससे पूरी प्रक्रिया तेज हो जाती है।

4. परिणाम: चीजों को खराब किए बिना गति बढ़ाना

लेखकों ने दो विशिष्ट AI मॉडल्स पर परीक्षण किया:

  1. EvaByte: एक मॉडल जो पहले से ही बाइट्स में लिखता है।
  2. Llama 3.2 3B (Byte): एक लोकप्रिय मॉडल जिसे बाइट्स में लिखने के लिए परिवर्तित किया गया है।

निष्कर्ष:

  • भारी गति वृद्धि: पुराने "एक बार में एक अक्षर" वाले तरीके की तुलना में, MTPC ने EvaByte को 5.15 गुना तेज़ और Llama को 2.24 गुना तेज़ बना दिया।
  • "स्वतंत्रता" वाली ट्रिक से बेहतर: यहाँ तक कि अन्य तेज़ तरीकों की तुलना में भी जो केवल स्वतंत्र रूप से अक्षरों का अनुमान लगाते हैं, MTPC 1.17 गुना तेज़ था।
  • गुणवत्ता में कोई कमी नहीं: महत्वपूर्ण रूप से, "सुरक्षा जाल" (Speculative Decoding) के कारण, अंतिम आउटपुट की गुणवत्ता बिल्कुल वैसी ही है जैसी यदि AI ने इसे एक बार में एक अक्षर करके लिखा होता। आप गति के लिए सटीकता खोते नहीं हैं।

सारांश

यह पेपर AI टेक्स्ट जनरेशन को तेज़ बनाने का एक नया तरीका प्रस्तुत करता है, जिससे AI को अक्षरों के अलग-थलग टुकड़ों के बजाय टेक्स्ट के जुड़े हुए समूहों के रूप में अनुमान लगाना सिखाया जाता है। अपने अनुमानों को व्यवस्थित करने के लिए एक स्मार्ट "बाइनरी ट्री" (BTree) संरचना और उन्हें सत्यापित करने के लिए एक "जज" का उपयोग करके, उन्होंने एक विशाल गति वृद्धि (5 गुना तक) हासिल की, जबकि यह गारंटी दी कि टेक्स्ट एकदम सही रहेगा। यह एक टाइपिस्ट को एक साथ पूरे शब्द टाइप करना सिखाने जैसा है, लेकिन एक सुरक्षा जाल के साथ जो तुरंत किसी भी स्पेलिंग मिस्टेक को पकड़ लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →