Qrita: High-performance Top-k and Top-p using Pivot-based Truncation and Selection
यह शोध पत्र Qrita को पेश करता है, जो बड़े शब्दकोशों (vocabularies) के लिए एक उच्च-प्रदर्शन, नियत (deterministic) Top-k और Top-p सैंपलिंग एल्गोरिदम है, जो पिवट-आधारित ट्रंकेशन (pivot-based truncation) और चयन का उपयोग करके मौजूदा GPU कर्नेल की तुलना में 1.4x तक थ्रूपुट सुधार और 50% मेमोरी कमी प्राप्त करता है, जिससे इसे vLLM में डिफ़ॉल्ट सैंपलर के रूप में अपनाया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल रसोई (एक Large Language Model) चला रहे हैं जहाँ आपके पास 1,00,000 अलग-अलग सामग्रियों (शब्दकोश/vocabulary) का एक भंडार है। हर बार जब आपको कोई व्यंजन (शब्द) बनाना होता है, तो आपको यह सुनिश्चित करने के लिए उन बेहतरीन कुछ सामग्रियों को चुनना पड़ता है कि भोजन स्वादिष्ट हो लेकिन उबाऊ न हो।
AI की दुनिया में, इस चयन प्रक्रिया को Top-k (शीर्ष k सर्वोत्तम सामग्रियों को चुनना) और Top-p (उन सामग्रियों के सबसे छोटे समूह को चुनना जो एक निश्चित "स्वाद स्कोर" जोड़ते हैं) कहा जाता है।
समस्या: धीमी और अव्यवस्थित रसोई
वर्तमान में, अधिकांश रसोई इसे इस तरह संभालती है कि वे सभी 1,00,000 सामग्रियों को एक विशाल काउंटर पर डाल देती हैं, उन्हें "स्वाद स्कोर" के आधार पर सबसे अच्छे से सबसे खराब क्रम में व्यवस्थित (sort) करती हैं, और फिर शीर्ष कुछ चीज़ों को उठा लेती हैं।
- समस्या: 1,00,000 वस्तुओं को सॉर्ट करना धीमा और अव्यवस्थित है। इसमें बहुत अधिक काउंटर स्पेस (मेमोरी) लगता है और शेफ के हाथ थक जाते हैं (कंप्यूटेशन ओवरहेड)।
- विकल्प: कुछ शेफ केवल कुछ रैंडम सामग्रियों को उठाने की कोशिश करते हैं जो शायद अच्छी हों। लेकिन यह जोखिम भरा है; कभी-कभी आप बेहतरीन सामग्रियों को छोड़ देते हैं, और कभी-कभी हर बार खाना बनाने पर व्यंजन अलग होता है (नॉन-डिटरमिनिस्टिक), जो यदि आपको किसी रेसिपी को ठीक से दोहराने की आवश्यकता हो, तो बुरा है।
समाधान: Qrita (एक स्मार्ट असिस्टेंट शेफ)
यह पेपर Qrita को पेश करता है, जो सामग्रियों को चुनने का एक नया, उच्च-गति वाला तरीका है। Qrita को एक सुपर-स्मार्ट असिस्टेंट शेफ के रूप में सोचें जो इस पूरी अव्यवस्थित सॉर्टिंग को छोड़ने के लिए दो चतुर तरीकों का उपयोग करता है।
ट्रिक 1: "गौसियन सिग्मा-ट्रंकेशन" (शोर फ़िल्टर - The Noise Filter)
कल्पना कीजिए कि आपके 1,00,000 सामग्रियों के भंडार में, 99,000 सामग्रियाँ केवल "शोर" (जैसे नमक, चीनी और आटा जो लगभग एक जैसे साधारण स्वाद वाले हैं) हैं। केवल कुछ सौ ही "मुख्य सामग्रियाँ" (जैसे ट्रफल या केसर) हैं।
हर एक जार को देखने के बजाय, Qrita एक त्वरित "सूंघने वाला परीक्षण" (sniff test) करता है। यह औसत स्वाद और "तीखेपन" (स्टैंडर्ड डेविएशन) की गणना करता है। फिर यह एक रेखा खींचता है: "इस रेखा से नीचे की कोई भी चीज़ केवल शोर है; हमें इसे देखने की ज़रूरत नहीं है।"
- परिणाम: यह तुरंत भंडार का 99% हिस्सा हटा देता है, जिससे केवल 200 या इतने ही दिलचस्प जार बचते हैं। यह एक ही, बिजली की गति वाले पास (pass) में होता है।
ट्रिक 2: "क्वाटरनरी पिवट सर्च" (चार-तरफा विभाजन - The Four-Way Split)
अब, शेफ के पास 200 दिलचस्प सामग्रियों का एक छोटा ढेर है। उन्हें अभी भी सटीक शीर्ष 50 ढूँढने हैं।
- पुराना तरीका: एक-एक करके चेक करना (बहुत धीमा) या ढेर को आधे में विभाजित करना (बाइनरी सर्च)।
- Qrita का तरीका: ढेर को दो हिस्सों में बांटने के बजाय, Qrita इसे एक साथ चार भागों में विभाजित करता है। यह पूछता है: "क्या सबसे अच्छी सामग्री पहले, दूसरे, तीसरे या चौथे भाग में है?"
- बोनस: इसके पास डुप्लिकेट सामग्रियों के लिए एक विशेष नियम भी है। यदि "केसर" के तीन जार का स्कोर बिल्कुल एक जैसा है, तो Qrita जानता है कि रेसिपी को हर बार समान रखने के लिए उसे कितने जार रखने हैं (डिटरमिनिस्टिक)। यह सुनिश्चित करता कि शेफ समान जारों के बीच निर्णय लेने के चक्कर में अंतहीन लूप में न फंस जाए।
यह क्यों मायने रखता है (परिणाम)
लेखकों ने Qrita को Triton (ग्राफिक्स कार्ड/GPUs को प्रोग्राम करने वाली एक भाषा) नामक एक विशेष टूल का उपयोग करके बनाया और इसकी तुलना vLLM और SGLang जैसे प्रमुख AI इंजनों द्वारा उपयोग किए जाने वाले वर्तमान सर्वोत्तम तरीकों से की।
- गति: वास्तविक दुनिया के सर्विंग परिदृश्यों में Qrita 1.4 गुना तेज़ है और कच्चे गति परीक्षणों में 2 गुना तेज़ है।
- मेमोरी: यह आधी मेमोरी का उपयोग करता है क्योंकि इसे 1,00,000 वस्तुओं की पूरी सॉर्ट की गई सूची को स्टोर करने की आवश्यकता नहीं होती है।
- सटीकता: अन्य तेज़ तरीकों के विपरीत जो अनुमान लगाते हैं, Qrita आपको धीमी, पूर्ण सॉर्टिंग विधि के समान ही सटीक परिणाम देता है। यह आउटपुट को नहीं बदलता; यह बस इसे बहुत तेज़ी से खोज लेता है।
निष्कर्ष
Qrita को एक ऐसे शेफ से अपग्रेड करने जैसा है जो दुनिया के हर मसाले को मैन्युअल रूप से सॉर्ट करता है, बजाय एक स्मार्ट असिस्टेंट के जो तुरंत उबाऊ चीजों को अनदेखा कर देता है, दिलचस्प चीजों को एक साथ चार ढेरों में बांट देता है, और डुप्लिकेट्स को पूरी तरह से संभालता है। यह बिना उत्तर की गुणवत्ता बदले AI जनरेशन को तेज़ और अधिक कुशल बनाता है।
नोट: पेपर में उल्लेख है कि Qrita अब vLLM में GPU पाथ के लिए डिफॉल्ट तरीका है, जो AI मॉडल चलाने के लिए एक लोकप्रिय टूल है, और इसका कोड दूसरों के उपयोग के लिए उपलब्ध है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।