← नवीनतम पेपर
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix एक प्रशिक्षण-मुक्त (training-free), टाइल-केंद्रित मिश्रित-परिशुद्धता (mixed-precision) कर्नेल है जो एक फ्यूज्ड डेंस अटेंशन ऑपरेशन के भीतर हार्डवेयर-अलाइन्ड अटेंशन स्कोर टाइल्स को FP16 और INT8 पाथ के बीच गतिशील रूप से रूट करके लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को त्वरित करता है, जिससे समान निम्न-परिशुद्धता विधियों द्वारा खोई गई सटीकता को पुनः प्राप्त किया जाता है और थ्रूपुट में सुधार किया जाता है।

मूल लेखक: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

प्रकाशित 2026-08-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

लार्ज लैंग्वेज मॉडल्स (LLMs) कृत्रिम बुद्धिमत्ता की एक नई पीढ़ी के इंजन बन गए हैं, जो पूरी किताबों का सारांश निकालने, लंबे दस्तावेज़ों से जटिल प्रश्न पूछने और हजारों शब्दों तक चलने वाली बातचीत करने में सक्षम हैं। ऐसा करने के लिए, ये मॉडल 'अटेंशन' (attention) नामक एक तंत्र पर भरोसा करते हैं, जो उन्हें एक वाक्य के हर शब्द को दूसरे हर शब्द के महत्व के विरुद्ध तौलने की अनुमति देता है। जब टेक्स्ट छोटा होता है, तो यह प्रक्रिया तेज़ होती है। लेकिन जैसे-जैसे संदर्भ पूरे अध्यायों या कानूनी अनुबंधों तक बढ़ता है, गणनात्मक लागत विस्फोटक रूप से बढ़ जाती है। मॉडल को शब्दों के हर संभावित जोड़े के लिए एक स्कोर की गणना करनी पड़ती है, जिससे डेटा का एक विशाल ग्रिड बन जाता है जो मेमोरी और प्रोसेसिंग पावर की भारी मात्रा की मांग करता है। इस बाधा ने इन शक्तिशाली उपकरणों को मानक हार्डवेयर पर कुशलतापूर्वक चलाना कठिन बना दिया है, विशेष रूप से उन लंबी अनुक्रमों (sequences) के साथ निपटने के दौरान जिनकी आवश्यकता कानूनी विश्लेषण या मेडिकल रिकॉर्ड समीक्षा जैसे वास्तविक दुनिया के कार्यों के लिए होती है।

शोधकर्ताओं ने गणित को सरल बनाकर इसे हल करने का प्रयास किया है। एक सामान्य दृष्टिकोण यह है कि कंप्यूटर द्वारा उपयोग किए जाने वाले नंबरों की सटीकता (precision) को कम कर दिया जाए, यानी उच्च-सटीक गणनाओं से बदलकर तेज़, कम-सटीक गणनाओं का उपयोग करना। यह प्रयोगशाला के तराजू से सामग्री मापने के बजाय रसोई के चम्मच का उपयोग करने जैसा है; यह बहुत तेज़ है, लेकिन यदि आप इसे जटिल रेसिपी के हर चरण के लिए करते हैं, तो अंतिम व्यंजन का स्वाद गलत हो सकता है। एक अन्य दृष्टिकोण गणनाओं को पूरी तरह से छोड़ देना है, यानी उन शब्दों को अनदेखा करना जो महत्वहीन लगते हैं। हालांकि इससे समय बचता है, लेकिन इसमें उन कनेक्शनों को काटने का जोखिम होता है जिनकी कहानी को समझने के लिए मॉडल को आवश्यकता होती है। चुनौती कम-सटीक गणित की गति का उपयोग करने के साथ-साथ उच्च-सटीक प्रकार की सटीकता को बनाए रखने का तरीका खोजने में थी, और साथ ही मॉडल की पूरी तस्वीर देखने की क्षमता को भी सुरक्षित रखना था।

शोधकर्ताओं की एक टीम ने 'TileMix' नामक एक नई विधि पेश की है जो इस समस्या से इस तरह निपटती है कि वह अटेंशन प्रक्रिया को एक एकल, समान कार्य के ब्लॉक के रूप में नहीं, बल्कि छोटे, प्रबंधनीय टाइल्स (tiles) के संग्रह के रूप में देखती है। कल्पना कीजिए कि शब्द-जोड़े के स्कोर का विशाल ग्रिड एक बड़े मोज़ेक (mosaic) की तरह है। पूरे मोज़ेक को एक ही प्रकार के पेंट से रंगने के बजाय, TileMix इसे हार्डवेयर-संरेखित छोटे वर्गाकार खंडों में विभाजित करता है। इन प्रत्येक खंड के लिए, सिस्टम एक पल का निर्णय लेता है: क्या शब्दों के इस विशिष्ट समूह को उच्च-सटीक, धीमी गणना की आवश्यकता है, या यह तेज़, कम-सटीक गणना से काम चला सकता है? यह निर्णय एक पूर्व-नियोजित मानचित्र के आधार पर लिया जाता है जो इन टाइल्स को एक साथ समूहित करता है, जिससे कंप्यूटर डेटा को पुनर्गठित करने के लिए रुके बिना एक ही ऑपरेशन के भीतर उच्च और निम्न सटीकता के बीच स्विच कर सकता है।

इस नवाचार का मूल एक रूटिंग सिस्टम है जो कंप्यूटर के प्रोसेसर के लिए एक ट्रैफिक कंट्रोलर की तरह कार्य करता है। यह इन निर्णयों को एक संक्षिप्त कोड में पैक करता है, जो अनिवार्य रूप से बिट्स की एक स्ट्रिंग है जो प्रोसेसर को बताता है कि प्रत्येक टाइल के लिए कौन सा रास्ता लेना है। यदि एक टाइल को उच्च-सकीकता के लिए चिह्नित किया गया है, तो प्रोसेसर अपने सबसे सटीक गणितीय इकाइयों का उपयोग करता है। यदि इसे कम-सटीकता के लिए चिह्नित किया गया है, तो यह अपनी सबसे तेज़, ऊर्जा-कुशल इकाइयों पर स्विच हो जाता है। महत्वपूर्ण रूप से, दोनों पथ एक साझा मेमोरी स्टेट को अपडेट करते हैं जो समग्र परिणामों को ट्रैक रखता है, जिससे यह सुनिश्चित होता है कि अंतिम आउटपुट सुसंगत बना रहे। यह सिस्टम को मॉडल की पूर्ण कनेक्टिविटी को संरक्षित करने की अनुमति देता है—अर्थात, शब्दों के बीच के किसी भी इंटरैक्शन को कभी अनदेखा नहीं किया जाता है—जबकि साथ ही कम-सटीक गणित के गति लाभों का लाभ भी उठाता है जिसके लिए गणना के कुछ हिस्से सहिष्णु होते हैं।

अपने प्रयोगों में, शोधकर्ताओं ने LLaMA, Qwen और Vicuna सहित कई लोकप्रिय लार्ज लैंग्वेज मॉडल्स पर 16,000 से 64,000 शब्दों के अनुक्रमों का उपयोग करके इस पद्धति का परीक्षण किया। उन्होंने अपने दृष्टिकोण की तुलना मानक उच्च-सटीक पद्धति और एक ऐसे संस्करण से की जिसमें पूरी गणना के लिए कम-सटीक गणित का उपयोग किया गया था। परिणामों ने दिखाया कि पूरी गणना के लिए कम-सकीक गणित का उपयोग करने से अक्सर सटीकता में महत्वपूर्ण गिरावट आती है, जिससे मॉडल विवरणों को मिस कर देता है या रिट्रीवल (retrieval) कार्यों में विफल हो जाता है। हालांकि, TileMix उस खोई हुई गुणवत्ता को काफी हद तक वापस लाने में सक्षम रहा। केवल विशिष्ट टाइल्स के समूहों को उच्च-सटीक पथ पर सावधानीपूर्वक रूट करके, सिस्टम ने सटीकता के स्तर को पूर्ण उच्च-सटीक बेसलाइन के बहुत करीब बनाए रखा, जबकि साथ ही बहुत तेज़ प्रोसेसिंग स्पीड भी हासिल की।

अध्ययन ने इस बात की भी खोज की कि यह तय करने के लिए कि किन टाइल्स को उच्च-सटीक उपचार मिलना चाहिए, विभिन्न पैटर्न क्या थे। उन्होंने पाया कि व्यवस्था मायने रखती थी; कुछ पैटर्न, जो शब्द ग्रिड के विशिष्ट स्थानिक क्षेत्रों में उच्च-सटीक गणनाओं को बनाए रखते थे, कार्य के आधार पर दूसरों की तुलना में बेहतर काम करते थे। उदाहरण के लिए, स्थानीय शब्द इंटरैक्शन के लिए उच्च-सटीकता बनाए रखने वाले कुछ लेआउट्स तथ्यात्मक रिकॉल (factual recall) कार्यों पर बेहतर प्रदर्शन करते थे, जबकि अन्य सामान्य प्रश्न पूछने (question answering) के लिए अधिक मजबूत थे। शोधकर्ताओं ने प्रदर्शित किया कि इस पद्धति को मॉडल्स को फिर से प्रशिक्षित (retraining) किए बिना लागू किया जा सकता है, जिसका अर्थ है कि इसे मौजूदा सिस्टम पर तुरंत तैनात किया जा सकता है। उन्होंने यह भी दिखाया कि यह दृष्टिकोण विभिन्न लंबाई वाले बैचों और अलग-अलग मॉडल आर्किटेक्चर के साथ अच्छी तरह से काम करता है, जो इसे दक्षता में सुधार के लिए एक लचीला उपकरण बनाता है।

अंततः, TileMix गति और सटीकता के बीच एक नियंत्रणीय संतुलन प्रदान करता है। यह सुझाव देता है कि कुशल लंबे-संदर्भ प्रसंस्करण (long-context processing) का भविष्य यह नहीं है कि आपको तेज़ होने या स्मार्ट होने में से किसी एक को चुनना पड़े। इसके बजाय, उच्च और निम्न सटीकता को बुद्धिमानी से मिश्रित करके, सिस्टम हार्डवेयर की सैद्धांतिक सीमाओं के करीब गति के साथ लंबे दस्तावेज़ों को प्रोसेस कर सकते हैं, बिना उस गंभीर सटीकता दंड के जो हर जगह कम-सटीक गणित का उपयोग करने से आता है। यह दृष्टिकोण बड़े डेटासेट के वास्तविक समय के विश्लेषण या उन इंटरैक्टिव टूल्स के लिए, जिन्हें लंबे, जटिल संदर्भों को तुरंत समझने की आवश्यकता होती है, जहाँ गति और सटीकता दोनों महत्वपूर्ण हैं, वहां तैनात करने के लिए एक व्यावहारिक मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →