← नवीनतम पेपर
🤖 machine learning

FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels

FairyFuse एक CPU-आधारित इन्फरेंस सिस्टम है जो बिना गुणा (multiplication-free) के निष्पादन और 29.6x कर्नेल स्पीडअप प्राप्त करता है, जो टेनरी वेट ऑपरेशन्स को एक एकल AVX-512 लूप में फ्यूज करता है, जिससे कमोडिटी हार्डवेयर पर फ्लोटिंग-पॉइंट गुणा के बिना उच्च-थ्रूपुट वाला, लगभग लॉसलेस LLM जनरेशन सक्षम होता है।

मूल लेखक: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ FairyFuse पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: आपके कंप्यूटर में "ट्रैफिक जाम"

कल्पना कीजिए कि आप एक विशाल ट्रक (एक Large Language Model) को एक शहर के माध्यम से चलाने की कोशिश कर रहे हैं। ट्रक भारी कार्गो (मॉडल के "weights" या ज्ञान) से भरा हुआ है।

अधिकांश कंप्यूटरों में, इंजन (CPU) शक्तिशाली होता है, लेकिन सड़कें (मेमोरी बैंडविड्थ) संकरी और भीड़भाड़ वाली होती हैं। हर बार जब ट्रक को कोई निर्णय लेना होता है (एक शब्द बनाना), तो उसे एक गोदाम पर रुकना पड़ता है, एक भारी बक्सा उतारना पड़ता है, उसे इंजन तक ले जाना पड़ता है, कुछ गणित करना पड़ता है, और फिर उसे वापस रखना पड़ता है।

समस्या यह है कि गणित बहुत भारी है। ट्रक वास्तव में गाड़ी चलाने के बजाय कार्गो के आने का इंतज़ार करने में अधिक समय बिताता है। यही कारण है कि एक सामान्य लैपटॉप या सर्वर पर AI चलाना अक्सर धीमा होता है; कंप्यूटर बहुत अधिक डेटा को इधर-उधर ले जाने के कारण होने वाले ट्रैफिक जाम में फँसा हुआ है।

पुराना समाधान: "Dequantization" (बक्सों को खोलना)

पहले, इन मॉडलों को छोटा करने के लिए, शोधकर्ताओं ने quantization का उपयोग किया था। इसे भारी कार्गो को छोटे, हल्के बक्सों में पैक करने के रूप में सोचें।

  • चुनौती: भले ही बक्से छोटे हों, कंप्यूटर को गणित करने से पहले उन्हें उनके मूल भारी रूप में अनपैक (unpack) करना पड़ता है। यह एक फ्लैट-पैक बुकशेल्फ़ खरीदने जैसा है: आप शिपिंग में जगह बचाते हैं, लेकिन उपयोग करने से पहले आपको उसे असेंबल करने में समय खर्च करना ही पड़ता है।
  • परिणाम: आप जगह तो बचा लेते हैं, लेकिन आप बहुत अधिक समय नहीं बचा पाते क्योंकि "असेंबली" (अनपैक करना और संख्याओं को गुणा करना) अभी भी बहुत लंबा समय लेती है।

नया विचार: "Ternary" Weights (जादुई स्विच)

पेपर एक मॉडल पेश करता है जिसे Fairy2i कहा जाता है जो Ternary Weights का उपयोग करता है।
3.14 या -2.5 जैसी संख्याओं के बजाय, ये weights केवल तीन चीजें हैं: +1, -1, या 0।

  • उपमा: कल्पना कीजिए कि आप खाना बना रहे हैं।
    • सामान्य गणित: आपको ठीक 3.14 कप आटा मापने की आवश्यकता है। इसके लिए आपको एक तराजू और कैलकुलेटर की आवश्यकता होती है (गुणा/Multiplication)।
    • Ternary गणित: आपके पास केवल तीन विकल्प हैं: "एक कप जोड़ें," "एक कप घटाएं," या "कुछ न करें।"
    • लाभ: अब आपको तराजू या कैलकुलेटर की आवश्यकता नहीं है। आप बस एक स्विच घुमाते हैं। यदि यह +1 है, तो आप जोड़ते हैं। यदि यह -1 है, तो आप घटाते हैं। यदि यह 0 है, तो आप इसे अनदेखा करते हैं। आपने पूरी तरह से गुणा (multiplication) की आवश्यकता को समाप्त कर दिया है।

नवाचार: "FairyFuse" (असेंबली लाइन)

यहाँ पेचीदा हिस्सा आता है। मॉडल एक जटिल "widely-linear" संरचना का उपयोग करता है, जिसका अर्थ है कि प्रत्येक एकल गणितीय ऑपरेशन के लिए, कंप्यूटर को वास्तव में आठ छोटे उप-ऑपरेशनों (sub-operations) को करना होता है।

यदि आप कंप्यूटर को ये आठ चरण एक-एक करके करने के लिए कहते, तो यह धीमा होता क्योंकि यह उन्हीं सामग्रियों (डेटा) को बार-बार लेने के लिए गोदाम तक बार-बार दौड़ता।

FairyFuse वह जीनियस असेंबली लाइन है जो इसे ठीक करती है।

  1. Fusion (फ्यूजन): ट्रक को 8 बार भेजने के बजाय, यह ट्रक को एक बार लोड करता है और सभी 8 ऑपरेशनों को एक ही, सुपर-फास्ट लूप में करता है।
  2. Masked Operations (मास्क्ड ऑपरेशन्स): यह विशेष CPU निर्देशों (एक मास्टर कुंजी की तरह) का उपयोग करता है ताकि कंप्यूटर को बताया जा सके: "केवल वहीं सामग्री जोड़ें जहाँ स्विच 'ON' है, और जहाँ स्विच 'OFF' है वहाँ घटाएं।"
  3. No Unpacking (कोई अनपैकिंग नहीं): यह कभी भी बक्सों को अनपैक नहीं करता। यह उन्हें उनकी छोटी, संकुचित अवस्था में ही रखता है और सीधे उन्हें प्रोसेस करता है।

परिणाम: यह सब कुछ कैसे बदल देता है

लेखकों ने एक मानक Intel सर्वर (एक "commodity CPU," जिसका अर्थ है एक सामान्य कंप्यूटर, न कि कोई बहुत महंगा AI चिप) पर इसका परीक्षण किया।

  • गति: यह CPU पर गणित करने के पुराने तरीके की तुलना में 30 गुना तेज़ है।
  • तुलना: यह वर्तमान उद्योग मानक (llama.cpp) को 1.24x से पछाड़ देता है, भले ही यह कम मेमोरी का उपयोग करता है।
  • गुणवत्ता: AI अपने पूर्ण आकार वाले संस्करण जितना ही स्मार्ट है। संपीड़न के कारण यह "मूर्ख" नहीं हुआ।
  • ट्विस्ट: आश्चर्यजनक रूप से, यह GPUs की तुलना में CPUs पर बेहतर काम करता है।
    • क्यों? GPUs विशाल बैंडविड्थ वाले सुपर-हाईवे की तरह हैं। उन्हें ट्रैफिक जाम की उतनी चिंता नहीं होती। लेकिन CPUs संकरी शहर की सड़कों की तरह हैं। बक्सों को इतना छोटा करके और "असेंबली" चरण को हटाकर, FairyFuse CPU पर ट्रैफिक जाम को पूरी तरह से साफ कर देता है। GPU पर, हाईवे पहले से ही इतना चौड़ा है कि बक्सों को छोटा करने से ज्यादा फर्क नहीं पड़ता, और वहां विशेष "स्विच-फ्लिपिंग" निर्देश उतने कुशल नहीं होते।

सारांश

FairyFuse सामान्य कंप्यूटरों पर AI चलाने का एक नया तरीका है। यह एक मॉडल लेता है, गणित को सरल "जोड़ें, घटाएं, या अनदेखा करें" चरणों में सिकोड़ देता है, और उन्हें बिना किसी जटिल गुणा के प्रोसेस करने के लिए एक सुपर-कुशल असेंबली लाइन बनाता है।

रूपक (Metaphor):

  • पुराना तरीका: एक डिलीवरी ड्राइवर जो हर घर पर पैकेज को तौलने, टैक्स की गणना करने और फिर उसे डिलीवर करने के लिए रुकता है। (धीमा, भारी गणित)।
  • FairyFuse: एक डिलीवरी ड्राइवर जो जानता है कि किन घरों को एक पैकेज चाहिए, किन घरों को वापसी (return) चाहिए, और किन्हें कुछ भी नहीं चाहिए। वे एक सरल सूची के आधार पर सामान छोड़ते या उठाते हुए, बिना गणित किए, पूरी गति से मोहल्ले में घूमते हैं।

यह हमें बिना किसी बड़े, महंगे सुपरकंप्यूटर की आवश्यकता के अपने लैपटॉप और निजी सर्वरों पर शक्तिशाली AI असिस्टेंट चलाने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →