← नवीनतम पेपर
🤖 AI

BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

यह शोध पत्र BaseRT को पेश करता है, जो Apple Silicon के लिए एक नेटिव Metal इन्फरेंस रनटाइम है जो बड़े भाषा मॉडलों (LLMs) के लिए रिकॉर्ड-तोड़ थ्रूपुट प्राप्त करने के लिए चिप-विशिष्ट अनुकूलनों का लाभ उठाता है, जो llama.cpp और MLX जैसे मौजूदा फ्रेमवर्कों से 1.56x तक बेहतर प्रदर्शन करता है।

मूल लेखक: Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ BaseRT पेपर का स्पष्टीकरण दिया गया है, जिसे रोज़मर्रा की भाषा में कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

मुख्य विचार: एक कस्टम रेस कार बनाना

कल्पना कीजिए कि आप एक बहुत ही विशिष्ट ट्रैक (Apple Silicon चिप्स जैसे M3 या M4) पर एक रेस कार (एक लार्ज लैंग्वेज मॉडल, या LLM) चलाना चाहते हैं।

वर्तमान में, अधिकांश लोग इन कारों को एक "यूनिवर्सल अडैप्टर" या "रेंटल कार किट" (मौजूदा सॉफ़्टवेयर जैसे llama.cpp या MLX) का उपयोग करके चलाते हैं। ये किट बेहतरीन हैं क्योंकि वे कई अलग-अलग ट्रैक्स पर काम करती हैं, लेकिन वे इस विशेष एप्पल ट्रैक के लिए पूरी तरह से ट्यून नहीं की गई हैं। उनमें अतिरिक्त वजन, अनावश्यक चरण और एक ऐसा ड्राइवर है जो शॉर्टकट नहीं जानता।

BaseRT एक नई, कस्टम-निर्मित रेस कार है जिसे केवल एप्पल ट्रैक के लिए डिज़ाइन किया गया है। Base Compute की टीम ने भारी अडैप्टर्स को हटा दिया और एक ऐसा वाहन बनाया है जो ट्रैक के अनूठे घुमावों और नियमों से मेल खाता है। परिणाम? यह काफी तेज़ी से चलता है।

समस्या: मौजूदा सॉफ़्टवेयर "धीमा" क्यों है?

पेपर का तर्क है कि मैक पर AI चलाने के लिए मौजूदा सॉफ़्टवेयर एक डिलीवरी ट्रक की तरह है जो बहुत अधिक स्टॉप लेता है।

  • "मिडलमैन" (बिचौलिया) की समस्या: अधिकांश सॉफ़्टवेयर कंप्यूटर के ग्राफिक्स चिप (GPU) से बात करने के लिए एक "फ्रेमवर्क" (एक बिचौलिये की तरह) का उपयोग करता है। यह बिचौलिया अतिरिक्त चरण जोड़ता है, जैसे हर एक कार्य से पहले क्लिपबोर्ड चेक करता हुआ एक मैनेजर।
  • "मेमोरी" की समस्या: एप्पल कंप्यूटरों में एक विशेष सुविधा होती है जिसे "यूनिफाइड मेमोरी" कहा जाता है, जहाँ CPU और GPU एक ही बड़ी RAM साझा करते हैं। मौजूदा सॉफ़्टवेयर अक्सर उनके साथ ऐसा व्यवहार करता है जैसे वे अलग-अलग कमरों में हों, जिससे डेटा को अनावश्यक रूप से इधर-उधर जाने के लिए मजबूर होना पड़ता है।

समाधान: BaseRT कैसे काम करता है

BaseRT बिचौलिये को हटा देता है और मस्तिष्क और मांसपेशियों के बीच एक सीधा हाईवे बनाता है। यहाँ चार मुख्य तरीके दिए गए हैं जिनका उन्होंने उपयोग किया है:

  1. "डेटा-ड्रिवन" ब्लूप्रिंट:
    हर अलग AI मॉडल (जैसे Qwen, Llama, या Gemma) के लिए नए निर्देशों का सेट लिखने के बजाय, BaseRT एक एकल, लचीला ब्लूप्रिंट उपयोग करता है। इसे एक यूनिवर्सल रिमोट कंट्रोल की तरह समझें जो स्वचालित रूप से पहचान लेता है कि आप किस टीवी की ओर इशारा कर रहे हैं और तुरंत उसके बटन बदल देता है, बजाय इसके कि हर ब्रांड के लिए अलग रिमोट की आवश्यकता हो। यह इंजन को पुनर्गठित करने के लिए रुके बिना सुचारू रूप से चलता रहता है।

  2. "जीरो-स्टॉप" लूप:
    जब आप AI को एक वाक्य लिखने के लिए कहते हैं, तो वह एक बार में एक शब्द उत्पन्न करता है। पुराने सॉफ़्टवेयर में, कंप्यूटर को हर नए शब्द के निर्माण के लिए एक पार्किंग स्पॉट (मेमोरी एलोकेशन) खोजना पड़ता है। BaseRT रेस शुरू होने से पहले ही सभी स्पॉट्स को पहले से पार्क कर देता है। एक बार जब AI बोलना शुरू करता है, तो वह पार्किंग स्पॉट खोजने के लिए कभी नहीं रुकता; वह बस दौड़ता रहता है। यह मेमोरी मैनेजमेंट के कारण होने वाले "ट्रैफिक जाम" को समाप्त करता है।

  3. "फ्यूजन" किचन:
    आमतौर पर, एक AI को अलग-अलग बर्तनों (मैट्रिक्स मल्टीप्लिकेशन, अटेंशन, नॉर्मलाइजेशन) में सामग्री पकाने और फिर भोजन को उनके बीच ले जाने की आवश्यकता होती है। BaseRT इन चरणों को एक विशाल बर्तन में मिला (fuse) देता है। यह सामग्री को एक ही गति में एक साथ पकाता है, जिससे भोजन को इधर-उधर ले जाने में लगने वाला समय बच जाता है।

  4. "कस्टम ड्राइवर":
    सॉफ्टवेयर ठीक जानता है कि यह किस एप्पल चिप (M1, M2, M3, आदि) पर चल रहा है। यह इंजन के आकार के आधार पर अपनी ड्राइविंग शैली को समायोजित करता है, जिससे यह सुनिश्चित होता है कि वह ईंधन की हर बूंद से अधिकतम शक्ति प्राप्त करे।

परिणाम: दौड़ कौन जीता?

टीम ने अपने दो सबसे बड़े प्रतिस्पर्धियों के विरुद्ध BaseRT का परीक्षण किया: llama.cpp (सबसे लोकप्रिय ओपन-सोर्स रनर) और MLX (एप्पल का अपना आधिकारिक फ्रेमवर्क)।

  • गति: BaseRT लगभग हर टेस्ट में सबसे तेज़ था।
    • छोटे मॉडल्स पर, यह llama.cpp से 1.56 गुना तेज़ तक था।
    • बड़े "मिक्सचर-ऑफ-एक्सपर्ट्स" मॉडल्स (जटिल AI दिमाग) पर, यह शुरुआती प्रॉम्प्ट को प्रोसेस करने में 1.78 गुना तेज़ था।
  • "स्मॉल मॉडल" का स्वीट स्पॉट: सबसे बड़ी जीत छोटे मॉडल्स पर हुई। ऐसा इसलिए है क्योंकि, छोटे मॉडल्स पर, "ओवरहेड" (प्रशासनिक कार्यों पर बर्बाद होने वाला समय) कुल समय का एक बड़ा हिस्सा होता है। उस बर्बादी को काटकर, BaseRT ने एक बड़ा अंतर पैदा किया।
  • "बिग मॉडल" की वास्तविकता: बहुत बड़े मॉडल्स पर, गति मुख्य रूप से इस बात से सीमित होती है कि डेटा मेमोरी के माध्यम से कितनी तेज़ी से चल सकता है (बैंडविड्थ)। एक आदर्श इंजन के साथ भी, आप सड़क की स्पीड लिमिट से तेज़ नहीं जा सकते। हालाँकि, BaseRT अभी भी यहाँ अतिरिक्त गति निकालने में सफल रहा, जिससे साबित हुआ कि पिछला सॉफ़्टवेयर सड़क का कुशलतापूर्वक उपयोग नहीं कर रहा था।

यह क्यों मायने रखता है? (द "एज" शिफ्ट)

पेपर सुझाव देता है कि हम एक ऐसे भविष्य की ओर बढ़ रहे हैं जहाँ AI आपके अपने डिवाइस (आपके लैपटॉप या फोन) पर चलता है, न कि किसी दूर स्थित क्लाउड सर्वर में।

  • प्राइवेसी: आपका डेटा आपके कंप्यूटर को कभी नहीं छोड़ता।
  • गति: इंटरनेट के माध्यम से अपने अनुरोध को वापस भेजने और प्राप्त करने के लिए प्रतीक्षा करने की कोई आवश्यकता नहीं है।
  • लागत: आप प्रति शब्द मासिक शुल्क नहीं देते हैं; आप बस हार्डवेयर के लिए एक बार भुगतान करते हैं।

BaseRT साबित करता है कि एप्पल सिलिकॉन स्थानीय रूप से AI चलाने के लिए हमारी सोच से कहीं अधिक शक्तिशाली है, यदि आप विशेष रूप से इसके लिए बने सॉफ़्टवेयर का उपयोग करते हैं।

BaseRT क्या नहीं करता है (सीमाएँ)

पेपर इस बारे में ईमानदार है कि यह उपकरण अभी क्या नहीं है:

  • केवल सिंगल यूजर: यह एक समय में एक व्यक्ति द्वारा AI का उपयोग करने के लिए डिज़ाइन किया गया है। यह सैकड़ों लोगों के एक साथ सवाल पूछने (सर्वर लोड) को हैंडल नहीं करता है।
  • केवल एप्पल: यह केवल Macs और iPads पर काम करता है। यह अभी Windows, Android, या NVIDIA ग्राफिक्स कार्ड पर काम नहीं करता है।
  • अभी "विज़न" नहीं है: यह वर्तमान में टेक्स्ट मॉडल्स को संभालता है, इमेज देख सकने वाले मॉडल्स को नहीं।

निचोड़ (The Bottom Line)

लेखकों ने एक कस्टम इंजन (BaseRT) बनाया है जो एप्पल कंप्यूटरों पर AI चलाने से सभी अनावश्यक बोझ को हटा देता है। ऐसा करके, उन्होंने हार्डवेयर की पूर्ण गति क्षमता को अनलॉक कर दिया है, जिससे स्थानीय AI पहले से कहीं अधिक तेज़, निजी और कुशल हो गया है। आप इसे GitHub पर स्वयं आज़मा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →