Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU
यह शोध पत्र LlamaWeb प्रस्तुत करता है, जो llama.cpp के लिए एक WebGPU बैकएंड है जो स्टैटिक मेमोरी प्लानिंग, एक ट्यूनेबल कर्नेल लाइब्रेरी और टेम्पलेटेड GPU कर्नेल का उपयोग करके ब्राउज़रों में मेमोरी-कुशल, प्रदर्शन-पोर्टेबल और मल्टी-प्रिसिजन LLM इन्फरेंस प्राप्त करता है, जिसके परिणामस्वरूप विविध हार्डवेयर पर मौजूदा फ्रेमवर्क की तुलना में मेमोरी के उपयोग में उल्लेखनीय कमी और डिकोड थ्रूपुट में वृद्धि होती है।