🤖 machine learning
Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU
تقدم هذه الورقة البحثية LlamaWeb، وهو خلفية (backend) لـ WebGPU لـ llama.cpp يحقق استنتاجاً للنماذج اللغوية الكبيرة (LLM) بكفاءة في الذاكرة، وقابلية للأداء المتنقل، وتعدد الدقة في المتصفحات من خلال الاستفادة من التخطيط الساكن للذاكرة، ومكتبة نوى (kernel library) قابلة للضبط، ونوى GPU تعتمد على القوالب (templated GPU kernels)، مما يؤدي إلى تقليل استخدام الذاكرة بشكل كبير وزيادة إنتاجية فك التشفير (decode throughput) مقارنة بالأطر البرمجية الحالية عبر مختلف الأجهزة.
Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen2026-05-21