← أحدث الأبحاث
🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

تقدم هذه الورقة البحثية LlamaWeb، وهو خلفية (backend) لـ WebGPU لـ llama.cpp يحقق استنتاجاً للنماذج اللغوية الكبيرة (LLM) بكفاءة في الذاكرة، وقابلية للأداء المتنقل، وتعدد الدقة في المتصفحات من خلال الاستفادة من التخطيط الساكن للذاكرة، ومكتبة نوى (kernel library) قابلة للضبط، ونوى GPU تعتمد على القوالب (templated GPU kernels)، مما يؤدي إلى تقليل استخدام الذاكرة بشكل كبير وزيادة إنتاجية فك التشفير (decode throughput) مقارنة بالأطر البرمجية الحالية عبر مختلف الأجهزة.

المؤلفون الأصليون: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تشغيل مساعد ذكاء اصطناعي فائق الذكاء (نموذج لغوي كبير، أو LLM) مباشرة داخل متصفح الويب الخاص بك، مثل Chrome أو Safari. عادةً ما تكون هذه الأدمغة الاصطناعية ضخمة جداً وتلتهم الكثير من الذاكرة، مما يتطلب خوادم هائلة ومكلفة لتشغيلها. الهدف من هذه الورقة البحثية هو تقليص حجم هذا الدماغ العملاق ليتناسب مع جهاز الكمبيوتر المحمول أو الهاتف الخاص بك دون أن يتسبب في تعطل المتصفح، مع الحفاظ على السرعة والخصوصية.

لقد بنى المؤلفون أداة جديدة تسمى LlamaWeb. فكر فيها كـ "مترجم" متخصص يسمح لمحرك الذكاء الاصطناعي الشهير llama.cpp بالتحدث بلغة متصفحات الويب (وتحديداً تقنية تسمى WebGPU).

إليك كيف حلوا المشكلات الثلاث الكبرى، باستخدام بعض التشبيهات من الحياة اليومية:

1. مشكلة الذاكرة: "شاحنة النقل مقابل قائمة التعبئة"

المشكلة: كانت أدوات الذكاء الاصطناعي الموجودة في المتصفحات تشبه شركة نقل فوضوية؛ حيث كانت تستمر في التقاط صناديق جديدة (ذاكرة) أثناء العمل، وأحياناً تلتقط الكثير منها، مما يؤدي إلى تعطل المتصفح أو بطئه الشديد. كما كانت تقوم بعمل نسخ غير ضرورية من الأثاث (أوزان النموذج) قبل نقله.

حل LlamaWeb:

  • التخطيط الثابت: بدلاً من التقاط الصناديق أثناء الحركة، يقوم LlamaWeb بفحص المنزل بالكامل قبل وصول الشاحنة ويحسب بالضبط عدد الصنوقات التي يحتاجها. إنه يجهز كل شيء في "ساحة ذاكرة" واحدة محددة الحجم مسبقاً منذ البداية. لا مزيد من التقاط صناديق إضافية في منتصف عملية النقل.
  • التحميل المباشر: بدلاً من تفريغ الأثاث في الممر (ذاكرة وحدة المعالجة المركزية CPU) ثم تحميله في الشاحنة (ذاكرة وحدة معالجة الرسومات GPU)، يقوم LlamaWeb بتحميل الأثاث مباشرة من المستودع إلى الشاحنة.
  • النتيجة: وجدوا أن LlamaWeb يستخدم ذاكرة أقل بنسبة 29-33% من منافسيه. الأمر يشبه وضع غرفة معيشة كاملة في شاحنة صغيرة كانت في السابق لا تتسع إلا لأريكة واحدة.

2. مشكلة الأداء: "الريموت كنترول الشامل مقابل الريموت المخصص"

المشكلة: الإنترنت مليء بأجهزة كمبيوتر مختلفة: بعضها يحتوي على بطاقات رسوميات من NVIDIA، وبعضها يحتوي على شرائح Apple، وبعضها في الهواتف، وبعضها في أجهزة الكمبيوتر المحمولة. كانت الأدوات الحالية تشبه "الريموت كنترول الشامل" الذي يحاول العمل على كل شيء ولكنه لا يستخدم الأزرار الخاصة بكل تلفاز، مما يؤدي إلى أداء بطيء.

حل LlamaWeb:

  • النوى القابلة للضبط (Tunable Kernels): LlamaWeb يشبه ريموت ذكي يمكنه إعادة برمجة نفسه. عند بدء التشغيل، يتحقق مما هو نوع "التلفاز" (الأجهزة) الذي يعمل عليه. إذا كان يعمل على بطاقة NVIDIA قوية، فإنه يستخدم ميزات "المجموعات الفرعية" عالية السرعة. وإذا كان يعمل على هاتف، فإنه ينتقل إلى وضع أكثر كفاءة.
  • النتيجة: على أربعة أنواع مختلفة من بطاقات الرسوميات، كان LlamaWeb أسرع بنسبة 45-69% في توليد النصوص (مرحلة التشفير/decoding) من غيره من أدوات المتصفح. إنه ليس مجرد ريموت شامل، بل هو ريموت يعرف تماماً كيف يستخرج أفضل صورة من تلفازك الخاص.

3. مشكلة التنسيق: "السكين السويسري"

المشكلة: يبتكر مطورو الذكاء الاصطناعي باستمرار طرقاً جديدة لضغط نماذج الذكاء الاصطناعي (تسمى التكميم/quantization) لجعلها أصغر. بعضها يكون بـ 4 بت، وبعضها 8 بت، وبعضها 1 بت. كانت الأدوات القديمة تشبه مفك براغي لا يناسب إلا نوعاً واحداً من البراغي؛ فإذا ظهر برغي جديد، تصبح الأداة عديمة الفائدة.

حل LlamaWeb:

  • النوى القائمة على القوالب (Templated Kernels): تم بناء LlamaWeb مثل السكين السويسري. لديه نظام "قوالب" يمكنه تبديل رأس الأداة فوراً ليناسب أي نوع من البراغي (تنسيق التكميم) دون الحاجة إلى إعادة بناء السكين بالكامل.
  • النتيجة: يدعم 23 تنسيقاً مختلفاً للأوزان، بينما يدعم المنافسون 6 أو 7 فقط. هذا يعني أنه إذا اخترع مطور طريقة ضغط جديدة فائقة الكفاءة غداً، فيمكن لـ LlamaWeb تشغيلها على الأرجح فوراً دون الحاجة إلى تحديث للبرامج.

النتائج الكلية

اختبر الفريق هذا على 16 جهازاً مختلفاً من 8 شركات مصنعة مختلفة (بما في ذلك NVIDIA، وApple، وIntel، وAMD، ورقائق الهواتف المحمولة).

  • الذاكرة: وفر كمية هائلة من ذاكرة الوصول العشوائي (RAM)، مما منع حالات التعطل على الأجهزة ذات الذاكرة المحدودة (مثل هواتف iPhone).
  • السرعة: كان أسرع بشكل ملحوظ من أدوات الذكاء الاصطناعي الأخرى التي تعمل عبر المتصفح.
  • تعدد الاستخدامات: يمكنه تشغيل أي نموذج يدعمه مجتمع llama.cpp تقريباً، وهو مكتبة ضخمة تضم أكثر من 177,000 نموذج.

ملاحظة واحدة: بينما يعد LlamaWeb بطلاً في توليد النصوص كلمة بكلمة (مرحلة التشفير/decode)، إلا أنه حالياً أبطأ قليلاً في قراءة المطالبة الأولية (مرحلة التجهيز/prefill) مقارنة ببعض المنافسين. ومع ذلك، يشير المؤلفون إلى أنه مع تحسن تقنيات المتصفح، من المتوقع أن تتقلص هذه الفجوة.

باختختصار، LlamaWeb هو محرك جديد يجعل تشغيل الذكاء الاصطناعي القوي في متصفحك أمراً ممكناً، وخصوصياً، وفعالاً، مما يضمن عدم احتراق جهاز الكمبيوتر الخاص بك أثناء الدردشة مع الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →