← أحدث الأبحاث
🤖 machine learning

Lever: Speculative LLM Inference on Smartphones

تقدم هذه الورقة نظام Lever، وهو نظام متكامل (end-to-end) يعمل على تحسين فك التشفير الاستنتاجي (speculative decoding) عبر مراحل الصياغة والتحقق والتنفيذ لتمكين استدلال النماذج اللغوية الكبيرة بكفاءة وزمن انتقال منخفض على الهواتف الذكية من خلال الاستفادة من ذاكرة التخزين الوميضي (flash storage) وقيود الأجهزة المحمولة.

المؤلفون الأصليون: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

المشكلة الكبرى: "حقيبة ثقيلة" على "دراجة هوائية"

تخيل أنك تريد ركوب دراجة هوائية (هاتفك الذكي) لقطع مسافة طويلة عبر البلاد. لديك حقيبة سفر عالية الجودة وثقيلة جداً (نموذج لغوي كبير قوي أو LLM) تحتوي على كل المعرفة التي تحتاجها.

  • المشكلة: الدراجة لديها سلة صغيرة (ذاكرة الهاتف السريعة، أو DRAM). هذه السلة لا يمكنها استيعاب الحقيبة بأكملها.
  • الحل المؤقت الحالي: عليك إبقاء الحقيبة في صندوق السيارة (ذاكرة التخزين البطيئة في الهاتف - Flash Storage). في كل مرة تحتاج فيها إلى اتخاذ خطوة (توليد كلمة)، يتعين عليك التوقف، وفتح الصندوق، وسحب الصفحة المحددة التي تحتاجها، وقراءتها، ثم إعادتها. هذا "التوقف والتحرك" بطيء للغاية. الأمر يشبه محاولة ركوب دراجة بينما تضطر للتوقف باستمرار للبحث داخل صندوق السيارة.

الفكرة: "التخمين" لتوفير الوقت

يقدم البحث نظاماً يسمى Lever. وهو يستخدم حيلة تسمى التوليد الاستنباطي (Speculative Decoding).

فكر في الأمر كأنه لعبة تخمين:

  1. المساعد الصغير (نموذج المسودة - Draft Model): لديك مساعد صغير وسريع يجلس في سلة الدراجة (في الذاكرة السريعة). هذا المساعد جيد في تخمين ما سيأتي لاحقاً.
  2. الرئيس الكبير (النموذج المستهدف - Target Model): الحقيبة الثقيلة في صندوق السيارة هي "الرئيس الكبير". إنه ذكي جداً ولكنه بطيء في الوصول إليه.
  3. الاستراتيجية: بدلاً من سؤال الرئيس الكبير عن كلمة واحدة في كل مرة، يقوم المساعد الصغير بتخمين جملة كاملة بسرعة (أو شجرة من الجمل المحتملة). بعد ذلك، تفتح الصندوق مرة واحدة فقط لتسأل الرئيس الكبير: "هل كانت تخميناتي صحيحة؟"

إذا قال الرئيس الكبير: "نعم، الكلمات الثلاث الأولى صحيحة"، فستحصل على ثلاث كلمات مقابل رحلة واحدة فقط إلى الصندوق. هذا يوفر قدراً هائلاً من الوقت.

العقبات الثلاث (وكيف يحلها Lever)

أدرك المؤلفون أنه بينما تعمل فكرة "التخمين" هذه بشكل رائع على الخوادم القوية، إلا أنها تفشل في الهواتف لثلاثة أسباب محددة. إليك كيف يعالجها Lever:

1. معضلة "حجم الشجرة" (التدريف - Drafting)

  • المشكلة: إذا خمن المساعد الصغير كلمات قليلة جداً، فستضطر لفتح الصندوق كثيراً. وإذا خمن كلمات كثيرة جداً، فإن عقل الهاتف سيصاب بالإرهاق أثناء محاولة التحقق من كل تلك التخمينات، مما يؤدي إلى تباطؤه.
  • حل Lever: يعمل Lever مثل بستاني ذكي. فهو لا ينمي مجرد شجيرة عشوائية من التخمينات، بل يحسب بعناية: "هل يستحق هذا الفرع من التخمينات هذا الجهد؟" هو ينمي فقط الفروع التي من المرجح قبولها ولن تكلف الكثير من الطاقة للتحقق منها. إنه يبني "شجرة تخمينات ذات حجم مثالي" توازن بين السرعة والدقة.

2. مشكلة "الجهد الضائع" (التحقق - Verification)

  • المشكلة: حتى مع وجود شجرة جيدة، قد يضطر الرئيس الكبير إلى فحص فرع يتبين لاحقاً أنه خاطئ. وفي الهاتف، يعد فحص فرع خاطئ هدراً للبطارية والوقت الثمينين.
  • حل Lever: يقوم Lever بتعيين شرطي مرور (متنبئ خفيف الوزن) في منتصف عملية تفكير الرئيس الكبير. قبل أن ينهي الرئيس الكبير قراءة الجملة بأكملها، ينظر شرطي المرور إلى القرائن ويقول: "مهلاً، هذا الفرع يبدو خاطئاً، توقف عن فحصه!" هذا يحمي الهاتف من القيام بعمل غير ضروري، لكنه حذر بما يكفي لعدم رمي أي إجابة صحيحة.

3. مشكلة "عدم التوافق مع الأدوات" (التنفيذ - Execution)

  • المشكلة: تمتلك الهواتف الذكية أنواعاً مختلفة من "الأدمغة" (وحدات المعالجة المركزية CPU ووحدات المعالجة العصبية NPU). وحدة المعالجة العصبية (NPU) رائعة في القيام بالعمليات الحسابية لأشياء كثيرة في وقت واحد، لكنها تكره المهام الغريبة وغير المنتظمة. وألعاب التخمين غالباً ما تكون غير منتظمة.
  • حل Lever: يعمل Lever كـ مدير مشروع ذكي. فهو يعرف متى يستخدم الـ NPU السريع ومتى يستخدم الـ CPU المرن.
    • يقوم بتجميع التخمينات المتشابهة معاً لكي تعمل الـ NPU بكفاءة (مثل خط تجميع في مصنع).
    • يترك عملية "اتخاذ القرار النهائي" (تحديد الكلمة التي سيتم اختيارها فعلياً) للـ CPU، حتى لا تستهلك الـ NPU الطاقة في حساب إجابات للمسارات التي لن تُستخدم أبداً.

النتائج

اختبر البحث نظام Lever على هواتف ذكية حقيقية (مثل OnePlus 12) مع نماذج ذكاء اصطناعي متنوعة.

  • مقارنة بالطريقة القديمة (فتح الصندوق لكل كلمة على حدة): Lever أسرع بمقدار 2.93 مرة.
  • مقارنة بطرق التخمين الأخرى المصممة للخوادم: Lever أسرع بمقدار 1.50 مرة.

الخلاصة

Lever هو نظام يسمح لهاتفك بتشغيل نماذج ذكاء اصطناعي ضخمة وذكية دون أن يتوقف عن العمل أو يتجمد. يفعل ذلك باستخدام نموذج "تخمين" صغير وسريع للقيام بالعمل الشاق، مع إدارة دقيقة للنموذج الثقيل والبطيء لضمان عدم إضاعة الوقت أو البطارية. إنه يحول عملية "التوقف والتحرك" البطيئة إلى رحلة سلسة وفعالة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →