← أحدث الأبحاث
🤖 machine learning

RAP: Runtime Adaptive Pruning for LLM Inference

تقدم هذه الورقة RAP، وهو إطار عمل مدفوع بالتعلم المعزز يعمل على تكييف استراتيجيات تقليم استنتاج النماذج اللغوية الكبيرة ديناميكيًا في الوقت الفعلي من خلال التحسين المشترك لأوزان النموذج والاحتفاظ بذاكرة التخزين المؤقت لـ KV لتعظيم المنفعة في ظل ميزانيات ذاكرة وظروف عمل متغيرة.

المؤلفون الأصليون: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعد مكتبة ذكي للغاية وضخم، (نموذج لغوي كبير - LLM)، يمكنه كتابة القصص، والإجابة على الأسئلة، وحل المشكلات. لكن هناك عقبة: هذا المساعد ضخم جداً لدرجة أنه يتطلب مستودعاً مليئاً بالأرفف (الذاكرة) وفريقاً هائلاً من العمال (قدرة الحوسبة) لمجرد تشغيله.

إذا حاولت تشغيل هذا المساعد على جهاز صغير، مثل هاتف ذكي أو كمبيوتر محمول، فإنه غالباً ما يتعطل لأنه ينفد منه المساحة أو يصبح بطيئاً جداً.

المشكلة: خطأ "المقاس الواحد الذي يناسب الجميع"

في الوقت الحالي، يحاول معظم الناس تقليص حجم هذا المساعد الضخم عن طريق حذف أجزاء منه بشكل دائم، مثل إزالة بعض الأرفف أو تسريح بعض العمال بناءً على قاعدة ثابتة. يقولون: "حسناً، سنقوم دائماً بقطع 30% من المكتبة".

هذه الورقة البحثية تجادل بأن هذه فكرة سيئة لأن احتياجات المكتبة تتغير كل يوم.

  • السيناريو (أ): يسأل المستخدم سؤالاً قصيراً جداً. يحتاج المساعد فقط إلى مساحة ضئيلة لتذكر المحادثة.
  • السيناريو (ب): يطلب مستخدم من المساعد كتابة رواية مكونة من 10,000 كلمة. فجأة، يحتاج المساعد إلى مساحة هائلة فقط لاستيعاب "مسودة العمل" (التي تسمى KV cache) حيث يحتفظ بتتبع أحداث القصة حتى الآن.

إذا قمت بقطع 30% من دماغ المساعد بشكل دائم ليتناسب مع هاتف، فقد يؤدي ذلك إلى تعطل عمله عندما يطرح شخص ما سؤالاً طويلاً. وإذا لم تقطع أي شيء، فلن يتسع له الهاتف على الإطلاق. الطرق الموجودة حالياً تشبه درعاً صلباً: إما أن يكون ثقيلاً جداً بحيث لا تستطيع ارتداءه، أو إذا قمت بقص جزء منه لتجعله أخف، فستبقى مكشوفاً.

الحل: RAP (التقليم التكيفي في وقت التشغيل)

تقترح الورقة نظام RAP، وهو يشبه منح المساعد بدلة ذكية ومرنة تغير شكلها في الوقت الفلي.

بدلاً من قص أجزاء من المساعد لمرة واحدة وللأبد، يستخدم RAP عميلاً يعتمد على التعلم التعزيزي (RL). فكر في هذا العميل كأنه منظم حركة مرور عالي المهارة أو مدير مسرح.

  1. يراقب الحشود: قبل أن يبدأ المساعد في العمل، ينظر العميل إلى الطلب المحدد. هل هو سؤال قصير؟ أم قصة طويلة؟ هل ذاكرة الهاتف ممتلئة لأن تطبيقاً آخر يعمل؟
  2. يتخذ قرارات فورية: بناءً على ما يراه، يقرر العميل في تلك اللحظة تحديداً ما الذي يجب إخفاؤه مؤقتاً.
    • إذا كان الطلب قصيراً والذاكرة ضيقة، فقد يقوم بإخفاء بعض أجزاء "التفكير" الثقيلة (طبقات FFN) لتوفير المساحة.
    • إذا كان الطلب طويلاً والذاكرة ممتلئة، فقد يقوم بإخفاء بعض أجزاء "الانتباه" (طبقات MHA) التي تُستخدم لتتبع القصة الطويلة.
  3. يحتفظ بأفضل الأجزاء: يدرك العميل أن ليست كل أجزاء الدماغ متساوية في الأهمية؛ فبعض الطبقات أكثر أهمية لمهام معينة. لذلك، يستخدم "ماسحاً للأهمية" خاصاً (يسمى Greedy Sequential Importance) لمعرفة الأجزاء التي يمكن إخفاؤها بأمان دون إفساد الإجابة.

كيف يعمل (التشبيه)

تخيل أنك تجهز حقيبة سفر لرحلة، لكنك لا تعرف حالة الطقس بعد.

  • الطريقة القديمة: تقرر دائماً ترك معطف الشتاء الثقيل وملابس السباحة في المنزل. إذا أمطرت، فستبتل، وإذا كان الجو مشمساً، فلن تجد ملابس للسباحة.
  • طريقة RAP: لديك مساعد آلي ذكي.
    • تخبره: "لدي حقيبة صغيرة (حد الذاكرة) وسأذهب إلى الشاطئ (محادثة طويلة)".
    • يقوم الروبوت فوراً باستبدال معطفك الثقيل بقميص خفيف ويحتفظ بملابس السبح.
    • تخبره: "لدي حقيبة صغيرة وسأذهب إلى الجبل (محادثة قصيرة)".
    • يقوم الروبوت باستبدال ملابس السباح بـ قبعة دافئة.

يتعلم الروبوت من الخبرة (التعلم التعزيزي) ليقوم بعملية الاستبدال المثالية في كل مرة، مما يضمن لك التوافق مع حجم الحقيبة ولكن مع امتلاك ما تحتاجه بالضبط للرحلة المحددة.

ما وجدوه

اختبرت الورقة هذا "الروبوت الذكي" على عدة نماذج ذكاء اصطناي شهيرة (مثل Llama و Qwen).

  • نتائج أفضل: عندما كانت الذاكرة ضيقة، حافظ نظام RAP على عمل الذكاء الاصطناعي بشكل أفضل بكثير من طرق "القص الثابت" القديمة. لم يتعطل النظام، وظلت الإجابات ذكية.
  • المرونة: تعامل النظام مع أنواع مختلفة من الطلبات (قصيرة مقابل طويلة) دون الحاجة إلى إعادة ضبط من قبل البشر.
  • السرعة: كان "الروبوت" الذي يتخذ القرارات سريعاً وصغيراً جداً لدرجة أنه لم يبطئ العملية على الإطلاق؛ فلم يضف أي وقت إضافي يذكر إلى المحادثة.

الخلاصة

إن RAP هو طريقة جديدة لتشغيل نماذج الذكاء الاصطناي الكبيرة على الأجهزة الصغيرة. فبدلاً من قطع أجزاء من الذكاء الاصطناي بشكل دائم، يقوم RAP بإعادة تشكيل الذكاء الاصط-ني ديناميكياً أثناء التشغيل، محتفظاً فقط بالأجزاء المطلوبة للمهمة المحددة والمساحة المتاحة. إنه الفرق بين ارتداء بدلة صلبة وثقيلة وبين ارتداء بدلة ذكية ومرنة تتكيف مع ما تفعله في ذلك اليوم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →