← أحدث الأبحاث
💻 computer science

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

تقترح الورقة البحثية استراتيجية "قبل بارك فيرميه" (BPF)، وهي استراتيجية تقليم مبتكرة تقوم بضغط النموذج بشكل تكراري أثناء التعلم التعزيزي لتحسين وحدات التحكم في النماذج اللغوية الكبيرة المتجسدة للقيادة الذاتية، محققةً توازناً فائقاً بين الأداء والذاكرة وزيادةً تصل إلى 27% في إنتاجية فك التشفير مقارنةً بالتقليم بعد التدريب أو اختيار نماذج كثيفة أصغر حجماً.

المؤلفون الأصليون: Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

نُشر 2026-06-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك سائق روبوت ذكي للغاية ومبهر يُدعى RobotxR1. هذا السائق يعمل بـ "دماغ" يُسمى "نموذج لغوي كبير" (LLM). فكر في هذا الدماغ كأنه مهندس فورمولا 1 عالمي قرأ كل كتاب عن القيادة، ويعرف فيزياء كل سيارة، ويمكنه فهم أي تعليمات تعطيها له باللغة الإنجليزية البسيطة.

ومع ذلك، هناك مشكلة: هذا المهندس "ضخم جدًا". فهو يحمل حقيبة ظهر ضخمة مليئة بالكتب (الذاكرة) ويستغرق وقتًا طويلاً في التفكير قبل إعطاء التعليمات (زمن الاستجابة/Latency). إذا حاولت وضع هذه الحقيبة الثقيلة على سيارة سباق صغيرة وسريعة (الروبوت الفعلي)، ستصبح السيارة بطيئة جدًا في السباق. الأمر يشبه محاولة ركض ماراثون وأنت تحمل بيانو.

المشكلة: متى تقوم بتقليص حجم الدماغ؟

لجعل الروبوت أسرع، يحاول المهندسون عادةً "تقليم" (Pruning) الدماغ. التقليم يشبه تحرير المخطوطة: حيث تقوم بحذف الجمل، أو الفقرات، أو حتى فصول كاملة ليست ضرورية، مما يجعل الكتاب أقصر وأخف وزنًا.

لكن الجزء الصعب هو: متى تقوم بعملية التحرير هذه؟

  1. بعد انتهاء السباق؟ (ما بعد التدريب - Post-training): تقوم بتدريب الدماغ الكامل، وتتركه يتعلم كل شيء، ثم تحاول تقليصه. المشكلة هي أن الدماغ قد حفظ بالفعل الأجزاء الثقيلة "الخاطئة"، وتقليصها قد يؤدي إلى كسر قدرته على القيادة.
  2. قبل بدء التدريب؟ (ما قبل التدريب - Pre-training): تقوم بتقليص الدماغ أولاً، ثم تدربه. المشكلة هي أنك لا تعرف بعد أي الأجزاء هي عديمة الفائدة حقًا حتى يجرب الدماغ القيادة.

الحل: "قبل بارك فيرميه" (Before Parc Fermé - BPF)

يقترح مؤلفو هذه الورقة استراتيجية جديدة تسمى "قبل بارك فيرميه" (BPF).

لفهم الاسم، تخيل سباقات الفورمولا 1. قبل السباق، تدخل السيارات إلى "بارك فيرميه" (مرآب مغلق) حيث يتم إغلاقها بإحكام. لا يُسمح لأي شخص بلمس أو تعديل السيارات بعد ذلك. السيارة التي تدخل المرآب هي نفسها التي ستشارك في السباق.

في عالم تدريب الذكاء الاصطناعي، "البارك فيرميه" هو اللحظة التي ينتهي فيها التدريب ويتم قفل النموذج في مكانه. يجادل المؤلفون بأنه لا ينبغي لك الانتظار حتى يتم قفل النموذج في المرآب لتبدأ في تحريره. بد instead، يجب أن تبدأ في التحرير بينما لا تزال السيارة في مرحلة الضبط على الحلبة.

يطلقون على هذا اسم التقليم أثناء التعلم المعزز (RL-Time Pruning).

كيف يعمل: النوعان

تختبر الورقة طريقتين للقيام بهذا التحرير "أثناء التواجد على الحلبة":

  1. BPF-RL (التحرير التكراري): تخيل أن سائق الروبوت يتعلم قيادة حلبة سباق. كل بضع لفات، يتدخل المهندسون، وينظرون في ملاحظات السائق، ويقولون: "أنت لست بحاجة إلى هذه الفقرة المحددة حول ضغط الإطارات؛ دعنا نحذفها". ثم يكمل السائق اللفات القليلة التالية بملاحظات أخف، ويتعلم التكيف مع المعلومات المفقودة فورًا. يكررون هذه العملية حتى تصبح الملاحظات بالحجم المناسب تمامًا.
  2. BPF-SFT/RL (التحرير ذو المرحلتين): أولاً، يقومون بتحرير خفيف بينما يتعلم السائق القواعد الأساسية (الضبط الدقيق الخاضع للإشراف - Supervised Fine-Tuning). ثم، بمج once يبدأ السائق في السباق في عمليات محاكاة في الوقت الفعلي (التعلم المعزز - Reinforcement Learning)، يقومون بالتحرير الثقيل، حيث يحذفون المزيد من الحشو بينما يتفاعل السائق بنشاط مع الحلبة.

النتائج: أخف، أسرع، وأذكى

اختبر الباحثون ذلك على نظام قيادة ذاتية حقيقي يتكون من جزأين:

  • DecisionxR1: "الدماغ" الذي يقرر ما يجب فعله.
  • MPCxR1: "اليدان" اللتان تقودان السيارة فعليًا.

إليك ما وجدوه:

  • مقايضات أفضل: إذا اخترت ببساية دماغًا أصغر وأضعف بطبيعته (نموذج 1.5B) بدلاً من نموذج كبير، فستقود السيارة بشكل أسوأ. ولكن إذا أخذوا الدماغ الكبير واستخدموا طريقة BPF-SFT/RL لتقليصه، فإن "الدماغ الصغير" الناتج كان أفضل بـ 1.69 مرة في تحقيق التوازن بين الحجم والأداء مقارنة بمجرد اختيار الدماغ الصغير منذ البداية. لقد حافظ على "ذكاء" النموذج الكبير ولكن بـ "وزن" النموذج الصغير.
  • السرعة في العالم الحقيقي: عندما وضعوا هذه النماذج على روبوت سيارة حقيقي مجهز بجهاز كمبيوتر Jetson AGX Orin، كانت النماذج المقلمة أسرع بنسبة 27% في توليد التعليمات.
  • فخ "الإطناب" (The Verbose Trap): اكتشفوا التواءً مفاجئًا. أحيانًا، جعل النموذج أصغر لم يجعل النظام بأكمله أسرع. لماذا؟ لأن النموذج الأصغر بدأ أحيانًا في كتابة جمل أطول لشرح قراراته. الأمر يشبه عداءً أخف وزنًا يبدأ في التحدث إلى نفسه طوال الوقت، مما يبطئه. علمهم هذا أنه لا يمكنك فقط النظر إلى حجم النموذج؛ بل يجب عليك مراقبة المسار بأكمله.

الخلاصة

تزعم الورقة أنه بالنسبة للروبوتات التي تحتاج إلى التفكير والعمل في الوقت الفعلي (مثل السيارات ذاتية القيادة)، لا ينبغي لك الانتظار حتى ينتهي التدريب لجعل الذكاء الاصطناعي أصغر حجمًا. بدلاً من ذلك، يجب عليك تقليصه أثناء تعلمه، مما يسم يسمح للروبوت بالتكيف مع "جراحته" في الوقت الفعلي.

هذا النهج "قبل بارك فيرميه" يخلق سائق روبوت خفيف بما يكفي ليكون سريعًا، ولكنه ذكي بما يكفي للتعامل مع مهام القيادة المعقدة، متفوقًا على كل من النماذج الأصلية الثقيلة والنماذج الصغيرة بطبيعتها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →