RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
تقدم الورقة البحثية RLinf-VLA، وهو إطار عمل موحد وفعال يعمل على توحيد معايير دمج بنيات VLA المتنوعة وخوارزميات التعلم المعزز (RL) مع تحسين تخصيص الموارد لتحقيق تسريع كبير في التدريب وأداءً يضاهي أحدث ما توصل إليه العلم عبر العديد من معايير الذكاء المجسد.
تخيل عالماً لا تكون فيه الروبوتات مجرد آلات صماء تتبع قائمة صارمة من التعليمات، بل متعلمات فضوليات يمكنها فهم ما تقوله، ورؤية ما تراه، ومعرفة كيفية تحريك أجسادها لإنجاز المهام. هذا هو الأفق المثير لنماذج الرؤية واللغة والعمل (VLA). فكر في هذه النماذج على أنها "دماغ" الروبوت، المدرب على كميات هائلة من بيانات الإنترنت لفهم اللغة والصور. ولكن هناك عقبة: فمجرد معرفة الروبوت بماهية "الكوب" وسماعه لجملة "ارفع الكوب"، لا يعني أنه يعرف أفضل طريقة للإمساك به دون قلبه. لكي يصبح بارعاً حقاً في المهام الفيزيائية، تحتاج هذه الروبوتات إلى الممارسة، وارتكاب الأخطاء، والتعلم من النتائج. وهنا يأتي دور التعلم التعزيزي (RL). يمكنك التفكير في التعلم التعزيزي كحلقة تدريب للعبة فيديو: يحاول الروبوت القيام بحركة ما، ويحصل على "درجة" (مكافأة) إذا نجح، ويتعلم تكرار الحركات الجيدة وتجنب الحركات السيئة. السؤال الكبير الذي يطرحه العلماء هو: كيف نبني نظام تدريب سريعاً وذكياً بما يكفي للسماح لهذه الروبوتات بتعلم مهارات معقدة دون أن يستغرق ذلك وقتاً طويلاً جداً؟
إليك RLinf-VLA، وهو إطار عمل جديد يعمل بمثابة "صالة ألعاب رياضية" فائقة الكفاءة لعقول هذه الروبوتات. فقد أدرك الباحثون وراء هذه الورقة البحثية أنه بينما نمتلك نماذج روبوت قوية وخوارزميات تدريب ممتازة، فإن "الصالة الرياضية" نفسها كانت غالباً معطلة. كانت الأنظمة السابقة تشبه محاولة ركض ماراثون وأنت تحمل حقيبة ظهر ثقيلة؛ فقد كانت بطيئة، وغير متناسقة، ولا تستطيع التعامل جيداً مع أنواع مختلفة من بيئات التدريب. في بعض الأحيان، كان دماغ الروبوت (النموذج) ينتظر المحاكي (العالم الافتراضي) ليلحق به، وفي أحيان أخرى كان المحاكي ينتظر الدماغ، مما يترك شرائح الكمبيوتر باهظة الثمن في حالة خمول.
لقد بنى الفريق RLinf-VLA لإصلاح هذا الازدحام المروري. لقد أنشأوا نظاماً موحداً يمكنه دمج نماذج محاكاة روبوتات مختلفة، وبنى عقول مختلفة، وخوارزميات تعلم مختلفة جميعاً في آن واحد. لكن السحر الحقيقي يكمكمن في كيفية إدارتهم لقوة الكمبيوتر. فقد قدموا وضعاً "هجيناً" ذكياً يعمل مثل رقصة متناغمة بدقة. فبدلاً من ترك دماغ الروبوت والعالم الافتراضي ينتظران بعضهما البعض، قاموا بعملية "خط إنتاج" (pipeline) للمسار: فبينما يفكر الدماغ في الحركة التالية لجزء من عملية المحاكاة، يكون المحاكي قد بدأ بالفعل في تشغيل الحركة السابقة لجزء آخر. وهذا يبقي كل شيء يتحرك بأقصى سرعة ممكنة.
النتائج التي حققها هذا النظام الجديد مبهرة. ففي عمليات المحاكاة الخاصة بهم، جعل هذا الإطار التدريب أسرع بمقدار يصل إلى 2.27 مرة من الطرق السابقة. وعندما وضعوا النماذج المدربة تحت الاختبار، كانت النتائج قوية؛ حيث حقق نموذج واحد تم تدريبه باستخدام RLinf-VLA معدل نجاح بنسبة 98.11% عبر 130 مهمة مختلفة في معيار LIBERO، و 97.66% في 25 مهمة في ManiSkill. وحتى في مهام RoboTwin الصعبة، والتي تتضمن استخدام يدين، وصلت النماذج إلى متوسط معدل نجاح قدره 84.63%. كما اختبر الباحثون نسخة من هذا النظام في العالم الحقيقي باستخدام ذراع روبوت فيزيائية لإغلاق درج. وبينما كان معدل النجاح هو نفسه للنموذج القياسي (8 من أصل 10 محاولات)، إلا أن الروبوت المدرب بالتعلم التعزيزي تحرك بشكل أكثر سلاسة وكفاءة، متجنباً الحركات المتشنجة والمربكة التي ظهرت في النسخة غير المدربة.
تشير الورقة البحثية إلى أن هذا الإطار الجديد ليس مجرد دفعة في السرعة فحسب؛ بل هو أداة تأسيسية تجعل من الممكن تدريب هذه العقول الروبوتية المعقدة على نطاق أكبر بكثير مما سبق. ومن خلال توحيد كيفية تواصل هذه الأنظمة مع بعضها البعض وتحسين كيفية استخدام موارد الكمبيوتر، يوفر RLinf-VLA مساراً نحو روبوتات يمكنها تعلم مهارات فيزيائية جديدة بسرعة وموثوقية، مما يقربنا خطوة أخرى من اليوم الذي يمكن فيه للروبوتات أن تساعدنا حقاً في حياتنا اليومية.
ملخص تقني: RLinf-VLA
بيان المشكلة
أظهرت التطورات الأخيرة في نماذج الرؤية واللغة والعمل (VLA) إمكانات التعلم التعزيزي (RL) لتعزيز أداء المهام من خلال التفاعل. ومع ذلك، تواجه الأبحاث الحالية في هذا المجال ثلاثة تحديات رئيسية:
التجزئة: تفتقر الجهود الحالية إلى منصة موحدة للمقارنة العادلة عبر مختلف بنيات VLA، وخوارزميات التعلم التعزيزي، والمحاكيات.
عدم الكفاءة: يعوق تصميم الأنظمة التي لا تراعي نزاع الموارد المحدد في البيئات المجسدة عملية تدريب RL القابلة للتوسع. فخلافًا للنماذج اللغوية الكبيرة (LLMs)، يتضمن تدريب VLA اقترانًا وثيقًا بين استنتاج النموذج، ورندرة المحاكي، والتحسين، مما يؤدي غالبًا إلى وقت خمول كبير لوحدات معالجة الرسومات (GPU) وظهور فجوات في خطوط المعالجة (pipeline bubbles).
الافتقار إلى المعايير: يجعل غياب واجهة موحدة من الصعب استخراج المبادئ العامة لتدريب VLA القائم على التعلم التعزيزي، حيث تعتمد الأعمال الحالية على بروتوكولات وقواعد بيانات برمجية متباينة.
المنهجية
يقدم المؤلفون RLinf-VLA، وهو إطار عمل موحد وفعال مصمم لمعالجة هذه التحديات من خلال التجريد على مستوى النظام وتحسين الخوارجيات.
1. التجريد الموحد للنظام
يوفر RLinf-VLA واجهة معيارية تدمج:
محاكيات متعددة: يدعم بيئات غير متجانسة تشمل المحاكيات المتوازية عبر المعالج المركزي (مثل LIBERO) والمحاكيات المتوازية عبر معالج الرسومات (مثل ManiSkill وRoboTwin). بنيات متنوعة: يستوعب نماذج VLA مختلفة (مثل OpenVLA وOpenVLA-OFT وπ0) وصيغ العمل (الخطوة الواحدة مقابل كتل العمل/action chunks).
خوارزميات التعلم التعزيزي: يدعم الخوارزميات التي تعتمد على السياسة الحالية (on-policy) مثل PPO وGRPO، مع قابلية التوسع للطرق التي تعتمد على السياسة السابقة (off-policy).
2. استراتيجيات تخصيص معالج الرسومات المرنة
لتعظيم استغلال الموارد، يقدم إطار العمل ثلاثة أوضاع للتنفيذ:
الوضع المشترك (Collocated Mode): تشترك جميع المكونات (التوليد، المحاكي، التدريب) في نفس وحدات معالجة الرسومات. قام المؤلفون بتعديل النهج القياسي لتقليل عبء نقل البيانات (offload-onload) عن طريق قصر هذه العمليات على بداية ونهاية مراحل التجميع (rollout phases).
الوضع المنفصل (Disaggregated Mode): يتم تخصيص المكونات لأجزاء منفصلة من معالج الرسومات. ورغم بساطته، إلا أنه غالبًا ما يؤدي إلى عدم استغلال الموارد بسبب التبعيات بين المكونات (على سبيل المثال، انتظار وحدات معالجة الرسومات للبيانات).
الوضع الهجين (Hybrid Mode - مبتكر): يجمع هذا الوضع بين مزايا الطريقتين السابقتين؛ حيث يخصص مكونات التوليد والمحاكي لأجزاء مختلفة من معالج الرسومات مع السماح لمكون التدريب باستخدام جميع وحدات معالجة الرسومات. والأهم من ذلك، أنه يقدم توصيلًا دقيقًا (fine-grained pipelining)، حيث يتم تقسيم نسخ المحاكي إلى محاكيات فرعية (S(1),S(2),…). وهذا يسمح لمكوني المحاكي والتوليد بالعمل بالتزامن، مما يخفف من "فجوات معالج الرسومات" الناتجة عن التبعيات التسلسلية دون تحمل عبء نقل البيانات المتكرر.
التوزيع التلقائي (Auto-Placement): تقوم خوارزمية خفيفة الوزن بتحديد التخصيص الأمثل لمعالج الرسومات وعمق خط المعالجة (k=1 أو k=2) تلقائيًا بناءً على تحليل الأداء أثناء التشغيل لتقليل وقت التجميع (rollout time).
3. خيارات التصميم الخوارزمي
يستخلص إطار العمل خيارات تصميم محددة لتوسيع نطاق RL لنماذج VLA:
دعم تعدد المستويات (Multi-Granularity): يدعم حساب الميزة (advantage) والاحتمالية اللوغاريتمية على مستويات: الكتلة (Chunk)، والعمل (Action)، والرمز (Token).
تحسينات PPO:
إعادة الضبط الجزئي (Partial Reset): يعيد ضبط البيئات الفرعية فور انتهاء المهمة بدلاً من الانتظار حتى طول حلقة ثابت، مما يحسن كفاءة العينات.
الناقد المشترك المعلمات (Parameter-Sharing Critic): يربط رأس قيمة (value head) خفيف الوزن بالنموذج اللغوي للـ actor لتجنب التكلفة الحسابية لشبكة ناقد منفصلة.
تقدير القيمة على مستوى العمل: وُجد تجريبيًا أنه يتفوق على التقدير على مستوى الكتلة عند استخدام كتل العمل.
تحسينات GRPO:
قناع العمل الصالح (Valid Action Mask): يحجب الخطوات الزمنية التي تحدث بعد اكتمال المهمة للتركيز على الخطوات ذات الصلة.
تطبيع طول المسار (Trajectory Length Normalization): يطبع الخسارة بناءً على عدد الخطوات الزمنية الصالحة لمنع المسارات الطويلة من الهيمنة على التدرجات.
فلتر معدل النجاح: يستبعد مجموعات المسارات التي تكون فيها جميع النتائج متطابقة (كلها نجاح أو كلها فشل) لضمان حساب ميزة ذي معنى.
النتائج الرئيسية
تم تقييم إطار العمل عبر ثلاثة اختبارات مرجعية: LIBERO (130 مهمة)، ManiSkill (25 مهمة)، وRoboTwin (6 مهام).
مكاسب الأداء:
LIBERO: حقق نموذج موحد واحد معدل نجاح بنسبة 98.11% عبر 130 مهمة (ارتفاعًا من ~42% للنموذج الأساسي).
ManiSkill: حقق نموذج موحد واحد معدل نجاح بنسبة 97.66% في 25 مهمة (ارتفاعًا من ~18% لنموذج OpenVLA-OFT).
RoboTwin: حققت ستة نماذج خاصة بكل مهمة متوسط معدل نجاح بلغ 84.63% (تحسن بنسبة 63.75% عن النموذج الأساسي).
تفوقت النماذج المدربة بـ RL باستمرار على نماذج الضبط الدقيق الخاضع للإشراف (SFT) الأساسية، لا سيما في التعميم خارج التوزيع (OOD).
كفاءة النظام:
حقق الوضع الهجين مع التوصيل الدقيق تسريعًا بنسبة 1.61×–1.88× في ManiSkill مقارنة بالنماذج المنفصلة.
حقق RLinf-VLA بشكل عام تسريعًا يصل إلى 2.27× مقارنة بالأطر الحالية (مثل SimpleVLA-RL) من خلال تحسين مرحلتي التجميع والتدريب.
النقل إلى العالم الحقيقي:
أظهرت تجربة أولية في العالم الحقيقي على مهمة إغلاق الدرج أن السياسة المحسنة بـ RL أكملت المهمة بكفاءة أكبر من نموذج SFT الأساسي، حيث أظهرت سلوكيات أكثر مباشرة وانسيابية رغم تدريبها أساسًا في المحاكاة.
التوحيد: يوفر أول واجهة موحدة تدعم محاكيات ونماذج وخوارزميات متنوعة، مما يتيح المقارنة العادلة وقابلية التكرار.
الكفاءة: من خلال معالجة مشكلات نزاع الموارد المحددة لـ RL المجسد (المحاكي مقابل الاستنتاج مقابل التدريب)، فإنه يقدم حلاً قابلاً للتوسع يقلل وقت التدريب بشكل كبير.
أفضل الممارسات: يستخلص البحث خيارات تصميم قابلة للتطبيق (مثل تقدير القيمة على مستوى العمل، وإعادة الضبط الجزئي، وقناع العمل الصالح) التي توجه الأبحاث المستقبلية في تدريب VLA القائم على RL.
الانفتاح: من خلال إطلاقه كمنصة مفتوحة المصدر وتحت الصيانة النشطة، يهدف الإطار إلى تسريع وتوحيد الأبحاث في هذا المجال.
يخلص البحث إلى أنه بينما تبدو RL القائمة على المحاكاة واعدة للنشر في العالم الحقيقي، فإن المساهمة الرئيسية هي إنشاء بنية تحتية قوية وفعالة وقابلة للتوسع ضرورية لتعزيز قدرات VLA من خلال التعلم التعزيزي.