← أحدث الأبحاث
💻 computer science

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

تقدم الورقة البحثية RLinf-VLA، وهو إطار عمل موحد وفعال يعمل على توحيد معايير دمج بنيات VLA المتنوعة وخوارزميات التعلم المعزز (RL) مع تحسين تخصيص الموارد لتحقيق تسريع كبير في التدريب وأداءً يضاهي أحدث ما توصل إليه العلم عبر العديد من معايير الذكاء المجسد.

المؤلفون الأصليون: Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao
نُشر 2026-08-13
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا تكون فيه الروبوتات مجرد آلات صماء تتبع قائمة صارمة من التعليمات، بل متعلمات فضوليات يمكنها فهم ما تقوله، ورؤية ما تراه، ومعرفة كيفية تحريك أجسادها لإنجاز المهام. هذا هو الأفق المثير لنماذج الرؤية واللغة والعمل (VLA). فكر في هذه النماذج على أنها "دماغ" الروبوت، المدرب على كميات هائلة من بيانات الإنترنت لفهم اللغة والصور. ولكن هناك عقبة: فمجرد معرفة الروبوت بماهية "الكوب" وسماعه لجملة "ارفع الكوب"، لا يعني أنه يعرف أفضل طريقة للإمساك به دون قلبه. لكي يصبح بارعاً حقاً في المهام الفيزيائية، تحتاج هذه الروبوتات إلى الممارسة، وارتكاب الأخطاء، والتعلم من النتائج. وهنا يأتي دور التعلم التعزيزي (RL). يمكنك التفكير في التعلم التعزيزي كحلقة تدريب للعبة فيديو: يحاول الروبوت القيام بحركة ما، ويحصل على "درجة" (مكافأة) إذا نجح، ويتعلم تكرار الحركات الجيدة وتجنب الحركات السيئة. السؤال الكبير الذي يطرحه العلماء هو: كيف نبني نظام تدريب سريعاً وذكياً بما يكفي للسماح لهذه الروبوتات بتعلم مهارات معقدة دون أن يستغرق ذلك وقتاً طويلاً جداً؟

إليك RLinf-VLA، وهو إطار عمل جديد يعمل بمثابة "صالة ألعاب رياضية" فائقة الكفاءة لعقول هذه الروبوتات. فقد أدرك الباحثون وراء هذه الورقة البحثية أنه بينما نمتلك نماذج روبوت قوية وخوارزميات تدريب ممتازة، فإن "الصالة الرياضية" نفسها كانت غالباً معطلة. كانت الأنظمة السابقة تشبه محاولة ركض ماراثون وأنت تحمل حقيبة ظهر ثقيلة؛ فقد كانت بطيئة، وغير متناسقة، ولا تستطيع التعامل جيداً مع أنواع مختلفة من بيئات التدريب. في بعض الأحيان، كان دماغ الروبوت (النموذج) ينتظر المحاكي (العالم الافتراضي) ليلحق به، وفي أحيان أخرى كان المحاكي ينتظر الدماغ، مما يترك شرائح الكمبيوتر باهظة الثمن في حالة خمول.

لقد بنى الفريق RLinf-VLA لإصلاح هذا الازدحام المروري. لقد أنشأوا نظاماً موحداً يمكنه دمج نماذج محاكاة روبوتات مختلفة، وبنى عقول مختلفة، وخوارزميات تعلم مختلفة جميعاً في آن واحد. لكن السحر الحقيقي يكمكمن في كيفية إدارتهم لقوة الكمبيوتر. فقد قدموا وضعاً "هجيناً" ذكياً يعمل مثل رقصة متناغمة بدقة. فبدلاً من ترك دماغ الروبوت والعالم الافتراضي ينتظران بعضهما البعض، قاموا بعملية "خط إنتاج" (pipeline) للمسار: فبينما يفكر الدماغ في الحركة التالية لجزء من عملية المحاكاة، يكون المحاكي قد بدأ بالفعل في تشغيل الحركة السابقة لجزء آخر. وهذا يبقي كل شيء يتحرك بأقصى سرعة ممكنة.

النتائج التي حققها هذا النظام الجديد مبهرة. ففي عمليات المحاكاة الخاصة بهم، جعل هذا الإطار التدريب أسرع بمقدار يصل إلى 2.27 مرة من الطرق السابقة. وعندما وضعوا النماذج المدربة تحت الاختبار، كانت النتائج قوية؛ حيث حقق نموذج واحد تم تدريبه باستخدام RLinf-VLA معدل نجاح بنسبة 98.11% عبر 130 مهمة مختلفة في معيار LIBERO، و 97.66% في 25 مهمة في ManiSkill. وحتى في مهام RoboTwin الصعبة، والتي تتضمن استخدام يدين، وصلت النماذج إلى متوسط معدل نجاح قدره 84.63%. كما اختبر الباحثون نسخة من هذا النظام في العالم الحقيقي باستخدام ذراع روبوت فيزيائية لإغلاق درج. وبينما كان معدل النجاح هو نفسه للنموذج القياسي (8 من أصل 10 محاولات)، إلا أن الروبوت المدرب بالتعلم التعزيزي تحرك بشكل أكثر سلاسة وكفاءة، متجنباً الحركات المتشنجة والمربكة التي ظهرت في النسخة غير المدربة.

تشير الورقة البحثية إلى أن هذا الإطار الجديد ليس مجرد دفعة في السرعة فحسب؛ بل هو أداة تأسيسية تجعل من الممكن تدريب هذه العقول الروبوتية المعقدة على نطاق أكبر بكثير مما سبق. ومن خلال توحيد كيفية تواصل هذه الأنظمة مع بعضها البعض وتحسين كيفية استخدام موارد الكمبيوتر، يوفر RLinf-VLA مساراً نحو روبوتات يمكنها تعلم مهارات فيزيائية جديدة بسرعة وموثوقية، مما يقربنا خطوة أخرى من اليوم الذي يمكن فيه للروبوتات أن تساعدنا حقاً في حياتنا اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →