← أحدث الأبحاث
💻 computer science

Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models

تقترح هذه الورقة البحثية RL-Co، وهو إطار عمل للتدريب المشترك بين المحاكاة والواقع قائم على التعلم التعزيزي، يجمع بين الضبط الدقيق الخاضع للإشراف على بيانات حقيقية ومحاكاة مختلطة وبين الضبط الدقيق للمحاكاة التفاعلية المرتكز على بيانات من العالم الحقيقي، محققاً تحسينات كبيرة في معدلات النجاح في العالم الحقيقي، والقدرة على التعميم، وكفاءة البيانات لنماذج الرؤية واللغة والعمل (Vision-Language-Action models).

المؤلفون الأصليون: Liangzhi Shi, Shuaihang Chen, Feng Gao, Yinuo Chen, Kang Chen, Tonghe Zhang, Hongzhi Zang, Weinan Zhang, Chao Yu, Yu Wang

نُشر 2026-03-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Liangzhi Shi, Shuaihang Chen, Feng Gao, Yinuo Chen, Kang Chen, Tonghe Zhang, Hongzhi Zang, Weinan Zhang, Chao Yu, Yu Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية القيام بالأعمال المنزلية، مثل التقاط كوب أو فتح درج. لديك طريقتان رئيسيتان لتعليمه:

  1. طريقة "العالم الحقيقي": تقوم بتوجيه ذراع الروبوت جسديًا آلاف المرات، وتسجل كل حركة. هذه الطريقة دقيقة ولكنها بطيئة للغاية، ومكلفة، وخطيرة (تخيل كسر ذراع الروبوت أثناء تعليمه).
  2. طريقة "ألعاب الفيديو": تعلم الروبوت في محاكاة حاسوبية مثالية. يمكنه التدرب ملايين المرات في ثوانٍ معدودة دون أن ينكسر أي شيء. لكن، غالبًا ما يصاب الروبوت بالارتباك عندما يخرج من اللعبة إلى العالم الحقيقي بسبب اختلاف الإضاءة، والأنسجة، والفيزياء.

لفترة طويلة، حاول الباحثون المزج بين هاتين الطريقتين عبر عرض مزيج من فيديوهات حقيقية وفيديوهات ألعاب فيديو على الروبوت. أطلقوا على ذلك اسم "التدريب المشترك" (Co-training). ولكن كانت هناك مشكلة: كان الروبوت يحفظ الفيديوهات فقط. كان الأمر يشبه طالبًا حفظ نموذج الإجابة لاختبار تجريبي لكنه لم يفهم الرياضيات فعليًا. عندما تتغير أسئلة الاختبار قليلًا (جسم جديد، زاوية مختلفة)، يفشل الروبوت.

الفكرة الجديدة: "ما وراء التقليد"

تقدم هذه الورقة البحثية طريقة جديدة تسمى RL-Co (التعلم التعزيزي للتدريب المشترك). بدلًا من مجرد حفظ الفيديوهات، فإننا نترك الروبوت يلعب، ويفشل، ويتعلم في لعبة الفيديو، مع الحفاظ على "شبكة أمان" من المعرفة في العالم الحقيقي.

إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:

التشبيه: برنامج تدريب الطيارين

فكر في تدريب الروبوت مثل تدريب طيار.

1. الطريقة القديمة (الضبط الدقيق الخاضع للإشراف - SFT):
تعرض على الطالب الطيار فيديو لطيار خبير يهبط بالطائرة بشكل مثالي. يحاول الطالب تقليد الحركات بدقة.

  • المشكلة: إذا هبت ريح مفاجئة (تغيير في العالم الحقيقي)، يصاب الطالب بالذعر لأنه حفظ السيناريو فقط، ولم يتعلم كيف يتفاعل.

2. الطريقة الجديدة (RL-Co):
يتم التدريب على مرحلتين:

  • المرحلة الأولى: مدرسة الطيران الأرضية (الإحماء)
    أولاً، تعرض على الطالب مزيجًا من الفيديوهات: بعضها لطيارين حقيقيين وبعضها من محاكي الطيران. هذا يعطيه فهمًا أساسيًا لما تبدو عليه "الهبوط الجيد" في كل من العالم الحقيقي والمحاكي. إنه يحصل على أساس متين.

  • المرحلة الثانية: محاكي الطيران (الخطوة السحرية)
    الآن، تضع الطالب في محاكي الطيران. ولكن بدلًا من مجرد المشاهدة، تتركه يقود الطائرة.

    • يحاول الهبوط.
    • يصطدم.
    • يقول له الكمبيوتر: "آه، كان ذلك سيئًا".
    • يحاول مرة أخرى، ويعدل أدوات التحكم بناءً على الملاحظات.
    • يتدرب ملايين المرات، ويتعلم كيفية التعامل مع الاضطرابات الجوية، والطقس السيئ، وأعطال المحركات.

    اللمسة المميزة (شبكة الأمان):
    عادةً، إذا دربت طيارًا في المحاكي فقط، فقد ينسى كيفية التعامل مع خصائص الطائرة الحقيقية. ولحل هذه المشكلة، يضيف الباحثون قاعدة: في كل مرة يتعلم فيها الطالب خدعة جديدة في المحاكي، يجب عليه أيضًا مراجعة بعض فيديوهات الهبوط في العالم الحقيقي.

    • يعمل هذا بمثابة "مرساة". فهو يمنع الطالب من نسيان قواعد العالم الحقيقي بينما يستكشف استراتيجيات جديدة وجنونية في اللعبة.

لماذا يعد هذا أمرًا بالغ الأهمية؟

اختبرت الورقة البحثية هذه الطريقة على "عقلين" مختلفين للروبوت (يُسميان OpenVLA و π0.5\pi_0.5) وأربع مهام مختلفة (التقاط الأشياء، دفع المكعبات، فتح/إغلاق الأدراج).

إليك النتائج بلغة بسيطة:

  • معدلات نجاح أفضل: كانت الروبوتات المدربة بهذه الطريقة الجديدة أكثر قدرة على إتمام المهمة بالفعل. على سبيل المثال، في إحدى المهام، ارتفعت نسبة النجاح من 20% إلى أكثر من 60%.
  • أفضل في التعامل مع المفاجآت: إذا وضعت جسمًا جديدًا على الطاولة (لم يره من قبل) أو غيرت وضعية بداية الروبوت، فإن الطريقة الجديدة تعاملت مع الأمر بشكل أفضل بكثير من الطرق القديمة. كان الأمر يشبه الطيار الذي تعلم الطيران وسط عاصفة، وليس في يوم هادئ فقط.
  • كفاءة البيانات: هذا هو الفوز الأكبر. كانت الطرق القديمة تحتاج إلى مئات الفيديوهات من العالم الحقيقي لتصبح جيدة. أما الطريقة الجديدة فقد حققت نتائج أفضل باستخدام 20 فيديو فقط من العالم الحقيقي لأنها قامت بالجهد الأكبر في المحاكي.

الخلاصة

تحل هذه الورقة البحثية عقبة رئيسية في مجال الروبوتات. فهي توضح أننا لسنا بحاجة لجمع ملايين العروض التوضيحية المكلفة والخطيرة من العالم الحقيقي لتعليم الروبوتات. بدلاً من ذلك، يمكننا:

  1. منحهم القليل من المعرفة من العالم الحقيقي.
  2. تركهم يلعبون ويتعلمون في لعبة فيديو حيث يمكنهم الفشل بأمان.
  3. الحفاظ على "شبكة أمان" صغيرة من بيانات العالم الحقيقي للتأكد من أنهم لا ينسون كيف يكونون واقعيين.

إنه الفرق بين روبوت يقلد البشر فحسب، وروبوت يفهم كيفية إنجاز المهمة، حتى عندما تسوء الأمور.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →