← أحدث الأبحاث
💻 computer science

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

تُثبت هذه الورقة أن التعلم المعزز يمكنه بنجاح تمهيد سياسة OpenVLA-OFT مسبقة التدريب لروبوت متوازي جديد يعمل بالكابلات دون الحاجة إلى أي بيانات عرض خاصة بالتجسيد، محققاً تحسناً في قدرات الحركة الاتجاهية واستهداف الأجسام من خلال عملية تدريب مكونة من مرحلتين باستخدام خوارزميتي PPO وGRPO.

المؤلفون الأصليون: Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

نُشر 2026-08-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يحرك ذراعيه. عادةً، تكون أفضل طريقة لتعليم الروبوت هي عرض فيديو لإنسان يقوم بالمهمة أولاً، مثل معلم رقص يوضح خطوات الرقص لطالب. يُسمى هذا "العرض التوضيحي" (Demonstration)، وهو يعمل بشكل رائع إذا كان الروبوت يشبه البشر أو لديه أذرع قياسية. ولكن ماذا يحدث إذا كان لديك روبوت جديد وغريب لا يشبه أي شيء في فيديوهات التدريب؟ ربما يكون منصة ضخمة عائمة معلقة بخيوط، أو لديه قابض بسيط وصغير بدلاً من يد بشرية. إذا حاولت تعليم الروبوت بالطريقة القديمة، فستظل عالقاً لأنك لا تملك أي فيديوهات لهذا الروبوت تحديداً وهو يقوم بأي شيء. هذا هو اللغز الذي يواجهه الباحثون: كيف تجعل الروبوت يفهم اللغة ويتحرك بشكل صحيح عندما يكون نوعاً جديداً تماماً من الآلات التي ليس لديها خبرة سابقة؟

هذه الورقة البحثية تعالج هذه المشكلة بالضبط. فقد أخذ الباحثون "دماغ" روبوت قوي ومُدرب مسبقاً (نموذج يسمى OpenVLA-OFT يعرف بالفعل كيف يتحدث ويرى) وحاولوا تعليمه التحكم في روبوت غريب جداً يعمل بالكابلات. المفاجأة؟ لم يعرضوا عليه فيديو واحداً للروبوت وهو يتحرك. بدلاً من ذلك، وضعوا الروبوت داخل محاكاة للعبة فيديو واستخدموا طريقة تعليم مختلفة تسمى "التعلم التعزيزي" (Reinforcement Learning). فكر في الأمر كأنك تلعب لعبة فيديو ليس لديك فيها دليل إرشادي أو خريطة؛ عليك فقط اكتشاف كيفية التحرك من خلال الحصول على نقاط كلما اقتربت من الهدف. وجد الباحثون أنه باستخدام طريقة "التجربة والخطأ" هذه مع نظام تسجيل نقاط خاص، استطاعوا جعل الروبوت يبدأ في الاستجابة لأوامر مثل "تحرك يساراً" أو "اذهب إلى التفاحة" دون أن يرى إنساناً يفعل ذلك أولاً.

قصة الروبوت الموجه بالخيوط

تعرف على الروبوت في هذه القصة: إنه روبوت متوازي مدفوع بالكابلات (CDPR). تخيل كاميرا أو أداة معلقة في الهواء، تُرفع بواسطة عدة خيوط (كابلات) تسحبها في اتجاهات مختلفة. إنه ليس ذراع روبوت قياسي بمفاصل؛ بل هو أشبه بمنصة عائمة يتم التحكم فيها عبر التوتر. أراد الباحثون تعليم هذه المنصة العائمة الاستماع إلى الأوامر الصوتية والتحرك حول المكان، لكنهم واجهوا عقبة رئيسية: "جسد" الروبوت كان جديداً تماماً، ولم يكن لديهم أي فيديوهات لحركته.

عادةً، لتعليم الروبوت، تحتاج إلى "مجموعة بيانات عرض توضيحي". تقوم بتسجيل إنسان (أو روبوت مثالي) وهو يؤدي المهمة 100 مرة، ويقوم الروبوت الجديد بتقليد تلك الحركات. ولكن بالنسبة لهذا الروبوت الغريب الذي يعمل بالخيوط، لم تكن هناك مثل هذه الفيديوهات. لذا، تساءل الباحثون: هل يمكننا تجاوز الفيديوهات تماماً والاكتفاء باستخدام لعبة فيديو لتعليم الروبوت؟

لعبة التدريب ذات الخطوتين

للإجابة على ذلك، أقاموا معسكراً تدريبياً في محاكاة حاسوبية (عالم افتراضي يحاكي الفيزياء). استخدموا عملية تدريب من خطوتين، مثل رفع المستوى في لعبة فيديو.

المستوى 1: تمرين الاتجاهات (PPO)
أولاً، علموا الروبوت أساسيات الحركة باستخدام أوامر بسيطة: "تحرك يساراً"، "تحرك يميناً"، "تحرك للأمام"، و"تحرك للخلف". استخدموا خوارزمية تسمى PPO (تحسين السياسة القريبة). في اللعبة، يحصل الروبوت على نقاط (مكافآت) في كل مرة يتحرك فيها باتجاه الهدف. لم تكن لعبة نجاح أو فشل؛ بل كانت لعبة "تقدم". إذا تحرك الروبوت ولو قليلاً نحو اليسار، يحصل على مكافأة صغيرة. ساعد هذا الروبوت على فهم كيف تعمل آلية شد الخيوط الفريدة الخاصة به.

المستوى 2: رحلة البحث عن الأشياء (GRPO)
بمجرد أن أتقن الروبوت كيفية التحرك في الاتجاهات، انتقلوا إلى مستوى أعلى في اللعبة. أدخلوا خوارزمية جديدة تسمى GRPO وأضافوا مجموعة جديدة من الأوامر: "تحرك إلى [الشيء]". قاموا بنثر ثمانية عناصر مختلفة في العالم الافتراضي: تفاح، كرات بيسبول، أوعية، أكواب، مجات، خوخ، كمثرى، وأطباق. الآن، لم يكن على الروبوت معرفة كيفية التحرك فحسب، بل كان عليه معرفة "ماذا" يتحرك نحوه.

النتائج: مزيج من النجاح والتعثر

كانت النتائج واعدة، لكنها ليست مثالية. إليكم ما تقوله الأرقام:

  • الحركات الاتجاهية: بعد مرحلة التدريب الأولى (PPO)، نجح الروبوت في التحرك في الاتجاه الصحيح بنسبة 34.25% من المرات. وبعد المرحلة الثانية (إضافة GRPO)، ارتفع هذا الرقم إلى 53.50%.
    • أكبر التحسينات كانت في "تحرك يساراً" (من 17.00% إلى 52.00%) و"تحرك للخلف" (من 15.00% إلى 48.00%).
    • "تحرك للأمام" كان يؤدي جيداً بالفعل بنسبة 62.00% واستمر عند هذا المستوى.
  • البحث عن الأشياء: عندما طُلب منه البحث عن أشياء محددة (مثل "تحرك إلى التفاحة")، نجح الروبوت في 9.75% من المحاولات (39 من أصل 400 محاولة).

على الرغم من أن نسبة 9.75% قد تبدو منخفضة، إلا أن الباحثين لاحظوا شيئاً مهماً. في كثير من المحاولات الفاشلة، فعل الروبوت الشيء الصحيح في البداية: لقد حدد التفاحة بشكل صحيح وبدأ بالتحرك نحوها. لقد تعثر فقط وأصبح غير مستقر في النهاية. هذا يشير إلى أن الروبوت فهم الأمر والشيء، لكنه لا يزال بحاجة إلى مزيد من الممارسة لإنهاء المهمة بسلاسة.

لماذا هذا مهم (وما ليس كذلك)

هذه الورقة البحثية أمر هام لأنها تثبت أنه يمكنك بناء متحكم روبوت من الصفر باستخدام المحاكاة والمكافآت فقط، دون الحاجة إلى عرض توضيحي بشري واحد. الأمر يشبه تعليم كلب جلب الكرة عبر إعطائه مكافآت مقابل اقترابه من الكرة، بدلاً من عرض فيديو لكلب آخر وهو يجلب الكرة.

ومع ذلك، فإن المؤلفين حذرون جداً من تسمية هذا "مشكلة تم حلها". فقد صرحوا بوضوح أن هذا لا يزال مجرد محاكاة. الروبوت ليس قوياً بما يكفي بعد؛ فهو يفشل كثيراً، خاصة عند محاولة الإمساك بأشياء محددة. هم لا يدعون أن هذا هو الحل النهائي لجميع الروبوتات. بدلاً من ذلك، يقترحون أن هذه خطوة أولى مفيدة.

الفكرة هي أن طريقة "التعلم التعزيزي فقط" (RL-only) هذه يمكن أن توصل الروبوت إلى نقطة يفهم فيها أساسيات جسده الجديد. وبمجرد أن يمتلك هذا الأساس، يمكن للباحثين جمع بعض الفيديوهات من العالم الحقيقي لصقل أدائه، مما يجعل العملية برمتها أرخص وأسرع بكثير من البدء من الصفر.

باختصار، تظهر الورقة البحثية أنه بالنسبة لروبوت جديد وغريب، لست بحاجة بالضرورة إلى مكتبة من الفيديوهات للبدء. يمكنك استخدام نظام تسجيل نقاط ذكي في لعبة فيديو لتعليمه القواعد، وتحويل حالة "صفر عرض توضيحي" إلى نجاح من "المحاولة الأولى". الروبوت ليس مثالياً بعد، لكنه روبوت يمكنه أخيراً البدء في الاستماع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →