Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations
تقدم هذه الورقة البحثية HERO، وهو وكيل مجسد هرمي ذاتي التحسين يقوم ذاتياً بتمهيد وتوحيد قدرات التلاعب الروبوتي في سياسات حلقة مغلقة فعالة من الصفر دون أي نماذج بشرية، وذلك عبر تنسيق الاستدلال الاستكشافي، وإعادة استخدام النماذج، والتنفيذ الانعكاسي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً لا تكتفي فيه الروبوتات باتباع سيناريو صارم كتبه مبرمج بشري، بل تتعلم فعلياً كيف تتحرك وتفكر مثلنا تماماً. هذا هو حلم "الذكاء الاصطناعي المتجسد" (Embodied AI) — منح الكمبيوتر جسداً ليتفاعل مع العالم الحقيقي. في الوقت الحالي، يبدو تعليم الروبوت القيام بشيء جديد وكأنك تعلم طفلاً صغيراً كيفية ربط حذائه: عليك أن تمسك بيده، وتوضح له بالضبط ما يجب فعله، وتكرر ذلك مئات المرات حتى "تتذكر" عضلاته تلك الحركة. يُسمى هذا "التعلم من التوضيحات البشرية". ولكن ماذا لو استطاع الروبوت أن يتعلم بمفرده؟ ماذا لو استطاع معرفة كيفية الإمساك بكوب، أو دفع صندوق، أو فتح درج بمجرد النظر إلى العالم وتجربة الأشياء، دون أن ترفع إصبعاً واحداً لتوضح له الطريق؟ هذا هو السؤال الكبير الذي يطارده الباحثون: كيف نجعل الروبوتات تبني "ذاكرتها العضلية" الخاصة من الصفر؟
إليك HERO، وهو "دماغ روبوتي" جديد يعمل كمتدرب يعلّم نفسه بنفسه. يقدم البحث HERO كنظام يبدأ بصفر من المساعدة البشرية ويتعلم كيفية التعامل مع الأشياء من خلال عملية تطور ذكية مكونة من ثلاث خطوات. فكر في الأمر كأن الروبوت ينمو عبر ثلاث مراحل متميزة. أولاً، يستخدم "الاستدلال الاستكشافي" (Heuristic Reasoning)، وهو يشبه "المخمّن الذكي" الذي يستخدم مكتبة ضخمة من المعرفة لمعرفة كيفية أداء مهمة لم يسبق له رؤيتها من قبل. إذا فشل ذلك أو أصبح بطيئاً، ينتقل إلى "إعادة استخدام النماذج" (Exemplar Reuse)، وهو يشبه تذكر وقت نجح فيه في تحريك جسم مشابه سابقاً، ثم نسخ تلك الحركة مع تعديلها لتناسب الوضع الجديد. وأخيراً، بعد التدريب الكافي، يطور "التنفيذ الانعكاسي" (Reflexive Execution)، وهو ذاكرة عضلية بحتة — رد فعل سريع وتلقائي لا يحتاج إلى تفكير عميق في كل مرة. يوضح البحث أنه من خلال دمج هذه المهارات الثلاث وترك الروبوت يتدرب بمفرده، يمكنه تعلم مهام معقدة مثل تكديس الكتل أو البحث في الأدراج، ليصبح بارعاً فيها لدرجة أنه يكاد لا يحتاج إلى التفكير على الإطلاق.
القصة الجوهرية للبحث: من الصفر إلى الذاكرة العضلية
أراد الباحثون وراء HERO، وهم فريق من جامعة شانغهاي جياوتونغ وجامعة ساسكس، حل مشكلة محددة: معظم الروبوتات اليوم عالقة في وضع "ثابت". فهي إما جيدة جداً في التفكير العام (التحدث عما يجب فعله) لكنها بطيئة وخرقاء في الحركة الفعلية، أو أنها سريعة جداً في الحركة ولكن فقط إذا أريتها بدقة كيف تفعل ذلك أولاً. يحاول HERO سد هذه الفجوة من خلال إنشاء نظام يطور مهاراته الخاصة.
يجادل البحث ضد فكرة أن الروبوتات تحتاج إلى قاعدة بيانات ضخمة من فيديوهات البشر. بدلاً من ذلك، يبدأ HERO بـ صفر من التوضيحات البشرية. يبدأ رحلته باستخدام "المُمهد الاستكشافي" (Heuristic Bootstrapper) (المستوى 1). عندما يواجه مهمة جديدة، مثل "التقط الطرد الأحمر"، يعمل هذا المستوى كالمحقق؛ حيث يستخدم نموذج رؤية ولغة (VLM) — وهو نوع من الذكاء الاصطناعي يفهم الصور والكلمات — للنظر في المشهد، وتخمين مكان الإمساك بالشيء، وتخطيط مسار. إنه ليس مثالياً، وهو بطيء نوعاً ما، لكنه ينجز المهمة دون أي تدريب مسبق.
بمجرد أن يمسك الروبوت بشيء ما بنجاح، فإنه لا ينسى ذلك فحسب، بل يحفظ هذا النجاح كـ "نموذج" (Exemplar). ومع ممارسة الروبوت أكثر، يدخل المرحلة الثانية: "مسرع النماذج" (Exemplar Accelerator) (المستوى 2). الآن، إذا رأى مهمة مشابهة لما قام به من قبل، فإنه لا يحتاج للتخمين مجدداً؛ بل يجد المثال المحفوظ، ويحسب كيفية تمديد أو تدوير تلك الحركة القديمة لتناسب الجسم الجديد، ثم ينفذها. هذا يشبه تذكر كيف فتحت برطماناً معيناً الأسبوع الماضي واستخدام نفس حركة معصمك لبرطمان جديد من نفس الحجم. هذه الخطوة أسرع بكثير من مرحلة التخمين.
المرحلة الأخيرة والأكثر إثارة للإعجاب هي "السياسة الانعكاسية" (Reflexive Policy) (المستوى 3). بعد أن يجمع الروبوت مئات المحاولات الناجحة، يقوم بتدريب نموذج خاص لـ "الذاكرة العضلية". هذا النموذج يتخطى خطوات التفكير والنسخ تماماً؛ فهو ينظر إلى الشيء والهدف ويرسل فوراً الأوامر الصحيحة لذراع الروبوت. هذا هو "التحكم في الحلقة المغلقة" المذكور في البحث، مما يعني أن الروبوت يتحقق باستمرار من حركته ويعدلها في الوقت الفعلي، تماماً مثل الإنسان الذي يمسك كرة دون التفكير في قوانين الفيزياء.
كيف يعمل في العالم الحقيقي
لاختبار ذلك، أعد الباحثون ذراع روبوت من نوع (Franka Emika Panda) في مختبر واقعي مع أربع كاميرات. أعطوه أربعة تحديات مختلفة: التقاط طرود بألوان مختلفة، تكديس كتل بترتيب معين، فتح درج للعثور على "كرواسون" مخفي، وتحريك صناديق للكشف عن لفة ضمادات مخفية.
لم يقم الروبوت بهذه المهام لمرة واحدة فقط؛ بل أجرى دورة مستمرة من التطور الذاتي للقدرات. إليكم الحلقة السحرية:
- المحاولة: يحاول الروبوت أداء مهمة. إذا كانت جديدة، يستخدم وضع "التخمين" (L1).
- الحفظ: إذا نجح، يحفظ الحركة. وإذا كانت مهمة رآها من قبل، فقد يستخدم وضع "النسخ" (L2) ليكون أسرع.
- إعادة الضبط: بعد إنهاء المهمة، يحدد الروبوت تلقائياً كيفية إعادة كل شيء إلى وضع البداية (مهمة عكسية) حتى يتمكن من المحاولة مرة أخرى. لقد فعل ذلك 664 مرة في المجمل!
- التعلم: بمجرد جمع قدر كافٍ من البيانات، قام بتدريب نموذج "الذاكرة العضلية" (L3).
كانت النتائج معبرة للغاية. وجد البحث أن HERO يمكنه جمع هذا الكم الهائل من البيانات دون مساعدة بشرية تقريباً، حيث استغرق حوالي 1.03 ثانية فقط من التدخل البشري لكل مهمة فرعية، وكان ذلك غالباً فقط لإصلاح المشهد إذا تعثر الروبوت. تمكن الروبوت من إكمال 46 دورة متتالية للمهام الفرعية دون أن يلمسه أي بشر.
وعندما اختبروا الروبوت النهائي في هذه المهام، حقق نظام HERO الكامل (باستخدام الطبقات الثلاث) نسبة نجاح بلغت 86.0% عبر المهام الأربعة المختلفة. كان هذا أفضل بكثير من استخدام طبقة واحدة فقط. فعلى سبيل المثال، إذا استخدموا طبقة "التخمين" فقط (L1)، انخفضت نسبة النجاح إلى 76.0%. وإذا استخدموا طبقة "الذاكرة العضلية" فقط (L3)، كانت النسبة 70.0%. يشير البحث إلى أن السر يكمن في المرونة: استخدام الذاكرة العضلية السريعة كلما أمكن، مع وجود مهارات "النسخ" و"التخمين" جاهزة للتدخل عندما تصبح الأمور صعبة أو عندما يواجه الروبوت شيئاً جديداً.
المقايضات والعثرات
يعترف البحث بصراحة بالقيود. طبقة "التخمين" (L1) هي الأبطأ، حيث تستغرق حوالي 46.57 ثانية لكل مهمة فرعية لأنها تحتاج إلى الكثير من التفكير العميق ورسم الخرائط ثلاثية الأبعاد. أما طبقة "النسخ" (L2) فهي أسرع بواقع 20.96 ثانية، وطبقة "الذاكرة العضلية" (L3) هي الأكثر كفاءة للمهام المتكررة، حيث تستغرق 37.90 ثانية (رغم أن هذا يشمل الوقت الذي يستغرقه الروبوت فعلياً في الحركة، وهي عملية طويلة).
كما حللوا مواضع الخطأ. من بين 120 محاولة للمهام، تم إكمال 73 منها بشكل مثالي دون أي أخطاء. أما الإخفاقات التي حدثت فكانت ناتجة في الغالب عن سوء تقدير الروبوت لمكان الجسم (أخطاء في الإدراك) أو قيام "الدماغ" بتخطيط تسلسل سيء للحركات. ومن المثير للاهتمام أن نظام "المراقبة" كان جيداً جداً؛ فقد حدد بشكل صحيح متى فشلت المهمة في 94.5% من الحالات، مما سمح له بالمحاولة مرة أخرى أو طلب المساعدة.
يشير المؤلفون إلى أنه على الرغم من أن HERO خطوة كبيرة للأمام، إلا أنه ليس مثالياً بعد. فجزء "التخمين" لا يزال بطيئاً وأحياناً يسيء قراءة الشكل ثلاثي الأبعاد للأجسام. كما يعتمد الروبوت حالياً على قائمة محددة مسبقاً من الحركات الأساسية (مثل "الإمساك"، "الدفع"، "السحب") التي صممها البشر في الأصل. لا يمكنه ابتكار أنواع جديدة تماماً من الحركات بمفرده حتى الآن.
الخلاصة
ببساء الكلمات، يثبت HERO أن الروبوت يمكن أن يبدأ من لوح فارغ، ويتعلم من خلال التجربة، وفي النهاية يطور "ذاكرته العضلية" الخاصة دون الحاجة إلى إنسان يمسك بيده في كل خطوة. يشير هذا إلى أن مستقبل الروبوتات لا يقتصر فقط على صنع أدمغة أذكى أو أذرع أقوى، بل يتعلق بإنشاء أنظمة يمكنها الانتقال بسلاسة بين التفكير، والنسخ، والاستجابة مع اكتسابها للخبرة. لا يدعي البحث أنه حل جميع مشاكل الروبوتات، لكنه يقدم مساراً واعداً لآلات يمكنها التعلم والتكيف حقاً في عالمنا الفوضوي وغير المتوقع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.