Phantom: Training Robots Without Robots Using Only Human Videos
تقدم الورقة البحثية "Phantom"، وهو إطار عمل قابل للتوسع يتيح التدريب بنمط "الصفر محاولة" (zero-shot) لروبوتات المناولة متعددة الأغراض باستخدام فيديوهات العروض البشرية فقط عبر تحويلها إلى بيانات متوافقة مع الروبوت من خلال تقدير وضعية اليد ومحاذاة النطاق البصري، محققةً معدلات نجاح عالية في مهام متنوعة دون الحاجة إلى أي بيانات روبوتية أو ضبط دقيق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد تعليم روبوت القيام بالأعمال المنزلية، مثل كنس الأرضية أو ربط عقدة. عادةً، لتعليم الروبوت، يتعين عليك الإمساك بذراعه وتوجيهه من خلال الحركات آلاف المرات. هذا يشبه محاولة تعليم طفل ركوب الدراجة من خلال دفعه في الحي لساعات كل يوم؛ إنه أمر بطيء، ومكلف، وصعب التنفيذ لكل مهمة ممكنة.
تقترح ورقة بحثية بعنوان "Phantom" (الشبح) طريقاً مختصراً ذكياً: لماذا لا نكتفي بمراقبة البشر وهم يقومون بالأعمال المنزلية ونتظاهر بأن الروبوت هو ذلك الإنسان؟
إليك كيف فعلوا ذلك، باستخدام تشبيهات بسيطة:
1. "محرر الصور السحري" (تحرير البيانات)
أدرك الباحثون أنه بينما نمتلك ملايين الفيديوهات للبشر وهم يفعلون أشياء مختلفة على الإنترنت، فإن الروبوتات لا تستطيع مجرد "المشاهدة". فالروبوت يرى العالم بشكل مختلف عن الإنسان؛ لديه أذرع وقوابض معدنية، وليس لحماً وأصابع. إذا قمت بتدريب روبوت على فيديو لإنسان، فسيصاب الروبوت بالارتباك لأن "المعلم" لا يشبه "الطالب" على الإطلاق.
ولحل هذه المشكلة، صمم المؤلفون "محرر صور سحرياً" رقمياً. إليك العملية:
- الخطوة 1: الممحاة. يأخذون فيديو لإنسان وهو يمد يده نحو جسم ما. باستخدام الذكاء الاصطناعي، يقومون بـ "مسح" ذراع الإنسان ويده رقمياً، مع ملء الخلفية بحيث يبدو وكأن الذراع لم تكن موجودة أبداً.
- الخطوة 2: محرك الدمى. يستخدمون برنامج كمبيوتر لتحديد المكان الذي كانت تتحرك فيه يد الإنسان بدقة.
- الخطوة 3: الاستبدال. يأخذون نموذجاً ثلاثي الأبعاد لذراع روبوت و"يلصقونه" في الفيديو، بحيث يتحرك بنفس الطريقة التي تحركت بها يد الإنسان تماماً.
النتيجة هي فيديو يبدو وكأن روبوتاً يقوم بالمهمة، لكنه في الواقع تم تصويره بواسطة إنسان. ويسمون هذا "عرض الشبح" (Phantom demonstration).
2. "الروح في الآلة" (النشر الصفري - Zero-Shot Deployment)
الجزء الأكثر إثارة للدهشة في اكتشافهم هو أنهم لم يحتاجوا إلى إظهار فيديو واحد حقيقي للروبوت وهو يؤدي المهمة بنفسه. لقد قاموا بتدريب الروبوت فقط على فيديوهات "الشبح" المعدلة هذه.
فكر في الأمر كالتالي: إذا كنت تريد تعلم لعب التنس، فعادة ما تشاهد لاعباً محترفاً. ولكن إذا كنت روبوتاً بجسم مختلف، فقد يكون مشاهدة إنسان أمراً مربكاً. هذه الطريقة تشبه أخذ فيديو للاعب تنس بشري، واستبدال جسده بجسم روبوت رقمياً، ثم تعليم الروبوت لعب التنس من خلال مشاهدة ذلك الفيديو المعدل.
عندما اختبروا ذلك على روبوتات حقيقية (تحديداً روبوتات Franka وKinova)، تمكنت الروبوتات من أداء المهام دون أي ممارسة مسبقة أو ضبط دقيق. كان الأمر كما لو أن الروبوت دخل الغرفة، رأى المهمة، وعرف فوراً ما يجب فعله، بعد أن "درس" فقط فيديوهات البشر المعدلة.
3. ماذا يمكن للروبوت أن يفعل؟
اختبر الباحثون هذه الطريقة في مجموعة متنوعة من المهام الصعبة، مما أثبت نجاحها حتى عندما تكون الأشياء فوضوية أو مرنة:
- الكنس: تحريك المكنسة لدفع القمامة إلى مجرفة الغبار (وهو ما يتضمن تحريك العديد من القطع المتناثرة التي ترتد بشكل غير متوقع).
- ربط العقد: ربط حبل في عقدة إبحار محددة (وهو أمر صعب للغاية لأن الحبال مرنة وتغير شكلها).
- التكديس: تكديس الأكواب بعناية والتي تختلف أحجامها قليلاً.
- التدوير: قلب صندوق دون إسقاطه ببساطة.
في العديد من هذه الاختبارات، نجحت الروبوتات بنسبة تصل إلى 92% من المرات، حتى في غرف لم تزرها من قبل.
4. لماذا هذا مهم (وفقاً للورقة البحثية)
تجادل الورقة بأن هذا النهج يزيل أكبر عقبة في مجال الروبوتات: الحاجة إلى بيانات الروبوت المكلفة.
- الطريقة القديمة: تحتاج إلى روبوت، ومختبر، وإنسان يقضي ساعات في التحكم عن بُعد (teleoperating) في الروبوت لجمع البيانات.
- الطريقة الجديدة (Phantom): تحتاج فقط إلى كاميرا وإنسان. يمكنك تصوير أي شخص، في أي مكان، وهو يؤدي مهمة ما. ثم يقوم الكمبيوتر بكل العمل المتبقي لترجمة حركات البشر إلى تعليمات للروبوت.
يؤكد المؤلفون أن هذا يعمل من أجل "التنفيذ في الحلقة المغلقة" (closed-loop execution)، مما يعني أن الروبوت يمكنه التفاعل مع التغييرات في الوقت الفعلي (مثل تحرك القمامة بشكل غير متوقع)، وليس مجرد اتباع نص مسجل مسبقاً.
ما لا تدعيه الورقة البحثية
من المهم الالتزام بما تقوله الورقة بالفعل:
- هم لم يدّعوا أن هذا يعمل مع كل نوع من أنواع الروبوتات أو كل مهمة ممكنة. لقد ركزوا على المهام التي يمكن للإنسان فيها استخدام "قبضة القرص" (الإمساك بالأشياء بالإبهام والإصبع)، وهو ما يتوافق مع القوابض الموجودة في الروبوتات التي استخدموها.
- هم لم يدّعوا أن هذا مثالي. إذا كانت يد الإنسان مخفية (محجوبة) في الفيديو، فقد يخطئ الكمبيوتر في تقدير موقع اليد، مما قد يربك الروبوت.
- هم لم يدّعوا أن هذا يحل محل الحاجة إلى الروبوتات تماماً؛ فلا يزالون بحاجة إلى روبوت للقيام بالعمل الفعلي. هم فقط أزالوا الحاجة إلى تسجيل البيانات من الروبوت.
باختاً، تقدم الورقة طريقة "الشبح" (Phantom) حيث يمكننا تدريب الروبوتات باستخدام فيديوهات البشر فقط، من خلال استبدال جسم الإنسان بجسم روبوت في اللقطات رقمياً، مما يسمح للروبوتات بتعلم مهارات معقدة دون الحاجة أبداً إلى عرضها عملياً على الروبوت.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.