← أحدث الأبحاث
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

تقدم الورقة البحثية FetchMan، وهو مسار نقل من المحاكاة إلى الواقع (sim-to-real) متكامل النهايات يتغلب على قيود الأداء لنسخ السلوك الاصطناعي عبر تحسين السياسات باستخدام التعلم التعزيزي Flow-GRPO، مما يمكّن الروبوت البشري Unitree G1 من تحقيق نسبة نجاح 73.3% في مهام التلاعب الموضعي (loco-manipulation) في مشاهد غير مرئية مسبقاً.

المؤلفون الأصليون: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

نُشر 2026-09-01
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كان حلم الروبوت الذي يمكنه السير إلى غرفة، وتحديد جسم معين، ثم التقاطه، هدفاً مركزياً في مجال الروبوتات. لعقود من الزمن، كافح الباحثون لتعليم الآلات هذا النوع من السلوك المعقد لأنه يتطلب عمل مهارتين صعبتين معاً في آن واحد: تحريك الجسم عبر الفضاء واستخدام اليدين للتفاعل مع العالم. وبينما أصبحت الروبوتات جيدة جداً في المشي بمفردها، فإن إضافة القدرة على الوصول إلى الأشياء والإمساك بها مع الحفاظ على التوازن على ساقين يخلق مزيجاً فوضوياً من الفيزياء يصعب برمجته يدوياً بشكل هائل. كما أن جمع البيانات اللازمة لتعليم الروبوت بهذه الطريقة يمثل عقبة ضخية؛ فقيام إنسان بتقديم عرض توضيحي لكل طريقة ممكنة للمشي نحو وعاء والتقاطه في كل غرفة ممكنة قد يستغرق سنوات ويعرض الروبوت لخطر الكسر. ولحل هذه المشكلة، لجأ العلماء إلى المحاكاة الحاسوبية، حيث أنشأوا عوالم رقمية يمكن للروبوتات التدرب فيها ملايين المرات دون خوف من التلف. ومع ذلك، ظل سؤال رئيسي قائماً: هل يمكن لروبوت تم تدريبه بالكامل في عالم رقمي أن يتعلم حقاً كيفية التعامل مع الواقع الفوضوي وغير المتوقع لمنزل حقيقي؟

قام فريق من الباحثين في جامعة كاليفورنيا، لوس أنجلوس، بالتعاون مع شركاء من معهد ألين للذكاء الاصطناحي وجامعة واشنطن، بمعالجة هذا التحدي باستخدام نظام جديد أطلقوا عليه اسم "FetchMan". يركز عملهم على روبوت بشري، وهو "Unitree G1"، الذي يشبه الإنسان في المظهر والحركة. أراد الفريق معرفة ما إذا كان بإمكانهم تعليم هذا الروبوت التنقل في غرفة والتقاط جسم مستهدف بمجرد إظهار آلاف الأمثلة له في محاكاة حاسوبية، ومن ثم جعله يؤدي المهمة بشكل مثالي في العالم الحقيقي دون أي تدريب إضافي. وقد اكتشفوا أن مجرد إظهار المزيد والمزيد من الأمثلة للمهمة للروبوت لم يكن كافياً. فحتى بعد التدريب على أكثر من 150,000 مشهد مختلف، وصل أداء الروبوت إلى سقف ثابت؛ فقد استطاع محاكاة المعلم الرقمي، لكنه لم يستطع تعلم التوقيت الدقيق المطلوب للانتقال بسلاسة من المشي إلى الوصول. فغالباً ما كان الروبوت يحاول الإمساك بالجسم في وقت مبكر جداً أو يتوقف عن المشي في وقت مبكر جداً، ويفشل لأنه كان يحاول تقليد معلم يستخدم معلومات سرية لا يستطيع الروبوت رؤيتها.

ولكسر هذا الحاجز، أضاف الباحثون مرحلة ثانية إلى عملية التدريب. فبدلاً من مجرد نسخ المعلم الرقمي، تركوا الروبوت يتدرب بمفرده في المحاكاة وكافأوه فقط عندما يكمل المهمة بأكملها بنجاح، وهي المشي نحو الجسم والتقاطه. هذه الطريقة، التي تستخدم تقنية تسمى "التعلم التعزيزي"، سمحت للروبوت باكتشاف التوقيت والحركة الصحيحين بمفرده. لقد تعلم المشي بالقرب من الجسم قبل مد يده، مصححاً الأخطاء التي كان يرتكبها عندما كان يكتفي بالمحاكاة فقط. وعندما اختبر الفريق هذا الروبوت المطور في العالم الحقيقي، كانت النتائج مذهلة. فالروبوت، الذي لم يرَ غرفة حقيقية أو جسماً حقيقياً أثناء تدريبه، تمكن من المشي في مساحات غير مألوفة، وتحديد وعاء مستهدف، والإمساك به بنسبة نجاح تجاوزت 73 بالمئة. مثّل هذا تحسناً كبيراً عن طريقة التدريب الأولية، التي لم تنجح إلا بنسبة 57 بالمئة تقريباً في الاختبارات الواقعية.

كما استكشف الباحثون ما إذا كان هذا النهج يمكن أن ينجح مع أنواع مختلفة من الأجسام، وليس الوعاء فقط. فقد دربوا نسخة من النظام للتعرف على أشياء مثل الخبز، والزجاجات، والكتب من خلال إعطاء الروبوت اسم الجسم كدليل. ورغم أن هذه النسخة متعددة الأجسام لم تكن ناجحة تماماً مثل النسخة أحادية الجسم، إلا أنها تمكنت من أداء المهمة في مواقف متنوعة، مما أثبت إمكانية توسيع نطاق هذه الطريقة. تسلط الدراسة الضوء على أنه بينما تعد محاكاة المعلم نقطة انطلاق جيدة، إلا أنها ليست كافية لإتقان المهام الفيزيائية المعقدة. يحتاج الروبوت إلى حرية الاستكشاف والتعلم من نجاحاته وإخفاقاته الخاصة ليفهم حقاً كيفية التحرك في العالم. ومن خلال الجمع بين كم هائل من الممارسة المحاكاتية ومرحلة نهائية من التصحيح الذاتي، أظهر الفريق مساراً واضحاً نحو إنشاء روبوتات يمكنها التكيف مع بيئات جديدة دون الحاجة إلى إنسان يمسك بيدها في كل خطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →