FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences
تقدم الورقة البحثية FetchMan، وهو مسار نقل من المحاكاة إلى الواقع (sim-to-real) متكامل النهايات يتغلب على قيود الأداء لنسخ السلوك الاصطناعي عبر تحسين السياسات باستخدام التعلم التعزيزي Flow-GRPO، مما يمكّن الروبوت البشري Unitree G1 من تحقيق نسبة نجاح 73.3% في مهام التلاعب الموضعي (loco-manipulation) في مشاهد غير مرئية مسبقاً.
المؤلفون الأصليون:Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui
لطالما كان حلم الروبوت الذي يمكنه السير إلى غرفة، وتحديد جسم معين، ثم التقاطه، هدفاً مركزياً في مجال الروبوتات. لعقود من الزمن، كافح الباحثون لتعليم الآلات هذا النوع من السلوك المعقد لأنه يتطلب عمل مهارتين صعبتين معاً في آن واحد: تحريك الجسم عبر الفضاء واستخدام اليدين للتفاعل مع العالم. وبينما أصبحت الروبوتات جيدة جداً في المشي بمفردها، فإن إضافة القدرة على الوصول إلى الأشياء والإمساك بها مع الحفاظ على التوازن على ساقين يخلق مزيجاً فوضوياً من الفيزياء يصعب برمجته يدوياً بشكل هائل. كما أن جمع البيانات اللازمة لتعليم الروبوت بهذه الطريقة يمثل عقبة ضخية؛ فقيام إنسان بتقديم عرض توضيحي لكل طريقة ممكنة للمشي نحو وعاء والتقاطه في كل غرفة ممكنة قد يستغرق سنوات ويعرض الروبوت لخطر الكسر. ولحل هذه المشكلة، لجأ العلماء إلى المحاكاة الحاسوبية، حيث أنشأوا عوالم رقمية يمكن للروبوتات التدرب فيها ملايين المرات دون خوف من التلف. ومع ذلك، ظل سؤال رئيسي قائماً: هل يمكن لروبوت تم تدريبه بالكامل في عالم رقمي أن يتعلم حقاً كيفية التعامل مع الواقع الفوضوي وغير المتوقع لمنزل حقيقي؟
قام فريق من الباحثين في جامعة كاليفورنيا، لوس أنجلوس، بالتعاون مع شركاء من معهد ألين للذكاء الاصطناحي وجامعة واشنطن، بمعالجة هذا التحدي باستخدام نظام جديد أطلقوا عليه اسم "FetchMan". يركز عملهم على روبوت بشري، وهو "Unitree G1"، الذي يشبه الإنسان في المظهر والحركة. أراد الفريق معرفة ما إذا كان بإمكانهم تعليم هذا الروبوت التنقل في غرفة والتقاط جسم مستهدف بمجرد إظهار آلاف الأمثلة له في محاكاة حاسوبية، ومن ثم جعله يؤدي المهمة بشكل مثالي في العالم الحقيقي دون أي تدريب إضافي. وقد اكتشفوا أن مجرد إظهار المزيد والمزيد من الأمثلة للمهمة للروبوت لم يكن كافياً. فحتى بعد التدريب على أكثر من 150,000 مشهد مختلف، وصل أداء الروبوت إلى سقف ثابت؛ فقد استطاع محاكاة المعلم الرقمي، لكنه لم يستطع تعلم التوقيت الدقيق المطلوب للانتقال بسلاسة من المشي إلى الوصول. فغالباً ما كان الروبوت يحاول الإمساك بالجسم في وقت مبكر جداً أو يتوقف عن المشي في وقت مبكر جداً، ويفشل لأنه كان يحاول تقليد معلم يستخدم معلومات سرية لا يستطيع الروبوت رؤيتها.
ولكسر هذا الحاجز، أضاف الباحثون مرحلة ثانية إلى عملية التدريب. فبدلاً من مجرد نسخ المعلم الرقمي، تركوا الروبوت يتدرب بمفرده في المحاكاة وكافأوه فقط عندما يكمل المهمة بأكملها بنجاح، وهي المشي نحو الجسم والتقاطه. هذه الطريقة، التي تستخدم تقنية تسمى "التعلم التعزيزي"، سمحت للروبوت باكتشاف التوقيت والحركة الصحيحين بمفرده. لقد تعلم المشي بالقرب من الجسم قبل مد يده، مصححاً الأخطاء التي كان يرتكبها عندما كان يكتفي بالمحاكاة فقط. وعندما اختبر الفريق هذا الروبوت المطور في العالم الحقيقي، كانت النتائج مذهلة. فالروبوت، الذي لم يرَ غرفة حقيقية أو جسماً حقيقياً أثناء تدريبه، تمكن من المشي في مساحات غير مألوفة، وتحديد وعاء مستهدف، والإمساك به بنسبة نجاح تجاوزت 73 بالمئة. مثّل هذا تحسناً كبيراً عن طريقة التدريب الأولية، التي لم تنجح إلا بنسبة 57 بالمئة تقريباً في الاختبارات الواقعية.
كما استكشف الباحثون ما إذا كان هذا النهج يمكن أن ينجح مع أنواع مختلفة من الأجسام، وليس الوعاء فقط. فقد دربوا نسخة من النظام للتعرف على أشياء مثل الخبز، والزجاجات، والكتب من خلال إعطاء الروبوت اسم الجسم كدليل. ورغم أن هذه النسخة متعددة الأجسام لم تكن ناجحة تماماً مثل النسخة أحادية الجسم، إلا أنها تمكنت من أداء المهمة في مواقف متنوعة، مما أثبت إمكانية توسيع نطاق هذه الطريقة. تسلط الدراسة الضوء على أنه بينما تعد محاكاة المعلم نقطة انطلاق جيدة، إلا أنها ليست كافية لإتقان المهام الفيزيائية المعقدة. يحتاج الروبوت إلى حرية الاستكشاف والتعلم من نجاحاته وإخفاقاته الخاصة ليفهم حقاً كيفية التحرك في العالم. ومن خلال الجمع بين كم هائل من الممارسة المحاكاتية ومرحلة نهائية من التصحيح الذاتي، أظهر الفريق مساراً واضحاً نحو إنشاء روبوتات يمكنها التكيف مع بيئات جديدة دون الحاجة إلى إنسان يمسك بيدها في كل خطوة.
ملخص تقني: FetchMan
بيان المشكلة
تتناول الورقة البحثية تحدي تدريب سياسات التحكم في الحركة والتلاعب البصري للبشر الآليين (humanoid loco-manipulation) التي يمكنها التعميم على مشاهد وأجسام جديدة دون الحاجة إلى ضبط لكل مشهد على حدة. وبينما أصبح المحاكاة معيارًا قياسيًا في حركة البشر الآليين (المشي، التوازن)، فإن توسيع هذا النطاق ليشمل التحكم في الحركة والتلاعب (loco-manipulation) (المشي أثناء الإمساك بالأشياء وتحريكها) لا يزال أمرًا صعبًا. وتتمثل العقبات الرئيسية في:
ندرة البيانات: جمع البيانات من العالم الحقيقي للبشر الآليين مكلف للغاية ومحفوف بالمخاطر بسبب الحاجة إلى استعادة التوازن الكامل للجسم والإشراف على السلامة.
قيود المحاكاة: تعتمد أساليب المحاكاة الحالية غالبًا على بيئات بصرية مقيدة أو مكافآت معقدة مصممة يدويًا.
فجوة التقليد (The Imitation Gap): غالبًا ما يصطدم التدريب عبر "نسخ السلوك" (Behavior Cloning - BC) باستخدام بيانات اصطناعية بسقف أداء معين. ويُعزى ذلك إلى "المعلومات المميزة" (privileged information) الموجودة في الموضحين المبرمجين (مثل متغيرات الطور المخفية) التي لا تستطيع السياسة ملاحظتها، مما يؤدي إلى حركة غير مستمرة وعدم القدرة على تعلم الانتقال الصحيح بين مرحلتي التنقل والتلاعب.
المنهجية
يقترح المؤلفون FetchMan، وهو مسار عمل (pipeline) لنقل السياسة من المحاكاة إلى الواقع (sim-to-real) يعمل من البداية إلى النهاية، تم تدريبه بالكامل في المحاكاة ونُشر بدون تدريب مسبق (zero-shot) على روبوت بشري حقيقي من نوع Unitree G1. يتكون النهج من أربعة مكونات رئيسية:
1. توليد البيانات (FetchMan-Bench)
النطاق: يولد مسار العمل أكثر من 150,000 حلقة (episode) عبر مشاهد داخلية مولدة إجرائيًا (باستخدام MolmoSpaces) وأجسام متنوعة.
الموضح المبرمج (Scripted Demonstrator): يقوم متحكم كامل الجسم يتمتع بامتيازات (πctrl) بحل المهام باستخدام حالة مخفية (مثل وضعية الجسم، شبكات الإشغال، وفهارس الطور). يقوم بالتنقل عبر تخطيط المسار باستخدام خوارزمية A* والتلاعب عبر تسلسل طوري منفصل (الوصول، الهبوط، الإغلاق، الرفع).
تعشية النطاق (Domain Randomization): لضمان التعميم البصري، تخضع كل حلقة لتعشية مستقلة للأنسجة، والإضاءة، والخصائص الداخلية والخارجية للكاميرا، وارتفاعات الأسطح، وضجيج الحركة.
خليط الحلقات: تتضمن مجموعة البيانات 80% من حلقات "الجلب" (التنقل + الإمساك) و20% من حلقات "الاكتفاء بالاختيار" (الإمساك فقط) لتعشية التكوينات الأولية للجزء العلوي من الجسم.
2. بنية السياسة (Policy Architecture)
الملاحظات: تتلقى السياسة (πθ) صورة RGB "عين السمكة" مثبتة على الرأس، وصورة RGB مثبتة على المعصم، ومتجهًا للحس العميق (proprioceptive vector) (ارتفاع القاعدة، الالتفاف/الميل، وضعيات مفاصل الجزء العلوي من الجسم، وفتحة القابض).
النموذج: بنية Flow-Matching DiT (Diffusion Transformer).
الرؤية: يقوم عمود فقري من نوع DINOv3 ViT (مجمد) بتشفير المدخلات البصرية.
رأس الحركة (Action Head): يقوم المحول (transformer) بعملية الربط المتقاطع (cross-attention) مع رموز الرؤية والحالة للتنبؤ بكتلة من الحركات المكونة من 15 بُعدًا (سرعة القاعدة، ارتفاع القاعدة، أهداف مفاصل الخصر/الذراع، وفتحة القابض).
واجهة التحكم: تخرج السياسة أوامر عالية المستوى يتتبعها متحكم الجزء السفلي من الجسم المدرب مسبقًا SONIC (للتوازن/المشي)، ومتحكم PD للجزء العلوي، مما يقلل مساحة الحركة من 29 عزم دوران للمفاصل إلى 15 أمرًا ذا معنى.
3. مسار التدريب ذو المرحلتين
يعالج التدريب فجوة التقليد من خلال عملية محددة من مرحلتين:
المرحلة 1: التدريب المسبق بالتقليد (نسخ السلوك - BC): يتم تدريب السياسة على 150 ألف عرض توضيحي اصطناعي. يوفر هذا أولوية قوية لمشكلة التحكم عالية الأبعاد، لكنه محدود بهيكل الطور المخفي للموضح المبرمج.
المرحلة 2: صقل Flow-GRPO: لكسر سقف الأداء، يتم صقل السياسة باستخدام Flow-GRPO (تحسين السياسة النسبي للمجموعات - Group-Relative Policy Optimization - المُكيف لسياسات مطابقة التدفق).
الآلية: يتم إعادة ضبط مجموعات من البيئات لمهام متطابقة. تقوم السياسة بتنفيذ مسارات مع حقن الضجيج. يتم حساب الميزة (advantage) بناءً على العوائد النسبية للمجموعة (النجاح مقابل الفشل) بدلاً من دالة قيمة متعلمة.
المكافأة: تُستخدم مكافأة متفرقة (sparse reward) واحدة (1 للنجاح في الجلب، 0 خلاف ذلك)، لتجنب تشكيل المكافأة لكل خطوة.
النتيجة: تسمح هذه المرحلة للسياسة بتعلم انتقالات الطور الضمنية (الانتقال من التنقل إلى التلاعب) التي اعتمد عليها الموضح المبرمج باستخدام الحالة المخفية، مما "يصلح" فعليًا الآثار الهيكلية التي تركها نسخ السلوك.
4. التوسيع متعدد الأجسام
يتم توسيع الوصفة لتشغيل نسخة مشروطة بالنص للتعميم على أجسام متعددة. يستخدم هذا النموذج عمودًا فقريًا من نوع dino.txt لربط أسماء الأجسام (مثل "وعاء"، "قدر") بالرموز البصرية، مما يمكّن من الإمساك بالأجسام من فئات متنوعة دون تدريب مسبق (zero-shot).
النتائج الرئيسية
تقيم ورقة البحث FetchMan على FetchMan-Bench (معيار محاكاة) وتنشره على روبوت Unitree G1 حقيقي.
سقف التقليد: أدى توسيع نطاق نسخ السلوك (BC) من 5 آلاف إلى 150 ألف عرض توضيحي إلى تحسين معدل النجاح (SR) من 40% إلى 67% في المحاكاة، لكن الأداء استقر عند 67%، مما يؤكد أن زيادة البيانات وحدها لا يمكنها التغلب على فجوة المعلومات المميزة.
اختراق RL: تطبيق Flow-GRPO على نقطة تفتيش الـ 150 ألف BC رفع معدل نجاح الحركة والتلاعب في المحاكاة إلى 83%.
الأداء في العالم الحقيقي (Zero-Shot):
الجسم الواحد: حقق النموذج النهائي 73.3% في نجاح الحركة والتلاعب على روبوت Unitree G1 الحقيقي عبر مشاهد غير مرئية، دون أي بيانات تدريب من العالم الحقيقي.
الدراسة الاستقصائية (Ablation): استبدال DINOv3 بـ SigLIP أو استخدام أهداف الحركة المطلقة بدلاً من أهداف الحركة النسبية (delta targets) أدى إلى انهيار الأداء في العالم الحقيقي (انخفاض إلى 0% في معدل نجاح الحركة والتلاعب)، مما يسلط الض الضوء على ضرية الميزات الهندسية ومعلمات الحركة النسبية.
متعدد الأجسام: يحقق النموذج المشروط بالنص معدل نجاح (SR) بنسبة 62% في المحاكاة (أقل من 83% للنموذج أحادي الجسم بسبب تعقيد المهمة) ويظهر نجاحًا في عمليات الجلب المختلفة (مثل القدور، الخبز، الزجاجات) على الروبوت الحقيقي، وإن كان بقدر أقل من المتانة مقارنة بسياسة الجسم الواحد.
الأهمية والادعاءات
تدعي الورقة تقديم أول مسار عمل من البداية إلى النهاية (end-to-end) للنقل من المحاكاة إلى الواقع للتحكم في الحركة والتلاعب البصري للبشر الآليين، والذي يعمم عبر مشاهد متنوعة دون ضبط لكل بيئة. تكمن أهميتها في:
إثبات حدود النسخ الاصطناعي للسلوك (BC): تُظهر تجريبيًا أن توسيع نطاق العروض التوضيحية الاصطناعية وحده غير كافٍ للتحكم في الحركة والتلاعب بسبب "فجوة التقليد" الناتجة عن متغيرات الطور المخفية في المتحكمات المبرمجة.
التحقق من فعالية Flow-GRPO للبشر الآليين: تثبت أن صقل سياسة منسوخة باستخدام RL النسبي للمجموعات بمكافأة متفرقة يمكن أن يكسر سقف التقليد، مما يسمح للسياسة بتعلم انتقالات الطور المعقدة (المشي إلى الإمساك) بالكامل في المحاكاة.
وصفة قابلة للتوسع: توفر وصفة قابلة لإعادة الإنتاج (MolmoSpaces + Flow-GRPO) تتوسع من سياسة الجسم الواحد إلى سياسة عامة للأجسام المتعددة، مما يمثل "خطوة أولى" نحو بشر آليين عامين للمهام بهذا النطاق من البيانات.
النشر بدون تدريب مسبق (Zero-Shot Deployment): تؤكد أنه يمكن تحقيق تحكم عالٍ في الحركة والتلاعب على أجهزة حقيقية باستخدام بيانات المحاكاة فقط، بشرط أن يعالج مسار التدريب القيود الهيكلية لتعلم التقليد بشكل صحيح.
يظل المؤلفون متواضعين، مشيرين إلى القيود مثل الطبيعة غير الحالة (stateless) للسياسة (لا يوجد تاريخ)، والمتحكم الثابت للجزء السفلي من الجسم (SONIC)، والتقييد الحالي بمهام الجلب، مما يترك مهام التلاعب الأكثر تعقيدًا والسلوكات ذات الأفق الزمني الأطول للعمل المستقبلي.