ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors
يُعد ExpertGen إطار عمل قابل للتوسع للنقل من المحاكاة إلى الواقع، حيث يقوم بأتمتة تعلم سياسة الخبير عبر تهيئة سياسة انتشار مجمدة باستخدام نماذج سلوكية سابقة غير مثالية، ثم صقلها عبر التعلم المعزز لتحقيق معدلات نجاح عالية في مهام المناولة المعقدة دون الحاجة إلى هندسة المكافآت.
المؤلفون الأصليون:Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper
المؤلفون الأصليون: Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper
تخيل أنك تريد تعليم روبوت كيفية أداء مهمة معقدة، مثل تجميع قطعة من الأثاث أو وضع موزة فوق علبة. عادةً، ستحتاج إلى توظيف خبير بشري ليري الروبوت ما يجب فعله بالضبط آلاف المرات. لكن هذا أمر مكلف، وبطيء، ويصعب توسيع نطاقه.
EXPERTGEN هو نظام "معلم روبوت" جديد يحل هذه المشكلة. إنه يشبه مدرباً ذكياً ولا يكلّ، يأخذ بضع محاولات خرقاء وغير مكتملة لمهمة ما، ويحولها إلى أداء بمستوى الخبراء داخل عالم افتراضي قبل أن يلمس الروبوت العالم الحقيقي.
إليك كيف يعمل، مقسماً إلى ثلاث خطوات بسيطة باستخدام تشبيه الطبخ:
1. "الوصفة السيئة" (السلوكيات الأولية غير المكتملة)
تخيل أن لديك وصفة لصنع كعكة، لكنها فوضوية بعض الشيء. ربما كُتبت بواسطة مبتدئ، أو ربما تم إنشاؤها بواسطة ذكاء اصطناعي لم يقم بالخبز كثيراً من قبل.
المشكلة: إذا اتبعت هذه الوصفة بدقة، فقد تخرج الكعكة مائلة، أو قد تنهار. إنها "غير مكتملة".
حل الورقة البحثية: بدلاً من رمي الوصفة، يتعامل EXPERTGEN مع هذه "الوصفة السيئة" كـ نقطة انطلاق. فهو يستخدم نوعاً خاصاً من الذكاء الاصطناعي (يسمى سياسة الانتشار - Diffusion Policy) لتعلم "الإحساس" العام للوصفة. إنه يتعلم الحركات الأساسية، مثل "خلط العجين" أو "وضعه في الفرن"، حتى لو كان التوقيت أو درجة الحرارة غير دقيقة تماماً.
2. "المطبخ الافتراضي" (المحاكاة المتوازية الضخمة)
الآن، تخيل أن لديك مطبخاً سحرياً حيث يمكنك تشغيل 1,000 محاكاة في نفس الوقت.
المشكلة: إذا تركت الروبوت يحاول التعلم من الصفر في هذا المطبخ، فسيصطدم بالجدران، ويسقط الكعكة، ولن يعرف أبداً كيف يخبز. إنه يحتاج إلى دليل.
حل الورقة البحثية: هنا يحدث السحر. يأخذ EXPERTGEN تلك "الوصفة السيئة" (الأولوية غير المكتملة) ويضعها في المطبخ الافتراضي. وهو يستخدم تقنية تسمى توجيه الانتشار (Diffusion Steering).
التشبيه: فكر في حركات الروبوت كأنها نهر يتدفق من منحدر. "الوصفة السيئة" تحدد الاتجاه العام للنهر (فهي تعرف أنه يحتاج للتدفق نحو المحيط/هدف المهمة). ومع ذلك، قد يكون النهر واسعاً جداً أو يصطدم ببعض الصخور.
الإصلاح: يعمل EXPERTGEN مثل مشغل السدود. هو لا يغير مسار النهر بالكامل (لأن ذلك سيجعل الروبوت ينسى الأسلوب البشري)، بل يقوم فقط بتوجيه المياه قليلاً عند بداية التدفق لتوجيهها حول الصخور ونحو الهدف.
النتيجة: يتعلم الروبوت النجاح من خلال إجراء تعديلات طفيفة على نقطة بدايته، مع الحفاظ على الأسلوب "البشري"، لكنه يصلح الأخطاء. يقوم بذلك ملايين المرات في المطبخ الافتراضي حتى يصبح طباخاً ماهراً.
3. "النقل إلى العالم الحقيقي" (من المحاكاة إلى الواقع - Sim-to-Real)
الآن أصبح الروبوت طباخاً ماهراً في المطبخ الافتراضي. ولكن هل يمكنه الطبخ في مطبخ حقيقي مع إضاءة حقيقية، وغبار حقيقي، وطاولات مهتزة حقيقية؟
المشكلة: العوالم الافتراضية مثالية؛ أما العوالم الحقيقية ففوضوية. الروبوت الذي يتم تدريبه في محاكاة مثالية غالباً ما يفشل عندما يرى جسماً حقيقياً.
حل الورقة البحثية: يستخدم EXPERTGEN تقنية تسمى DAgger (التي تبدو كاسم سيف، لكنها في الواقع طريقة تعليمية).
التشبيه: تخيل أن الروبوت الافتراضي (الطباخ الماهر) يعلم روبوتاً طالباً (الطالب) الذي يمتلك كاميرا فقط ولا يملك وصولاً إلى "الحالة السرية" للمطبخ.
العملية: يحاول الطالب الطبخ. وعندما يرتبك أو يرتكب خطأً، يتدخل الطباخ الماهر ويقول: "لا، افعل هذا بهذه الطريقة". يسجل الطالب هذا التصحيح. ويكرران ذلك مراراً وتكراراً.
النتيجة: يتعلم الطالب كيفية التعامل مع الإضاءة وزوايا الكاميرا الفوضوية في العالم الحقيقي من خلال التحقق باستمرار مع الطباخ الماهر. وفي النهاية، يصبح الطالب بارعاً جداً لدرجة أنه يستطيع الطبخ بشكل مثالي بمفرده، حتى لو تغيرت الإضاءة أو اهتزت الطاولة.
لماذا يعد هذا أمراً هاماً؟
لا صداع "هندسة المكافآت": عادةً ما يتطلب تعليم الروبوت من البشر كتابة قواعد معقدة مثل "إذا أسقط الروبوت الكوب، امنحه -1 نقطة". هذا من الصعب ضبطه بدقة. أما EXPERTGEN فيكتفي بالقول: "هل أنهيت المهمة؟ نعم؟ جيد. لا؟ حاول مجدداً". وهو يكتشف الباقي من تلقاء نفسه.
يتعلم من الفشل: معظم الروبوتات تستسلم عندما تفشل. أما EXPERTGEN فيتعلم تحديداً كيفية التعافي من الأخطاء. إذا أسقط الروبوت الموزة، فإنه يتعلم كيفية التقاطها مرة أخرى ووضعها فوق بعضها، بدلاً من مجرد التوقف.
رخيص وسريع: لا تحتاج إلى توظيف بشر لتسجيل آلاف الساعات من الفيديو. يمكنك إنشاء البيانات "غير المكتملة" باستخدام نص برمجي حاسوبي أو نموذج لغوي كبير (LLM)، ثم تترك عملية المحاكاة تقوم بالعمل الشاق.
الخلا الخلاصة
EXPERTGEN يشبه أخذ مسودة أولية لسلوك الروبوت، وتمريرها عبر حلقة ممارسة فائقة السرعة ولا نهائية حيث يتعلم الربوات إصلاح أخطائه بنفسه، ثم تعليم طالب يعتمد على الكاميرا كيفية نسخ ذلك الكمال في العالم الحقيقي.
النتيجة؟ روبوتات يمكنها التعامل مع المهام الفوضوية في العالم الحقيقي (مثل التجميع الصناعي أو التقاط الفاكهة) بنسبة نجاح تزيد عن 90%، حتى عندما تبدأ ببيانات قليلة جداً وبدون خبراء بشريين لتوجيهها خطوة بخطوة.
إليك ملخص تقني مفصل لورقة البحث بعنوان "EXPERTGEN: تعلم سياسة خبير قابلة للتوسع من نقل المحاكاة إلى الواقع باستخدام نماذج سلوك غير كاملة."
1. بيان المشكلة
التحدي الجوهري الذي تعالجه هذه الورقة هو ندرة البيانات عالية الجودة والمستوى الخبير المطلوبة لتدريب سياسات قوية وقابلة للتعميم للنشر في العالم الحقيقي.
العنق الزجاجي: بينما تُظهر نماذج الرؤية واللغة والعمل (VLA) فهماً دلالياً قوياً، فإن ترجمة هذا الفهم إلى تنفيذ فيزيائي موثوق يعوقه نقص تسلسلات الإدراك والعمل المتوافقة زمنياً وذات الحلقة المغلقة. إن جمع بيانات خبيرة من العالم الحقيقي عبر التحكم عن بُعد (teleoperation) مكلف للغاية وبطيء.
قصور أساليب النقل من المحاكاة إلى الواقع (Sim-to-Real) الحالية:
السياسات المبرمجة/المولدة بواسطة النماذج اللغوية الكبيرة (LLM): غالباً ما تفتقر إلى التنوع السلوكي، وتفشل في تغطية حالات الفشل، وتعاني من عدم تطابق الديناميكيات عند النقل إلى الأجهزة الحقيقية.
التعلم التعزيزي القياسي (Standard RL): يصعب توسيع نطاق التعلم التعزيزي لتوليد بيانات خبيرة لأنه يتطلب عادةً هندسة دقيقة لوظائف المكافأة (reward shaping)، مما يتطلب خبرة واسعة في المجال ويحد من القدرة على التوسع عبر مهام متنوعة.
النماذج الأولية غير الكاملة (Imperfect Priors): تجد الطرق الحالية صعوبة في تحسين "العروض التوضيحية غير الكاملة" (مثل تلك التي تعاني من تغطية حالة غير مكتملة أو تفتقر إلى التعافي من الفشل) وتحويلها إلى سياسات خبيرة قوية دون فقدان ضمانات السلامة للبيانات الأصلية.
2. المنهجية: إطار عمل EXPERTGEN
إطار EXPERTGEN هو نظام متكامل مصمم لتحويل مجموعة صغيرة من العروض التوضيحية غير الكاملة إلى سياسات خبيرة عالية الجودة وجاهزة للنقل من المحاكاة إلى الواقع. وهو يعمل عبر ثلاث مراحل متميزة:
المرحلة الأولى: نمذجة السلوك الأولي التوليدي (Generative Behavior Prior Modeling)
المدخلات: مجموعة بيانات صغيرة من العروض التوضيحية "غير الكاملة". يمكن أن تكون هذه العروض مولدة بواسطة النماذج اللغوية الكبيرة (LLMs)، أو سياسات مبرمجة، أو تحكم بشري عن بُعد. قد تظهر هذه العروض تغطية محدودة للحالات، أو تفتقر إلى التعافي من الفشل، أو تعاني من عدم تطابق في الديناميكيات.
النموذج: يتم تدريب سياسة انتشار قائمة على الحالة (State-based Diffusion Policy) على هذه العروض التوضيحية غير الكاملة.
الهدف: إنشاء "سلوك أولي" (πP) يلتقط مسارات الحركة البشرية الممكنة، ولكنه لم يتم تحسينه بعد من أجل نجاح المهمة. يعمل هذا السلوك الأولي كمنظم سلامة (safety regularizer)، مما يضمن بقاء الروبوت ضمن مساحات سلوكية آمنة وممكنة فيزيائياً.
المرحلة الثانية: اكتساب سياسة الخبير عبر توجيه الانتشار التعزيزي (Diffusion Steering RL)
الآلية: يستخدم إطار العمل التعلم التعزيزي لتوجيه الانتشار (DSRL).
بدلاً من ضبط أوزان نموذج الانتشار المدرب مسبقاً (والذي قد يدمر مسار الحركة المتعلم)، يتعلم DSRL سياسة توجيه خفيفة الوزن تعمل على تحسين الضجيج الأولي (z0) الذي يتم تغذيته في نموذج الانتشار.
يظل نموذج الانتشار نفسه مثبتاً (Frozen).
الخوارزمية: يتم تدريب سياسة التوجيه باستخدام FastTD3، وهي خوارزمية تعلم تعزيزي خارج السياسة (off-policy) قابلة للتوسع ومصممة للمحاكاة المتوازية الضخمة (مثل IsaacLab).
المكافأة: يستخدم النظام مكافآت نادرة على مستوى المهمة (نجاح/فشل ثنائي) مع عدم وجود هندسة للمكافأة.
النتيجة: يتعلم وكيل التعلم التعزيزي كيفية توجيه نموذج الانتشار نحو معدلات نجاح عالية في المهام مع الحفاظ على خصائص الحركة الطبيعية والآمنة للأصل. وهذا يتيح التعافي من الفشل القوي والقدرة على التعميم لتهيئات أولية غير مرئية.
المرحلة الثالثة: تقطير سياسة الرؤية والحركة (Visuomotor Policy Distillation - DAgger)
التحدي: تعتمد سياسة الخبير المتعلمة في المرحلة الثانية على معلومات حالة مميزة (مثل وضعيات الأشياء الدقيقة) غير متاحة للروبوتات الحقيقية.
الحل: يتم استخدام عملية تقطير DAgger (تجميع البيانات).
يقوم "المعلم" (الخبير القائم على الحالة) بالتشغيل في المحاكاة لتوليد المسارات.
يقوم "الطالب" (سياسة الرؤية والحركة) بمراقبة المدخلات الخام فقط (صور RGB/سحب النقاط).
يقدم "المعلم" إجراءات تصحيحية للحالات التي يزورها "الطالب"، مما ينشئ مجموعة بيانات تغطي توزيع "الطالب".
النقل من المحاكاة إلى الواقع (Sim-to-Real): يتم تطبيق عشوائية النطاق البصري (Visual Domain Randomization) المكثفة (الأنسجة، الإضاءة، وضعيات الكاميرا) أثناء عملية التقطير لضمان قدرة السياسة النهائية على التعميم في العالم الحقيقي دون الحاجة لمزيد من الضبط الدقيق (نقل صفري - Zero-shot transfer).
3. المساهمات الرئيسية
توجيه الانتشار القابل للتوسع: أثبتت الدراسة أن توجيه الضجيج الأولي لنموذج الانتشار في محاكاة متوازية ضخمة يحافظ على مسار الحركة الطبيعي مع تعزيز معدلات النجاح بشكل كبير تحت ظروف المكافآت النادرة.
إطار عمل متكامل (EXPERTGEN): قدم مساراً يحول عدداً قليداً من العروض التوضيحية غير الكاملة (حتى تلك المولدة بواسطة LLM أو المبرمجة) إلى سياسات خبيرة قوية دون الحاجة لهندسة يدوية للمكافآت.
نقل صفري قوي (Zero-Shot Transfer): أثبتت الدراسة أن السياسات المقطرة عبر DAgger من هؤلاء الخبماء المحاكيين يمكن نشرها على أجهزة حقيقية بنجاح عالٍ، متجاوزة فجوة النقل من المحاكاة إلى الواقع.
الأداء في ظروف المكافآت النادرة: أثبتت الجمع بين نماذج الانتشار الأولية وخوارزمية FastTD3 إمكانية التعلم الفعال في أنظمة المكافآت النادرة حيث يفشل التعلم التعزيزي القياسي غالباً.
4. النتائج التجريبية
تم تقييم إطار العمل على معيارين رئيسيين: ANYTASK (مناولة عامة) و AutoMate (تجميع صناعي).
معدلات النجاح:
ANYTASK: حقق EXPERTGEN أعلى معدلات نجاح عبر جميع المهام الثمانية، حيث وصل إلى ~100% في المهام ذات الأفق القصير (مثل الرفع، فتح الدرج) و 85% في المهام ذات الأفق الطويل، متفوقاً على النماذج المرجعية مثل Residual RL، و Diffusion Policy، ومتغيرات PPO.
AutoMate: حقق معدل نجاح إجمالي قدره 90.5% في مهام إدخال الوتد عالية الدقة، متفوقاً بشكل كبير على جميع النماذج المرجعية.
التعافي من الفشل: تحت تأثير الاضطرابات (فتح عشوائي للملقط، قوى خارجية)، أظهر EXPERKGEN تراجعاً طفيفاً جداً في الأداء (انخفاض بنسبة 0.5% فقط في بعض الحالات)، بينما فشلت سياسات الانتشار الأساسية تماماً (انخفض معدل النجاح إلى الصفر تقريباً).
كفاءة البيانات: يتطلب النظام فقط عدداً صغيراً من العروض التوضيحية غير الكاملة (حوالي 200) لتهيئة نموذج أولي يمكن صقله بفعالية. ويستقر الأداء بعد هذا الحد.
النشر في العالم الحقيقي:
تم النشر على روبوت Franka Emika مع ملقط Robotiq.
سياسة سحابة النقاط (Point-Cloud Policy): حققت نجاحاً بنسبة 75-85% في مهام مثل "رفع الموز"، متفوقة على التعلم السلوكي (BC) القياسي الذي فشل في مهام التمفصل المعقدة.
سياسة RGB: حققت نجاحاً بنسبة 80% في مهمة "رفع الموز" في تجارب النقل الصفري، مما أظهر المتانة تجاه المشتتات البصرية والفوضى.
5. الأهمية
يعالج EXPERTGEN عقبة حرجة في مجال الروبوتات: الانتقال من الفهم الدلالي إلى التنفيذ الفيزيائي الموثوق.
دمقرطة البيانات: يزيل الاعتماد على مجموعات البيانات البشرية الضخمة وعالية الجودة أو هندسة المكافآت المعقدة، مما يسمح للروبوتات بالتعلم من بيانات "غير كاملة" أو اصطناعية.
السلامة والتعميم: من خلال إبقاء نموذج الانتدار الأولي مثبتاً وتوجيه الضجيج فقط، تضمن الطريقة بقاء الروبوت يتحرك بأمان ضمن مسارات حركة بشرية، مما يمنع "النسيان الكارثي" أو الاستكشاف غير الآمن الذي يظهر غالباً في التعلم التعزيزي الصرف.
القابلية للتوسع: يجعل استخدام المحاكاة المتوازية الضخمة والتعلم خارج السياسة (Off-policy) من هذا النهج قابلاً للتوسع عبر مهام متنوعة ومشكلات طويلة الأمد.
الأثر العملي: يوضح النقل الصفري الناجح إلى الأجهزة الحقيقية مساراً قابلاً للتطبيق لنشر سياسات الروبوتات العامة في بيئات العالم الحقيقي غير المنظمة.