Flexible Multitask Learning with Factorized Diffusion Policy
تقدم هذه الورقة إطار عمل جديد لسياسة الانتشار النمطية (modular diffusion policy) يقوم بتحليل توزيعات أفعال الروبوت المعقدة ومتعددة الأنماط إلى مكونات متخصصة، مما يؤدي إلى تحسين ملاءمة السياسة، وتمكين التكيف المرن مع المهام الجديدة، والتخفيف من حدة النسيان الكارثي، مع التفوق على النماذج المتجانسة والنمطية الحالية في كل من بيئات المحاكاة والواقع الفعلي.
المؤلفون الأصليون:Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du
تخيل أنك تحاول تعليم روبوت القيام بالعديد من الوظائف المختلفة: فتح درج، التقاط مكعب أحمر، تعليق كوب على خطاف محدد، وطرق مسمار.
المشكلة: صراع "السكين السويسري" تحاول أدمغة الروبوتات التقليدية (التي تسمى "السياسات المتجانسة") أن تكون بمثابة سكين سويسري واحد ضخم. فهي تحاول تعلم كل هذه المهارات المختلفة في عقل واحد كبير وفوضوي. وهذا أمر صعب لأن أفعال الروبوت تكون متنوعة للغاية. الأمر يشبه محاولة تعليم طالب واحد ليكون طباخاً ماهراً، وعازف بيانو محترفاً، وسائق سيارات سباق في آن واحد. سيصاب الطالب بالارتباك، ويحاول القيام بكل شيء في وقت واحد، وينتهي به الأمر بعدم إتقان أي شيء منها. قد يحاول "إمساك" المطرقة كما لو كانت ملعقة، أو "فتح" الدرج كما لو كان باباً.
الحل: "الفريق المتخصص" (FDP) يقترح المؤلفون طريقة جديدة تسمى "سياسة الانتشار المجزأة" (Factorized Diffusion Policy - FDP). بدلاً من وجود عقل واحد ضخم، تخيل فريقاً من الخبراء المتخصصين.
الخبراء (مكونات الانتشار): يمتلك الروبوت عدة "خبراء" صغيرين ومتخصصين.
الخبير (أ) بارع في "الاقتراب" من الأشياء.
الخبير (ب) بارع في "الإمساك" بالأشياء بلطف.
الخبير (ج) بارع في "الطرق" أو "التعليق".
الخبير (د) بارع في "محاذاة" الأشياء. كل خبير يركز فقط على نوع معين من الحركة أو "المهارة الفرعية".
المدير (الموجه/الراوتر): عندما يرى الروبوت مهمة ما (مثل "تعليق الكوب")، ينظر مدير ذكي (يسمى "الموجه") إلى الموقف. وبدلاً من اختيار خبير واحد فقط للقيام بالمهمة بأكملها، يطلب المدير النصيحة من جميع الخبراء.
يقول المدير: "الخبير (أ)، أنت محق بنسبة 80% بشأن كيفية الاقتراب. الخبير (ب)، أنت محق بنسبة 90% بشأن كيفية الإمساك. الخبير (ج)، أنت محق بنسبة 10% بشأن الزاوية".
يقوم المدير بعد ذلك بخلط كل هذه القطع من النصائح معاً لإنشاء الفعل النهائي المثالي. الأمر يشبه قائد الأوركسترا الذي يمزج بين الآلات المختلفة ليعزف سيمفونية، بدلاً من مطالبة آلة واحدة بعزف الأغنية بأكملها.
لماذا هذا أفضل؟
الاستقرار: لأن المدير يمزج نصائح الجميع بسلاسة (بدلاً من اختيار شخص واحد وتجاهل البقية)، يتعلم الروبوت بشكل أسرع بكثير ولا يصاب بالارتباك. إنه يشبه فريقاً يساهم فيه الجميع، بدلاً من فريق يصرخ فيه شخص واحد فوق الجميع.
عدم "النسيان": هذا هو الفوز الكبير لهذا البحث. إذا أردت تعليم الروبوت مهارة جديدة (مثل "ربط مصباح كهربائي")، فلا يتعين عليك إعادة تدريب الفريق بأكم، بل يكفي أن "توظف" خبيراً جديداً لهذه الوظيفة المحددة ليدخل الفريق. الخبراء القدامى (الذين يعرفون كيفية فتح الأدراج أو تعليق الأكواب) يبقون كما هم تماماً. وهذا يعني أن الروبوت يتعلم المهارة الجديدة دون نسيان مهاراته القديمة، وهي مشكلة تسمى "النسيان الكارثي" التي تعاني منها الطرق الأخرى.
المرونة: إذا احتاج الروبوت للقيام بمهمة معقدة للغاية، يمكن للمدير طلب المزيد من النصائح من المزيد من الخبراء. وإذا كانت المهمة بسيطة، يمكنه الاعتماد على عدد قليل فقط.
إثبات من الواقع اختبر المؤلفون هذا على روبوتات في كل من المحاكاة الحاسوبية والعالم الحقيقي.
في المحاكاة: تفوق فريق الروبوتات (FDP) على الروبوتات ذات "العقل الواحد" وروبوتات "الفريق" الأخرى في مهام مثل فتح الأدراج، وتجميع الأوتاد، والتقاط المظلات.
في العالم الحقيقي: اختبروا ذلك باستخدام ذراع روبوت حقيقية. عندما طُلب منها التقاط مكعب أحمر أو تعليق كوب، كان روبوت (FDP) أكثر نجاحاً ودقة من غيره. غالباً ما كانت الروبوتات الأخرى تتعثر أو تسقط الأشياء لأنها لم تستطع التعامل مع تعقيد المهمة.
الخلاصة يزعم البحث أنه من خلال تقسيم عقل الروبوت المعقد إلى فريق من الخبراء المتخصصين الذين يمكن دمجهم وتغييرهم، يمكن للروبوتات تعلم العديد من المهام بشكل أسرع، وتذكر مهاراتها القديمة بشكل أفضل، والتكيف مع الوظائف الجديدة دون الحاجة إلى تغيير شامل للنظام. إن هذا يحول الروبوت من "عامّ" مرتبك إلى فريق متخصص عالي الكفاءة والقابلية للتكيف.
إليك ملخص تقني مفصل لورقة البحث بعنوان "سياسة الانتشار متعددة المهام المرنة باستخدام الانتشار الموزع" (FDP).
1. بيان المشكلة
تعالج الورقة تحديات التعلم بالتقليد متعدد المهام في مجال الروبوتات، وتحديداً صعوبة نمذجة توزيعات الأفعال شديدة التعدد (multimodal) والمتنوعة.
قيود النماذج المتجانسة (Monolithic Models): تعاني سياسات الشبكة الواحدة التقليدية (مثل سياسة الانتشار القياسية) من صعوبة في التعميم عبر المهام المتنوعة، حيث غالباً ما تفشل في استيعاب التوزيعات المعقدة أو تمثيل أنماط سلوكية متميزة (مثل استراتيجيات الإمساك المختلفة للأجسام المختلفة).
قيود النماذج الوحدوية الموجودة (Modular Models): بينما تحاول بنيات "خليط الخبراء" (Mixture-of-Experts - MoE) تفكيك المهام، إلا أنها تعاني من:
عدم استقرار التدريب: صعوبة في موازنة استخدام الخبراء.
مشكلات التوجيه (Routing): قد يؤدي اختيار الخبير المنفصل إلى "عدم توازن التوجيه" (حيث لا يتم استخدام بعض الخبراء أبداً، بينما يُستخدم البعض الآخر بشكل مفرط).
ضعف القابلية للتفسير: غالباً ما تكون أدوار الخبراء متداخلة أو غير واضحة، وقد تتوزع المهارات عبر الطبقات بدلاً من كونها منفصلة بوضوح.
النسيان الكارثي (Catastrophic Forgetting): التكيف مع مهام جديدة يتطلب غالباً إعادة تدريب النموذج بأكم، مما يهدد بفقدان المهارات التي تم تعلمها مسبقاً.
2. المنهجية: سياسة الانتشار الموزع (FDP)
يقترح المؤلفون FDP، وهي بنية سياسة وحدوية تقوم بتفكيك توزيع الفعل إلى تكوين من نماذج انتشار متخصصة.
أ. البنية الأساسية
التفكيك (Factorization): بدلاً من سياسة واحدة p(at∣ot)، يقوم FDP بنمذجة توزيع الفعل كحاصل ضرب مرجح لـ N من التوزيعات المكونة: p(at∣ot)∝i∏pi(at∣ot)wt,i هنا، كل pi هو نموذج انتشار متخصص (خبير) يلتقط نمطاً سلوكياً متميزاً (مهارة فرعية)، و wt,i هي أوزان تعتمد على الملاحظة.
أخذ العينات التركيبي (Compositional Sampling):
الموجه (Router): شبكة MLP خفيفة الوزن تأخذ الملاحظة ot وتخرج أوزاناً مستمرة {wt,i} لجميع المكونات.
تجميع الدرجة (Score Aggregation): على عكس MoE المنفصل (الذي يختار خبيراً واحداً)، يقوم FDP بتجميع تقديرات الدرجة (تدرجات لوغاريتم الاحتمالية) من جميع المكونات: ∇logp(at∣ot)≈i∑wt,i∇logpi(at∣ot)
عملية إزالة الضجيج (Denoising Process): تستخدم خطوة إزالة الضجيء التكرارية هذا المجموع المرجح للدرجات لتوجيه توليد مسار الفعل. وهذا يقابل أخذ العينات من حاصل ضرب التوزيعات، مما يؤطر توليد الفعل كـ مسألة تحقيق قيود (constraint satisfaction problem).
ب. التدريب والتكيف
التدريب المشترك: يتم تدريب جميع مكونات الانتشار والموجه بشكل كامل (end-to-end) باستخدام خسارة متوسط مربع الخطأ (MSE) على تنبؤ الدرجة المجمعة.
التكيف الفعال (Upcycling): للتكيف مع مهمة جديدة دون إعادة تدريب النموذج بالكامل:
يتم تقديم مكون انتشار جديد.
يتم تهيئة هذا المكون عن طريق الترقية (upcycling) (نسخ الأوزان) من مكون موجود.
يتم ضبط المكون الجديد والموجه فقط (fine-tuning)؛ بينما يتم تجميد جميع المكونات السابقة.
هذا يمنع النسيان الكارثي ويقلل بشكل كبير من عدد المعلمات القابلة للتدريب.
3. المساهمات الرئيسية
بنية وحدوية مبتكرة: قدم FDP، الذي يستخدم تجميع درجات مستمر بدلاً من اختيار الخبراء المنفصل. هذا يضمن استقرار التدريب، ويمنع عدم توازن التوجيه، ويعزز التخصص الواضح بين المكونات.
التفسير الاحتمالي: يستند إلى نماذج الطاقة (EBM) ومطابقة الدرجة (score matching)، مما يوفر صياغة مبدئية حيث يمثل السياسة المركبة تقاطع القيود السلوكية. ចំនួន
استراتيجية تكيف قابلة للتوسع: اقترح آلية "التدريب الانتقائي" باستخدام الترقية (upcycling) والتجميد، مما يتيح توسيع المهارات بكفاءة وبأقل قدر من البيانات ودون نسيان كارثي.
التحقق التجريبي: أظهر أداءً متفوقاً على النماذج المرجعية القوية (الانتشار المتجانس، وسياسة الانتشار المتناثر، وMoDE) في كل من المحاكاة والبيئات الواقعية.
4. النتائج التجريبية
قيم المؤلفون FDP على MetaWorld، و RLBench، و LIBERO، و التحكم الروبوتي في العالم الحقيقي (ذراع UR5e).
أداء المهام المتعددة:
تفوق FDP باستمرار على سياسة الانتشار المتجانسة (DP) والنماذج الوحدوية المرجعية (SDP, MoDE) عبر أكثر من 30 مهمة.
MetaWorld: حقق FDP متوسط نجاح بنسبة 74.8% مقابل 70.8% (DP) و 69.8% (SDP).
RLBench: حقق FMP متوسط نجاح بنسبة 63.9% مقابل 45.6% (DP) و 42.1% (SDP).
العالم الحقيقي: أظهر FDP معدلات نجاح أعلى في المهام المعقدة (مثل تعليق الأكواب، أو التقاط المكعبات الملونة) حيث فشلت النماذج المرجعية بسبب الإفراط في التخصيص (overfitting) أو عدم القدرة على استيعاب التوزيعات متعددة الأنماط.
التكيف مع المهام والنقل:
كفاءة البيانات: عند التكيف مع مهام جديدة ببيانات محدودة (10-25 عرضاً توضيحياً)، تفوق FMP باستخدام استراتيجية "إضافة مكون جديد" على الضبط الدقيق لكامل المعلمات أو الضبط الدقيق الجزئي.
التعلم المستمر: في اختبار تعلم مستمر مكون من 12 مهمة (LIBERO)، حافظ FDP على أداء عالٍ مع إضافة خبراء جدد، بينما تدهورت الطرق الأخرى.
الاحتفاظ بالمعرفة: أدى تجميد المكونات القديمة إلى الحفاظ بفعالية على المهارات السابقة. استخدام مخزن إعادة تشغيل (replay buffer) ضئيل (5 عروض لكل مهمة) سمح للنموذج بالاحتفاظ بما يقرب من 100% من الأداء الأصلي بعد التكيف.
التحليل والتوسع:
توسع المكونات: تحسن الأداء مع زيادة عدد المكونات من 2 إلى 4، ثم استقر.
توسع المهام: اتسعت الفجوة في الأداء بين FDP والنماذج المتجانسة مع زيادة عدد المهام، مما يبرز قدرة FDP على التوسع.
القابلية للتفسير: أظهرت التصورات أن المكونات الفردية تخصصت في مهارات فرعية متميزة (مثل: المحاذاة، الاقتراب، الإمساك) بدلاً من مستويات الضجيج أو الطبقات العشوائية.
سرعة الاستنتاج: يدعم FDP "إعادة البناء الجزئي" (باستاستخدام أفضل k من المكونات)، مما يحقق تسريعاً بمقدار ضعفين (2x) في الاستنتاج مع انخفاض في الأداء بنسبة ~19% فقط.
5. الأهمية
التعلم الروبوتي: يقدم FDP حلاً عملياً لنشر الروبوتات في بيئات ديناميكية حيث يجب أن تتعلم مهارات جديدة بسرعة دون نسيان المهارات القديمة.
الاستقرار: من خلال استبدال التوجيه المنفصل بتكوين الدرجات المستمر، يحل FDP مشكلات عدم استقرار التدريب التي واجهت سياسات MoE القائمة على الانتشار.
القابلية للتفسير: يسمح التفكيك للباحثين بفحص وفهم المهارات الفرعية المحددة (مثل "الإمساك" مقابل "الاقتراب") داخل السياسة، مما يساعد في تصحيح الأخطاء والتحقق من السلامة.
الاتجاهات المستقبلية: يفتح هذا الإطار آفاقاً لتصميمات وحدوية غير متجانسة (خلط البنيات) وأنظمة تعلم مدى الحياة حيث يمكن للروبوتات تجميع مكتبة من المهارات المتخصصة باستمرار.
باختصار، يمثل FDP تقدماً كبيراً في التعلم بالتقليد الروبوتي من خلال الجمع بين القدرة التوليدية لنماذج الانتشار وبنية وحدوية قوية وقابلة للتفسير والتكيف.