← أحدث الأبحاث
🤖 AI

Flexible Multitask Learning with Factorized Diffusion Policy

تقدم هذه الورقة إطار عمل جديد لسياسة الانتشار النمطية (modular diffusion policy) يقوم بتحليل توزيعات أفعال الروبوت المعقدة ومتعددة الأنماط إلى مكونات متخصصة، مما يؤدي إلى تحسين ملاءمة السياسة، وتمكين التكيف المرن مع المهام الجديدة، والتخفيف من حدة النسيان الكارثي، مع التفوق على النماذج المتجانسة والنمطية الحالية في كل من بيئات المحاكاة والواقع الفعلي.

المؤلفون الأصليون: Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

نُشر 2026-04-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت القيام بالعديد من الوظائف المختلفة: فتح درج، التقاط مكعب أحمر، تعليق كوب على خطاف محدد، وطرق مسمار.

المشكلة: صراع "السكين السويسري"
تحاول أدمغة الروبوتات التقليدية (التي تسمى "السياسات المتجانسة") أن تكون بمثابة سكين سويسري واحد ضخم. فهي تحاول تعلم كل هذه المهارات المختلفة في عقل واحد كبير وفوضوي. وهذا أمر صعب لأن أفعال الروبوت تكون متنوعة للغاية. الأمر يشبه محاولة تعليم طالب واحد ليكون طباخاً ماهراً، وعازف بيانو محترفاً، وسائق سيارات سباق في آن واحد. سيصاب الطالب بالارتباك، ويحاول القيام بكل شيء في وقت واحد، وينتهي به الأمر بعدم إتقان أي شيء منها. قد يحاول "إمساك" المطرقة كما لو كانت ملعقة، أو "فتح" الدرج كما لو كان باباً.

الحل: "الفريق المتخصص" (FDP)
يقترح المؤلفون طريقة جديدة تسمى "سياسة الانتشار المجزأة" (Factorized Diffusion Policy - FDP). بدلاً من وجود عقل واحد ضخم، تخيل فريقاً من الخبراء المتخصصين.

  1. الخبراء (مكونات الانتشار): يمتلك الروبوت عدة "خبراء" صغيرين ومتخصصين.
  • الخبير (أ) بارع في "الاقتراب" من الأشياء.
  • الخبير (ب) بارع في "الإمساك" بالأشياء بلطف.
  • الخبير (ج) بارع في "الطرق" أو "التعليق".
  • الخبير (د) بارع في "محاذاة" الأشياء.
    كل خبير يركز فقط على نوع معين من الحركة أو "المهارة الفرعية".
  1. المدير (الموجه/الراوتر): عندما يرى الروبوت مهمة ما (مثل "تعليق الكوب")، ينظر مدير ذكي (يسمى "الموجه") إلى الموقف. وبدلاً من اختيار خبير واحد فقط للقيام بالمهمة بأكملها، يطلب المدير النصيحة من جميع الخبراء.
  • يقول المدير: "الخبير (أ)، أنت محق بنسبة 80% بشأن كيفية الاقتراب. الخبير (ب)، أنت محق بنسبة 90% بشأن كيفية الإمساك. الخبير (ج)، أنت محق بنسبة 10% بشأن الزاوية".
  • يقوم المدير بعد ذلك بخلط كل هذه القطع من النصائح معاً لإنشاء الفعل النهائي المثالي. الأمر يشبه قائد الأوركسترا الذي يمزج بين الآلات المختلفة ليعزف سيمفونية، بدلاً من مطالبة آلة واحدة بعزف الأغنية بأكملها.

لماذا هذا أفضل؟

  • الاستقرار: لأن المدير يمزج نصائح الجميع بسلاسة (بدلاً من اختيار شخص واحد وتجاهل البقية)، يتعلم الروبوت بشكل أسرع بكثير ولا يصاب بالارتباك. إنه يشبه فريقاً يساهم فيه الجميع، بدلاً من فريق يصرخ فيه شخص واحد فوق الجميع.
  • عدم "النسيان": هذا هو الفوز الكبير لهذا البحث. إذا أردت تعليم الروبوت مهارة جديدة (مثل "ربط مصباح كهربائي")، فلا يتعين عليك إعادة تدريب الفريق بأكم، بل يكفي أن "توظف" خبيراً جديداً لهذه الوظيفة المحددة ليدخل الفريق. الخبراء القدامى (الذين يعرفون كيفية فتح الأدراج أو تعليق الأكواب) يبقون كما هم تماماً. وهذا يعني أن الروبوت يتعلم المهارة الجديدة دون نسيان مهاراته القديمة، وهي مشكلة تسمى "النسيان الكارثي" التي تعاني منها الطرق الأخرى.
  • المرونة: إذا احتاج الروبوت للقيام بمهمة معقدة للغاية، يمكن للمدير طلب المزيد من النصائح من المزيد من الخبراء. وإذا كانت المهمة بسيطة، يمكنه الاعتماد على عدد قليل فقط.

إثبات من الواقع
اختبر المؤلفون هذا على روبوتات في كل من المحاكاة الحاسوبية والعالم الحقيقي.

  • في المحاكاة: تفوق فريق الروبوتات (FDP) على الروبوتات ذات "العقل الواحد" وروبوتات "الفريق" الأخرى في مهام مثل فتح الأدراج، وتجميع الأوتاد، والتقاط المظلات.
  • في العالم الحقيقي: اختبروا ذلك باستخدام ذراع روبوت حقيقية. عندما طُلب منها التقاط مكعب أحمر أو تعليق كوب، كان روبوت (FDP) أكثر نجاحاً ودقة من غيره. غالباً ما كانت الروبوتات الأخرى تتعثر أو تسقط الأشياء لأنها لم تستطع التعامل مع تعقيد المهمة.

الخلاصة
يزعم البحث أنه من خلال تقسيم عقل الروبوت المعقد إلى فريق من الخبراء المتخصصين الذين يمكن دمجهم وتغييرهم، يمكن للروبوتات تعلم العديد من المهام بشكل أسرع، وتذكر مهاراتها القديمة بشكل أفضل، والتكيف مع الوظائف الجديدة دون الحاجة إلى تغيير شامل للنظام. إن هذا يحول الروبوت من "عامّ" مرتبك إلى فريق متخصص عالي الكفاءة والقابلية للتكيف.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →