DemoDiffusion: One-Shot Human Imitation using pre-trained Diffusion Policy
تُعد DemoDiffusion طريقة تعلم تقليد من محاولة واحدة تُمكّن الروبوتات من أداء مهام مناولة متنوعة عبر الاستفادة من إعادة التوجيه الكينماتيكي لاستخلاص مسار تقريبي من عرض بشري واحد وتطويره باستخدام سياسة انتشار مدربة مسبقاً لضمان التوافق مع أفعال الروبوت المعقولة، مما يحقق معدلات نجاح أعلى بكثير من النهج المرجعية دون الحاجة إلى تدريب خاص بالمهمة أو بيانات مقترنة.
المؤلفون الأصليون:Sungjae Park, Homanga Bharadhwaj, Shubham Tulsiani
تخيل أنك تريد تعليم روبوت كيفية إغلاق جهاز كمبيوتر محمول، لكن ليس لديك الوقت لقضاء أسابيع في برمجته أو تسجيل مئات الساعات من قيام الروبوت بذلك. بدلاً من ذلك، تريد فقط أن تريه مرة واحدة كيف تفعل ذلك بيديك.
هذه هي المشكلة التي يحلها DemoDiffusion. إنه أسلوب جديد يسمح للروبوت بتعلم مهمة معقدة من فيديو واحد فقط لإنسان يقوم بها، دون الحاجة إلى أي تدريب خاص مسبقاً.
إليك كيف يعمل، مشروحاً ببعض التشبيهات من الحياة اليومية:
المشكلة: "وادي الغرابة" في حركة الروبوت
إذا قلت للروبوت ببساطة "انسخ حركات يدي تماماً"، فإنه عادة ما يفشل.
التشبيه: تخيل أنك تحاول تعليم طفل صغير (الروبوت) كيفية ربط حذائه من خلال جعله يقلد حركات أصابعك بدقة. الطفل لديه أيدٍ بأحجام مختلفة، وقوة مختلفة، ولا يفهم فيزياء الأربطة. إذا حاول تقليد أصابعك تماماً، فمن المرجح أن يتعثر في الأربطة أو يكسر الحذاء.
الواقع: الروبوتات والبشر لديهم أجسام مختلفة (التجسيد - Embodiment). حركة يد الإنسان بطريقة معينة قد تتسبب في اصطدام ذراع الروبوت بالطاولة أو إسقاط جسم ما.
الحل: نهج "المحرر الذكي"
ابتكر المؤلفون نظاماً يسمى DemoDiffusion يعمل مثل "محرر ذكي". يأخذ "المسودة الأولية" الخاصة بالإنسان ويصقلها لتصبح "النسخة النهائية المثالية" التي يمكن للروبوت تنفيذها بالفعل.
يحدث هذا في خطوتين رئيسيتين:
الخطوة 1: المسودة الأولية (إعادة الاستهداف الحركي - Kinematic Retargeting)
أولاً، يشاهد النظام فيديو الإنسان ويحاول مطابقة يد الإنسان مع ذراع الروبوت.
التشبيه: فكر في هذا كأنه مترجم يتحدث لغتين لكنه ليس مثالياً. هو يسمعك تقول "أغلق الكمبيوتر المحمول" ويترجمها إلى "أيها الروبوت، تحرك إلى الإحداثيات X، Y، Z".
النتيجة: هذا يعطي الروبوت مساراً تقريبياً ليتبعه. إنه يشبه مسار نظام GPS الذي يوصلك إلى الحي الصحيح ولكنه قد يخبرك بالقيادة عبر جدار. إنه يلتقط فكرة الحركة، لكنه ليس آمناً أو دقيقاً بما يكفي ليتمكن الروبوت من تنفيذه بمفرده.
الخطوة 2: المحرر الذكي (سياسة الانتشار - The Diffusion Policy)
هنا يحدث السحر. يستخدم النظام "ذكاءً اصطناعياً عاماً" (عقل روبوت قد شاهد بالفعل ملايين الفيديوهات لروبوتات تقوم بمهام متنوعة).
التشبيه: تخيل أن لديك رسماً تخطيطياً أولياً للوحة (مسار الروبوت من الخطوة 1). أنت تسلم هذا الرسم إلى فنان ماهر (سياسة الانتشار) يعرف تماماً كيف يتصرف الطلاء، وكيف يسقط الضوء على اللوحة، وما الذي يجعل اللوحة "جيدة".
العملية: الفنان الماهر لا يرمي الرسم التخطيطي، بل يأخذ الرسم، ويضيف إليه القليل من "الضجيج" (الارتباك)، ثم يقوم بعملية إزالة الضجيج (Denoising). إنه يضبط الخطوط بلطف، ويصلح المنظور، وينعم الضربات حتى تبدو اللوحة وكأن إنساناً يمكنه رسمها حقاً.
بمصطلحات الروبوت: يأخذ الذكاء الاصطناعي المسار التقريبي، يضيف إليه بعض "الاضطراب" العشوائي، ثم يستخدم معرفته الواسعة بالفيزياء لـ "تنظيف" المسار. إنه يضمن عدم اصطدام الروبوت، ويحافظ على قبضته على الجسم، ويتحرك بسلاسة، كل ذلك مع اتباع الشكل العام لما فعله الإنسان.
لماذا يعد هذا أمراً مهماً؟
التعلم من مرة واحدة (One-Shot Learning): تحتاج فقط لعرض الأمر على الروبوت مرة واحدة. لا حاجة لأن يتدرب الروبوت لساعات.
لا حاجة لبيانات "خاصة بالروبوت فقط": عادةً، لتعليم روبوت ما، تحتاج إلى بيانات لـ روبوتات أخرى وهي تقوم بتلك المهمة المحددة. DemoDiffusion يتخطى هذا. فهو يستخدم عقل روبوت عام يعرف بالفعل كيفية الحركة، ويقوم فقط بتعديله بناءً على الفيديو البشري الخاص بك.
إنه يعمل في العالم الحقيقي: في اختباراتهم، جربوا 8 مهام مختلفة (مثل مسح الطاولة، أو إغلاق الميكروويف، أو التقاط دب قطني).
طريقة "المسودة الأولية" (مجرد نسخ الإنسان) نجحت بنسبة 52.5% فقط.
"الروبوت العام" (محاولة القيام بالمهمة من الصفر دون الفيديو الخاص بك) نجح بنسبة 13.8% فقط.
معاً، تخلقان عرضاً وفياً لفكرتك الأصلية ولكن متكيفاً تماماً مع جسد الروبوت.
هذا يعني أنه في المستقبل، لن تحتاج لأن تكون مهندس روبوتات لبرمجة روبوت. ستتمكن فقط من التقاط جسم ما وإظهار ما يجب فعله له، وسيقوم الروبوت بالباقي.
إليك ملخص تقني مفصل لورقة "DemoDiffusion: محاكاة البشر من خلال محاولة واحدة باستخدام سياسة الانتشار المدربة مسبقاً (Pre-trained Diffusion Policy)."
1. بيان المشكلة
تعالج الورقة تحدي نشر أنظمة التلاعب الروبوتية في البيئات البشرية غير المهيكلة. وبينما يمكن للسياسات "العامة" (المدربة على مجموعات بيانات واسعة النطاق) أداء مهام متنوعة، إلا أنها غالباً ما تفشل عند نشرها بنمط "الصفر من التدريب" (zero-shot) في بيئات جديدة أو مهام غير مرئية.
القيود الحالية:
الضبط الدقيق (Fine-tuning): يتطلب تكييف السياسات العامة عادةً جمع عينات تجريبية خاصة بالمهمة للروبوت، وهو أمر يستغرق وقتاً طويلاً ويتطلب تحكماً خبيراً عن بُعد (teleoperation).
إعادة الاستهداف الكينماتيكي (Kinematic Retargeting): إن رسم خرائط مباشرة لوضعيات يد الإنسان إلى نهايات الأطراف الروبوتية (الحلقة المفتوحة) يكون هشاً بسبب عدم التوافق في التجسيد (الإنسان مقابل الروبوت) والافتقار إلى التغذية الراجعة ذات الحلقة المغلقة.
التعلم التعزيزي عبر الإنترنت (Online RL): تتطلب الطرق التي تتعلم من العينات البشرية عبر التعلم التعزيزي عبر الإنترنت ساعات من التفاعل وإعادة الضبط، مما يجعلها غير عملية للنشر في البيئات الحرجة من حيث السلامة أو في العالم الحقيقي.
الهدف: تمكين الروبوت من أداء مهمة تلاعب من خلال محاكاة عرض توضيحي بشري واحد دون الحاجة لتدريب خاص بالمهمة، أو بيانات مقترنة بين الإنسان والروبوت، أو تفاعل عبر الإنترنت.
2. المنهجية: DemoDiffusion
يعمل إطار عمل DemoDiffusion على الاستفضاء من سياسة انتشار عامة مدربة مسبقاً كـ "أولوية" (prior) لتنقية مسار تقريبي مستمد من الحركة البشرية. تعمل الطريقة في مرحلتين رئيسيتين:
أ. إعادة الاستهداف الكينماتيكي (التهيئة)
الاستخراج: يقوم النظام باستخراج مسارات وضعيات اليد ثلاثية الأبعاد {ht} من فيديو عرض بشري واحد (RGBD أو متعدد الزوايا) باستخدام مُقدر وضعية يد أحادي العين مدرب مسبقاً.
الرسم الخرائطي: تقوم دالة رسم خرائط هندسية fretarget بتحويل وضعيات اليد البشرية إلى مسار أولي لنهاية طرف الروبوت {a^t}.
بالنسبة للمقابض (grippers)، تستنتج عرض القبضة بناءً على المسافة بين الإبهام والأصابع.
بالنسبة للأيدي الماهرة (dexterous hands)، تستخدم الكينماتيكا العكسية (IK) لمطابقة مواضع أطراف الأصابع.
القصور: يعمل هذا المسار كتهيئة "تقريبية". وبسبب الاختلافات في التجسيد والافتقار إلى التغذية الراجعة من البيئة، غالباً ما يكون غير مثالي أو غير قابل للتنفيذ مباشرة من قبل الروبوت.
ب. إزالة الضجيج ذات الحلقة المغلقة (التنقية)
الابتكار الجوهري هو استخدام سياسة انتشار مدربة مسبقاً πˉθ لتنقية المسار المعاد استهدافه.
حقن الضجيج: بدلاً من بدء عملية الانتشار بضجيج غاوسي نقي (كما في التوليد القياسي)، يبدأ DemoDiffusion عند خطوة انتشار وسيطة s∗ (0<s∗<S).
يتم تشويه المسار المعاد استهدافه a^t بضجيج غاوسي لإنشاء حالة وسيطة مشوشة: a~t(s∗)=αs∗a^t+1−αs∗ϵt.
إزالة الضجيج التكراري: تقوم سياسة الانتشار المدربة مسبقاً بخطوات عكسية لإزالة الضجيج من s∗ نزولاً إلى $0$.
الاشتراط (Conditioning): في كل خطوة، يتم اشتراط السياسة على ملاحظات الروبوت الحالية (o≤t) ووصف المهمة (T).
الآلية: تقوم السياسة بإزالة الضجيج بشكل تكراري، مما يؤدي فعلياً إلى إسقاط المسار المستمد من الإنسان "التقريبي" على نطاق الأفعال الروبوتية الممكنة.
التنفيذ ذو الحلقة المغلقة: تُنفذ هذه العملية بطريقة الحلقة المغلقة. يستخدم الروبوت ملاحظات الكاميرا في الوقت الفعلي لتصحيح الأخطاء (مثل انزلاق الجسم، أو الحجب، أو عدم محاذاة الوضع الأولي) أثناء عملية إزالة الضجيج.
المعلمة الفائقة الرئيسية (Hyperparameter): تتحكم خطوة الانتشار s∗ في المقايضة بين الأمانة تجاه العرض البشري (عندما تكون s∗ منخفضة) والالتزام بتوزيع سياسة الروبوت (عندما تكون s∗ مرتفعة).
3. المساهمات الرئيسية
محاكاة من محاولة واحدة بدون تدريب: تمكن الطريقة الروبوتات من تعلم مهام جديدة من فيديو بشري واحد دون الحاجة لجمع عينات روبوتية أو ضبط دقيق للسياسة.
سد فجوات التجسيد: من خلال استخدام سياسة انتشار مدربة مسبقاً كأولوية، تقوم الطريقة بتصحيح الأخطاء الهيكلية الناتجة عن إعادة الاستهداف الكينماتيكي، مما يضمن أن الأفعال قابلة للتنفيذ فيزيائياً للروبوت المحدد.
التكيف ذو الحلقة المغلقة: على عكس إعادة الاستهداف مفتوحة الحلقة، يدمج DemoDiffusion تغذية راجعة حسية في الوقت الفعلي، مما يجعله قوياً ضد تغيرات المشهد والضجيج.
التعميم من الصفر (Zero-Shot Generalization): يمكن للنظام أداء مهام تفشل فيها السياسة العامة المدربة مسبقاً تماماً، طالما توفر عرض توضيحي بشري.
4. النتائج التجريبية
أ. المحاكاة (الإمساك الماهر)
الإعداد: تم الاختبار على يد Allegro بـ 16 درجة حرية تمسك أجساماً بأحجام متفاوتة (صغير، متوسط، كبير) من مجموعة بيانات Objaverse.
المقارنة المرجعية (Baselines): إعادة الاستهداف الكينماتيكي مفتوح الحلقة مقابل سياسة الانتشار الأساسية المدربة مسبقاً.
النتائج:
DemoDiffusion: حقق معدل نجاح متوسط قدره 31.0%.
إعادة الاستهداف الكينماتيكي: 1.6% (فشل بسبب عدم توافق التجسيد).
السياسة الأساسية: 26.5% (عانت مع تكوينات أجسام محددة).
النتيجة: تفوق DemoDiffusion بشكل كبير على المراجع، خاصة في الأجسام الصغيرة حيث تكون الدقة بالغة الأهمية.
ب. التلاعب في العالم الحقيقي
الإعداد: ذراع Franka Emika Panda مع مقبض Robotiq. تم التقييم على 8 مهام متنوعة (مثل إغلاق كمبيوتر محمول، مسح طاولة، إغلاق ميكروويف، التقاط دب).
المقارنة المرجعية:
Pi-0: وهي سياسة مطابقة تدفق (flow-matching) متطورة مدربة مسبقاً (من Physical Intelligence).
إعادة الاستهداف الكينماتيكي: التنفيذ المباشر مفتوح الحلقة.
النتائج (متوسط معدل النجاح):
DemoDiffusion:83.8%
إعادة الاستهداف الكتماتيكي: 52.5%
Pi-0 (السياسة الأساسية): 13.8%
الملاحظات الرئيسية:
نجح DemoDiffusion في مهام فشلت فيها السياسة الأساسية (Pi-0) تماماً (مثل "مسح الطاولة" حيث حصلت Pi-0 على 0% وحصل DemoDiffusion على 100%).
تفوق على إعادة الاستهداف الكينماتيكي في المهام التي تتطلب الحفاظ على التلامس الدقيق (مثل "إغلاق الكمبيوتر المحمول": 60% مقابل 10%).
القوة (Robustness): ظلت الطريقة فعالة حتى عندما كانت نقاط اليد ثلاثية الأبعاد مشوشة (مزاحة بمقدار 5 سم) أو عند استخدام منطق إعادة استهداف مبسط (إبهام وسبابة فقط).
5. الأهمية والعمل المستقبلي
الأهمية: يثبت DemoDiffusion أن السياسات العامة المدربة مسبقاً يمكن أن تعمل كـ "أولويات" قوية لتفسير النية البشرية، مما يسد الفجوة بفعالية بين العرض البشري والتنفيذ الروبوتي دون جمع بيانات مكلفة أو تدريب عبر الإنترنت. إنه يقدم آلية نشر عملية للروبوتات في البيئات التي يرتكز فيها وجود الإنسان.
القيود:
يفترض أن الروبوت يجب أن يحاكي الاستراتيجية البشرية (قد لا يعمل إذا كانت هناك استراتيجية مختلفة مطلوبة بسبب القيود الفيزيائية).
لا ينتج سياسة قابلة لإعادة الاستخدام لمتغيرات عشوائية للمهمة (هو عبارة عن محاولة واحدة لكل مهمة).
يعتمد على جودة تقدير وضعية اليد ثلاثية الأبعاد؛ ورغم كونه قوياً ضد الضجيج، إلا أن الأخطاء الشديدة قد تضعف الأداء.
يفترض وجود محاذاة زمنية بين السرعة البشرية وسرعة الروبوت.
الاتجاهات المستقبلية: توسيع الطريقة للتعامل مع عدم المحاذاة الزمنية واستكشاف استخدامها كاستراتيجية استكشاف للتعلم التعزيزي عبر الإنترنت.
في الختام، يمثل DemoDiffusion خطوة هامة نحو النشر الشامل للروبوتات، مما يسمح للمستخدمين غير الخبراء بتعليم الروبوتات مهارات تلاعب جديدة ببساطة عبر عرضها مرة واحدة، مع الاستفادة من ضمانات السلامة والجدوى لنماذج الذكاء الاصطناعي المدربة مسبقاً.