← أحدث الأبحاث
🤖 machine learning

DemoDiffusion: One-Shot Human Imitation using pre-trained Diffusion Policy

تُعد DemoDiffusion طريقة تعلم تقليد من محاولة واحدة تُمكّن الروبوتات من أداء مهام مناولة متنوعة عبر الاستفادة من إعادة التوجيه الكينماتيكي لاستخلاص مسار تقريبي من عرض بشري واحد وتطويره باستخدام سياسة انتشار مدربة مسبقاً لضمان التوافق مع أفعال الروبوت المعقولة، مما يحقق معدلات نجاح أعلى بكثير من النهج المرجعية دون الحاجة إلى تدريب خاص بالمهمة أو بيانات مقترنة.

المؤلفون الأصليون: Sungjae Park, Homanga Bharadhwaj, Shubham Tulsiani

نُشر 2026-03-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sungjae Park, Homanga Bharadhwaj, Shubham Tulsiani

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيفية إغلاق جهاز كمبيوتر محمول، لكن ليس لديك الوقت لقضاء أسابيع في برمجته أو تسجيل مئات الساعات من قيام الروبوت بذلك. بدلاً من ذلك، تريد فقط أن تريه مرة واحدة كيف تفعل ذلك بيديك.

هذه هي المشكلة التي يحلها DemoDiffusion. إنه أسلوب جديد يسمح للروبوت بتعلم مهمة معقدة من فيديو واحد فقط لإنسان يقوم بها، دون الحاجة إلى أي تدريب خاص مسبقاً.

إليك كيف يعمل، مشروحاً ببعض التشبيهات من الحياة اليومية:

المشكلة: "وادي الغرابة" في حركة الروبوت

إذا قلت للروبوت ببساطة "انسخ حركات يدي تماماً"، فإنه عادة ما يفشل.

  • التشبيه: تخيل أنك تحاول تعليم طفل صغير (الروبوت) كيفية ربط حذائه من خلال جعله يقلد حركات أصابعك بدقة. الطفل لديه أيدٍ بأحجام مختلفة، وقوة مختلفة، ولا يفهم فيزياء الأربطة. إذا حاول تقليد أصابعك تماماً، فمن المرجح أن يتعثر في الأربطة أو يكسر الحذاء.
  • الواقع: الروبوتات والبشر لديهم أجسام مختلفة (التجسيد - Embodiment). حركة يد الإنسان بطريقة معينة قد تتسبب في اصطدام ذراع الروبوت بالطاولة أو إسقاط جسم ما.

الحل: نهج "المحرر الذكي"

ابتكر المؤلفون نظاماً يسمى DemoDiffusion يعمل مثل "محرر ذكي". يأخذ "المسودة الأولية" الخاصة بالإنسان ويصقلها لتصبح "النسخة النهائية المثالية" التي يمكن للروبوت تنفيذها بالفعل.

يحدث هذا في خطوتين رئيسيتين:

الخطوة 1: المسودة الأولية (إعادة الاستهداف الحركي - Kinematic Retargeting)

أولاً، يشاهد النظام فيديو الإنسان ويحاول مطابقة يد الإنسان مع ذراع الروبوت.

  • التشبيه: فكر في هذا كأنه مترجم يتحدث لغتين لكنه ليس مثالياً. هو يسمعك تقول "أغلق الكمبيوتر المحمول" ويترجمها إلى "أيها الروبوت، تحرك إلى الإحداثيات X، Y، Z".
  • النتيجة: هذا يعطي الروبوت مساراً تقريبياً ليتبعه. إنه يشبه مسار نظام GPS الذي يوصلك إلى الحي الصحيح ولكنه قد يخبرك بالقيادة عبر جدار. إنه يلتقط فكرة الحركة، لكنه ليس آمناً أو دقيقاً بما يكفي ليتمكن الروبوت من تنفيذه بمفرده.

الخطوة 2: المحرر الذكي (سياسة الانتشار - The Diffusion Policy)

هنا يحدث السحر. يستخدم النظام "ذكاءً اصطناعياً عاماً" (عقل روبوت قد شاهد بالفعل ملايين الفيديوهات لروبوتات تقوم بمهام متنوعة).

  • التشبيه: تخيل أن لديك رسماً تخطيطياً أولياً للوحة (مسار الروبوت من الخطوة 1). أنت تسلم هذا الرسم إلى فنان ماهر (سياسة الانتشار) يعرف تماماً كيف يتصرف الطلاء، وكيف يسقط الضوء على اللوحة، وما الذي يجعل اللوحة "جيدة".
  • العملية: الفنان الماهر لا يرمي الرسم التخطيطي، بل يأخذ الرسم، ويضيف إليه القليل من "الضجيج" (الارتباك)، ثم يقوم بعملية إزالة الضجيج (Denoising). إنه يضبط الخطوط بلطف، ويصلح المنظور، وينعم الضربات حتى تبدو اللوحة وكأن إنساناً يمكنه رسمها حقاً.
  • بمصطلحات الروبوت: يأخذ الذكاء الاصطناعي المسار التقريبي، يضيف إليه بعض "الاضطراب" العشوائي، ثم يستخدم معرفته الواسعة بالفيزياء لـ "تنظيف" المسار. إنه يضمن عدم اصطدام الروبوت، ويحافظ على قبضته على الجسم، ويتحرك بسلاسة، كل ذلك مع اتباع الشكل العام لما فعله الإنسان.

لماذا يعد هذا أمراً مهماً؟

  1. التعلم من مرة واحدة (One-Shot Learning): تحتاج فقط لعرض الأمر على الروبوت مرة واحدة. لا حاجة لأن يتدرب الروبوت لساعات.
  2. لا حاجة لبيانات "خاصة بالروبوت فقط": عادةً، لتعليم روبوت ما، تحتاج إلى بيانات لـ روبوتات أخرى وهي تقوم بتلك المهمة المحددة. DemoDiffusion يتخطى هذا. فهو يستخدم عقل روبوت عام يعرف بالفعل كيفية الحركة، ويقوم فقط بتعديله بناءً على الفيديو البشري الخاص بك.
  3. إنه يعمل في العالم الحقيقي: في اختباراتهم، جربوا 8 مهام مختلفة (مثل مسح الطاولة، أو إغلاق الميكروويف، أو التقاط دب قطني).
    • طريقة "المسودة الأولية" (مجرد نسخ الإنسان) نجحت بنسبة 52.5% فقط.
    • "الروبوت العام" (محاولة القيام بالمهمة من الصفر دون الفيديو الخاص بك) نجح بنسبة 13.8% فقط.
    • DemoDiffusion (المحرر الذكي) نجح بنسبة 83.8%.

الخلاصة

فكر في DemoDiffusion كـ شريك رقص تعاوني.

  • أنت (الإنسان) توفر الإيقاع والأسلوب العام للرقصة.
  • الذكاء الاصطناائي (سياسة الانتشار) يوفر ذاكرة العضلات والمعرفة بكيفية التحرك دون التعثر.
  • معاً، تخلقان عرضاً وفياً لفكرتك الأصلية ولكن متكيفاً تماماً مع جسد الروبوت.

هذا يعني أنه في المستقبل، لن تحتاج لأن تكون مهندس روبوتات لبرمجة روبوت. ستتمكن فقط من التقاط جسم ما وإظهار ما يجب فعله له، وسيقوم الروبوت بالباقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →