← أحدث الأبحاث
💻 computer science

DreamControl-v2: Simpler and Scalable Autonomous Humanoid Skills via Trainable Guided Diffusion Priors

تقدم هذه الورقة DreamControl-v2، وهو إطار عمل مُحسَّن يدرب نموذج انتشار موجَّه مباشرة في فضاء حركة الروبوت البشري باستخدام بيانات بشرية وروبوتية مجمعة لتمكين مهارات التحكم في الحركة والتلاعب الذاتية بشكل أبسط وأكثر قابلية للتوسع والمتانة دون تصفية يدوية.

المؤلفون الأصليون: Sudarshan Harithas, Sangkyung Kwak, Pushkal Katara, Srujan Deolasee, Dvij Kalaria, Srinath Sridhar, Sai Vemprala, Ashish Kapoor, Jonathan Chung-Kuan Huang

نُشر 2026-04-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sudarshan Harithas, Sangkyung Kwak, Pushkal Katara, Srujan Deolasee, Dvij Kalaria, Srinath Sridhar, Sai Vemprala, Ashish Kapoor, Jonathan Chung-Kuan Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت جديد تماماً القيام بمهام معقدة، مثل فتح درج ثقيل، أو التقاط صندوق أثناء القرفصاء، أو حتى توجيه لكمة. لا تريد برمجة كل حركة عضلة يدوياً؛ لأن ذلك سيستغرق وقتاً طويلاً جداً. بدلاً من ذلك، تريد من الروبوت أن "يحلم" بالحركات أولاً، ثم يتعلم تنفيذها.

تقدم هذه الورقة البحثية DreamControl-v2، وهي طريقة جديدة لتعليم الروبوتات البشرية (الروبوتات التي تشبهنا في الهيئة) كيفية الحركة. لفهم سبب تميزها، دعونا ننظر إلى الطريقة القديمة مقابل الطريقة الجديدة.

الطريقة القديمة: مشكلة "المترجم" (DreamControl v1)

تخيل أنك مخرج تحاول تعليم ممثل روبوت كيفية أداء مشهد ما.

  1. النص (السيناريو): لديك نص مكتوب لممثل بشري (مجموعة بيانات حركة بشرية).
  2. الترجمة: تقوم بتعيين مترجم لتحويل حركات البشر إلى حركات روبوت.
  3. الخلل: المترجم غير دقيق. عندما يقول النص البشري "مد يدك نحو المقبض على ارتفاع قدمين"، قد يخبر المترجم الروبوت بأن يمد يده على ارتفاع قدم ونصف لأن شكل ذراع الروبوت مختلف.
  4. الإصلاح: عليك مراقبة الروبوت، وإدراك أنه أخطأ، ثم إخبار المترجم يدوياً: "حسناً، حاول إخبار البشر أن يمدوا أيديهم نحو المقبض على ارتفاع 3 أقدام بدلاً من ذلك".
  5. الحلقة المفرغة: تكرر عملية "التخمين والتحقق" هذه عشرات المرات حتى يصل الروبوت أخيراً إلى النقطة الصحيحة.

هذا ما كان يفعله الإصدار السابق، DreamControl. فقد استخدم ذكاءً اصطناعياً للحركة البشرية، وحاول ترجمة النتائج إلى روبوت، ثم اضطر البشر لتعديل التعليمات يدوياً حتى تنجح العملية. كانت العملية بطيئة، ومملة، ولا يمكن التوسع بها بشكل جيد.

الطريقة الجديدة: "المتحدث الأصلي" (DreamControl-v2)

يغير DreamControl-v2 قواعد اللعبة من خلال تخطي عملية الترجمة تماماً.

بدلاً من تعليم الذكاء الاصطناعي كيف يتحرك البشر ثم ترجمة ذلك، قام الباحثون بـ تعليم الذكاء الاصطناعي التحدث بلغة "الروبوت" كلغة أم.

إليك كيف فعلوا ذلك:

  1. المكتبة: أخذوا مكتبات ضخمة من بيانات الحركة البشرية (أشخاص يرقصون، يمشون، يفتحون الأبواب) وقبل تدريب الذكاء الاصطنا، قاموا بتحويل كل هذه الحركات رياضياً إلى "لغة الروبوت". لقد قاموا أساساً بإعادة كتابة الحركات البشرية كما لو أن الروبوت هو من قام بها منذ البداية.
  2. التدريب: قاموا بتدريب نموذج ذكاء اصطناعي جديد (نموذج انتشار - Diffusion Model) على هذه البيانات المحولة. الآن، عندما تطلب من هذا الذكاء الاصطناعي "افتح الدرج"، فإنه لا يفكر في يد بشرية؛ بل يفكر في ذراع روبوت.
  3. النتيجة: عندما تعطي الأمر، يقوم الذكاء الاصطناعي بتوليد حركة روبوت مثالية فوراً. لا أخطاء ترجمة، ولا عملية "تخمين وتحقق".

التشبيه: تعلم لغة

  • الطريقة القديمة (DreamControl): تريد طلب الطعام في بلد أجنبي. تتحدث بالإنجليزية إلى مترجم، الذي يتحدث الفرنسية إلى النادل. فيحضر لك النادل حساءً بدلاً من الشطيرة لأن المترجم أساء الفهم. فتضطر للجدال مع المترجم، الذي يحاول مرة أخرى.
  • الطريقة الجديدة (DreamControl-v2): تتعلم الفرنسية مباشرة. تتحدث إلى النادل بالفرنسية. فتحصل على ما طلبته بالضبط، وفوراً.

لماذا هذا مهم (القوى الخارقة)

تسلط الورقة الضوء على ثلاث قوى خارقة رئيسية لهذا النهج الجديد:

  1. إنه تلقائي: لا تحتاج إلى تدخل بشري لتعديل الإعدادات بعد الآن. النظام يستبعد الأفكار السيئة من تلقاء نفسه. إنه يشبه امتلاك مصحح لغوي ذاتي التصحيح يصلح القواعد قبل أن تضغط على زر الإرسال.
  2. إنه أذكى: نظرًا لأنهم غدوا الذكاء الاصطناعي بمزيج ضخم من البيانات (ليس فقط المشي، بل أيضاً التفاعل مع الأشياء مثل الأدراج والخزائن)، فقد تعلم الروبوت مجموعة متنوعة أكبر من المهارات. إنه يشبه طالباً درس الرياضيات فقط مقابل طالب درس الرياضيات والفيزياء والهندسة؛ الطالب الثاني يمكنه حل مشكلات أكثر تعقيداً.
  3. إنه قابل للتوسع: نظرًا لأن العملية مؤتمتة، يمكنك تعليم الروبوت آلاف المهارات الجديدة بسرعة. في الطريقة القديمة، كان إضافة مهارة جديدة يعني ساعات من الضبط اليدوي. أما الآن، فما عليك سوى تغذيته بمزيد من البيانات، وسوف يتعلم.

الاختبار في العالم الحقيقي

اختبر الفريق هذا على روبوت حقيقي يسمى Unitree G1. علموه القيام بـ:

  • فتح درج.
  • القرفصاء بعمق لالتقاط شيء ما.
  • توجيه لكمة.
  • صب مشروب.
  • مسح طاولة بشكل رأسي.

لم يكتفِ الروبوت بمجرد الظهور وكأنه يفعل هذه الأشياء؛ بل قام بها بنجاح فعلي في العالم الحقيقي، دون أن يسقط أو يخطئ الهدف.

الخلاصة

يعد DreamControl-v2 قفزة نوعية في مجال الروبوتات لأنه يتوقف عن محاولة إجبار الروبوتات على محاكاة البشر عبر عملية ترجمة متعثرة. بدلاً من ذلك، يبني "دماغاً روبوتياً" يفهم جسده الخاص منذ البداية. إنه يحول المهمة الصعبة واليدوية لتعليم الروبوتات إلى عملية مؤتمتة وقابلة للتوسع، مما يقربنا خطوة أخرى من روبوتات يمكنها حقاً مساعدتنا في حياتنا اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →