← أحدث الأبحاث
💻 computer science

WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors

تقدم الورقة البحثية WholeBodyWAM، وهو نموذج عالم-فعل (world-action model) بشري الهيئة يستفيد من مجموعة حركات ضخمة وغير متجانسة (UniMotion-4K) لتدريب مسبق لنموذج حركة قابل للنقل، مما يعزز بشكل كبير كفاءة البيانات وأداء المهام اللاحقة عند دمجه مع خبراء الفيديو والفعل عبر آلية انتباه "خليط المحولات غير المتماثل" (asymmetric Mixture-of-Transformers attention).

المؤلفون الأصليون: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

نُشر 2026-09-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لجعل الروبوت يتحرك مثل البشر، يواجه المهندسون مشكلة جوهرية: وهي تعليم الآلة كيفية تنسيق جسدها بالكامل، وهو أمر بالغ الصعوبة. فالإنسان لا يفكر في تحريك كل عضلة على حدة عند الوصول إلى كوب أو المشي عبر الغرفة؛ بل يتحرك الجسد كوحدة واحدة انسيابية. أما بالنسبة للروبوتات، فيجب إصدار أوامر لكل مفصل وطرف بشكل منفصل، كما أن جمع ملايين الساعات من بيانات الممارسة اللازمة لتعليم روبوت معين هذه المهارة هو أمر بطيء، ومكلف، وغالباً ما يكون مستحيلاً. وبينما بنى العلماء نماذج قوية يمكنها فهم اللغة ورؤية العالم، إلا أن هذه الأنظمة غالباً ما تعاني في التنبؤ بكيفية تحرك جسد الروبوت نفسه في المستقبل، معتمدة بدلاً من ذلك على رد الفعل تجاه ما يحدث في اللحظة الراهنة. وهذا القصور يجعل من الصعب على الروبوتات أداء مهام معقدة تتطلب التخطيط المسبق، مثل حمل صندوق ثقيل أثناء التنقل في أرض غير مستوية أو الركوع لالتقاط شيء ما دون فقدان التوازن.

لقد عالج فريق من الباحثين هذا التحدي من خلال تعليم الروبوت التعلم من المكتبة الهائلة والمجانية لحركة البشر المتاحة على الإنترنت، بدلاً من الاعتماد فقط على العروض التوضيحية المكلفة من الروبوت نفسه. لقد أنشأوا نظاماً جديداً يسمى WHOLEBODYWAM، والذي يعمل كمحرك تنبؤي لجسد الروبوت. وبدلاً من مجرد مشاهدة فيديو وتخمين ما سيحدث بعد ذلك، يتعلم هذا النظام الفيزياء الكامنة وراء كيفية تحرك الأجساد بمرور الوقت. وقد تم تدريبه على مجموعة ضخمة من بيانات الحركة تسمى UniMotion-4K، والتي تتضمن أكثر من 4,100 ساعة من الحركة المسجلة من فيديوهات بشرية، ومجموعات بيانات متخصصة لالتقاط الحركة ثلاثية الأبعاد، وروبوتات بشرية أخرى. ومن خلال تحويل كل هذه المصادر المختلفة إلى لغة حركة واحدة مشتركة، تعلم النظام "حدساً" عاماً لكيفية انتقال الجسد من وضعية إلى أخرى. وقد نُقل هذا الحدس بعد ذلك إلى روبوت بشري حقيقي، مما سمح له بتوقع حركاته المستقبلية وتنفيذ مهام كاملة الجسم معقدة بمهارة وكفاءة أكبر بكما في الطرق السابقة.

يكمن جوهر هذا العمل في عملية تدريب مكونة من مرحلتين تفصل بين تعلم قواعد الحركة العامة وتعلم كيفية تطبيقها على آلة محددة. في المرحلة الأولى، درس النظام مجموعة البيانات الضخمة لحركة البشر والروبوتات دون أن يرى ولو مثالاً واحداً للأوامر الفعلية للروبوت المستهدف. لقد تعلم التنبؤ بما سيفعله الجسد تالياً بناءً على وصف نصي بسيط للمهمة، مثل "التقط اللعبة" أو "اركع لأسفل". وقد خلق هذا أساساً قوياً، وهو "سابقة تنبؤية" (predictive prior) تفهم الرقص المنسق للأطراف والتوازن المطلوب للحركة الشبيهة بالبشر. وفي المرحلة الثانية، تم دمج هذه المعرفة المسبقة مع وحدة لفهم الفيديو ومولد للأفعال. ثم عُرِض على النظام عدد قليل من العروض التوضيحية للروبوت المحدد، وهو TianGong 3.0، ليتعلم كيفية ترجمة فهمه العام للحركة إلى أوامر المحركات المحددة التي تحتاج مفاصل ذلك الروبوت لتنفيذها. والأهم من ذلك، أن النظام لا يكتفي بمجرد رد الفعل تجاه المشهد الحالي؛ بل يستخدم معرفته المتعلمة لتخيل الحالة المستقبلية لجسده، مستخدماً هذا التنبؤ لتوجيه أفعاله في الوقت الفعلي.

وعند اختباره في ست مهام صعبة من العالم الحقيقي، كانت النتائج مذهلة. طُلب من الروبوت القيام بأفعال مثل التقاط الألعاب، وتحميل الغسيل في الغسالة، ونقل وسادة إلى أريكة، وحمل صندوق إلى طاولة. تطلبت هذه المهام من الروبوت الانحناء، والمشي، والركوع، والتعامل مع الأشياء جميعها في آن واحد. تفوق النظام الجديد على أفضل الطرق الموجودة، محققاً معدل نجاح أعلى بكثير في جميع المهام. فعلى سبيل المثال، في مهمة نقل الصندوق، حيث كان على الروبوت رفع صندوق، والمشي إلى طاولة جانبية، ووضعه، نجح النظام الجديد بنسبة 73.3% من المرات، مقارنة بمعدلات أقل بكثير للنهج الأخرى. ووجد الباحثون أنه كلما زادت كمية بيانات الحركة المستخدمة لتدريب "خبير الحركة" الأولي، كان أداء الروبوت أفضل، مما يشير إلى أن النظام تعلم حقاً مهارة قابلة للتوسع بدلاً من مجرد حفظ أمثلة محددة. والأهم من ذلك، أثبت النظام كفاءة عالية في التعامل مع البيانات؛ فعندما قلل الباحثون كمية العروض التوضيحية المخصصة للروبوت المتاحة للتدريب إلى النصف، ظل الروبوت الذي تم تدريبه مسبقاً على مجموعة بيانات الحركة الضخمة يتفوق في أدائه على الروبوتات الأخرى التي تدربت على المجموعة الكاملة من العروض التوضيحية.

كما أظهر هذا النهج قدرة ملحو ملا لافتة على التعامل مع التغييرات في البيئة. فعندما قام الباحثون بتحريك السلة المستهدفة قليلاً أو تغيير لون وشكل الألعاب التي كان على الروبوت التقاطها، تكيف النظام بسرعة، محافظاً على أداء عالٍ حيث تعثرت النماذج الأخرى. حقق النظام ذلك دون الحاجة إلى إنشاء فيديو للمستقبل، وهو أمر مكلف حاسوبياً وبطيء. بدلاً من ذلك، تنبأ بالمواقع المستقبلية لمفاصله مباشرة، مما سمح له باتخاذ القرارات في حوالي 363 ميلي ثانية، وهي سرعة كافية للتحكم في الوقت الفعلي. وتؤكد الدراسة أنه بينما لا يمكن للروبوت ببساطة تقليد الحركات البشرية لأن جسده مختلف، فإنه يمكنه التعلم من الأنماط الواسعة للحركة البشرية لتطوير فهم تنبؤي قوي لكيفية تحريك جسده. ومن خلال الاستفادة من وفرة بيانات الحركة البشرية المتاحة في العالم، يوفر هذا الأسلത്ഥ مساراً جديداً نحو إنشاء روبوتات بشرية ليست قادرة على أداء مهام معقدة فحسب، بل يمكنها أيضاً تعلمها بعدد أقل بكثير من العروض التوضيحية مما كان يُعتقد سابقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →