← أحدث الأبحاث
🤖 machine learning

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

يُعد Motus2 نموذج عالم عام ذاتي التطور للمناولة الماهرة، حيث يوحد السياسة والمحاكاة والتقييم في حلقة مغلقة من اتخاذ القرار والتعلم، مستفيداً من بنيات النماذج الموسعة وقواعد البيانات متعددة الوسائط المتوسعة تدريجياً لتمكين التحسين المستمر من خلال كل من عروض الخبراء وبيانات التفاعل ذاتية التوليد.

المؤلفون الأصليون: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiab
نُشر 2026-09-01
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لبناء روبوت يمكنه حقاً التعامل مع عالم المهام البشرية الفوضوي وغير المتوقع، سعى العلماء طويلاً لإيجاد نظام يفعل أكثر من مجرد اتباع قائمة من التعليمات. الهدف هو إنشاء آلة يمكنها إدراك محيطها، وتخيل ما قد يحدث بعد ذلك، واتخاذ إجراء، ثم التعلم من النتيجة لتؤدي بشكل أفضل في المرة القادمة. هذا المفهوم، المعروف باسم "نموذج العالم"، يعمل بمثابة محاكي داخلي للروبوت. فبدلاً من الاكتفاء بالتفاعل مع ما يراه في اللحظة الراهنة، يقوم الروبوت بإجراء عمليات محاكاة ذهنية لتخمين نتيجة حركاته قبل أن يقوم بها بالفعل. وبينما كانت الإصدارات السابقة من هذه الأنظمة قادرة على التنبؤ بالمستقبل أو اقتراح حركة، إلا أنها كانت تعمل غالباً في خط مستقيم: يرى، يخمن، يتحرك، ثم يتوقف. لقد افتقرت إلى وسيلة للنظر إلى الوراء وتقييم توقعاتها، والحكم على ما إذا كانت جيدة أم سيئة، واستخدام ذلك الحكم لتحسين مهارات اتخاذ القرار لديها دون الحاجة إلى إنسان يرشدها في كل مرة.

قدم فريق من الباحثين الآن نظاماً يسمى "Motus2"، وهو دماغ روبوتي ذاتي التطور مصمم خصرياً للمهام الدقيقة والمعقدة مثل استخدام الأدوات أو التعامل مع الأشياء بأيدٍ تشبه الأيدي البشرية. ويمثل هذا النظام خطوة كبيرة للأمام لأنه يغلق الحلقة بين التفكير والتعلم. فبدلاً من كونه مجرد مراقب سلبي أو تابع بسيط، يعمل Motus2 كمعلم لنفسه. فهو يقترح سلسلة من الحركات الممكنة، ويحاكي كيف ستبدو تلك الحركات في المستقبل، ثم يقيم ما إذا كانت تلك النتائج المتخيلة ستؤدي إلى النجاح. إذا أظهرت المحاكاة فشلاً، يتعلم الروبوت من هذا الخطأ. وإذا أظهرت نجاحاً، فإنه يعزز ذلك المسار. تسمح هذه الدورة للروبوت بتحسين "سياسته"، أو مجموعة قواعد العمل الخاصة به، من خلال اختبار أفكاره وصقلها باستمرار، حتى عندما لا يوجد إنسان يوجهه في كل خطوة.

يقوم أساس هذا النظام على كمية هائلة من البيانات التي تم جمعها من الأيدي البشرية. بدأ الباحثون بتعليم الروبوت كيفية تفاعل البشر مع العالم باستخدام فيديوهات مسجلة من منظور الشخص الأول، كما لو كانت الكاميرا مثبتة على رأس الشخص. بدأوا بفيديوهات بسيطة بعدسة واحدة تظهر مجموعة متنوعة من المهام، من الطبخ إلى التنظيم، ثم انتقلوا إلى فيديوهات ستيريو (مجسمة) متزامنة أكثر توفر إحساساً بالعمق، تماماً مثل الرؤية البشرية الثنائية. سمح ذلك للروبوت بتعلم الفيزياء الدقيقة لكيفية إمساك الأيدي بالأشياء ورفعها والتحكم بها. ومع ذلك، فإن مجرد مشاهدة البشر ليس كافياً لروبوت يمتلك جسداً مختلفاً. لذا، قام الباحثون بتوجيه النظام عبر مرحلة تدريب متوسطة حيث تعلم ترجمة تلك الحركات البشرية إلى الميكانيكا المحددة لأذرعه وأيديه الروبوتية. تضمنت هذه العملية عرض آلاف الساعات من البيانات البشرية، متبوعة بأمثلة محددة لكيفية عمل البشر والروبوتات معاً، مما أدى فعلياً إلى جسر الفجوة بين الحدس البشري والتنفيذ الروبوتي.

ما يجعل Motus2 فريداً هو كيفية استخدامه لهذه المعرفة. فالنظام مبني حول نموذج موحد واحد يرتدي ثلاثة قبعات مختلفة في آن واحد. أولاً، يعمل كـ "سياسة"، حيث يقترح الإجراء الواجب اتخاذه تالياً. ثانياً، يعمل كـ "محاكي"، حيث يتنبأ بكيف سيكون شكل العالم بعد اتخاذ هذا الإجراء. ثالثاً، يعمل كـ "مقيم"، حيث يحكم ما إذا كان ذلك المستقبل المتوقع جيداً أم سيئاً. في الأنظمة التقليدية، غالباً ما تكون هذه الوظائف منفصلة أو غير متصلة، ولكنها هنا منسوجة معاً بإحكام. فعندما يفكر الروبوت في حركة ما، فإنه يجري فوراً محاكاة ذهنية لرؤية العواقب. ثم يسأل نفسه عما إذا كانت تلك العاقبة مرغوبة أم لا. إذا كانت الإجابة لا، فإنه يستبعد ذلك المسار ويجرب مساراً آخر. وإذا كانت الإجابة نعم، فإنه يلتزم بالفعل. هذا الحوار الداخلي يحدث بسرعة كبيرة لدرجة أن الروبوت يمكنه التخطيط لعدة خطوات للأمام، واختيار أفضل مسار قبل أن يحرك عضلة واحدة.

اختبر الباحثون هذا النظام على منصة روبوتية كاملة مجهزة بذراعين، ويدين ماهرتين، ومستشعرات يمكنها الشعور باللمس، تشبه أطراف الأصابع البشرية. وقد تحدوا الروبوت بسلسلة من المهام الصعبة، مثل وضع كرة في مكان محدد، أو ربط مصباح في مقبسه، أو تثبيت ممحاة في قلم. وفي هذه الاختبارات، ثبت أن قدرة الروبوت على التعلم من محاكاته الخاصة كانت حاسمة. فعندما سُمح للنظام باستخدام مقيمه الداخلي لاختيار أفضل الخيارات أثناء المهمة، تحسن معدل نجاحه بشكل ملحوظ. والأكثر إثارة للإعجاب هو أنه عندما سُمح للنظام باستخدام تنبؤاته لتحديث قواعد التعلم الخاصة به، أصبح أفضل في تنفيذ المهمة. لم يكن الروبوت محظوظاً فحسب؛ بل تعلم حقاً تجنب الأخطاء التي حاكاها وتكرار الأفعال التي حاكاها لتكون ناجحة.

كان جزء رئيسي من هذا النجاح هو قدرة الروبوت على تذكر ما حدث في وقت سابق من المهمة، حتى لو كانت تلك المعلومات محجوبة عن الرؤية مؤقتاً. ففي العديد من الوظائف المعقدة، قد تحجب يدٌ ما الرؤية عن جسم ما، أو قد تحدث خطوة حاسمة قبل فترة طويلة من رؤية النتيجة النهائية. وللتعامل مع هذا، منح الباحثون الروبوت شكلاً من أشكال الذاكرة العاملة التي يمكنها الاحتفاظ بالتفاصيل البصرية الهامة من الماضي. وقد اختبروا طرقاً مختلفة لإدارة هذه الذاكرة، من الاحتفاظ بنوافذ زمنية قصيرة للأحداث الأخيرة إلى الحفاظ على تاريخ أطول وأكثر تفصيلاً. وأظهرت النتائج أن امتلاك القدرة على الوصول إلى هذا التاريخ الأطول سمح للروبوت بحل مهام تتطلب تذكر تسلسل الأحداث على فترة زمنية أطول، مما أثبت أن القدرة على استرجاع الماضي لا تقل أهمية عن التنبؤ بالمستقبل.

كما تضمن النظام وحدة متخصصة للمس. وبينما تعد الرؤية قوية، إلا أنها لا تستطيع دائماً معرفة ما إذا كانت القبضة تنزلق أو ما إذا كان السطح ناعماً جداً. فقد تم تجهيز الروبوت بنظام خبير خفيف الوزن مخصص لمعالجة التغذية الراجعة اللمسية. سمح هذا للروبوت بصقل حركاته في الوقت الفعلي، وتعديل قبضته في اللحظة التي يشعر فيها بانزلاق أو تغير في الضغط. هذا الجمع بين الرؤية، والشعور، والتفكير، والتعلم خلق نظاماً قوياً قادراً على التعامل مع عدم اليقين في العالم الحقيقي.

تشير النتائج إلى أن الطريق نحو روبوتات قادرة حقاً لا يكمن فقط في جمع المزيد من البيانات، بل في بناء أنظمة يمكنها استخدام تلك البيانات لمساءلة نفسها وتحسين أدائها. ومن خلال دمج بيانات التفاعل البشية واسعة النطاق مع حلقة تصحيح ذاتي من التنبؤ والتقييم، أثبت Motus2 أن الروبوتات يمكنها تعلم كيفية التحكم في العالم المادي بمستوى من التكيف كان بعيد المنال سابقاً. وجد الباحثون أنه مع زيادة كمية بيانات الفيديو الستيريو المستخدمة في التدريب، تحسنت قدرة الروبوت على التنبؤ بالأفعال البشرية بطريقة ثابتة ومتوقعة. ويشير هذا التوسع إلى أنه مع توفر المزيد من البيانات، يمكن لهذه الأنظمة أن تصبح أكثر براعة. في النهاية، يظهر العمل أن الروبوت لا يحتاج إلى أن يتم برمجته بكل حل ممكن لكل مشكلة محتملة. بدلاً من ذلك، إذا كان بإمكانه محاكاة المستقبل، والحكم على النتيجة، والتعلم من الفرق، فإنه يمكنه تطوير مهاراته لمواجهة تحديات عالم معقد وماهر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →