← أحدث الأبحاث
💻 computer science

RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic Manipulation

تُعد RoboCousin منصة محاكاة قابلة للتوسيع تعمل على أتمتة تحويل ملاحظات الكائنات المقدمة من المستخدم إلى أصول متنوعة ودقيقة فيزيائياً ومسارات خبيرة، مما يتيح توليد بيانات واسعة النطاق وقوية للمناولة الروبوتية ثنائية اليد مع نقل فعال من المحاكاة إلى الواقع.

المؤلفون الأصليون: Jingxuan Zhu, Jingyi Li, LiangLiang Chen, Zhiyuan Jing, Jidong Zhang, Hongming Li

نُشر 2026-09-09
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Jingxuan Zhu, Jingyi Li, LiangLiang Chen, Zhiyuan Jing, Jidong Zhang, Hongming Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إن تعليم روبوت استخدام يدين مثل البشر يعد أحد أصعب التحديات في الروبوتات الحديثة. لتعلم مهام معقدة مثل طي الغسيل، أو فتح مرطبان، أو حمل صندوق ثقيل، يحتاج الروبوت إلى رؤية آلاف الأمثلة لكيفية القيام بذلك. وفي العالم الحقيقي، يكون جمع هذه الأمثلة بطيئاً، ومكلفاً، وغالباً ما يكون خطيراً. فإذا أسقط الروبوت كأساً، فستنكسر؛ وإذا قلب كومة من الأطبية، فستكون عملية التنظيف مهمة شاقة. ولهذا السبب، لجأ العلماء إلى المحاكاة الحاسوبية؛ حيث يبنون عوالم افتراضية يمكن للروبوتات التدرب فيها ملايين المرات دون كسر أي شيء. ومع ذلك، كانت هناك مشكلة رئيسية أعاقت هذا المجال: معظم عمليات المحاكاة تشبه غرفاً مغلقة ذات أثاث ثابت. يمكنك تشغيل الروبوت داخل الغرفة كما تشاء، لكن لا يمكنك بسهولة إضافة جسم جديد، مثل كوب قهوة محدد يمتلكه المستخدم، أو تغيير تخطيط الغرفة. وللقيام بذلك، يتعين على مهندس بشري عادةً قضاء ساعات في إعادة بناء شكل الجسم يدوياً، وتحديد وزنه، ومعرفة أين يجب أن تلمسه أصابع الروبوت بالضبط. هذا العمل اليدوي بطيء للغاية لدرجة أنه يمنع إنشاء مجموعات البيانات الضخمة والمتنوعة اللازمة لتعليم الروبوتات لتكون قابلة للتكيف حقاً.

قدم فريق من الباحثين نظاماً جديداً يسمى "RoboCousin" يحل هذه العقبة عن طريق تحويل المحاكاة إلى ورشة عمل مفتوحة وقابلة للتوسع. فبدلاً من إجبار الروبوت على التعلم فقط من قائمة مختارة مسبقاً من الأشياء، يسمح هذا النظام للمستخدم بالتقاط صورة بسيطة لأي جسم أو وصف لغرفة وتحويلها فوراً إلى نموذج ثلاثي الأبعاد واقعي وتفاعلي ليتدرب عليه الروبوت. لا يكتفي النظام بإنشاء صورة جميلة فحسب؛ بل يستنتج تلقائياً الخصائص الفيزيائية للجسم، مثل وزنه ومدى انزلاق سطحه، ويحسب أفضل الأماكن التي يمكن لمقابض الروبوت الإمساك بها. هذه العملية تحول الصورة المسطحة إلى "قريب رقمي" (digital cousin) — وهو نسخة افتراضية تبدو وتتصرف مثل الشيء الحقيقي، ولكنها مرنة بما يكفي لتُخلط مع أشياء وخلفيات أخرى لإنشاء سيناريوهات تدريبية جديدة لا حصر لها.

بنى الباحثون هذا النظام فوق منصة محاكاة موجودة وأضافوا مسار عمل (pipeline) يتعامل مع كل شيء بدءاً من الصورة الأولية وصولاً إلى حركة الروبوت النهائية. عندما يقدم المستخدم صورة لجسم ما، يقوم النظام أولاً بعزل الجسم عن الخلفية ويعيد بناء شكله ثلاثي الأبعاد. ثم يستخدم الذكاء الاصطناعي لتخمين السمات الفيزيائية للجسم، مثل كتلته واحتكاكه، مما يضمن تفاعل الروبوت معه بشكل واقعي. والأهم من ذلك، يحدد النظام تلقائياً "نقاط التلامس"، وهي نقاط محددة على الجسم حيث يمكن ليد الروبوت الإمساك به بأمان وفعالية. في الإعدادات التقليدية، كان على الإنسان تحديد هذه النقاط يدوياً لكل جسم على حدة، وهي عملية مملة تحد من عدد الأشياء التي يمكن إضافتها. في هذا النظام الجديد، يقوم الكمبيوتر بذلك فوراً. والنتيجة هي مكتبة تضم أكثر من 3000 نموذج مختلف من الأشياء و50 بيئة خلفية مختلفة، جميعها جاهزة لاستخدام الروبوت.

ولجعل التدريب أكثر قوة، ينشئ النظام "أقارب رقميين". وبينما يعد "التوأم الرقمي" (digital twin) نسخة دقيقة وصلبة من مشهد حقيقي، فإن "القريب الرقمي" هو نسخة متغيرة تحافظ على العلاقات المهمة ولكن تغير التفاصيل. على سبيل المثال، إذا كان يحتاج الروبوت لتعلم كيفية التقاط زجاجة من فوق طاولة، يمكن للنظام إنشاء مشهد تكون فيه الزجاجة بلون مختلف، والطاولة من مادة مختلفة، والخلفية مطبخاً بدلاً من غرفة معيشة، طالما أن الزجاجة لا تزال موضوعة على الطاولة بطريقة منطقية. هذا النهج يعلم الروبوت المفهوم الجوهري للمهمة بدلاً من مجرد حفظ إعداد محدد واحد. كما يتوسع النظام ليشمل مستوى الغرفة؛ حيث يمكنه تخطيط مسار لروبوت متنقل للتنقل عبر منزل افتراضي، والاقتراب من طاولة، ثم تنفيذ مهمة المناولة، كل ذلك ضمن محاكاة واحدة مستمرة. وهذا يسمح للروبوت بتعلم ليس فقط كيفية تحريك ذراعيه، بل كيفية تحريك جسده بالكامل للوصول إلى المهمة.

اختبر الفريق ما إذا كان هذا النهج المؤتمت يعمل بالفعل في العالم الحقيقي. فقد قاموا بتوليد أكثر من مليون مسار تدريبي باستخدام النظام، ثم قاموا بتدريب روبوت مادي بذراعين لأداء مهام محددة. وكانت النتائج مذهلة. فعندما تم تدريب الروبوت على أشياء أعاد النظام بناءها تلقائياً من الصور، كان أداؤه جيداً بقدر، وفي بعض الحالات أفضل، مما كان عليه عندما تم تدريبه على أشياء صممها خبراء بشريون بعناية. على سبيل المثال، في مهمة التقاط زجاجة، قفز معدل النجاح من 40 بالمئة إلى 80 بالمئة عند استخدام أصول النظام الجديد. علاوة على على ذلك، عندما تم تدريب الروبوت على مجموعة متنوعة من مشاهد "الأقارب" بدلاً من نسخة طبق الأصل واحدة من الغرفة، أصبح أفضل بكثير في التعامل مع المواقف الجديدة. في أحد الاختبارات المتعلقة بالتقاط علبة نظارات، فشل الروبوت الذي تدرب على مشهد واحد مطابق تماماً، بينما نجح الذي تدرب على مشاهد "الأقارب" المتنوعة بنسبة 55 بالمئة.

تحقق الباحثون أيضاً من أن تخمينات الكمبيوتر التلقائية حول مكان الإمساك بالجسم كانت دقيقة. فقد قارنوا نقاط الإمساك التي اقترحها النظام بمجموعة من النقاط التي حددها البشر بعناية. كانت اقتراحات الكمبيوتر أفضل قليلاً، حيث حققت نسبة نجاح بلغت 76 بالمئة في المحاكاة مقارنة بـ 72 بالمئة للنقاط التي حددها البشر. وهذا يثبت أن النظام يمكنه استبدال العملية اليدوية البطيئة لتوسيم الأشياء بعملية مؤتمتة سريعة لا تقل موثوقية عنها. ومن خلال ربط القدرة على تحويل الملاحظات الواقعية إلى أصول محاكاة مع القدرة على توليد سيناريوهات تدريبية متنوعة، يقدم "RoboCousin" مساراً عملياً للمستقبل. فهو يشير إلى أن مستقبل تعلم الروبوتات لا يتطلب انتظار المهندسين لبناء كل جسم جديد يدوياً، بل يعتمد على أنظمة يمكنها الفهم الفوري والتكيف مع العالم المتنوع والمضطرب الذي نعيش فيه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →