Perception-and-action system for humanoid robot task execution in construction
تقترح هذه الورقة نظام إدراك وحركة مبتكر يتكون من Humanoid-PoseNet وHumanoid-ActionNet يُمكّن الروبوتات البشرية من تعلم وتنفيذ مهام البناء بموثوقية من خلال العروض البشرية، محققةً متوسط خطأ في تتبع الحركة يبلغ 82.45 ملم.
تخيل عالماً لا تكون فيه الروبوتات مجرد آلات ضخمة على عجلات أو أذرع مثبتة في الجدرب، بل شركاء يشبهوننا في المظهر والحركة. هذا هو مجال الروبوتات البشرية (humanoid robotics)، وهو مجال يحاول بناء آلات يمكنها السير في مساحاتنا التي صنعها البشر — مثل مواقع البناء، أو المطابخ، أو المكاتب — والقيام بالأعمال الشاقة دون الحاجة إلى دليل تعليمات لكل خطوة. التحدي الكبير؟ البشر فوضويون، مرنون، وفريدون؛ أما الروبوتات فهي دقيقة، صلبة، ومبنية وفق مخططات محددة. إذا حاولت نسخ حركة الإنسان مباشرة على روبوت، فقد يتعثر الروبوت، أو يسقط، أو تكسر مفصله لأن ساقيه أقصر أو وركيه ينثني بشكل مختلف. ولحل هذه المشكلة، يستخدم العلماء إعادة استهداف الحركة (motion retargeting) (وهي طريقة متطورة لقول "ترجمة حركات البشر إلى حركات روبوتات") والتعلم التعزيزي (reinforcement learning) (وهي طريقة يتعلم من خلالها الروبوت عن طريق التجربة والخطأ، حيث يحصل على "مكافآت" للبقاء منتصباً و"عقوبات" للسقوط). الهدف هو السماح للروبوتات بالتعلم من مراقبتنا، حتى تتمكن في النهاية من مساعدتنا في بناء عالمنا، مثل حمل الطوب أو تسلق السلالم تماماً كما يفعل العامل البشري.
دخلت هذه الدراسة الجديدة، التي تعمل بمثادة مترجم بارع ومدرب صارم لروبوت يدعى Unitree G1. أراد الباحثون معرفة ما إذا كان بإمكان روبوت بشري أن يشاهد عامل بناء يؤدي مهمة ما، ويفهم ما يفعله، ثم يقوم به بنفسه دون أن يسقط. لقد بنوا نظاماً يتكون من جزأين لتحقيق ذلك. أولاً، أنشأوا "مترجماً" يسمى Humanoid-PoseNet. فكر في هذا كدماغ كاميرا ذكي للغاية يراقب فيديو لعامل بشري. هو لا يرى شخصاً فحسب؛ بل يحسب بدقة مكان كل مفصل في الفضاء ثلاثي الأبعاد. ولكن الجزء الصعب هنا هو: جسم الإنسان مشكل بشكل مختلف عن جسم الروبوت. لذا، يقوم هذا الدماغ فوراً بإعادة كتابة حركات الإنسان إلى نسخة تناسب شكل جسم الروبوت المحدد، مما يضمن عدم محاولة الروبوت للي مفاصله بطرق مستحيلة.
بمجرد أن يعرف الروبوت ماذا يجب أن يحرك، فإنه يحتاج إلى معرفة كيف يتحرك دون أن يصطدم. وهنا يأتي دور الجزء الثاني، Humanoid-ActionNet. هذا هو المدرب الداخلي للروبوت، والذي تم تدريبه باستخدام طريقة "المعلم والطالب". "المعلم" هو نسخة قوية جداً من الروبوت تعيش في محاكاة حاسوبية وتعرف كل شيء عن الفيزياء (مثل مدى ثقل الطوبة أو مدى انزلاق الأرض). يتعلم المعلم الطريقة المثالية للحركة للحفاظ على التوازن. ثم يقوم بتعليم نسخة "الطالب" من الروبوت. الطالب هو الذي سيخرج فعلياً إلى العالم الحقيقي، لكن لا يُسمح له بالاعتماد على أسرار الفيزياء؛ بل عليه أن يتعلم فقط من خلال الشعور بمفاصله ومراقبة الحركات المستهدفة، تماماً كما سيفعل روبوت حقيقي. وهذا يضمن أنه عندما يغادر الروبوت الحاسوب ويخطو نحو موقع بناء حقيقي، فإنه لن يشعر بالارتباك بسبب الاختلاف بين المحاكاة والواقع.
اختبر الفريق هذا النظام مع 30 مهمة بناء مختلفة، من حمل الأنابيب الثقيلة ورص المواد إلى الإشارة بالأعلام والمشي على أرض غير مستوية. بدأوا بتسجيل خمسة متطوعين بشريين يؤدون هذه المهام في استوديو التقاط الحركة. ثم تركوا نظام الروبوت يتعلم من هذه التسجيلات. كانت النتائج واعدة: نجح الروبوت في تعلم أداء ثماني من هذه الأفعال الإنشائية المعقدة. في عمليات المحاكاة الحاسوبية، تتبع الروبوت الحركات البشرية بمتوسط خطأ قدره حوالي 82.45 ملم (متوسط خطأ موضع المفصل) عبر مفاصله. وعندما وضعوا الروبوت تحت الاختبار في العالم الحقيقي، تمكن من حمل الأنابيب، وحمل كتل الخرسانة، وحتى التلويح بعلم مع الحفاظ على توازنه، مما أثبت أن "الترجمة" و"التدريب" قد نجحا.
ومع ذلك، فإن الورقة البحثية حذرة في عدم تسمية هذا حلاً مثالياً. لاحظ الباحثون أنه بينما استطاع الروبوت القيام بهذه المهام، إلا أنه لم يكن خالياً من العيوب. في المحاكاة، فشلت بعض المحاولات، حيث فقد الروبوت توازنه أو تعثر، خاصة عندما لم تتطابق فيزياء العالم الحقيقي (مثل الاحتكاك أو الوزن) تماماً مع النموذج الحاسوبي. كما أشاروا إلى أن يدي الروبوت ليستا ببراعة يد الإنسان، لذا فبينما يمكنه حمل كتلة، فإنه لا يستطيع بالضرورة الإمساك بها بنفس الدقة التي يمتلكها العامل البشري. تشير الدراسة إلى أن هذا النهج هو خطوة أولى صلبة نحو امتلاك روبوتات يمكنها العمل جنباً إلى جنب معنا في مواقع البناء، ولكن لا يزال هناك الكثير من العمل للقيام به لجعلها موثوقة وقادرة على التكيف مثل البشر الذين يحاولون محاكاتهم. لقد أظهر النظام أنه من الممكن تعليم الروبوت كيف يتحرك مثل العامل، لكن الرحلة من "تعلم المشي" إلى "بناء ناطحة سحاب" لا تزال في بدايتها.
ملخص تقني: نظام الإدراك والعمل للروبوتات البشرية لتنفيذ المهام في قطاع البناء
بيان المشكلة
تُعد مواقع البناء بيئات معقدة، وخطرة، وكثيفة العمالة، حيث تبرز الحاجة المتزايدة للأتمتة لمعالقة مخاطر السلامة ونقص العمالة. ورغم نشر روبوتات متخصصة (مثل بنائي الطوب، أو روبوتات الفحص ذات الأرجل)، إلا أنها غالبًا ما تكون مقتصرة على مهمة واحدة وتفتقر إلى المرونة للتعاون بشكل طبيعي مع العمال البشر في المساحات المصممة للبشر. توفر الروبوتات البشرية (Humanoid Robots) حلاً واعدًا نظرًا لتشريحها الشبيه بالبشر، مما يجعلها تتوافق مع الأدوات وسير العمل الحالي، وبفضل درجات الحرية (DoF) العالية التي تتيح لها القدرة على التكيف مع مهام متعددة.
ومع ذلك، يواجه نشر الروبوتات البشرية في البناء فجوتين تقنيتين رئيسيتين:
عدم التطابق المورفولوجي (الشكلي): تُنتج طرق تقدير وضعية الجسم البشرية الحالية بيانات متمحورة حول الإنسان لا يمكن تطبيقها مباشرة على الروبوتات البشرية بسبب الاختلافات في نسب الأطراف، وهياكل المفاصل، وقيود التشغيل.
الجدوى الفيزيائية: حتى لو تمت إعادة استهداف الحركات البشرية لتناسب هيكل الروبوت البشري، فإن تحويل هذه المراجع الكينماتيكية إلى أفعال كاملة الجسم قابلة للتنفيذ فيزيائيًا—مع الحفاظ على التوازن، واستقرار الاتصال، والجدوى الديناميكية في بيئات البناء الغنية بالتلامس—يظل تحديًا كبيرًا.
المنهجية
يقترح المؤلفون نظام الإدراك والعمل القائم على الرؤية (VPA) المصمم لتمكين الروبوتات البشرية من تعلم مهام البناء مباشرة من عروض العمال التوضيحية. يتكون النظام من وحدتين للتعلم العميق: Humanoid-PoseNet و Humanoid-ActionNet.
1. Humanoid-PoseNet: الإدراك وإعادة الاستهداف
تعمل هذه الوحدة على سد الفجوة بين العروض المرئية للعمال والوضعيات القابلة للتنفيذ من قبل الروبوت. وتتكون من شبكتين فرعيتين:
تقدير الوضعية البشرية ثلاثية الأبعاد: تستخدم نماذج جاهزة (تم اختيار PoseNet تحديدًا كخيار أمثل) لإعادة بناء النقاط المفصلية البشرية ثلاثية الأبعاد من إطارات فيديو RGB ثنائية الأبعاد.
إعادة استهداف الإنسان إلى الروبوت البشري: شبكة عميقة ذات بنية مساحة كامنة مشتركة (مشفران وفك تشفير واحد) تقوم برسم خرائط للوضعيات البشرية المقدرة إلى تكوينات متوافقة مع الروبوت البشري.
البنية: تستخدم الشبكات متعددة الطبقات (MLPs) مع مساحة كامنة مشتركة.
هدف التدريب: يتم تدريب الشبكة باستخدام مزيج من ثلاثة دوال خسارة لضمان المحاذاة الهندسية والجدوى الفيزيائية:
خسارة الثلاثي (Triplet Loss - L1): تستخدم خطأ زاوية اتجاه العظام (BAE) لتجميع أزواج الوضعيات المتشابهة (بشر-روبوت) في المساحة الكامنة.
خسارة إعادة البناء (Reconstruction Loss - L2): تضمن قدرة فك التشفير على إعادة بناء وضعيات الروبوت بدقة من المدخلات المشفرة للروبوت.
خسارة الاتساق الكامن (Latent-Consistency Loss - L3): تفرض أن تظل الوضعيات البشرية التي يتم فك تشفيرها إلى وضعيات روبوت متسقة عند إعادة تشفيرها، مما يعزز محاذاة التوزيع عبر المجالات المختلفة.
2. Humanoid-ActionNet: التحكم في كامل الجسم
تتعلم هذه الوحدة سياسة تحكم لتنفيذ الوضعيات المعاد استهدافها مع الحفاظ على الاستقرار الديناميكي. وهي تعتمد إطار عمل التعلم التعزيزي (RL) "المعلم-الطالب":
سياسة المعلم (πteacher): تم تدريبها في بيئة محاكاة (IsaacGym) باستخدام تحسين السياسة القريبة (PPO). وهي تمتلك وصولًا إلى ملاحظات "مميزة" (مثل فروق المفاصل الدقيقة، وسرعة الجذر) لتعظيم مكافآت المهمة مع فرض القيود الفيزيائية.
سياسة الطالب (πstudent): يتم استخلاصها من المعلم للعمل بدون ملاحظات مميزة. وهي تعتمد فقط على الحالات الحسية الخاصة (مواقع وسرعات المفاصل) وتاريخ قصير من الحالات السابقة، مما يسهل النقل من المحاكاة إلى الواقع (sim-to-real) بمتانة.
تصميم المكافأة: دالة المكافأة "واعية بالفيزياء"، وتتضمن بنودًا لـ:
تتبع درجات الحرية ومواضع النقاط المفصلية.
السرعة الخطية للجذر والاتجاه.
دوران الجسم وتماسك الجزء العلوي.
اتساق تلامس القدم (عقوبة الانزلاق) وتشكيل وقت الطيران في الهواء.
النشر: تخرج سياسة الطالب زوايا المفاصل المستهدفة، والتي يتم تنفيذها على الروبوت المادي عبر متحكم التناسب والتكامل والمشتق (PD).
الإعداد التجريبي
جمع البيانات: قام خمسة أشخاص بأداء 30 إجراءً متعلقًا بالبناء (مثل حمل الأنابيب، رفع الكتل، الإشارة، صعود السلالم) في بيئة التقاط الحركة.
منصة الروبوت: تم استخدام الروبوت البشري Unitree G1 (بـ 23 درجة حرية مشغلة) لكل من المحاكاة والنشر المادي.
بروتوكول التقييم:
دقة إعادة الاستهداف: تم قياسها عبر متوسط خطأ موضع المفصل لكل مفصل (MPJPE) على مجموعة اختبار مستقلة.
النقل من المحاكة إلى المحاكة (Sim-to-Sim): تم التقييم عبر محركي فيزياء (IsaacGym و MuJoCo) لاختبار المتانة ضد اختلافات نمذجة الديناميكيات.
النقل من المحاكاة إلى الواقع (Sim-to-Real): تم النشر على الروبوت المادي Unitree G1 لتنفيذ ثمانية إجراءات بناء مختارة.
النتائج الرئيسية
إعادة استهداف الوضعية: حقق Humanoid-PoseNet متوسط MPJPE قدره 48.46 مم لتمثيل الروبوت المكون من 14 مفصلًا، مما نجح في ترجمة الوضعيات البشرية المتنوعة إلى تكوينات قابلة للتنفيذ للروبوت.
تنفيذ المهام: نجح Humanoid-ActionNet في تنفيذ ثمانية إجراءات متعلقة بالبناء (مثل دفع عربة يد، حمل أنبوب، الإشارة) في كل من المحاكاة وعلى الروبوت المادي.
أداء التتبع: حقق النظام متوسط خطأ تتبع حركة (MPJPE) قدره 82.45 مم عبر الإجراءات الثمانية المختبرة.
الأداء المقارن: في الدراسات المقارنة ضد أساليب التحكم في كامل الجسم المتطورة (ExBody، OmniH2O، ExBody2)، أظهر Humanoid-ActionNet المقترح متوسط MPJPE أقل، مما يشير إلى دقة تتبع فائقة للحركات الخاصة بالبناء.
تحليل الفشل: أقرت الدراسة بحالات الفشل أثناء النقل من المحاكة إلى المحاكة (مثل فقدان التوازن، انهيار التتبع)، وعزت ذلك إلى الصعوبات في نمذجة الديناميكيات الغنية بالتلامس والفجوات بين المحاكاة والعتاد المادي.
الأهمية والادعاءات
يضع المؤلفون هذا العمل كـ خطوة أولية نحو نشر المتعاونين البشر في قطاع البناء. وتدعي الورقة المساهمات التالية:
مسار مبتكر: هي الطريقة الأولى التي تمكن الروبوت البشري من تعلم وتنفيذ مهام البناء مباشرة من العروض البشرية، معالجة التحديات المحددة لمجال البناء.
سد الفجوة: يعمل نظام VPA بفعالية على سد الفجوة المورفولوجية بين البشر والروبوتات، والفجوة الديناميكية بين التقليد الكينماتيكي والتنفيذ المستقر فيزيائيًا.
القابلية للتطبيق العملي: من خلال إثبات النقل الناجح من المحاكاة إلى الواقع على روبوت مادي لمهام مثل مناولة المواد والإشارات، توفر الدراسة خطوة تأسيسية لتنفيذ الروبوتات في الهندسة المدنية.
القدرة على التكيف: أظهر النظام قدرة على التكيف مع تكوينات بشرية مختلفة (تم اختباره على كل من Unitive G1 و H1)، مما يشير إلى إمكانية التوسع لمنصات بشرية أخرى.
يظل المؤلفون متواضعين بشأن القيود الحالية، مشيرين إلى أن النظام يركز حاليًا على تقليد الوضعية دون نمذجة صريحة للتفاعل مع الأدوات/المواد، وأن المتانة في البيئات عالية الديناميكية والغنية بالتلامس تتطلب مزيدًا من الصقل لوظائف المكافأة وواقعية المحاكة.