Learning Slope-Adaptive Whole-Body Locomotion for Humanoid Robots in Roofing Construction
تقدم هذه الورقة إطار عمل دلالي للمهام ومستند إلى المشهد، يجمع بين عروض بشرية مُعاد توجيهها وتحسين المسار والتعلم التعزيزي لتمكين روبوت بشري من طراز Unitree G1 من أداء مهام تنقل وتشييد معقدة ومتكيفة مع المنحدرات، مثل تسقيف الأسطح، مع الحفاظ على قيود دقيقة للدعم وخلوص العمل.
تخيل روبوتًا يمكنه المشي، والتسلق، والعمل تمامًا مثل البشر. لسنوات، علم العلماء الآلات كيفية الحركة من خلال عرض مقاطع فيديو لأشخاص يمشون أو يركضون. يقوم الكمبيوتر بتقليد الحركات، ويأمر أرجل الروبوت وأذرعه بمحاكاة جسم الإنسان. هذا الأسلوب يعمل بشكل جيد على الأرضيات المستوية، ولكنه ينهار عندما تميل الأرض. فعلى سطح منحدر، يمكن أن يكون مجرد تقليد لحركة بشرية أمرًا خطيرًا. إذا حاول الروبوت تقليد إنسان ينحني للأسفل ليطرق مسمارًا، فقد يضع الكمبيوتر أقدام الروبوت في الهواء أو يدفع يديه مباشرة عبر بلاط السقف. يحتاج الروبوت إلى فهم ليس فقط كيفية حركة الجسم، بل وأين يقع هذا الجسم بالنسبة للسطح المحدد الذي يقف عليه. هذا هو التحدي الجوهري لمنح الروبوتات القدرة على العمل في عالم البناء الفوضوي وغير المستوي.
قام فريق من الباحثين في جامعة فلوريدا بمعالجة هذه المشكلة من خلال تعليم روبوت بشري (Humanoid) كيف يتصرف كعامل سقف. ركزوا على نوع معين من الروبوتات وهو "Unitite G1"، الذي يقف على ساقين ويمتلك أذرعًا مثل الإنسان. كان الهدف هو تجاوز مجرد المشي وتعليم الآلة كيفية عبور سقف مائل، والانحناء للأسفل للعمل، واستخدام أدوات مثل مسدس المسامير أو المطرقة دون السقوط أو الاصطدام بالسطح. أدرك الباحثون أن مجرد نسخ حركات الإنسان لم يكن كافيًا. فالإنسان يعرف غريزيًا كيفية ضبط توازنه على المنحدر، لكن الروبوت الذي يتبع نصًا مرئيًا قد لا يدرك أن قدمه تحوم فوق فجوة أو أن يده على وشك اختراق السقف. ولحل هذه المشكلة، ابتكر الفريق طريقة جديدة تجمع بين الحركة البشرية وخريطة رقمية دقيقة للسقف.
بدأت العملية بتسجيل عامل بشري يؤدي مهام تسقيف على منحدر مختبري. ارتدى الشخص سماعة واقع افتراضي وأجهزة تتبع على يديه وكاحليه، مما سمح للباحثين بالتقاط توقيت وانسيابية الحركات. بعد ذلك، تم نقل هذه البيانات إلى الروبوت، مما خلق مسودة أولى للحركة. ومع ذلك، كانت هذه المسودة معيبة؛ لأن جسم الروبوت يختلف عن جسم الإنسان، فإن النسخة الأولية وضعت أقدام الروبوت في أماكن خاطئة ويديه على ارتفاعات غير صحيحة بالنسبة للسقف. ولإصلاح ذلك، استخدم الباحثون نموذجًا ثلاثي الأبعاد مفصلًا لسطح السقف. قاموا بتعديل مسار المرجع الخاص بالروبوت بحيث تكون أقدامه ثابتة بقوة على المنحدر ويداه على مسافة آمنة ومحددة من البلاط. على سبيل المثال، تأكدوا من بقاء يد الروبوت على بعد 25 سنتيمترًا بالضبط من السقف عند حمل مسدس المسامير، و12 سنتيمترًا عند استخدام المطرقة. ضمنت هذه الخطوة أن تكون خطة الروبوت ممكنة فيزيائيًا وآمنة قبل أن يحاول التحرك فعليًا.
حتى مع وجود خطة مثالية، يمكن للروبوت أن يرتكب أخطاء عند التحرك فعليًا. فالعالم الحقيقي مليء بالانزلاقات والتأخيرات الصغيرة التي لا تتوقعها المحاكاة الحاسوبية دائمًا. وللتعامل مع هذا، علم الباحثون الروبوت كيفية الانتباه لقواعد السلامة هذه أثناء حركته. استخدموا طريقة تعلم تكافئ الروبوت على إبقاء يديه بالمسافة الصحيحة من السقف، وتُعاقبه إذا لمس أي جزء من جسمه السطح في غير موضعه. حدث هذا التدريب في محاكاة حاسوبية أولاً، حيث تدرب الروبوت آلاف المرات على زوايا أسقف مختلفة، تتراوح من منحدر لطيف بزاوية 9 درجات إلى منحدر شديد بزاوية 25 درجة. أظهرت النتائج أن الروبوت تعلم تكييف وضعية جسده مع المنحدر، محافظًا على توازنه أثناء الانحناء للعمل.
ثم اختبر الفريق هذه المهارات على الروبوت الفعلي في مختبرهم. أعدوا منصة سقف حقيقية وتركوا الروبوت يجرب المهام التي تعلمها في المحاكاة. نجح الروبوت في المشي صعودًا المنحدر، والانحناء للإمساك بمسدس المسامير، وأرجح المطرقة. في كل اختبار، حافظ الروبوت على أقدامه على السقف ويديه على المسافة الصحيحة، متجنبًا أي اصطدامات مع السطح. أظهرت القياسات أن حركات الروبوت كانت دقيقة، حيث ظل جسمه ضمن نطاق سنتيمترات قليلة من المسار المقصود. كما قارن الباحثون طريقتهم بنهج أخرى، ووجدوا أن الروبوتات التي تدربت فقط على اتباع إشارة مكافأة دون دليل حركة بشرية انتهت بوضعيات غريبة ومنحنية لا تشبه أعمال التسقيف الحقيقية. وبالمثل، فإن الروبوتات التي يتم التحكم فيها مباشرة بواسطة مشغل بشري في الوقت الفعلي فقدت توازنها وسقطت عند محاولة الخطو على المنحدر. كانت الطريقة الجديدة، التي جمعت بين الحركة البشرية، والخريطة الرقمية للسقف، والتعلم الواعي بالسلامة، هي الوحيدة التي نجحت بشكل موثوق.
تشير هذه الدراسة إلى أنه لكي تعمل الروبوتات في مجال البناء، فإنها تحتاج إلى ما هو أكثر من مجرد القدرة على المشي. فهي تحتاج إلى فهم هندسة السطح الذي تقف عليه والحفاظ على علاقة آمنة معه أثناء العمل. وجد الباحثون أن مجرد نسخ الحركات البشرية ليس كافيًا؛ إذ يجب أن يكون الروبوت مرتبطًا بالواقع الفيزيائي لموقع العمل. ومن خلال تعليم الروبوت احترام شكل السقف وإبقاء أدواته على المسافة الصحيحة، وضع الفريق أساسًا لآلات يمكنها يومًا ما المساعدة في المهام الخطرة مثل تسقيف المنازل. وبينما أجريت الاختبارات الحالية في مختبر محكوم مع حزام أمان، فإن النتائج تظهر أن المهارات الأساسية للتسلق والعمل على منحدر باتت في المتناول. الخطوة التالية ستكون معرفة ما إذا كان بإمكان هذه الروبوتات التعامل مع الظروف القاسية وغير المستوية وغير المتوقعة لموقع بناء حقيقي.
ملخص تقني: تعلم الحركة المتكيفة مع المنحدرات لكامل الجسم للروبوتات البشرية في أعمال تركيب السقوف
بيان المشكلة تمثل أعمال تركيب السقوف تحديًا فريدًا لروبوتات الهيكل البشري (Humanoid): فهي تتطلب تنسيقًا بين الحركة، والتوازن، وحركات العمل المعقدة الغنية بالتلامس على أسطح منحدرة ومرتفعة وشديدة الانحدار. وبينما تبرز الروبوتات الإنشائية الحالية في المهام المنظمة على مستوى الأرض أو مهام الفحص المتخصصة، إلا أنها تعاني في محاكاة سلوكيات "الأسلوب المهني لعمال السقف" اللازمة لأعمال التركيب. ويكمكنت الصعوبة الرئيسية في الفجوة بين العروض التوضيحية البشرية وتنفيذ الروبوت. فغالباً ما تحافظ الحركات البشرية المعاد توجيهها (Retargeted) على المظهر البصري للمهمة، لكنها تفشل في الحفاظ على الاتساق الهندسي مع سطح السقف. وتحديداً، قد تضع المراجع المعاد توجيهها الأقدام تحت السقف، أو تضع الأيدي بعيداً جداً عن سطح العمل، أو تسمح لكتل الجسم (Meshes) باختراق السقف. علاوة على ذلك، غالباً ما تفشل أساليب التعلم التعزيزي (RL) القياسية أو التحكم عن بُعد (Teleoperation) في تلبية الاقتران الوثيق بين الحركة، واستقرار الوضعية، والقيود المكانية الخاصة بالمهمة (مثل الحفاظ على خلوص محدد بين الأداة والسطح) على التضاريس المائلة.
المنهجية يقترح المؤلفون إطار عمل مشهدياً دلالياً مرتبطاً بالأرض (task-semantic scene-grounded framework) لتعلم حركة كامل الجسم على روبوت بشري من طراز Unitree G1. يتكون هذا النهج من ثلاث مراحل رئيسية:
جمع البيانات وإعادة التوجيه: يتم التقاط العروض التوضيحية البشرية لحركات السقف (المشي، الانحناء، الجثو، الطرق، استخدام مسدس المسامير، الدفع) باستخدام نظام تتبع VR متفرق (سماعة PICO، وحدات تحكم، وأجهزة تتبع الكاحل) على منصة قابلة للتعديل ومائلة. يتم إعادة توجيه هذه الحركات إلى البنية الكينماتيكية لروبوت Unitree G1 لإنشاء أولوية حركة أولية.
تحسين المرجع المرتبط بالمشهد: يتم تحسين الحركة المعاد توجيهها الأولية خارجياً (Offline) باستخدام شبكة سقف مترية. تعمل هذه المرحلة على حل مشكلة تحسين لبناء مسار مرجعي صالح هندسياً (M∗) عن طريق تقليل مجموع مرجح من الأهداف:
تأصيل الدعم (Support Grounding): استنتاج فترات دعم القدم وتثبيت نقاط متعددة للنعل على سطح السقف لمنع اختراق القدم أو طفوها.
العلاقات الدلالية للمهمة: فرض مسافات خلوص محددة بين اليد والسطح (على سبيل المثال، 25 سم لمسدس المسامير، و12 سم للمطرقة) خلال مراحل العمل الموضحة.
عدم الاختراق (Nonpenetration): ضمان بقاء شبكة الجسم بالكامل (بما في ذلك اليدين والركبتين) خارج هندسة السقف.
السلاسة والحفاظ على الحركة: الحفاظ على السلاسة الزمنية والالتزام بدلالات الحركة البشرية الأصلية.
تعلم السياسة المدركة للتنفيذ: يتم تدريب سياسة تعتمد على المرجع (Reference-conditioned) باستخدام التعلم التعزيزي في بيئة محاكاة (Isaac Lab) لتتبع المرجع المحسن. ومن الأهمية بمكان أن تتضمن دالة المكافأة مكافآت زمن التنفيذ المرتبطة بالمرحلة (phase-gated execution-time rewards):
مكافآت الخلوص (Clearance Rewards): تشجع السياسة على الحفاظ على المسافة المطلوة بين اليد والسطح أثناء مراحل العمل.
مكافآت سلامة الشبكة (Mesh-Safety Rewards): تعاقب أي اختراق لشبكة الجسم داخل السقف أثناء التنفيذ. وهذا يضمن أنه حتى لو كان المسار المرجعي مثالياً من الناحية الهندسية، فإن السياسة المتعلمة تقوم بنشط بتصحيح أخطاء التتبع الديناميكية للحفاظ على دلالات المهمة.
المساهمات الرئيسية يقدم البحث المساهمات المحددة التالية:
مسار التحويل من VR إلى الروبوت البشري: نظام يحول العروض التوضيحية البشرية المتفرقة لأعمال السقف إلى حركات مرجعية معاد توجيهها مناسبة لتعلم السياسة.
تحسين المسار على مستوى التوجيه: طريقة تحسن بشكل مشترك دعم القدم، وخلوص الأداة للمهمة، وعدم اختراق شبكة الجسم، والحفاظ على الحركة مقابل نموذج سقف متري، متجاوزةً مجرد إزاحات الارتفاع الموحدة.
المكافآت المدركة للتنفيذ: تقديم مكافآت الخلوص وسلامة الشبكة المرتبطة بالمرحلة أثناء تدريب RL، مما يجبر السياسة على الحفاظ على العلاقات المقصودة بين اليد والسقف رغم أخطاء التتبع الديناميكية.
النتائج تم تقييم إطار العمل من خلال دراسات الاستبعاد في المحاكاة، والتحقق من صحة المهام المتقاطعة، والتجارب الفيزيائية على روبوت Unitree G1.
دراسات الاستبعاد (مهمة مسدس المسامير): قارنت الدراسة خمس حالات: إعادة التوجيه الخام (A)، الإزاحة اليدوية (M)، تصحيح الدعم (B)، تصحيح المرجع على مستوى المهمة (C)، والطريقة الكاملة المدركة للتنفيذ (D).
فشلت الحالات A وB وC في تلبية قيود المهمة (مثل اختراق اليد للسقف أو كونها بعيدة جداً).
حققت الحالة D متوسط خطأ في خلوص العمل قدره 0.531 سم وخلوصاً إيجابياً بين اليد والشبكة عبر جميع البذور الثلاثة المختبرة، حيث أتمت المهمة بنجاح.
التحقق من صحة المهام المتقاطعة: تم التحقق من الطريقة في مهمة الطرق (خلوص 12 سم) والدفع الجانبي (خلوص 18.5 سم). حققت الطريقة الكاملة (D) أخطاء خلوص عمل بلغت 0.256 سم و0.424 سم على التوالي، مع معدلات نجاح بنسبة 100%، بينما أدى تصحيح المرجع فقط (C) إلى اختراق الشبكة.
تغطية المنحدر: فشلت السياسات المدربة على منحدر واحد (مثلاً 17 درجة) في التعميم على منحدرات أكثر حدة غير مرئية (25 درجة). تطلب التنفيذ الناجح عبر 9، 17، و25 درجة بيانات تدريب صريحة تغطي جميع ميول الأسطح المستهدفة.
المقارنة المرجعية (Baselines): أنتج التعلم التعزيزي الصرف (بدون مقدمات الحركة) حركات انحرفت بشكل كبير عن وضعيات عمال السقف البشر. وفشل التحكم عن بُعد (Zero-shot teleoperation - SONIC) في الحفاظ على التوازن عند الخطو على المنحدر.
التجارب الفيزيائية: تم نشر السياسات المدربة في المحاكاة على روبوت Unitree G1 فيزيائي دون تحسين في العالم الحقيقي. نجح الروبوت في أداء المشي صعوداً، وتحديد موقع مسدس المسامير، والطرق، والانحناء. تراوح متوسط أخطاء الحركة في إطار القاعدة (MPJPE) بين 27.6 ملم (المشي صعوداً) و79.9 ملم (الطرق). ويشير المؤلفون إلى أن الأخطاء كانت أكبر في الجزء السفلي من الجسم (الركبتين/الكاحلين) بسبب صعوبة تكيف التلامس على المنحدرات.
الأهمية والادعاءات يزعم البحث أن تعلم الحركة البشرية المرتبط بالمشهد يعد أساساً واعداً للنماذج الأولية للحركة الموجهة نحو البناء. ويؤكد المؤلفون على ما يلي:
إن الحفاظ على دلالات الحركة البشرية وحده غير كافٍ؛ بل إن التأصيل الهندسي لسطح العمل ضروري لحل الأخطاء التي لا يمكن لإعادة التوجيه أو الإزاحات البسيطة إصلاحها.
إن كلاً من تحسين المرجع خارجياً والإنفاذ أثناء التنفيذ ضروريان. فالمسار المرجحي الصحيح هندسياً لا يضمن التنفيذ الصحيح إذا لم تعمل السياسة بنشاط على فرض قيود المهمة ضد الأخطاء الديناميكية.
يتيح إطار العمل المقترح للروبوتات البشرية تلبية معايير الدعم، وخلوص العمل، وعدم الاختراق عبر مهام السقف المختلفة، مما يسد الفجوة بين العرض التوضيحي البشري والتنفيذ الروبوتي القوي في مواقع البناء المعقدة والمنحدرة.
يظل المؤلفون متواضعين، حيث ذكروا أن هذه النتائج توفر أدلة أولية على قدرات النشر في ظروف محكومة. وهم لا يدعون أن الروبوتات البشرية متفوقة على المنصات المتخصصة في جميع السيناريوهات، ولا يدعون أن النظام جاهز لأعمال بناء ذاتية بالكامل وغير مساعدة دون مزيد من التطوير في الإدراك، والسلامة، والمتانة تجاه تغيرات السطح في العالم الحقيقي.