Model Predictive Control of Tensegrity Robots via Contact-Aware Graph Neural Dynamics Model
تقدم هذه الورقة إطار عمل للملاحة القوية لروبوتات التوتر والضغط (tensegrity) يجمع بين نموذج ديناميكيات للشبكة العصبية الرسومية المدركة للتلامس وبين متحكم مسار تكامل النموذج التنبئي الهجين لتحقيق أداء متفوق في البيئات المعقدة والغنية بالتلامس مقارنة بالنماذج المرجعية الحالية.
المؤلفون الأصليون:Nelson Chen, Patrick Meng, Charles Tang, Angelina Degay, Zachary Brei, Rebecca Kramer-Bottiglio, Kostas E. Bekris, Mridul Aanjaneya
تواجه الروبوتات التي تتحرك عبر العالم معضلة أساسية: يجب أن تكون قوية بما يكفي لحمل وزنها ودفع العوائق، ولكن مرنة بما يكفي للتكيف عندما تتغير الأرض تحتها. الروبوتات التقليدية، المبنية من إطارات معدنية صلبة، تعاني عندما تكون التضاريس غير مستوية أو صخرية أو مزدحمة، حيث غالباً ما تتعثر أو تنقلب. يستخدم نهج مختلف هياكل مكونة من قضبان صلبة متصلة بشبكة من الكابلات المرنة. هذه الروبوتات "الشدّية" (tensegrity) خفيفة الوزن ومتينة للغاية؛ فإذا سقطت، فإنها ترتد بدلاً من أن تنكسر. ومع ذلك، فإن التحكم فيها صعب للغاية. ولأن حركتها تعتمد على التفاعل المعقد للشد في الكابلات والطريقة التي تلمس بها القضبان الأرض، فإن التنبؤ بكيفية تدحرجها أو تقلبها بدقة يشبه محاولة التنبؤ بالطقس ببيانات غير كاملة. غالباً لا تستطيع الروبوتات رؤية شكلها الكامل أو الزاوية الدقيقة للأرض التي تلمسها، مما يجعل من الصعب على الكمبيوتر تخطيط مسار آمن للمضي قدماً.
لقد طور باحثون في جامعة روتجرز وجامعة ييل طريقة جديدة لتوجيه هذه الروبوتات القافزة عبر بيئات معقدة، بما في ذلك المنحدرات الشديدة، والممرات الضيقة، والعوائق المتدلية منخفضة الارتفاع. وبدلاً من الاعتماد على صيغة رياضية مثالية لوصف حركة الروبوت، علموا نموذجاً حاسوبياً أن يتعلم من الخبرة. يستخدم هذا النموذج نوعاً من الذكاء الاصطناعي يُعرف باسم "الشبكة العصبية الرسومية" (graph neural network)، وهو بارع بشكل خاص في فهم كيفية اتصال الأجزاء المختلفة للنظام ببعضها البعض. وفي هذه الحالة، النظام هو الروبوت نفسه، جنباً إلى جنب مع الجدران والأرض التي قد يصطدم بها. أضاف الباحثون ميزة خاصة لهذا النظام التعليمي تسمح له بـ "الشعور" عندما يلمس الروبوت سطحاً ما، سواء كان هذا السطح أرضية مسطحة، أو منحدرًا مائلاً، أو حتى جزءاً آخر من جسم الروبوت نفسه. هذه القدرة على استشعار التلامس أمر بالغ الأهمية، حيث يحتاج الروبوت غالباً إلى الاتكاء على جدار أو الانضغاط تحت حاجز للتحرك للأمام.
ولوضع هذا النموذج التعليمي موضع التنفيذ، أنشأ الفريق نظام تحكم يعمل كمنظم سريع ومتواصل. تخيل الروبوت وهو يتوقف لجزء من الثانية ليتخيل آلاف الطرق المختلفة التي يمكنه التحرك بها خلال الثواني القليلة القادمة. إنه يحاكي كل احتمال في ذهنه، ويتحقق من أي مسار يؤدي إلى الهدف دون الاصطدام. يختار النظام بعد ذلك الخيار الأفضل وينفذه، ليعود ويبدأ فوراً في التخطيط لمجموعة التحركات التالية. هذه العملية، المعروفة باسم "التحكم التنبئي بالنموذج" (model predictive control)، تسمح للروبوت بالتفاعل مع التغييرات في الوقت الفعلي. ومع ذلك، وجد الباحثون أن الروبوت واجه صعوبة في معرفة كيفية الدوران بفعالية بمفرده. ولحل هذه المشكلة، دمجوا نظام التخطيط الذكي مع مجموعة من حركات الدوران البسيطة والمبرمجة مسبقاً. فعندما يحتاج الروبوت إلى تغيير اتجاهه، فإنه يستخدم هذه الدورات الموثوقة ليواجه الاتجاه الصحيح، ثم يترك المخطط الذكي يتولى مهمة التنقل في بقية المسار.
اختبر الفريق هذا النهج في محاكاة حاسوبية عالية الدقة تحاكي فيزياء العالم الحقيقي. لقد أعدوا خمسة تحديات مختلفة للروبوت، تتراوح من مسار مسطح بسيط مع جدران إلى مسار عوائق ثلاثي الأبعاد صعب يتضمن منحدرات شديدة ومساحات ضيقة. في الاختبار الأكثر صعوبة، كان على الروبوت اجتياز مسار لم يره من قبل، يجمع بين جميع التحديات السابقة في مسار واحد. أظهرت النتائج أن الروبوت الذي يستخدم النظام التعليمي الجديد واستراتيجية الدوران الهجينة كان أكثر نجاحاً من الطرق القديمة. وبينما فشلت الأساليب الأخرى في تسلق المنحدرات أو علقت في الممرات الضيقة، تمكن النظام الجديد من الوصول إلى هدفه في الغالبية العظمى من المحاولات، حتى في البيئات غير المرئية. وقد تحسن الروبوت مع جمعه المزيد من البيانات، ليصبح أسرع وأكثر دقة مع كل جولة من الاختبارات.
يشير هذا العمل إلى أنه من خلال تعليم الروبوتات كيفية فهم كيفية ملامستها للعالم من حولها، ومن خلال منحها مزيجاً من الذكاء المتعلم والحركات البسيطة والموثوقة، يمكننا إنشاء آلات قادرة على التنقل في التضاريس الفوضوية وغير المتوقعة للعالم الحقيقي. لقد أثبت الباحثون أن هذه الطريقة تعمل جيداً في المحاكاة، مما يمهد الطريق للاختبارات المستقبلية مع الروبوتات المادية. وبينما يقتصر النظام الحالي على الأسطح المستوية ويتطلب مزيداً من التطوير للتعامل مع البيئات غير المنظمة تماماً، فإن نجاح هذا النهج يقدم مساراً واعداً نحو روبوتات يمكنها استكشاف مناطق الكوارث، أو البحث عن الناجين تحت الأنقاض، أو عبور المناظر الطبيعية الوعرة لكواكب أخرى.
ملخص تقني: التحكم التنبئي بالنماذج لروبوتات التوتر عبر نموذج ديناميكيات رسوم بيانية مدرك للتلامس
بيان المشكلة تتميز روبوتات التوتر (Tensegrity)، المكونة من دعامات صلبة وكابلات مرنة، بقدرة عالية على الحركة بوزن خفيف ومرونة مناسبة للتضاريس غير المهيكلة. ومع ذلك، فإن التحكم فيها يعوقه ديناميكيات معقدة غنية بالتلامس وقصور في الملاحظة. تعتمد أساليب التحكم التقليدية غالبًا على تجنب ديناميكيات النظام من خلال الاعتماد على التخطيط الهندسي أو النماذج الأولية للحركة، بينما تظهر سياسات التعلم المعزز المنقولة من المحاكاة قدرات محدودة في التنقل. علاوة على ذلك، تفشل نماذج الديناميكيات المتعلمة القائمة على الشبكات العصبية الرسومية (GNNs) الحالية التي تفترض تلامسات أرضية أفقية، حيث تفشل في مراعاة الأسطح المستوية غير الأفقية، أو العوائق البيئية، أو التصادمات الذاتية. يعالج هذا العمل تحدي تحقيق ملاحة قوية مغلقة الحلقة لروبوتات التوتر في بيئات معقدة حيث يعد النمذجة الدقيقة لتفاعلات التلامس أمرًا بالغ الأهمية.
المنهجية يدمج الإطار المقترح نموذج ديناميكيات GNN متعلم مع متحكم "تكامل المسار التنبئي بالنماذج" (MPPI)، والذي يعمل ضمن حلقة تجميع بيانات تكرارية.
1. نموذج ديناميكيات GNN مدرك للتلامس:
جوهر هذا النهج هو امتداد لنماذج الديناميكيات السابقة القائمة على GNN. قدم المؤلفون وحدة كشف تلامس قابلة للتفاضل تم تنفيذها في PyTorch.
تولد هذه الوحدة ميزات تلامس تمثل التفاعلات بين نهايات الروبوت والأسطح المستوية غير الأفقية (مثل المنحدرات، والجدران)، بالإضافة إلى التصادمات الذاتية بين قضبان الروبوت الأسطوانية.
يتم ترميز هذه التفاعلات كميزات عقد (المسافات الموقعة) وميزات حواف (السرعات النسبية، والمتجهات العمودية للأسطح، والمسافات) داخل الرسم البياني. يسمح هذا للنموذج بالتنبؤ بتغيرات الحالة (سرعات القضبان وأطوال الراحة للكابلات) تحت ملاحظات جزئية في بيئات ذات قيود تلامس معقدة.
2. متحكم MPPI هجين:
يستخدم المتحكم نموذج GNN المتعلم كنموذج تنبؤ داخلي لإجراء تحكم أمثل قائم على أخذ العينات.
لمعالجة صعوبة أخذ عينات فعالة لسلوكيات الدوران لروبوت التوتر ثلاثي القضبان (والذي يتطلب آفاقًا زمنية طويلة وعينات كثيرة)، يتم استخدام استراتيجية هجينة.
يقيم النظام اتجاه رأس الروبوت بالنسبة لمتجه تدرج التكلفة المحلي. إذا كان الاتجاه محاذيًا لاتجاه الهدف (ضمن عتبة α)، يقوم متحكم MPPI بالتنفيذ. وإذا كان غير متوافق، ينتقل النظام إلى نماذج حركة دوران هندسية مصممة بشريًا (في اتجاه عقارب الساعة أو عكس اتجاه عقارب الساعة) لإعادة توجيه الروبوت قبل استئناف التحكم بـ MPPI.
تستخدم دالة التكلفة استدلال جبهة الموجة المدرك للعوائق الذي يتم بناؤه على شبكة. وهذا يتجنب عيوب مقاييس المسافة الإقليدية في البيئات المزدحمة عن طريق نشر تقديرات المسافة المدركة للعوائق من الهدف.
3. حلقة تجميع البيانات التكرارية:
يعمل النظام في حلقة مغلقة حيث ينفذ متحكم MPPI المهام، مما يولد بيانات مسار جديدة.
تُضاف هذه البيانات إلى مجموعة التدريب لإعادة تدريب نموذج ديناميكيات GNN، والذي بدوره يحسن دقة تنبؤ المتحكم وأدائه في الدورات اللاحقة. تبدأ العملية ببيانات من النماذج الأولية المصممة بشريًا وتتطور عبر دورات تدريبية متتالية.
المساهمات الرئيسية
نموذج ديناميكيات GNN ممتد: نموذج متعلم يتضمن كشف تلامس قابل للتفاضل للتعامل مع الأسطح المستوية غير الأفقية، والعوائق البيئية، والتصادمات الذاتية، متجاوزًا افتراضات الأرض المسطحة السابقة.
إطار عمل MPC تكراري: إطار عمل MPC يستخدم MPPI فوق GNN المتعلم، مما يسهل حلقة تكرارية لتحسين كل من نموذج الديناميكيات وأداء التحكم في آن واحد.
استراتيجية تحكم هجينة: حل يجمع بين MPPI ونماذج حركة الدوران لتعزيز القدرة على المناورة والتغلب على عدم كفاءة أخذ العينات في MPPI الصرف أثناء مناورات الدوران.
تقييم شامل: تحقق التحقق التجريبي في بيئة MuJoCo عبر خمس مهام ملاحة متنوعة، بما في ذلك المنحدرات، والممرات الضيقة، والهياكل ذات الخلوص المنخفض، ومسار عقبات ثلاثي الأبعاد مركب.
النتائج أجريت التجارب عبر خمسة سيناريوهات ملاحة: مسار عقبات مسطح، منحدر بزاوية 5 درجات، ممر/زاوية ضيقة، هيكل ذو خلوص منخفض، ومسار عقبات ثلاثي الأبعاد مركب (الذي يعمل كبيئة اختبار غير مرئية سابقًا).
دقة النموذج: تفوق نموذج GNN المدرك للتلامس باستمرار على نموذج GNN الأساسي (الذي يفترض أرضية مسطحة) في التنبؤ بموقع مركز الكتلة واتجاه القضبان. انخفضت أخطاء التنبؤ عبر دورات التدريب مع نمو مجموعة البيانات من خلال بيانات المتحكم.
أداء الملاحة:
مسار العقبات المسطح: حقق Hybrid MPPI نسبة نجاح 100% من التكرار الأول، متفوقًا على MPPI-only (الذي عانى مع الدوران) ومطابقًا للأداء النهائي لنماذج A* لإعادة التخطيط.
المنحدر: فشلت نماذج A* تمامًا بسبب الانحراف في ديناميكيات الاتجاه. حقق MPPI-only نجاحًا محدودًا (33%)، بينما حقق Hybrid MPPI نسبة نجاح 100% من التكرار الأول.
الممر الضيق والخلوص المنخفض: تطلبت هذه المهام تلامسًا متعمدًا مع العوائق، وهو ما لم تستطع نماذج A* التخطيط له. تفوق Hybrid MPPI بشكل كبير على MPPI-only، محققًا معدلات نجاح أعلى وسرعة أكبر في التقارب.
مسار العقبات ثلاثي الأبعاد (غير المرئي): أظهرت استراتيجية Hybrid MPPI قدرة قوية على التعميم، حيث حققت نسبة نجاح 84% بحلول التكرار النهائي، مقارنة بـ 35% لـ MPPI-only.
دراسات الاستئصال (Ablation Studies): أشارت النتائج إلى أن ميزات عقد المسافة إلى التلامس كان لها تأثير أكبر على دقة التنبؤ من حواف التلامس وحدها، مما يسلط الضوء على أهمية معلومات القرب الصريحة.
الأهمية والادعاءات يدعي البحث أن الجمع بين ديناميكيات التعلم المدركة للتلامس والتحكم التنبئي بالنماذج القائم على أخذ العينات يتيح ملاحة قوية لروبوتات التوتر في بيئات معقدة غنية بالتلامس حيث تفشل التخطيطات الهندسية التقليدية أو التعلم المعزز الصرف. يؤكد المؤلفون أن حلقة تجميع البيانات التكرارية ضرورية لصقل قدرة النموذج على التعامل مع قصور الملاحظة وديناميكيات التلامس المعقدة.
يتسم العمل بالتواضع فيما يتعلق بنطاقه الحالي، حيث يقر بأن النهج مقيد حاليًا بتمثيلات الأسطح المستوية وأن نماذج الدوران هي نماذج مصممة يدويًا. يحدد المؤلفون العمل المستقبلي في توسيع النموذج ليشمل التضاريس غير المهيكلة بالكامل، وتعلم نماذج الدوران مباشرة من البيانات، وإظهار حلقة التحسين التكراري على روبوت توتر ثلاثي القضبان حقيقي.