VertexCBF: Improving Neural Control Barrier Functions via Vertex-Restricted Control Search
تقدم هذه الورقة VertexCBF، وهو إطار عمل قابل للتوسع وقابل للتفسير يتعلم دوال حاجز بارير (CBF) عصبية من خلال تقريب دالة القيمة لـ هاميلتون-جاكوبي عبر تدريب مستند إلى الفيزياء وبحث تحكم مقيد بالرؤوس متوازٍ باستخدام وحدات معالجة الرسومات، مما يستعيد بفعالية مجموعات آمنة كبيرة ويضمن السلامة في كل من عمليات المحاكاة والتجارب الروبوتية في العالم الحقيقي.
المؤلفون الأصليون:Bojan Derajić, Sebastian Bernhard, Wolfgang Hönig
مع تزايد انتشار الآلات ذاتية القيادة في حياتنا اليومية، من روبوتات التوصيل على الأرصفة إلى الطائات المسيرة التي تراقب الغابات، يبرز سؤال جوهري: كيف نضمن ألا تؤذي هذه الآلات أي شخص أو أي شيء؟ تكمن الإجابة في مفهوم رياضي يُعرف باسم "مرشح السلامة" (safety filter). تخيل روبوتاً يتلقى أمراً بالتحرك للأمام، لكن أحد المشاة يعترض مساره؛ يعمل مرشح السلامة هنا كحارس يقظ، حيث يتحقق فوراً مما إذا كان هذا الأمر آمناً. فإذا كان المسار خالياً، يستمر الروبوت في حركته؛ أما إذا لم يكن كذلك، يقوم المرشح بتعديل حركة الروبوت بشكل طفيف بما يكفي لتجنب الاصطدام مع محاولة الوصول إلى هدفه في الوقت ذاته. لسنوات طويلة، استخدم المهندسون نوعاً معيناً من مرشحات السلامة يعتمد على "دوال حاجز التحكم" (control barrier functions)، وهي طريقة توفر ضماناً صارماً للسلامة. ومع ذلك، فإن تصميم هذه المرشحات للروبوتات المعقدة كان أمراً صعباً للغاية؛ إذ غالباً ما تؤدي الطرق التقليدية إلى مناطق سلامة صغيرة جداً، مما يجبر الروبوتات على التحرك بحذر وعدم كفاءة، أو تفشل تماماً عندما تصبح حركات الروبوت معقدة للغاية بحيث يصعب رسم مساراتها يدوياً.
لقد طور فريق من الباحثين نهجاً جديداً يسمى "VertexCBF" لحل هذه المشكلة، مما يسمح للروبوتات بتعلم مناطق سلامة أكبر وأكثر عملية. فبدلاً من محاولة حساب كل مسار مستقبلي محتمل يمكن أن يسلكه الروبوت — وهي مهمة مستحيلة حسابياً بالنسبة للآلات المعقدة — ركزوا على اختصار رياضي محدد. فقد أدركوا أنه بالنسبة للعديد من الروبوتات، فإن القرارات الأكثر حرجاً بشأن السلامة تحدث عند الحواف القصوى لما يمكن لمحركات الروبوت القيام به. ومن خلال قصر بحثهم على هذه الحدود القصوى، أو "الرؤوس" (vertices)، لقدرات التحكم الخاصة بالروبوت، تمكنوا من توليد بيانات تدريب عالية الجودة بشكل أسرع وأكثر دقة من ذي قبل. ثم استخدموا هذه البيانات لتعليم "شبكة عصبية"، وهي نوع من أنواع الذكاء الاصطناعي، للتعرف على الحالات الآمنة وغير الآمنة. والنتيجة هي نظام يتعلم كيفية الحفاظ على سلامة الروبوت دون مبالغة في الحذر، مما يؤدي فعلياً إلى استعادة أكبر مساحة ممكنة يمكن للروبوت العمل فيها بحرية.
اختبر الباحثون هذا المنهج على خمسة عشر نظاماً روبوتياً مختلفاً، تتراوح من البندولات البسيطة والطائرات المسيرة إلى المركبات تحت الماء المعقدة والروبوتات التي تسير على قدمين. وفي كل حالة، قارنوا منهجهم التعليمي الجديد بالتقنيات القائمة. فغالباً ما أنتجت الطرق القديمة مناطق سلامة إما فارغة، بمعنى أن الروبوت لا يمكنه التحرك على الإطلاق، أو صغيرة جداً لدرجة تجعل الروبوت مشلولاً عملياً. وفي المقابل، نجحت الطريقة الجديدة باستمرار في إيجاد مناطق سلامة واسعة وموثوقة. فعلى سبيل المثال، في نظام يحاكي روبوتاً يوازن قضيباً، فشلت الأساليب التقليدية في إيجاد أي مسار آمن، بينما نجحت الطريقة الجديدة في تحديد مساحة شاسعة يمكن للروبوت أن يعمل فيها بأمان. كما تحقق الفريق من هذه النتائج عبر تشغيل مرشح السلامة الذي تم تعلمه على روبوت متنقل حقيقي في تجربة مادية؛ حيث كُلف الروبوت بالتنقل عبر مساحة مع تجنب المشاة الذين تحركوا عمداً لاعتراض طريقه. وباستخدام مرشح السلامة الذي تم تدريبه باستخدام منهجهم الجديد، نجح الروبوت في تجنب الاصطدامات في جميع التجارب العشر، حيث عدّل مساره بسلاسة للحفاظ على مسافة آمنة مع الاستمرار في التقدم نحو وجهته.
إن ما يجعل هذا النهج قوياً بشكل خاص هو كيفية موازنته بين احتياجين متنافسين: السلامة الرياضية الصارمة والكفاءة العملية. فقد جمع الباحثون بين قاعدة قائمة على الفيزياء، تضمن عدم انتهاك الروبوت لقوانين الحركة، وعملية تعلم تعتمد على البيانات لسد الفجوات. كما صمموا الشبكة العصبية بهيكل محدد يضمن أن منطقة السلامة المتعلمة لا يمكن أبداً أن تكون أكبر من الحدود الفيزيائية للروبوت، مما يمنع الذكاء الاصطناعي من "الهلوسة" بمسار آمن غير موجود. وهذا يضمن بقاء الروبوت ضمن قيوده الفيزيائية الحقيقية. وتظهر الدراسة أنه من خلال التركيز على الحدود القصوى للتحكم بدلاً من محاولة أخذ عينات من كل مسار متوسط ممكن، يمكن للنظام أن يتعلم التنقل في البيئات المعقدة بمستوى من الثقة لم تستطع الطرق السابقة تحقيقه. ويمهد هذا العمل الطريق لنشر الروبوتات ذاتية القيادة في البيئات البشرية المزدحمة وغير المتوقعة، حيث يجب أن تكون السلامة مطلقة، ولكن لا يمكن التضحية بالكفاءة.
ملخص تقني: VertexCBF
بيان المشكلة
مع توسع تطبيقات الروبوتات ذاتية القيادة، يظل ضمان التشغيل الآمن والموثوق تحديًا حاسمًا. وبينما توفر دوال الحاجز للتحكم (CBFs) إطارًا نظريًا راسخًا لمرشحات السلامة، فإن تصميم دوال CBF فعالة للأنظمة ذات قيود الحالة والمدخلات أمر صعب للغاية. غالبًا ما تعاني الطرق القائمة على التعلم من مشاكل تتعلق بقابلية التوسع، أو قابلية التفسير، أو تؤدي إلى مجموعات آمنة مفرطة التحفظ. علاوة على ذلك، فإن النهج التي تعتمد فقط على التعلم المستند إلى الفيزياء (حل متراجحات التباين لهاملتون-جاكوبي HJB) غالبًا ما تتقارب نحو حلول تافهة أو غير مثالية، بينما الطرق التي تستخدم تحسين مسار التحكم الكامل للإشراف تكون مكلفة حاسبيًا وأقل غنى بالمعلومات.
المنهجية: VertexCBF
يقترح المؤلفون VertexCBF، وهو إطار عمل لتعلم دوال CBF عصبية تقرب مجموعة الأمان المثلى التي تتميز بها إمكانية الوصول إلى هاملتون-جاكوبي (HJ reachability). تدمج الطريقة التعلم المستند إلى الفيزياء مع إشراف متفرق وعالي الجودة مستمد من خاصية هيكلية محددة للأنظمة ذات التأثير الخطي للتحكم (control-affine systems).
المكونات الأساسية
التقريب العصبي لدالة القيمة: تقوم الطريقة بتقريب دالة قيمة السلامة المستقرة V(x) باستخدام شبكة عصبية. ولضمان عدم تجاوز مجموعة الأمان المتعلمة للقيود الفيزيائية الأصلية، تستخدم الشبكة بنية متبقية (residual architecture): VΘ(x)=c(x)−rΘ(x) حيث c(x) هي دالة القيد و rΘ(x)≥0 هي مخرجات متبقية غير سالبة ناتجة عن مضرب متعدد الطبقات (MLP). يضمن هذا أن VΘ(x)≤c(x)، مما يضمن أن مجموعة الأمان المتعلمة هي مجموعة جزئية من مجموعة القيود.
البحث المقيد بالرؤوس (Vertex-Restricted Control Search): يكمن الابتكار الرئيسي في توليد تسميات الإشراف. بالنسبة للأنظمة ذات التأثير الخطي للتحكم (x˙=f(x)+g(x)u) مع مجموعة تحكم متعدد الأوجه (convex polytope) U، يتم تعظيم الهاملتوني عند رؤوسU.
بدلًا من حل المعادلات التفاضلية الجزئية (PDEs) المعقدة أو إجراء تحسين مسار التحكم الكامل (مثل MPPI)، يقوم VertexCBF بتقييد البحث في التحكم إلى رؤوس متعدد الأوجه لمجموعة التحكم.
يحول هذا مشكلة السلامة ذات الأفق اللانهائي إلى تحسين أفق محدود عبر مجموعة منفصلة من تسلسلات التحكم.
يتم توليد تسميات الإشراف عبر بحث شجري موازي للمعالج الرسومي (GPU-parallel tree search) (باستخدام البحث الشعاعي Beam Search، أو البحث الشعاعي العشوائي Stochastic Beam Search، أو البحث بالفرع والحد Branch-and-Bound) عبر هذه المسارات المقيدة بالرؤوس. يتجنب هذا الحاجة إلى حلول عددية للمعادلات التفاضلية الجزئية ويقلل العبء الحسابي مقارنة بأخذ عينات التحكم الكامل.
هدف التدريب: يتم تدريب الشبكة العصبية عن طريق تقليل مزيج محدب من حدين للخسارة:
خسارة المعلومات المستندة إلى الفيزياء (LPDE): تفرض متراجحة التباين لـ HJ المستقرة محليًا على حالات مأخوذة عينات منها بكثافة وغير معلمة.
خسارة البيانات (Ldata): تقلل متوسط مربع الخطأ بين مخرجات الشبكة والتسميات المولدة عبر البحث الشجري المقيد بالرؤوس عند حالات مأخوذة عينات منها بشكل متفرق. يوجه هذا الجمع عملية التحسين بعيدًا عن الحلول الثابتة التافهة (الشائعة في التعلم القائم على PDE فقط) مع الحفاظ على الاتساق المحلي مع ديناميكيات النظام.
المساهمات الرئيسية
إطار تعلم منهجي: يقدم البحث طريقة لتعلم دوال CBF عصبية تقرب مجموعة الأمان القصوى باستخدام دمج نظرية إمكانية الوصول إلى HJ مع التعلم الخاضع للإشراف.
الإشراف المقيد بالرؤوس: من خلال استغلال ديناميكيات التأثير الخطي للتحكم وقيود التحكم المحدبة، يوضح المؤلفون أنه يمكن توليد الإشراف بكفاءة عبر بحث شجري مقيد بالرؤوس. هذا النهج أكثر قابلية للتوسع من أخذ عينات التحكم الكامل وأكثر فعالية من تحسين PDE وحده.
التمثيل المتبقي (Residual Parametrization): تضمن البنية المتبقية أن دالة CBF المتعلمة محصورة علويًا بدالة القيد، مما يمنع عملية التعلم من توسيع مجموعة الأمان خارج الحدود الفيزيائية.
تقييم شامل: تم تقييم الطريقة على 15 نظامًا ديناميكيًا متنوعًا (تتراوح من 2 إلى 13 حالة ومن 1 إلى 6 عناصر تحكم) ومقارنتها مع خطوط الأساس المعتمدة على PDE فقط وتحسين MPPI للتحكم الكامل.
النتائج التجريبية
أظهر التقييم أن VertexCBF يستعيد باستمرار مجموعات آمنة أكبر وأكثر موثوقية من الطرق المرجعية:
الموثوقية: غالبًا ما يفشل التعلم المعتمد على PDE فقط (ND)، حيث ينهار نحو حلول تافهة بمجموعات آمنة فارغة أو معدلات عالية للسلامة الكاذبة (ρFS). يحافظ VertexCBF على معدلات منخفضة للسلامة الكاذبة في معظم الأنظمة.
الفعالية: مقارنة ببيانات التحكم الكامل (FCD) المولدة عبر MPPI، يحقق VertexCBF (باستخدام بيانات التحكم المقيدة بالرؤوس VRCD) أحجام سلامة فعالة (ηeff) تنافسية أو متفوقة ومعدلات أقل من عدم الأمان الكاذب (ρFU). غالبًا ما يؤدي إشراف MPPI للتحكم الكامل إلى مجموعات آمنة مفرطة التحفظ.
التحقق من الأجهزة: أكدت تجربة الأجهزة مع روبوت متنقل يتنقل بين المشاة أن Neural CBF المتعلم يمكن نشره في الوقت الفعلي كمرشح سلامة، حيث نجح في تجنب الاصطدامات في جميع التجارب العشر رغم وجود عدم تطابق في النماذج (مثل انزلاق الإطارات، وتأخر الإدراك).
الأهمية والادعاءات
يدعي البحث أن VertexCBF يوفر نهج تصميم عملي ومنهجي لتعلم دوال CBF عصبية. تكمن أهميته في:
قابلية التوسع: يتجنب عدم القدرة على الحل في حلول PDE القائمة على الشبكات (grid-based) والتكلفة الحسابية العالية لتحسين مسار التحكم الكامل من خلال الاستفادة من هيكل رؤوس مجموعات التحكم.
المتانة: يتغلب على مشكلات عدم الاستقرار والحلول التافهة في التعلم القائم على PDE فقط من خلال تقديم إشراف عالي الجودة ومتفرق مستمد من عمليات البحث المقيدة بالرؤوس.
ضمانات السلامة: توفر البنية المتبقية ضمانًا مدمجًا بأن مجموعة الأمان المتعلمة تظل ضمن قيود الحالة الأصلية.
يقر المؤلفون بالقيود، مشيرين إلى أن الطريقة لا توفر بعد ضمانات تقارب رسمية أو حدود خطأ حتمية، بل تعتمد بدلاً من ذلك على التحقق بعد التدريب عبر عمليات التدحرج (rollouts) في الحلقة المغلقة. كما يشيرون إلى أنه بينما تتوسع الطريقة جيدًا للأنظمة التي تصل إلى 13 حالة، فإن الديناميكيات عالية الأبعاد جدًا (مثل نماذج البشر الكاملة) قد لا تزال تشكل تحديات حسابية بسبب النمو الأسي للبحث الشجري مع عدد رؤوس التحكم. ويُقترح العمل المستقبلي لمعالجة ضمانات التقارب، وقابلية التوسع للأنظمة عالية الأبعاد، والتوسعات في الديناميكيات غير اليقينية.