BIG-CBF: Behavior-Imagination-Guided Control Barrier Function with Shared Uncertainty for Mobile Robot Navigation
تقدم هذه الورقة البحثية BIG-CBF، وهي بنية ملاحة ثنائية المعدل تدمج تخيل السلوك مع نمذجة عدم اليقين المشترك لتوجيه دالات حاجز التحكم، مما يحقق نجاحاً شبه مثالي للمهام ويقلل من تدخلات مرشح السلامة في ملاحة الروبوتات المتنقلة.
تخيل روبوتًا يحاول السير عبر غرفة مزدحمة. مهمته الأساسية هي تجنب الاصطدام بالبشر أو الأثاث، وهي مهمة عادة ما يتولاها نظام سلامة يعمل مثل درع غير مرئي. هذا الدرع مصمم رياضيًا لإيقاف الروبوت في اللحظة التي يقترب فيها كثيرًا من عائق ما، مما يضمن عدم اصطدامه أبدًا. ومع ذلك، فإن لدرع السلامة هذا نقطة ضعف؛ فهو بارع في قول "توقف" أو "تمهل"، لكنه غالبًا ما يكون سيئًا للغاية في تقرير الاتجاه الذي يجب أن يسلكه بعد ذلك. عندما يواجه الروبوت موقفًا معقدًا، مثل ممر ضيق يتحرك فيه الناس في اتجاهين متعاكسين، فقد يستمر درع السلامة في الحفاظ على سلامة الروبوت عبر تجميده في مكانه، مما يمنع التصادم ولكنه يمنع التقدم أيضًا. يصبح الروبوت عالقًا، آمنًا ولكن غير مفيد، غير قادر على معرفة ما إذا كان عليه الخطو يسارًا، أو اليمين، أو الانتظار. هذه هي المشكلة الجوهرية التي يواجهها الباحثون في مجال الروبوتات: كيف نحافظ على سلامة الآلة دون جعلها حذرة للغاية بحيث لا تنهي مهمتها أبدًا.
ولحل هذه المشكلة، طور فريق من الباحثين نظام ملاحة جديدًا يسمى BIG-CBF. يرمز الاسم إلى "دالة حاجز التحكم الموجهة بالخيال والسلوك" (Behavior-Imagination-Guided Control Barrier Function)، لكن الفكرة وراءه بسيطة بشكل مدهش. فبدلاً من مجرد التفاعل مع الخطر لحظة ظهوره، يتوقف الروبوت الآن لجزء من الثانية لـ "يتخيل" عدة طرق مختلفة يمكنه التحرك من خلالها. إنه يختبر ست استراتيجيات محددة في ذهنه، مثل "المشي للأمام"، أو "الخطوة يسارًا للمرور"، أو "الخطوة يمينًا للمرور"، أو "الانتظار حتى يخلي الزحام المكان". ثم يختار النظام أفضل استراتيجية واحدة تحافظ على حركته نحو هدفه مع البقاء آمنًا. وبمجرد اختيار استراتيجية ما، ينفذها الروبوت، لكنه يظل محتفظًا بدرع السلامة الأصلي نشطًا كدعم نهائي. الابتكار الرئيسي هو أن الروبوت يستخدم نفس الفهم لعدم اليقين في كل من الاختبار الذهني والحركة الفعلية. في العالم الحقيقي، ليست المستشعرات مثالية، وهناك دائمًا تأخير طفيف بين رؤية شيء ما والتحرك. ومن خلال الإقرار بهذه التأخيرات والأخطاء في مرحلتي التخطيط والتنفيذ، يتجنب الروبوت الفخ الشائع حيث تبدو الحركة جيدة على الورق ولكنها تفشل في الواقع لأن نظام السلامة يصاب بالذعر فجأة.
اختبر الباحثون هذا النهج الجديد في سلسلة صارمة من عمليات المحاكاة التي شملت 3600 حلقة مختلفة عبر تسعة سيناريوهات متميزة. تراوحت هذه السيناريوهات من التنقل عبر حشد كثيف من الناس المتحركين إلى التسلل عبر فجوات ضيقة بين عوائق ثابتة. في كل اختبار، كان الروبوت مزودًا بنفس درع السلامة الأساسي، لكن الطريقة التي يختار بها مساره كانت تختلف. كانت النتائج مذهلة؛ فقد نجح نظام BIG-CFB في إكمال 99.78% من المهام، وهو معدل أعلى بكثير من الأساليب المتقدمة الأخرى. والأهم من ذلك، أنه تطلب تدخلًا أقل بكثير من درع السلامة. في الأنظمة السابقة، كان درب السلامة يضطر باستمرار لتصحيح أوامر الروبوت، مما يجبره غالبًا على التوقف أو الانحراف بشكل غير متوقع. ومع BIG-CBF، كان المسار الذي يختاره الروبوت متوافقًا تمامًا مع متطلبات السلامة لدرجة أن الدرع نادرًا ما كان يضطر للتدخل. وهذا يعني أن الروبوت تحرك بسلاسة وكفاءة أكبر، وقضى وقتًا أقل في حالة التردد.
ولضمان أن هذه النتائج لم تكن مجرد نتيجة للحاسوب، نقل الفريق النظام إلى العالم الحقيقي. قاموا بتثبيت البرنامج على روبوت مادي متعدد الاتجاهات مجهز بحاسوب داخلي قوي. وُضع الروبوت في خمس عشرة تجربة واقعية في ثلاث بيئات تحديّة: سيناريو يتطلب خطوة جانبية متعمدة، وغرفة مليئة بالفوضى الثابتة، ومسار يتقاطع مع المشاة. في كل واحدة من هذه التجارب الخمس عشرة، وصل الروبوت إلى وجهته دون ملامسة أي جسم أو شخص. وبينما عانت الأساليب الأخرى، حيث فشلت بعضها في إكمال حتى جزء بسيط من تجاربها، نجح BIG-CBF في كل مرة. وأظهرت البيانات أنه من خلال مشاركة رؤية متسقة لعدم اليقين بين طبقتي التخطيط والتنفيذ، قلل الروبوت من الطاقة المستهلكة في تصحيحات السلامة بهامش كبير. لم يتجنب الاصطدامات فحسب، بل حافظ أيضًا على تدفق حركة مستمر وهادف.
كشفت الدراسة أيضًا عن مقايضة دقيقة؛ نظرًا لأن النظام مصمم ليكون قويًا ضد عدم اليقين، فإنه أحيانًا يختار أن يكون أكثر تحفظًا مما هو ضروري حقًا، مثل الانتظار للحظة أطول قبل التحرك. أضاف هذا قدرًا صغيرًا من الوقت إلى الرحلة الإجمالية، لكنه كان خيارًا متعمدًا لضمان السلامة بدلاً من الفشل في إيجاد مسار. وجد الباحثون أن هذا التأخير الصغير كان ثمنًا عادلاً مقابل الانخفاض الكبير في تدخلات نظام السلامة والقضاء على سلوك "التعثر" الذي يعاني منه الروبوتات الأخرى. أثبت النظام أن الروبوت ليس بحاجة ليكون حاسوبًا خارقًا ليفكر مسبقًا؛ بل يحتاج ببساه إلى طريقة منظمة لتخيل بعض الخيارات البسيطة والالتزام بأفضلها.
يوضح هذا العمل أن مستقبل الملاحة الآمنة للروبوتات لا يكمن فقط في مستشعرات أفضل أو حواسيب أسرع، بل في منطق أفضل لاتخاذ القرار. ومن خلال فصل اختيار استراتيجية عامة عن التنفيذ اللحظي لتلك الاستراتيجية، وضمان فهم كلا الطبقتين لمحدوديات العالم الحقيقي، يمكن للروبوتات التنقل في المساحات المعقدة والديناميكية بمستوى من الثقة كان بعيد المنال سابقًا. وتشير النتائج إلى أنه مع الإطار الصحيح، يمكن للآلات ذاتية القيادة أن تكون آمنة وصارمة ومنتجة وموثوقة في آن واحد، وتتحرك عبر عالمنا دون تردد أو توقفات غير ضرورية.
ملخص تقني: BIG-CBF
بيان المشكلة توفر دوال الحاجز للتحكم (CBFs) إطاراً رياضياً صارماً لفرض تجنب الاصطدام المحلي في الروبوتات المتنقلة، حيث تعمل عادةً كمرشحات سلامة تقوم بتعديل الأوامر لاستيفاء شروط الحفاظ على الاستمرارية الأمامية. ومع ذلك، تعاني مرشحات CBF ذات التدخل الأدنى من "فجوة الحيوية" (liveness gap). فبينما تضمن هذه المرشحات السلامة، إلا أنها تفتقر إلى الوعي بالمناورات على مستوى المهمة. وفي البيئات الغامضة هندسياً (مثل العوائق المتماثلة أو الممرات الضيقة)، قد تقوم دالة CBF بكبح مكونات الاقتراب غير الآمنة دون إنشاء تفضيل جانبي مستمر، مما يتسبب في بقاء الروبوت آمناً ولكنه يقع في حالة من التوقف (stalled state).
علاوة على ذلك، تواجه النشر العملي "عدم تطابق عبر الطبقات" (cross-layer mismatch) تحت ظروف عدم اليقين. فطبقات اختيار المناورة في المستويات العليا غالباً ما تقيم المرشحين باستخدام الهندسة الاسمية، بينما تأخذ مرشحات السلامة في المستويات الدنيا حسابات عدم اليقين (مثل ضجيج الإدراك، وتأخيرات التنفيذ، وآثار التثبيت عند القيمة السابقة - zero-order-hold). هذا التضارب يمكن أن يؤدي إلى وضع يُعتبر فيه المناور قابلاً للتنفيذ أثناء التخطيط، ولكنه يستدعي تدخلات تصحيحية متكررة أثناء التنفيذ، مما يقلل الكفاءة ويزيد العبء على مرشح السلامة.
المنهجية: بنية BIG-CBF تقترح الورقة البحثية BIG-CBF (دالة الحاجز للتحكم الموجهة بتخيل السلوك مع مشاركة عدم اليقين)، وهي بنية ملاحة ثنائية المعدل مصممة لحل غموض المناورة ومواءمة دلالات عدم اليقين عبر طبقات التحكم.
بنية ثنائية المعدل:
تخيل السلوك منخفض المعدل (TB=0.5s): طبقة خفيفة الوزن تقيم مكتبة مدمجة من ستة سلوكيات تغذية راجعة مغلقة الحلقة: الهدف (GOAL)، المرور يساراً (PASS-L)، المرور يميناً (PASS-R)، الجانب الأيسر (SIDE-L)، الجانب الأيمن (SIDE-R)، والانتظار (YIELD). بدلاً من إعادة تخطيط المسارات مفتوحة الحلقة، تختار هذه الطبقة نمط سلوك واحد (b∗). وتقوم السياسة المختارة بتوليد أهداف فرعية محلية وأوامر مدخلات تعتمد على الحالة بشكل مستمر بناءً على أحدث القياسات.
التنفيذ عالي المعدل (TC=0.05s): يقوم السلوك المختار بتوليد أمر اسمي (uin)، والذي يتم بعد ذلك ترشيحه بواسطة CBF صارم لإنتاج الأمر الآمن النهائي (usafe).
تمثيل مشترك لعدم اليقين: لإزالة عدم التطابق بين التخطيط والتنفيذ، تبني BIG-CBF غلاف عدم يقين للموضع النسبي مشترك يستخدم في كل من طبقتي التخيل والتنفيذ. يجمع هذا الغلاف أربعة مصادر محددة لعدم اليقين:
تأخير الحركة النسبية (من الإدراك إلى التنفيذ).
عدم يقين تنبؤ العائق (نمو التباين).
بقايا تنفيذ الروبوت (الأخطاء المحدودة).
حركة التثبيت عند القيمة السابقة (ZOH) بين العينات.
تستخدم طبقة التخيل عدم اليقين هذا لتقييم توافق CBF تحليلياً وتسجيل السلوكيات دون حل مسألة البرمجة التربيعية (QP). وتستخدم طبقة التنفيذ نفس دلالات عدم اليقين في قيد الـ CBF الصارم. وهذا يضمن أن المناورات المختارة في المستويات العليا تتوافق مع قيود السلامة التي تواجهها المستويات الدنيا.
التسجيل والاختيار: يتم ترتيب السلوكيات بناءً على دالة تكلفة (Jb) توازن بين:
توافق CBF: عقوبة تحليلية لانتهاكات الحاجز المحتملة عبر الأفق الزمني.
التقدم في المهمة: المسافة إلى الهدف.
التجمد (Freezing): معاقبة الأوامر التي تؤدي إلى سرعة تقترب من الصفر.
النعومة: معاقبة الجهد العالي في التحكم أو التغيير المفاجئ.
التبديل: معاقبة التغييرات غير الضرورية في نمط السلوك.
يتم رفض المرشح إذا فشل اختبار الحاجز القوي؛ وإلا، يتم اختيار المرشح صاحب التكلفة الأدلى المقبولة، مع مراعاة فترات المكوث وعتبات تحسين التبديل.
المساهمات الرئيسية
تخيل السلوك خفيف الوزن: تقدم بنية لاختيار المناورة تقيم مكتبة مدمجة من السلوكيات مغلقة الحلقة عبر أفق زمني محدد. وهي تحل خيارات المرور والانتظار المنفصلة دون الحاجة إلى تحسين مسارات كثيف أو إعادة تشغيل المسارات مفتوحة الحلقة.
تقييم مشترك لعدم اليقين عبر الطبقات: تصيغ تمثيلاً موحداً لعدم يقين الموضع النسبي يربط تقييم مستوى السلوك بقيود السلامة في مستوى التنفيذ. هذا يقلل من الحاجة إلى التصحيح في المستويات الدنيا من خلال ضمان تقييم المرشحين في المستويات العليا تحت نفس دلالات عدم اليقين المستخدمة في مرشح التنفيذ.
التحقق التجريبي المكثف: تم التحقق من النهج من خلال 3,600 حلقة محاكاة عبر تسعة سيناريوهات متنوعة و120 تجربة خاضعة للإشراف (8 طرق × 3 سيناريوهات × 5 تكرارات) على روبوت متعدد الاتجاهات مجهز بـ Jetson Orin Nano.
النتائج
أداء المحاكاة: عبر 3,600 حلقة، حققت BIG-CBF معدل نجاح في المهمة بنسبة 99.78%، متفوقة على النماذج المرجعية بما في ذلك CBF-only، وBackup-CBF، وPL-CBF، وAPF، وDWA، وMPPI. كما قللت بشكل كبير من العبء على مرشح السلامة في المستويات الدنيا، حيث بلغ متوسط طاقة تدخل CBF (المشار إليها بـ ECBF) 0.02 مقارنة بـ 0.83 لـ DWA+CBF و0.45 لـ MPPI+CBF. وانخفضت نسبة تفعيل CBF إلى 9.10% (مقابل 30.24% لـ DWA).
دراسة الاستئصال (عدم اليقين المشترك): أظهرت مقارنة BIG-CBF مع نسخة تفتقر إلى عدم اليقين المشترك (BIG-CBF-NoShared) أن عدم اليقين المشترك قلل من نسبة تفعيل CBF من 15.64% إلى 9.10% ومن طاقة التدخل من 0.10 إلى 0.02. جاء ذلك مع مقايضة طفيفة في وقت الإنجاز (11.72 ثانية مقابل 11.21 ثانية)، وهو ما يُعزى إلى اختيار مناورات أكثر تحفظاً واتساقاً.
التجارب على الأجهزة: في تجارب على روبوت Rosmaster X3 حقيقي، أكملت BIG-CBF 15/15 تجربة خاضعة للإشراف (3 سيناريوهات × 5 تكرارات) دون أي حوادث اصطدام. كما أثبتت جدوى الحوسبة على المتن، حيث بلغ زمن تأخير المخطط 141.0 مللي ثانية (ضمن ميزانية الـ 0.5 ثانية) وزمن حل CBF هو 3.86 مللي ثانية. وأكدت النتوات المادية أن عدم اليقين المشترك قلل من طاقة تدخل CBF بمقدار 0.34 ونسبة التفعيل بمقدار 12.4 نقطة مئوية مقارنة بالنسخة غير المشتركة.
الأهمية والادعاءات تدعي الورقة أن BIG-CBF تنجح في سد الفجوة بين ترشيح السلامة المحلي والحيوية على مستوى المهمة. ومن خلال فصل اختيار المناورة عن ترشيح السلامة عالي المعدل وفرض الاتساق في نمذجة عدم اليقين عبر الطبقات، تمنع هذه البنية الروبوتات من التوقف في الهندسات الغامضة مع تقليل تكرر وحجم تدخلات مرشح السلامة. ويؤكد المؤلفون أن هذا النهج يقدم بديلاً فعالاً حاسبياً لطرق أخذ عينات المسارات الثقيلة (مثل MPPI) مع توفير متانة ومعدلات إنجاز مهام فائقة مقارنة بالنهج التفاعلية أو القائمة على المكتبات القياسية. وتوضح الدراسة أن تخيل السلوك خفيف الوزن، عندما يقترن بعدم اليقين المشترك، يمكن أن يحسن حيوية المهمة دون المساس بضمانات السلامة لتنفيذ الـ CBF الصارم.