VikPath: A Vision Kansformer Framework for Effective Obstacle Avoidance in Self-Supervised Pathfinding
يُعد VikPath إطار عمل للتعلم الذاتي الموجه يتميز بوحدة Vision Kansformer مبتكرة تتعلم توزيعات العوائق دون الحاجة إلى بيانات مصنفة لتوليد مسارات أكثر سلاسة وأماناً وكفاءة مع زمن استجابة أقل بكثير في الاستدلال مقارنة بالأساليب المتطورة.
المؤلفون الأصليون:Junyao Wang, Yulin Xu, Mohammad Abdullah Al Faruque
في عالم الروبوتات والمركبات ذاتية القيادة، تُعد القدرة على إيجاد طريق من النقطة (أ) إلى النقطة (ب) تحدياً جوهرياً. لعقود من الزمن، حلت الحواسيب هذه المعضلة باستخدام قواعد رياضية تعامل العالم كشبكة من المربعات، حيث تحسب أقصر مسافة مع محاولة تجنب الجدران. تعمل هذه الطرق التقليدية بشكل جيد في الغرف البسيطة والمتوقعة، لكنها غالباً ما تعاني في المساحات المعقدة والمزدحمة حيث تتكدس العوائق جنباً إلى جنب. تميل القواعد القديمة إلى إنتاج مسارات تكون تقنياً هي الأقصر، لكنها قريبة بشكل خطير من الأجسام، أو مسارات تتطلب انعطافات مفاجئة وحادة لا تستطيع المركبة الحقيقية القيام بها فيزيائياً. علاوة على على ذلك، فإن العديد من المحاولات الحديثة لتعليم الحواسيب كيفية التنقل بشكل أفضل اعتمدت على عرض آلاف الأمثلة للمسارات المثالية التي أنشأها بشر أو حواسيب أخرى. وهذا النهج يعيبه وجود خلل: فإذا كانت الأمثلة غير مثالية أو منحازة، فإن نظام التعلم يرث تلك الأخطاء نفسها، وغالباً ما يفشل عند مواجهة بيئة جديدة لم يسبق له رؤيتها.
لقد طور فريق من الباحثين في جامعة كاليفورنيا، إيرفاين، نهجاً جديداً يسمى "فيك باث" (VikPath) يغير كيفية تعلم الآلات للتنقل دون الحاجة إلى معلم يرشدها إلى الطريق. فبدلاً من حفظ المسارات المعدة مسبقاً، يتعلم نظامهم فهم تخطيط البيئة من تلقاء أنفسهم، تماماً كما قد ينظر شخص إلى غرفة مزدحمة ويعرف غريزياً أين توجد المساحات المفتوحة وأين تكون تجمعات الأثاث ضيقة جداً بحيث يصعب المرور عبرها. لقد أنشأ الباحثون وحدة تعلم خاصة تنظر إلى خريطة العوائق وتملأ التفاصيل المفقودة، حيث تتعلم التنبؤ بمكان وجود العوائق على الأرجح ومدى القرب الذي يجب أن تلتزم به المسارات الآمنة منها. وهذا يسمح للنظام بإنشاء "خريطة احتمالية"، وهي دليل ذهني يسلط الضوء على الممرات المفتوحة والآمنة ويحذر من المناطق المزدحمة للغاية، حتى لو كانت تلك المناطق فارغة تقنياً.
إن جوهر هذا النظام الجديد هو بنية فريدة تجمع بين فكرتين قويتين لفهم العلاقات المكانية. فهو يستخدم طريقة تقوم بإخفاء أجزاء من الخريطة وتجبر الكمبيوتر على تخمين ما هو مفقود بناءً على السياق المحيط، وهي تقنية تساعده على تعلم هيكل البيئة بدلاً من مجرد حفظ أنماط محددة. ولجعل هذه التخمينات أكثر دقة ومرونة، يستخدم النظام إطاراً رياضياً يمكنه تكييف قواعده الداخلية لتناسب الأشكال والأحجام المحددة للعوائق التي يواجهها. وبمجرد أن يتعلم النظام قراءة الخريطة وفهم أين تكمن المخاطر، فإنه يستخدم عملية بحث منقحة لرسم مسار. هذه العملية لا تبحث فقط عن الخط الأقصر؛ بل تعاقب بنشاط المسارات التي تقترب كثيراً من العوائق وتثبط الانعطافات الحادة والمفاجئة. والنتيجة هي مسار ليس فعالاً فحسب، بل سلس وآمن أيضاً، يتجنب التضييقات والتحركات المتشنجة التي تعاني منها الطرق القديمة.
عندما اختبر الباحثون نظامهم مقابل أفضل الأساليب الموجودة، كانت النتائج مذهلة. ففي سلسلة من الاختبارات باستخدام ثلاثة أنواع مختلفة من البيئات المعقدة، وجد "فيك باث" باستمرار مسارات كانت أكثر أماناً بشكل ملحوظ من تلك التي وجدتها الخوارزميات التقليدية. وفي المتوسط، حافظت المسارات التي أنشأها النظام الجديد على مسافة أكبر بنسبة 3.28 بالمائة من العوائق مقارنة بأفضل طريقة تالية، مما يعني أن الروبوت سيكون أقل عرضة للاحتكاك بجدار أو العلوق في فجوة ضيقة. وفي الوقت نفسه، كانت المسارات أكثر سلاسة، مع تغييرات أقل حدة في الاتجاه، مما يجعل من السهل على المركبة الفيزيائية اتباعها. ولعل الأمر الأكثر إثارة للدهشة هو أن النظام كان سريعاً للغاية؛ فقد أتم حساباته في جزء بسيط من الوقت الذي تتطلبه الطرق المتقدمة الأخرى القائمة على التعلم، حيث أظهر انخفاضاً بنسبة 87.07 بالمائ في الوقت المستغرق لإيجاد المسار. وتأتي هذه السرعة من حقيقة أن النظام لا يحتاج إلى معالجة أمثلة معقدة ومصنفة مسبقاً أو إجراء خطوات إضافية لتنعيم المسار بعد العثور عليه؛ إذ إن السلامة والسلاسة مدمجتان في عملية البحث منذ البداية.
إن الاختبار الحقيقي لأي نظام ملاحة هو ما إذا كان بإمكانه التعامل مع عالم لم يره من قبل. لقد درب الباحثون نظامهم على مجموعة واحدة من الخرائط، ثم طلبوا منه التنقل في بيئات مختلفة تماماً، بما في ذلك تخطيطات تشبه شوارع المدن ومستويات ألعاب الفيديو، دون أي تدريب إضافي. وقد تكيف النظام على الفور، محافظاً على قدرته على إيجاد مسارات آمنة وسلسة، وتجنب الحاجة إلى إعادة تعليم البشر قواعد البيئة الجديدة. وهذا يشير إلى أن النظام قد تعلم فهماً عميقاً لكيفية توزيع العوائق في الفضاء، بدلاً من مجرد حفظ أنماط محددة. ومن خلال تعليم الآلات فهم شكل الخطر وقيمة الرحلة السلسة، يقدم هذا العمل طريقة جديدة للأنظمة ذاتية القيادة للتحرك عبر عالمنا المعقد المليء بالعوائق بثقة وكفاءة أكبر.
ملخص تقني: VikPath
بيان المشكلة
يعد تحديد المسار تحديًا جوهريًا في الذكاء الاصطناعي والأنظمة المستقلة، حيث يتطلب تحديد مسارات فعالة وخالية من الاصطدامات من نقطة البداية إلى الوجهة. تعتمد الخوارزميات التقليدية القائمة على الاستدلال (Heuristics)، مثل خوارزمية A*، على استدلالات محددة مسبقًا (مثل المسافة الإقليدية أو مسافة مانهاتن) وتمثيلات الشبكة أو الرسم البياني. وبينما تكون هذه الطرق فعالة في البيئات المنظمة، إلا أنها غالبًا ما تواجه صعوبات في السيناريوهات المعقدة الغنية بالعوائق حيث تفشل الاستدلالات المصممة يدويًا في استيعاب الهياكل المكانية المعقدة. علاوة على ذلك، تركز المخططات الكلاسيكية عادةً على تحسين طول المسار وتجنب الاصطدام فقط، وغالبًا ما تهمل عوامل عملية مثل الخلوص من العوائق (القرب من العوائق) وسلاسة المسار. يمكن أن يؤدي هذا إلى مسارات تمر بالقرب من العوائق بشكل خطير أو تحتوي على انعطافات مفاجئة، مما يجعلها غير مثالية أو غير آمنة للتنفيذ في العالم الحقيقي.
حاولت النهج الحديثة القائمة على التعلم معالجة هذه المشكلات، لكنها غالبًا ما تعتمد على التعلم الخاضع للإشراف باستخدام تسميات (Labels) ناتجة عن مخططات تقليدية أو تعليقات توضيحية يدوية. هذا الاعتماد يحد من القدرة على التعميم، حيث ترث النماذج المتعلمة التحيزات والقيود الخاصة بالبيانات الإشرافية (مثل إعطاء الأولوية لأقصر المسارات على حساب السلامة). بالإضافة إلى ذلك، غالبًا ما تعامل الطرق الموجودة توليد المسار وتنعيمه كمرحلتين منفصلتين (مثل استخدام منحنيات بيزييه في مرحلة ما بعد المعالجة)، مما قد يضر بالخلوص من العوائق أو يتطلب فحوصات جدوى إضافية.
المنهجية
تقترح الورقة البحثية VikPath، وهو إطار عمل لتحديد المسارات ذاتي الإشراف مصمم لتحسين القرب من العوائق، وسلاسة المسار، والكفاءة الحسابية بشكل مشترك دون الاعتماد على تسميات المسارات التي أعدها الخبراء. يعمل إطار العمل في مرحلتين:
1. تعلم التمثيلات المدركة للعوائق (Vision Kansformer)
تتعلم المرحلة الأولى تمثيلًا كثيفًا لـ خريطة احتمالية العوائق مباشرة من خرائط البيئة غير المصنفة باستخدام وحدة Vision Kansformer مبتكرة.
البنية: يجمع النموذج بين نمذجة السياق العالمي لآلية الانتباه الذاتي (من المحولات الرؤيوية - Vision Transformers) والتحويلات غير الخطية المرنة لشبكات كولموغوروف-أرنولد (KANs). بخلاف المحولات القياسية التي تستخدم شبكات التغذية الأمامية (FFNs)، يستبدل VikPath هذه الطبقات بطبقات KAN، التي تستخدم دالات أحادية المتغير قابلة للتعلم (تتم تمثيلها بواسطة B-splines) لتنقية التمثيلات.
استراتيجية التدريب: يتم تدريب الوحدة باستخدام نهج النمذجة المقنعة (المستوحى من نمذجة الصور المقنعة).
القناع (Masking): يتم قناع أجزاء عشوائية من خريطة الإشغال الثنائية.
الأهداف: يتم تدريب النموذج على إعادة بناء المناطق المقنعة باستخدام ثلاثة خسائر متكاملة:
خسارة إعادة البناء (Reconstruction Loss): الهدف ليس الخريطة الثنائية الأصلية بل هدف مدرك للقرب من العوائق. يتم إنشاء هذا الهدف عن طريق توسيع مناطق العوائق بشكل تكراري وتعيين قيم أعلى للعوائق ومحيطها المباشر، مما يشجع النموذج على تعلم القرب المكاني.
الخسارة التباينية (Contrastive Loss): يعمل محول رؤيوي (ViT) مدرب مسبقًا كمعلم لتوفير تمثيلات مرجعية، مما يعزز قدرة التمييز للميزات المتعلمة.
الخسارة الإدراكية (Perceptual Loss): تضمن الحفاظ على المعلومات الهيكلية عالية المستوى أثناء عملية إعادة البناء.
المخرج: تولد رأس إعادة البناء خريطة احتمالية طبيعية P∈[0,1]m×n، حيث تشير القيم الأعلى إلى المناطق ذات التأثير القوي للعوائق.
2. البحث في المسار المدرك للعوائق والسلاسة
تقوم المرحلة الثانية بعملية تحديد المسار باستخدام خوارزمية الوزن المرجح A (WA)** المعدلة التي تدمج خريطة الاحتمالية المتعلمة وعقوبة السلاسة مباشرة في تكلفة البحث.
تعريف الحالة: لمراعاة السلاسة، تُعرف حالة البحث كزوج (Qp,Q)، يمثل الموقع الحالي وسابقه، بدلاً من مجرد الموقع الحالي.
دالة التكلفة: تتضمن تكلفة الانتقال c(X,Xn) لعملية انتقال ما:
مسافة الحركة: تكلفة الخطوة القياسية.
عقوبة القرب من العوائق: حد مرجح woP(Qn) مشتق من خريطة الاحتمالية المتعلمة، مما يعاقب المسارات عبر المناطق ذات الكثافة العالية للعوائق.
عقوبة الانعطاف الحاد: تكلفة csmooth تُحسب بناءً على الزاوية بين ناقلات الحركة الواردة والصادرة، مما يقلل من تغيير الاتجاهات المفاجئة.
البحث: تستخدم الخوارزمية استدلالًا مرجحًا لتوجيه البحث نحو الهدف مع موازنة تكاليف السلامة والسلاسة، مما يلغي الحاجة إلى خطوات معالجة لاحقة منفصلة لتنعيم المسار.
المساهمات الرئيسية
إطار عمل VikPath: نظام لتحديد المسارات ذاتي الإشراف يتعلم التمثيلات البيئية دون الاعتماد على تسميات المسارات الناتجة عن الاستدلالات أو التوضيحات اليدوية، ويدمج بشكل مشترك الوعي بالعوائق وسلاسة المسار.
وحدة Vision Kansformer: بنية مبتكرة تدمج شبكات KAN في هيكل المحولات مع النمذجة المقنعة. تلتقط هذه الوحدة التبعيات المكانية المحلية والعالمية لبناء خرائط احتمالية دقيقة للعوائق، محققة متوسط خلوص من العوائق أكبر بنسبة 3.28% مقارنة بالطرق الرائدة (SOTA).
هدف بحث موحد: تحسين لخوارزمية Weighted A* يتضمن صراحةً القرب من العوائق وعقوبة الانعطاف الحاد في دالة التكلفة. يتيح ذلك توليد مسارات آمنة وسلسة دون الحاجة إلى مرحلة معالجة لاحقة تعتمد على منحنيات بيزييه.
الكفاءة: يحقق إطار العمل متوسط زمن انتقال استدلال أقل بنسبة 87.07% من الطرق الرائدة مع الحفاظ على جودة المسار.
النتائج التجريبية
قيم المؤلفون VikPath على ثلاثة مجموعات بيانات عامة (Motion Planning، وBugtrap Forest، وTiled Motion Planning) ومجموعتي بيانات غير مرئية (City وGame) لاختبار القدرة على التعميم.
مقاييس الأداء: تفوق VikPath باستمرار على النماذج المرجعية (بما في ذلك WA*، وImproved JPS، وSAIL-SL، وBB-A*، وFDW-A*، وAPF-A*) في:
درجة سلامة المسار: خلوص تراكمي أعلى من العوائق.
متوسط المسافة من العوائق: مسافة متوسطة أكبر من أقرب العوائق.
السلاسة: انحراف زاوي أقل (مما يشير إلى مسارات أكثر سلاسة) مقارنة بالطرق التي تعطي الأولوية للسلامة على حساب السلاسة.
كفاءة البحث: تقليل كبير في استكشاف العقد مقارنة بـ A* القياسي والنماذج المرجعية الأخرى.
زمن الانتقال (Latency): أدنى زمن انتقال للاستدلال عبر جميع مجموعات البيانات.
التعميم: عند تطبيقه على مجموعات البيانات غير المرئية (City وGame) دون ضبط دقيق (Fine-tuning)، حافظ VikPath على أداء متفوق في السلامة، والخلوص، والكفاءة، مما أظهر قدرة قوية على التعميم عبر مجموعات البيانات.
دراسات الاستئصال (Ablation Studies):
أدى إزالة عقوبة العوائق المتعلمة أو عقوبة السلاسة إلى انخفاض كبير في مقاييس السلامة والسلاسة، مما أكد ضرورة كلا المكونين.
أظهرت مقارنة تقنيات إعادة البناء أن Vision Kansformer تفوق على Vision Transformers وVision Mamba في إعادة بناء هياكل العوائق (MSE أقل، وPSNR/SSIM أعلى).
الأهمية
تزعم الورقة أن VikPath يعالج القيود الحرجة في طرق تحديد المسارات الموجودة من خلال إلغاء الاعتماد على التسميات التي أعدها الخبراء وتوحيد الخلوص من العوائق مع سلاسة المسار في عملية بحث واحدة فعالة. من خلال الاستفادة من التعلم ذاتي الإشراف لفهم توزيعات العوائق ودمج هذه الرؤى مباشرة في دالة تكلفة تحديد المسار، ينتج VikPath مسارات ليست فقط أقصر، بل أيضًا أكثر أمانًا وقابلية للتنفيذ في البيئات الواقعية. إن قدرة إطار العمل على تحقيق أداء عالٍ مع زمن انتقال استدلال منخفض تجعله مناسبًا بشكل خاص لتطبيقات الملاحة المستقلة الحساسة لزمن الانتقال في السيناريوهات المعقدة والغنية بالعوائق.