Failure or Drift? Evaluating Monocular SLAM under Synthetic and Real-World Corruptions
تقيم هذه الورقة أنظمة التحديد الآني للموقع ورسم الخرائط أحادية الكاميرا (monocular SLAM) في ظل ظروف فساد اصطناعية وواقعية، كاشفةً أن أدوات التتبع المتعلمة غالباً ما تستبدل الفشل الكارثي بانحراف شديد، وأن صلاحية اختبارات الإجهاد الاصطناعية تعتمد على مدى دقتها الفيزيائية مقارنة بالظروف الواقعية.
تخيل سيارة تقود نفسها عبر مدينة، أو روبوت يتنقل في مستودع، معتمداً كلياً على كاميرا واحدة لفهم مكانه. هذه التكنولوجيا، المعروفة باسم "التموضع وتحديد الموقع البصري" (visual SLAM)، هي البوصلة غير المرئية التي تسمح للآلات ببناء خريطة لمحيطها وتتبع حركتها في الوقت الفعلي. ولكي تعمل هذه الأنظمة بأمان، يجب ألا تقتصر وظيفتها على العمل في الظروف المثالية المشمسة فحسب، بل أيضاً عندما ينقلب العالم ضدها: عندما يطمس المطر عدسة الكاميرا، أو يحجب الضباب الطريق، أو عندما تنخفض الشمس في الأفق لتلقي بظلال طويلة ومربكة. لطالما حاول المهندسون اختبار هذه الأنظمة عن طريق إلحاق ضرر اصطناعي بمقطع الفيديو باستخدام ضوضاء أو تشويش أو عتامة مولدة حاسوبياً، آملين في التنبؤ بكيفية تصرف الآلة أثناء العاصفة. ومع ذلك، ظل السؤال الجوهري دون إجابة: هل الاختبار الذي يبدو مثل العاصفة يتصرف فعلياً مثلها؟ إذا قالت محاكاة حاسوبية إن الروبوت آمن، فهل هو آمن حقاً، أم أنه يخدع الاختبار فحسب؟
وضع فريق من الباحثين في جامعة مانهايم ومعهد ماكس بلانك للمعلوماتية نصب أعينهم الإجابة على ذلك من خلال إخضاع ثلاثة أنواع مختلفة من أنظمة تتبع الكاميرا لاختبار صارم. أخذوا مسار قيادة قياسي تم تسجيله في ألمانيا وأخضعوه لنوعين مختلفين تماماً من الإجهاد. أولاً، طبقوا تشوهات بسيطة ومسطحة على الصور، مثل تغيير السطوع، أو إضافة ضوضاء حبيبية، أو جعل الصورة ضبابية، تماماً مثل تطبيق مرشح (فلتر) على صورة هاتف ذكي. ثانياً، طبقوا تشوهات أكثر تعقيداً قائمة على الفيزياء تحترم عمق المشهد، مثل محاكاة المطر الذي يسقط أمام الأجسام البعيدة وليس القريبة منها، أو الضباب الذي يزداد كثافة في المسافات البعيدة. ثم قارنوا بين أداء هذه الأنظمة وبين لقطات حقيقية تم تصويرها في ظروف مطر وشتاء ومساء فعلية. لم يكن الهدف مجرد معرفة أي نظام سيفشل، بل فهم كيفية فشله.
كشفت النتائج عن انقسام جوهري في كيفية تعطل هذه الآلات. أحد الأنظمة، الذي يعتمد على إيجاد زوايا وحواف حادة ومميزة في الصورة، يتصرف مثل إنسان يفقد طريقه في ضباب كثيف: فهو ببساطة يتوقف. عندما تصبح المعالم البصرية صعبة الرؤية للغاية، يعترف هذا النظام بالهزيمة ولا يعطي أي مسار على الإطلاق. هذا فشل واضح وصريح يسهل اكتشافه. أما النظامان الآخران، اللذان يستخدما التعلم المتقدم لتخمين حركة المشهد، فيتصرفان بشكل مختلف. فهما لا يتوقفان؛ حتى عندما تكون الصورة مشوهة بشدة، يستمران في إخراج مسار، لكن ذلك المسار ينحرف ببطء عن الواقع. قد يخبران الروبوت أنه يتحرك في خط مستقيم بينما هو في الواقع ينعطف، أو أنه قطع مئة متر بينما لم يتحرك سوى بضعة أمتار. هذا الانحراف الصامت هو الأكثر خطورة لأن النظام يبدو وكأنه يعمل بشكل مثالي بينما يقود الآلة بهدوء نحو الهاوية.
ولعل الاكتشاف الأكثر إثارة للدهشة هو أن نوع الاختبار المستخدم غيّر تماماً النظام الذي بدا الأفضل. عندما استخدم الباحثون تشوهات الصور البسيطة والمسطحة، بدا أحد الأنظمة القائمة على التعلم متفوقاً، حيث تعامل مع الضوضاء بشكل أفضل من منافسه. ومع ذلك، عندما انتقلوا إلى التشوهات الأكثر واقعية والقائمة على الفيزياء والتي تراعي العمق وبنية المشهد، انقلبت الترتيبات تماماً. فالنظام الذي بدا ضعيفاً في الاختبارات البسيطة أصبح هو الفائز الواضح في الاختبارات المعقدة. وهذا يشير إلى أن استخدام مرشحات الصور البسيطة لاختبار المتانة يمكن أن يكون مضللاً؛ فالاختبار الذي يبدو كالعاصفة قد يكون في الواقع يختبر مشكلة مختلفة تماماً عن العاصفة الحقيقية.
بعد ذلك، تحقق الباحثون من هذه النتائج مقابل بيانات من العالم الحقيقي مأخوذة من أيام ممطرة، وصباحات ضبابية، ومساءات غائمة. ووجدوا أن الاختبارات المعقدة القائمة على الفيزياء تنبأت بشكل صحيح بأي نظام سيكون الأفضل في ظروف المطر والشتاء. أما الاختبارات البسيطة، فقد فشلت في التنبؤ بالنتيجة بالنسبة لإضاءة المساء، حيث فضلت بشكل خاطئ النظام الذي كان في الواقع الأقل أداءً في الواقع. وهذا يثبت أنه بينما تعتبر الاختبارات الاصطناعية أدوات مفيدة للتشخيص، إلا أنها ليست كرات بلورية مثالية. فالاختبار الذي يبدو مقنعاً على الشاشة لا يترجم دائماً إلى الواقع الفعلي الفوضوي.
تخلص الدراسة إلى وجوب توخي الحذر في كيفية الحكم على هذه التقنيات. فالنظام الذي لا يتوقف أبداً عن إنتاج مسار ليس بالضرورة نظاماً موثوقاً؛ بل قد يكون واثقاً من خطئه فحسب. إن المتانة الحقيقية تتطلب التمييز بين نظام يعترف بأنه لا يستطيع الرؤية، ونظام يستمر في التخمين بينما ينحرف عن المسار. علاوة على ذلك، فإن اختيار الاختبار أمر بالغ الأهمية. لفهم ما إذا كان بإمكان روبوت التعامل مع عاصفة حقاً، يجب اختباره باستخدام عمليات محاكاة تحترم فيزياء العاصفة، وليس مجرد مظهرها. فمن خلال مطابقة تعقيد الاختبار مع تعقيد العالم الحقيقي فقط، يمكننا الوثوق بأن الآلات التي نرسلها إلى المطر ستجد طريقها للعودة إلى الديار.
ملخص تقني: فشل أم انحراف؟ تقييم نظام SLAM أحادي العدسة تحت تأثير التشويهات الاصطناعية والواقعية
بيان المشكلة
يعد التحديد المتزامن للموقع ورسم الخرائط البصري (Visual SLAM) شرطًا أساسيًا للقيادة الذاتية، والروبوتات المتنقلة، والواقع المعزز. ومع ذلك، تعتمد التقييمات القياسية في الغالب على مسارات نظيفة، مما يفشل في رصد الظروف القاسية (مثل المطر، الضباب، الإضاءة المنخفضة، ضبابية الحركة، ضوضاء المستشعر) التي يتم مواجهتها أثناء التشغيل الفعلي. وبينما توفر التشويهات الاصطناعية طريقة محكومة لعزل عوامل التدهور المحددة، فإن صلاحيتها كبدائل للظروف الواقعية تظل غير مثبتة للأنظمة ذات الحالة المستمرة (stateful systems) مثل SLAM. في هذه الأنظمة، تنتشر الأخطاء عبر الزمن؛ حيث يمكن لتشويه ما يغير الارتباطات البصرية قد يفضل متتبعات مختلفة أو يؤدي إلى أنماط فشل مختلفة (فقدان صريح للتتبع مقابل تراكم صامت للانحراف) مقارنة بالظروف القاسية الطبيعية. يبحث هذا العمل في الصلاحية الخارجية لاختبارات الإجهاد الاصطناعية لنظام SLAM أحادي العدسة، متسائلًا عما إذا كانت الاستنتاجات المستخلصة من تشويهات فضاء الصورة أو التشويهات المدركة للهندسة (geometry-aware) تظل صالحة عند تطبيقها على بيانات واقعية قاسية.
المنهجية
تستخدم الدراسة بروتوكول تقييم محكوم يقارن بين ثلاثة نماذج متميزة لـ SLAM أحادي العدسة دون تكيف خاص بالتشويهات:
ORB-SLAM2: نظام كلاسيكي يعتمد على الميزات المتفرقة (sparse features) مع إغلاق الحلقة وإعادة التموضع بشكل صريح.
DPVO: نظام تتبع حركة بصري يعتمد على الرقع (patch-based) ويتعلم عبر التحديثات المتكررة والضبط الحزمي التفاضلي، ويفتقر إلى إغلاق الحلقة الكلاسيكي.
DROID-SLAM: نظام ارتباطات كثيف (dense) يتعلم عبر التحسين متعدد الإطارات العالمي والضبط الحزمي الكثيف.
مجموعات البيانات والتشويهات:
الأساس (Baseline): تسلسلات قيادة KITKI (00–10) النظيفة.
اختبار الإجهاد الاصطناعي: يخضع التسلسل 00 من KITKI لـ 115 نسخة مشوهة عبر ثلاث فئات عند خمس مستويات من الشدة:
فضاء الصورة (Image-space): 13 تحويلاً (مثل السطوع، التباين، الضوضاء، الضبابية، ضغط JPEG) من حزمة imagecorruptions.
المدركة للهندسة (Geometry-aware): 7 تأثيرات (مثل الضباب، المطر، الإضاءة المنخفضة، تغيرات التركيز) من 3D Common Corruptions باستخدام العمق وهيكل المشهد.
المركبة (Compound): تركيبات من أعلاه (مثل المطر + التباين).
المرجع الواقعي: أربعة تسلسلات من مجموعة بيانات 4Seasons تمثل بعد الظهر الغائم، بعد الظهر الممطر، صباح شتوي غائم، والمساء الغائم. تعمل هذه كأمثلة مطابقة لمستوى الظروف وليس كأرقام مسجلة مقترنة.
بروتوكول التقييم: يقدم المؤلفون بروتوكولًا مدركًا للفشل للتمييز بين فشل التتبع الصريح والانحراف المتراكم:
الصلاحية (Vr): مقياس ثنائي يشير إلى ما إذا كان قد تم إرجاع مسار غير فارغ وقابل للتقييم.
الخطأ الشرطي: يتم حساب خطأ الوضع المطلق (APE) وخطأ الوضع النسبي (RPE) فقط للمسارات الصالحة. وهذا يمنع الطرق التي لا ترجع أي مخرجات من خفض مقاييس الخطأ اصطناعيًا عبر تجنب الحساب.
المقارنة: تحلل الدراسة "معدل التشغيل الصالح" والترتيب النسبي للمتتبعات المتعلمة (DPVO مقابل DROID-SLAM) عبر أنواع التشويهات والشدات المختلفة.
المساهمات الرئيسية
التقييم المحكوم: مقارنة منهجية بين نماذج SLAM المتفرقة القائمة على الميزات، والمتعلمة القائمة على الرقع، والمتعلمة الكثيفة عبر فضاء الصورة، والتشويهات المدركة للهندسة، والتشويهات المركبة، والظروف القاسية الطبيعية.
بروتوكول مدرك للفشل: منهجية تبلغ عن صلاحية المسار بشكل منفصل عن دقة الوضع، مما يتجنب خلط فقدان التتبع مع مقاييس الخطأ المنخفضة.
تحليل الدقة (Fidelity Analysis): تقديم أدلة تثبت أن "دقة" نموذج التشويه (فضاء الصورة مقابل المدرك للهندسة مقابل المركب) تغير بشكل جوهري ترتيب المتتبعات المتعلمة، وأن الاستنتاجات الاصطناعية لا تنتقل دائمًا إلى البيانات الواقعية.
النتائج
1. أنماط الفشل: الفشل الصريح مقابل الانحراف الصامت
ORB-SLAM2: يظهر غالبًا فشلاً صريحًا، حيث لا يعيد أي مسار قابل للتقييم في ظل وجود الضوضاء، أو الثلوج، أو الضبابية الشديدة. وعندما يكون صالحًا، غالبًا ما يحقق أقل وسيط لـ APE في البيانات النظيفة ولكنه يعاني من عدم استقرار يعتمد على المسار.
المتتبعات المتعلمة (DPVO & DROID-SLAM): تظل نشطة في 100% من المحاولات الاصطناعية. وبدلاً من الفشل الصريح، فإنها تراكم انحرافًا مستمرًا وحادًا أحيانًا. تحت التشويهات المدركة للهندسة والمركبة، يتجاوز APE المتوافق لها غالبًا 100 متر. هذا "التدهور الصامت" خطير تشغيليًا لأنه قد يمر عبر أنظمة الاستقلالية دون تفعيل آليات إعادة التموضع أو التراجع.
2. تغير اختيار المتتبع بناءً على دقة التشويه
يعتمد الظهور النسبي لقوة النظام بشكل كبير على نوع التشويه المطبق:
تشويهات فضاء الصورة: تفضل بشكل أساسي DPVO. في 30 حالة من أصل 43 إعدادًا مقترنًا، يحقق DPVO أقل APE. إن الاختبارات المقتصرة على التحويلات العالمية البسيطة (السطوع، التباين) ستختار DPVO بشكل خاطئ كنظام متفوق.
التشويهات المدركة للهندسة والمركبة: تفضل بقوة DROID-SLAM. يحقق DROID-SLAM أقل APE في جميع حالات الـ 33 المدركة للهندسة وفي 14 من أصل 15 حالة مركبة. يبدو أن التحسين العالمي الكثيف لـ DROID-SLAM أكثر قوة تجاه التدهورات الهيكلية مثل المطر والضباب مقارنة بالتحسين المحلي للنافذة في DPVO.
3. انتقال النتائج من الاصطناعي إلى الواقعي
تجد الدراسة أن الاستنتاجات الاصطناعية لا تنتقل بشكل موحد إلى الظروف الواقعية:
المطر والشتاء (الضباب): الترتيب الملاحظ في الوسائط الاصطناعية المركبة (DROID-SLAM > DPVO) يتم الحفاظ عليه في تسلسلات المطر والشتاء الواقعية.
الخلاصة: تفشل الوسائط البسيطة لفضاء الصورة (مثل السطوع العالمي) في التقاط العوامل الواقعية المعقدة مثل التعرض التلقائي، والإضاءة المتغيرة مكانيًا، وضوضاء الكاميرا الخاصة، مما يؤدي إلى توصيات معمارية خاطئة.
الأهمية والادعاءات
يجادل البحث بأن تقييم المتانة يجب أن يتجاوز مقاييس الخطأ للمسار الواحد في البيانات النظيفة. تكمن الأهمية الأساسية في كشف الثنائية بين التوفر والموثوقية: قد يظل النظام نشطًا (متوفرًا) بينما يصبح مساره غير صحيح عالميًا (غير موثوق).
يدعي المؤلفون ما يلي:
التشويهات الاصطناعية هي أدوات تشخيصية قيمة ولكنها ليست توقعات معايرة لخطأ التشغيل.
اختيار نموذج التشويه يحدد النتيجة: اختبارات فضاء الصورة تفضل الطرق المحلية القائمة على الرقع، بينما الاختبارات المدركة للهندسة تفضل الطرق الكثيفة ذات التحسين العالمي.
هناك حاجة إلى "سلم وسيط" للتقييم: البدء بفضاء الصورة من أجل الشمولية، ثم الانتقال إلى المدرك للهندسة/المركب من أجل دقة الآلية، والتحقق باستخدام الظروف القاسية الطبيعية.
يجب أن تميز مقاييس المتانة المستقبلية بين صلاحية المسار، وصلاحية الخريطة، وصلاحية النظام، خاصة مع بدء أنظمة إعادة البناء الكثيفة (مثل Gaussian Splatting SLAM) في ربط جودة التتبع مباشرة بحالة الخريطة.
يخلص العمل إلى أنه بينما يمكن لاختبارات الإجهاد الاصطناعية أن تكشف عن نقاط الضعف المعمارية التي تستمر في البيانات الطبيعية (كما هو ملاحظ في المطر والضباب)، إلا أنها يمكن أيضًا أن تكون مضللة (كما هو الحال مع الإضاءة)، مما يستلزم إطار تقييم أكثر دقة يأخذ في الاعتبار آليات الفشل المحددة لمختلف نماذج SLAM.