Markerless Robot Detection and 6D Pose Estimation for Multi-Agent SLAM
تقترح هذه الورقة نظاماً جديداً لتقدير الموقع ورسم الخرائط المتزامن (SLAM) متعدد الوكلاء وبدون علامات، يستفيد من تقدير الوضعية سداسية الأبعاد القائم على التعلم العميق للتغلب على تحديات ربط البيانات وتحسين دقة التحديد النسبي للمواقع، وقد تم التحقق من ذلك من خلال تجارب في بيئة مماثلة لبيئة كوكبية.
المؤلفون الأصليون:Markus Rueggeberg, Maximilian Ulmer, Maximilian Durner, Wout Boerdijk, Marcus Gerhard Mueller, Rudolph Triebel, Riccardo Giubilato
تخيل فريقاً من المستكشفين أُرسلوا إلى كوكب صخري غريب (مثل المريخ أو بركان على الأرض) لرسم خرائط تضاريسه. جميعهم يتجولون في مركبات استكشافية (rovers)، محاولين بناء خريطة مشتركة لمواقعهم.
المشكلة الأكبر التي يواجهونها هي الضياع عن بعضهم البعض رغم وجودهم في نفس المكان.
الطريقة القديمة: مشكلة "التصفيق باليد" (High-Five)
في الماضي، لكي تعرف هذه الروبوتات مكان أصدقائها، كان عليها ارتداء ملصقات ضخمة وساطعة وعالية التباين (تسمى العلامات المرجعية - fiducial markers، مثل AprilTags) على ظهورها.
التشبيه: تخيل أنك تحاول العثور على صديقك في حفلة موسيقية مزدحمة وضبابية. إذا كان يرتدي لوحة نيون ضخمة ومتوهجة، ستتمكن من رؤيته بسهولة. ولكن إذا كانت اللوحة صغيرة جداً، أو كان الضباب كثيفاً، أو كانت أضواء المسرح مبهرة، فلن تتمكن من رؤيته.
القصور: إذا ابتعدت الروبوتات عن بعضها كثيراً، ستبدو الملصقات صغيرة جداً. إذا انعكست أشعة الشمس على صخرة أو كان الإضاءة غريبة، ستصبح الملções غير مرئية. وإذا أدار الروبوت ظهره، سيختفي الملصق. هذا يعني أن الروبوتات كانت تفقد تتبع بعضها البعض، مما يؤدي إلى وضع "ملاحة عمياء" حيث تبتعد عن بعضها وتصبح خرائطها غير دقيقة.
الطريقة الجديدة: عقل "المتعرف الخارق"
يقدم هذا البحث نظاماً جديداً حيث لا تحتاج الروبوتات إلى ملصقات على الإطلاق. بدلاً من ذلك، تستخدم الذكاء الاصطناعي (التعلم العميق) للتعرف على بعضها البعض بمجرد النظر إلى شكلها وتصميمها.
التشبيه: تخيل أنك في نفس تلك الحفلة الموسيقية، لكن صديقك لا يرتدي لوحة نيون. بدلاً من ذلك، لديك عقل خارق القوة يعرف وجه صديقك، وسترة ملابسه، وطريقة مشيته. حتى لو كان بعيداً، أو مختبئاً جزئياً، أو كانت الإضاءة سيئة للغاية، فإن عقلك يقول: "هذا هو صديقي! أنا أعرف تماماً أين يقف".
كيف يعمل: تمتلك الروبوتات "نموذجاً ذهنياً" (مخطط ثلاثي الأبعاد) لما تبدو عليه زميلاتها. عندما ترى كاميرا الروبوت شكلاً يطابق ذلك المخطط، يقوم الذكاء الاصطناعي بحساب المسافة الدقيقة التي يبعدها الصديق والزاوية التي يواجهها. وهذا ما يسمى تقدير الوضعية سداسي الأبعاد (6D Pose Estimation) (أي تحديد الموقع والدوران في 6 أبعاد).
التدريب: التعلم في لعبة فيديو
قد تتساءل: "كيف تعلم روبوتاً التعرف على صديقه بدون ملصق؟" لم يكتفِ المؤلفون بالتقاط صور لروبوتات حقيقية؛ بل بنوا محاكاة للعبة فيديو.
أنشأوا عالماً رقمياً يشبه تماماً المناظر الطبيعية البركانية (جبل إيتنا في صقلية).
برمجوا الروبوتات للتحرك داخل هذه اللعبة، والتقاط آلاف الصور تحت ظروف إضاءة مختلفة (شمس مبهرة، ظلال، غبار).
علموا الذكاء الاصطناعي باستخدام هذه الصور الوهمية أولاً، بحيث عندما تخرج الروبوتات الحقيقية إلى الخارج، يكون الذكاء الاصطناعي قد أصبح خبيراً بالفعل في رصدهم.
النتائج: فريق لا يفقد الاتصال أبداً
عندما اختبروا هذا النظام على روبوتات حقيقية في جبل إيتنا، كانت النتائج مذهلة:
رؤية خارقة: استطاعت الروبوتات رصد بعضها البعض من مسافة أبعد بـ 4 مرات مما سبق. فبدلاً من الحاجة لأن تكون على بُعد 5 أمتار لرؤية الملصق، استطاعت رؤية بعضها من مسافة 20 متراً بمجرد التعرف على شكل الروبوت.
خرائط أفضل: نظرًا لأن قدرتها على رؤية بعضها كانت أكبر، استطاعت باستمرار تصحيح خرائطها. الأمر يشبه مجموعة من المتنزهين الذين يتحققون باستمرار من بعضهم البعض للتأكد من أنهم جميعاً على نفس المسار، بدلاً من التيه في اتجاهات مختلفة.
لا مزيد من الأضواء المبهرة: عمل النظام بفعالية حتى عندما انعكست أشعة الشمس على الصخور أو عندما كانت الروبوتات في ظلال عميقة—وهي ظروف كانت ستؤدي لفشل نظام "الملصقات" القديم تماماً.
الخلاية
يتعلق هذا البحث بمنح الروبوتات رؤية خارقة. فبدلاً من الاعتماد على أدوات اصطناعية هشة مثل الملصقات التي قد تتعطل بسبب الطقس السيئ أو المسافات، منحوا الروبوتات القدرة على التعرف على بعضها البعض بشكل طبيعي، تماماً كما يفعل البشر. وهذا يجعل فرق الروبوتات أكثر أماناً، وأكثر دقة، وقادرة على العمل معاً في أكثر البيئات قسوة على الأرض (وفي المستقبل، على كواكب أخرى).
إليك ملخص تقني مفصل للورقة البحثية بعنوان: "الكشف عن الروبوتات بدون علامات وتقدير الوضعية سداسية الأبعاد (6D Pose) لعمليات التموضع ورسم الخرائط المتزامن (SLAM) متعددة الوكلاء."
1. بيان المشكلة
تعتمد عمليات التموضع ورسم الخرائط المتزامن (SLAM) متعددة الروبوتات على ربط البيانات (Data Association) لدمج سجلات التموضع والخرائط من وكلاء مختلفين. تواجه النهج الحالية تحديات كبيرة:
الالتباس الإدراكي (Perceptual Aliasing): غالبًا ما يفشل اكتشاف إغلاق الحلقة (Loop closure) بين الروبوتات المختلفة بسبب الاختلافات الجذرية في زاوية الرؤية، والإضاءة، والغموض البيئي (خاصة في التضاريس الطبيعية غير المهيكلة مثل أسطح الكواكب).
محدودية العلامات المرجعية (Fiducial Markers): تعتمد الحلول الحالية غالبًا على مصفوفات معايرة من العلامات المرئية (مثل AprilTags أو ArUco). وهذه لها عيوب شديدة:
محدودية المدى: يتحدد مسافة الكشف بصرامة بناءً على حجم العلامة.
قيود التوجه: يجب أن تواجه العلامات المراقب ضمن زاوية محددة.
الحساسية البيئية: تفشل بشكل متكرر في ظروف الإضاءة الخارجية القاسية (الانعكاسات، فرط التعرض للضوء) أو عند الحجب.
الاعتماد على الأجهزة: تتطلب بعض الطرق البديلة أجهزة محددة (مثل مصابيح LED فوق البنفسجية، أو تقنية UWB) أو سمات يدوية لا تعمم بشكل جيد على الأشكال الهندسية العشوائية للروبوتات.
تعالج الورقة البحثية الحاجة إلى منهجية قوية وخالية من العلامات (Markerless) للكشف عن الروبوتات الأخرى وتقدير وضعيتها سداسية الأبعاد (6D pose) (الموقع والتوجه) لتسهيل المراقبة المتبادلة المباشرة في عمليات SLAM التعاونية.
2. المنهجية
يقترح المؤلفون نظام SLAM متعدد الروبوتات لامركزي مدمج مع خط معالجة للكشف عن الروبوتات بدون علامات وتقدير الوضعية سداسية الأبعاد يعتمد على التعلم العميق.
أ. بنية النظام
SLAM لامركزي: يستخدم النظام نهجًا موزعًا حيث تقوم الروبوتات بحساب تقدير الحالة المحلية (دمج التقدير البصري، وحدة قياس القصور الذاتي IMU، وتقدير المسافات/Odometry) وتقسيم البيئة إلى خرائط فرعية (Submaps).
تحسين الرسم البياني (Graph Optimization): يتم ربط حالات الروبوت عبر رسم بياني للوضعية باستخدام قيود من إغلاق الحلقات البصرية، ومطابقة الخرائط الفرعية، والملاحظات المباشرة بين الروبوتات.
التكامل: تعمل وحدة الكشف المقترحة كمكون في نظام ROS2، حيث تغذي قيود الوضعية سداسية الأبعاد مباشرة في رسم الـ SLAM البياني (الذي يتم حله عبر iSAM2).
ب. خط معالجة الكشف بدون علامات
الابتكار الأساسي هو خط معالجة يعتمد على التعلم العميق يفترض أن الروبوتات لها أشكال ثلاثية الأبعاد معروفة (نماذج CAD) ولكن بدون علامات مرئية.
كشف النسخ (Instance Detection): يستخدم YOLO v7 للكشف عن نسخ الروبوت في الصور الكاميرا.
التصفية: يتم تصفية النتائج بناءً على درجات الثقة ونسب العرض إلى الارتفاع لاستبعاد عمليات الكشف الجزئية أو المحجوبة.
تقدير الوضعية سداسية الأبعاد (6D Pose Estimation): يبني على نهج موسع من قبل Ulmer وآخرون [20]، تم تكييفه لهذا التطبيق المحدد:
البنية: يستخدم نموذج مطابقة كثيف من 2D إلى 3D (مشفر-مفكك - encoder-decoder) لتقدير إحداثيات النموذج ثلاثي الأبعاد لكل بكسل.
تكامل المحولات (Transformer Integration): يستبدل المفكك القياسي ببنية قائمة على المحولات (Transformer-based) تتضمن آليات الانتباه للتعامل مع المشاهد المعقدة.
تقدير الوضعية: يستبدل حل PnP التقليدي بشبكة عصبية تقوم بتقدير الوضعية سداسية الأبعاد مباشرة.
القناع غير النمطي (Amodal Masking): يقدم رأس تنبؤ لتقدير الأقنعة غير النمطية (التنبؤ بالشكل الكامل للجسم حتى عند حجبه)، مما يحسن المتانة.
ج. استراتيجية التدريب
البيانات الاصطناعية: يتم تدريب النماذج بالكامل على بيانات اصطناعية ناتجة عن نماذج CAD مبسطة لروبوتات (وحدة الروفر خفيفة الوزن - LRU).
أدوات المحاكاة:
BlenderProc: تولد صورًا واقعية مع خلفيات وعناصر مشتتة عشوائية.
OAISYS: محاكي مصمم خصيصًا للبيئات الخارجية غير المهيكلة وتضاريس الكواكب.
تعزيز البيانات (Data Augmentation): يتم تطبيق تعزيزات واسعة النطاق (تغيرات الإضاءة، الحجب، الضجيج) لضمان تعميم النموذج على الظروف الميدانية الواقعية.
مجموعات التدريب: تم تدريب النماذج على بيانات BlenderProc، وبيانات OAISYS، ومجموعة بيانات مشتركة لتعظيم المتانة.
3. المساهمات الرئيسية
أول نهج بدون علامات: حسب علم المؤلفين، هذا هو العمل الأول الذي يقدم نهجًا للكشف وتقدير الوضعية بدون علامات للاكتشاف المتبادل للروبوتات يعتمد فقط على معرفة الشكل المسبقة (نماذج CAD) دون سمات يدوية أو علامات مرئية.
تكامل النظام: التكامل الناجح لمخطط الكشف هذا في نظام SLAM متعدد الروبوتات عبر الإنترنت (online) ولا مركزي لفريق من روفرات الكواكب.
التحقق الواقعي: التحقق التجريبي المكثف باستخدام بيانات من حملة ميدانية على جبل إتنا (Mount Etna) (بيئة مشابهة للكواكب)، مما أظهر الأداء مقابل الطرق التقليدية القائمة على العلامات.
4. النتائج والتقييم
أ. أداء البيانات الاصطناعية
فعالية التدريب: حققت النماذج المدربة على بيانات مشتركة (BlenderProc + OAISYS) أفضل أداء، متفوقة على النماذج المدربة على بيانات من مصدر واحد.
المقاييس:
معدل الكشف (ρ): وصل إلى 0.792 (79.2%) في مجموعات اختبار OAISYS مع التدريب المشترك.
الدقة: انخفض خطأ الترجمة (t) إلى 0.040 متر وخطأ الدوران (θ) إلى 0.048 راديان في الظروف المثلى.
وقت التشغيل: يعمل خط المعالجة بسرعة 14 هرتز لكامل عملية الكشف والوضعية و20 هرتز للكشف وحده.
ب. الحملة الميدانية الواقعية (جبل إتنا)
تم اختبار النظام خلال حملة ARCHES لعام 2022 باستخدام اثنين من روفرات LRU ووحدة هبوط (Lander).
مدى الكشف:
AprilTag (الأساس): أقصى مسافة كشف ≈ 4.9م – 7.6م.
بدون علامات (المقترح): زادت أقصى مسافة كشف إلى 16.15 مترًا (المهمة 1) و17.14 مترًا (المهمة 2).
التحسن: زاد مدى الكشف بنسبة تصل إلى 402%.
تكرار الكشف:
المهمة 1 (LRU): زادت عمليات الكشف من 49 إلى 87 (+87%).
المهمة 2 (LRU): زادت عمليات الكشف من 14 إلى 20 (+43%).
دقة التموضع:
مدة الحلقة المفتوحة (Open-Loop): انخفض الوقت الذي تنقلت فيه الروبوتات بدون تصحيح خارجي بشكل كبير (على سبيل المثال، -55% في المهمة 1)، مما يشير إلى تصحيحات أكثر تكرارًا في الرسم البياني.
خطأ المسار (RMSE):
المهمة 1 (LRU): انخفض من 1.57 متر إلى 1.13 متر (-28%).
المهمة 2 (LRU): انخفض من 0.76 متر إلى 0.52 متر (-32%).
ملاحظة: بينما كان أداء AprilTags أفضل قليلاً في المسافات القريبة جدًا، فإن النهج الخالي من العلامات تفوق بشكل كبير في المسافات المتوسطة إلى الطويلة، وفي ظروف الإضاءة الصعبة (الوهج/الانعكاسات) حيث فشلت العلامات.
5. الأهمية والخاتمة
يثبت هذا العمل أن تقدير الوضعية سداسية الأبعاد بدون علامات يعد بديلاً ناجحًا ومتفوقًا للعلامات المرجعية للتعاون بين الروبوتات في البيئات غير المهيكلة.
المتانة: يتغلب على قيود ظروف الإضاءة وقيود التوجه التي تعاني منها أنظمة AprilTag.
القابلية للتوسع: يسمح للروبوتات باكتشاف بعضها البعض على مسافات أكبر بكثير (زيادة بنسبة 400%)، وهو أمر بالغ الأهمية لمهام الاستكشاف واسعة النطاق حيث قد تكون الروبوتات متباعدة.
الأثر التشغيلي: من خلال توفير قيود تموضع نسبي أكثر تكرارًا وموثوقية، يحسن النظام بشكل كبير من الدقة اللحظية لمسارات الروبوتات، مما يقلل من الانحراف أثناء الملاحة في الحلقة المفتوحة.
يخلص المؤلفون إلى أن هذا النهج ذو قيمة خاصة لاستكشاف الكواكب والفحص الصناعي، حيث يجب أن تعمل الروبوتات بشكل مستقل في بيئات يكون فيها وضع أو صيانة العلامات المرئية غير عملي أو مستحيل. سيركز العمل المستقبلي على التعامل مع الروبوتات المفصلية (articulated robots) ونشر النظام على وحدات معالجة رسومية مدمجة للتشغيل في الوقت الفعلي.