Extending Deep Event Visual Odometry with Sparse Point-Cloud Export
توسع هذه الورقة البحثية إطار عمل تقدير المسافة البصرية للأحداث العميقة (DEVO) عبر إضافة مسار تصدير سحابي نقطي متفرق يقوم بتحويل البنية ثلاثية الأبعاد الداخلية للنظام إلى تمثيل هندسي صريح لأغراض التصور والمعالجة اللاحقة، محققةً دقة محلية عالية على بيانات الاختبار المرجعية مع الحفاظ على أداء تقدير المسافة الأصلي.
تخيل أنك تقود سيارة ليلاً وسط عاصفة شديدة. الكاميرا العادية (مثل تلك الموجودة في هاتفك) ستكون عديمة الفائدة؛ فالأمطار ستجعل الصورة ضبابية، والظلام سيجعل الرؤية مستحيلة. لكن تخيل لو كانت سيارتك تمتلك "كاميرا أحداث" (Event Camera) خاصة. هذه الكاميرا لا تلتقط صوراً كاملة، بل تعمل مثل نظام إنذار فائق الحساسية: فهي لا "تصرخ" (ترسل إشارة) إلا عندما يتغير شيء ما — مثل حركة غصن شجرة أو وميض ضوء شارع. إنها تتجاهل الأجزاء الثابتة والمظلمة من المشهد وتركز تماماً على الحركة والتغييرات.
النظام الأصلي (DEVO) يبدأ البحث بنظام يسمى DEVO (التقدير العميق للمسافة البصرية للأحداث). فكر في DEVO كأنه سائق ذكي جداً ينظر فقط إلى الأجزاء "الصارخة" من كاميرا الأحداث.
كيف يعمل: يقوم باختيار بعض النقاط المثيرة للاهتمام (مثل حافة لافتة أو سيارة متحركة)، ويتتبع كيفية حركتها، ويحسب بدقة أين تذهب السيارة.
القصور: نظام DEVO ممتاز في إخبارك أين أنت وإلى أين تذهب (المسار). ومع ذلك، فهو يحتفظ بخريطة العالم داخل عقله الخاص. هو يعرف الشكل ثلاثي الأبعاد للأجسام التي تتبعها، لكنه لا "يظهر" لك الخريطة. إنه يشبه جهاز تحديد المواقع (GPS) الذي يعرف الطريق ولكنه يرفض طباعة خريطة لك.
الإضافة الجديدة (تصدير السحابة النقطية المتفرقة) هذا المشروع يشبه إضافة "طابعة خرائط" إلى ذلك السائق الذكي. لم يغير المؤلفون طريقة قيادة السائق أو كيفية حساب مساره، بل بنوا "باباً جانبياً" يسمح لك بالتلصص على عقل السائق وأخذ الخريطة ثلاثية الأبعاد التي يبنيها بالفعل.
مفهوم "التفرقة" (Sparse): نظرًا لأن كاميرا الأحداث لا ترى إلا التغييرات، فإن الخريطة التي تبنيها ليست جداراً صلباً من البكسلات مثل الصورة الفوتوغرافية. إنها أشبه بـ كوكبة من النجوم. لديك آلاف النقاط الفردية (النجوم) التي تمثل حواف وزوايا الأجسام، لكن المساحات بينها فارغة.
العملية: يأخذ النظام الجديد تلك "النجوم" الداخلية (الرقع المتتبعة وتقديرات العمق)، ويحولها إلى تنسيق ثلاثي الأبعاد قياسي (سحابة نقاط)، ويحفظها حتى تتمكن من النظر إليها، أو تنظيفها، أو استخدامها لمهام أخرى.
التجربة: اختبار "اللوحة" لاختبار ذلك، استخدم الباحثون تسلسلاً يسمى "BOARD SLOW". تخيل لوحة كبيرة مطبوع عليها أشكال هندسية (معينات، مربعات، دوائر).
لماذا هذه اللوحة؟ كاميرات الأحداث تعشق الحواف. عندما تتحرك الكاميرا، تخلق حواف الأشكال أكبر قدر من "الأحداث" (الإنذارات). أما المساحات المسطحة والفارغة داخل الأشكال فلا تنتج شيئاً.
النتيجة: نجح النظام في تصدير سحابة نقطية ثلاثية الأبعاد. وعندما نظروا إلى النتيجة، وجدت النقاط نفسها تماماً مع حواف الأشكال الموجودة على اللوحة. كان الأمر كما لو أن النظام قد رسم الخطوط العريضة للأشكال في الفضاء ثلاثي الأبعاد باستخدام حبر غير مرئي.
ما وجدوه (الجيد والسيء)
إنه يعمل محلياً: النقاط التي صدرها النظام كانت دقيقة للغاية. إذا نظرت إلى مكان محدد، ستجد النقاط في مكانها الصحيح (بدقة 98%).
ليس جداراً صلباً: نظرًا لأن النظام يتتبع فقط بعض النقاط "المثيرة للاهتمام"، فإن الخريطة النهائية تكون متفرقة. إنها ليست نموذجاً ثلاثي الأبعاد كاملاً وصلباً للغرفة، بل هي مجموعة من النقاط.
مشكلة "الكثافة": قارن الباحثون نظامهم بطريقة "المعيار الذهبي" (EMLS) التي تستخدم مساراً مثالياً ومعروفاً. وجدوا أن المعيار الذهبي يصنع خريطة أكثر اكتمالاً. لماذا؟ لأن المعيار الذهبي كان لديه 4 أضعاف عدد "اللقطات" (الوضعيات) للعمل بها.
تشبيه: تخيل أنك تحاول رسم صورة لمبنى. المعيار الذهبي التقط 4000 صورة من زوايا مختلفة. أما DEVO فقد التقط 1000 صورة فقط. كلاهما رسم نفس المبنى، لكن رسم المعيار الذهبي كان أكثر تفصيلاً لأنه امتلك نقاط بيانات أكثر. الفرق لم يكن لأن DEVO كان "مخطئاً" في الحجم؛ بل لمجرد أن DEVO لم ينظر إلى المبنى من زوايا كثيرة مثل المعيار الذهبي.
الخلاصة يخلص البحث إلى أنهم نجحوا في تحويل نظام "مخصص للـ GPS فقط" إلى نظام "GPS + طابعة خرائط".
ما هو: أداة تأخذ البيانات ثلاثية الأبعاد المخفية من كاميرا عالية السرعة تعتمد على الأحداث، وتحولها إلى قائمة قابلة للاستخدام من النقاط ثلاثية الأبعاد.
ما ليس عليه: ليس عصا سحرية تخلق نموذجاً ثلاثي الأبعاد كاملاً وصلباً للغرفة. إنه نموذج "متفرق"، مما يعني أنه مجموعة من النقاط التي تحدد الأجزاء المهمة من المشهد.
لماذا يهم: بالنسبة للروبوتات أو الطائرات بدون طيار التي تتحرك بسرعة في الظلام، فإن امتلاك رسم تخطيطي ثلاثي الأبعاد تقريبي للبيئة (مثل حواف الجدران، وزوايا العوائق) يعد أمراً مفيداً للغاية، حتى لو لم يكن صورة فوتوغرافية مثالية. هذا المشروع يمنح المهندسين طريقة للحصول على ذلك الرسم التخطيطي مباشرة من "عقل" كاميرا الأحداث.
ملخص تقني: توسيع نظام تقدير الموضع البصري للأحداث العميق (DEVO) عبر تصدير سحابة نقاط متفرقة
بيان المشكلة أثبت نظام تقدير الموضع البصري للأحداث العميق (DEVO) أن تقدير الموضع أحادي الكاميرا القائم على الأحداث فقط يمكن أن يحقق أداءً قويًا في حالات الحركة عالية السرعة والإضاءة الصعبة من خلال الجمع بين تتبع الرقع المتفرقة، واختيار الرقع المتعلم، وتحسين الارتباط المتكرر، وضبط الحزمة التفاضلي. ومع ذلك، صُمم DEVO أساسًا كنظام لتقدير المسار؛ فبينما يحتفظ داخليًا ببنية هندسية متفرقة (مواقع الرقع المتتبعة والعمق المقدر) لتحسين وضعيات الكاميرا، تظل هذه المعلومات ثلاثية الأبعاد كامنة داخل حلقة التحسين ولا يتم إظهارها كمخرج صريح. ولأغراض عديدة تتعلق بالروبوتات، وتصحيح الأخطاء، والتصور المرئي، لا يكفي مجرد تقدير المسار وحده؛ بل هناك حاجة إلى سحابة نقاط ثلاثية الأبعاد قابلة للتصدير لفحص المشهد والمعالجة اللاحقة. أما طرق إعادة البناء ثلاثية الأبعاد الحالية القائمة على الأحداث (مثل EMVS)، فهي تعامل إعادة البناء كمسألة منفصلة، وغالبًا ما تتطلب خطوط معالجة مخصصة أو مستشعرات إضافية.
المنهجية يعمل العمل المقترح على توسيع DEVO بإضافة خط معالجة لتصدير سحابة نقاط متفرقة دون تغيير الصيغة الجوهرية لتقدير الموضع البصري. يعتمد هذا النهج على ملاحظة أن DEVO يقدر بالفعل المكونات اللازمة لإعادة البناء ثلاثية الأبعاد: وضعيات الكاميرا ومتغيرات العمق المتفرقة المرتبطة بالرقع المتتبعة.
الكشف الداخلي: يتضمن التعديل الجوهري كشف الملاحظات الداخلية لخط استنتاج DEVO. تم توسيع النظام باستخدام علامة اختيار (flag) تتيح العودة (return_observables=True) في الدوال المساعدة (run_rgb و run_voxel_norm_seq و run_voxel). عند تفعيلها، لا تعيد هذه الدوال وضعيات الكاميرا والطوابع الزمنية فحسب، بل تعيد أيضًا سحابة النقاط المتفرقة الحالية وتقديرات العمق.
توليد الثلاثي الأبعاد: تستخدم عملية التصدير عملية الإسقاط الخلفي القياسية. لكل رقعة متتبعة صالحة ذات إحداثيات صورة (u,v) وعمق مقدر z، يتم حساب النقطة ثلاثية الأبعاد في إحداثيات الكاميرا باستخدام مصفوفة الخصائص الداخلية K (pc=zK−1[u,v,1]T). ثم تُحول هذه النقاط إلى إطار إحداثيات عالمي مشترك باستخدام وضعيات الكاميرا المحسنة.
خط المعالجة والمعالجة اللاحقة: تم تنفيذ سير عمل عملي للتعامل مع استخراج البيانات، وتحويل الصيغ (إلى .ply و .npy)، والتنظيف. يتضمن خط المعالجة خطوات معالجة لاحقة اختيارية مثل إزالة القيم المتطرفة إحصائيًا وبالنصف قطر لتحسين قابلية استخدام المخرجات المتفرقة والضوضائية دون تعديل تقديرات تقدير الموضع الأساسية.
التنفيذ: يحافظ التوسيع على بنية كود DEVO الأصلي، مع إضافة سكربت تصدير مخصص (scripts/export_pointcloud.py) وسكربت تنظيم (scripts/start_pipline.py). كما تم توفير حاوية Docker لضمان إمكانية إعادة الإنتاج عبر بيئات مختلفة.
المساهمات الرئيسية
كشف التمثيل المتفرق: يوسع المشروع DEVO ليكشف عن تمثيله الهندسي ثلاثي الأبعاد المتفرق كبيانات سحابة نقاط قابلة للتصدير، محولًا نظامًا مخصصًا للمسار فقط إلى نظام يوفر مخرجات هندسية للمشهد.
خط تصدير عملي: تنفيذ سير عمل كامل لتوليد سحابة النقاط، وتحويل الصيغ، والتنظيف، بما في ذلك دعم أنواع مختلفة من مجموعات البيانات (FPV، RPG، VECtor).
تحليل القيود: تحليل تجريبي لمدى فائدة وقيود استخراج سحب النقاط المتفرقة من إطار عمل تقدير الموضع البصري القائم على الأحداث، وتحديدًا فيما يتعلق بالكثافة، والاكتمال، والحساسية لضوضاء تقدير الموضع المتراكمة.
النتائج التجريبية تم تقييم النظام باستخدام تسلسل كاميرا الأحداث BOARD SLOW، والذي يتميز بلوحة معايرة مستوية ذات أنماط هندسية عالية التباين. تمت مقارنة سحابة نقاط DEVO SLAM المصدرة مع عمليات إعادة بناء EMVS التي تم إنشاؤها باستخدام كل من وضعيات DEVO والوضعيات الحقيقية (ground-truth).
عزل المقياس: أكدت التجارب أن الفرق في جودة إعادة البناء بين EMVS بوضعيات الحقيقة وبين EMVS بوضعيات DEVO ليس ناتجًا عن عدم تطابق المقياس العالمي (كان مسار DEVO أكبر بنحو 1.42 مرة). لم يؤدِ تغيير مقياس المسار ونطاق العمق باستمرار إلى تحسين جودة إعادة بناء DEVO.
كثافة الوضعيات: العامل الرئيسي المؤثر على جودة إعادة البناء كان كثافة الوضعيات. وفر المسار الحقيقي 4,171 وضعية مقارنة بـ 985 وضعية لـ DEVO (فرق بنحو 4.2 مرة). وفر هذا أخذ العينات الأكثر كثافة لـ EMV عددًا أكبر من وجهات النظر المستقلة، مما أدى إلى إعادة بناء أكثر حدة.
الاتساق الهندسي: أظهرت سحابة DEVO SLM المصدرة اتساقًا محليًا عاليًا مع إعادة بناء EMVS. عند عتبة 5 سم، كانت قيمة F-score هي 0.491 (بعد محاذاة ICP)، مع دقة بلغت 98.4%. يشير هذا إلى أن معظم نقاط EMVS تقع بالقرب من سحابة DEVO. ومع ذلك، كانت نسبة الاستدعاء (recall) أقل (31.7%) بسبب الاختلافات في خصائص التغطية؛ حيث يجمع DEVO نقاطًا متفرقة على طول المسار بالكامل، بينما يعيد EMVS بناء هياكل شبه كثيفة موضعية.
التسطح والضوضاء: بينما استعاد كلا الطريقتين الهندسة المستوية السائدة للوحة، أظهرت سحابة DEVO SLAM بقايا ملاءمة مستوية أعلى (93.2 ملم مقابل 13.5 ملم لـ EMVS) واحتوت على المزيد من القيم المتطرفة المعزولة. يُعزى ذلك إلى تراكم حالة تقدير الموضع المتفرقة والانحراف في الوضعية عبر التسلسل الكامل.
التحقق البصري: تماشى النقاط ثلاثية الأبعاد المسقطة مع الحدود المرئية للأشكال المطبوعة (المعينات، المربعات، الدوائر) على اللوحة، مما يؤكد أن النقاط المصدرة تتوافق مع هندسة المشهد الحقيقية الناتجة عن تغيرات السطوع.
الأهمية والادعاءات يدعي البحث أن التوسيع المقترح ينجح في سد الفجوة بين تقدير الموضع البصري الصرف وإعادة البناء ثلاثي الأبعاد الكامل عبر كشف المعلومات الهندسية الكامنة داخل إطار عمل تقدير موضع عالي الأداء. يحافظ النظام على نقاط القوة الأصلية لـ DEVO (القوة في ظروف الحركة عالية السرعة والإضاءة المنخفضة) مع إضافة فائدة لفحص المشهد والمعالجة اللاحقة.
يصف المؤلفون المخرج بتواضع، ليس كإعادة بناء سطح كثيف مقارنة بطرق الرؤية متعددة المناظر مثل EMVS، بل كـ تمثيل هيكلي متفرق. تكمن الأهمية في إثبات أن خطوط عمل تقدير الموضع البصري القائمة على الأحداث يمكن توسيعها لتوفير هندسة مشهد ثلاثية الأبعاد قابلة للاستخدام دون استبدال منطق التحسين الجوهري. يسلط العمل الضوء على أنه بينما تكون سحابة النقاط الناتلة متفرقة بطبيعتها وحساسة لضوضاء تقدير الموضع، إلا أنها صالحة هندسيًا محليًا وتعمل كخطوة وسيطة قيمة لتدفقات عمل الروبوتات التي تتطلب تمثيلات هندسية خفيفة الوزن. ويُقترح أن يركز العمل المستقبلي على الدمج الزمني الأكثر كثافة والتكامل الوثيق مع طرق إعادة البناء المخصصة لتحسين الاكتمال.