VLEM: Real-Time 3D Vision-Language Embedding Mapping
يُعد VLEM إطار عمل في الوقت الفعلي يدمج تمثيلات لغوية-بصرية ثنائية الأبعاد محاذية للبكسلات من تدفقات RGB-D الخام في تمثيل ثلاثي الأبعاد متسق عالمياً ودقيق مترياً، مما يتيح تجزئة فائقة مفتوحة المجموعة ومعالجة روبوتية تفاعلية دون الحاجة إلى أوضاع حقيقية.
المؤلفون الأصليون:Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert
لطالما عانت الروبوتات من أجل فهم العالم كما يفعل البشر. يمكن برمجتها للتعرف على كرسي معين أو باب محدد إذا عُرضت عليها أمثلة كافية، لكنها لا تستطيع بسهولة استيعاب جسم جديد بمجرد سماع وصف مثل "الكوب الأزرق" أو "صندوق الأدوات الثقيل". ينبع هذا القصور من الطريقة التي ترسم بها الروبوتات خرائط محيطها تقليديًا: فهي تبني نماذج هندسية دقيقة للمساحة، لكن هذه النماذج تفتقر إلى المعنى الغني والمرن الذي توفره اللغة. ولكي يتفاعل الروبوت حقًا مع بيئة ديناميكية، فإنه يحتاج إلى خريطة ليست دقيقة في المسافة والشكل فحسب، بل قابلة أيضًا للبحث باستخدام الكلمات التي نستخدمها كل يوم. لقد كان التحدي يكمن في الجمع بين الدقة المترية الحادة لخريطة ثلاثية الأبعاد والفهم الواسع والمفتوح للنماذج اللغوية الحديثة، كل ذلك مع العمل بالسرعة الكافية لكي يتحرك الروبوت ويتفاعل في الوقت الفعلي دون الحاجة إلى حاسوب خارق.
قام فريق من الباحثين في جامعة ليبن التقنية بتطوير نظام جديد يسمى VLEM، وهو اختصار لـ "رسم خرائط التضمين البصري اللغوي" (Vision-Language Embedding Mapping)، لحل هذه المشكلة. يعمل عملهم على سد الفجوة بين الرؤية والفهم من خلال إنشاء خريطة ثلاثية الأبعاد لا تخزن شكل الأشياء فحسب، بل تخزن أيضًا "بصمة رقمية" لما تبدو عليه تلك الأشياء وكيفية ارتباطها باللغة. وعلى عكس المحاولات السابقة التي كانت تتطلب بيانات كاميرا مثالية أو كميات هائلة من الذاكرة، يعمل هذا النظام مع تدفق بسيط من الصور الملونة وصور العمق من كاميرا قياسية. فهو يبني خريطة حية للعالم أثناء تحرك الروبوت، مما يسمح للمستخدم بأن يسأل: "أين آلة صنع القهوة؟" ويجعل الروبوت يشير فورًا إلى الجسم الصحيح، حتى لو لم يسبق له رؤية تلك الآلة المحددة من قبل.
يكمن جوهر النظام في كيفية معالجته للمعلومات المرئية. يمكن لنماذج الذكاء الاصطناعي الحديثة بالفعل فهم العلاقة بين الصور والنصوص عن طريق تحويلها إلى ناقلات رياضية، وهي في الأساس قوائم من الأرقام التي تمثل المعنى. ومع ذلك، تعمل هذه النماذج عادةً على صور مسطحة ثنائية الأبعاد. واجه الباحثون المهمة الصعبة المتمثلة في أخذ هذه المفاهيم ثنائية الأبعاد وإسقاطها في مساحة ثلاثية الأبعاد يمكن للروبوت التنقل فيها. وقد حققوا ذلك من خلال تقسيم رؤية الكاميرا إلى مناطق صغيرة، واستخراج بصمة معنى لكل منطقة، ثم دمج هذه البصمات معًا في سحابة نقاط ثلاثية الأبعاد متسقة. تعمل هذه السحابة كنظير رقمي للغرفة، حيث تحتوي كل نقطة فيها على موقع في الفضاء ومعنى دلالي مستمد من البيانات المرئية.
ما يجعل هذا النهج متميزًا هو كفاءته وقدرته على التعامل مع عدم اليقين. تحاول العديد من الأنظمة الموجودة بناء هذه الخرائط عن طريق تدريب شبكات عصبية معقدة على مجموعات بيانات كاملة، وهي عملية بطيئة وتتطلب معرفة الموقع الدقيق للكاميرا مسبقًا. في المقابل، يعمل VLEM في الوقت الفعلي، حيث يعالج الصور فور وصولها ويقدر موقع الكاميرا أثناء الحركة. وهو يستخدم طريقة ذكية لتنقية البيانات المرئية، عبر حجب الضوضاء الخلفية غير ذات الصلة لضمان أن يكون المعنى المرتبط بجسم ما نقيًا ودقيقًا. فعلى سبيل المثال، عندما ينظر النظام إلى آلة صنع القهوة، فإنه يعزل ذلك الجسم عن الجدار الموجود خلفه، مما يضمن عدم تخفيف "البصمة الرقمية" لآلة صنع القهوة بألوان الجدار. وهذا يسمح للروبوت بالتمييز بين الأشياء المتشابهة بدقة عالية، مثل التفريق بين مثقاب عام ومثقاب "بوش" (Bosch) محدد، وذلك ببساطة من خلال دقة الاستعلام النصي.
اختبر الباحثون نظامهم في بيئات متنوعة، من المطابخ والورش إلى طوابق المكاتب الكبيرة، باستخدام مجموعات بيانات ثابتة وتجارب روبوتية حية. ووجدوا أن طريقتهم أنتجت نتائج أفضل بكثير من الأنظمة الرائدة السابقة في تحديد الأشياء بناءً على الأوصاف النصية. وبينما عانت الأنظمة الأخرى غالبًا من حدود ضبابية أو تطلبت كميات هائلة من ذاكرة الكمبيوتر، تمكن VLEM من إنشاء خريطة مدمجة وعالية الجودة باستخدام أقل من 12 جيجابايت من ذاكرة الفيديو، وهو حجم يناسب بطاقات الرسوميات القياسية الموجودة في العديد من الحواسيب الحديثة. وتعد هذه الكفاءة أمرًا بالغ الأهمية لأنها تسمح للروبوت بتشغيل برنامج رسم الخرائط والتحكم في حركته في آن واحد دون تباطؤ. وفي العروض العملية، نجح النظام في توجيه ذراع روبوتية لالتقاط عناصر محددة ووضعها في أماكن مخصصة، بناءً على تعليمات منطوقة أو مكتوبة بسيطة.
يوحي نجاح VLEM بأن مستقبل التفاعل الروبوتي قد لا يعتمد على تعليم الروبوتات قائمة ثابتة من كل جسم في العالم، بل على منحها طريقة مرنة لفهم العالم من خلال اللغة. لقد أثبت النظام أنه من الممكن الحفاظ على تمثيل متري دقيق ثلاثي الأبعاد يكون أيضًا قابلًا للاستعلام باللغة الطبيعية، دون الحاجة إلى التدريب المسبق على البيئة المحددة أو بيانات كاميرا حقيقية. وأشار الباحثون إلى أنه بينما تعمل طريقتهم الحالية بشكل جيد لتحديد الأجسام الفردية، إلا أنها لا تستوعب بعد العلاقات المعقدة بين العناصر المختلفة، مثل معرفة أن الكوب موضوع على الطاولة. ومع ذلك، من خلال إثبات أن رسم الخرائط الدلالي عالي الجودة في الوقت الفعلي أمر ممكن باستخدام الأجهزة الحالية، فإن هذا العمل يوفر أساسًا متينًا للجيل القادم من الروبوتات التي يمكنها حقًا فهم العالم البشوي والتفاعل معه.
ملخص تقني: VLEM - رسم خرائط تضمين الرؤية واللغة ثلاثية الأبعاد في الوقت الفعلي
بيان المشكلة
تتطلب المهام الروبوتية اللاحقة، مثل المعالجة والملاحة، فهمًا دقيقًا من الناحية المترية للبيئة ثلاثية الأبعاد مقترنًا بمعلومات دلالية تسمح باستعلامات مفتوحة المجموعة (على سبيل المثال، "ابحث عن آلة صنع القهوة" دون فئات محددة مسبقًا). وبينما مكنت نماذج الرؤية واللغة (VLMs) من تحقيق محاذاة قوية بين الصور والنصوص ثنائية الأبعاد، فإن دمجها في أنظمة رسم الخرائط ثلاثية الأبعاد في الوقت الفعلي لا يزال يمثل تحديًا. تواجه النهج الحالية عقبات كبيرة:
قيود المجموعة المغلقة: تعتمد رسم الخرائط الدلالية التقليدية على مجموعات فئات ثابتة، مما يحد من قابليتها للتطبيق في مجالات محددة.
القيود ثنائية الأبعاد: تم تدريب معظم نماذج الرؤية واللغة على بيانات إنترنت ثنائية الأبعاد، مما يجعلها غير مناسبة للبيئات ثلاثية الأبعاد حيث قد تكون الأشياء خارج مجال الرؤية الحالي.
المتطلبات الحسابية ووضعية الكاميرا: تعتمد طرق التكامل ثلاثي الأبعاد الحديثة غالبًا على تمثيلات عصبية ضمنية أو معالجة غير فورية (offline)، مما يتطلب أوضاع كاميرا حقيقية (ground truth)، أو موارد حوسبة باهظة التكلفة، أو مراحل تدريب متعددة معتمدة، مما يجعلها غير مناسبة للتطبيقات الروبوتية في الوقت الفعلي.
المنهجية
يقترح المؤلفون VLEM (رسم خرائط تضمين الرؤية واللغة)، وهو إطار عمل مصمم لدمج تضمينات الرؤية واللغة المحاذية للبكسل في تمثيل ثلاثي الأبعاد متسق عالميًا ودقيق متريًا باستخدام تدفق RGB-D خام فقط. يعمل النظام دون الحاجة إلى أوضاع كاميرا حقيقية أو تدريب مسبق على البيئة المستهدفة.
خط الإنتاج الأساسي (Core Pipeline)
تحديد موقع الكاميرا (Camera Localisation):
يقدر النظام أوضاع الكاميرا عبر الإنترنت باستخدام نهج تقدير الحركة البصرية (visual odometry) يعتمد على خريطة هاش متعددة القيم (مشابه لـ Open-Fusion).
يستخدم نهجًا متعدد المقاييس من الخشن إلى الناعم على هرم صور مع فقدان ضوئي وهندسي هجين.
على عكس الطرق التي تتطلب أوضاعًا حقيقية، يستخدم VLEM خريطة الهاش لتقليل الانحراف عن طريق توليد رسومات ملونة وعمق من الإطارات السابقة لتقدير الإطار إلى النموذج.
تضمينات الرؤية واللغة المحاذية للبكسل:
تضمينات القطع (Segment-Embeddings): يستخرج النظام التضمينات لمناطق الصور باستخدام Segment Anything (SAM) لتوليد أقنعة ذات معنى دلالي.
التحسين: بالنسبة للمناطق غير المجزأة، يقوم النظام بأخذ عينات من الإحداثيات بشكل موحد واستعلام SAM مرة أخرى لملء الفجوات.
استراتيجية القناع: لمنع التخفيف الدلالي من المناطق المتداخلة، يتم استبدال المناطق الخلفية غير المجزأة في القطع المقصوصة بلون ثابت (أو بيانات عشوائية) قبل الترميز. يضمن ذلك ارتباط التضمينات ارتباطًا وثيقًا بالشيء المجزأ.
تضمينات رقع الـ ViT (ViT-Patch-Embeddings): بدلاً من ذلك، يمكن للنظام استخدام تضمينات الرقع من نماذج مثل DINOv3 أو NACLIP+RADIO، والتي يتم رفع دقتها خطيًا وتطبيعها.
تكامل التضمين ثلاثي الأبعاد:
يتم إسقاط صور العمق إلى إحداثيات نقاط ثلاثية الأبعاد في إطار الكاميرا.
يتم ربط التضمينات بهذه النقاط ثلاثية الأبعاد.
يتم تحويل النقاط إلى إطار خريطة عالمي باستخدام وضع الكاميرا المقدر.
منطق التكامل: يتم دمج النقاط الجديدة في الخريطة الموجودة (Mi−1) عبر البحث عن أقرب جار. إذا تم العثور على تطابق، يتم تحديث التضمين عبر متوسط مرجح (w=0.5) وإعادة التطبيع. تُضاف النقاط غير المتطابقة مباشرة.
الضغط: يتم تقليل حجم الخريطة بشكل تكراري للحفاظ على كثافة نقاط موحدة (نقاط لكل متر مكعب) للحد من استهلاك الذاكرة (NM) مع الحفاظ على الكثافة في المناطق المرصودة.
تقسيم الاستعلام ثلاثي الأبعاد:
يتم ترميز استعلامات النص إلى متجه تضمين نصي.
يتم حساب تشابه جيب التمام (Cosine similarity) بين التضمين النصي وجميع التضمينات المرئية في الخريطة ثلاثية الأبعاد، مما يولد خريطة حرارية ثلاثية الأبعاد.
التجميع (Clustering): للتعامل مع الإمساك الروبوتي، يقوم النظام بتجميع النقاط بناءً على التشابه. يستعلم النظام عن كل من كائن المهمة المحدد وخط أساس "كائن" عام لضمان أن الهدف أكثر صلة من الفوضى العامة. يتم إزالة القيم المتطرفة عبر DBSCAN ونماذج الخليط الغاوسي (Gaussian Mixture Models).
المساهمات الرئيسية
إطار عمل في الوقت الفعلي: نظام للتكامل والاستعلام في الوقت الفعلي لمختلف تضمينات الرؤية واللغة المحاذية للصور والرقع في ثلاثية الأبعاد، ويتطلب فقط تدفقات RGB-D خام.
تحسين القناع المبتكر: نهج محدد لدمج التضمينات المحاذية للصورة في سحابة نقاط ثلاثية الأبعاد يتضمن تحسين القناع التكراري وقناع الخلفية لتحسين الخصوصية الدلالية.
تمثيل مضغوط: تمثيل مشهد دلالي يحقق أداء تقسيم فائق في الإعدادات محدودة الموارد (على سبيل المثال، أقل من 12 جيجابايت من ذاكرة VRAM) مقارنة بالنماذج المرجعية الحالية.
النتائج والتقييم
قيم المؤلفون VLEM على مجموعة بيانات ScanNet وتسلسلات RGB-D مخصصة باستخدام NVIDIA GeForce RTX 4090 (24 جيجابايت) و RTX 4070 (12 جيجابايت).
أداء التقسيم: حقق VLEM مع خلفيات CLIP وتحسين القناع متوسط تقاطع فوق الاتحاد (mIoU) بنسبة 26.1% على ScanNet، متفوقًا على ConceptFusion (25.3%) و Open-Fusion (19.2%).
خلفيات VLM: باستخدام NARADIO (NACLIP + RADIO) كخلفية، حقق VLEM أعلى mIoU بنسبة (30.7%)، متفوقًا على RayFronts (29.2%)، رغم أن RayFronts استخدم نفس خلفية VLM.
كفاءة الذاكرة: أظهر VLEM مقايضة متفوقة بين الأداء والذاكرة.
استخدم VLEM (NARADIO) ذروة ذاكرة VRAM تبلغ 7.1 جيجابايت، بينما تطلب RayFronts (NARADIO) مقدار 23.4 جيجابايت.
استخدم VVLEM (CLIP) مقدار 4.0 جيجابايت، وهو أقل بكثير من ConceptFusion (8.8 جيجابايت) مع تحقيق تقسيم أفضل.
التحليل النوعي: أنتج VLEM استجابات استعلام أكثر حدة مع عدد أقل من القيم المتطرفة مقارنة بـ ConceptFusion، وأقل آثار بكسلة مقارنة بـ RayFronts. وقد تعامل بنجاح مع استعلامات محددة (مثل "مثقاب Bosch") بدقة أعلى من الاستعلامات العامة.
التطبيقات الروبوتية: تم عرض نظام VLEM بنجاح في الوقت الفعلي لـ:
المعالجة التفاعلية: التقاط ووضع الأشياء بناءً على استعلامات اللغة الطبيعية باستخدام ذراع روبوت Franka Emika.
رسم الخرائط المتنقل: تحديد المناطق والأشياء عبر غرف متعددة باستخدام قاعدة متنقلة (Segway RMP Lite 220).
الأهمية والادعاءات
يزعم البحث أن VLEM يعمل كحجر بناء متعدد الاستخدامات للتطبيقات الروبوتية التي تتطلب واجهة لغوية. تكمن أهميته الأساسية في تمكين المهام الروبوتية اللاحقة مفتوحة المجموعة (المعالجة والملاحة) في الوقت الفعلي دون الحاجة إلى أوضاع حقيقية أو موارد حوسبة ضخمة.
يؤكد المؤلفون أن VLEM يوفر تمثيلًا أكثر ضغطًا وأداء تقسيم أفضل لمجموعات مفتوحة من ConceptFusion و Open-Fusion و RayFronts. من خلال دمج التضمينات لكل نقطة ثلاثية الأبعاد في سحابة نقاط يتم إعادة أخذ عينات منها بشكل تكيفي، يوازن VLEM بفعالية بين الحجم، والتدريج الدلالي، والدقة المكانية لتسهيل المعالجة الروبوتية في الوقت الفعلي.
يشير المؤلفون بتواضع إلى القيود الحالية: أخذ العينات الموحد يمنع تمثيل المناطق المختلفة بمستويات مختلفة من التفاصيل، ولا يمثل النظام بعد العلاقات الهرمية أو المكانية بين الأشياء. ويُقترح عمل مستقبلي لمعالجة التدرج الديناميكي للتضمين وعلاقات الأشياء.