AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation
يُعد AdaGeoVLN إطار عمل للملاحة البصرية اللغوية التدفقية، يعزز الأداء من خلال الدمج الانتقائي لتمثيلات النماذج التأسيسية للهندسة الهرمية عبر أعماق مختلفة، والاحتفاظ بالأدلة الهندسية التاريخية المدركة للملاحة من خلال آلية ذاكرة محدودة.
المؤلفون الأصليون:Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen
المؤلفون الأصليون: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen
تخيل روبوتًا يحاول اتباع مجموعة من التعليمات المنطوقة عبر منزل لم يره من قبل. لكي ينجح، لا يمكن للروبوت ببساطة أن يدرك أن الكرسي هو كرسي أو أن الباب هو باب؛ بل يجب عليه فهم كيفية ارتباط تلك الأشياء ببعضها البعض في الفضاء، وكيف تتغير وجهة نظره أثناء حركته، وكيف يتصل المسار الذي يسلكه بالتعليمات التي يسمعها. هذا التحدي، المعروف باسم الملاحة البصرية اللغوية (vision-language navigation)، يتطلب من الوكيل بناء خريطة ذهنية للعالم في الوقت الفعلي، باستخدام كاميرا فقط وأمر صوتي. لسنوات، حاول الباحثون تعليم الآلات هذه المهارة عبر تغذيتها بكميات هائلة من البيانات المرئية، ولكن ظل هناك سؤال جوهي دون إجابة: كيف ينبغي للروبوت استخدام الفهم العميق والطبقي للهندسة الذي تمتلكه نماذج الذكاء الاصطناعي الحديثة، وكم من الماضي يجب أن يتذكره لاتخاذ قرارات جيدة في المستقبل؟
قدم فريق من الباحثين نظامًا جديدًا يسمى AdaGeoVLN يجيب على هذه الأسئلة من خلال تغيير الطريقة التي ينظر بها الروبوت إلى العالم وكيفية تخزين ذاكراته. فبدلاً من الاعتماد على لقطة واحدة نهائية لمحيطه، يتعلم النظام استخلاص المعلومات الهندسية المفيدة من مراحل متعددة لعملية تفكيره الخاصة. علاوة على ذلك، فهو لا يحاول تذكر كل إطار رآه على الإطلاق، لأن ذلك سيؤدي سريعًا إلى إغراق ذاكرته؛ بل يعمل مثل مؤرشف دقيق، يحتفظ فقط باللحظات التاريخية الأكثر أهمية التي تساعده على فهم مكان وجوده وإلى أين يحتاج الذهاب بعد ذلك. يتيح هذا النهج للروبوت التنقل في بيئات معقدة وغير مرئية مسبقًا باستخدام بث فيديو قياسي فقط، دون الحاجة إلى مستشعرات إضافية مثل كاميرات العمق أو خرائط معدة مسبقًا.
يكمن جوهر هذه الطريقة الجديدة في كيفية معالجة الروبوت للمعلومات المرئية. إن نماذج الذكاء الاصطناعي الحديثة التي تفهم الهندسة مبنية كأكوام عميقة من الطبقات، حيث تعالج كل طبقة الصورة بشكل مختلف قليلاً. قد تلتقط الطبقات الأولى الأشكال والحواف البسيطة، بينما تفهم الطبقات الأعمق الهياكل المعقدة والعلاقات المكانية. كانت الأنظمة السابقة تتجاهل عادةً هذه الطبقات المبكرة، وتنتظر حتى نهاية العملية تمامًا لاستخدام ملخص نهائي واحد للمشهد. وجد الباحثون أن هذا كان خطأً؛ فمن خلال ربط خطوات اتخاذ القرار لدى الروبوت بعدة طبقات من النموذج الهندسي في آن واحد — باستخدام المراحل المبكرة والمتوسطة والمتأخرة معًا — اكتسب الروبوت فهمًا أغنى لمحيطه. وقد أثبت هذا النهج متعدد الطبقات أنه أكثر فعالية بكثير من مجرد حقن الملخص النهائي بشكل متكرر، مما يشير إلى أن الروبوت يستفيد من رؤية العالم من خلال "عدسات" مختلفة في نفس الوقت.
يعالج الابتكار الرئيسي الثاني مشكلة الذاكرة. فبينما يسير الروبوت عبر منزل، فإنه يولد تدفقًا مستمرًا من البيانات المرئية. وتخزين كل قطعة من هذه البيانات سيتطلب قدرًا مستحيلاً من الذاكرة، خاصة في الرحلات الطويلة. كانت الأساليب القديمة تحتفظ غالبًا بالإطارات الأخيرة أو عدد ثابت من المشاهد الماضية، بافتراض أن ما حدث قبل لحظة واحدة هو الأكثر أهمية. ومع ذلك، أدرك الباحثون أن المشهد القديم قد يكون حيويًا إذا كان يحتوي على معلم محدد ذُكر في التعليمات، أو إذا أظهر منعطفًا فريدًا في المسار. يحل AdaGeoVLV هذه المشكلة عن طريق اختيار الذكريات التي يجب الاحتفاظ بها بناءً على ثلاثة معايير محددة: مدى صلة الذاكرة بالتعليمات الحالية، ومدى ثقة الروبوت في التفاصيل الهندسية لذلك المشهد، ومدى اختلاف ذلك المشهد عما رآه من قبل. وهذا يسمح للروبوت بالتخلص من المعلومات الزائدة مع التمسك باللحظات المحددة التي ستساعده في الملاحة لاحقًا.
ولاختبار هذه الأفكار، درب الباحثون نظامهم على آلاف مهام الملاحة المحاكية ثم قيموه باستخدام معيارين قياسيين يستخدمهما المجتمع العلمي. وأظهرت النتائج أن النظام الجديد تفوق بشكل كبير على الأساليب السابقة. وفي إحدى مجموعات الاختبار، نجح في الوصول إلى وجهته بنسبة 55.7 بالمائة، وهو تحسن ملحوظ مقارنة بأفضل الأنظمة الموجودة التي لا تستخدم بيانات خارجية إضافية. والأهم من ذلك، حقق النظام هذا المستوى العالي من الأداء مع استخدام ذاكرة حاسوبية أقل بكثير من النهج الأخرى التي حاولت تخزين كميات كبيرة من التاريخ. وقد أثبت الباحثون أنه من خلال كون الروبوت انتقائيًا فيما يتذكره، يمكنه الحفاظ على وعيه المكاني دون أن يثقله الكثير من البيانات غير الضرورية.
لم يتوقف الفريق عند المحاكاة الحاسوبية، بل قاموا بنشر السياسة المدربة على روبوت حقيقي بحجم الإنسان مجهز بكاميرا قياسية. وفي التجارب الواقعية، نجح الروبوت في اتباع تعليمات متعددة الخطوات، مثل الابتعء عن مدفأة، وصعود درج منحني، والتوقف عند باب محدد. لقد تمكن من تجاوز نبتة من الجانب الصحيح وتجنب الأبواب غير ذات الصلة، مما أثبت أن الذاكرة الانتقائية والاستدلال الهندسي متعدد الطبقات يعملان في العالم المادي، وليس في العالم الافتراضي فحسب. وأشار الباحثون إلى أنه بينما يعد النظام فعالًا للغاية، إلا أنه لا تزال هناك مساحة لتحسين كيفية موازنة إشارات الذاكرة المختلفة، لكن النهج الأساسي المتمثل في اختيار الهندسة عبر أعماق وأوقات مختلفة قد أثبت أنه وسيلة قوية لتعليم الآلات كيفية التحرك عبر العالم.
ملخص تقني: AdaGeoVLN
بيان المشكلة
تتطلب الملاحة البصرية-اللغوية (VLN) من الوكيل مواءمة التعليمات اللغوية الطبيعية مع الملاحظات البصرية المستمرة مع الحفاظ على الفهم المكاني بمرور الوقت. توفر نماذج التأسيس الهندسي (GFMs) مثل VGGT تمثيلات وسيطة غنية لبنية المشهد دون الحاجة إلى مدخلات العمق أو الوضعية، إلا أن دمجها في سياسات الملاحة لا يزال غير محسوم. هناك تحديان رئيسيان:
عمق التمثيل: ليس من الواضح ما إذا كان ينبغي لسياسات الملاحة الاعتماد فقط على التمثيل النهائي (الأخير) لنموذج GFM، أو ما إذا كانت الحالات الوسيطة من أعماق مختلفة تحتوي على معلومات تكميلية مفيدة للاستدلال المتسلسل.
الاحتفاظ الزمني: توفر الحالات الهندسية التاريخية سياقاً مكانياً ضرورياً، لكن الاحتفاظ بكامل التاريخ أمر مرهق للذاكرة. قد تتجاهل استراتيجيات الاحتفاظ القائمة على الحداثة (recency-based) الأدلة التاريخية المفيدة (مثل المعالم أو التحولات المميزة) التي تعد حاسمة لاتباع التعليمات، ومع ذلك فإن الاحتفاظ غير المقيد غير ممكن في ظل ميزانيات ذاكرة محدودة.
المنهجية: AdaGeoVLN
AdaGeoVLN هو إطار عمل للملاحة البصرية-اللغوية التدفقية (streaming VLN) مصمم لمعالجة هذه التحديات من خلال آليتين متكاملتين: دمج GFM–VLM الهرمي وذاكرة GFM الواعية بالملاحة.
1. دمج GFM–VLM الهرمي (اختيار العمق)
بدلاً من حقن تمثيل نهائي واحد لنموذج GFM بشكل متكرر، يقوم AdaGeoVLN بربط التمثيلات الوسيطة من أعماق متعددة لنموذج GFM (وهو VGGT) بمراحل متتالية من نموذج الرؤية واللغة (VLM) الخاص بالسياسة.
البنية: يستخرج الإطار التمثيلات من VGGT عند أعماق محددة (m∈{11,17,23}) ويحقنها في أول ثلاث طبقات فك تشفير (k∈{0,1,2}) لنموذج VLM من نوع Qwen3.5-4B.
المعالجة: لكل عمق، يتم تطبيع تمثيل GFM، ومحاذاته مكانياً (عبر تجميع 2×2)، وإسقاطه في الفضاء المخفي لـ VLM. تقوم شبكة بوابات (gating network) لكل رمز (token-wise) ووزن قياسي متعلم بالتحكم في مساهمة تحديث كل عمق.
الفرضية: يعامل هذا النهج تسلسل GFM كمصدر تجريبي للمعلومات التكميلية، متجنباً تحديد أدوار دلالية مسبقة لطبقات معينة، مما يسمح للتحديثات الهندسية بالانتشار عبر حسابات السياسة.
2. الاحتفاظ بـ GFM KV الواعي بالملاحة (اختيار الوقت)
لإدارة الذاكرة تحت ميزانية ثابتة، يقوم AdaGeoVLN باختيار حالات المفتاح-القيمة (KV) العالمية التاريخية من GFM بناءً على ثلاثة معايير، بدلاً من الاعتماد فقط على الحداثة.
معايير الاختيار:
الصلة بالتعليمات: يقيس التشابه الجيبي (cosine similarity) بين الرموز البصرية وأجزاء التعليمات (المستمدة من علامات الترقيم وعلامات التسلسل)، مما يربط الهندسة بأهداف فرعية محددة.
الثقة الهندسية: يجمع درجات الثقة من متنبئات العمق وخرائط النقاط في GFM، حيث يتطلب الأمر ثقة عالية من كليهما للحصول على درجة موثوقية عالية.
حداثة الانتقال: يحدد مدى تميز منظور إطار معين بالنسبة لجميع الإطارات المرصودة سابقاً لتجنب التاريخ الهندسي المكرر.
الآلية: يتم حساب درجة احتفاظ مشتركة للرموز المرشحة باستخدام مجموع مرجح للدرجات المعيارية للصلة والثقة والحداثة. يتم إجراء عملية اختيار "Top-K" لكل طبقة لتناسب إجمالي ميزانية الرموز للطبقة (Btotal). توفر الحالات المحتفظ بها السياق الهندسي للملاحظات اللاحقة قبل الدمج مع السياسة.
المساهمات الرئيسية
اختيار الهندسة عبر عمق التمثيل: يثبت البحث أن ربط أعماق متعددة لـ GFM بمراحل السياسة المتتالية يتفوق على كل من الحقن أحادي النهاية والحقن المتكرر للميزة النهائية في المواقع المتطابقة. وهذا يؤكد فائدة التمثيلات الهندسية الوسيطة للاستدلال المتسلسل.
الذاكرة الهندسية المشروطة بالملاحة: قدم المؤلفون آلية احتفاظ محدودة تختار حالات GFM التاريخية بناءً على الصلة بالتعليمات، والثقة الهندسية، وانتقالات المسار. وهذا يسمح للملاحة بتوجيه اختيار الذاكرة، مما يحافظ على الأداء مع تقليل بصمة الذاكرة بشكل كبير مقارنة بالنماذج الزمنية ذات الذاكرة الأكبر.
تقييم شامل: تم تقييم الإطار على معايير R2R-CE و RxR-CE Val-Unseen باستخدام تدفق RGB واحد فقط دون بيانات ملاحة خارجية. بالإضافة إلى ذلك، تم نشر السياسة على روبوت بشري حقيقي من نوع Unitree G1.
النتائج التجريبية
أداء المعايير: في R2R-CE Val-Unseen، حقق AdaGeoVLN معدل نجاح (SR) بنسبة 55.7% ونجاحاً مرجحاً بطول المسار (SPL) بنسبة 51.4%، متفوقاً على النموذج المرجعي القوي JanusVLN (الذي حقق 52.8% SR و 49.2% SPL) دون استخدام بيانات تدريب خارجية إضافية. وفي RxR-CE Val-Unseen، حقق 54.1% SR و 44.7% SPL.
دراسة الاستئصال على العمق: أدى الدمج الهرمي (باستخدام الأعماق 11، 17، 23) إلى تحسين SR/SPL بمقدار 6.8/7.3 نقطة مئوية عن الدمج أحادي النهاية، وبمقدار 13.6/14.5 نقطة عن التحكم الذي كرر حقن الميزة النهائية في نفس المواقع. وهذا يؤكد أن تنوع التمثيل، وليس مجرد تكرار الحقن، هو ما يقود الأداء.
دراسة الاستئصال على الذاكرة: حققت استراتيجية الاحتفاظ الواعية بالملاحة (Nav. 900K) أعلى SR (55.7%) بين التكوينات المختبرة، بينما استخدمت أقل بنحو 39.73% من ذاكرة GFM-KV و 20.22% أقل من ذاكرة GPU المخصصة مقارنة بنموذج هجين تدريجي (8+48).
مساهمة الإشارة: أدى استئصال إشارات الاحتفاظ الفردية (الصلة، الثقة، الحداثة) عند ميزانية ثابتة إلى انخفاض في الأداء، حيث كانت الثقة الهندسية هي الأكثر تأثيراً (انخفاض 2.1 نقطة مئوية في SR عند إزالتها)، مما يؤكد ضرورة النهج متعدد الإشارات.
الأهمية والادعاءات
يزعم البحث أن AdaGeoVLN يضع نموذجاً جديداً للملاحة البصرية-اللغوية التدفقية من خلال فحص التمثيلات الهندسية المعروضة للسياسة والأدلة التاريخية المحتفظ بها للاستدلال المستقبلي بشكل مشترك. النتائج الرئيسية هي:
الربط متعدد الأعماق يتفوق على الحقن المتكرر للميزة النهائية، مما يشير إلى أن حالات GFM الوسيطة تحتوي على معلومات حرجة للملاحة تُفقد عند استخدام الحالة النهائية فقط.
الاحتفاظ الواعي بالملاحة يوازن بفعالية بين قيود الذاكرة والأداء، مما يحافظ على قدرات الملاحة مع تقليل العبء الإضافي للذاكرة المرتبط بالاستدلال الهندسي طويل الأمد بشكل كبير.
يعمل الإطار بفعالية مع تدفق RGB واحد، مما يثبت إمكانية تحقيق فهم مكاني قوي دون الحاجة إلى مستشعرات عمق، أو بيانات قياس المسافات (odometry)، أو بيانات تدريب خارجية واسعة.
يشير المؤلفون إلى وجود قصور: حيث تم ضبط معاملات الاحتفاظ للإشارات الثلاث بأوزان متساوية دون تحسين. ويُقترح في العمل المستقبلي استكشاف ضبط أو تعلم هذه الأوزان النسبية. ويخلص البحث إلى أن التمثيلات الهندسية المختارة والأدلة التاريخية أمر حيوي للملاحة المتجسدة، وهو ادعاء مدعوم بكل من معايسات المحاكاة والنشر الفعلي على روبوت بشري.