← أحدث الأبحاث
💻 computer science

AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation

يُعد AdaGeoVLN إطار عمل للملاحة البصرية اللغوية التدفقية، يعزز الأداء من خلال الدمج الانتقائي لتمثيلات النماذج التأسيسية للهندسة الهرمية عبر أعماق مختلفة، والاحتفاظ بالأدلة الهندسية التاريخية المدركة للملاحة من خلال آلية ذاكرة محدودة.

المؤلفون الأصليون: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

نُشر 2026-09-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتًا يحاول اتباع مجموعة من التعليمات المنطوقة عبر منزل لم يره من قبل. لكي ينجح، لا يمكن للروبوت ببساطة أن يدرك أن الكرسي هو كرسي أو أن الباب هو باب؛ بل يجب عليه فهم كيفية ارتباط تلك الأشياء ببعضها البعض في الفضاء، وكيف تتغير وجهة نظره أثناء حركته، وكيف يتصل المسار الذي يسلكه بالتعليمات التي يسمعها. هذا التحدي، المعروف باسم الملاحة البصرية اللغوية (vision-language navigation)، يتطلب من الوكيل بناء خريطة ذهنية للعالم في الوقت الفعلي، باستخدام كاميرا فقط وأمر صوتي. لسنوات، حاول الباحثون تعليم الآلات هذه المهارة عبر تغذيتها بكميات هائلة من البيانات المرئية، ولكن ظل هناك سؤال جوهي دون إجابة: كيف ينبغي للروبوت استخدام الفهم العميق والطبقي للهندسة الذي تمتلكه نماذج الذكاء الاصطناعي الحديثة، وكم من الماضي يجب أن يتذكره لاتخاذ قرارات جيدة في المستقبل؟

قدم فريق من الباحثين نظامًا جديدًا يسمى AdaGeoVLN يجيب على هذه الأسئلة من خلال تغيير الطريقة التي ينظر بها الروبوت إلى العالم وكيفية تخزين ذاكراته. فبدلاً من الاعتماد على لقطة واحدة نهائية لمحيطه، يتعلم النظام استخلاص المعلومات الهندسية المفيدة من مراحل متعددة لعملية تفكيره الخاصة. علاوة على ذلك، فهو لا يحاول تذكر كل إطار رآه على الإطلاق، لأن ذلك سيؤدي سريعًا إلى إغراق ذاكرته؛ بل يعمل مثل مؤرشف دقيق، يحتفظ فقط باللحظات التاريخية الأكثر أهمية التي تساعده على فهم مكان وجوده وإلى أين يحتاج الذهاب بعد ذلك. يتيح هذا النهج للروبوت التنقل في بيئات معقدة وغير مرئية مسبقًا باستخدام بث فيديو قياسي فقط، دون الحاجة إلى مستشعرات إضافية مثل كاميرات العمق أو خرائط معدة مسبقًا.

يكمن جوهر هذه الطريقة الجديدة في كيفية معالجة الروبوت للمعلومات المرئية. إن نماذج الذكاء الاصطناعي الحديثة التي تفهم الهندسة مبنية كأكوام عميقة من الطبقات، حيث تعالج كل طبقة الصورة بشكل مختلف قليلاً. قد تلتقط الطبقات الأولى الأشكال والحواف البسيطة، بينما تفهم الطبقات الأعمق الهياكل المعقدة والعلاقات المكانية. كانت الأنظمة السابقة تتجاهل عادةً هذه الطبقات المبكرة، وتنتظر حتى نهاية العملية تمامًا لاستخدام ملخص نهائي واحد للمشهد. وجد الباحثون أن هذا كان خطأً؛ فمن خلال ربط خطوات اتخاذ القرار لدى الروبوت بعدة طبقات من النموذج الهندسي في آن واحد — باستخدام المراحل المبكرة والمتوسطة والمتأخرة معًا — اكتسب الروبوت فهمًا أغنى لمحيطه. وقد أثبت هذا النهج متعدد الطبقات أنه أكثر فعالية بكثير من مجرد حقن الملخص النهائي بشكل متكرر، مما يشير إلى أن الروبوت يستفيد من رؤية العالم من خلال "عدسات" مختلفة في نفس الوقت.

يعالج الابتكار الرئيسي الثاني مشكلة الذاكرة. فبينما يسير الروبوت عبر منزل، فإنه يولد تدفقًا مستمرًا من البيانات المرئية. وتخزين كل قطعة من هذه البيانات سيتطلب قدرًا مستحيلاً من الذاكرة، خاصة في الرحلات الطويلة. كانت الأساليب القديمة تحتفظ غالبًا بالإطارات الأخيرة أو عدد ثابت من المشاهد الماضية، بافتراض أن ما حدث قبل لحظة واحدة هو الأكثر أهمية. ومع ذلك، أدرك الباحثون أن المشهد القديم قد يكون حيويًا إذا كان يحتوي على معلم محدد ذُكر في التعليمات، أو إذا أظهر منعطفًا فريدًا في المسار. يحل AdaGeoVLV هذه المشكلة عن طريق اختيار الذكريات التي يجب الاحتفاظ بها بناءً على ثلاثة معايير محددة: مدى صلة الذاكرة بالتعليمات الحالية، ومدى ثقة الروبوت في التفاصيل الهندسية لذلك المشهد، ومدى اختلاف ذلك المشهد عما رآه من قبل. وهذا يسمح للروبوت بالتخلص من المعلومات الزائدة مع التمسك باللحظات المحددة التي ستساعده في الملاحة لاحقًا.

ولاختبار هذه الأفكار، درب الباحثون نظامهم على آلاف مهام الملاحة المحاكية ثم قيموه باستخدام معيارين قياسيين يستخدمهما المجتمع العلمي. وأظهرت النتائج أن النظام الجديد تفوق بشكل كبير على الأساليب السابقة. وفي إحدى مجموعات الاختبار، نجح في الوصول إلى وجهته بنسبة 55.7 بالمائة، وهو تحسن ملحوظ مقارنة بأفضل الأنظمة الموجودة التي لا تستخدم بيانات خارجية إضافية. والأهم من ذلك، حقق النظام هذا المستوى العالي من الأداء مع استخدام ذاكرة حاسوبية أقل بكثير من النهج الأخرى التي حاولت تخزين كميات كبيرة من التاريخ. وقد أثبت الباحثون أنه من خلال كون الروبوت انتقائيًا فيما يتذكره، يمكنه الحفاظ على وعيه المكاني دون أن يثقله الكثير من البيانات غير الضرورية.

لم يتوقف الفريق عند المحاكاة الحاسوبية، بل قاموا بنشر السياسة المدربة على روبوت حقيقي بحجم الإنسان مجهز بكاميرا قياسية. وفي التجارب الواقعية، نجح الروبوت في اتباع تعليمات متعددة الخطوات، مثل الابتعء عن مدفأة، وصعود درج منحني، والتوقف عند باب محدد. لقد تمكن من تجاوز نبتة من الجانب الصحيح وتجنب الأبواب غير ذات الصلة، مما أثبت أن الذاكرة الانتقائية والاستدلال الهندسي متعدد الطبقات يعملان في العالم المادي، وليس في العالم الافتراضي فحسب. وأشار الباحثون إلى أنه بينما يعد النظام فعالًا للغاية، إلا أنه لا تزال هناك مساحة لتحسين كيفية موازنة إشارات الذاكرة المختلفة، لكن النهج الأساسي المتمثل في اختيار الهندسة عبر أعماق وأوقات مختلفة قد أثبت أنه وسيلة قوية لتعليم الآلات كيفية التحرك عبر العالم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →