← أحدث الأبحاث
💻 computer science

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

يقدم AgenticNav إطار عمل خفيف الوزن للملاحة بالرؤية واللغة بنمط "الصفر استباقي" (zero-shot)، يعيد تصور التفاعل بين النموذج اللغوي البصري (VLM) والبيئة كإطار لاستدعاء الأدوات، مما يتيح اختيار الإجراءات المباشرة القائمة على البكسل، والاستعلام عن العمق عند الطلب، والاسترجاع الانتقائي للذاكرة لتحقيق أداء رائد دون الحاجة إلى متنبئات نقاط مسار متعلمة.

المؤلفون الأصليون: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

نُشر 2026-07-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية التنقل في منزل جديد تمامًا. تعطي له أمرًا بسيطًا: "اذهب إلى المطبخ، ثم انعطف يمينًا، وتوقف بجانب الأريكة". هذا هو عالم الملاحة القائمة على الرؤية واللغة (VLN). وهو فرع من فروع الروبوتات حيث يجب على العميل فهم الكلام البشري والإشارات البصرية للتحرك عبر مساحة ثلاثية الأبعاد لم يسبق له رؤيتها من قبل. لفترة طويلة، احتاجت الروبوتات إلى التدريب على آلاف المنازل المحددة لتعلم كيفية الحركة، مما يعني أنها كانت ستضل طريقها إذا نقلتها إلى مبنى مختلف. ولكن مؤخرًا، طورنا "نماذج الرؤية واللغة الكبيرة" (VLMs) — وهي عقول ذكاء اصطناعي فائقة الذكاء يمكنها بالفعل فهم الصور والكلمات دون الحاجة إلى إعادة تدريبها لكل مهمة على حدة. السؤال الكبير للعلماء هو: كيف نربط هذا العقل الذكي بأرجل الروبوت؟ كيف نسمح للذكاء الاصطناعي بتقرير مكان خطوته بدقة دون أن يصاب بالارتباك أمام الواقع المستمر والفوضوي للعالم الحقيقي؟

هنا يأتي دور ورقة بحثية بعنوان AgenticNav. يرى المؤلفون أن الطريقة القديمة لربط الذكاء الاصطناعي بالروبوتات كانت تشبه إعطاء سائق خريطة تحتوي فقط على ثلاثة طرق مرسومة مسبقًا ليختار منها؛ فإذا لم يكن الوجهة موجودة على أحد هذه الطرق الثلاثة، سيعلق السائق. طريقة AgenticNav الجديدة تغير قواعد اللعبة تمامًا. فبدلاً من إجبار الروبوت على الاختيار من قائمة محدودة من التحركات المعتمدة مسبقًا، فإنها تمنحه مجموعة من "الأدوات" التي يمكنه استدعاؤها كلما احتاج إليها. فكر في الذكاء الاصطناعي كأنه محقق في لعبة غموض؛ فبدلاً من إجبار المحقق على الاختيار بين "اذهب يسارًا"، أو "اذهب يمينًا"، أو "اذهب مستقيمًا"، يمكن للمحقق الآن أن يقول: "أحتاج إلى فحص عمق تلك البكسل المحددة على الجدار"، أو "أرني الخريطة لمساري الذي سلكته"، أو "أريد المشي مباشرة نحو ذلك الكرسي الذي أراه".

تقدم الورقة نظامًا يسمى AgenticNav، والذي يعمل كـ "حزام" أو لوحة تحكم لهذه العقول الذكية للذكاء الاصطناعي. وجد الباحثون أنه من خلال منح الذكاء الاصطناعي ثلاث أدوات محددة، أصبح بإمكانه التنقل في بيئات غير مرئية بشكل أفضل بكثير من ذي قبل، حتى دون أي تدريب إضافي. الأداة الأولى هي أداة الحركة (Action Tool). فبدلاً من الاختيار من قائمة صغيرة من النقاط المقترحة، يمكن للذكاء الاصطناعي الإشارة مباشرة إلى أي بكسل في عرض الكاميرا والقول: "اذهب إلى هناك". ثم يقوم النظام بإجراء العمليات الحسابية لتحويل تلك البكسل إلى مسار مشي آمن. الأداة الثانية هي أداة العمق (Depth Tool). فأحيانًا يحتاج الذكاء الاصطناعي إلى معرفة مدى بعد شيء ما بالضبط. وبدلاً من عرض خريطة عمق ثلاثية الأبعاد ضخمة ومربكة للذكاء الاصطناعي، تسمح له هذه الأداة بالسؤال: "كم يبعد الجدار عند هذه النقطة المحددة؟" والحصول على رقم دقيق. الأداة الثالثة هي أداة الذاكرة (Memory Tool). بينما يتحرك الروبوت، فإنه يبني خريطة مدمجة. وإذا ارتبك الروبوت أو احتاج لتذكر علامة رآها سابقًا، يمكنه أن يطلب من النظام "استرجاع" تلك اللحظة المحددة، بدلاً من محاولة تذكر كل إطار من رحلته بأكملها، مما قد يرهق عقله.

اختبر المؤلفون هذا النظام في محاكاة حاسوبية تسمى R2R-CE (باستخدام محاكي Habitat) وأيضًا على روبوت حقيقي. تضمن التحقق في العالم الحقيقي 30 حلقة محددة شملت مشاهد مختبرية، ومكتبية، وفناء خارجي، مع التركيز على مهام مثل قراءة اللافتات، والملاحة بعيدة المدى، والوصال الدقيق للهدف. ووجدوا أنه عند استخدام عقل ذكاء اصطناعي قوي (GPT-5.5)، حققت طريقتهم الجديدة نسبة نجاح بلغت 55% في الوصول إلى الهدف، وهي قفزة كبيرة عن أفضل طريقة سابقة (SmartWay) التي وصلت فقط إلى 44%. ومن حيث الكفاءة (مدى التوازن بين النجاح واتباع مسار قصير)، فقد تحسنوا من 35.04% إلى 48.41%. تشير الورقة البحثية إلى أن العقبة ليست فقط في مدى ذكاء عقل الذكاء الاصطناعي، بل في مدى جودة تزويده بالأدوات للتفاعل مع العالم. ومن خلال السماح للذكاء الاصطناعي باختيار أهدافه الخاصة وطلب معلومات محددة، يصبح أكثر قدرة على التنقل في العالم الحقيقي، حتى في الأماكن التي لم يزرها من قبل. كما لاحظ الباحثون أن هذا النهج يعمل جيدًا مع أنواع مختلفة من عقول الذكاء الاصطناعي، مما يشير إلى أن أسلوب "استدعاء الأدوات" هذا هو طريق واعد لجعل الروبوتات قادرة حقًا على فهم عالمنا المعقد والتحرك من خلاله.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →