AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
يقدم AgenticNav إطار عمل خفيف الوزن للملاحة بالرؤية واللغة بنمط "الصفر استباقي" (zero-shot)، يعيد تصور التفاعل بين النموذج اللغوي البصري (VLM) والبيئة كإطار لاستدعاء الأدوات، مما يتيح اختيار الإجراءات المباشرة القائمة على البكسل، والاستعلام عن العمق عند الطلب، والاسترجاع الانتقائي للذاكرة لتحقيق أداء رائد دون الحاجة إلى متنبئات نقاط مسار متعلمة.
تخيل أنك تعلم روبوتًا كيفية التنقل في منزل جديد تمامًا. تعطي له أمرًا بسيطًا: "اذهب إلى المطبخ، ثم انعطف يمينًا، وتوقف بجانب الأريكة". هذا هو عالم الملاحة القائمة على الرؤية واللغة (VLN). وهو فرع من فروع الروبوتات حيث يجب على العميل فهم الكلام البشري والإشارات البصرية للتحرك عبر مساحة ثلاثية الأبعاد لم يسبق له رؤيتها من قبل. لفترة طويلة، احتاجت الروبوتات إلى التدريب على آلاف المنازل المحددة لتعلم كيفية الحركة، مما يعني أنها كانت ستضل طريقها إذا نقلتها إلى مبنى مختلف. ولكن مؤخرًا، طورنا "نماذج الرؤية واللغة الكبيرة" (VLMs) — وهي عقول ذكاء اصطناعي فائقة الذكاء يمكنها بالفعل فهم الصور والكلمات دون الحاجة إلى إعادة تدريبها لكل مهمة على حدة. السؤال الكبير للعلماء هو: كيف نربط هذا العقل الذكي بأرجل الروبوت؟ كيف نسمح للذكاء الاصطناعي بتقرير مكان خطوته بدقة دون أن يصاب بالارتباك أمام الواقع المستمر والفوضوي للعالم الحقيقي؟
هنا يأتي دور ورقة بحثية بعنوان AgenticNav. يرى المؤلفون أن الطريقة القديمة لربط الذكاء الاصطناعي بالروبوتات كانت تشبه إعطاء سائق خريطة تحتوي فقط على ثلاثة طرق مرسومة مسبقًا ليختار منها؛ فإذا لم يكن الوجهة موجودة على أحد هذه الطرق الثلاثة، سيعلق السائق. طريقة AgenticNav الجديدة تغير قواعد اللعبة تمامًا. فبدلاً من إجبار الروبوت على الاختيار من قائمة محدودة من التحركات المعتمدة مسبقًا، فإنها تمنحه مجموعة من "الأدوات" التي يمكنه استدعاؤها كلما احتاج إليها. فكر في الذكاء الاصطناعي كأنه محقق في لعبة غموض؛ فبدلاً من إجبار المحقق على الاختيار بين "اذهب يسارًا"، أو "اذهب يمينًا"، أو "اذهب مستقيمًا"، يمكن للمحقق الآن أن يقول: "أحتاج إلى فحص عمق تلك البكسل المحددة على الجدار"، أو "أرني الخريطة لمساري الذي سلكته"، أو "أريد المشي مباشرة نحو ذلك الكرسي الذي أراه".
تقدم الورقة نظامًا يسمى AgenticNav، والذي يعمل كـ "حزام" أو لوحة تحكم لهذه العقول الذكية للذكاء الاصطناعي. وجد الباحثون أنه من خلال منح الذكاء الاصطناعي ثلاث أدوات محددة، أصبح بإمكانه التنقل في بيئات غير مرئية بشكل أفضل بكثير من ذي قبل، حتى دون أي تدريب إضافي. الأداة الأولى هي أداة الحركة (Action Tool). فبدلاً من الاختيار من قائمة صغيرة من النقاط المقترحة، يمكن للذكاء الاصطناعي الإشارة مباشرة إلى أي بكسل في عرض الكاميرا والقول: "اذهب إلى هناك". ثم يقوم النظام بإجراء العمليات الحسابية لتحويل تلك البكسل إلى مسار مشي آمن. الأداة الثانية هي أداة العمق (Depth Tool). فأحيانًا يحتاج الذكاء الاصطناعي إلى معرفة مدى بعد شيء ما بالضبط. وبدلاً من عرض خريطة عمق ثلاثية الأبعاد ضخمة ومربكة للذكاء الاصطناعي، تسمح له هذه الأداة بالسؤال: "كم يبعد الجدار عند هذه النقطة المحددة؟" والحصول على رقم دقيق. الأداة الثالثة هي أداة الذاكرة (Memory Tool). بينما يتحرك الروبوت، فإنه يبني خريطة مدمجة. وإذا ارتبك الروبوت أو احتاج لتذكر علامة رآها سابقًا، يمكنه أن يطلب من النظام "استرجاع" تلك اللحظة المحددة، بدلاً من محاولة تذكر كل إطار من رحلته بأكملها، مما قد يرهق عقله.
اختبر المؤلفون هذا النظام في محاكاة حاسوبية تسمى R2R-CE (باستخدام محاكي Habitat) وأيضًا على روبوت حقيقي. تضمن التحقق في العالم الحقيقي 30 حلقة محددة شملت مشاهد مختبرية، ومكتبية، وفناء خارجي، مع التركيز على مهام مثل قراءة اللافتات، والملاحة بعيدة المدى، والوصال الدقيق للهدف. ووجدوا أنه عند استخدام عقل ذكاء اصطناعي قوي (GPT-5.5)، حققت طريقتهم الجديدة نسبة نجاح بلغت 55% في الوصول إلى الهدف، وهي قفزة كبيرة عن أفضل طريقة سابقة (SmartWay) التي وصلت فقط إلى 44%. ومن حيث الكفاءة (مدى التوازن بين النجاح واتباع مسار قصير)، فقد تحسنوا من 35.04% إلى 48.41%. تشير الورقة البحثية إلى أن العقبة ليست فقط في مدى ذكاء عقل الذكاء الاصطناعي، بل في مدى جودة تزويده بالأدوات للتفاعل مع العالم. ومن خلال السماح للذكاء الاصطناعي باختيار أهدافه الخاصة وطلب معلومات محددة، يصبح أكثر قدرة على التنقل في العالم الحقيقي، حتى في الأماكن التي لم يزرها من قبل. كما لاحظ الباحثون أن هذا النهج يعمل جيدًا مع أنواع مختلفة من عقول الذكاء الاصطناعي، مما يشير إلى أن أسلوب "استدعاء الأدوات" هذا هو طريق واعد لجعل الروبوتات قادرة حقًا على فهم عالمنا المعقد والتحرك من خلاله.
ملخص تقني: AgenticNav
بيان المشكلة
تهدف الملاحة في البيئات المستمرة القائمة على الرؤية واللغة بنمط الصفر-الاستباقي (Zero-shot VLN-CE) إلى تمكين الوكلاء من اتباع تعليمات لغوية طبيعية في مشاهد ثلاثية الأبعاد غير مرئية مسبقًا، دون الاعتماد على رسوم بيانية للملاحة محددة مسبقًا أو تدريب خاص بالمهمة. وبينما جعلت النماذج اللغوية البصرية الكبيرة (VLMs) الاستدلال بنمط الصفر-الاستباقي أمرًا ممكنًا، تواجه الأساليب الحالية المتطورة (مثل Open-Nav وSmartWay وEvoNav) ثلاث عقبات حرجة في الواجهة بين النموذج اللغوي البصري (VLM) والبيئة:
مساحة حركة مقيدة: تعتمد الأساليب الحالية على متنبئات نقاط مسار (waypoint predictors) متعلمة تقترح مجموعة صغيرة وثابتة من المرشحين القابلين للملاحة. وهذا يحد من قدرة الـ VLM على اختيار المواقع ذات الصلة بالتعليمات إذا لم تكن مدرجة ضمن مخرجات المتنبئ.
استخدام غير فعال للعمق: على الرغم من توفر بيانات العمق، إلا أنه غالبًا ما يتم تغذيتها كمدخلات خام أو إخفاؤها داخل متنبئ نقاط المسار. وهذا يمنع الـ VLM من الوصول إلى مسافات مترية دقيقة لمهام الاستدلال المكاني المحددة (مثل مقارنة المسافات بين العوائق).
إدارة غير فعالة للذاكرة: تقوم النهج الحالية إما بتراكم السجلات النصية/البصرية الطويلة (مما يؤدي إلى إدخال سياق غير ذي صلة وتشتيت النموذج) أو استرجاع تجارب الحلقات السابقة (مما ينتهك فرضية الصفر-الاستباقي الصارمة بالاعتماد على بيانات الحلقات السابقة).
المنهجية: AgenticNav
يقترح المؤلفون AgenticNav، وهو إطار عمل ملاحة خفيف الوزن يعيد صياغة الملاحة (VLN-CE) بنمط الصفر-الاستباقي كعملية استدعاء أدوات وكيلية (agentic tool-calling). بدلاً من إجبار الـ VLM على الاختيار من بين نقاط مسار محسوبة مسبقًا أو تحليل خرائط عمق كثيفة، يكشف AgenticNav عن ثلاثة أدوات محددة ومؤصلة يمكن للـ VLM استدعاؤها عند الطلب:
1. أداة الحركة (الاختيار على مستوى البكسل)
الآلية: يختار الـ VLM مباشرة بكسل مستهدف (u,v) في ملاحظة RGB بدلاً من الاختيار من قائمة نقاط مسار متوقعة.
التنفيذ: يقوم إطار العمل بتحويل اختيار البكسل ثنائي الأبعاد هذا إلى حركة قابلة للتنفيذ ثلاثية الأبعاد (θ,ρ) باستخدام إلغاء إسقاط العمق (depth unprojection) ومعايرة الكاميرا.
السلامة: قبل التنفيذ، يتحقق فحص سلامة حتمي من أن المسار خالٍ من العوائق (باستخدام تصفية النقاط حسب ارتفاع الجسم) وأن العمق صالح. إذا كان الهدف غير آمن، تعيد الأداة إشارة Reselect (إعادة اختيار)، مما يدفع الـ VLM للاختيار مرة أخرى.
الفائدة: هذا يلغي الاعتماد على متنبئات نقاط المسار المتعلمة، مما يسمح للـ VLM بالملاحة إلى أي موقع مرئي ومتاح.
2. أداة العمق (الاستعلامات المترية عند الطلب)
الآلية: بدلاً من تقديم خرائط عمق كاملة، يمكن للـ VLM استدعاء query_depth(P) على مجموعة محددة من البكسلات.
الفائدة: يسمح هذا للـ VLM بإجراء مقارنات مكانية مستهدفة (مثل: "هل الباب أقرب من العائق؟") دون العبء المعرفي لتحليل صورة عمق كاملة، مما يوفر أدلة محلية دقيقة عند الحاجة فقط.
3. أداة الذاكرة والاستدعاء الوكيلية
الآلية: يحافظ النظام على صورة خريطة (Map Image) موجزة تلخص المسار، بالإضافة إلى ذاكرة مؤقتة محدودة للملاحظات السابقة.
الاستدعاء: عندما يحدد الـ VLM أن التفاصيل البصرية من نقطة قرار سابقة ضرورية، فإنه يستدعي recall(p, k) لاسترجاع صورة RGB محددة مخزنة مؤقتًا.
الفائدة: يضمن هذا أن نافذة السياق تنمو فقط مع المعلومات ذات الصلة بالمهمة، مما يتجنب تراكم الإطارات التاريخية غير ذات الصلة مع الحفاظ على إعداد الصفر-الاستباقي الصارم للحلقة الواحدة (عد_م استرجاع البيانات من الحلقات السابقة).
المساهمات الرئيسية
إطار عمل استدعاء الأدوات الوكيلية: يقدم البحث AgenticNav، الذي يعيد التفكير في واجهة الـ VLM والبيئة كعملية استدعاء للأدوات، مما يلغي الحاجة إلى متنبئات نقاط المسار المتعلمة.
واجهة العمق الوكيلية: آلية مبتكرة تسمح لنماذج VLMs بطلب العمق المتري في مواقع دقيقة، والتي ثبت أنها أكثر فعالية للاستدلال المكاني من مدخلات العمق الخام أو وسائط نقاط المسار.
آلية الذاكرة الانتقائية: نظام ذاكرة هجين يجمع بين خريطة مسار موجزة وأداة استدعاء انتقائية، مما يحسن اتخاذ القرار طويل المدى بشكل كبير دون تضخم السياق.
أداء الحالة الراهنة (SOTA): يحقق الأسلوب نتائج جديدة في SOTA لـ zero-shot VLN-CE على معيار R2R-CE، مما يثبت أن تصميم إطار العمل لا يقل أهمية عن النموذج الأساسي للـ VLM نفسه.
النتائج التجريبية
المحاكاة (R2R-CE Val Unseen)
تم التقييم باستخدام بروتوكول الـ 100 حلقة القياسي دون تدريب السياسة:
الأداء: باستخدام GPT-5.5 كنموذج أساسي، حقق AgenticNav نسبة نجاح (SR) بلغت 55% ونجاح مرجح بطول المسار (SPL) بلغ 48.41%.
المقارنة: يتفوق هذا على إعادة إنتاج SmartWay بنفس النموذج الأساسي (44% SR، 35.04% SPL) بمقدار 11 نقطة مئوية في SR و13.37 نقطة في SPL.
التعميم: باستخدام Gemini-2.5-Pro، تفوق AgenticNav أيضًا على Open-Nav وEvoNav تحت نفس المعيار، مما يؤكد أن النهج ليس مرتبطًا بنموذج VLM واحد.
الدراسات الاستقصائية (Ablations):
إزالة أداة الحركة (العودة إلى متنبئات نقاط المسار) أدى إلى انخفاض SR بمقدار 5 نقاط.
إزالة أداة العمق أدى إلى انخفاض SR إلى 42%؛ حيث أدى مجرد إضافة صور العمق كمدخلات إلى استعادة جزء فقط من الخسارة، مما يسلط الضال على قيمة الاستعلامات المهيكلة.
إزالة آلية الاستدعاء الانتقائي أدى إلى انخضفاض SR إلى 41%، مما يثبت قيمة استرجاع الذاكرة المستهدف مقارنة بالخرائط الثابتة وحدها.
التحقق من العالم الحقيقي
تم النشر على روبوت ذي أربع عجلات مع كاميرا RGB-D في بيئات مختبرية، مكتبية، وفناء:
حقق AgenticNav (بـ 4 زوايا رؤية) نسبة 46.7% SR وخطأ ملاحة (NE) قدره 2.67 متر، متفوقًا بشكل كبير على SmartWay (23.3% SR، 3.57m NE).
أظهر التحليل النوعي أن AgenticNav نجح في التعامل مع الحالات التي فشل فيها متنبئ نقاط المسار في SmartWay في اقتراح الاتجاه الصحيح، واستخدم أدوات العمق بفعالية لتوقيت الدورات واستخدم أدوات الاستدعاء للحفاظ على قيود المدى الطويل.
الأهمية والادعاءات
يجادل البحث بأنه بالنسبة للملاحة القائمة على النماذج التأسيسية، فإن تصميم إطار عمل الحركة، الإدراك، والذاكرة لا يقل أهمية عن اختيار الـ VLM نفسه.
التحول في النموذج الفكري: لم يعد العامل المحدد لـ zero-shot VLN-CE هو قدرة الاستدلال للنموذج فحسب، بل كيفية ربط النموذج بالبيئة.
نزاهة الصفر-الاستباقي: من خلال تجنب المتنبئات المتعلمة والذاكرة عبر الحلقات، يحافظ AgenticNav على إعداد صفر-استباقي حلقي صارم، مما يجعله أكثر قوة للانتشار في مشاهد جديدة حيث لا توجد بيانات تدريب سابقة.
الكفاءة: يسمح واجهة استدعاء الأدوات للـ VLM بتقرير ما هي الأدلة التي يجب فحصها (العمق، الذاكرة) وأين يتحرك، مع إبقاء فحوصات السلامة حتمية مع تعظيم حرية الاستدلال للنموذج.
يخلص المؤلفون إلى أنه بينما تظل جودة قرار الـ VLM هي المصدر الرئيسي للفشل (حوالي 89% من حالات الفشل في المحاكاة)، فإن إطار عمل AgenticNav ينجح في إطلاق إمكانات النماذج التأسيسية من خلال توفير واجهة مباشرة، مؤصلة، ومستمرة مع العالم المادي.