يُعد VerNav إطار عمل يرتكز أولاً على التحقق من صحة الملاحة القائمة على الرؤية واللغة، حيث يقلل بشكل كبير من زمن انتقال مرحلة اتخاذ القرار عبر استبدال التوليد التكراري لكل خطوة بالتحقق من الإجراءات بنظام الدفعات ومولد تكيفي يعتمد على الإنتروبيا، مع توظيف مخطط محاذاة ثنائي المراحل للحفاظ على أداء ملاحة تنافسي في اختبار R2R.
تخيل روبوتاً يحاول إيجاد طريقه عبر منزل لم يره من قبل، مسترشداً فقط بجملة منطوقة مثل "اذهب إلى المطبخ، ثم انعطف يساراً عند الكرسي الأزرق، ثم توقف". هذا هو تحدي الملاحة القائمة على الرؤية واللغة. يجب على الروبوت أن ينظر إلى محيطه، ويفهم كلمات الإنسان، ويقرر بالضبط أين سيتحرك بعد ذلك. لفترة طويلة، حاول الباحثون حل هذه المشكلة عبر منح الروبوت عقلاً قوياً يتحدث مع نفسه خلال كل خطوة. فقبل القيام بأي حركة، كان الروبوت يولد تدفقاً طويلاً من الأفكار، يشرح فيه منطقه، ويتفحص محيطه، ويخطط لمنعطفه التالي. وبينما يساعد هذا التفكير الصريح الروبوت على فهم التعليمات المعقدة، إلا أنه بطيء للغاية. تماماً كما أن الإنسان الذي يتحدث في كل خطوة من خطوات مشيه سيكون أبطأ بكثير من الشخص الذي يمشي ببساطة، فإن الروبوت الذي يولد فقرة كاملة من الاستنتاج قبل كل خطوة واحدة يستغرق وقتاً طويلاً جداً لاتخاذ القرار. وفي العالم الحقيقي، حيث السرعة مهمة، يجعل هذا التأخير هذه التكنولوجيا غير عملية.
اقترح فريق من الباحثين من جامعة العلوم الإلكترونية والتكنولوجيا في الصين طريقة مختلفة للتفكير في هذه المشكلة. فهم يقترحون أنه بدلاً من إجبار الروبوت على كتابة قصة طويلة قبل كل حركة، يجب عليه أولاً التحقق بسرعة من قائمة بالتحركات الممكنة واختيار الأفضل منها. وقد أطلقوا على نظامهم الجديد اسم "VerNav". الفكرة الجوهرية هي استبدال عملية توليد الأفكار البطيئة والخطوة بخطوة بعملية تحقق سريعة. فبدلاً من مطالبة عقل الروبوت بابتكار مسار جديد من الصفر، يعرض النظام مجموعة من الاتجاهات المتاحة — مثل "تحرك للأمام"، أو "انعطف يساراً"، أو "توقف" — ويطلب من العقل ببساطة قول "نعم" أو "لا" لكل منها. يسمح هذا للروبوت بتقييم جميع خياراته دفعة واحدة، بدلاً من تقييمها واحداً تلو الآخر. ومن خلال القيام بذلك، يقلل النظام الوقت الذي يستغرقه اتخاذ القرار بأكثر من عشر مرات مقارنة بالطرق التقليدية، مع الحفاظ في الوقت ذاته على بقاء الروبوت في المسار الصحيح.
ومع ذلك، فإن مجرد التحقق من الخيارات بسرعة ليس كافياً. فقد وجد الباحثون أنه إذا استخدموا طريقة التحقق السريع هذه فقط، فسيصاب الروبوت بالارتباك ويرتكب الأخطاء، خاصة في المواقف الصعبة. فالمدقق السريع جيد في استبعاد الأفكار السيئة، لكنه يواجه أحيالاً صعوبة في اختيار الفكرة الأفضل الوحيدة عندما تبدو الخيارات متشابهة جداً. ولإصلاح ذلك، أضاف الفريق شبكة أمان ذكية؛ حيث بنوا نظاماً يراقب ثقة الروبوت. فإذا كان الروبوت متأكداً بشأن الاتجاه الذي يجب أن يسلكه، فإنه يلتزم بطريقة التحقق السريع. ولكن إذا كان الروبوت غير متأكد — وهو ما يشير إليه مستوى عالٍ من الارتباك بين الخيارات المتاحة — فإن النظام يتوقف ويطلب من محرك تفكير أقوى وأبطأ تقديم ملخص موجز ومركز للموقف. يعمل هذا الملخص كإشارة سريعة لمساعدة المدقق السريع على اتخاذ القرار الصحيح. وبهذه الطريقة، لا يستخدم الروبوت قوة التفكير البطيئة والمكلفة إلا عندما يحتاج إليها بشدة، مما يحافظ على سرعة وكفاءة العملية الإجمالية.
وللتأكد من أن نظام التحقق السريع هذا يعمل جيداً للملاحة بالفعل، كان على الباحثين تعليمه كيفية الحكم على التحركات بشكل صحيح. فقد طوروا عملية تدريب مكونة من خطوتين: أولاً، علموا النظام التعرف على أي التحركات الفورية هي الأفضل من غيرها، مما ساعده على تعلم تفضيل الإجراءات التي تنقله ليكون أقرب إلى الهدف. بعد ذلك، تركوا النظام يتدرب على ملاحة مسارات كاملة، مكافئين إياه ليس فقط للوصول إلى الوجهة النهائية، بل أيضاً لكل خطوة صغيرة حققت تقدماً. ضمن هذا التدريب أن المدقق السريع لا يختار تحركات عشوائية فحسب، بل تعلم اتباع التعليمات بدقة عبر مسافات طويلة. وعند اختباره على مجموعة معيارية من مهام الملاحة، أدى النظام الجديد أداءً يضاهي أفضل الروبوتات الموجودة التي تستخدم التفكير الثقيل والبطيء، ولكنه اتخذ القرارات في جزء بسيط من الوقت. وتظهر النتائج أنه من خلال التحقق من الخيارات بسرعة واللجوء إلى التفكير العميق عند الضرورة فقط، يمكن للروبوتات التنقل في بيئات معقدة بشكل أسرع بكثير دون أن تفقد طريقها.
ملخص تقني: VerNav
بيان المشكلة تتطلب الملاحة عبر الرؤية واللغة (VLN) من وكيل مجسد عبور بيئات ثلاثية الأبعاد غير مرئية باتباع تعليمات لغوية طبيعية. وبينما تستخدم الأساليب الحديثة القائمة على النماذج اللغوية الكبيرة (LLMs) الاستدلال الصريح (مثل سلسلة الأفك - Chain-of-Thought) لتحسين فهم التعليمات والربط الدلالي، إلا أنها تعاني من تأخير كبير في مرحلة اتخاذ القرار. ينشأ هذا التأخير لأن التوليد التكراري (autoregressive generation) عند كل خطوة ملاحة يراكم وقتاً طويلاً، يذهب الكثير منه سدى (على سبيل المثال، إعادة صياغة المدخلات بشكل متكرر أو التنسيق العام). التحدي المركزي الذي يتم معالجته هو كيفية الحفاظ على مسار قرار منخفض التأخير مع استدعاء الاستدلال التوليدي المكلف فقط عند الحاجة لاتخاذ قرارات غير مؤكدة.
المنهجية يقترح المؤلفون VerNav، وهو إطار عمل يعتمد على "المُحقِّق أولاً" (verifier-first) مصمم لتقليل زمن التأخير مع الحفاظ على أداء الملاحة. يتكون النظام من ثلاثة مكونات أساسية:
1. واجهة الإجراءات القائمة على المُحقِّق أولاً: بدلاً من توليد الاستدلال والإجراءات بشكل تكراري، يستخدم VerNav مُحقِّقاً لتقييم الإجراءات (action-scoring verifier). عند كل خطوة زمنية، يبني النظام مجموعة استعلامات مجمعة (batched set)، بواقع استعلام واحد لكل إجراء مرشح قابل للتنفيذ. يقوم المُحقِّق، المشروط بالتعليمات، وسجل الملاحة، والملاحظات البصرية (المحولة إلى نص)، بإخراج درجة ثنائية "نعم" أو "لا" (logit) تشير إلى ما إذا كان الإجراء يساعد في إتمام المهمة. يتم اختيار الإجراء الذي يحصل على أعلى درجة "نعم". هذا التحقق المجمع يستبدل التوليد لكل خطوة، مما يقلل وقت الاستدلال بشكل جذري.
2. إطار التعاون القائم على الإنتروبيا (Entropy-Based Collaboration): لمعالجة الفجوة في الأداء بين التحقق الخام والتوليد الكامل، يقدم VerNav مولداً تكيفياً ينتج أدلة حالة مدمجة (تلخص الإشارات البصرية-الدلالية والتقدم في المسار) فقط عندما يكون المُحقِّق غير متأكد.
آلية التشغيل: يحسب النظام الإنتروبيا المعيارية لدرجات الإجراءات المرشحة للمُحقِّق. تشير الإنتروبيا العالية إلى أن المُحقِّق يفتقر إلى تفضيل واضح بين المرشحين (وهو ما يحدث غالباً في الحالات المعقدة أو عندما يخرج الوكيل عن المسار).
التدفق التكيفي: إذا تجاوزت الإنتروبيا حداً معيناً، يتم استدعاء المولد التكيفي لإنتاج دليل الحالة (zt). يتم تغذية هذا الدليل مرة أخرى في استعلام التحقق لإعادة التقييم. إذا كانت الإنتروبيا منخفضة، يستمر النظام في مسار "المُحقِّق فقط" الأصلي، متجنباً التوليد غير الضروري.
3. محاذاة المُحقِّق على مرحلتين: لضمان توافق درجات المُحقِّق مع تفضيلات الملاحة، يقترح المؤلفون مخطط تدريب من مرحلتين:
المحاذاة الثابتة (تحسين تفضيل المُحقِّق - VPO): مستوحى من تحسين التفضيل المباشر (DPO)، تقوم هذه المرحلة بتدريب المُحقِّق على أزواج الإجراءات (المختارة مقابل المرفوضة) ضمن نفس سياق القرار. وهي تشجع المُحقِّق على تخصيص درجات أعلى للإجراءات التي تتبع المسار المحدد أو التي تعالج الانحرافات.
التحسين الديناميكي (الضبط الدقيق للخطوة عبر التعلم التعزيزي - RFT): بما أن الملاحة مهمة طويلة الأمد، فإن المحاذاة الثابتة غير كافية. تقوم هذه المرحلة بتحسين المُحقِّق بناءً على عمليات التدحرج (rollouts) المستحثة بالسياسة باستخدام مكافآت كثيفة على مستوى الخطوة. تعتمد المكافآت على التقدم المحلي (مثل تقليل المسافة إلى الهدف، اكتشاف معالم جديدة) وتفرض عقوبات على الحلقات المكررة (زيارة نقاط النظر مجدداً)، مدمجة مع مزايا النجاح على مستوى الحلقة (episode-level).
المساهمات الرئيسية
واجهة منخفضة التأخير قائمة على المُحقِّق أولاً: صياغة اختيار الإجراء في VLN كعملية تحقق مجمعة على المرشحين القابلين للتنفيذ، مما يوفر مسار قرار أسرع بعدة مراتب من التوليد التكراري.
التعاون القائم على الإنتروبيا: آلية تنسق بين مُحقِّق ومولد تكيفي، حيث تستدعي المولد فقط للقرارات ذات الإنتروبيا العالية (غير المؤكدة) لتوفيد دليل حالة مدمج.
محاذاة المُحقِّق الثابتة والديناميكية: خط تدريب يجمع بين VPO للمحاذاة المحلية لتفضيل الإجراء، والضبط الدقيق للتعلم التعزيزي على مستوى الخطوة للتحسين الدينماكي على مستوى المسار.
تقييم الكفاءة والأداء: إثبات تجريبي بأن الإطار يحقق أداء ملاحة تنافسي مع تقليل زمن التأخير بشكل كبير.
النتائج التجريبية أُجريت التجارب على معيار Room-to-Room (R2R) (تقسيمات val-seen و val-unseen) باستخدام نموذج Qwen2.5-3B كقاعدة أساسية.
تقليل زمن التأخير: يحقق مسار قرار "المُحقِّق فقط" في VerNav متوسط زمن تأخير في مرحلة القرار يبلغ 0.08 ثانية لكل خطوة. ويمثل هذا انخفاضاً بأكثر من 10 أضعاف مقارنة بطرق VLN المعتمدة على LLM التكرارية الممثلة (مثل NavCoT بـ 0.98 ثانية، وNavGPT بـ 3.52 ثانية، وDiscussNav بـ 21.13 ثانية).
أداء الملاحة:
في R2R val-unseen، يحقق نموذج VerNav المدرب باستخدام VPO وRFT معدل نجاح (SR) قدره 39.63% ومعدل نجاح مرجح بطول المسار (SPL) قدره 34.13%. هذا الأداء تنافسي مع الوكلاء المعتمدين على LLM المتطورين (مثل NavCoT: 40.23% SR؛ NavGPT: 34% SR).
في R2R val-seen، يحقق النموذج SR بنسبة 43.10%.
تحليل المكونات:
تأثير التدريب: الانتقال من مُحقِّق خام (0.38% SR) إلى VPO (37.25% SR) ثم إضافة RFT (39.63% SR) يوضح ضرورة المحاذاة على مرحلتين.
التوليد التكيفي: يظهر التحليل أن محفز الإنتروبيا يركز بنجاح استدعاءات المولد على المسارات الصعبة (المسارات الفاشلة تظهر إنتروبيا أعلى واستدعاءات أكثر). إضافة أدلة الحالة لهذه الخطوات غير المؤكدة يحسن SR بمقدار 6.0 إلى 8.0 نقاط مئوية مقارنة بمسار "المُحقِّق فقط".
الأهمية تزعم الورقة أن VerNav توفر مساراً عملياً نحو ملاحة منخفضة التأخير تعتمد على LLM. ومن خلال فصل واجهة القرار عن التوليد التكراري الكامل، تثبت الورقة أن الملاحة عالية الأداء لا تتطلب استدلالاً مكلفاً في كل خطوة. بدلاً من ذلك، فإن نهج "المُحقِّق أولاً"، المعزز بتوليد أدلة انتقائي محفز بالإنتروبيا ومحاذاة تدريبية متخصصة، يمكنه تحقيق نتائج تنافسية مع تقليل هائل في العبء الحسابي. وهذا يتحدى الافتراض السائد بأن التوليد الصريح للاستدلال خطوة بخطوة ضروري للملاحة الفعالة (VLN)، مما يشير إلى أن الاختيار القائم على التحقق هو بديل فعال وقابل للتطبيق.