RTNav: Towards Real-Time Zero-Shot Object Navigation
تقدم الورقة البحثية RTNav، وهي بنية ملاحة في الوقت الفعلي تأخذ في الاعتبار صراحةً زمن انتقال الاستدلال والخطوات البيئية غير المتزامنة للتغلب على تدهور الأداء لطرق الملاحة الكائنية ذات الصفرية (zero-shot) الحالية تحت قيود زمنية واقعية، محققةً تحسينات كبيرة في معدلات النجاح في اختبارات HM3D.
تخيل روبوتًا أُرسل إلى منزل غير مألوف للعثور على جسم محدد، مثل كوب أحمر، دون أي تدريب مسبق على تلك الغرفة تحديدًا. لكي ينجح، يجب على الروبوت أن يتطلع حوله، ويفهم ما يراه، ويقرر أين سيذهب بعد ذلك، ويحرك عجلاته أو أرجله، كل ذلك بينما يستمر العالم من حوله في التغير. هذا هو تحدي الملاحة في الأجسام عبر "التعلم الصفري": استخدام الذكاء الاصطناዊ القوي لتوجيه آلة عبر المجهول. لسنوات، اختبر الباحثون هذه الأنظمة في محاكاة حاسوبية حيث يتوقف العالم الافتراضي مؤقتًا بينما "يفكر" عقل الروبوت. في هذه الحالة المجمدة، يمكن للروبوت أن يستغرق كل الوقت الذي يحتاجه لمعالجة صورة أو اتخاذ قرار، ولا يتحرك عقرب الساعة. لقد سمح هذا الإعداد للعلماء ببناء وكلاء ملاحة أكثر تعقيدًا وقدرة، لكنه يخفي عيبًا جوهريًا. ففي العالم الحقيقي، لا يتوقف الزمن أبدًا. وبينما يقوم الروبوت بحساب خطوته التالية، تمر ثوانٍ، ويقف الروبوت بلا حراك، وتتقلص ميزانية المهمة — أي الوقت المسموح به لإنهاء العمل. إذا استغرق الروبوت وقتًا طويلاً في التفكير، فلن يتمكن ببساطة من إكمال المهمة، بغض النظر عن مدى ذكاء منطقه.
لقد كشف فريق من الباحثين في جامعة ديوك الآن عن هذه التكلفة الخفية واقترحوا طريقة جديدة لبناء أنظمة ملاحة تحترم عقارب الساعة التي لا تتوقف. وجدوا أن أكثر وكلاء الملاحة تقدمًا، والتي تعتمد على نماذج ذكاء اصطناعي ضخمة وقوية لفهم اللغة والرؤية، تعاني من انخفاض حاد في الأداء عندما تُجبر على العمل في الوقت الفعلي. في دراستهم، أنشأوا بيئة اختبار جديدة حيث تعمل المحاكاة بشكل مستمر، تمامًا مثل غرفة حقيقية، بينما يعمل كمبيوتر الروبوت لاتخاذ قراره التالي. وعندما قاموا بتشغيل طرق الملاحة القياسية في هذا الإعداد، أصبحت الوكلاء بطيئة وغير فعالة. إن الوقت المستغرق في انتظار انتهاء الكمبيوتر من حساباته يعني أن الروبوت يقضي جزءًا كبيرًا من وقته واقفًا بلا حراك، وغالبًا ما يفقد الفرص للوصول إلى هدفه قبل انتهاء الوقت. وقد قاس الباحثون ذلك باستخدام مقي('%') جديد يكافئ ليس فقط العثور على الجسم، بل القيام بذلك بسرعة، مع معاقبة أي ثوانٍ مهدرة.
ولحل هذه المشكلة، قدم الفريق بنية جديدة تسمى RTNav، والتي تعامل تدفق الوقت كجزء أساسي من التصميم وليس مجرد فكرة لاحقة. بدلًا من إجبار الروبوت على التوقف والانتظار لكل جزء من أجزاء دماغه لينهي فكرة واحدة قبل التحرك، تسمح RTNav لأجزاء مختلفة من النظام بالعمل بسرعاتها الطبيعية الخاصة. فالجزء من النظام الذي يكتشف الأجسام يعمل باستمرار، ماسحًا البيئة مرات عديدة في الثانية. والجزء الذي يخطط للمسار يعمل بوتيرة أقل تكرارًا، حيث يتحدث فقط عند الضرورة. أما الجزء الذي يتحكم في العجلات فيتحرك باستمرار، مستجيبًا لآخر خطة دون انتظار اكتمال خطة جديدة. هذا يشبه كيف يسير الإنسان في شارع مزدحم: أنت لا تتوقف تمامًا لتفكر في كل خطوة؛ بل تستمر في الحركة بينما تمسح عيناك العقبات ويقوم عقلك بتحديث مسارك. ومن خلال السماح لهذه العمليات بالحدوث بالتزامن بدلاً من اتباع خط مستقيم صارم، يظل الروبوت في حالة حركة ويستخدم وقته بكفاءة.
كانت نتائج هذا النهج مذهلة. فعند اختبارها على معايير الملاحة القياسية، تفوق النظام الجديد على الطرق السابقة بشكل ملحوظ. وفي الاختبارات التي كان على الروبوت فيها العثور على أجسام في بيئات معقدة متعددة الغرف، حسن النظام الجديد معدل النجاح بنسبة تصل إلى 11 بالمائة مقارنة بأفضل الطرق الموجودة. والأهم من ذلك، أنه أكمل المهام بشكل أسرع بكثير. فقد قاس الباحثون مقياسًا يسمى "النجاح الموزون بوقت الإنجاز"، والذي يجمع بين نجاح الروبوت في العثور على الجسم والوقت الذي استغرقه. سجل النظام الجديد نقاطًا أعلى بنسبة تصل إلى 5.1 نقطة في هذا المقياس، مما يشير إلى أنه لم يكن أكثر نجاحًا فحسب، بل كان أيضًا أكثر كفاءة بكثير. وأظهرت الدراسة أن الطرق القديمة، التي صُممت لعالم المحاكاة المجمد، أهدرت قدرًا كبيرًا من الوقت في انتظار انتهاء الحسابات. في المقابل، حافظ النظام الجديد على حركة الروبوت، مما قلل من الوقت الذي يقضيه في حالة الخمول بأكثر من 14 بالمائة مقارنة بمنافسيه.
كما اختبر الباحثون مدى قوة هذا النظام من خلال تشغيله على أنواع مختلفة من أجهزة الكمبيوتر، بدءًا من بطاقات رسومات سطح المكتب القوية وصولًا إلى الرقائق الأصغر والأكثر كفاءة في استهلاك الطاقة والمصممة للأجهزة الطرفية. عمل النظام بشكل متسق جيدًا عبر جميع هذه الأجهزة، محافظًا على معدلات نجاح عالية حتى عند تقليل قدرة الحوسبة. وهذا يشير إلى أن التصميم مرن بما يكفي للعمل على روبوتات متنوعة دون الحاجة إلى الأجهزة الأكثر تكلفة المتاحة. كما جرب الفريق أحجامًا مختلفة من نماذج الذكاء الاصطناዊ المستخدمة في التفكير، ووجدوا أنه بينما لم يكن النموذج الضخم جدًا ضروريًا، فإن النموذج متوسط الحجم وفر أفضل توازن بين السرعة والدقة، مما سمح للروبوت باتخاذ قرارات جيدة دون أن يتعثر في المعالجة البطيئة.
يسلط هذا العمل الضوء على تحول حاسم في كيفية بناء الروبوتات لعالمنا الحقيقي. إن الطريقة القديمة في الاختبار، حيث ينتظر العالم الروبوت ليفكر، لم تعد تعكس واقع النشر الفعلي. وتثبت الدراسة أنه لكي تكون الروبوتات عملية في البيئات اليومية، يجب تصميم برمجياتها للتعامل مع قيود التنفيذ في الوقت الفعلي. ومن خلال فصل المهام المختلفة للإدراك والتخطيط والحركة، والسماح لها بالعمل بالتوازي، يمكن للروبوتات أن تصبح أكثر استجابة وفعالية. ويخلص الباحثون إلى أن تجاهل تكلفة وقت الحوسبة يؤدي إلى أنظمة تبدو جيدة في المحاكاة ولكنها تفشل في الواقع. ويقدم نهجهم الجديد مسارًا للمضي قدمًا، موضحًا أنه مع البنية الصحيحة، يمكن للروبوتات التنقل في العالم المجهول بسرعة وموثوقية، محولةً الوعد النظري للذكاء الاصطناዊ إلى واقع عملي.
ملخص تقني: RTNav نحو ملاحة الكائنات في الوقت الفعلي بدون تدريب مسبق (Zero-Shot)
1. بيان المشكلة
تعتمد وكلاء الملاحة للكائنات من نوع (zero-shot) المتطورة حالياً بشكل كبير على نماذج الرؤية واللغة التأسيسية (VLMs) الضخمة لتفسير الأهداف، والتعرف على الكائنات، وتخطيط الإجراءات دون الحاجة لتدريب خاص بالمهمة. ومع ذلك، تسبب هذه النماذج تأخراً غير ضئيل في زمن الاستدلال (يتراوح من مئات الملي ثانية إلى عدة ثوانٍ).
تتمثل المشكلة الجوهرية المحددة في عدم التطابق بين بروتوكولات التقييم والنشر في العالم الحقيقي:
المقاييس المتزامنة (Synchronous Benchmarks): تعمل معايسات الملاحة القياسية (مثل Habitat) بطريقة متزامنة تعتمد على الخطوات. حيث يتوقف المحاكي وينتظر الوكيل حساب الإجراء قبل المضي قدماً في البيئة. في هذا الإعداد، يكون زمن استدلال النموذج "مجانيّاً" فعلياً، ولا تعاقب مقاييس مثل معدل النجاح (SR) والنجاح الموزون بطول المسار (SPL) اتخاذ القرارات البطيئة.
الواقع غير المتزامن (Asynchronous Reality): في النشر الواقعي، تتطور البيئة باستمرار بينما يقوم الوكيل بالحساب. يستهلك زمن استدلال النموذج وقت الساعة (wall-clock time)، مما يقلل مباشرة من قدرة الوكيل على قطع مسافات ضمن ميزانية زمنية محددة للمهمة.
النتيجة: تتعرض الوكلاء المصممة للبيئات المتزامنة لانخفاض مستمر في الأداء عند تقييمها تحت ظروف زمنية واقعية. إن سلوك "التوقف ثم الانطلاق" الناتج عن التنفيذ المتسلسل لوحدات الإدراك والاستنتاج والعمل يجعل العديد من الوكلاء القائمين على النماذج التأسيسية غير عمليين للاستخدام في الوقت الفعلي.
2. المنهجية
أ. إطار تقييم الوقت الفعلي
لتحديد تأثير زمن استدلال النموذج، قدم المؤلفون واجهة خطوة الوقت الفعلي مبنية على طبقة ROS2 فوق محاكي Habitat.
التنفيذ المنفصل (Decoupled Execution): يتقدم المحاكي بمعدل ثابت لوقت الساعة (30 هرتز) بشكل مستقل عن حسابات الوكيل.
التفاعل غير المتزامن: يعالج الوكيل الملاحظات ويحسب الإجراءات بشكل غير متزامن. إذا استغرق الإجراء δ ثانية للحساب، يستمر المحاكي في التقدم تحت الأمر السابق خلال تلك الفترة الزمنية.
المقاييس: بالإضافة إلى SR و SPL القياسيين، يستخدم المؤلفون النجاح الموزون بوقت الإنجاز (SCT)، والذي يعاقب الوكلاء الذين يستغrكون وقتاً أطول لإكمال المهمة، حتى لو كان المسار فعالاً.
ب. بنية RTNav
يقترح المؤلفون RTNav، وهي بنية نموذجية غير متزامنة مصممة للعمل تحت قيود الحوسبة وزمن الاستجلة المحدودة. على عكس الدورات التقليدية المتسلسلة حيث تملي أبطأ وحدة استجابة النظام، تسمح RTNav للوحدات بالعمل بتردداتها الطبيعية.
المكونات المعمارية الرئيسية:
ناقل الحالة المشترك (Shared State Bus): تعمل وحدات الإدراك، ورسم الخرائط، والتخطيط، والملاحة في خيوط (threads) مستقلة، وتتواصل عبر حالة مشتركة دون أن تعيق بعضها البعض.
الإدراك (تردد عالٍ):
يستخدم Owlv2 للكشف عن الكائنات مفتوحة المفردات (open-vocabulary) عالية التردد (حوالي 15 هرتز) لالتقاط الأهداف المحتملة.
يستخدم Qwen3.5-9B للتحقق الدلالي من المرشحين المكتشفين لتقليل الإيجابيات الكاذبة.
يستخدم MobileSAM للتجزئة (segmentation) لتنقية إسقاطات السحابة النقطية.
رسم الخرائط (Mapping): يحافظ على خريطة مترية ثنائية الأبعاد (العوائق، المناطق المستكشفة، الحدود/frontiers) عن طريق الإسقاط الخلفي لملاحظات RGB-D وأقنعة الأهداف.
التخطيط (مدفوع بالأحداث):
يستخدم استراتيجية استكشاف الحدود (frontier exploration) ذات الأساس الدلالي.
يتم استعلام نموذج VLM عند الضرورة فقط (على سبيل المثال، عندما تحتاج حدود معينة إلى اختيار أو عند اقتراح مرشح جديد)، بدلاً من القيام بذلك في كل دورة قرار.
يختار الـ VLM الحدود الأكثر واعدة بناءً على وصف الهدف ومشاهد المرشحين.
الملاحة: تنفذ سياسة الملاوة بالنقطة (PointNav) أوامر سرعة مستمرة. ولأنها تعمل بشكل مستقل، يستمر الروبوت في التحرك نحو آخر هدف متاح بينما تعالج الوحدات الأخرى بيانات جديدة أو تقوم بعمليات استنتاج ثقيلة.
3. المساهمات الرئيسية
بروتوكول تقييم الوقت الفعلي: تقديم واجهة تقييم تعتمد على ROS تفصل تقدم البيئة عن حسابات الوكيل، مما يسمح بتقييم الطرق الحالية تحت قيود زمنية واقعية بأقل قدر من التعديلات.
الدليل التجريبي على تأثير زمن الاستجابة: دراسة إعادة إنتاج واسعة النطاق توضح أن طرق الملاحة (zero-shot) تعاني من تدهور كبير في الأداء (انخفاض يصل إلى 38% في SR لبعض الطرق) عند الانتقال من التقييم المتزامن إلى التقييم في الوقت الفعلي.
بنية RTNav: تصميم غير متزامن مبتكر يعامل زمن استدلال النموذج ووقت الساعة كقيود تصميم صريحة، مما يسمح بالتنفيذ المتزامن للإدراك والاستنتاج والتحكم.
مكاسب الأداء: إثبات أن RTNav يتفوق بشكل كبير على الطرق السابقة المتطورة في إعدادات الوقت الفعلي، حيث يحسن معدل النجاح (SR) بنسبة تصل إلى 11%، والنجاح الموزون بوقت الإنجاز (SCT) بنحو 5.1 نقطة.
4. النتائج التجريبية
قيم المؤلفون RTNav وسبعة من الطرق المرجعية (بما في ذلك VLFM، L3MVN، OpenFMNav، Trihelper، GAMap، وBeliefMapNav) على ثلاثة معايير: HM3D-v1، HM3D-v2، و HM3D-OVON.
تدهور الأداء في النماذج المرجعية: أظهرت جميع الطرق المرجعية انخفاضاً في الأداء في وضع الوقت الفعلي مقارنة بالوضع المتزامن. عانت الطرق التي تعتمد على نماذج تأسيسية أثقل (مثل BeliefMapNav) من التدهور الأكثر حدة (على سبيل المثال، انخفض SR من 73.5% إلى 36.7% في HM3D-v2).
تفوق RTNav:
معدل النجاح (SR): حقق RTNav أعلى معدل نجاح عبر جميع المعايير، متفوقاً على أفضل نموذج مرجٍ متزمني بنسبة 6.4% (في OVON)، و10.5% (في HM3D-v1)، و9.1% (في HM3D-v2).
الكفاءة (SCT): أظهر RTNav أكبر ميزة في SCT، حيث سجل أعلى بـ 2.45 إلى 5.17 نقطة من النماذج المرجعية، مما يشير إلى إنجاز المهام بشكل أسرع بكثير.
وقت الخمول (Idle Time): قلل RTNav من وقت الخمول (الوقت الذي يقضيه الروبوت ساكناً بسبب الحوسبة أو الانتظار) بأكثر من 14% مقارنة بالنماذج المرجعية الأخرى، كما هو موضح في تحليل الجدول الزمني للتنفيذ.
المعالجة البصرية: عالج RTNav أكثر من 20 ضعف عدد إطارات الكشف الفريدة في الثانية مقارنة بالنماذج المرجعية المتزامنة، مما قلل من "الفجوات العمياء" بين عمليات الكشف.
المتانة: أظهر تحليل الحساسية أن RTNav يحافظ على أداء ثابت عبر مستويات الأجهزة المختلفة (RTX A6000، L40S، Jetson Thor) ومع أحجام مختلفة من نماذج VLM (Qwen3.5-9B مقابل Gemma4-12B)، رغم أن النماذج الأصغر (4B) أدت إلى تدهور كبير في الأداء.
5. الأهمية والادعاءات
يجادل البحث بأن الاعتماد الحالي على المعايير المتزامنة يخلق "فجوة تصميم" تبالغ في تقدير عملية وكلاء الملاحة المدفوعين بالنماذج التأسيسية.
التحول المعماري: يزعم المؤلفون أنه بالنسبة للنشر في العالم الحقيقي، يجب أن تتبنى أنظمة الملاحة التنفيذ المستمر في الوقت الفعلي والنمطية غير المتزامنة كمبادئ تصميم أساسية. لا ينبغي لأبطأ وحدة أن تملي سرعة استجابة النظام بأكمله.
العملية: من خلال التعامل مع وقت الساعة كعنصر حاسم، يثبت RTNav أنه من الممكن الاستفيد من نماذج اللغة والرؤية القوية للملاحة (zero-shot) دون التضحية بالاستجابة في الوقت الفعلي.
الاتجاه المستقبلي: يحفز هذا العمل المجتمع نحو التحول نحو تقييم الخوارزميات تحت ظروف زمنية واقعية، ويقترح أن الأبحاث المستقبلية يجب أن تمد هذه المبادئ غير المتزامنة إلى مهام تجسد (embodied tasks) أكثر ترابطاً مثل الحركة والتحكم في الأشياء.
يظل المؤلفون متواضعين فيما يتعلق بالقيود، مشيرين إلى أن دراستهم الحالية تركز على البيئات الثابتة، وأن توسيع هذه التصميمات لتشمل المشاهد الديناميكية ومهام التحكم المعقدة يظل تحدياً مفتوحاً.