← أحدث الأبحاث
🤖 machine learning

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

تقدم هذه الورقة تقييماً شاملاً وواقعياً لخمسة من نماذج الملاحة البصرية المتطورة عبر بيئات ومنصات روبوتية متنوعة، كاشفةً أنه على الرغم من معدلات النجاح العالية، فإن هذه النماذج تعاني من تصادمات متكررة، وارتباك إدراكي في الإعدادات المتكررة، وتدهور في الأداء تحت تأثير تغير التوزيعات، مما يسلط الضوء على الحاجة إلى مقاييس تقييم تتجاوز مجرد الوصول إلى الهدف.

المؤلفون الأصليون: Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

نُشر 2026-03-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيف يجد طريقه من الباب الأمامي إلى المطبخ، ولكن مع شرط واحد: الروبوت ليس لديه خريطة، ولا نظام تحديد مواقع (GPS)، ولا ذاكرة للمنزل. ليس لديه سوى كاميرا فقط. تعليمه الوحيد هو: "هذه صورة للمطبخ. اذهب إلى هناك."

هذا هو تحدي نماذج الملاحة البصرية (VNMs). وهي أنظمة ذكاء اصطناعي متقدمة مصممة لتعلم كيفية المشي أو القيادة من خلال مشاهدة آلاف الفيديوهات لروبوتات أخرى وهي تقوم بنفس المهمة. إنها تعد بأن تكون بمثابة "خرائط جوجل" للمستقبل، قادرة على التنقل في أي مكان بمجرد رؤية صورة للوجهة.

ولكن السؤال الكبير الذي طرحه مؤلفو هذه الورقة البحثية هو: هل تعمل هذه الروبوتات حقاً في العالم الحقيقي، أم أنها بارعة فقط في اجتياز الاختبارات؟

التجربة الكبرى: اختبار طريق في العالم الحقيقي

لم يكتفِ الباحثون بتشغيل عمليات محاكاة على جهاز كمبيوتر. بل أخذوا خمسة "أدمغة" روبوتية ذكية مختلفة (النماذج) ووضعوها على جسمين مختلفين للروبوت (روبوت مجنزر يشبه الدبابة وروبوت رباعي الأرجل يشبه الكلب). ثم أرسلوهم إلى خمسة مواقع مختلفة في العالم الحقيقي:

  1. ممر بسيط.
  2. درج (مع وجود درجين متطابقين تماماً).
  3. مكتب مزدحم ومشتت.
  4. ساحة كبيرة بها العديد من الأبواب المتشابهة.
  5. موقف سيارات مغطى بالثلوج (بيئة جديدة كلياً وقاسية).

كما ألقوا ببعض "الحيل"، مثل تشويش عدسة الكاميرا أو إعماء الروبوت بوهج الشمس، لمعرفة ما إذا كان بإمكان الروبوتات التعامل مع الطقوس السيئة أو الحركة السريعة.

النتائج: تقرير "تعليم القيادة"

وجد الباحثون أنه على الرغم من أن نماذج الذكاء الاصطناعي هذه مثيرة للإعجاب، إلا أن لديها بعض مشاكل "السائق المبتدئ" الخطيرة. إليكم ما اكتشفوه، باستخدام بعض التشبيهات البسيطة:

1. مشكلة "الماشي الأعمى" (تجنب الاصطدام)

المشكلة: حتى أكثر الروبوتات تطوراً، المبنية بهياكل "أدمغة" معقدة (مثل نماذج Transformer و Diffusion)، استمرت في الاصطدام بالأشياء.
التشبيه: تخيل شخصاً ذكياً للغاية يمكنه تسميع القاموس بأكره، ولكنه عندما يمشي في ممر، يستمر في الاصطدام بالجدرب لأنه لا يفهم أن الجدران أجسام صلبة.
النتيجة: كانت الروبوتات رائعة في اتباع مسار ما، لكنها كانت سيئة جداً في فهم الهندسة. لم "ترَ" الكرسي أو إطار الباب كعائق؛ بل رأته فقط كجزء من الصورة. لقد احتاجت إلى نظام سلامة منفصل وأبسط لإيقافها عن الاصطدام.

2. "حيرة التوأم" (التعرف على الهدف)

المشكلة: عندما كانت البيئة تحتوي على معالم متكررة (مثل ممر طويل به أبواب متطابقة أو درجين متطابقين)، كانت الروبوتات تضل طريقها.
التشبيه: تخيل أنك تبحث عن منزل صديقك. لديك صورة لباب منزله. تمشي في شارع به 50 منزلاً متطابق الشكل. تتوقف عند أول منزل يشبه الصورة، رغم أنه المنزل الخطأ.
النتيقة: لم تستطع الروبوتات التمييز بين "هذا يشبه الهدف" وبين "هذا هو الهدف بالفعل". كانت تصاب بالحماس، وتظن أنها وصلت، ثم تتوقف في المكان الخطأ.

3. "صدمة الثلج" (التعميم)

المشكلة: عندما نُقلت الروبوتات من مكتب مشمس إلى موقف سيارات مغطى بالثلوج، انخفض أداؤها.
التشبيه: تخيل طالباً حفظ كل الإجابات لاختبار رياضيات تم إجراؤه في مكتبة هادئة. إذا نقلتهم إلى موقع بناء صاخب وعاصف لإجراء نفس الاختبار، فسوف يتجمدون في مكانهم. التغيير في البيئة (الثلج، الضوء، الملمس) أربك "أدمغتهم".
النتيجة: كلما كان دماغ الروبوت أكثر تعقيداً، زادت معاناته عندما يتغير العالم. ومن المثير للدهشة أن نموذجاً أقدم وأبسط (GNM) تعامل مع الثلج بشكل أفضل من النماذج الجديدة والمتطورة.

"الخلطة السرية" (ما تعلموه)

تخلص الورقة البحثية إلى ثلاث دروس رئيسية لمستقبل ملاحة الروبوتات:

  1. التعقيد ليس كل شيء: مجرد امتلاك الروبوت لدماغ "كمبيوتر خارق" لا يعني أنه أكثر ذكاءً. أحياناً، يعمل الدماغ الأبسط (مثل نموذج GNM) بشكل جيد، أو حتى بشكل أفضل، لأنه أقل ارتباكاً بالضجيج.
  2. نحن بحاجة إلى "فيديوهات تدريبية" أفضل: فشلت الروبوتات في تجنب الاصطدامات لأن الفيديوهات التي تعلمت منها لم تعرض أمثلة كافية لروبوتات تصطدم وتتعافى. الأمر يشبه تعليم شخص القيادة فقط في طرق فارغة؛ لن يعرف ماذا يفعل عندما تقطعه سيارة أمامه. نحن بحاجة لإظهار الحوادث لهم ليتعلموا كيفية تجنبها.
  3. نحن بحاجة إلى اختبارات أفضل: الطريقة القديمة لاختبار الروبوتات كانت تكتفي بالسؤال: "هل وصلوا إلى الهدف؟" (نعم/لا). تجادل هذه الورقة بأننا بحاجة للسؤال: "هل اصطدموا؟ هل ضلوا الطريق؟ هل بدا عليهم الارتباك؟". نحن بحاجة لقياس جودة الرحلة، وليس فقط الوصول إلى الوجهة.

الخلا الخطوط العريضة

نماذج الملاحة البصرية هي بداية واعدة، تشبه طفلاً يتعلم المشي. يمكنهم اتخاذ خطوات، لكنهم يتعثرون بأقدامهم، ويصابون بالحيرة أمام الغرف المتطابقة، ويصابون بالذعر عندما يتغير الطقس.

ويعد المؤلفون بنشر بياناتهم وأكوادهم البرمجية لكي يتمكن علماء آخرون من مساعدة هذه الروبوتات على النضوج، وتعلم تجنب الجدران، والملاحة أخيراً في العالم الحقيقي دون الحاجة إلى إمساك يد بشرية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →