← أحدث الأبحاث
💻 computer science

GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System

يُعد GoalVLM إطار عمل للملاحة التعاونية متعددة الوكلاء، تعتمد على التعرف الصفري (zero-shot) والمفردات المفتوحة (open-vocabulary)، حيث يدمج نماذج الرؤية واللغة (Vision-Language Models)، وSAM3، وSpaceOM لتمكين الوكلاء من تفسير أهداف لغوية حرة الشكل والملاحة نحو أجسام جديدة دون الحاجة إلى تدريب خاص بالمهمة.

المؤلفون الأصليون: MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

نُشر 2026-03-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك في منزل ضخم وغير مألوف مع صديق لك، ومعك قائمة تسوق محددة وغريبة جداً: "ابحث عن محمصة خبز حمراء، ثم دب أزرق، ثم مصباح عتيق". ليس لديك خريطة، ولم ترَ هذا المنزل من قبل.

معظم الروبوتات اليوم تشبه الأشخاص الذين يعرفون فقط كيفية العثور على الأشياء التي حفظوها. إذا طلبت منهم "محمصة خبز"، سيعرفون ما هي. ولكن إذا طلبت منهم "مصباحاً عتيقاً" أو "دباً"، فسيصابون بالارتباك لأنهم تدرّبوا فقط على قائمة ثابتة من 10 أشياء شائعة.

الهدف (GoalVLM) هو فريق جديد من الروبوتات المصممة لحل هذه المشكلة. وإليك كيف يعمل، مشروحاً عبر تشبيهات بسيطة:

1. الفريق: مستكشفان بعقل مشترك

بدلاً من روبوت واحد يتجول وحيداً، يستخدم GoalVLM عميلين (روبوتين) يعملان معاً.

  • التشبيه: فكر في الأمر كأنهم متزلجون في غابة. لديهم جهاز لاسلكي. إذا رأى المتزلج (أ) مساراً، فإنه يخبر المتزلج (ب): "لا تذهب إلى هناك، أنا أتفقد ذلك المسار". وإذا وجد المتزلج (ب) مساحة مفتوحة، فإنه يخبر المتزلج (أ).
  • الفائدة: من خلال مشاركة ما يرونه في الوقت الفعلي، فإنهم يغطون "المنزل" (البيئة) بأكمله بشكل أسرع بكثير ولا يضيعون الوقت في المشي في دوائر أو فحص نفس الغرفة مرتين.

2. العيون: "المترجم العالمي" (SAM3)

كانت الروبوتات القديمة تحتاج إلى قاموس من كلمات محددة للتعرف على الأشياء. يستخدم GoalVLM ذكاءً اصطناعياً فائق الذكاء يسمى SAM3 (نموذج رؤية-لغة).

  • التشبيه: تخيل أنك تنظر إلى صورة ويمكنك أن تسأل: "أين الشيء الذي يشبه المهرج الحزين؟" أو "ابحث عن الصندوق المعدني اللامع". SAM3 يشبه صديقاً شديد الملاحظة لا يحتاج إلى قاموس. إنه يفهم أي وصف تقدمه له باللغة الإنجليزية البسيطة. يمكنه رصد "عربة تسوق"، أو "كرسي رمادي"، أو "شجرة عيد الميلاد" حتى لو لم يسبق له رؤيتها من قبل.
  • السحر: هو لا يخمن فحسب؛ بل يرسم تحديداً دقيقاً حول الشيء الذي يجده، مثل قلم التحديد (الهايلايتر).

3. الخريطة: "رؤية من منظور الطائر"

الروبوتات لا تنظر إلى الأرض فحسب؛ بل تبني خريطة ذهنية من الأعلى.

  • التشبيه: تخيل أن الروبوت يلتقط صورة للغرفة، ثم يقوم بسحرها وتحويلها إلى خريطة ثنائية الأبعاد مسطحة على الأرض، مثل خريطة ألعاب الفيديو. إنه يسقط كل ما يراه (الكراسي، الجدران، الشيء الذي طلبته) على هذه الخريطة المسطحة.
  • "جهاز عرض الهدف" (Goal Projector): عندما يرى الروبوت "عربة تسوق" في صورة، فإنه لا يكتفي بالقول "أنا أراها". بل يحسب بدقة مكان تلك العربة على الخريطة المسطحة، حتى لو كان الروبوت بعيداً عنها. وهذا يساعد الروبوت على معرفة أين يسير بالضبط.

4. العقل: "المحقق ذو المنطق السليم" (SpaceOM)

هذا هو الجزء الأكثر ذكاءً. الروبوت لا يتجول عشوائياً، بل يستخدم "محققاً ذا منطق سليم" (SpaceOM) لتخمين أين قد توجد الأشياء.

  • التشبيه: إذا طلبت من الروبوت البحث عن "ميكروويف"، سيفكر الروبوت: "هممم، الميكروويف عادة ما يكون في المطابخ، وليس في الحمام أو غرفة النوم".
  • الاستراتيجية: بدلاً من فحص كل غرفة، يستخدم الروبوت هذا المنطق السليم لإعطاء الأولوية لفحص المطبخ أولاً. إنه يصنف "الحدود" (حواف المناطق غير المعروفة) بناءً على مدى احتمالية احتواء هذه المناطق على الشيء المطلوب.

5. الرحلة: "نظام GPS مع طريق بديل"

بمجرد أن يعرف الروبوت إلى أين يتجه، فإنه يستخدم نظام ملاحة يسمى طريقة المشي السريع (Fast Marching Method).

  • التشبيه: هذا يشبه نظام GPS الذي يرسم أسرع خط ممكن حول الأثاث للوصول إلى الوجهة. فهو يتجنب الاصطدام بالكراسي والجدران أثناء توجهه نحو "عربة التسوق" أو "المصباح".

ما مدى جودة عمله؟

اختبر الباحثون هذا النظام على مجموعة بيانات رقمية ضخمة تسمى GOAT-Bench، وهي تشبه لعبة فيديو معقدة للغاية تحتوي على مئات الغرف والأشياء المختلفة.

  • النتي نتيجة: نجح GoalVLM في العثัง الأشياء بنسبة 55.8% من المرات.
  • لماذا يعد هذا أمراً مثيراً للإعجاب؟ معظم الروبوتات الأخرى التي لا تحتاج إلى تدريب (Zero-Shot) تحقق نسبة نجاح تتراوح بين 16-29% فقط. إن GoalVLM يقترب من ضعف تلك النسبة!
  • العيب: ليس مثالياً. إذا كان الشيء لامعاً جداً (مثل المرآة) أو صغيراً جداً (مثل صورة على طاولة)، فقد يرتبك الروبوت أحياناً لأن الكاميرا لا تستطيع رؤيته بوضوح. أيضاً، ولأنه يجب عليه الاستكشاف للعثور على الأشياء، فإنه يسلك مساراً أطول قليلاً من الروبوت الذي حفظ المنزل بالكامل.

الاختبار في العالم الحقيقي

لم يكتفِ الفريق باختبار هذا في جهاز كمبيوتر، بل وضعوا النظام على طائرتين بدون طيار (Drones) حقيقيتين تطيران في مختبر حقيقي.

  • النتيجة: نجحت الطائرات بدون طيار في استخدام كاميراتها للعثور على أشياء حقيقية مثل حقائب السفر وعربات التسوق وبناء الخريطة في الوقت الفعلي. وهذا يثبت أن النظام ليس مجرد خدعة في لعبة فيديو؛ بل إنه يعمل في العالم الحقيقي.

الملخص

GoalVLM يشبه منح فريق من الروبوتات قوة خارقة: القدرة على فهم لغة البشر، واستخدام المنطق السليم لتخمين مكان الأشياء، والعمل معاً للعثور على أي شيء تطلبه، حتى لو لم يسبق لهم رؤيته من قبل. إنها خطوة كبيرة نحو روبوتات يمكنها حقاً مساعدتنا في منازلنا دون الحاجة إلى إعادة تدريبها لكل شيء جديد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →