← أحدث الأبحاث
💻 computer science

Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs

تقدم هذه الورقة إطار عمل موحداً يعتمد على التعلم الصفري (zero-shot) لرسم خرائط الطرق الوعرة، والذي يستفيد من نموذج SAM2 للتقطيع (segmentation) ونموذج رؤية-لغة للاستدلال حول المناطق القابلة للقيادة باستخدام التلميحات البصرية، مما يلغي الحاجة إلى نماذج تضاريس منفصلة ومخصصة لمهام معينة مع تحقيق أداء يضاهي أحدث ما توصل إليه العلم والملاحة كاملة الحزمة.

المؤلفون الأصليون: Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji

نُشر 2026-04-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية قيادة سيارة عبر غابة برية غير مستكشفة. لا توجد طرق، ولا لوحات إرشادية، ولا خرائط GPS. الأرض عبارة عن مزيج فوضوي من الطين، والصخور، والرمال، والعشب.

الطريقة القديمة: الفريق المتخصص
تقليديًا، لجعل الروبوت يفعل ذلك، كان على المهندسين توظيف فريق كامل من المتخصصين:

  • روبوت (أو ذكاء اصطناائي) واحد ينظر إلى الأرض ويقول: "هذا طين".
  • آخر يقيس مدى انحدار التل.
  • ثالث يخمن ما إذا كانت الإطارات ستنزلق على الرمال.
  • رابع يحسب درجة الميل.

يتعين عليك تدريب كل واحد من هؤلاء المتخصصين بشكل منفصل باستخدام آلاف الصور. وإذا واجه الروبوت نوعًا جديدًا من التضاربات لم يره من قبل، فقد يرتبك الفريق بأكمله. الأمر يشبه محاولة التنقل في بلد أجنبي من خلال استئجار مترجم لكل كلمة تسمعها، بدلًا من فهم اللغة ككل.

الطاليب الجديدة: "المحقق الذكي"
يقدم هذا البحث نهجًا أكثر ذكاءً وبساطة. بدلًا من توظيف فريق من المتخصصين، فإنهم يمنحون الروبوت محققًا واحدًا فائق الذكاء (نموذج رؤية ولغة - VLM) يمكنه "الرؤية" و"التفكير" في نفس الوقت.

إليك كيف يعمل نظامهم، خطوة بخطوة، باستخدام تشبيه بسيط:

1. "قلم التحديد السحري" (SAM2)

أولاً، يلتقط الروبوت صورة للغابة. يستخدم أداة تسمى SAM2 (نموذج التجزئة الشاملة). فكر في هذا كقلم تحديد سحري يقوم فورًا بتلوين كل جسم متميز في الصورة بلون مختلف ويضع عليه رقمًا.

  • كومة الصخور تحصل على تحديد أحمر والرقم "1".
  • المسار الرملي يحصل على تحديد أزرق والرقم "2".
  • العشب الطويل يحصل على تحديد أخضر والرقم "3".

2. "إيجاز المحقق" (الـ VLM)

الآن، يعرض الروبوت الصورة على المحقق الذكي (الـ VLM). لكنه لا يعرض له الصورة الخام فقط، بل يعرض له "كولاج" (تجميعة): الصورة الأصلية بجانب النسخة "المحددة" بالألوان والأرقام.

ثم يطرح الروبوت سؤالًا بسيطًا على المحقق باللغة الإنجليزية العادية:

"مهلاً، بالنظر إلى هذه البقع المرقمة، أي منها آمن لسيارة لتقود عليه؟ تذكر أن التراب، والرمل، والحصى مقبولة، لكن الصخور والطين العميق ليست كذلك. فقط أخبرني بالأرقام."

3. "لحظة الإدراك!" (الاستنتاج)

هذا هو الجزء السحري. المحقق لا يكتفي بمطابقة الكلمات بالصور، بل يستنتج.

  • ينظر إلى البقعة رقم 3 (العشب) ويفكر: "همم، يبدو هذا كمستنقع كثيف ورطب. قد تغرز السيارة فيه. سأتخطاه."
  • ينظر إلى البقعة رقم 2 (الرمل) ويفكر: "هذا يبدو كمسار جاف ومتماسك. يمكن القيادة عليه."
  • ينظر إلى البقعة رقم 1 (الصخور) ويفكر: "وعرة جدًا، لا تصلح."

ثم يرد المحقق: "قد بالرقم 2."

4. "عجلة القيادة" (التخطيط والتحكم)

بمجرد أن يعرف الروبوت أي الأرقام آمنة، فإنه يرسم خريطة على شبكة. يستخدم مخططًا يشبه نظام تحديد المواقع (GPS) لرسم خط من مكانه إلى حيث يحتاج للوصة، ملتزمًا فقط بالأرقام "الآمنة". أخيرًا، تتولى وحدات التحكم في التوجيه والسرعة مهمة قيادة السيارة فعليًا على طول ذلك الخط.

لماذا يعد هذا أمرًا بالغ الأهمية؟

  • لا يتطلب واجبات منزلية: الطريقة القديمة كانت تتطلب تدريب الروبوت على ملايين الصور المحددة للطين، والرمال، والصخور. هذه الطريقة الجديدة تستخدم نهج "Zero-shot" (التعلم من دون تدريب مسبق). إنه يشبه إعطاء المحقق كتابًا عن "المنطق العام" حول العالم؛ لست بحاجة لإظهار صورة لكل تشكيل صخري ممكن له، فهو يستخدم معرفته العامة ليفهم الأمر.
  • عقل واحد، وليس عقولًا متعددة: بدلًا من التعامل مع خمسة نماذج ذكاء اصطناعي مختلفة، يستخدمون نظامًا واحدًا موحدًا يرى ويفكر معًا.
  • يعمل في المحاكاة: اختبر الفريق النظام في عالم فيديو عالي التقنية (Isaac Sim) يشبه العالم الحقيقي تمامًا. نجح الروبوت في القيادة إلى أهداف مختلفة، مما أثبت أن "المحقق" يمكنه تحديد المسار.

العقبة

النظام ليس مثاليًا بعد. أحيانًا يرتبك المحقق إذا كانت التضاريس تبدو معقدة (مثل حفرة صغيرة تبدو وكأنها طريق). وأيضًا، نظرًا لأن المحقق "يفكر" بلغة، فإنه يستغرق وقتًا أطول قليلاً لاتخاذ القرار مقارنة بآلة حاسبة بسيطة. لكن الباحثين وجدوا طريقة لجعله سريعًا بما يكفي للقيادة في الوقت الفعلي.

باختًا:
لقد استبدلوا فريقًا من الروبوتات المتخصصة والجامدة بروبوت واحد مرن ومفكر، يمكنه النظر إلى غابة فوضوية، وفهم ما هو آمن للقيادة عليه، وتحديد المسار — وكل ذلك عبر طرح سؤال بسيط على ذكاء اصطناعي ذكي باللغة الإنجليزية. إنها قفزة هائلة نحو روبوتات يمكنها استكشاف البراري دون الحاجة إلى تعليمها كل قاعدة من صنع البشر أولًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →