← أحدث الأبحاث
💻 computer science

VLD: Visual Language Goal Distance for Reinforcement Learning Navigation

تقدم هذه الورقة مسافة الرؤية واللغة (VLD)، وهو إطار عمل قابل للتوسع يفصل بين الإدراك وتعلم السياسة من خلال تدريب متنبئ مسافة ذاتي الإشراف على بيانات فيديو بمقياس الإنترنت لتمكين الملاحة القائمة على الأهداف متعددة الوسائط والمتينة مع نقل قوي من المحاكاة إلى الواقع.

المؤلفون الأصليون: Lazar Milikic, Manthan Patel, Jonas Frey

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lazar Milikic, Manthan Patel, Jonas Frey

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يجد طريقه عبر منزل ضخم وغير مألوف للعثور على شيء محدد، مثل "محمصة خبز حمراء".

تقليديًا، هناك طريقتان رئيسيتان للقيام بذلك، وكلتاهما تعانيان من مشاكل كبيرة:

  1. طريقة "البيان والنموذج" (تعلم التقليد): تقوم بتصوير إنسان وهو يمشي نحو محمصة الخبز آلاف المرات وتخبر الروبوت: "افعل تمامًا ما فعله".
  • المشكلة: يستغرق تصوير كل تلك الفيديوهات وقتًا طويلاً جدًا، وإذا رأى الروبوت محمصة في مطبخ مختلف بإضاءة مختلفة، فسيصاب بالارتباك. الأمر يشبه حفظ خريطة لمدينة معينة بدقة، ثم تضيع بمجرد الانتقال إلى المدينة التالية.
  1. طريقة "التجربة والخطأ" (التعلم المعزز): تضع الروبوت في محاكاة لعبة فيديو وتتركه يصطدم بالجدران حتى يتعلم المسار الصحيح.
  • المشكلة: ما ينجح في لعبة الفيديو غالبًا ما يفشل في العالم الحقيقي لأن "الفيزياء" و"الإضاءة" في اللعبة ليست مثالية. الأمر يشبه تعلم القيادة في جهاز محاكاة، ثم الاصطدام فورًا بمجرد خروجك إلى طريق حقيقي.

حل الـ "VLD": البوصلة الذكية

يقدم هذا البحث إطار عمل جديدًا يسمى VLD (المسافة البصرية اللغوية - Visual Language Distance). بدلًا من تعليم الروبوت كيف يمشي أو حفظ مسارات محددة، هم يعلمون الروبوت مفهومًا بسيطًا وقويًا: "كم يبعد الهدف عني؟"

فكر في VLD كـ بوصلة سحرية لا تشير إلى الشمال، بل تشير نحو هدفك.

إليك كيف بنوا هذا النظام، مقسمًا إلى ثلاث خطوات بسيطة:

الخطوة 1: "محقق المسافة" (الإدراك)

أولاً، لم يعلم الباحثون الروبوت كيف يمشي. بدلاً من ذلك، علموا ذكاءً اصطناعيًا يسمى "محقق المسافة".

  • التدريب: قاموا بتغذية هذا المحقق بملايين الساعات من فيديوهات يوتيوب ولقطات للروبوتات من جميع أنحاء العالم. لم يخبروا المحقق ماذا يفعل؛ بل سألوه فقط: "إذا أريتك صورة لمطبخ ثم صورة لغرفة نوم، كم خطوة تعتقد أنها تفصل بينهما؟"
  • السحر: نظرًا لأنه شاهد الكثير من الفيديوهات، تعلم المحقق فهمًا عميقًا للعالم. تعلم أنه إذا رأى ممرًا، فمن المرجح أنه أقرب إلى غرفة المعيشة منه إلى الشاطئ. تعلم فهم الأهداف الموصوفة بـ النصوص (مثل "ابحث عن الكرسي الأزرق") أو الصور (صورة للكرسي).
  • المخرج: هذا المحقق لا يعطي خريطة. هو فقط يعطي رقمًا واحدًا: "أنت على بُعد 50 خطوة". ثم مع اقترابك، ينخفض الرقم إلى "40"، ثم "10"، ثم "1".

الخطوة 2: "ماشِي الروبوت" (التحكم)

بعد ذلك، قاموا بتدريب وكيل روبوت منفصل على المشي.

  • التدريب: وضعوا هذا الروبوت في محاكاة لعبة فيديو مثالية. وبدلًا من إظهار الغرفة بأكملة له، أعطوه فقط الرقم من "محقق المسافة" (على سبيل المثال: "أنت على بُود 50 خطوة").
  • الحيلة: لضمان عدم ارتباك الروبوت عندما يكون العالم الحقيقي فوضويًا، أضافوا "ضجيجًا" إلى الرقم أثناء التدريب. جعلوا الرقم يتذبذب قليلاً، مما يحاكي حقيقة أن محقق العالم الحقيقي قد يكون غير متأكد تمامًا. هذا علم الروبوت أن يكون قويًا ولا يصاب بالذعر إذا تذبذب تقدير المسافة.
  • النتيجة: تعلم الروبوت قاعدة بسيطة للغاية: "إذا انخفض الرقم، فأنا أفعل الشيء الصحيح. إذا ارتفع الرقم، فأنا أسير في الاتجاه الخاطئ". تعلم المشي ببساطة من خلال محاولة تقليل هذا الرقم.

الخطوة 3: الجمع بينهما (النشر)

الآن، يقومون بدمجهما معًا.

  • يتم وضع الروبوت في منزل حقيقي (أو محاكاة جديدة لم يسبق له رؤيتها).
  • ينظر إلى الهدف (صورة أو وصف نصي).
  • ينظر "محقق المسافة" إلى رؤية كاميرا الروبوت ويقول: "أنت على بُعد 100 خطوة".
  • يقوم "ماشِي الروبوت" بخطوة. ينظر المحقق مرة أخرى: "الآن أنت على بُعد 95 خطوة".
  • يستمر الروبوت في المشي، ويتحقق باستمرار من الرقم، حتى يصل إلى الصفر.

لماذا يعد هذا أمرًا بالغ الأهمية؟

  1. قابل للتوسع: لست بحاجة لتصوير إنسان يمشي نحو كل جسم في العالم. تحتاج فقط إلى فيديوهات الإنترنت لتدريب "محقق المسافة".
  2. قوي ومتين: نظرًا لأن الروبوت يهتم فقط بـ الرقم (المسافة) وليس بالبكسلات المحددة للصورة، فإنه يعمل بشكل رائع حتى عندما تتغير الإضاءة أو يتحرك الأثاث. الأمر يشبه القيادة من خلال الاستماع إلى نظام GPS يقول لك "انعطف يسارًا بعد 500 قدم" بدلًا من محاولة حفظ شكل كل شارع.
  3. يعمل في العالم الحقيقي: اختبر الباحثون هذا النظام على روبوت حقيقي (TurtleBot). وبينما ارتبكت الروبوتات المتقدمة الأخرى وتوقفت، نجح روبوت VLD في التنقل عبر غرف حقيقية، واجدًا أشياء لم يراها من قبل، فقط من خلال اتباع "رقم المسافة".

الخلاصة في تشبيه بسيط:
تخيل أنك في غرفة مظلمة تحاول العثور على كنز مخفي.

  • الطريقة القديمة: شخص ما يعطيك رسمًا تفصيليًا للغرفة ويقول لك: "امشِ 3 خطوات يسارًا، ثم خطوتين يمينًا". إذا تغيرت الغرفة قليلًا، ستضيع.
  • طريقة VLD: شخص ما يعطيك عداد جيجر (Ge Geiger counter) يصدر أصواتًا تزداد سرعة كلما اقتربت من الكنز. لست بحاجة لمعرفة تخطيط الغرفة؛ أنت فقط تتبع سرعة التنبيه. حتى لو كانت الغرفة فوضوية أو مظلمة، طالما أن التنبيه يصبح أسرع، فأنت تعلم أنك على الطريق الصحيح.

هذا البحث يبني "عداد جيجر" فائق القدرة للروبوتات، مما يسمح لها بالتنقل في العالم الحقيقي بمستوى من المرونة والذكاء كان من الصعب تحقيقه سابقًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →