← أحدث الأبحاث
💻 computer science

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

تقدم هذه الورقة نموذج عالم كامن للملاحة القائمة على هدف صوري، يستخدم مشفر DINO مجمدًا وفقد ترتيب التكلفة الرتيبة المبتكر لضمان تخطيط موثوق لتسلسل الإجراءات، محققةً أداءً هو الأفضل في حالته على مجموعة بيانات GNM ونشرًا ناجحًا بنمط الصفر استباقي (zero-shot) على روبوتات فيزيائية.

المؤلفون الأصليون: Amirhosein Chahe, Siwei Cai, Lifeng Zhou

نُشر 2026-08-11
📖 8 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Amirhosein Chahe, Siwei Cai, Lifeng Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيف يجد طريقه عبر متاهة، لكن لا يمكنك إعطاءه خريطة، ولا نظام تحديد مواقع (GPS)، ولا حتى بوصلة. الخيط الوحيد الذي تملكه هو صورة فوتوغرافية واحدة للوجهة. هذا هو تحدي الملاحة بهدف الصورة (image-goal navigation). لحل هذه المعضلة، لا يمكن للروبوت مجرد النظر إلى الصورة والتخمين؛ بل يجب أن يكون "حالمًا" بعض الشيء. يحتاج إلى "نموذج عالم" (world model)—محاكي ذهني يسمح له بالتساؤل: "إذا خطوت خطوة لليسار، كيف سيبدو العالم؟ إذا استدرت لليمين، أين سينتهي بي المطاف؟" ومن خلال تشغيل آلاف عمليات المحاكاة الذهنية هذه، يمكن للروبوت اختيار المسار الأفضل قبل أن يحرك عجلة واحدة. ومع ذلك، هناك عقبة: إذا كان المحاكي الذهني للروبوت سيئًا في تخمين المستقبل، أو إذا لم يستطع التمييز بين المسار "الجيد" والمسار "السيئ"، فسوف يضل طريقه. يحتاج الروبوت إلى طريقة لتصنيف أحلام اليقظة الخاصة به، لضمان أن المسار الذي يؤدي بالفعل إلى الصورة يحصل على أعلى درجة.

يتناول هذا البحث هذه المشكلة تحديدًا: كيف نبني محاكي العالم الخاص بالروبوت بحيث لا يتنبأ بالمستقبل بدقة فحسب، بل يعرف أيضًا كيف "يُقيّم" توقعاته الخاصة. وجد الباحثون أن مجرد تدريب الروبوت على التنبؤ بالخطوة التالية ليس كافيًا. فإذا تم تدريب الروبوت على تخمين المستقبل بناءً على بيانات واقعية مثالية (وهي طريقة تسمى "إجبار المعلم" أو teacher forcing)، فإنه يعتمد على حقيقة خارجية ويفشل عندما يتعين عليه تخمين المستقبل بناءً على تخميناته الخاصة غير المثالية. علاوة على على ذلك، اكتشفوا أن محاولة جعل توقعات الروبوت أكثر "تمييزًا" باستخدام نوع معين من التعلم التبايني (contrastive learning) أدت في الواقع إلى إفساد هندسة خريطته الذهنية، مما جعل التخطيط أكثر صعوبة. وبدلاً من ذلك، اقترحوا طريقة تدريب جديدة تجبر الروبوت على ممارسة التنبؤ بالمستقبل باستخدام تخميناته السابقة (التدفق التلقائي أو autoregressive rollout) وتضيف قاعدة خاصة: كلما ابتعد المسار عن الهدف، زادت "التكلفة" أو العقوبة المفروضة عليه. وهذا يخلق مشهدًا سلسًا ورتيبًا (monotone) حيث يمكن للروبوت الانزلاق بسهولة نحو المسار الأفضل.

مشكلة أحلام اليقظة لدى الروبوت

فكر في روبوت يحاول الانتقال إلى صورة هدف مثل متسلق جبال يحاول الوصول إلى قمة جبل محددة باستخدام صورة فقط للمنظر من القمة. المتسلق ليس لديه خريطة، ولا بوصلة، ولا يعرف أين هو الآن. لديه فقط عينيه وصورة ذهنية للوجهة. للوصول إلى هناك، يحتاج المتسلق إلى تخيل: "إذا مشيت شمالًا، هل ستشبه الأشجار تلك الموجودة في الصورة؟ إذا مشيت جنوبًا، هل سأرى منحدرًا؟"

في عالم الروبوتات، تسمى هذه المحاكاة الذهنية نموذج العالم (World Model). وهو عبارة عن شبكة عصبية تعمل مثل البلورة السحرية. تقول لها: "هذا ما أراه الآن، وهذا هو الإجراء الذي أفكر في اتخاذه"، فترد هي: "هذا ما ستراه بعد ذلك". ومن خلال ربط هذه التوقعات معًا، يمكن للروبوت محاكة رحلة كاملة في ذهنه.

لكن الجزء الصعب هنا هو: التخطيط (Planning). امتلاك بلورة سحرية ليس كافيًا؛ فأنت بحاجة لمعرفة أي مسار هو الأفضل. يحاول الروبوت تجربة مئات المسارات الخيالية المختلفة. ويحتاج إلى طريقة لتسجيل درجاتها. في هذا البحث، تعتمد الدرجة على المسافة الجيبية تمامًا (cosine distance)، وهي طريقة متطورة لقياس مدى تشابه صورتين (أو بصماتهما الرقمية). إذا بدا محاكاة الروبوت الذهنية لنهاية المسار مشابهة جدًا لصورة الهدف، فإن الدرجة تكون جيدة. وإذا بدت مختلفة تمامًا عن الهدف، فإن الدرجة تكون سيئة.

المشكلة التي وجدها المؤلفون هي أن العديد من الروبوتات الحالية سيئة جدًا في لعبة التسجيل هذه. قد تتنبأ بالمستقبل بدقة لخطوة واحدة، ولكن عندما تحاول التنبؤ بعشر خطوات للأمام، تخرج توقعاتها عن المسار الصحيح. والأسوأ من ذلك، حتى لو تنبأت بالمستقبل بشكل جيد، فإن "التكلفة" التي تخصصها لمختلف المسارات قد تكون فوضوية. تخيل متسلق جبال، حيث المسار الذي يؤدي إلى منحدر يحصل على درجة "ممتازة"، والمسار المؤدي إلى قمة الجبل يحصل على درجة "سيئة". سيسير المتسلق مباشرة نحو الهاوية! يحدث هذا عندما لا تكون العلاقة بين "مدى بعدك عن الهدف" و"درجتك" سلسة أو رتيبة (monotone).

الحل: حالم يقظ أفضل

قام المؤلفون، أمير حسين شاهي، وسيوي كاي، ولي فينغ زو من جامعة دريكسل، ببناء نوع جديد من عقول الروبوتات لإصلاح هذا. أطلقوا عليه اسم نموذج العالم الكامن مع تكاليف تخطيط رتيبة (Latent World Model with Monotone Planning Costs). دعونا نفكك ما فعلوه، باستخدام بعض التشبيهات الممتعة.

1. العدسة المجمدة والدماغ القابل للتدريب

أولاً، استخدموا "عينًا" مدربة مسبقًا (مشفر من عائلة DINO) وهي جيدة جدًا في تحويل الصور إلى بصمات رقمية. هذه العين لا تتغير؛ فهي ترى العالم بوضوح فقط. ثم بنوا "دماغًا" (متنبئ قابل للتدريب) يأخذ تلك البصمات ويحاول تخمين كيف ستبدو بعد تحرك الروبوت.

2. التدريب بأسلوب "الممارسة تؤدي إلى الإتقان" (التدفق التلقائي - Autoregressive Rollout)

تُدرب معظم الروبوتات مثل الطلاب في الفصل الدراسي حيث يعطيهم المعلم مفتاح الإجابة بعد كل سؤال. يُسمى هذا إجبار المعلم (teacher forcing). يرى الروبوت الصورة الحالية، ويقول المعلم "لقد تحركت لليسار"، فيتنبأ الروبوت بالصورة التالية. ثم يقوم المعلم بتصحيحه فورًا.

المشكلة هي أنه عندما يكون الروبوت في العالم الحقيقي، لا يوجد معلم. عليه أن يخمن الصورة التالية بناءً على تخميناته السابقة. إذا ارتكب خطأً صغيرًا في الخطوة الأولى، فإن هذا الخطأ يكبر في الخطوة الثانية، وبحلول الخطوة العاشرة، يكون الروبوت يحلم بعالم مختلف تمامًا. يسمى هذا عدم التطابق بين التدريب والاختبار (train-test mismatch).

أصلح المؤلفون هذا بجعل الروبوت يتدرب على ممارسة أحلام اليقظة بمفرده. جعلوا الروبوت يتنبأ بالخطوة 2 بناءً على تنبئه للخطوة 1، ثم الخطوة 3 بناءً على الخطوة 2، وهكذا. أطلقوا على هذا اسم التدفق التلقائي (autoregressive rollout). إنه يشبه طالبًا يتعين عليه خوض اختبار بدون مفتاح الإجابات، مما يجبره على تعلم كيفية التعامل مع أخطائه. كما استخدموا "منهجًا عكسيًا"، حيث بدأوا بأحلام يقظة قصيرة (خطوتين) ثم زادوا طولها تدريجيًا (حتى 8 خطوات) مع تحسن الروبوت، حتى لا يشعر بالإرهاق.

3. قاعدة "التكلفة الرتيبة"

حتى مع أحلام يقظة أفضل، كان الروبوت لا يزال بحاجة إلى طريقة أفضل لتصنيف مساراته. قدم المؤلفون قاعدة تسمى تصنيف التكلفة الرتيبة (Monotone Cost Ranking - MCR).

تخيل تلاً حيث القاع هو الهدف. كلما كنت بعيدًا عن القاع، كنت في مكان أعلى على التل. هذا مشهد رتيب (monotone): إذا ابتعدت عن الهدف، فإن "تكلفتك" (ارتفاعك) تزدير دائمًا. لا تنخفض ثم تعود للارتفاع مرة أخرى.

في العديد من النماذج السابقة، كان "التل" متعرجًا. المسار الذي ينحرف قليلاً قد يبدو بالخطأ كأنه "وادي" (تكلفة منخفضة)، مما يخدع الروبوت ويجعله يظن أنه على المسار الصحيح. أضاف المؤلفون فقدان تدريب خاصًا يجبر الروبوت على تعلم: "إذا انحرفت عن المسار الصحيح، يجب أن تزداد تكلفتك". فعلوا ذلك من خلال إنشاء مسارات عديدة مشوهة قليلًا وإخبار الروبوت: "كلما زاد انحرافك، يجب أن تكون العقوبة أكبر". هذا ينعم الخريطة الذهنية، مما يسهل على الروبوت العثور على أدنى نقطة (الهدف) باستخدام طريقة تسمى طريقة التباين (Cross-Entropy Method - CEM)، وهي ببساطة طريقة متطورة لأخذ عينات من مسارات عديدة واختيار الأفضل منها.

4. منطقة "عدم الذهاب" المفاجئة

اختبر الباحثون أيضًا فكرة بدت جيدة في الظاهر: التعلم التبايني للفعل (Action-Contrastive Learning). وهي تقنية تحاول تعليم الروبوت التمييز بين الأفعال "الجيدة" والأفعال "السيئة" من خلال إظهار أزواج منها. ظنوا أن هذا سيجعل الخريطة الذهنية للروبوت أكثر حدة.

ومع ذلك، وجدوا العكس. عندما استخدموا نوعًا معينًا من التدريب التبايني الذي يخلط ترتيب الأفعال (التبديل الزمني السلبي)، أدى ذلك في الواقع إلى تدمير قدرة الروبوت على التخطيط. كان الأمر أشبه بمحاولة شحذ سكين بضربها بمطرقة؛ تشوهت الخريطة ولم يعد بإمكان الروبوت العثด على الهدف. يستبعد البحث صراحة هذه الطريقة لهذه المهمة المحددة، موضحًا أن محاولة جعل التمثيل "تمييزيًا" (جيد في التفريق بين الأشياء) يمكن أن تكسر "الهندسة" (شكل الخريطة) اللازمة للتخطيط.

النتائج: روبوت يجد طريقه بالفعل

اختبر الفريق عقل الروبوت الجديد على مجموعة بيانات تسمى GNM، والتي تحتوي على ساعات من اللقطات لستة أنواع مختلفة من الروبوتات التي تتنقل في بيئات حقيقية. قارنوا نموذجهم بالعديد من المنافسين الأوائل، بما في ذلك NWM (الذي يتنبأ بإطارات فيديو كاملة)، و DINO-WM (نموذج كامن سابق)، و OmniVLA (سياسة تفاعلية ضخمة).

كانت النتائج مبهرة. قلل نموذجهم، باستخدام مشفر DINOv2، من خطأ التوجه (orientation error) بمقدار 2.7 مرة مقارنة بأفضل نموذج كامن سابق (DINO-WM). وباللغة البسيطة، كان الروبوت أفضل بكثير في مواجهة الاتجاه الصحيح عند وصوله.

  • خطأ التوجه (AOE): حقق أفضل نموذج لديهم 7.63 درجة، بينما حقق أفضل نموذج كامن سابق (DINO-WM مع DINOv2) 20.27 درجة.
  • خطأ الإزاحة (ADE): قللوا أيضًا من المسافة التي انتهى بها الروبوت بعيدًا عن الهدف.

والأهم من ذلك، اختبروا الروبوت على روبوت فيزيائي حقيقي (Clearpath Husky) في العالم الحقيقي، دون إظهار أي بيانات تدريب من ذلك الموقع المحدد. يسمى هذا النشر بصفر معرفة مسبقة (zero-shot deployment). نجح الروبوت في التنقل عبر بيئات داخلية وخارجية غير مرئية، متبعًا مسارات كانت أكثر منطقيةية وتوجهًا نحو الهدف مقارنة بمنافسيه. وبينما كانت النماذج الأخرى تمشي أحيانًا نحو الجدران أو تتوقف مبكرًا، استمر هذا النموذج في التحرك نحو صورة الهدف.

لماذا يهم هذا؟

يشير هذا البحث إلى أنه لكي تتنقل الروبوتات بفعالية باستخدام صورة هدف فقط، فإنها تحتاج إلى ما هو أكثر من مجرد متنبئ جيد؛ إنها بحاجة إلى متنبئ مُدرب على التعامل مع أخطائه ونظام تسجيل سلس وموثوق. من خلال إصلاح طريقة التدريب (التدفق التلقائي) وتشكيل مشهد التكلفة (التصنيف الرتيب)، خلق المؤلفون نظامًا يتفوق على كل من السياسات التفاعلية (التي تخمن الحركة التالية فقط) ونماذج العالم السابقة.

ومع ذلك، يلاحظ المؤلفون بحذر أن نموذجهم ليس حلاً سحريًا لكل المواقف. يعمل نموذجهم بشكل أفضل في البيئات الثابتة أو ذات الحركة المنخفضة. لم يتم اختباره في مشاهد فوضوية بها مشاة أو سيارات متحركة. وأيضًا، نظرًا لأن الروبوت يعتمد على توقعاته الخاصة للتخطيط، فإن الرحلات الطويلة جدًا لا تزال تشكل تحديًا، حيث يمكن للأخطاء الصغيرة أن تتراكم في النهاية. ولكن في الوقت الحالي، يمثل هذا النهج خطوة مهمة للأمام في تعليم الروبوتات كيف تحلم طريقها نحو الوجهة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →