← أحدث الأبحاث
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

تقدم الورقة البحثية GLAM، وهو نموذج عالم كامن مشروط بالهدف يتم تدريبه على ذاكرة مكانية زمانية عالمية يتنبأ بتمثيلات الخرائط المستقبلية ونقاط المسار الملاحية لتمكين الاستكشاف النشط والملاحة الدلالية بشكل محسّن، كما تم إثبات تفوق نظام GLAM NAV على خط الأساس BSC-Nav في مهام HM3D-ObjectNav.

المؤلفون الأصليون: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

نُشر 2026-09-16
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتًا يدخل غرفة لم يسبق له رؤيتها، مُكلفًا بالعثور على جسم محدد، مثل كرسي أحمر، لا يمكنه رؤيته من مكانه الحالي. للنجاح، لا يمكن للروبوت ببساطة أن يتفاعل مع ما تراه كاميرته أمامه مباشرة؛ بل يجب عليه بناء صورة ذهنية للمساحة أثناء تحركه، وتذكر الأماكن التي زارها، وتخمين ما يكمن خلف المنعطف التالي. هذه القدرة على الاحتفاظ بخريطة في الذاكرة، وتوقع كيف ستتغير تلك الخريطة مع تقدم الروبوت للأمام، واستخدام هذا التوقع لتخطيط الخطوة التالية، هي جوهر تحدي الاستكشاف النشط. لسنوات، حاول الباحثون تعليم الآلات هذه المهارة عبر جعلها تعيد بناء العالم بتفاصيل عالية الدقة، بكسل تلو الآخر، أو بالاعتماد على خرائط معدة مسبقًا. ومع ذلك، يشير نهج جديد إلى أن الروبوت ليس بحاجة لرؤية كل طوبة وظل؛ بل يحتاج فقط لفهم هيكل المساحة والمسار المرجح للوصول إلى هدفه.

قام فريق من الباحثين بتطوير نظام يسمى GLAM، وهو اختصار لـ (Goal-conditioned Latent World Model trained over Global Spatiotemporal Memory) أو "نموذج عالم كامن مرتبط بالهدف ومدرب على ذاكرة مكانية زمانية عالمية". وبعبارة أبسط، هذا نظام ملاحة يتعلم التنبؤ بالتخطيط المستقبلي للغرفة وأفضل مسار للوصول إلى الوجهة دون الحاجة لإعادة إنشاء العالم المرئي بدقة مثالية. فبدلاً من محاولة توليد إطار فيديو جديد لما سيبدو عليه الغرفة في الثانية التالية، يتنبأ النظام بتمثيل مجرد ومضغوط للخريطة وخطة خفية للمكان الذي يجب التوجه إليه بعد ذلك. هذا النهج مستوحى من كيفية تنظيم الأدمغة البيولوجية، وخاصة الحصين (hippocampus)، للذكريات المكانية واستخدامها لمحاكاة سيناريوهات مستقبلية. وقد بنى الباحثون نظام ملاحة متكامل حول هذا النموذج، أطلقوا عليه اسم GLAM NAV، والذي يجمع بين رسم الخرائط اللحظي، واسترجاع الذاكرة، والتخطيط التنبئي في حلقة واحدة.

يعمل النظام من خلال التحديث المستمر لذاكرة رقمية متفرقة للبيئة أثناء تحرك الروبوت. هذه الذاكرة ليست صورة ثلاثية الأبعاد كاملة، بل هي مجموعة من المعالم الرئيسية والعلاقات المكانية. وعندما يحتاج الروبوت للعثور على هدف ما، فإنه يستخدم موقعه الحالي وذاكرة ما رآه بالفعل ليسأل سؤالاً بسيطاً: "إذا تحركت في هذا الاتجاه، كيف سيبدو شكل الخريطة، وهل سأكون أقرب إلى هدفي؟". يجيب نموذج GLAM على هذا السؤال من خلال التنبؤ بشيئين في آن واحد: أولاً، يتنبأ بكيفية تطور "رموز الخريطة" (map tokens) — وهي اللبنات المجردة لذاكرته — مع استكشاف الروبوت للمكان. ثانياً، يتنبأ بـ "نقطة طريق كامنة" (latent waypoint)، وهي تمثيل خفي للخطوة التالية التي يجب أن يتخذها الروبوت. تحدث هذه التنبؤات في مساحة مشتركة، مما يعني أن النموذج يتعلم ربط الخريطة المتغيرة مباشرة بالحركة الضرية، وكل ذلك دون محاولة إعادة بناء الصور المرئية الخام للمستقبل.

لتدريب هذا النظام، لم يرسل الباحثون روبوتات إلى العالم الحقيقي لارتكاب الأخطاء، بل استخدموا محاكيًا عالي الدقة يسمى Habitat، والذي يحتوي على مئات المسوحات ثلاثية الأبعاد التفصيلية لبيئات داخلية حقيقية مثل الشقق والمكاتب. أعادوا تشغيل مسارات الخبراء — وهي مسارات اتخذها وكيل يتحكم فيه الكمبيوتر بشكل مثالي ويعرف بالضبط أماكن الأجسام — وقسموا هذه المسارات إلى آلاف العينات التدريبية. تعلم النموذج النظر إلى تاريخ من رموز الخريطة والهدف، ثم التنبؤ بالخريطة المستقبلية ونقطة الطريق التالية. والأهم من ذلك، تم تعليم النظام تجاهل مهمة إعادة إنشاء العالم المرئي، حيث ركز تمامًا على التنبؤ بهيكل المساحة وبالخطة للملاحة فيها. وقبل تدريب النموذج الرئيسي، قام الباحثون أيضًا بتدريب مكون منفصل مسبقًا لفهم كيفية ترجمة خطط نقاط الطريق الخفية هذه إلى حركات فيزيائية فعلية، مما يضمن إمكانية تحويل التنبؤات إلى أوامر حقيقية.

عند اختبار هذا النظام في المحاكي، أظهرت النتائج أن هذا النهج التنبئي كان أفضل من الطرق السابقة التي اعتمدت على أنواع مختلفة من هياكل الذاكرة. في مجموعة محددة مكونة من 50% من مشاهد الاختبار، نجح نظام GLAM NAV في العثور على الجسم المستهدف في 86.89% من المحاولات، وهو تحسن ملحوظ عن نسبة النجاح البالغة 78.50% للنظام الأساسي الذي تمت مقارنته به. كما تمكن من الوصول إلى الهدف بكفاءة أكبر، حيث ارتفع مقياس "النجاح الموزون بطول المسار" (Success weighted by Path Length) من 47.70% إلى 48.35%. تشير هذه الأرقام إلى أنه من خلال التنبؤ بهيكل الخريطة والمسار معًا، أصبح الروبوت أكثر موثوقية في إيجاد طريقه، حتى عندما كان الهدف غير مرئي في البداية. لم يقم النظام بمجرد حفظ مسار، بل تعلم توقع تخطيط البيئة وتعديل خطته بناءً على ذلك التوقع.

لإثبات أن هذا لم يكن مجرد نتيجة للمحاكي، نشر الباحثون النظام على روبوت حقيقي، وهو روبوت بشري ذو عجلات وذراعين، في بيئة مكتبية حقيقية. في أول اختبار حقيقي، طُلب من الروبوت البحث عن نبات أصيص في غرفة لم يسبق له رؤيتها، دون توفير خريطة مسبقة البناء. وبينما كان يتحرك، بدأ في بناء ذاكرته الخاصة للمساحة، وربط الملاحظات المرئية الجديدة بخريطته المتنامية. لقد نجح في الملاحة للوصول إلى النبات، مما أثبت أن النظام يمكنه بناء ذاكرة مكانية مفيدة من الصفر في بيئة فيزيائية حقيقية. وفي اختبار ثانٍ، طُلب من الروبوت تذكر مكان رؤيته للنبات بعد أن خرج الجسم عن مجال الرؤية. استرجع النظام الموقع المخزن في ذاكرته ونجح في الملاحة للعودة إلى تلك النقطة. أكدت هذه التجار تجارب أن التنبؤات المجردة التي يقدمها النموذج يمكن أن توجه روبوتًا حقيقيًا عبر بيئة حقيقية، باستخدام الذاكرة لسد الفجوة بين ما يُرى وما هو مطلوب.

على الرغم من هذه النجاحات، يوضح الباحثون بحذر حدود عملهم. يتعلم النظام من المسارات التي اتخذها وكلاء الخبراء في المحاكي، لذا فهو يكون أكثر فعالية عندما يظل سلوك الروبوت ضمن الأنماط التي رآها أثناء التدريب. إنه ليس محاكيًا عامًا يمكنه التنبؤ بنتيجة أي إجراء عشوائي، بل هو أداة موجهة نحو هدف لتقدير الخريطة والمسار الأكثر احتمالاً لهدف معين. كما ينتج النموذج تنبؤًا واحدًا محددًا بدلاً من نطاق من الاحتمالات، مما يعني أنه لا يحسب صراحةً مدى عدم اليقين في تخميناته. إذا واجه الروبوت تخطيطًا مختلفًا جدًا عما تعلمه، أو إذا انحرفت مستشعراته وفقد تتبع موقعه، فقد يعاني النظام. ويؤكد الباحثون أن الروبوت لا يزال يعتمد على الملاحظات في الوقت الفعلي للتحقق من موقعه وتجنب الاصطدامات، مستخدمًا التنبؤات فقط لتوجيه بحثه.

يمثل هذا العمل تحولًا في طريقة تفكيرنا في ملاحة الروبوتات. فبدلاً من محاولة بناء نسخة طبق الأصل عالية الدقة من العالم داخل الكمبيوتر، يتعلم النظام العمل باستخدام نسخة مجردة ووظيفية من الخريطة تكون كافية للتخطيط. ومن خلال معاملة التنبؤ بالخريطة المستقبلية والتخطيط للخطوة التالية كمهمة واحدة متصلة، خلق الباحثون نظامًا أكثر موثوقية في العثور على الأهداف وقادرًا على العمل في بيئات حقيقية. تشير النتائج إلى أنه لكي يستكشف الروبوت بفعالية، فإنه لا يحتاج لرؤية كل شيء؛ بل يحتاج لفهم هيكل المساحة بما يكفي لتخيل ما سيأتي بعد ذلك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →