← أحدث الأبحاث
💻 computer science

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

يُعد STEGNav إطار عمل لا يتطلب تدريباً يعمل على تعزيز الملاحة الكائنية متعددة الوسائط مدى الحياة من خلال توسيع الرسوم البيانية للمشاهد التقليدية إلى رسوم بيانية للأحداث المكانية والزمانية، والتي تدمج التأسيس المكاني للنماذج المشروطة بالاستعلام مع الذاكرة الزمنية المدركة للمسار لتحسين تمييز النماذج، وتمثيل الحدود، وإعادة استخدام الخبرات عبر المهام الفرعية.

المؤلفون الأصليون: Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

نُشر 2026-08-31
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتًا يدخل غرفة لم يسبق له رؤيتها من قبل، مكلفًا بالعثور على جسم معين. في أبسط نسخة من هذا التحدي، يُطلب من الروبوت البحث عن "كرسي". ولكن في العالم الحقيقي، تكون الغرف مليئة بالكراسي، ويحتاج الروبوت إلى معرفة أي واحد منها هو المقصود بناءً على وصف مثل "الكرسي الأحمر بجانب النافذة" أو صورة لقطعة أثاث محددة. هذا هو مجال الملاحة المتجسدة (embodied navigation)، حيث يجب على الوكلاء الاصطناعيين فهم محيطهم، وتفسير التعليمات المعقدة، والتحرك عبر المساحة لتحقيق هدف ما. لسنوات، حاول الباحثون تعليم الروبوتات كيفية بناء خرائط ذهنية لهذه البيئات، مستخدمين غالبًا أداة تسمى "رسم بياني للمشهد" (scene graph). فكر في الرسم البياني للمشهد كقائمة رقمية تسجل ماهية الأشياء الموجودة في الغرفة وكيف ترتبط ببعضها البعض. ورغم فائدتها، إلا أن هذه القوائم التقليدية لديها نقطة عمياء: فهي غالبًا ما تعامل جميع الكراسي كعنصر عام واحد، وتنسى المسار الذي اتخذه الروبوت للوصول إلى هناك. إنها لقطات ثابتة للغرفة وليست سجلًا للرحلة، مما يتسبب في ارتباك الروبوتات بين الأشياء المتطابقة أو تجولها في دوائر، وإعادة زيارة مناطق استكشفتها بالفعل.

قام فريق من الباحثين في جامعة نانجينغ بتطوير نهج جديد لحل هذه المشكلات، حيث ابتكروا نظامًا يسمونه STEGNav. فبدلاً من الاعتماد على قائمة ثابتة من الأشياء، يبني هذا النظام خريطة ديناميكية مدفوعة بالأحداث تتذكر كلاً من تخطيط الغرفة وسجل تحركات الروبوت. أدرك الباحثون أنه لكي يتمكن الوكيل من الملاحة بفعالية على مدى فترة طويلة، فإنه يحتاج إلى فهم ليس فقط ما هو أمامه، ولكن أيضًا كيف وصل إلى هناك وما الذي جربه بالفعل. ويتضمن حلهم تحسينين رئيسيين لكيفية إدراك الروبوت للعالم. أولاً، أضافوا طبقة مكانية تساعد الروبوت على التمييز بين العناصر الفردية. إذا كان الروبوت يبحث عن طاولة معينة، فإن هذا النظام يساعده على التفريق بين الطاولة الموجودة في غرفة الطعام وتلك الموجودة في المطبخ، حتى لو بدتا متشابهتين. كما يربط هذه الأشياء بالمساحات الفارلة حولها، مما يسمح للروبوت برؤية ليس فقط الأثاث، بل أيضًا المسارات المفتوحة التي يمكنه اتخاذها للوصول إليها.

التحسين الثاني هو نظام ذاكرة يتتبع قرارات الروبوت الأخيرة ونجاحاته الماضية. يعمل هذا النظام مثل دفتر ملاحظات ذي طبقتين. يسجل الجزء الأول من الدفتر الماضي القريب، حيث يراقب بدقة الخطوات القليلة الأخيرة التي اتخذها الروبوت، والمسارات التي سلكها، والمناطق التي استكشفها. وهذا يمنع الروبوت من العلوق في حلقات مفرغة أو إضاعة الوقت في إعادة زيارة أماكن سبق وفحصها. أما الجزء الآخر من الدفتر، فيخزن النجاحات المؤكدة من المهام السابقة. فإذا نجح الروبوت في العثور على جسم معين في مهمة سابقة، يتم حفظ هذه المعلومة وربطها بالخريطة الحالية، مما يساعد الروبوت على تذكر أين يمكن العث/وجود عناصر مماثلة في المستقبل. ومن خلال الجمع بين الطبقتين المكانية والزمنية، ينشئ الروبوت تمثيلًا غنيًا وحيًا لبيئته يتطور أثناء حركته.

ولاختبار هذا النظام الجديد، أخضع الباحثون النظام لسلسلة من التحديات الصارمة في بيئة محاكية مصممة لمحاكاة الملاحة في العالم الحقيقي. لقد استخدموا معيارًا يسمى GOAT-Bench، والذي يتطلب من الروبوت إكمال سلسلة من المهام المختلفة، مثل العث-ور على جسم معين بناءً على صورة، أو وصف جملة، أو اسم فئة، وكل ذلك ضمن رحلة واحدة مستمرة. كانت النتائج كبيرة؛ فقد نجح النظام الجديد في إكمال 66.3% من مهام الملاحة المعقدة متعددة الخطوات، وهو تحسن ملحوظ مقارنة بالأساليب السابقة التي عانت مع هذه التحديات. كما تمكن من العثور على أقصر المسارات في كثير من الأحيان، حيث سجل 39.7 في مقياس يوازن بين النجاح وكفاءة المسار المتخذ. وعند اختباره على مجموعة أخرى أكبر من البيئات تسمى HM3D، استمر النظام في الأداء الجيد، محققًا معدلات نجاح بلغت 64.0% و69.4% في نسختين مختلفتين من الاختبار.

حلل الباحثون المواضع التي نجح فيها النظام والمواضع التي لا يزال يواجه فيها صعوبات لفهم سبب عمله بشكل جيد. ووجدوا أن أكبر المكاسب جاءت من قدرة النظام على منع الروبوت من استكشاف نفس المناطق بشكل متكرر ومن الخلط بين جسم وآخر. فمن خلال تذكر المسارات التي تم سلكها والأشياء التي تم فحصها بالفعل بشكل صريح، تجنب الروبوت العديد من الطرق المسدودة التي عانت منها الأنظمة القديمة. وأظهر التحليل أن الطريقة الجديدة قللت من عدد المرات التي تاه فيها الروبوت أو ارتبك بمقدار النصف تقريبًا مقارنة بأفضل الأساليب السابقة. وبينما لا يزال النظام يواجه بعض التحديات في الآليات منخفضة المستوى للحركة والتوقف، فإن المنطق الأساسي للملاحة — أي معرفة أين تذهب وماذا تبحث عنه — قد تحسن بشكل جوهري. يوضح هذا العمل أنه من خلال منح الروبوتات طريقة أفضل لتذكر رحلتها والتمييز بين الأشياء المتشابهة، يمكننا جعلها شركاء أكثر موثوقية في استكشاف المجهول.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →