Visual Navigation Transformer with Pose Attention
تقترح الورقة البحثية VNT-PA، وهو مخطط ملاحة قائم على المحولات يستخدم أوضاع الكاميرا كترميزات موضعية لفهرسة الإطارات الرئيسية للعمق، مما يتيح إعادة استخدام الخبرة المكانية بكفاءة عبر مسارات مختلفة وتحقيق أداء رائد في الملاحة طويلة الأمد نحو هدف نقطي محدد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تواجه الروبوتات التي تتحرك في العالم مشكلة ذاكرة جوهرية. فلكي ينتقل الآلة من النقطة (أ) إلى النقطة (ب)، يجب أن تتذكر ما رأته، ولكنها تحتاج أيضاً إلى معرفة أين تنتمي تلك الذكريات في الفضاء. غالباً ما تتعامل أنظمة الملاحة التقليدية مع رحلة الروبوت كأنها شريط فيديو، حيث تخزن الملاحظات بالترتيب الدقيق الذي حدثت به. هذا الأسلوب يعمل جيداً لرحلة واحدة، ولكنه يخلق فوضى عندما يحاول الروبوت إعادة استخدام تجارب قديمة. فإذا زار الروبوت ممرًا اليوم وعاد إليه في الأسبوع التالي، فإن الذاكرة التي تعمل بأسلوب الفيديو ستعاني لدمج هاتين الزيارتين في خريطة واحدة متماسكة؛ إذ لا يمكنها بسهولة إدراك أن الباب الذي رُئي بالأمس هو نفسه الباب الذي رُئي اليوم، أو أن انعطافاً تم اتخاذه بترتيب مختلف يؤدي إلى الوجهة نفسها. ولحل هذه المشكلة، قام المهندسون غالباً ببناء خرائط صريحة، عبر رسم شبكات أو رسوم بيانية للعالم قبل تحرك الروبوت. ومع ذلك، تتطلب هذه الخرائط بناءً معقداً ويمكن أن تنهار إذا كانت مستشعرات الروبوت غير دقيقة قليلاً. ويبقى السؤال: هل يمكن للروبوت أن يتعلم الملاحة ببساطة عن طريق تذكر أين كان عندما رأى شيئاً ما، دون الحاجة إلى رسم خريطة أولاً؟
قام فريق من الباحثين في جامعة بنسلفانيا بتطوير طريقة جديدة لجعل الروبوتات تفكر في الفضاء، أطلقوا عليها اسم "محول الملاحة البصرية مع انتباه الوضع" (Visual Navigation Transformer with Pose Attention). فبدلاً من تنظيم ذكريات الروبوت حسب الوقت، قاموا بتنظيمها حسب الموقع. تخيل مجموعة من الصور الفوتوغرافية الملتقطة أثناء نزهة داخل منزل؛ في النهج القياسي، تُكدس هذه الصور في كومة حسب ترتيب التقاطها. أما في هذا النظام الجديد، فيتم وسم كل صورة بالموقع والزاوية الدقيقة للكاميرا عند التقاطها. لا ينظر الروبوت إلى الكومة بالترتيب؛ بل ينظر إلى المجموعة ككل، متسائلاً: "أين أنا الآن، وأين الهدف؟". ثم يبحث النظام في جميع الصور المخزنة للعثور على الصور ذات الصلة مكانياً بالوضع الحالي، متجاهلاً متى التُقطت. وهذا يسمح للروبوت بدمج الذكريات من رحلات مختلفة في فهم مرن وموحد للبيئة.
اختبر الباحثون هذه الفكرة في محاكاة حاسوبية باستخدام مجموعة بيانات لبيئات داخلية حقيقية، وتحديداً مجموعة بيانات "Habitat-Matterport 3D"، التي تحتوي على مسوحات ثلاثية الأبعاد لمبانٍ فعلية. وقد زودوا الروبوت بمجموعة من صور العمق — وهي بيانات بصرية تلتقط المسافة إلى الأجسام — جُمعت خلال استكشاف أولي للمبنى. تم تصفية هذه الصور لتصبح مجموعة من "الصور المفتاحية" (keyframes)، وهي اللقطات الأكثر فائدة التي تظهر أجزاء جديدة من الغرفة، بدلاً من المشاهد المتكررة لنفس الجدار. ثم كُلف الروبوت بمهمة العثور على نقطة هدف محددة، بدءاً من موقع عشوائي، باستخدام هذه الصور المخزنة وموقعه الحالي فقط. لم يعتمد الروبوت على خريطة مبنية مسبقاً أو بث فيديو لحركته الحالية، بل استخدم نوعاً من الذكاء الاصطناعي يسمى "المحول" (transformer)، وهو مصمم لتقدير أهمية قطع المعلومات المختلفة. وفي هذه الحالة، استخدم المحول موقع الكاميرا وزاويتها كدليل لتحديد الذكريات التي يجب أن ينتبه إليها.
أظهرت النتائج أن هذا النهج كان فعالاً للغاية. ففي سلسلة من الاختبارات، نجح الروبوت في الوصول إلى هدفه في 93.3% من المحاولات، وهو تحسن ملحوظ مقارنة بالطرق الأخرى التي تعاملت مع نفس الذكريات كتسلسل زمني مرتب. وعندما كان الهدف بعيداً أو يتطلب مساراً طويلاً ومتعرجاً، حافظ النظام الجديد على دقته، بينما ضلت الأنظمة الأخرى طريقها أو سلكت طرقاً غير فعالة. ووجد الباحثون أن مفتاح هذا النجاح يكمن في الطريقة التي يربط بها الروبوت ذكرياته؛ فمن خلال التركيز على الفرق في الموقع بين الموقع الحالي والصور المخزنة، بدلاً من الفجوة الزمنية بينهما، استطاع الرالروبوت التفكير في هندسة الغرفة بشكل أكثر فعالية. لقد تعلم أن الانعطاف الذي يتم الآن مرتبط بانعطاف تم في جزء آخر من المبنى، ببساطة لأن العلاقة المكانية بين النقطتين كانت متسقة.
كان أحد أكثر الاكتشافات إثارة للدهشة هو مدى قدرة النظام على التعامل مع الأخطاء في إدراكه للموقع. ففي العالم الحقيقي، غالباً ما تمتلك الروبوتات مستشعرات غير مثالية وقد لا تعرف موقعها الدقيق بالمليمتر. وعندما أدخل الباحثون "ضجيجاً" لمحاكاة هذه الأخطاء، ظل النظام الجديد قوياً، حيث فقد جزءاً ضئيلاً فقط من أدائه. في المقابل، فشل النظام التقليدي الذي يبني خريطة صلبة من نفس البيانات فشلاً ذريعاً، حيث أخطأ في تحديد الممرات المفتوحة واعتبرها جدراناً مسدودة لأن بيانات الموقع المشوبة بالضجيج وضعت الجدران في أماكن خاطئة. أما النظام الجديد، فمن خلال معاملة البيئة كمجموعة مرنة من الذكريات الموسومة بالموقع، استطاع تحمل هذه عدم الدقة دون أن ينهار؛ فهو لم يكن بحاجة للالتزام بشبكة واحدة مثالية للعالم، بل كان بإمكانه ببساطة الاستعلام عن ذكرياته بناءً على موقعه المفترض، وتعديل مساره أثناء حركته.
اكتشف الباحثون أيضاً أن النظام يمكنه التعلم من أكثر من مجرد الاستكشاف الأولي. فإذا واجه الروبوت زاوية جديدة لغرفة أو منطقة لم يسبق رؤيتها خلال رحلته، يمكنه إضافة تلك الرؤية الجديدة إلى مجموعة ذاكرته فوراً، دون الحاجة إلى إعادة تدريبه. وهذا يعني أن الروبوت يمكنه بناء فهم أغنى لمحيطه أثناء العمل، باستخدام الملاحظات من مسارات مختلفة لسد الثغرات. لقد تم تدريب النظام ليحاكي مخططاً خبيراً يعرف المسار المثالي عبر المبنى، وتعلم التنبؤ بالخطوة التالية من خلال النظر في السياق المكاني لمحيطه. لم يكن بحاجة لرؤية المشهد الحالي لاتخاذ قرار؛ بل احتاج فقط لمعرفة أين هو وإلى أين يريد الذهاب، ثم استدعاء الأجزاء ذات الصلة من ذاكرته.
يشير هذا العمل إلى أنه لكي تتمكن الروبوتات من الملاحة في بيئات معقدة ومتغيرة، لا تحتاج بالضرورة إلى بناء خريطة ثابتة للعالم. بدلاً من ذلك، يمكنها الاعتماد على مجموعة ديناميكية من التجارب، مفهرسة حسب مكان حدوثها. وتوضح الدراسة أن تنظيم الذاكرة حسب الموقع بدلاً من الوقت يسمح بتعلم أسرع وأداء أفضل في المهام الطويلة والصعبة. ورغم أن التجار nghiệm أجريت في بيئة محاكاة، إلا أن المبادئ تعتمد على الاستدلال الهندسي الذي ينطبق على العالم المادي. ويشير الباحثون إلى أن نظامهم يعمل حالياً في بُعدين، بافتراض أن الروبوت يتحرك على أرضية مسطحة، ولكن يمكن توسيع الطريقة الأساسية لتشمل الحركة في ثلاثة أبعاد. ومن خلال إظهار أن الروبوت يمكنه الملاحة بفعالية باستخدام مجموعة من الذكريات الموسومة بالوضع فقط، يفتح هذا البحث مساراً جديداً لخلق آلات يمكنها التحرك في العالم بالمرونة والقدرة على التكيف التي يمتلكها البشر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.