HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness
يقدم HarnessVLN إطار عمل موحداً للملاحة المتجسدة، يعمل بنظام التعلم الصفري (zero-shot) وبدون تدريب، وذلك عبر توظيف "حمالة وكيل" (Agent Harness) لتنسيق الإدراك والذاكرة والتحقق من الإجراءات من خلال واجهة أدوات مهيكلة، محققاً أداءً هو الأفضل في فئته على عدة معايير قياسية دون الحاجة إلى تدريب خاص بالمهام.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كان الروبوت القادر على التحرك في العالم بمفرده حلمًا من أحلام الخيال العلمي، ولكن بالنسبة للمهندسين، فإن التحدي عملي للغاية. لكي يتنقل الروبوت، يجب عليه القيام بثلاثة أشياء في آن واحد: فهم ما يراه، وتذكر أين كان، واتخاذ قرار بشأن ما سيفعله بعد ذلك. لسنوات، حاول الباحثون تعليم الروبوتات من خلال عرض آلاف الأمثلة لرحلات ناجحة، آملين أن تتعلم الآلة النمط. ومع ذلك، غالبًا ما تفشل هذه الطريقة عندما يواجه الروبوت غرفة جديدة أو تعليمات مختلفة قليًا. كانت الفكرة الأحدث هي تزويد الروبوتات بدماغ لغوي قوي، يشبه نماذج الذكاء الاصطناعي الكبيرة التي يمكنها كتابة القصص أو الإجابة على الأسئلة. وكان الأمل هو أن تتمكن هذه النماذج من التفكير والتدبير في طريقها عبر مبنى دون الحاجة إلى تدريب محدد. ومع ذلك، ظلت هناك فجوة: فبينما استطاعت هذه النماذج التحدث عن خطة ما، إلا أنها غالبًا ما واجهت صعوبة في التحقق مما إذا كانت تلك الخطة ممكنة بالفعل في العالم المادي، مما أدى إلى الارتباك أو العلوق في مكان ما.
قدم فريق من الباحثين نظامًا جديدًا يسمى HarnessVLN يسد هذه الفجوة. فبدلاً من الاعتماد على نموذج واحد للقيام بكل شيء، بنوا مديرًا مركزيًا، أو "حزامًا" (harness)، يعمل كمشرف صارم على دماغ الروبوت. هذا المدير لا يكتفي بترك الروبوت يخمن؛ بل يتحقق باستمرار من كل حركة مقترحة مقابل ما يراه الروبوت وما يتذكره بالفعل. تم اختبار النظام في بيئات رقمية معقدة وعلى روبوت بشري حقيقي كامل الحجم. وفي هذه الاختبارات، نجح الروبوت في اتباع تعليمات لفظية مفصلة للعثور على أشياء محددة أو الوصول إلى مواقع معينة، محققًا معدلات نجاح تجاوزت الأساليب السابقة التي لم تتطلب تدريبًا على مهام محددة. والنتيجة الرئيسية هي أنه من خلال إضافة طبقة من التحقق — حيث يجب على الروبوت إثبات أن الهدف مرئي ويمكن الوصول إليه قبل التحرك — يمكن للنظام التنقل في مساحات غير مألوفة بموثوقية لا يمكن للتخمين المحض مضاهاتها.
جوهر هذا النهج الجديد هو فكرة أن الروبوت يحتاج إلى طريقة موحدة للتعامل مع مختلف مهام التنقل. وسواء كان الهدف هو "اذهب إلى المطبخ ثم اتجه يمينًا" أو ببساطة "ابحث عن غسالة الأطباق"، فإن الروبوت يواجه نفس المشكلة الأساسية: يجب عليه ربط الكلمات بالمساحة المادية. صمم الباحثون إطار عمل حيث يقوم متحكم مركزي، وهو "الحزام" (Harness)، بتنسيق جميع أدوات الروبوت. ويشمل ذلك عيني الروبوت، اللتين تلتقطان الصور والعمق؛ وذاكرته، التي تخزن ما رآه؛ وساقيه، اللتين تحركانه للأمام. عندما يقترح دماغ اللغة لدى الروبوت حركة ما، يتوقف "الحزام" للتحقق من صحتها. فهو يسأل: هل هناك دليل على هذا؟ هل المسار خالٍ؟ هل يتوافق هذا مع الهدف الحالي؟ إذا كانت الإجابة لا، فلا يتحرك الروبوت بشكل أعمى؛ بل يتم إرساله لإعادة النظر أو للبحث عن مزيد من المعلومات.
تعتمد عملية التحقق هذه على نوعين متميزين من الذاكرة يعملان معًا. الأول هو سجل الأحداث، الذي يتتبع تاريخ الروبوت المباشر، مثل الأهداف الفرعية التي أكملها والأماكن التي فشل فيها مؤخرًا. والثاني هو خريطة مستمرة للبيئة، والتي تحتفظ بسجل للأماكن التي زارها الروبوت والأشياء التي رآها، بالإضافة إلى الوقت والموقع لتلك الملاحظات. تسمه هذه الخريطة الروبوت من التمييز بين المعلومات الجديدة والأفكار القديمة أو التي عفا عليها الزمن. إذا حاول الروبوت سابقًا المرور عبر باب ووجد أنه مغلق، فإن هذا النظام يتذكر ذلك الفشل ويمنع الروبوت من محاولة اتباع نفس المسار المستحيل مرة أخرى. ومن خلال الحفاظ على فصل واضح بين تفكير الروبوت وأفعاله المادية، يضمن النظام أن كل خطوة تستند إلى الواقع.
اختبر الباحثون هذا النظام في أربعة معايير مختلفة، وهي مجموعات قياسية من التحديات المستخدمة لقياس مهارات التنقل. في الاختبارات التي كان على الروبوت فيها اتباع مسار موصوف بالكلمات، نجح في 60.8% من الحالات في أحد الاختبارات الرئيسية و53.9% في اختبار آخر. وعندما كانت المهمة هي العثور على جسم محدد، مثل كرسي أو سرير، نجح النظام في 76.0% من المحاولات في بيئة واحدة و59.3% في بيئة أخرى. وتمثل هذه الأرقام تحسنًا كبيرًا مقارنة بالأساليب الأخرى التي لا تستخدم بيانات تدريب محددة. وأشار الباحثون إلى أن النظام كان يؤدي بشكل أفضل من المحاولات السابقة لأنه لم يكتفِ بالثقة في ثقة نموذج اللغة؛ بل تطلب إثباتًا ماديًا بأن الهدف يمكن الوصول إليه قبل الالتزام بالفعل.
لإثبات أن هذا النظام يعمل خارج محاكاة الكمبيوتر، نشره الفريق على روبوت بشري حقيقي يبلغ طوله 1.74 مترًا. هذا الروبوت، المجهز بكاميرات وأجهزة استشعار، كُلف بالتنقل في مبنى حقيقي. في إحدى التجارب، قيل للروبوت أن يمشي إلى تقاطع، ثم ينعطف يسارًا، ويتوقف عند سلة مهملات بالقرب من موزع مياه، ثم يجد ثلاجة. وفي تجربة أخرى، كان عليه تحديد موقع طفاية حريق حمراء دون معرفة شكلها بالضبط مسبقًا. استخدم الروبوت نفس نظام "الحزام" لإدارة هذه المهام، والتحقق من أدلته البصرية في كل خطوة. لقد نجح في تتبع تقدمه، وتحديد المعالم، والتحقق من نقاط التوقف بناءً على ما رآه بالفعل. إن حقيقة أن البرنامج نفسه استطاع توجيه الروبوت عبر مسار معقد ثم البحث عن جسم غير معروف دون أي إعادة برمجة أظهرت مرونة هذا النهج.
يشير نجاح HarnessVLN إلى أن مستقبل تنقل الروبوتات قد لا يكمن في تعليم الآلات كل مسار ممكن، بل في منحها طريقة موثوقة للتحقق من عملها الخاص. ومن خلال معاملة أفعال الروبوت كسلسلة من الخطوات المتحقق منها بدلاً من كونها تخمينًا مستمرًا واحدًا، يتجنب النظام العثرات الشائعة المتمثلة في الضياع أو تكرار الأخطاء. وجد الباحثون أن الجمع بين مخطط لغوي قوي ومدير صارم قائم على الأدلة سمح للروبوت بالتعامل مع مهام لم يسبق له رؤيتها. وبينما لا يزال النظام يعتمد على قواعد محددة مسبقًا لكيفية التحقق من الذاكرة وتحديثها، فإن النتائج تظهر أن طريقة التنسيق هذه هي خطوة عملية نحو روبوتات يمكنها حقًا التحرك والعمل في العالم البشري. ولا يزال المشروع مفتوحًا لمزيد من التطوير، حيث يخطط الفريق لاستكشاف كيف يمكن لهذه الأنظمة أن تتعلم وتتكيف بشكل أكبر من خلال التفاعل في البيئات المفتوحة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.