← أحدث الأبحاث
💻 computer science

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

يُعد LightNav-0 نموذجاً مدمجاً وعاماً للملاحة المتجسدة، يستفيد من واجهة رموز موحدة لاستحضاء ومواءمة الذكاء المكاني للنماذج اللغوية البصرية مسبقة التدريب مع التحكم الروبوتي، محققاً أداءً رائداً في أحدث التقنيات وتعميماً صفري القدرة عبر مهام وبيئات وهياكل متنوعة دون الحاجة إلى رؤوس تنبؤ خاصة بالمهام.

المؤلفون الأصليون: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pa
نُشر 2026-09-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات في التحرك عبر العالم بنفس السهولة التي يتحرك بها البشر. فبينما يمكن للشخص أن يدخل غرفة، ويرصد كرسياً أزرق، ويتنقل حول طاولة بينما يستمع إلى تعليمات منطوقة، غالباً ما يرى الروبوت مجرد مزيج فوضوي من البكسلات والأصوات. ولجسر هذه الفجوة، أمضى العلماء سنوات في بناء أنظمة متخصصة تعامل الرؤية والتفكير والحركة كمهام منفصلة؛ حيث قد يتعرف جزء من البرنامج على الأشياء، ويرسم جزء آخر خريطة، ويقرر جزء ثالث الاتجاه الذي يجب أن ينعطف إليه. هذا النهج يعمل جيداً في البيئات المحكومة، ولكنه غالباً ما يفشل عندما يواجه الروبوت غرفة جديدة، أو نوعاً مختلفاً من الآلات، أو أمراً معقداً. لقد كان التحدي يكمداً في إنشاء "عقل واحد" يمكنه فهم المشهد، والتفكير في مكان الذهاب، والتحكم في الجسد للوصول إلى هناك، كل ذلك في آن واحد.

قدم فريق من الباحثين الآن نظاماً جديداً يسمى LightNav-0 يحاول حل هذه المعضلة من خلال تعليم الروبوت التفكير كما يفعل البشر: عبر النظر إلى صورة، والإشارة إلى المكان الذي يريد الذهب إليه، ثم التحرك. وبدلاً من بناء أدوات منفصلة لكل مهمة، أخذ الباحثون نموذجاً حاسوبياً ضخماً مدرباً مسبقاً يفهم اللغة والصور بالفعل وعلموه كيفية التنقل. لا يحتاج هذا النموذج إلى إعادة برمجة لكل روبوت جديد أو كل غرفة جديدة؛ فهو ببساطة ينظر إلى ما يراه، ويستمع إلى الأمر، ويقرر المسار. والنتيجة هي نظام مدمج يمكنه اتباع التعليمات، وإيجاد أشياء محددة، وحتى تتبع الأهداف المتحركة، كل ذلك أثناء العمل على أنواع مختلفة من الآلات، من العربات ذات العجلات إلى الروبوتات رباعية الأرجل، دون الحاجة إلى أي تعديلات خاصة.

إن جوهر هذا النظام هو طريقة ذكية لترجمة أفكار الروبوت إلى أفعال. تخيل روبوتاً ينظر إلى شاشة تعرض ردهة. عندما يسمع الأمر "اذهب إلى لوحة قائمة الطعام الزرقاء بجوار المبنى الحجري"، فإنه لا يبدأ فوراً بتحريك عجلاته. أولاً، يستخدم منطقه الداخلي للإشارة إلى نقطتين محددتين على الشاشة؛ تشير إحدى النقطتين إلى مكان آمن للتحرك نحوه، مثل بقعة أرضية مفتوحة، بينما تحدد النقطة الأخرى الهدف الفعلي، وهو اللوحة الزرقاء. عملية الإشارة هذه تعمل كلغة مشتردة وواضحة بين عقل الروبوت وجسده. وبمجرد تحديد هاتين النقطتين، يتنبأ الروبوت بمسار قصير مكون من عشر خطوات للوصب إلى تلك النقطة. ثم ينفذ هذا المسار، وينظر إلى المشهد الجديد، ويكرر العملية. ومن خلال تقسيم الرحلة إلى هذه الخطوات الصغيرة والمدروسة، يمكن للروبوت التعامل مع البيئات المعقدة دون أن يضل طريقه أو يصاب بالارتباك.

لتعليم الروبوت هذه المهارة، لم يكتفِ الباحثون بعرض بعض الأمثلة عليه، بل أنشأوا مكتبة تدريب ضخمة تحتوي على أكثر من 2,000 مشهد مختلف وأكثر من 4,000 ساعة من بيانات التنقل. تضمنت هذه المكتبة تعليمات للعثور على الأشياء، واتباع الأشخاص، والتحرك في المساحات الداخلية والخارجية على حد سواء. تمت عملية التدريب على مراحل؛ أولاً، تم تعليم النموذج فهم العلاقات المكانية والإشارة بدقة إلى الأشياء والمواقع في الصور. بعد ذلك، تعلم الجمع بين قدرة الإشارة هذه وأوامر الحركة الفعلية اللازمة للتنقل. وأخيراً، تم صقل النظام من خلال عملية التجربة والخطأ، حيث تعلم تصحيح أخطائه وتحسين تخطيط مساره بمرور الوقت. سمح هذا التدريب الصارم للنموذج بالتعميم، مما يعني أنه يمكنه تطبيق ما تعلمه من بيانات التدريب على مواقف جديدة تماماً لم يسبق له رؤيتها.

نتائج هذا العمل هامة لأنها تظهر أن نموذجاً حاسوبياً واحداً صغيراً نسبياً يمكنه التفوق على الأنظمة الأكبر والأكثر تعقيداً التي تعتمد على العديد من الأجزاء المتخصصة المختلفة. في اختبارات عبر عشر بيئات محاكاة مختلفة، حقق النظام الجديد أعلى معدلات النجاح في اتباع التعليمات وإيجاد الأشياء، حتى عندما كان مسموحاً له فقط برؤية عرض كاميرا واحدة ودون الوصول إلى مستشعرات العمق أو خرائط جاهزة. لقد أدى أداءً جيداً في الغرف الداخلية، والمناطق الخارجية، وحتى في عوالم الألعاب ذات الأنماط البصرية المختلفة تماماً. ولعل الأمر الأكثر إثارة للإعجاب هو أن الباحثين اختبروا نفس البرنامج على أربعة روبوتات مادية مختلفة جداً: روبوت بشري، وروبوت رباعي الأرجل، وطائرة بدون طيار (درون)، ومركبة ذات عجلات. ودون تغيير سطر واحد من الكود أو إعادة تدريب النموذج، نجح النظام في توجيه جميع هذه الأنواع من الآلات عبر مهام واقعية، مثل اتباع شخص أو العثور على شيء محدد.

يتحدى هذا النهج الفكرة القديمة القائلة بأن الروبوتات تحتاج إلى عقل فريد لكل وظيفة جديدة أو نوع جسم جديد. فمن خلال استخدام طريقة موحدة حيث يشير الروبوت إلى أهدافه ثم يخطط مساراً قصيراً، أظهر الباحثون أن نظاماً واحداً مدمجاً يمكنه التعامل مع مجموعة واسعة من مهام التنقل. لا يعتمد النظام على السحر أو الحسابات الخفية والمعقدة؛ بل يتعلم ببساطة رؤية العالم، وفهم الأمر، والإشارة إلى الطريق للأمام. وبينما تم اختبار هذا العمل بشكل أساسي في عمليات المحاكاة والبيئات الواقعية المحكومة، فإن القدرة على نقل هذه المهارة عبر مختلف الروبوتات والإعدادات تشير إلى مستقبل يمكن فيه نشر الروبوتات في أماكن جديدة وإعطاؤها مهام جديدة دون الحاجة إلى إعادة برمجة مكثفة. يشير نجاح LightNav-0 إلى أن السبيل نحو روبوتات أكثر قدرة وتكيفاً قد لا يكمن في بناء آلات أكبر وأكثر تخصصاً، بل في تعليمها التفكير والإشارة بالطريقة البسيطة والمرنة التي يستخدمها البشر كل يوم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →