← أحدث الأبحاث
💻 computer science

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

تقدم هذه الورقة البحثية HumanoidVLN، وهو محاكي ومعيار قائم على الفيزياء ومبني على منصة NVIDIA Isaac Sim، يعالج التحديات الفريدة للملاحة القائمة على الرؤية واللغة لمختلف الروبوتات البشرية من خلال دعم نماذج تجسد متعددة، وتوليد مجموعات بيانات تعليمات مراعية للتصادم، وإثبات قدرات قوية في النقل من المحاكاة إلى الواقع.

المؤلفون الأصليون: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

نُشر 2026-08-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا تكتفي فيه الروبوتات بالتدحرج على عجلات مثل سيارات التحكم عن بعد، بل تتعلم المشي والتعثر والتوازن على ساقين تماماً مثلنا. هذا هو أفق "الروبوتات البشرية" (humanoid robotics)، وهو مجال يحاول بناء آلات يمكنها التنقل في منازلنا ومكاتبنا الواقعية المليئة بالفوضى. لتعليم هذه الروبوتات كيفية الحركة، يستخدم العلماء مجالاً يسمى "الملاحة عبر الرؤية واللغة" (Vision-Language Navigation - VLN). فكر في الـ VLN كأنها لعبة "سيمون يقول" (Simon Says) للروبوتات: حيث يعطي إنسان تعليمات منطوقة مثل "امشِ إلى المطبخ وتوقف بجانب الثلاجة"، ويتحتم على الروبوت النظر حوله، وفهم الكلمات، والتحرك جسدياً إلى المكان الصحيح.

الجزء الصعب هو أن معظم الروبوتات اليوم يتم اختبارها في ألعاب الفيديو أو المحاكاة حيث يمكنها ببساطة "الانتقال الآني" من مكان إلى آخر، متجاهلة الجاذبية، والتوازن، وحقيقة أن المشي أمر صعب. لكن المشي الحقيقي مليء بالفيزياء؛ فإذا حاول الروبوت الدوران بسرعة كبيرة، فقد يسقط أرضاً. تعالج هذه الورقة البحثية السؤال الكبير: كيف نعلم روبوتات المشي هذه كيفية اتباع التعليمات عندما يتعين عليها المشي فعلياً دون السقوط، وكيف نختبرها بشكل عادل عندما يبدو كل روبوت ويتحرك بشكل مختلف قليلاً؟


الورقة البحثية: HumanoidVLN

أدرك الباحثون وراء هذه الورقة، HumanoidVLN، أن الطرق القديمة لاختبار ملاحة الروبوتات كانت تشبه اختبار سيارة فورمولا 1 على طريق ترابي ثم التظاهر بأنها دراجة هوائية. لقد بنوا "ملعباً" جديداً كلياً فائق الواقعية (محاكي) مخصصاً لروبوتات المشي. وبدلاً من السماح للروبوتات بالانتقال الآني، يجبرها نظامهم على الامتثال لقوانين الفيزياء. فإذا حاول الروبوت اتخاذ خطوة كبيرة جداً أو الدوران بحدة شديدة، فسوف يتعثر ويسقط بالفعل، تماماً كما قد يفعل إنسان حقيقي.

لقد أعدوا هذا الملعب بأربعة أنواع مختلفة من الروبوتات "البشرية". هذه الروبوتات ليست متشابهة؛ فهي تتراوح من روبوت قصير بطول 1.17 متر (حوالي طول مراهق طويل القامة) إلى عملاق بطول 1.80 متر. كما أنها تمتلك أعداداً مختلفة من المفاصل في سيقانها، مما يعني أن بعضها أكثر مرونة من غيرها. وضع الفريق نظام "تحكم هرمي" لإدارتها. يمكنك التفكير في هذا الأمر كفريق مكون من شخصين: "مدرب حركة" (سياسة التعلم المعزز) يعلم الروبوت كيفية التوازن والمشي دون السقوط، و"ملاح" (متتبع مسار) يخبر المدرب إلى أين يذهب بناءً على الأمر الصوتي البشري. يضمن هذا الإعداد أن يكون كل اختبار تحدياً فيزيائياً حقيقياً، وليس مجرد خدعة من خدع ألعاب الفيديو.

ولجعل الاختبار عادلاً وواقعياً، لم يكتفِ الفريق باستخدام نماذج ثلاثية الأبعاد كرتونية. بل بنوا 87 بيئة مختلفة، تتراوح من غرف المعيشة المريحة إلى أماكن العمل المزدحمة. كما حرصوا على أن تكون كل غرفة واسعة بما يكفي (100 متر مربع على الأقل) حتى لا تعلق الروبوتات في زوايا ضيقة مستحيلة. بعض هذه الغرف رسمها فنانون، بينما تم مسح بعضها الآخر من الواقع باستخدام تقنية رائعة تسمى "التشتت الغاوسي ثلاثي الأبعاد" (3D Gaussian Splatting)، والتي تحول الصور إلى عوالم ثلاثية الأبعاد. حتى أنهم حرصوا على أن تهتز وتتمايل رؤية الكاميرا تماماً كما ستحدث إذا كان روبوت حقيقي يمشي، مما يلتقط تمايل مشية ثنائية الأرجل.

كما تم صياغة التعليمات المقدمة للروبوتات بعناة. فبدلاً من مجرد كتابة جمل عشوائية، استخدموا نظام "التعليق متعدد الوكلاء" (Multi-Agent Annotation). تخيل فريقاً من كتاب الذكاء الاصطناعي، والمحررين، ومدققي الحقائق يعملون معاً. يقوم اثنان من "مولدات" الذكاء الاصطناعي بإنشاء مسار بناءً على فيديو لحركة الروبوت، ويقوم ذكاء اصطناعي "مُراجع" بالتحقق مما إذا كان المسار منطقياً مقابل الخريطة، ثم يقوم ذكاء اصطناعي "إعادة صياغة" بإعادة كتابة التعليمات بثلاثة أساليب مختلفة: رسمي (مثل المدير)، وطبيعي (مثل الصديق)، وعفوي (مثل رسالة نصية). وأخيراً، قام بشر حقيقيون بمراجعة العمل للتأكد من أن التعليمات آمنة ودقيقة. نتج عن ذلك 933 حلقة اختبار فريدة.

عندما أجروا الاختبارات، وجدوا بعض الأشياء المفاجئة. لقد اختبروا أربعة نماذج ملاحة مختلفة بالذكاء الاصطناعي لمعرفة أي منها الأفضل في اتباع التعليمات دون السقوط. أدى النموذج المسمى JanusVLN أفضل أداء، حيث نجح في الوصول إلى الهدف بنسبة 43.55% من المرات واتبع المسار بدقة. ومع ذلك، أظهرت النتائج أن جسم الروبوت مهم جداً. فالروبوت الأطول (Unitery H1) عانى أكثر بكثير من غيره، حيث سقط في ما يقرب من 70% من المحاولات مع بعض النماذج، بينما سقطت الروبوتات الأقصر والأكثر استقراراً بشكل أقل بكراثير. وهذا يثبت أنه لا يمكنك مجرد اختبار ذكاء اصطناٍ للملاحة على روبوت واحد وافتراض أنه سيعمل على روبوت آخر؛ فالشكل الفيزيائي والتوازن يغيران كل شيء.

كما أجرى الفريق اختباراً تجريبياً "من المحاكاة إلى الواقع" (sim-to-real)، حيث أخذوا أحد نماذج الذكاء الاصطنا هذه من الكمبيوتر ونقلوه إلى روبوت حقيقي في غرفة حقيقية. ووجدوا أن أداء الروبوت في محاكاة الكمبيوتر كان متطابقاً تقريباً مع أدائه في العالم الحقيقي، مع وجود ارتباط قوي جداً في مدى انحرافه عن المسار. يشير هذا إلى أن محاكاتهم القائمة على الفيزياء هي متنبئ موثوق للسلوك في العالم الحقيقي.

باختصار، HumanoidVLN ليس مجرد مجموعة بيانات جديدة؛ بل هو طريقة جديدة للتفكير في ملاحة الروبوتات. إنه يجادل بأنه إذا أردنا للروبوتات أن تمشي في شوارعنا وتنظف منازلنا، فعلينا أن نتوقف عن اختبارها في عالم لا يمكنها فيه السقوط. ومن خلال ترسيخ الاختبارات في فيزياء حقيقية وأجساد روبوتية متنوعة، توضح الورقة لنا أن الطريق نحو روبوت ماشٍ مفيد معبد بالتوازن، وليس مجرد الكود البرمجي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →