يُعد Robostral Navigate نموذجاً لغوياً بصرياً بـ 8 مليارات معلمة يحقق أداءً رائداً في الملاحة أحادية الكاميرا عبر هياكل روبوتية متنوعة، وذلك من خلال الاستفادة من وصفة تدريب قابلة للتوسع تضم 2.4 مليون مسار محاكى، وكفاءة التخزين المؤقت للبادئات، والتنبؤ بنقاط المسار في فضاء الصورة لإلغاء الحاجة إلى مستشعرات العمق أو الخرائط مسبقة البناء.
المؤلفون الأصليون:Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, AAbdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany
تخيل أنك تعلم روبوتاً ليكون مرشداً سياحياً. في عالم الروبوتات، يُطلق على هذا اسم "الملاحة المتجسدة" (embodied navigation)—وهي القدرة للآلة على فهم أمر منطوق مثل "اذهب إلى المطبخ" والتحرك فعلياً إلى هناك دون الاصطدام بالجدران. لفترة طويلة، كانت أفضل الأدلة السياحية تشبه رواد الفضاء رفيعي المستوى: فقد كانوا يحتاجون إلى معدات باهظة وثقيلة للقيام بعملهم. كانوا يرتدون نظارات ثلاثية الأبعاد خاصة (مستشعرات عمق)، ويحملون كاميرات متعددة مثل فريق أمني، أو يعتمدون على خرائط مرسومة مسبقاً للمبنى بأكل. وبينما كانت هذه الروبوتات جيدة، إلا أنها كانت أيضاً مكلفة، وهشة، ويصعب وضعها على طائرة بدون طيار بسيطة للتوصيل أو عجلة مستودع صغيرة. السؤال الكبير الذي كان العلماء يطرحونه هو: هل يمكننا بناء روبوت ذكي بنفس القدر ولكن باستخدام الأداة الأكثر بساطة وشيوعاً؟ الإجابة تكمن في كاميرا واحدة قياسية—من النوع الموجود في كل هاتف وروبوت اليوم—وعقل قوي بما يكفي ليدرك الباقي.
يقدم هذا البحث Robostral Navigate، وهو نوع جديد من عقول الروبوتات المصممة لحل لغز الملاحة باستخدام تلك الكاميرا القياسية الوحيدة فقط. فكر في الأمر كأنه روبوت لا يحتاج إلى خريطة ثلاثية الأبعاد أو ماسح ضوئي ليزري؛ بل يتعلم كيف "يشير" إلى الخطوة التالية في الرحلة بمجرد النظر إلى صورة. قام الباحثون ببناء "نموذج رؤية-لغة" (Vision-Language Model) يتكون من 8 مليارات معلمة (وهو ذكاء اصطناعي فائق الذكاء يمكنه القراءة والرؤية) وعلموه الملاحة من خلال إطلاعه على ملايين الأمثلة في محاكاة تشبه ألعاب الفيديو. وبدلاً من حساب عمليات رياضية معقدة حول كيفية التحرك بالأمتار، يقوم النموذج ببساطة بالإشارة إلى المكان الذي يريد الذهال إليه تالياً على الشاشة. وإذا كان الوجهة مخفية خلف زاوية ما، فإنه ينتقل إلى خطة بديلة تتمثل في التحرك للأمام مسافة محددة.
وجد الفريق أن هذا النهج البسيط قوي للغاية. فمن خلال تدريب النموذج على 2.4 مليون رحلة محاكاة عبر 350,000 مشهد مختلف، أنشأوا نظاماً ليس فقط أرخص وأسهل في البناء، بل هو أيضاً أذكى من العديد من الروبوتات التي تمتلك مستشعرات متطورة. وفي الاختبارات القياسية، حقق Robostral Navigate نسبة نجاح بلغت 77.4% في إيجاد طريقه، متفوقاً على أفضل الروبوتات ذات الكاميرا الواحدة السابقة بفارق كبير، بل وتفوق حتى على بعض الروبوتات التي استخدمت مستشعرات العمق أو كاميرات متعددة. لم يكن "السر" مجرد عملية الإشارة؛ بل كان خدعة تدريب جديدة جعلت عملية التعلم أسرع بـ 22 مرة، ومرحلة تعلم تعزيزي علمت الروبوت كيفية التعافي عندما يضل طريقه. والنتيجة هي روبوت يمكنه الانتقال من عربة بعجلات إلى آلة تمشي أو طائرة بدون طيار دون الحاجة إلى إعادة تعليمه، مما يثبت أنك لا تحتاج إلى مجموعة مستشعرات بمليون دولار لبناء روبوت حقيقي متعدد الأغراض.
ملخص تقني: Robostral Navigate
بيان المشكلة
يواجه نشر أنظمة الملاحة المجسدة (Embodied Navigation) على نطاق واسع عوائق كبيرة: فغالباً ما تعتمد أحدث الأساليب الحالية على نماذج استشعار ذات امتيازات (مستشعرات العمق، أو ليدار (LiDAR)، أو مجموعات كاميرات متعددة) أو خرائط مسبقة البناء. وتزيد هذه التبعيات من تكالديات الأجهزة، وتحد من التوافق مع مختلف الهياكل الروبوتية (المجنزرة، أو ذات العجلات، أو الجوية)، وتتطلب معايرة خاصة بكل بيئة. علاوة على ذلك، يتطلب تدريب هذه الأنظمة عادةً جمع بيانات واقعية مكلفة وواسعة النطاق. ويتمثل التحدي في تطوير وصفة للملاحة تقلل من افتراضات المستشعرات، وتعمم عبر مختلف الهياكل الروبوتية، وتتدرب بكفاءة باستخدام المحاكاة فقط.
المنهجية
Robostral Navigate هو نموذج رؤية ولغة (VLM) بـ 8 مليارات معلمة، مصمم لحل الملاحة المجسدة باستخدام تدفق من صور RGB أحادية اللون فقط. يقوم النظام بتفكيك الملاحة إلى مرحلتين متمايزتين: تخطيط عالي المستوى عبر نموذج رؤية ولغة (VLM)، وتحكم منخفض المستوى عبر سياسة الانتشار (Diffusion Policy).
1. بنية النموذج
مخطط الرؤية واللغة (8B VLM): النموذج الأساسي مستمد من نموذج رؤية ولغة كثيف مصمم للتموضع المكاني (الإشارة، العد، والتحديد الموضعي). يأخذ تعليمات باللغة الطبيعية وتاريخاً من إطارات RGB أحادية اللون كمدخلات.
الملاحة عبر الإشارة (Pointing): بدلاً من التنبؤ بإزاحات مترية مرتبطة بهندسة روبوت محددة، يتنبأ الـ VLM بنقاط المسار (Waypoints) عن طريق "الإشارة" إلى الموقع المستهدف التالي في عرض الكاميرا الحالي (إحداثيات الصورة u,v) وتغيير الاتجاه المطلوب (Δθ). يضمن هذا الصياغة في مساحة الصورة المتانة تجاه الخصائص الداخلية للكاميرا ومقياس المشهد.
الاحتياطي عند الإزاحة (Displacement Fallback): للتعامل مع الحالات التي يكون فيها الوجهة خارج مجال الرؤية (على سبيل المثال، تتطلب دوراناً)، يتنبأ النموذج بشكل مشترك بإزاحات مترية (Δx,Δy,Δθ) جنباً إلى جنب مع إحداثيات الإشارة. إذا كان الوجهة غير مرئية، فإنه يستبعد إحداثيات الصورة ويعتمد فقط على الإزاحة المترية.
سياسة الانتشار (121 مليون معلمة): يتم تحويل نقاط المسار المستنتجة من الـ VLM إلى أوامر حركية منخفضة المستوى بواسطة محول انتشار خفيف الوزن. تُخرج هذه السياسة مساراً كثيفاً لإزاحات ثنائية الأبعاد (2D) ودورات أحادية البعد (1D) بتردد 10 هرتز، والتي تُترجم بعد ذلك إلى عزوم دوران عالية التردد للمشغلات الميكانيكية عبر وحدة تحكم في تتبع الحركة.
2. استراتيجية التدريب
تم تصميم خط أنابيب التدريب لتحقيق أقصى قدر من الكفاءة والقابلية للتوسع، بالاعتماد كلياً على المحاكاة.
توليد البيانات: يتم تدريب النظام على حوالي 2.4 مليون مسار خبير عبر 350,000 مشهد محاكى (داخلي وخارجي). تتضمن عملية توليد البيانات أخذ عينات تعتمد على "أبعد نقطة" (Farthest-point sampling) لضمان تنوع مواضع البداية والهدف وتنوع تعقيدات المشهد.
التخزين المؤقت للبادئة (Prefix-Caching) وقناع الانتباه: لمعالجة عدم الكفاءة الحسابية للتدريب التسلسلي القياسي (حيث تتزايد تعقيدات الرموز كـ O(T2))، استخدم المؤلفون تقنية التخزين المؤقت للبادئة. يتم حزم حلقات كاملة في تسلسلات تدريب واحدة. كما تم استخدام قناع انتباه شجري لمنع النموذج من الاشتراط على الأفعال السابقة الحقيقية (Ground-truth actions) أثناء التدريب. وهذا ضرري لأن الأفعال السابقة الحقيقية غالباً ما تكون معلوماتية جداً للأفعال المستقبلية (خاصة بسبب نموذج أقرب نقطة مرئية)، وكان النموذج سيعتمد عليها بدلاً من تعلم التنبؤ المرتكز بصرياً. قلل هذا من عدد رموز التدريب بمقدار 22 ضعفاً، مما قلص وقت التدريب من شهور إلى أيام.
التعميم عبر الروبوتات: خلال توليد البيانات، يتم تغيير تكوينات الروبوت (الارتفاع، نصف القطر، وضع الكاميرا، الميل) عشوائياً. يسمين هذا يسمح للسياسات المتعلمة بالانتقال عبر هياكل مختلفة دون إعادة تدريب.
التعلم المعزز عبر الإنترنت (Online RL): بعد الضبط الدقيق الخاضع للإشراف (SFT)، يخضع النموذج لتعلم معزز عبر الإنترنت باستخدام CISPO (وهي طريقة لتقدير الميزة النسبية للمجموعة). يتفاعل الوكيل مع محاكي على مجموعة مختارة من المسارات "الصعبة" حيث فشلت سياسة الـ SFT. يتم تعريف دالة المكافأة كـ −max(2,dist_to_goal)، مما يحفز الوكيل على الوصول إلى الهدف وإصدار أمر STOP مع تجنب المناورات غير الضرورية بالقرب من الهدف.
المساهمات الرئيسية
الاعتماد الأدنى على المستشعرات: إثبات أن نموذج VLM بـ 8 مليارات معلمة يمكنه تحقيق أداء ملاحة رائد باستخدام كاميرا RGB واحدة فقط، مما يلغي الحاجة إلى مستشعرات العمق، أو ليدار، أو مجموعات كاميرات متعددة.
الإشارة في مساحة الصورة: تقديم آلية تنبؤ بنقاط المسار تعتمد على الإشارة تعمل في مساحة الصورة بدلاً من الإحداثيات المترية، مما يتيح بشكل طبيعي التعميم عبر الهياكل المختلفة دون إعادة معايرة.
وصفة تدريب فعالة: تطوير طريقة تدريب تعتمد على التخزين المؤقت للبادئة تقلل من تعقيد الرموز بمقدار 22 ضعفاً، مما يسمح بتدريب سياسات ملاحة واسعة النطاق في أيام بدلاً من شهور باستخدام بيانات المحاكاة فقط.
تكامل التعلم المعزز: التطبيق الناجح للتعلم المعزز عبر الإنترنت لتحسين قدرات الاستكشاف والتعافي، مما يسد الفجوة بين التقليد السلوكي والملاحة القوية طويلة المدى.
النتائج
تم تقييم النظام على اختبارات المن غرفة إلى غرفة في البيئات المستمرة (R2R-CE) و الغرفة عبر الغرفة (RxR-CE).
R2R-CE (التحقق غير المرئي): حقق Robostral Navigate معدل نجاح (SR) بنسبة 77.4% و نجاح مرجح بطول المسار (SPL) بنسبة 74.2%.
يتفوق هذا على أفضل خط أساس لكاميرا واحدة (Qwen-RobotNav-4B, 66.9% SR) بمقدار 10.5 نقطة.
كما يتفوق على أفضل نظام يعتمد على العمق/الكاميرات المتعددة (Qwen-RobotNav-8B, 72.1% SR) بمقدار 5.3 نقطة، رغم عدم استخدامه لأي مستشعرات إضافية.
RxR-CE (التحقق غير المرئي): حقق النموذج 75.1% SR و 68.7% SPL، متفوقاً على جميع خطوط الأساس ذات الكاميرا الواحدة، ومظهراً كفاءة مسار متفوقة مقارنة بالنماذج المدعومة بالعمق.
النشر عبر الروبوتات: تم نشر نفس أوزان النموذج بنجاح على منصتين مختلفتين (Galaxea R1 و Hiwonder JetAuto) بهياكل وإعدادات كاميرا مختلفة، مما أثبت صحة ادعاءات التعميم عبر الروبوتات.
الأهمية
تفترض الورقة أن Robostral Navigate يمثل وصفة قابلة للتوسع للملاحة العامة. ومن خلال الجمع بين المحاكاة واسعة النطاق، وخواروات التدريب الفعالة (التخزين المؤقت للبادئة)، والتعلم المعزز، يوضح المؤلفون أن الملاحة عالية الأداء لا تتطلب استشعار امتيازات. يشير العمل إلى أن نهج المستشعرات الدنيا، عندما يقترن بمنهجيات تدريب قوية، يمكن أن يتفوق على الأنظمة التي تستخدم أجهزة معقدة، مما يخفض الحاجز أمام نشر وكلاء مجسدين عامين عبر أجهزة متنوعة وبيئات جديدة.