ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
تقدم الورقة البحثية ABot-N0، وهو نموذج تأسيسي موحد للرؤية واللغة والعمل يتميز ببنية هرمية "دماغ-عمل" (Brain-Action) وتم تدريبه على مجموعة بيانات ضخمة تضم 16.9 مليون مسار، مما يحقق أداءً هو الأفضل في فئته عبر خمس مهام ملاحة مجسدة متنوعة ويمكّن من تنفيذ مهام طويلة المدى وقوية في بيئات واقعية ديناميكية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيف يكون رفيقًا بشريًا مثاليًا. في الماضي، كان باحثو الروبوتات يبنون "متخصصين": روبوت واحد يمكنه فقط المشي إلى إحداثيات معينة، وآخر يمكنه فقط العثور على كوب أحمر، وثالث يمكنه فقط تتبع شخص ما. إذا أردت من الروبوت القيام بالمهام الثلاث معًا، كان عليك تبديل دماغه أو تشغيل ثلاثة برامج مختلفة في وقت واحد. كان الأمر يشبه امتلاك سيارة يمكنها القيادة فقط على الطرق السريعة، وسيارة منفصلة للطرق الوعرة، وسيارة ثالثة لمجرد ركن السيارة.
ABot-N0 هو حل شركة علي بابا لهذه المشكلة. فكر فيه كأنه "السكين السويسري" لأدمغة الروبوتات. إنه نموذج موحد وشامل يمكنه القيام بكل ما يتعلق بالتنقل، من العثور على مقهى محدد إلى تتبع صديق عبر حديقة مزدحمة، كل ذلك مع فهم اللغة البشرية المعقدة.
إليك تفصيل لكيفية عمله، باستخدام تشبيهات بسيطة:
1. "التوحيد الكبير": عقل واحد، وخمس قوى خارقة
بدلاً من امتلاك خمسة روبوتات مختلفة، فإن ABot-N0 هو روبوت واحد يتقن خمس مهارات أساسية:
- هدف النقطة (Point-Goal): "اذهب إلى تلك الإحداثيات الجغرافية". (مثل سائق تاكسي يتبع خريطة).
- هدف الكائن (Object-Goal): "ابحث عن كرسي". (مثل محقق يبحث في غرفة).
- اتباع التعليمات (Instruction-Following): "امشِ إلى المطبخ، ثم انعطف يسارًا، وتوقف عند الثلاجة". (مثل اتباع وصفة طعام).
- هدف نقطة الاهتمام (POI-Goal): "اذهب إلى مدخل ستاربكس". (مثل العثور على الباب الأمامي لمبنى معين).
- تتبع الشخص (Person-Following): "اتبع ذلك الشخص الذي يرتدي سترة حمراء". (مثل كلب وفيّ في نزهة).
2. البنية التحتية: "الدماغ" و"خبير الحركة"
يصف البحث بنية "الدماغ-الحركة". تخيل طيارًا يقود طائرة:
- الدماغ الإدراكي (الطيار): هذا نموذج لغوي كبير (مثل روبوت دردشة ذكي للغاية). ينظر إلى ما يراه الروبوت، ويقرأ تعليمات الإنسان، ويحدد ما الذي يجب فعله. إنه يستنتج منطقيًا: "الشخص يمشي بسرعة، لذا يجب أن أسرع"، أو "يبدو ذلك مقهى، لكن الباب مغلق، لذا يجب أن أنتظر".
- خبير الحركة (المساعد الطيار/المحرك): هذا الجزء لا يفكر؛ بل يتحرك. يأخذ خطة الطيار ويترجمها إلى حركات بدنية سلسة ودقيقة. يستخدم تقنية تسمى "مطابقة التدفق" (Flow Matching)، وهي تشبه راقصًا بارعًا يتعلم من آلاف الفيديوهات. بدلًا من مجرد تخمين مسار واحد، فإنه يفهم أن هناك طرقًا عديدة للمشي حول الكرسي (يسارًا، أو يمينًا، أو عبر المناورة) ويختار المسار الأكثر سلاسة.
3. محرك البيانات: "النادي الرياضي" للروبوت
لكي يصبح هذا الروبوت ذكيًا، لم يتعلم من مجرد ساعات قليلة من الممارسة. لقد بنى الباحثون محرك بيانات ضخمًا.
- المشاهد: أنشأوا عالمًا افتراضيًا يحتوي على 7,802 بيئة ثلاثية الأبعاد مختلفة. تخيل مكتبة تحتوي على كل أنواع المنازل، المكاتب، مراكز التسوق، المنتزهات، وتقاطعات المدن التي يمكنك تخيلها، وكلها مرقمنة بدقة عالية.
- التدريب: قاموا بتغذية الروبوت بـ 16.9 مليون مسار خبير. هذا يشبه عرض ملايين الساعات من فيديوهات البشر وهم يمشون بشكل مثالي عبر هذه الأماكن.
- الاستنتاج المنطقي: زودوه أيضًا بـ 5 ملايين عينة "تفكير". هذا يشبه وجود معلم يجلس بجانب الروبوت، ويشرح له لماذا اتخذ منعطفًا معينًا. "لقد انعطفت يسارًا هنا لأن الطريق الأيمن كان مغلقًا بمنطقة بناء". هذا يعلم الروبوت المنطق وراء الحركة، وليس الحركة نفسها فحسب.
4. "نظام الملاحة الوكيل": المدير في العالم الحقيقي
وضع دماغ ذكي في روبوت أمر جيد، لكن الحياة الواقعية فوضوية. الناس يغيرون آراءهم، الأبواب تُغلق، والحشود تظهر فجأة.
للتعامل مع هذا، بنوا نظامًا وكيلًا (Agentic System) (الوكيل هو مساعد ذكي).
- المخطط (The Planner): هذا هو مدير المشروع. إذا قلت له "أحضر لي كوكاكولا"، يقوم المخطط بتفكيك المهمة:
- أين أقرب متجر؟ (يستخدم الذاكرة).
- امشِ إلى هناك. (هدف النقطة).
- ابحث عن آلة البيع. (هدف الكائن).
- تحقق مما إذا كانت تحتوي على كوكاكولا. (الإجابة على الأسئلة البصرية - VQA).
- الذاكرة: يمتلك الروبوت "ذاكرة طبوغرافية" (Topo-Memory). إنها ليست مجرد خريطة ثابتة؛ بل هي ذاكرة حية. إذا كان الممر مغلقًا بصندوق اليوم، فسيتذكر الروبوت ذلك في المرة القادمة. إنه يعامل الخريطة كمفكرة يمكنه الكتابة فيها وتحديثها.
- التصحيح الذاتي: إذا حاول الروبوت الحصول على كوكاكولا من رف الوجبات الخفيفة وفشل، يقول "المتأمل الذاتي" (Self-Reflector): "انتظر، هذا لم ينجح. دعنا نجرب آلة البيع بدلًا من ذلك". إنه لا يصطدم فحسب؛ بل يفكر، يتكيف، ويحاول مرة أخرى.
5. النتيجة: روبوت يعمل بالفعل
اختبر الفريق هذا النظام على روبوت Unitree Go2 (روبوت رباعي الأرجل يشبه الكلب) في العالم الحقيقي.
- الاختبار: أرسلوه في مهام طويلة ومعقدة، مثل المشي من منزل، وعبور شارع مزدحم، ودخول مركز تسوق، والعثور على متجر محدد، ثم الجلوس على كرسي معين.
- النتيجة: لم يكتفِ ABot-N0 بالنجاح فحسب؛ بل حطم الأرقام القياسية. كان أكثر دقة، وأكثر أمانًا، وأفضل في اتباع القواعد الاجتماعية (مثل عدم المشي على العشب أو الاصطدام بالناس) من أي روبوت سابق.
الملخص
ABot-N0 هو طفرة لأنه توقف عن معاملة ملاحة الروبوت كمجموعة من الألغاز المنفصلة. بدلاً من ذلك، بنى دماغًا واحدًا ضخمًا وموحدًا يتعلم من مكتبة هائلة من التجارب، ويستنتج منطقيًا مثل البشر، ويتحرك بسلاسة مثل الراقص، ويتكيف مثل المساعد الذكي. إنه الفرق بين روبوت يمكنه فقط اتباع خط على الأرض وروبوت يمكن أن يكون رفيق سفر حقيقي لك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.