StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
تُعد StarVLA قاعدة كود برمجية شاملة ومفتوحة المصدر ونمطية، صُممت لتوحيد أبحاث نماذج الرؤية واللغة والعمل (VLA) من خلال دمج نماذج خلفية متنوعة ونماذج فك تشفير الأفعال مع استراتيجيات تدريب قابلة لإعادة الاستخدام وواجهة تقييم معيارية لتعزيز قابلية التكرار وتسريع تطوير الوكلاء المتجسدين العامين.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول بناء روبوت طاهٍ عالمي يمكنه طهي أي شيء، في أي مكان، باستخدام أي وصفة.
في الوقت الحالي، يبدو عالم "الذكاء الاصطناعي المتجسد" (الروبوتات التي ترى، وتفكر، وتتحرك) فوضويًا بعض الشيء. الأمر يشبه مطبخًا يمتلك فيه كل طاهٍ مجموعة أدوات فريدة خاصة به، ويتحدث لغة مختلفة، ويتبع كتاب وصفات مختلفًا تمامًا.
- فريق بنى روبوتًا يتعلم من خلال القراءة (باست using نماذج الرؤية واللغة - Vision-Language Models).
- فريق آخر بنى روبوتًا يتعلم من خلال تخيل المستقبل (باستخدام نماذج العالم - World Models).
- جميعهم يستخدمون أكوادًا مختلفة، وطرق اختبار مختلفة، وطرقًا مختلفة لإخبار الروبوت بما يجب فعله.
إذا أردت مقارنتهم أو دمج أفضل أفكارهم، فستكون المهمة كابوسًا. الأمر يشبه محاولة مقارنة سيارة فيراري، ودراجة هوائية، ومركبة فضائية عبر جعلهم يتسابقون على مضمار لا يتسع إلا للدراجة الهوائية.
إليك StarVLA.
اعتبر StarVLA بمثابة مجموعة قطع "ليغو" (Lego) فائقة للأنظمة العصبية للروبوتات. إنها صندوق أدوات مفتوح المصدر يتيح للباحثين تركيب أدمغة وأجساد الروبوتات المختلفة مع بعضها البعض بطريقة معيارية، مما يجعل من السهل بناء واختبار ومقارنة الروبوتات.
إليك كيف يعمل StarVLA، مقسمًا إلى مفاهيم بسيطة:
1. هندسة "الليغو" (العمود الفقري + الرأس)
تخيل أن الروبوت يتكون من جزأين رئيسيين:
- الدماغ (العمود الفقري - Backbone): هذا هو الجزء الذي يرى العالم ويفهم اللغة. قد يكون دماغًا "قارئًا" (مثل دودة كتب ذكية) أو دماغًا "متخيلاً" (مثل حالم يتوقع ما سيحدث بعد ذلك).
- الأيدي (رأس الحركة - Action Head): هذا هو الجزء الذي يحرك أذرع الروبوت بالفعل لالتقاط كوب أو فتح باب.
في الماضي، إذا أردت تغيير الدماغ، كان عليك غالبًا إعادة بناء الروبوت بالكامل. مع StarVLA، يكون الاتصال بين الدماغ والأيدي عبارة عن قابس معياري.
- يمكنك توصيل دماغ "قارئ" بيد "سريعة".
- يمكنك استبداله بدماغ "متخيل" ويد "حذرة".
- السحر: نظرًا لأن القابس معياري، يمكنك مزج وتوفيق هذه الأجزاء فورًا لمعرفة أي تركيبة تعمل بشكل أفضل، دون الحاجة لإعادة بناء الآلة بالكامل.
2. المترجم العالمي (الواجهة الموحدة)
حاليًا، إذا أردت اختبار روبوت في مهمة محددة (مثل "ضع الملعقة على المنشفة")، فغالبًا ما يتعين عليك كتابة كود مخصص للتحدث مع ذلك الروبوت تحديدًا. الأمر يشبه الحاجة إلى جهاز تحكم عن بعد مختلف لكل علامة تجارية من أجهزة التلفاز.
يعمل StarVLA كـ جهاز تحكم عن بعد عالمي.
- يتحدث بلغة واحدة إلى الروبوت (الدماغ).
- يتحدث بلغة واحدة إلى بيئة الاختبار (التلفاز).
- سواء كنت تختبر في محاكاة لألعاب الفيديو أو على روبوت حقيقي في مختبر، فإن الكود لا يتغير. أنت فقط تقوم بتوصيل الروبوت، وهو يعمل. وهذا يجعل من السسه للغاية اختبار الأفكار الجديدة مقابل الأفكار القديمة بشكل عادل.
3. "السكين السويسري" للتدريب
StarVLA ليس مخصصًا للبناء فحًا؛ بل هو مخصص لتعليم الروبوت أيضًا.
- وضع "المتخصص": يمكنك تعليم الروبوت مهمة واحدة محددة فقط (مثل تكديس المكعبات فقط).
- وضع "العام": يمكنك تعليم روبوت واحد القيام بكل شيء في وقت واحد. يسمح لك StarVLA بخلط البيانات من روبوتات مختلفة (بعضها بذراع واحدة، وبعضها بذراعين) ومهام مختلفة (طهي، تنظيف، تنظيم) في جلسة تدريب واحدة ضخمة.
- "حافظ الذاكرة": أحيانًا، عندما تعلم روبوتًا كيفية الحركة، فإنه ينسى كيفية فهم اللغة. يحتوي StarVLA على خدعة تدريب خاصة تعلم الروبوت التحرك بينما يحافظ على مهاراته اللغوية حادة، حتى لا يصبح روبوتًا "غبيًا".
4. "مضمار السباق" (الاختبارات المعيارية)
لمعرفة من هو الروبوت الأفضل، تحتاج إلى سباق عادل. يحتوي StarVila على مضامير مدمجة لأكثر خمسة تحديات روبوتية شعبية (مثل LIBERO و SimplerEnv، إلخ).
- بدلًا من أن يقوم الباحثون ببناء مضامير سباق فوضوية خاصة بهم، يوفر StarVLA استادًا معياريًا.
- يمكنك تشغيل الروبوت الخاص بك على المضمار، وسيخبرك بالضبط كيف كان أداؤه مقارنة بالآخرين، باستخدام نفس القواعد للجميع.
لماذا يهم هذا؟
قبل StarVLA، كان مجال تعلم الروبوتات يشبه برج بابل — الجميع يتحدث لغة مختلفة، مما يجعل من المستحيل الاتفاق على من يحرز تقدمًا فعليًا.
StarVLA هو اللغة المشتركة.
- يخفض الحاجز أمام الباحثين الجدد لبدء البناء.
- يتيح لنا مقارنة التفاح بالتفاح (أو الروبوتات بالروبوتات).
- يساعدنا في معرفة ما إذا كان الدماغ "القارئ" أفضل من الدماغ "المتخيل"، أو ما إذا كانا يعملان بشكل أفضل معًا.
باختصار: StarVLA هو "نظام التشغيل" لمستقبل ذكاء الروبوتات. إنه يحول الفوضى غير المتوافقة للأكواد إلى منصة نظيفة، ونمطية، وقوية حيث يمكننا أخيرًا بناء روبوتات يمكنها حقًا فهم عالمنا والتفاعل معه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.