← أحدث الأبحاث
💻 computer science

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models

تعد StellaVLA إطار عمل للتكيف في وقت الاختبار لنماذج الرؤية واللغة والعمل، والتي تستفيد من العروض التوضيحية المهيكلة ومنعدمة التكلفة (مثل خطط المهام والحركة ثلاثية الأبعاد المنطوقة) كإرشاد داخل السياق لتعزيز التعميم عبر سيناريوهات خارج نطاق التوزيع والأنماط الجسمانية المختلفة، محققةً أداءً رائدًا في المعايير الرئيسية دون تأخير في الاستدلال.

المؤلفون الأصليون: Siyu Xu, Yunke Wang, Zijian Wang, Dihao Zhu, Chenghao Xia, Chengbin Du, Daochang Liu, Tao Huang, Chang Xu

نُشر 2026-08-13
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Siyu Xu, Yunke Wang, Zijian Wang, Dihao Zhu, Chenghao Xia, Chengbin Du, Daochang Liu, Tao Huang, Chang Xu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية صنع شطيرة. يمكنك أن تريه مقطع فيديو وأنت تقوم بذلك، وقد يحاول الروبوت تقليد حركات يدك بدقة. ولكن ماذا يحدث إذا كان الروبوت في مطبخ مختلف، وكان الخبز على اليسار بدلاً من اليمين، أو كان لدى الروبوت نوع مختلف من الأذرع؟ فجأة، يصاب الروبوت بالارتباك ويسقط الخبز. هذه مشكلة كبيرة في عالم الروبوتات، وتحديداً لنوع من الأنظمة الذكية تسمى نموذج الرؤية واللغة والعمل (VLA). هذه النماذج تشبه الروبوتات فائقة الذكاء التي يمكنها "رؤية" صورة، و"قراءة" أمر مثل "التقط الكوب"، ثم "القيام بالعمل" عبر تحريك ذراعها. المشكلة هي أنها غالباً ما تكون مثل الطلاب الذين حفظوا اختباراً معيناً عن ظهر قلب، لكنهم يفشلون عندما تتغير الأسئلة قليلاً. فهي تعاني عندما يتغير المشهد، أو يظهر جسم جديد، أو تتغير زاوية الكاميرا. ولإصلاح ذلك، يتعين على العلماء عادةً جمع آلاف الفيديوهات الجديدة وإعادة تدريب الروبوت، وهو أمر يستغرق وقتاً طويلاً جداً.

ولكن ماذا لو استطاع الروبوت فقط النظر إلى مثال واحد لشخص آخر يقوم بالمهمة وفهم "لماذا" كان يفعل ذلك، وليس فقط "ماذا" كان يفعل؟ هذا هو السؤال الكبير الذي يتناوله هذا البحث. فبدلاً من مجرد عرض فيديو خام لحركة يد، يريد الباحثون منح الروبوت "دليلاً مرجعياً" يشرح المنطق وراء الحركات. إنهم يريدون من الروبوت أن يتعلم الخطة (مثل "أمسك المقبض أولاً") بدلاً من مجرد تعلم البكسلات (مثل "حرك اليد إلى الإحداثيات X، Y، Z"). إذا تمكنوا من فعل ذلك، فقد يتمكن الروبوت من التعامل مع مواقف جديدة وغريبة دون الحاجة إلى إعادة تشغيل كاملة.

هنا يأيد StellaVLA، وهو إطار عمل جديد من الفريق التقني لشركة StellarEdge AI، والذي يحاول حل هذه المشكلة تحديداً. فكر في StellaVLA كأنه روبوت لا يكتفي بمشاهدة فيلم فحسب، بل يقرأ أيضاً التعليق الصوتي للمخرج أثناء مشاهدته.

إليك كيف يعمل: قام الفريق ببناء نظام يأخذ فيديو خاماً وغير منظم لروبوت أو إنسان يقوم بمهمة ما، ويقوم تلقائياً بتحويله إلى عرض توضيحي مهيكل. تخيل أخذ فيديو طويل ومربك لشخص يبني قلعة من "الليغو" وتحويله إلى دليل تعليمات واضح وخطوة بخطوة. يقوم النظام بتفكيك المهمة إلى "أهداف فرعية" (مثل "ابحث عن المكعب الأحمر") ويصف الحركات بلغة بسيطة (مثل "حرك الذراع للأعلى وإلى اليمين"). يحدث هذا تلقائياً، دون الحاجة لتدخل بشري لكتابة الملاحظات، باستخدام ذكاء اصطناعي قوي "يقرأ" الفيديو ويكتب القصة.

بمجرد تجهيز هذه الأمثلة "القائمة على القصص"، يتم تخزينها في مكتبة. وعندما يواجه الروبوت مهمة جديدة، فإنه لا يخمن فحسب؛ بل يبحث في هذه المكتبة، ويجد القصة الأكثر مطابقة، ويستخدمها كدليل. ولكن الجزء الذكي هنا هو أن الروبوت يتم تدريبه بطريقة خاصة. خلال "دراسته"، يتعين عليه القيام بشيئين في آن واحد: يجب عليه تعلم كيفية تحريك ذراعه (العمل) ويجب عليه أيضاً تعلم كيفية شرح الحركة بالكلمات (المنطق). إنه يشبه طالباً يتعين عليه حل مسألة رياضية و كتابة الخطوات للوص la درجة كاملة. هذا يجبر الروبوت على فهم منطق المهمة، وليس مجرد محاكاة الحركة.

ومع ذلك، يوضح البحث فرقاً مهماً للغاية حول كيفية عمل ذلك في العالم الحقيقي. فبينما يتعلم الروبوت من خلال التحدث إلى نفسه أثناء التدريب، فإنه يتوقف عن الكلام عندما يبدأ العمل فعلياً (الاستنتاج). يتم إيقاف تشغيل جزء "الشرح" في دماغه، ويبقى فقط جزء "الحركة" نشطاً. لماذا؟ لأن الكلام يستغرق وقتاً، والروبوتات تحتاج إلى التحرك بسرعة. ومن خلال إيقاف "الثرثرة" أثناء المهمة الفعلية، يظل الروبوت سريع الاستجابة للغاية، لكنه لا يزال يستفيد من الفهم العميق الذي اكتسبه أثناء الدراسة.

النتائج التي حققها هذا النهج واعدة للغاية، على الأقل في الاختبارات التي أجراها الباحثون. ففي سلسلة من عمليات المحاكاة تسمى LIBERO، حقق الروبوت نسبة نجاح بلغت 98.8%، وهي نسبة عالية جداً. وعندما اختبروه على لوحة صدارة أكثر صعوبة تسمى VLA-Arena، والتي تتضمن مواقف صعبة مثل وجود أشياء جديدة أو خلفيات مربكة، سجل StellaVLA نتيجة 0.63 إجمالاً. وقد تفوق هذا على نماذج قوية أخرى كانت تسجل حوالي 0.44 و 0.22. وحتى عندما اضطر الروبوت للتعامل مع إضاءة غريبة، أو زوايا كاميرا مختلفة، أو أشياء لم يسبق له رؤيتها من قبل (مثل وضع جزرة في وعاء عندما كان لون الجزرة مختلفاً)، فقد صمد بشكل أفضل من منافسيه، حيث سجل 85.1% في اختبار متانة يسمى LIBERO-Plus.

كما اختبر الباحثون هذا على ذراع روبوت حقيقي في العالم الحقيقي. ووجدوا أن الروبوت يمكنه استخدام عروض توضيحية من البشر، أو روبوتات أخرى، أو حتى محاكاة الواقع الافتراضي (XR) كدليل له. لم يكن يهم كيف يبدو "المعلم"؛ فما دام "سرد القصة" للمهمة واضحاً، يمكن للروبوت اتباعها. على سبيل المثال، عندما طُلب منه وضع مكعبات في درج لم يره من قبل، لم يفشل فحسب، بل أحرز تقدماً، حيث وصل إلى متوسط درجة 1.9 من 4، مما أظهر أنه كان يحاول اتباع الخطة حتى لو لم يتمكن من إتمام المهمة بشكل مثالي.

ومع ذلك، يحرص البحث على عدم الادعاء بأن هذا الحل السحري لكل المشكلات. فلا يزال الروبوت يعاني في المهام الطويلة والمعقدة جداً حيث تحتاج الخطة إلى تغيير في منتصف الطريق (مثل دخول شخص وتحريك المكعبات أثناء عمل الروبوت). في اختبارات "الأفق الطويل" هذه، انخفضت نسبة النجاح بشكل كبير، مما يشير إلى أنه رغم براعة الروبوت في اتباع قصة مكتوبة مسبقاً، إلا أنه ليس مستعداً تماماً لارتجال حبكة جديدة بالكامل في اللحظة ذاتها. كما أشار البحث إلى أنه بينما كان الروبوت ثابتاً جداً عند استخدام أنواع مختلفة من العروض التوضيحية (بشر مقابل روبوت)، أظهرت الاختبارات في العالم الحقيقي أنه لا يزال بحاجة إلى النوع المناسب من التوجيه ليعمل بشكل مثالي.

باختصار، يشير StellaVLA إلى أنه إذا كنت تريد من الروبوت أن يكون ذكياً وقادراً على التكيف، فلا ينبغي لك فقط أن تريه ما يجب فعله، بل يجب أن تخبره لماذا يفعله. ومن خلال تحويل الفيديوهات الخام إلى قصص مهيكلة ومنطقية وتعليم الروبوت هذا المنطق، يصبح النظام أفضل بكثير في التعامل مع المواقف الجديدة والصعبة. إنها خطوة نحو روبوتات لا تكتفي بنسخ حركاتنا، بل تفهم حقاً نوايانا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →