ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models
يُعد ICI-VLA إطار عمل للتدريب والاسترجاع يُمكّن نماذج الرؤية واللغة والعمل (Vision-Language-Action) الثابتة من تحقيق تكيف سريع في زمن الاختبار باستخدام عينات قليلة، وذلك عبر تكييف توليد العمل بناءً على عروض توضيحية مجهرية متوافقة مكانيًا وزمانيًا وموسومة دلاليًا، مما يلغي الحاجة إلى تحديثات إضافية للتدرج مع التفوق بشكل ملحوظ على النماذج المرجعية في العديد من معايير التحكم الروبوتي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما عانت الروبوتات في سبيل تعلم مهام جديدة بسرعة. فغالباً ما تتطلب الأساليب التقليدية إعادة تدريب الروبوت من الصفر في كل مرة يواجه فيها وظيفة جديدة، وهي عملية تتطلب كميات هائلة من البيانات وقدرة حوسبية كبيرة. وهذا يجعل من الصعب نشر الروبوتات في بيئات متغيرة حيث يجب أن تتكيف آنياً. ويقدم نهج أحدث، يُعرف باسم "التعلم في السياق" (in-context learning)، مساراً مختلفاً؛ فبدلاً من إعادة تدريب "دماغ" الروبوت، يسمح هذا الأسلوب للنظام بالنظر إلى بضعة أمثلة لكيفية تنفيذ مهمة ما سابقاً واستخدام تلك المعلومات لمعرفة ما يجب فعله بعد ذلك، وكل ذلك دون تغيير إعداداته الداخلية. وبينما أحدثت هذه التقنية ثورة في كيفية فهم الحواسيب للغة والصور، فإن تطبيقها على الروبوتات الفيزيائية أكثر تعقيداً بكثير؛ إذ لا يتعين على الروبوت فهم مشهد بصري وتعليمة منطوقة فحسب، بل يجب عليه أيضاً تنسيق حركات جسده في الوقت الفعلي، حيث يمكن لأي عدم تطابق طفيف في التوقيت أو الموضع أن يتسبب في الفشل.
لقد طور باحثون في جامعة ووهان إطار عمل جديداً يسمى ICI-VLA نجح في جلب قدرة "التعلم من الأمثلة" هذه إلى الأذرع الروبوتية. يتيح نظامهم للروبوت مشاهدة بضعة مقاطع فيديو قصيرة لمهمة يتم تنفيذها، ثم تطبيق تلك المعرفة فوراً على موقف جديد مشابه. ويكمن الابتكار الرئيسي في كيفية تعامل النظام مع الأمثلة؛ فبدلاً من تغذية الروبوت بمقاطع فيديو كاملة وطويلة للمهمة، قام الباحثون بتفكيك هذه العروض التوضيحية إلى أجزاء صغيرة مصنفة تتطابق مع لحظات محددة في وظيفة الروبوت الحالية. ثم قاموا بتدريب أداة بحث متخصصة للعثور على الجزء الدقيق الذي يتوافق مع ما يراه الروبوت الآن، مما يضمن أن ينسخ الروبوت الحركة الصحيحة في الوقت الصحيح. ولمنع الروبوت من مجرد حفظ الأرقام في مقاطع الفيديو النموذجية، تم تدريب النظام على تجاهل النهاية الفعلية للمثال والتركيز بدلاً من ذلك على المشهد الحالي، مما يجبر الروبوت على فهم الفعل بدلاً من مجرد تكراره.
في تجاربهم، اختبر الفريق هذا النهج في بيئتين مختلفتين من المحاكاة وعلى روبوت فيزيائي حقيقي بذراعين. في المحاكاة الأولى، التي تضمنت مهاماً متنوعة مثل تحريك الأشياء وفتح الأدراج، حقق النظام نسبة نجاح بلغت 97.7 بالمائة. وفي محاكاة ثانية أكثر صعوبة تتضمن تنسيق العمل بين الذراعين، وصل النظام إلى 60.4 بالمائة، وهو تحسن كبير مقارنة بالأساليب السابقة. وعندما نقلوا النظام إلى إعداد واقعي يحتوي على كاميرات فيزيائية وأذرع روبوتية، نجح في إكمال مهام مثل فرز الأشياء ووضع العناصر في الأدراج بنسبة 83.2 بالمائة. وتشير هذه النتائج إلى أن الروبوت لا يحتاج إلى إعادة التدريب لكل وظيفة جديدة إذا تم تزويده بالأمثلة المناسبة والمطابقة جيداً للنظر إليها في اللحظة الراهنة.
يكمن جوهر هذا النجاح في كيفية إدارة النظام لتدفق المعلومات. فعندما يُعطى الروبوت تعليمة طويلة، مثل "افتح الدرج وضع الوعاء بداخله"، يقوم النظام بتفكيكها إلى خطوات أصغر. ثم يبحث في مكتبة من التجارب الماضية ليجد مقاطع قصيرة تتوافق مع الخطوة الحالية. على سبيل المثال، إذا كان الروبوت يحاول حالياً دفع درج للإغلاق، فإن النظام يجد مقطعاً قصيراً لدرج يتم دفعه للإغلاق، بدلاً من عرض مقطع لفتح الدرج. وهذا يضمن أن الروبوت ينظر إلى معلومات ذات صلة. كما قدم الباحثون تقنية تدريب حيث يقومون بإخفاء أجزاء من الأفعال النموذجية خلال مرحلة التعلم، مما يجبر الروبوت على الاعتماد على ما يراه الآن والسياق العام للمهمة، بدلاً من مجرد النسخ الأعمى للأرقام من فيديو المثال. وهذا يمنع الروبوت من الارتباك إذا كان موضع البداية مختلفاً قليلاً عن المثال.
تسلط الدراسة الضوء على أن جودة الأمثلة تهم أكثر من كميتها. فمن خلال اختيار هذه العروض التوضيحية القصيرة ومواءمتها بعناية مع مرحلة حركة الروبوت الحالية، يمكن للنظام التكيف فوراً. ووجد الباحثون أن استخدام ثلاثة أمثلة فقط كان كافياً لتحقيق ذروة الأداء؛ حيث إن إضافة المزيد لم يساعد بل جعل النظام في بعض الأحيان أقل فعالية. وهذا يشير إلى أن الروبوت يستفيد من بضعة أدلة ذات صلة عالية بدلاً من فيض من المعلومات. يعمل النظام من خلال إبقاء برنامج التحكم الرئيسي للروبوت ثابتاً وغير متغير، مع تعديل سلوكه فقط بناءً على الأمثلة المسترجعة. وهذا يعني أنه يمكن نشر الروبوت في مواقف جديدة دون الحاجة إلى جلسات إعادة تدريب مكلفة ومستهلكة للوقت.
بينما تبدو النتائج واعدة، يشير الباحثون إلى أن النظام لا يزال يعتمد على وجود مكتبة جيدة من العروض التوضيحية الماضية للاستقاء منها. فإذا واجه الروبوت موقفاً مختلفاً تماماً عما هو موجود في مكتبته، فقد يواجه صعوبة في العثور على مثال مفيد. بالإضافة إلى ذلك، فإن عملية بناء المكتبة وتدريب أداة البحث تتطلب عملاً كبيًراً خارج نطاق التشغيل قبل أن يمكن استخدام الروبوت. ومع ذلك، فإن النتائج تظهر مساراً واضحاً نحو جعل الروبوتات أكثر مرونة. فمن خلال التعامل مع التجارب الماضية كدليل مرجعي بدلاً من نص جامد، يمكن للروبوتات أن تتعلم التعامل مع التحديات الجديدة بمستوى من القدرة على التكيف كان بعيد المنال في السابق. ويشير العمل إلى أن مستقبل التحكم الروبوتي قد لا يكمن في بناء أدمغة أكثر ذكاءً من الصفر، بل في تعليمها كيفية التعلم من الأمثلة الصحيحة في الوقت الصحيح.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.