← أحدث الأبحاث
💻 computer science

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

تعد MergeVLA بنية رؤية-لغة-فعل (Vision-Language-Action) موجهة نحو الدمج، تتغلب على عدم قابلية دمج خبراء الـ VLA الحاليين من خلال إدخال محولات LoRA متفرقة مقنعة بالمهام وخبراء أفعال يعتمدون على الانتباه المتقاطع فقط، مما يمكّن عميلاً عاماً واحداً من التعامل بمتانة مع مهام وتجسيدات متنوعة دون تدهور في الأداء.

المؤلفون الأصليون: Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

نُشر 2026-03-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طباخاً آلياً عبقرياً. لقد دربت هذا الطباخ على صنع البيتزا المثالية (المهمة أ). ثم دربت نسخة أخرى من نفس الطباخ على صنع السوشي المثالي (المهمة ب). كلاهما خبير في مجاله.

الآن، تريد روبوتاً واحداً يمكنه صنع كل من البيتزا والسوشي دون الحاجة إلى عقلين منفصلين. تحاول "دمج" هذين الطباخين في طباخ خارق واحد.

المشكلة:
في عالم الروبوتات الحالية (المعروفة بنماذج الرؤية واللغة والعمل أو VLA)، يفشل هذا الدمج عادةً بشكل كارثي. إذا حاولت دمج "عقل البيتزا" و"عقل السوشي"، ستكون النتيجة روبوتاً مرتبكاً لا يستطيع القيام بأي منهما. قد يحاول وضع الببروني على لفافة سمك، أو قد يتوقف عن العمل تماماً.

لماذا؟ اكتشف مؤلفو الورقة البحثية سببين رئيسيين:

  1. صراع "العقل": الجزء من الروبوت الذي يرى ويفهم اللغة (نموذج الرؤية واللغة) يصبح متخصصاً جداً في البيتزا لدرجة أنه ينسى كيفية التعامل مع السوشي، والعكس صحيح. عندما تخلط بينهما، تتضارب التعليمات.
  2. صراع "اليد": الجزء الذي يحرك الأذرع فعلياً (خبير العمل) يتعلم الاعتماد على عاداته الداخلية. الأمر يشبه عازف بيانو تعلم عزف أغنية محددة عبر حفظ كل حركة أصابع كأنها سلسلة من ردود الفعل. إذا حاولت دمج ذلك مع عادات عازف جاز، ستنكسر هذه السلسلة وتتوقف الأيدي عن العمل.

الحل: MergeVLA
ابتكر المؤلفون بنية روبوت جديدة تسمى MergeVLA. فكر في الأمر كبناء روبوت باستخدام "مجموعة أدوات نمطية" بدلاً من عقل واحد صلب. إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. "لوحة التبديل الذكية" (أقنعة المهام - Task Masks)

تخيل أن عقل الروبوت عبارة عن مكتبة ضخمة. عندما يتعلم الروبوت صنع البيتزا، فإنه يكتب ملاحظات جديدة على صفحات محددة. وعندما يتعلم السوشي، فإنه يكتب على صفحات مختلفة.

  • الطريقة القد قديمة: تحاول لصق الكتابين معاً. فتتداخل الملاحظات، وتلغي بعضها البعض، وتصبح القصة بلا معنى.
  • طريقة MergeVLA: بدلاً من لصق الكتب، تضع "مفتاح تشغيل ذكي" على كل صفحة. عندما يحتاج الروبوت لصنع البيتزا، يقوم المفتاح بتشغيل صفحات البيتزا وإيقاف صفحات السوشي. وعندما يحتاج للسوشي، يقوم بتبديل المفتاح. بهذه الطريقة، لا تتصادم "ملاحظات البيتزا" مع "ملاحظات السوشي"، بل تتعايشان بسلام في نفس الكتاب.

2. "الخط المباشر" (الانتباه المشترك فقط - Cross-Attention Only)

كان لدى "أيدي" الروبوت (خبير العمل) عادة التحدث مع نفسه. "أنا أمسك بالسكين، لذا يجب أن أحرك مرفقي، مما يعني أنني يجب أن ألف معصمي..." هذا الثرثرة الداخلية جعلت الأيدي بارعة جداً في مهمة محددة ولكنها سيئة جداً في التكيف مع مهمة أخرى.

  • طريقة MergeVLA: قام المؤلفون بإزالة "الثرثرة الداخلية" (الانتباه الذاتي). الآن، الأيدي تستمع فقط إلى "العقل" (جزء الرؤية واللغة). العقل يقول: "التقط المكعب الأحمر"، والأيدي تنفذ الأمر فحسب. ولأن الأيدي لا تبالغ في التفكير في عاداتها الداخلية، يمكن مشاركتها بسهولة بين مهام مختلفة.

3. "المحقق السحري" (موجه وقت الاختبار - Test-Time Router)

ماذا لو اقتربت من الروبوت وقلت له: "اصنع شطيرة"، لكنك لم تخبره أي شطيرة؟ كيف سيعرف أي "مفتاح" يقلب؟

  • طريقة MergeVLA: يمتلك الروبوت "محققًا سحريًا" مدمجًا. ينظر إلى صورة المطبخ والكلمات التي قلتها. يتحقق بسرعة من "الفضاء الفرعي" الداخلي الخاص به (وهي طريقة متطورة لقول إنه يبحث في الأنماط الخفية في عقله) ليخمن: "آه، هذا يبدو كمهام 'بيتزا'!" أو "هذا يبدو كـ 'سوشي'!".
  • بمجرد أن يخمن المحقق المهمة، يقوم فوراً بقلب المفاتيح الصحيحة واستخدام مجموعة "الأيدي" المناسبة (رأس الخبير) للقيام بالعمل. وهو يفعل ذلك دون الحاجة لإعادة التدريب أو طلب المساعدة.

النتائج

اختبر الفريق هذا على روبوتات حقيقية ومحاكاة:

  • في المحاكاة: استطاع الروبوت المدمج التنقل بين ترتيب السرير، وتكديس المكعبات، ودفع الأشياء بنجاح بلغ 90%، وهو أداء يقارب كونه قد تدرب بشكل منفصل لكل مهمة.
  • في العالم الحقيقي: وضعوه على ذراع روبوتية حقيقية. تمكن من التقاط المكعبات، ودفعها، وتكديسها، حتى عندما كانت ألوان المكعبات مختلفة عما تدرب عليه.

الصورة الكبيرة

تعد هذه الورقة البحثية طفرة لأنها تثبت أننا لسنا بحاجة لتدريب روبوت ضخم وجديد لكل مهارة جديدة. بدلاً من ذلك، يمكننا تدريب "خبراء" صغيرين ومتخصصين، ودمجهم معاً باستخدام تصميم "لوحة التبديل" الذكي هذا، والحصول على روبوت عام يمكنه التعامل مع أي شيء تقريبًا. إنه الفرق بين امتلاك صندوق أدوات يحتوي على 100 أداة منفصلة، وبين امتلاك "سكين سويسري" يمكنه التحول فوراً إلى الأداة التي تحتاجها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →