MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
تعد MergeVLA بنية رؤية-لغة-فعل (Vision-Language-Action) موجهة نحو الدمج، تتغلب على عدم قابلية دمج خبراء الـ VLA الحاليين من خلال إدخال محولات LoRA متفرقة مقنعة بالمهام وخبراء أفعال يعتمدون على الانتباه المتقاطع فقط، مما يمكّن عميلاً عاماً واحداً من التعامل بمتانة مع مهام وتجسيدات متنوعة دون تدهور في الأداء.