GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
يُعد GaussVLA نموذجاً للرؤية واللغة والعمل يعتمد على بنية Mamba وفعالية في استخدام المعلمات، حيث يعزز الاستدلال المكاني عبر تقديم مُرمز غاوسي مكاني (Gaussian Spatial Tokenizer) لتحويل الميزات ثنائية الأبعاد إلى رموز غاوسية ثلاثية الأبعاد مدمجة، ووحدة تسلسل أفكيمدركة للعمق (Depth-Aware Chain-of-Thought) للاستدلال الهندسي المنظم، محققاً أداءً هو الأفضل في فئته على معيار LIBERO بـ 200 مليون معلمة فقط.