GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
GaussVLA एक पैरामीटर-कुशल, Mamba-आधारित विजन-लैंग्वेज-एक्शन मॉडल है जो 2D फीचर्स को कॉम्पैक्ट 3D गॉसियन टोकन में बदलने के लिए एक गॉसियन स्पेशियल टोकेनाइज़र और संरचित ज्यामितीय तर्क के लिए एक डेप्थ-अवेयर चेन-ऑफ-थॉट मॉड्यूल पेश करके स्थानिक तर्क (spatial reasoning) को बढ़ाता है, जिससे केवल 200M पैरामीटर्स के साथ LIBERO बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।