TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging
यह शोध पत्र TS-Mask VLA का प्रस्ताव करता है, जो एक रोबोटिक मैनिपुलेशन फ्रेमवर्क है जो ब्रिज अटेंशन (Bridge Attention) के साथ एक डिस्क्रीट डिफ्यूजन एक्शन एक्सपर्ट (Discrete Diffusion Action Expert) और एक टेम्पोरल-स्पेशियल 2D मास्किंग रणनीति को एकीकृत करके विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है ताकि ऑटोरिग्रेसिव टोकन प्रेडिक्शन की सीमाओं को दूर किया जा सके, जिससे उच्च दक्षता के साथ लॉन्ग-होरिज़न कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।