GVLA: Geometric inductive bias for Vision-Language-Action Models
यह शोध पत्र GVLA को प्रस्तुत करता है, जो एक कैमरा-जागरूक ज्यामितीय मॉड्यूल है जो बिना डेप्थ सेंसर की आवश्यकता के रे इम्बेडिंग्स (ray embeddings) और क्रॉस-व्यू फ्यूजन के माध्यम से विज़न-लैंग्वेज-एक्शन मॉडल्स में कैलिब्रेटेड 3D संरचना को इंजेक्ट करता है, जिससे विविध बेंचमार्क और वास्तविक दुनिया की सेटिंग्स में रोबोट मैनिपुलेशन प्रदर्शन में महत्वपूर्ण सुधार होता है।