FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model
यह शोधपत्र FurnitureVLA प्रस्तुत करता है, जो एक विजन-लैंग्वेज-एक्शन मॉडल है जो वास्तविक-पैमाने के, दीर्घ-अवधि वाले द्विपक्षीय फर्नीचर असेंबली को सक्षम बनाता है, जो सिमुलेशन और वास्तविक दुनिया के सत्यापन दोनों में बेसलाइन की तुलना में सफलता दर में महत्वपूर्ण सुधार प्राप्त करने के लिए एक प्रोग्रेस-एन्हांस्ड आर्किटेक्चर और उच्च-गुणवत्ता वाले टेलीऑपरेटेड प्रदर्शनों का लाभ उठाता है।