VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models
यह शोध पत्र VLA प्रस्तुत करता है, जो एक नियंत्रित अध्ययन है जो यह प्रदर्शित करता है कि एक मजबूत प्रीट्रेंड विजन-लैंग्वेज-एक्शन (VLA) बैकबोन को सेल्फ-अटेंशन के माध्यम से अपडेट किए गए सीखने योग्य मेमोरी टोकन के एक न्यूनतम सेट के साथ संवर्धित करने से, बिना किसी सहायक लॉस या जटिल आर्किटेक्चरल परिवर्तनों की आवश्यकता के, आंशिक रूप से दृश्यमान मैनिपुलेशन कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है, जबकि पूर्ण दृश्यता के तहत मजबूती बनाए रखी जाती है।