Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
यह सर्वेक्षण एम्बोडीड मैनिपुलेशन (embodied manipulation) में विजन-लैंग्वेज-एक्शन (VLA) मॉडलों की दक्षता में सुधार करने के लिए हालिया दृष्टिकोणों की व्यवस्थित रूप से समीक्षा और वर्गीकरण करता है, जो मॉडल आर्किटेक्चर, धारणा (perception), एक्शन जनरेशन, और प्रशिक्षण/अनुमान (training/inference) रणनीतियों में कम्प्यूटेशनल और मेमोरी संबंधी मांगों को कम करने पर केंद्रित है।