Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment
यह शोध पत्र विभिन्न एक्सीलरेटरों के माध्यम से मॉडल-हार्डवेयर ट्रेड-ऑफ का व्यवस्थित रूप से मूल्यांकन करके, एक दो-चरणीय अनुमान बाधा (two-phase inference bottleneck) की पहचान करके, और न्यूनतम प्रदर्शन हानि के साथ दोनों GPU और एज NPU पर महत्वपूर्ण गति प्राप्त करने के लिए DP-Cache और V-AEFusion तकनीकों का प्रस्ताव देकर, संसाधन-सीमित रोबोटों पर विजन-लैंग्वेज-एक्शन (VLA) मॉडल तैनात करने की चुनौतियों का समाधान करता है।