Efficient Block-Layer Parallel Inference for Vision-Language-Action on Hybrid Architectures
تقدم هذه الورقة إطار عمل هجين للاستدلال بين وحدة المعالجة المركزية ووحدة معالجة الرسومات يقوم بتقسيم نماذج الرؤية واللغة والعمل (VLA) عند طبقة الكتل لتفريغ الحوسبة إلى وحدة المعالجة المركزية عبر خط أنابيب غير متزامن، مما يقلل بشكل كبير من زمن استجابة الاستدلال واستهلاك ذاكرة وحدة معالجة الرسومات لتمكين النشر الناجح على منصات القيادة الذاتية محدودة الموارد.