HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
يُعد HiST-VLA نموذجاً هرمياً جديداً للرؤية واللغة والأفعال (Vision-Language-Action) يعتمد على البعد المكاني والزماني، وهو يعالج أوجه القصور في الإدراك المكاني ثلاثي الأبعاد والاستدلال العددي للقيادة الذاتية من خلال دمج الوعي الهندسي، والتناثر الديناميكي للرموز (dynamic token sparsification)، ومخطط يعتمد على المحولات الهرمية (hierarchical transformer-based planner) لتحقيق أداء رائد في اختبار NAVSIM v2.