Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines
تجادل هذه الدراسة المسحية بأن مستقبل نماذج الرؤية واللغة والعمل (VLA) يعتمد على التعامل مع البنية التحتية للبيانات — وتحديداً مجموعات البيانات، والمعايير المرجعية، ومحركات البيانات — كأولوية بحثية أساسية للتغلب على القيود الحالية في قابلية التوسع، والتعميم، والتجذر الفيزيائي.