ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
تقدم الورقة البحثية ViSRA، وهو وكيل يعتمد على الفيديو ومتوافق مع البشر ولا يتطلب تدريباً، يستفيد من المعلومات المكانية الصريحة من النماذج الخبيرة لتعزيز قدرات الاستدلال المكاني ثلاثي الأبعاد للنماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير دون الحاجة إلى ما بعد التدريب أو تنسيق مجموعات البيانات يدوياً.