LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
تقدم هذه الورقة البحثية LRR-Bench، وهو معيار اصطناعي لتقييم نماذج الرؤية واللغة في مهام الفهم المكاني المطلق والثلاثي الأبعاد، كاشفةً أن النماذج الحالية تتخلف بشكل كبير عن الأداء البشري وتفشل غالباً تماماً في تحديات الاستدلال المكاني المعقدة.