Learning GUI Grounding with Spatial Reasoning from Visual Feedback
تقدم هذه الورقة البحثية نموذج GUI-Cursor، الذي يعيد صياغة عملية تحديد المواقع في واجهات المستخدم الرسومية (GUI grounding) كمهة بحث تفاعلية باستخدام التغذية الراجعة البصرية من مؤشر (cursor) مُصوَّر والتعلم التعزيزي للتغلب على قيود التنبؤ بالإحداثيات في النماذج اللغوية البصرية (Vision Language Models)، محققاً بذلك أداءً فائقاً في مهام الاستدلال المكاني والمهام الوكيلية (agentic tasks) ببيانات تدريب أقل.