Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
تقدم هذه الورقة إطار عمل جديداً متمحوراً حول نماذج اللغات الكبيرة متعددة الوسائط (MLLM) لوكلاء واجهة المستخدم الرسومية (GUI) المستقلين، يجمع بين تقدير (agentic-Q) وتحسين السياسة خطوة بخطوة لتمكين جمع البيانات ذاتي التوليد بكفاءة وتعزيز التعلم المستقر، مما سمح لنموذج Ovis2.5-9B بالتفوق على المنافسين الأكبر حجماً في اختبارات الملاحة والتمركز.