← أحدث الأبحاث
💻 computer science

POINTS-GUI-G: GUI-Grounding Journey

تقدم هذه الورقة نموذج POINTS-GUI-G-8B، وهو نموذج متطور لتحديد عناصر واجهة المستخدم الرسومية (GUI grounding) تم تدريبه من نموذج أساسي ذي وعي مكاني ضئيل عبر الاستفادة من هندسة بيانات دقيقة، واستراتيجيات تدريب محسنة، وتعلم تعزيزي بمكافآت قابلة للتحقق لتحقيق أداء فائق عبر معايير قياسية متعددة.

المؤلفون الأصليون: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعد روبوت ذكي للغاية يمكنه قراءة النصوص والنظر إلى الصور. تريد تعليمه كيفية استخدام حاسوبك أو هاتفك، تماماً كما تفعل أنت. لكن هناك مشكلة: الروبوت يمكنه قراءة التعليمات ("انقر على الزر الأحمر")، لكنه لا يعرف أين يوجد الزر الأحمر فعلياً على الشاشة. الأمر يشبه إعطاء شخص ما خريطة لمدينة ولكن دون إخباره في أي شارع يقف حالياً.

تقدم هذه الورقة البحثية POINTS-GUI-G، وهي نسخة جديدة من ذلك المساعد الروبوتي الذي تعلم أخيراً كيف ينظر إلى الشاشة ويقول: "آه، لقد رأيت الزر! إنه هناك تماماً عند هذه الإحداثيات الدقيقة".

إليك كيف علم الباحثون هذا الروبوت ليصبح سيد الشاشة، مشروحاً عبر تشبيهات بسيطة:

1. نقطة البداية: لوحة بيضاء فارغة

أخذ معظم الباحثين الآخرين روبوتاً كان بارعاً بالفعل في العثور على الأشياء (مثل محقق متمرس) وقاموا فقط بإعطائه بعض الأدلة الإضافية. قرر مؤلفو هذه الورقة البدء بروبوت كان سيئاً في العثور على الأشياء. أرادوا بناء المهارة من الصفر، مثل تعليم طفل القراءة بدلاً من مجرد تصحيح إملاء مراهق. بدأوا بنموذج أساسي يسمى "POINTS-1.5" لم يكن لديه أي قدرة تقريباً على الإشارة إلى الأشياء على الشاشة.

2. ركائز النجوى الثلاث

لتحويل هذا الروبوت "الأعمى" إلى روبوت "بصير"، استخدموا ثلاث استراتيجيات رئيسية:

أ. تنظيف وتنظيم الكتب المدرسية (هندسة البيانات المنقحة)

تخيل أنك تحاول تعليم طالب باستخدام مجموعة من الكتب المدرسية. بعض الكتب تستخدم البوصة، وبعضها يستخدم السنتيمتر، وبعضها مكتوب بالإنجليزية، والبعض الآخر بالفرنسية. بعض الصفحات ممزقة وبعضها عليه خربشات في كل مكان. سيكون التعلم منها كابوساً.

قام الباحثون بثلاثة أشياء لإصلاح ذلك:

  • التوحيد القياسي: أخذوا جميع مجموعات البيانات الفوضوية والمختلفة وأجبرواهم على اتخاذ تنسيق واحد موحد. الآن، يتم قياس كل "إحداثي" (موقع) بنفس الطريقة، مثل تحويل كل شيء إلى مسطرة قياسية واحدة.
  • تقليل الضجيج: عملوا كمحررين صارمين. استخدموا أداة خاصة (تسمى OmniParser-v2) للتحقق من الكتب المدرسية. إذا قال الكتاب "الزر موجود هنا" بينما تظهر الصورة بوضوح أن الزر كان في مكان آخر، فإنهم يستبعدون تلك الصفحة. لقد احتفظوا فقط بالأمثلة المثالية.
  • رفع مستوى الصعوبة: بمجرد أن أصبح الروبوت جيداً في العثور على الأزرار الكبيرة والواضحة، بدأ الباحثون في تغذيته بألغاز "الوضع الصعب". أنشأوا شاشات بها أزرار صغيرة ومزدحمة وتخطيطات مربكة (مثل مكتب فوضوي مليء بالأوراق في كل مكان) لإجبار الروبوت على أن يصبح أكثر دقة وحدة.

ب. ضبط العيون (استراتيجيات التدريب المحسنة)

عادةً، عند تدريب نماذج الذكاء الاصطناعي هذه، تكون "العيون" (الجزء من الكمبيوتر الذي يعالج الصور) ثابتة في مكانها. أدرك الباحثون أنه بالنسبة للعثور على الأزرار على الشاشة، يجب أن تكون العيون مرنة.

  • إلغاء تجميد الرؤية: سمحوا لـ "العيون" بالتعلم والتكيف أثناء تعلم بقية الدماغ. سمح هذا للروبوت بأن يصبح أفضل في رصد التفاصيل الصغيرة.
  • اتساق الدقة: تخيل أنك تتدرب على مباراة كرة سلة عبر تسديد الكرات من مسافة 5 أقدام، ثم تذهب للمباراة الحقيقية حيث تبلغ المسافة 10 أقداء. ستخطئ الهدف. لاحظ الباحثون أن الروبوت يتدرب على صور صغيرة ومنخفضة الدقة، بينما يتم اختباره على شاشات ضخمة وعالية الدقة. قاموا بإصلاح ذلك بتدريب الروبوت على صور أكبر وأوضح حتى تصبح "رؤيته" جاهزة للواقع.

ج. نظام مكافأة ألعاب الفيديو (التعلم المعزز)

هذا هو الجزء الأكثر تميزاً. عادةً، يُستخدم التعلم المعزز (RL) لتعليم الروبوتات كيفية التفكير أو حل الألغاز المنطقية. هنا، استخدموه لتعليم الروبوت كيف يرى.

فكر في الأمر كأنه لعبة فيديو:

  • الروبوت يخمن مكان الزر.
  • الكمبيوتر يتحقق: "هل أصبت الزر؟"
  • نعم؟ +100 نقطة.
  • لا؟ 0 نقطة.

لأن الإجابة هي إما صح أو خطأ (لا يوجد "ربما")، يحصل الروبوت على ردود فعل واضحة جداً. وجد الباحثون أن حلقة "جرب، احصل على درجة، حاول مرة أخرى" جعلت الروبوت أكثر دقة بكثير من مجرد عرض الأمثلة له والقول "هذا صحيح".

النتيجة

من خلال الجمع بين هذه الطرق الثلاث، أصبح نموذج POINTS-GUI-G بطلاً في العثور على الأشياء على الشاشات.

  • تفوق على العديد من النماذج الأخرى التي كانت أكبر بكثير وأكثر تكلفة.
  • سجل درجات عالية للغاية في الاختبارات التي تقيس مدى قدرة الروبوت على العثور على الأزرار، والنصوص، والأيقونات على الهواتف، والحواسيب، والمواقع الإلكترونية.

باختصار: تظهر الورقة البحثية أنه إذا قمت بتنظيف بيانات التدريب الخاصة بك، وتركت "عيون" النموذج تتعلم بحرية، واستخدمت نظام مكافأة صارم يعتمد على "الصح أو الخطأ"، يمكنك بناء روبوت صغير وفعال يتفوق في التنقل عبر شاشة حاسوبك على العديد من البدائل الضخمة والمكلفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →