← أحدث الأبحاث
💻 computer science

Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning

يقدم البحث HyperClick، وهو إطار عمل مبتكر يستفيد من التعلم التعزيزي ذاتي النقد لتحسين دقة تحديد عناصر واجهة المستخدم الرسومية (GUI grounding) ومواءمة الثقة في آن واحد، مما يتيح وكلاء واجهة مستخدم رسومية ذاتية أكثر موثوقية وطمأنينة.

المؤلفون الأصليون: Shaojie Zhang, Pei Fu, Ruoceng Zhang, Jiahui Yang, Anan Du, Xiuwen Xi, Shaokang Wang, Ying Huang, Bin Qin, Zhenbo Luo, Jian Luan

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shaojie Zhang, Pei Fu, Ruoceng Zhang, Jiahui Yang, Anan Du, Xiuwen Xi, Shaokang Wang, Ying Huang, Bin Qin, Zhenbo Luo, Jian Luan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً، ولكنه مغرور قليلاً. مهمته هي النظر إلى شاشة هاتفك أو حاسوبك والنقر بالضبط حيث تطلب منه ذلك. إذا قلت له: "انقر على زر الخصوصية"، فعلى الروبوت أن يجد ذلك الزر ويضغط عليه.

المشكلة هي أن هذا الروبوت غالباً ما يعتقد أنه عبقري حتى عندما يكون مخطئاً. قد ينقر في المكان الخطأ، لكنه سيقول لك بثقة: "أنا متأكد بنسبة 99% أن هذا هو الزر الصحيح!". وهذا أمر خطير، لأنه إذا كان الروبوت مخطئاً ولكنه واثق من نفسه، فقد ينقر على الشيء الخطأ، مما يتسبب في خطأ يفسد مهمتك بالكامل.

تقدم هذه الورقة البحثية طريقة تدريب جديدة تسمى HyperClick لإصلاح هذا الأمر. وإليك كيف تعمل، باستخدام بعض التشبيهات البسيطة:

المشكلة: "الطالب المغرور"

فكر في نماذج الذكاء الاصطناعي الحالية كأنها طالب يؤدي امتحاناً. إنه يجيب على كل الأسئلة، ولكنه غالباً ما يقدم إجابة خاطئة وهو يصرخ: "أنا متأكد تماماً أنني على صواب!".

  • المشكلة: وجد الباحثون أن نماذج الذكاء الاصطناعي هذه سيئة جداً في معرفة متى تكون غير متأكدة. إنها "مغرورة بالثقة". إذا كانت مخطئة، فإنها لا تزال تقول إنها متأكدة بنسبة 90%. وهذا يجعل من الصعب على البشر الوثوق بها أو معرفة متى يتدخلون للمساعدة.

الحل: "النقد الذاتي" مع مكافأة مزدوجة

ابتكر المؤلفون نظاماً جديداً يسمى HyperClick يعلم الروبوت أن يكون صادقاً بشأن ثقته بنفسه. لقد استخدموا تقنية تسمى التعلم التعزيزي ذاتي النقد (SCRL).

تخيل معلماً يدرب طالباً باستخدام قاعدتين محددتين (للمكافأة):

  1. مكافأة "هل أصبت الهدف؟":

    • إذا نقر الروبوت على الزر الصحيح، يحصل على نقطة. إذا نقر على زر خاطئ، يحصل على صفر. هذه هي الطريقة القياسية لتدريب الروبوتات.
    • التشبيه: هذا يشبه مدرب كرة السلة الذي يقول: "إذا دخلت الكرة في السلة، ستحصل على نقطة".
  2. مكافأة "الأمانة" (الجزء الجديد):

    • هذا هو المكون السحري. يجب على الروبوت الآن أن يحدد مدى تأكده قبل أن ينقر.
    • إذا نقر الروبوت في المكان الصحيح، يجب أن يقول: "أنا متأكد جداً (ثقة عالية)".
    • إذا نقر في المكان الخاطئ، يجب أن يقول: "لست متأكداً جداً (ثقة منخفضة)".
    • التحول: إذا نقر في المكان الخطأ وقال: "أنا متأكد بنسبة 100%!"، فسيتم عقابه. وإذا نقر في المكان الصحيح وقال: "أنا أخمن فقط"، فسيحصل أيضاً على درجة أقل.
    • التشبيه: المعلم الآن يقول: "لن تحصل على الدرجة الكاملة إلا إذا تطابقت ثقتك مع أدائك. إذا أخطأت في التصويب، يجب أن تعترف بأنك كنت تخمن. وإذا أصبت الهدف، يمكنك القول إنك كنت متأكداً".

كيف يعمل الأمر في الواقع

ينشئ النظام "خريطة ثقة" لكل شاشة.

  • الهدف: تخيل أن الزر الصحيح هو مركز الهدف (Bullseye). مركز الهدف هو "ثقة 100%". وكلما ابتعدت عن المركز، تنخفض درجة الثقة.
  • التدريب: يتعلم الروبوت مراقبة نقرته الخاصة. إذا نقر بالقرب من المركز، فإنه يتعلم أن يقول: "ثقة عالية!". إذا نقر بعيداً، فإنه يتعلم أن يقول: "ثقة منخفضة".

النتائج

اختبر الباحثون هذا النظام على العديد من الشاشات الصعبة (مثل واجهات الكمبيوتر عالية الدقة وتطبيقات الهاتف المحمول).

  • الدقة: لا يزال الروبوت يحصل على الإجابات الصحيحة بنفس وتيرة أفضل الروبوتات الموجودة حالياً.
  • الأمانة: كان الفوز الكبير هو أن الروبوت أصبح أفضل بكثير في مطابقة ثقته مع أدائه الفعلي.
    • قبل: كان يخطئ ولكنه يقول إنه متأكد بنسبة 90%.
    • بعد: عندما يخطئ، يعترف قائلاً: "أنا متأكد بنسبة 40% فقط". وعندما يصيب، يقول: "أنا متأكد بنسبة 90%".

لماذا هذا مهم

هذا لا يعني أن الروبوت مثالي بعد، ولكنه يجعله موثوقاً.

  • ميزة "الامتناع": لأن الروبوت يمكنه الآن أن يقول: "أنا لست متأكداً بشأن هذه النقرة"، يمكن للإنسان (أو لنظام السلامة) التدخل وقول: "حسناً، لا تنقر على ذلك بعد، دعني أتحقق".
  • لا مزيد من الثقة العمياء: بدلاً من الثقة العمياء في روبوت قد يكون مخطئاً ولكنه واثق من نفسه، يمكنك الآن الوثوق بـ عدم تأكده. إذا قال إنه غير متأكد، فأنت تعلم أن عليك توخي الحذر.

الملخص

تقترح الورقة البحثية HyperClick، وهي طريقة تدريب تعلم أدوات النقر على الشاشات بالذكاء الاصطناعي أن تكون صادقة. إنها تجبر الذكاء الاصطناعي ليس فقط على إيجاد الزر الصحيح، بل وأيضاً على الإبلاغ بدقة عن مدى تأكده. هذا يمنع الذكاء الاصطناعي من ارتكاب الأخطاء بثقة، مما يجعله مساعداً أكثر أماناً وموثوقية لأتمتة مهام الحاسوب والهاتف الخاصة بك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →