← أحدث الأبحاث
🤖 AI

DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding

يُعد DRS-GUI إطار عمل لا يتطلب تدريباً يعمل على تعزيز تحديد عناصر واجهة المستخدم الرسومية في النماذج اللغوية الكبيرة متعددة الوسائط، وذلك عبر توظيف مُدرِك واجهة مستخدم خفيف الوزن ومخطط إجراءات يعتمد على بحث شجرة مونت كارلو (MCTS) لمحاكاة أفعال إدراكية شبيهة بالبشر (التركيز، والتحول، والتشتت) ديناميكياً لتحديد العناصر ذات الصلة بالتعليمات بكفاءة في لقطات الشاشة المعقدة.

المؤلفون الأصليون: Yichao Liu, Huawen Shen, Liu Yu, Shiyu Liu, Zeyu Chen, Yu Zhou

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yichao Liu, Huawen Shen, Liu Yu, Shiyu Liu, Zeyu Chen, Yu Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على زر صغير ومحدد على شاشة كمبيوتر للنقر عليه. لكن هذه ليست مجرد شاشة عادية؛ إنها فوضى عالية الدقة مليئة بمئات الأيقونات، والقوائم، وصناديق النصوص. إذا طلبت من ذكاء اصطناعي قياسي أن "ينقر على زر الحفظ"، فقد يصاب بالارتباك بسبب الضجيج البصري، تماماً مثل شخص يحاول العثور على إبرة في كومة قش بينما يرتدي نظارات ضبابية.

تقدم هذه الورقة البحثية DRS-GUI، وهي طريقة جديدة "خالية من إعادة التدريب" تعمل كدليل ذكي يشبه البشر لمساعدة الذكاء الاصطناعي في العثด على المكان الصحيح على الشاشة دون الحاجة إلى إعادة تدريبه أو تعليمه مهارات جديدة.

إليك كيف تعمل، باستخدام تشبيهات بسية:

المشكلة: خطأ "المرة الواحدة"

تحاول نماذج الذكاء الاصطناعي الحالية عادةً تخمين موقع الزر في قفزة واحدة كبيرة. إذا نظروا إلى الشاشة الفوضوية بأكملها وخمنوا بشكل خاطئ، فسوف يعلقون. الأمر يشبه محاولة العثور على شارع محدد في مدينة ضخمة عن طريق تخمين إحداثي واحد على الخريطة دون التكبير (Zoom in). إذا خمنت الحي الخطأ، فلا يمكنك التراجع.

الحل: DRS-GUI (المحقق الذكي)

يغير DRS-GUI قواعد اللعبة. فبدلاً من التخمين فوراً، يعمل كالمحقق الذي يبحث أولاً، ثم يحل المشكلة. إنه يقسم العملية إلى ثلاثة أجزاء رئيسية:

1. "مدرك واجهة المستخدم" (عدسة المحقق المكبرة)

قبل أن يحاول الذكاء الاصطناعي تخمين الإجابة، يقوم هذا النموذج بمسح الشاشة وتفكيكها إلى قائمة من الكائنات (أزرار، نصوص، أيقونات). ثم يسأل: "أي من هذه الكائنات يطابق بالفعل ما طلبه المستخدم؟"

  • تشبيه: تخيل أنك تبحث عن "تفاحة حمراء" في وعاء فاكهة. "المدرك" هو اليد التي تفرز الوعاء، متجاهلة الموز والبرتقال، وتسلط الضوء فقط على الفواكه الحمراء.

2. الثلاث "حركات البشرية"

بمجرد أن يحصل "المدرك" على قائمة بالمرشحين المحتملين، لا يكتفي النظام بالنظر إلى نقطة واحدة. بل يستخدم ثلاث حركات ديناميكية لتعديل رؤيته، تماماً كما يفعل البشر:

  • التركيز (التكبير - Focus/Zoom In): إذا رأى الذكاء الاصطناعي تجمعاً لعناصر ذات صلة، فإنه يكبر المشهد بدقة للحصول على رؤية أفضل، متجاهلاً بقية الفوضى.
    • تشبيه: تضييق عينيك لقراءة نص صغير في قائمة طعام.
  • الإزاحة (التحرك - Shift): إذا أدرك الذكاء الاصطناعي أنه ينظر إلى الجزء الخطأ من الشاشة (على سبيل المثال، ينظر إلى القائمة العلوية بينما الزر موجود في الأسفل)، فإنه ينقل رؤيته فوراً إلى منطقة جديدة.
    • تشبيه: إدراك أنك تنظر إلى الرف الخطأ في المكتبة ثم الانتقال إلى الرف الصحيح.
  • التشتت (التصغير - Scatter/Zoom Out): إذا أصبح الذكاء الاصطناعي شديد التركيز لدرجة تفقد السياق، فإنه يصغر المشهد ليرى الصورة الأكبر مرة أخرى.
    • تشبيه: التراجع خطوة للخلف من لوحة فنية لرؤية اللوحة بأكملها لأنك كنت قريباً جداً بحيث لا ترى التفاصيل الشاملة.

3. "مخطط الإجراءات" (لاعب الشطرنج المحترف)

كيف يعرف الذكاء الاصطناعي الحركة التالية التي يجب اتخاذها؟ إنه يستخدم استراتيجية تسمى بحث مونت كارلو في الشجرة (MCTS).

  • تشبيه: فكر في هذا كلاعب شطرنج. بدلاً من القيام بحركة واحدة فقط، يقوم الذكاء الاصطناعي بمحاكاة عدة مستقبليات محتملة في ذهنه. يسأل نفسه: "إذا كبّرت المشهد الآن، هل سأجد الهدف؟ إذا تحركت لليسار، هل سأجده؟"
  • يستخدم نظام "مكافأة الجودة" (Quality Reward) لتقييم كل احتمال. يسأل: "هل يحتوي هذا المشهد المكبر على نوع الأزرار الصحيح؟ هل هو فارغ جداً؟ هل النص واضح؟"
  • إذا بدا المسار سيئاً (على سبيل المثال، إذا كبّر المشهد على مساحة فارغة)، فإن الذكاء الاصطناعي "يتراجع" ويجرب حركة مختلفة. هذا يمنعه من الوقوع في طريق مسدود.

النتيجة: بحث أكثر نقاءً

لأن DRS-GUI يقوم بتصفية "النفايات البصرية" قبل أن يحاول الذكاء الاصطناعي الرئيسي إجراء التوقع، يتعين على الذكاء الاصطناعي فقط النظر إلى جزء صغير، نظيف، وذات صلة من الشاشة.

  • ادعاء الورقة البحثية: عند اختباره على شاشات صعبة وعالية الدقة (مثل البرامج الاحترافية التي تحتوي على مئات الأزرار)، أدت هذه الطريقة إلى تحسين دقة الذكاء الاصطناعي بنسبة 14%.
  • الخلاصة الأساسية: إنه يعمل مع نماذج الذكاء الاصطناعي الحالية دون الحاجة إلى إعادة تدريبها. إنه ترقية "جاهزة للتشغيل" تجعل الذكاء الاصطناعي أكثر ذكاءً في النظر قبل أن يحاول التنفيذ.

باختصار، يعلم DRS-GUI الذكاء الاصطناعي التوقف عن التخمين الأعمى على شاشة فوضوية، وبدلاً من ذلك، المسح، والإزاحة، والتكبير، وتقييم محيطه كما يفعل البشر، مما يضمن العثور على الزر الصحيح في كل مرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →