← أحدث الأبحاث
🤖 AI

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

يُعد CoAdapt-GUI إطار عمل للتكيف في وقت الاختبار يعمل على تحسين تعميم وكيل واجهة المستخدم الرسومية للهواتف المحمولة (mobile GUI agent) تجاه التطبيقات غير المرئية من خلال تكييف سياسة خاصة بالمهمة عبر تقنية LoRA بشكل مشترك وتحسين سياق سير العمل القابل للنقل من تفاعلات الوكيل نفسه، محققاً بذلك مكاسب كبيرة في الأداء مقارنة بالطرق المرجعية.

المؤلفون الأصليون: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter)
نُشر 2026-08-13
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيفية التنقل في العالم الرقمي. هذا الروبوت هو "وكيل واجهة مستخدم رسومية" (GUI agent)، وهو مساعد ذكي يمكنه النظر إلى شاشة الهاتف، وقراءة ما يراه، والنقر على الأزرار لتنفيذ تعليماتك، مثل "احجز رحلة طيران" أو "أرسل رسالة نصية". لفترة من الوقت، أصبحت هذه الروبوتات جيدة جداً، ولكن فقط إذا تدربت على نفس التطبيقات التي ستستخدمها لاحقاً. الأمر يشبه طالباً يحفظ الإجابات لاختبار رياضيات محدد، لكنه يتجمد عندما يرى كتاباً مدرسياً جديداً. التحدي الحقيقي يحدث عندما يواجه الروبوت تطبيقاً لم يره من قبل، يحتوي على أزرار وقوائم لا يتعرف عليها. هذه هي مشكلة "التطبيق غير المرئي". يحاول العلماء معرفة كيفية تعليم هذه الرذوتات التعلم أثناء العمل، باستخدام بضع محاولات فقط لفهم كيفية عمل تطبيق جديد، دون الحاجة إلى إنسان ليرشدها في كل مرة.

تقدم هذه الورقة نظاماً جديداً ذكياً يسمى CoAdapt-GUI يساعد وكلاء الروبوتات هذه على التكيف مع التطبيقات الجديدة تماماً بشكل أفضل من ذي قبل. فكر في عقل الروبوت كأنه يتكون من جزئين: "السياسة" (policy)، وهي غريزته لكيفية النقر والمسح، و"سير العمل" (workflow)، وهو قائمة مرجعية ذهنية للخطوات والقواعد لكيفية إتمام مهمة ما. حاولت المحاولات السابقة لمساعدة الروبوتات على تعلم تطبيقات جديدة تعديل غريزتها (السياسة) فقط مع تجاهل قائمتها المرجعية. وجد المؤلفون أن هذا ليس كافياً؛ فإذا كانت قائمة الروبوت المرجعية مليئة بالتفاصيل الخاصة بالتطبيقات القديمة التي يعرفها (مثل "ابحث عن الزر الأزرق في الشاشة الرئيسية")، فسيصاب بالارتباك عندما يكون للتطبيق الجديد زر أحمر في مكان مختلف.

يحل CoAdapt-GUI هذه المشكلة عبر القيام بشيئين في آن واحد. أولاً، يعمل كمحرر صارم لقائمة الروبوت المرجعية؛ حيث يأخذ القواعد العامة التي يعرفها الروبوت (مثل "إذا علقت، حاول العودة") ولكنه يزيل أي تفاصيل محددة عن التطبيقات القديمة (مثل "زر الرجوع موجود في الزاوية العلوية اليسرى"). هذا يخلق دليلاً "نظيفاً" يمكن أن يعمل في أي مكان. ثانياً، يسمح للروبوت بالممارسة على التطبيق الجديد وتحديث غرائزه (السياسة) بناءً على ما ينجح وما يفشل. يحدث السحر لأن هذين الجزأين يساعدان بعضهما البعض: القائمة المرجعية النظية تساعد الروبوت على الممارسة بشكل أفضل، ونتائج الممارسة تساعد الروبوت على تحسين قائمته المرجعية.

اختبر الباحثون هذا النظام في ساحة لعب رقمية تسمى AndroidWorld. في أحد الاختبارات، حيث كان على الروبوت التعامل مع إصدارات جديدة من مهام مألوفة، نجح CoAdapt-GUI بنسبة 45.0%. وكانت هذه قفزة كبيرة مقارنة بأفضل طريقة سابقة، والتي تمكنت فقط من تحقيق 37.5%. وفي اختبار أصعب، حيث كان على الروبوت تعلم أنواع جديدة تماماً من المهام التي لم يرها من قبل، رفع النظام معدلات النجاح من 38.6% إلى 52.9%. تشير الورقة إلى أنه من خلال الفصل بين "ما يجب فعله" (سير العمل) و"كيفية فعله" (السياسة) وتنظيف التعليمات قبل استخدامها، يمكن للروبوتات أن تصبح أكثر مرونة واستعداداً للعالم الحقيقي، حيث تتغير التطبيقات باستمرار.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →