CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications
يُعد CoAdapt-GUI إطار عمل للتكيف في وقت الاختبار يعمل على تحسين تعميم وكيل واجهة المستخدم الرسومية للهواتف المحمولة (mobile GUI agent) تجاه التطبيقات غير المرئية من خلال تكييف سياسة خاصة بالمهمة عبر تقنية LoRA بشكل مشترك وتحسين سياق سير العمل القابل للنقل من تفاعلات الوكيل نفسه، محققاً بذلك مكاسب كبيرة في الأداء مقارنة بالطرق المرجعية.
المؤلفون الأصليون:Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter)Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen
تخيل أنك تعلم روبوتاً كيفية التنقل في العالم الرقمي. هذا الروبوت هو "وكيل واجهة مستخدم رسومية" (GUI agent)، وهو مساعد ذكي يمكنه النظر إلى شاشة الهاتف، وقراءة ما يراه، والنقر على الأزرار لتنفيذ تعليماتك، مثل "احجز رحلة طيران" أو "أرسل رسالة نصية". لفترة من الوقت، أصبحت هذه الروبوتات جيدة جداً، ولكن فقط إذا تدربت على نفس التطبيقات التي ستستخدمها لاحقاً. الأمر يشبه طالباً يحفظ الإجابات لاختبار رياضيات محدد، لكنه يتجمد عندما يرى كتاباً مدرسياً جديداً. التحدي الحقيقي يحدث عندما يواجه الروبوت تطبيقاً لم يره من قبل، يحتوي على أزرار وقوائم لا يتعرف عليها. هذه هي مشكلة "التطبيق غير المرئي". يحاول العلماء معرفة كيفية تعليم هذه الرذوتات التعلم أثناء العمل، باستخدام بضع محاولات فقط لفهم كيفية عمل تطبيق جديد، دون الحاجة إلى إنسان ليرشدها في كل مرة.
تقدم هذه الورقة نظاماً جديداً ذكياً يسمى CoAdapt-GUI يساعد وكلاء الروبوتات هذه على التكيف مع التطبيقات الجديدة تماماً بشكل أفضل من ذي قبل. فكر في عقل الروبوت كأنه يتكون من جزئين: "السياسة" (policy)، وهي غريزته لكيفية النقر والمسح، و"سير العمل" (workflow)، وهو قائمة مرجعية ذهنية للخطوات والقواعد لكيفية إتمام مهمة ما. حاولت المحاولات السابقة لمساعدة الروبوتات على تعلم تطبيقات جديدة تعديل غريزتها (السياسة) فقط مع تجاهل قائمتها المرجعية. وجد المؤلفون أن هذا ليس كافياً؛ فإذا كانت قائمة الروبوت المرجعية مليئة بالتفاصيل الخاصة بالتطبيقات القديمة التي يعرفها (مثل "ابحث عن الزر الأزرق في الشاشة الرئيسية")، فسيصاب بالارتباك عندما يكون للتطبيق الجديد زر أحمر في مكان مختلف.
يحل CoAdapt-GUI هذه المشكلة عبر القيام بشيئين في آن واحد. أولاً، يعمل كمحرر صارم لقائمة الروبوت المرجعية؛ حيث يأخذ القواعد العامة التي يعرفها الروبوت (مثل "إذا علقت، حاول العودة") ولكنه يزيل أي تفاصيل محددة عن التطبيقات القديمة (مثل "زر الرجوع موجود في الزاوية العلوية اليسرى"). هذا يخلق دليلاً "نظيفاً" يمكن أن يعمل في أي مكان. ثانياً، يسمح للروبوت بالممارسة على التطبيق الجديد وتحديث غرائزه (السياسة) بناءً على ما ينجح وما يفشل. يحدث السحر لأن هذين الجزأين يساعدان بعضهما البعض: القائمة المرجعية النظية تساعد الروبوت على الممارسة بشكل أفضل، ونتائج الممارسة تساعد الروبوت على تحسين قائمته المرجعية.
اختبر الباحثون هذا النظام في ساحة لعب رقمية تسمى AndroidWorld. في أحد الاختبارات، حيث كان على الروبوت التعامل مع إصدارات جديدة من مهام مألوفة، نجح CoAdapt-GUI بنسبة 45.0%. وكانت هذه قفزة كبيرة مقارنة بأفضل طريقة سابقة، والتي تمكنت فقط من تحقيق 37.5%. وفي اختبار أصعب، حيث كان على الروبوت تعلم أنواع جديدة تماماً من المهام التي لم يرها من قبل، رفع النظام معدلات النجاح من 38.6% إلى 52.9%. تشير الورقة إلى أنه من خلال الفصل بين "ما يجب فعله" (سير العمل) و"كيفية فعله" (السياسة) وتنظيف التعليمات قبل استخدامها، يمكن للروبوتات أن تصبح أكثر مرونة واستعداداً للعالم الحقيقي، حيث تتغير التطبيقات باستمرار.
ملخص تقني: CoAdapt-GUI
بيان المشكلة تُظهر وكلاء واجهة المستخدم الرسومية (GUI) للهواتف المحمولة هشاشة عند نشرها في تطبيقات غائبة عن بيانات تدريبها المصدرية. وبينما أدت التطورات الأخيرة إلى تحسين الأداء في المعايير المرجعية الراسخة، فإن هذه التقييمات غالبًا ما تفترض وجود مجموعة محددة مسبقًا من التطبيقات وسير العمل. في النشر الواقعي، يواجه الوكلاء تطبيقات "غير مرئية" حيث تكون عناصر الواجهة وإجراءات المهام جديدة كليًا. تركز النهج الحالية للتعميم، مثل التعلم التعزيزي (RL) عبر الإنترنت على التفاعلات المستهدفة، على تكييف السياسة فقط. ومع ذلك، فإن النجاح في مهام جديدة ضمن واجهة مألوفة لا يضمن سلوكًا فعالًا في تطبيق غير مألوف. قد يفشل الوكلاء بسبب مشكلات في الربط (grounding) الخاصة بالواجهة أو نقص في معرفة سير العمل الإجرائي (مثل شروط الإتمام، أو التعافي من الفشل). إن تحديث السياسة فقط أو سياق سير العمل فقط يترك مصادر الفشل الحرجة دون حل، لا سيما تحت ظروف التحول عبر التطبيقات حيث قد يحتوي الخبر السابق (المصدر) على نقل سلبي (تفاصيل خاصة بالتطبيق) يعيق التكيف.
المنهجية: CoAdapt-GUI تقدم الورقة البحثية إطار عمل CoAdapt-GUI، وهو إطار عمل للتكيف وقت الاختبار (TTA) مصمم لتكييف سياق سير العمل الهيكلي والسياسة معًا باستخدام عمليات التشغيل (rollouts) الخاصة بالتطبيق المستهدف والجوائز على مستوى المهمة فقط، دون الوصول إلى عروض توضيحية مستهدفة أو إشارات تقييم محجوزة.
يعمل إطار العمل على حالتين تكيفيتين متكاملتين:
سياق سير العمل المقيد بالانتقال (Mt):
فصل الاهتمامات: يميز النظام بين الحالة المرتبطة بالتطبيق في المصدر (الشاشات، الإحداثيات، المعرفات المحددة) والمعرفة الإجرائية القابلة للانتقال (الإجراءات المجردة، أوضاع الفشل، قواعد التحقق).
التمثيل المرتكز على آلة الحالة المحدودة (FSM): يتم تمثيل سير عمل المصدر كآلات حالة محدودة (FSMs). يقوم "مُخلق" (synthesizer) مجمد ببناء حالة قابلة للانتقال (Mtr) عن طريق تصفية التفاصيل المرتبطة بالتطبيق عبر محددات الأهلية ومحققات المخطط (schema validators).
المراجعة المرتكزة على الهدف: أثناء التكيف، يحافظ الوكيل على حالة منفصلة مرتكزة على الهدف (Mttgt). يقوم "عَاكس" (reflector) مجمد بمقارنة المسارات الناجحة والفاشلة من عمليات التشغيل المتطابقة لاقتراح مراجعات لسياق سير العمل. يتم التحقق من هذه المراجعات مقابل مخطط نمطي (باستثناء أسماء التطبيقات، ومعرفات الحزم، إلخ) قبل دخولها إلى المجتمع.
الاسترجاع: بالنسبة لمهمة مستهدفة، يسترجع النظام سياق سير عمل المصدر المقيد بالأهلية والمحدد بحدود (M0) ويجمعه مع الحالة المتطورة المرتكزة على الهدف.
تكييف السياسة المتوافق مع المهمة والسياق:
البنية: السياسة هي نموذج لغة رؤية (VLM) مع عمود فقري مجمد ومحول LoRA قابل للتدريب (θt).
التحسين النسبي للمجموعة: لمنع التداخل من تغيرات السياق، يتم حساب تحديثات السياسة فقط بين عمليات التشغيل التي تشترك في نفس المهمة ونفس شرط السياق (G(q,κ)).
الهدف: يستخدم إطار العمل هدفًا نسبيًا للمجموعة (Shao et al., 2024) لتحديث معاملات LoRA بناءً على المزايا (Aj) المحسوبة داخل هذه المجموعات المتطابقة. يضمن هذا أن تحديد المسؤولية (credit assignment) يعكس تحسينات السياسة بدلاً من الاختلافات في صعوبة المهمة أو التوجيه السياقي.
حلقة التكيف المشتركة:
ينفذ إطار العمل عمليات تشغيل متطابقة تحت ظروف إعادة ضبط محكومة.
تدفع نفس تدفق عمليات التشغيل قناتين:
قناة السياق: تُحدث تقييمات متغيرات السياق وتقترح مراجعات فرعية تم التحقق منها.
قناة السياسة: تُحدث محول LoRA باستخدام المسارات المتراكمة، ولكن فقط عندما توجد مجموعات مقارنة صالحة بين المهمة والسياق.
التحديثات مقترنة بالتفاعل ولكنها ليست قابلة للاشتقاق المشترك؛ السياق الحالي يشكل المسارات لتعلم السياسة، بينما تولد السياسة الحالية إشارات النجاح/الفشل المستخدمة لمراجعة سير العمل.
المساهمات الرئيسية
التكيف المشترك من جانب الهدف: إطار عمل (TTA) يقوم بتحديث حالات سياق سير العمل والسياسة بشكل منفصل باستخدام التفاعلات المستهدفة المستقلة والجوائز فقط، مما يلغي الحاجة إلى العروض التوضيحية المستهدفة.
التكيف المقيد بالانتقال: آلية تفصل معرفة سير العمل القابلة للانتقال عن حالة المصدر المرتبطة بالتطبيق. وهي تنسق التحديثات الموجهة بالمكافأة حيث يتم التحقق من مراجعات السياق بواسطة فحوصات المخطط، ويتم حساب ائتمان السياسة بدقة داخل مجموعات المهمة والسياق المتطابقة.
تقييم شامل: تم تقييم إطار العمل عبر مستويين من التعميم:
تعميم المثيل (Instance Generalization): نماذج جديدة من قوالب المهام المعروفة (AndroidWorld-Generalization).
تعميم نوع المهمة (Task-Type Generalization): قوالب مهام جديدة تمامًا ضمن تطبيقات غير مرئية (AndroidWorld Plus).
النتائج التجريبية قيم المؤلفون CoAdapt-GUI مقابل خطوط الأساس بما في ذلك: السياسة الأساسية (Base Policy)، انتقال السياق الثابت (Static Context Transfer)، التكيف (TTA) للسياسة فقط، والتكيف (TTA) للسياق فقط.
AndroidWorld-Generalization (نماذج مهام جديدة):
حقق CoAdapt-GUI معدل نجاح بنسبة 45.0%.
تفوق على خط الأساس للتكيف (TTA) للسياسة فقط (37.5%) بمقدار 7.5 نقطة مئوية، وعلى التكيف (TTA) للسياق فقط (35.0%) بمقدار 10.0 نقاط مئوية.
حقق انتقال السياق الثابت 28.75%.
AndroidWorld Plus (قوالب مهام جديدة):
اختبر هذا الإعداد الانتقال إلى أنواع مهام لم تُشاهد أثناء التكيف.
رفع CoAdapt-GUI معدل النجاح الإجمالي من 38.6% للسياسة الأساسية إلى 52.9%.
حسن التكيف (T_TA) للسياق فقط النسبة الأساسية إلى 48.1%، بينما وصل التكيف (TTA) للسياسة فقط إلى 40.0% فقط.
في التطبيقات المشتركة الفئة (حيث يمكن استرجاع سير عمل المصدر)، وصل CoAdapt-GUI إلى 70.4%.
في التطبيقات الجديدة الفئة (لا تتوفر فيها سير عمل للمصدر)، ظل CoAsAdapt-GUI يحسن النجاح من 29.4% (الأساسي) إلى 34.3%، مما يثبت فعالية التكيف المرتكز على الهدف حتى بدون أولويات مصدرية.
الأهمية والادعاءات تدعي الورقة أن سياق سير العمل المقيد بالانتقال يوفر مكاسب كبيرة للتعميم في التطبيقات الجديدة، وأن التكيف المشترك للسياسة يحسن الأداء الإجمالي أيضًا. تشير النتائج إلى أن:
تكييف سير العمل أمر بالغ الأهمية: إن تكييف سياق سير العمل وحده (Context-Only TTA) يحقق تحسينات كبيرة مقارنة بالانتقال الثابت أو تحديثات السياسة فقط، لا سيما في السيناريوهات التي تتضمن أنواع مهام جديدة.
التآزر في التكيف المشترك: يحقق الجمع بين تكييف السياق والسياسة (CoAdapt-GUI) أفضل أداء إجمالي، مما يشير إلى أن الحالتين متميزتان ولكنهما قناتان متكاملتان للتعميم.
القوة تجاه تحول المصدر: يتعامل إطار العمل بفعالية مع السيناريوهات التي لا يتوفر فيها سير عمل المصدر (Category-Novel Apps) من خلال بناء معرفة مرتكزة على الهدف من الصفر.
يؤكد المؤلفون أن نهجهم يتجنب تسرب المعلومات عن طريق استخدام مجموعات مصدر وهدف منفصلة، وتقييد التحديثات في تقسيم التكيف، وتجميد الحالات قبل التقييم. ويخلصون إلى أن CoAdapt-GUI يقدم مسارًا قابلًا للتطبيق لنشر وكلاء GUI يمكنهم التكيف ذاتيًا مع التطبيقات غير المرئية باستخدام ميزانيات تفاعل محدودة.