Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction
تقدم هذه الورقة VAGEN، وهو إطار عمل يستخدم وكيل تحقق مدعوم بالأدوات مع آلية تحقق تدريجية من السطح إلى الكامن للتغلب على قيود طرق نمذجة المكافأة السلبية والمفرطة في الاستقصاء الحالية، مما يؤدي إلى تحسين دقة وكفاءة تقييم وكيل واجهة المستخدم الرسومية (GUI) بشكل كبير على معايض مثل OSWorld-Verified وAndroidWorld.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيفية استخدام جهاز الكمبيوتر. تريد منه فتح التطبيقات، والنقر على الأزرار، وإتمام مهام مثل شراء كتاب أو تنظيم الملفات. لتعليم الروبوت، تحتاج إلى طريقة لإخباره ما إذا كان قد قام بعمل جيد أو أخطأ. هذا هو عالم التعلم التعزيزي (Reinforcement Learning)، حيث يتعلم الذكاء الاصطناعي من خلال التجربة والحصول على "مكافآت" عند النجاح. ولكن هنا تكمن الحيلة: كيف تعرف ما إذا كان الروبوت قد أنهى المهمة حقًا؟ هل اشترى الكتاب بالفعل، أم أنه اكتفى بالنقر على زر يبدو وكأنه زر شراء؟ هذه هي مشكلة نمذجة المكافأة (Reward Modeling). إذا اعتقد الروبوت أنه نجح بينما لم ينجح، فسيستمر في ارتكاب نفس الخطأ. وإذا اعتقد أنه فشل بينما نجح بالفعل، فسيصاب بالارتباك ويتوقف عن المحاولة. الحصول على هذا "التقييم" بشكل صحيح هو الفرق بين روبوت أخرق ومساعد مفيد.
لفترة طويلة، حاول العلماء طريقتين رئيسيتين لتقييم الروبوت. الطريقة الأولى كانت تشبه معلمًا صارمًا لديه قائمة مراجعة: "هل ظهر الملف؟ نعم. هل أُغلقت النافذة؟ نعم." هذا يعمل في المهام البسيطة ولكنه ينهار عندما تكون المهمة إبداعية أو مفتوحة النهايات. الطريقة الثانية كانت تتمثل في الطلب من ذكاء اصطناعي فائق الذكاء (نموذج لغوي كبير) النظر إلى فيديو لعمل الروبوت وتخمين ما إذا كان قد نجح. هذه الطريقة قابلة للتوسع، لكن الذكاء الاصطناعي هنا يكون سلبيًا؛ فهو يمكنه فقط النظر إلى ما يراه على الشاشة. لا يمكنه التلصص داخل "عقل" الكمبيوتر ليرى ما إذا كان قد تم حفظ ملف بالفعل في الخلفية. الأمر يشبه معلمًا يصحح اختبار رياضيات من خلال النظر فقط إلى ورقة الإجابات النهائية للطالب، دون التحقق مما إذا كان الطالب قد بذل الجهد فعليًا أم أن الإجابة كانت مجرد ضربة حظ.
تقدم هذه الورقة البحثية طريقة جديدة وأكثر ذكاءً لتقييم روبوتات استخدام الكمبيوتر هذه. يقترح المؤلفون، تشاوكون كوي وزملاؤه، نظامًا يسمى VAGEN. بدلاً من مجرد مشاهدة فيديو أو التحقق من قائمة مراجعة، يستخدم VAGEN "وكيل تحقق" (Verifier Agent)—وهو محقق ذكاء اصطناعي ثاني يمكنه الاستقصاء بنشاط. فكر في الأمر كمحقق لا يكتفي فقط بقراءة عذر المشتبه به (فيديو الروبوت)، بل يمتلك أيضًا القدرة على الذهال إلى مسرح الجريمة، وفحص الملفات المخفية، وإجراء الاختبارات ليرى ما إذا كانت القصة تتطابق مع الواقع. وجد المؤلفون أن هذا النهج الاستقصائي النشط أفضل بكثير في رصد الحقيقة، خاصة عندما تترك أفعال الروبوت أدلة غير مرئية على الشاشة. وقد أثبتوا أن هذه الطريقة ليست أكثر دقة فحسب، بل هي أيضًا فعالة، مما يثبت أنه في بعض الأحيان تحتاج إلى "توسيخ يديك" لتعرف ما إذا كان العمل قد أُنجز حقًا.
المحقق في العالم الرقمي
إذًا، كيف يعمل هذا المحقق الجديد، VAGEN، في الواقع؟ أدرك المؤلفون أن التحقق مما إذا كان الروبوت قد أنهى مهمة ما غالبًا ما يكون أسهل من تنفيذ المهمة نفسها. إنه يشبه الفرق بين خبز كعكة والتحقق مما إذا كانت الكعكة قد نضجت. الخباز (الروبوت "الممثل" أو Actor) عليه خلط المكونات، ومراقبة الفرن، وتزيين الكعكة. أما القاضي (المدقق أو Verifier) فعليه فقط أن يغرز عودًا في الكعكة أو يشم رائحة المطبخ ليعرف ما إذا كانت جاهزة. يطلق المؤلفون على هذا خاصية "سهولة التحقق، صعوبة الحل".
لتحقيق ذلك، يستخدم VAGEN آلية تحقق تدريجية (Progressive Verification Mechanism). تخيل أن المدقق هو محقق يحل لغزًا، ولديه استراتيجية محددة لتجنب إضاعة الوقت. هو لا يهجم مباشرة لكسر الأبواب؛ بل يبدأ بأسهل الأدلة ولا يصبح أكثر هجومية إلا إذا لزم الأمر.
المرحلة 1: النظرة السريعة (التقييم الساكن - Static Assessment)
أولاً، ينظر المدقق إلى الصورة النهائية لشاشة الكمبيوتر وملخص لما قام به الروبوت. ويسأل نفسه: "هل يبدو هذا كفوز؟" إذا أظهرت الشاشة بوضوح رسالة "تم تأكيد الطلب"، يقول المحقق: "انتهت القضية!" ويمضي قدمًا. هذا الإجراء سريع وغير مكلف.
المرحلة 2: إعادة شريط الفيديو (الاسترجاع البصري - Visual Retrospection)
إذا كانت الصورة النهائية مربكة—ربما تكون الشاشة فارغة، أو الرسالة مخفية—فإن المحقق لا يستسلم. بدلاً من ذلك، يقوم بإعادة عرض الفيديو. ينظر إلى لقطات الشاشة من خطوات سابقة للعثور على أدال. ربما نقر الروبوت على الزر الصحيح قبل خمس دقائق، حتى لو كانت الشاشة النهائية فوضوية. هذا يشبه مراجعة تسجيلات كاميرا المراقبة لمعرفة ما إذا كان المشتبه به قد دخل المبنى بالفعل.
المرحلة 3: الاقتحام والبحث (الاستقصاء الاستباقي - Proactive Probing)
أحيانًا، لا تكون الأدلة موجودة على الشاشة على الإطلاق. ربما كان من المفترض أن يحفظ الروبوت ملفًا في القرص الصلب، لكن الشاشة تظهر فقط رسالة عامة مثل "تم". الشاشة تكذب، أو على الأقل، تخفي الحقيقة. هنا يصبح VAGEN رائعًا حقًا. يمتلك وكيل التحقق أدوات خاصة لـ التفاعل النشط مع الكمبيوتر. يمكنه تشغيل كود برمي، أو فحص نظام الملفات، أو حتى النقر على الأزرار بنفسه لاختبار ما إذا كان الملف موجودًا حقًا. إنه مثل حصول المحقق أخيرًا على أمر تفتيش لمنزل المشتبه به. هو لا يكتفي بتصديق القصة؛ بل يذهب ويفحص القبو.
توضح الورقة أن نهج "من السطح إلى الباطن" (الانتقال من سطح الشاشة إلى الأعماق الخفية للنظام) يعد نقطة تحول. اختبر المؤلفون VAGEN في مجموعتين كبيرتين من المهام: OSWorld-Verified (أجهزة الكمبيوتر المكتبية) و AndroidWorld (الهواتف المحمولة).
النتائج: أذكى وأسريد
عندما قام المؤلفون بتشغيل الأرقام، لم يكتفِ VAGEN بأداء جيد فحسب؛ بل سحق المنافسين. في اختبار أجهزة الكمبيوتر المكتبية، وبينما كافحت الطرق الأخرى لتجاوز دقة 80%، حقق VAGEN دقة بلغت 92.9% عند تقييمه من قبل خبراء بشريين. والأمر الأكثر إثارة للإعجاب هو أنه فعل ذلك دون الحاجة إلى فحص كل لقطة شاشة أو إجراء اختبارات لا نهاية لها. لقد كان ذكيًا بما يكفي للتوقف مبكرًا عندما وجد الإجابة.
كما تسلط الورقة الضوء على نتيجة حاسمة: التفاعل النشط ضروري، لكنه ليس دائمًا الخطوة الأولى. الطرق السابقة التي اعتمدت بشكل كبير على "الاستقصاء" (فحص النظام) كانت غالبًا بطيئة وغير فعالة لأنها لم تنظر إلى دليل الفيديو أولًا. كانت تشبه المحققين الذين يكسرون الباب فورًا دون حتى النظر إلى الباب الأمامي. ومع ذلك، يستخدم VAGEN دليل الفيديو لتوجيه تحقيقاته. هو لا يقتحم النظام إلا عندما لا يكون الفيديو كافيًا. هذا التوازن جعله أكثر كفاءة، حيث استخدم موارد حاسوبية أقل (مثل "الخطوات" أو "الرموز/Tokens") للحصول على إجابة أفضل.
اختبر المؤلفون أيضًا ما إذا كان بإمكانهم جعل المدقق أفضل من خلال مطالبته بالتحقق من نفس المهمة عدة مرات (استراتيجية تسمى "التحجيم/Scaling"). ووجدوا أنه حتى عندما قيدوا المدقق بالاكتفاء بـ "قراءة" البيانات وعدم تغيير أي شيء، فقد أصبح أكثر ذكاءً. وهذا يشير إلى أن المهمة الرئيسية للمدقق هي الاستقصاء، وليس العبث بالكمبيوتر.
لماذا يهم هذا؟
الخلاصة الكبرى هنا هي أننا لسنا مضطرين للاختيار بين مراقب كسول ومحقق فضولي. يمكننا الحصول على كليهما. من خلال الجمع بين المراقبة السلبية لفيديو الروبوت والقدرة النشطة على فحص حالات الكمبيوتر الخفية، يخلق VAGEN نظام مكافأة موثوقًا وفعالًا في آن واحد.
يجادل المؤلفون بأن هذا هو مستقبل تدريب الوكلاء الذكيين. إذا أردنا روبوتات يمكنها حقًا مساعدتنا في أجهزة الكمبيوتر والهواتف الخاصة بنا، فنحن بحاجة إلى طريقة لتقييمهم لا يمكن خداعها بصورة جميلة. يشير VAGEN إلى أنه من خلال منح مدققينا الذكيين الأدوات للبحث بعمق، يمكننا تعليم روبوتاتنا لتكون أكثر كفاءة بكثير. لا تدعي الورقة أنها حلت كل مشاكل العالم، لكنها تظهر مسارًا واضحًا للمضي قدمًا: توقف عن مجرد مشاهدة العرض، وابدأ في فحص ما وراء الكواليس.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.