← أحدث الأبحاث
🤖 AI

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

تقدم الورقة البحثية SeekJudge، وهو إطار عمل للمكافأة القائم على النماذج وعملي يستخدم أربعة وكلاء متخصصين في الأدوار ونموذجاً أساسياً بـ 9 مليارات معلمة تم تقطيره، والذي يضاهي أو يتفوق على الإشراف القائم على القواعد في تدريب وكلاء استخدام الكمبيوتر مع توفير أحكام على مستوى الخطوة، وتكاليف أقل، وقابلية للتوسع للمهام طويلة الأمد.

المؤلفون الأصليون: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

نُشر 2026-07-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية التنقل في عالم لعبة فيديو، ولكن بدلاً من الضغط على أزرار وحدة التحكم، يتعين على الروبوت النقر، والكتابة، والتمرير على شاشة كمبيوتر حقيقية تمامًا كما يفعل البشر. هذا هو عالم "وكلاء استخدام الكمبيوتر". لفترة طويلة، حاول العلماء تعليم هذه الروبوتات من خلال عرض هدف عليها — مثل "احجز فندقًا" — ثم التحقق مما إذا كانت قد نجحت. كانت الطريقة القديمة للتحقق تشبه استخدام قائمة مرجعية جامدة: إذا نقر الروبوت على الزر الصحيح في الوقت الصحيح، يحصل على نقطة؛ وإذا نقر على زر خاطئ، يحصل على صفر. لكن الحواسيب فوضوية وتتغير باستمرار. قد تقول القائمة المرجعية "لقد فشلت" لأن الروبوت نقر على زر يبدو مختلفًا قليلاً عما هو موجود في القائمة، رغم أن الروبوت أنجز المهمة ببراعة بالفعل. الأمر يشبه معلمًا يرسب طالبًا لأنه كتب كلمة "color" بدلاً من "colour"، رغم أن المقال كان رائعًا.

ولإصلاح ذلك، بدأ الباحثون في استخدام نماذج الذكاء الاصطناي لتلعب دور القضاة، آملين أن يتمكنوا من فهم جوهر المهمة بدلاً من مج-رد الالتزام بالقواعد الصارمة. ومع ذلك، غالبًا ما يرتبك قضاة الذكاء الاصطناعي هؤلاء عندما يتعين عليهم النظر إلى فيلم كامل لأفعال الروبوت دفعة واحدة. الأمر يشبه محاولة العثور على خطأ مطبعي محدد في رواية مكونة من 500 صفحة عن طريق قراءة الكتاب بأك entire في ثانية واحدة؛ حيث تضيع التفاصيل المهمة وسط الضجيج. أصبح السؤال الكبير هو: كيف نبني قاضيًا ذكيًا بما يكفي لفهم الأهداف البشرية، ورخيصًا بما يكفي للتشغيل آلاف المرات أثناء تعلم الروبوت، وسريعًا بما يكفي للتعامل مع القصص الطويلة والمعقدة دون أن يصاب بصداع؟


هنا يظهر SeekJudge، وهو إطار عمل جديد يعمل كفريق من أربعة محققين متخصصين يعملون معًا لحل لغز ما، بدلاً من محقق واحد مثقل بالأعباء يحاول القيام بكل شيء في آن واحد. وجد الباحثون أنه عندما تجبر الذكاء الاصطناعي على النظر إلى الكثير من لقطات الشاشة لشاشة الكمبيوتر في نفس الوقت، يبدأ في الهلوسة أو تفويت أهم الأدلة. الأمر يشبه أن تطلب من شخص تحديد مشتبه به في حشد مكون من 100 شخص؛ قد يتشتت انتباهه بسبب قبعة غريبة يرتديها أحد الغرباء ويفقد المشتبه به الحقيقي. ولكن إذا عرضت عليه صورة واحدة فقط للمشتبه به، فسوف يميزه على الفور.

يحل SeekJudge هذه المشكلة عن طريق تقسيم العمل. أولاً، يقوم "كشافان" (يُسميان وكيل Condense ووكيل Ground) بتصفح سريع لرحلة الروبوت الطويلة وكتابة ملخص قصير وسهل القراءة لما حدث، خطوة بخوة. بعد ذلك، يقرأ "المحقق" (وكيل Seek) هذا الملخص ويقرر: "همم، أحتاج لرؤية الصورة من الخطوة 42 لأكون متأكدًا". ثم يستدعي الوكيل الرابع، وكيل Analyze، لينظر فقط إلى لقطة الشاشة المحددة تلك ويجيب على سؤال دقيق حولها. تستمر هذه الحلقة من الأخذ والرد حتى يصبح المحقق واثقًا بما يكفي لإعطاء حكم نهائي.

تظهر الورقة البحثية أن نهج "البحث والتحليل" هذا يعد تحولًا جذريًا. فعندما اختبروه، كان SeekJudge أول قاضٍ يعتمد على الذكاء الاصطناعي يؤدي بمستوى يضاهي، أو حتى يتفوق على، مدققي القواعد الجامدة القدامى في مساعدة الروبوتات على تعلم مهام جديدة. في الواقع، عند استخدامه لتدريب روبوت، تعلمت الروبوتات بشكل أسرع ونجحت في مهام أكثر باستخدام SeekJudge مقارنة بالطرق التقليدية.

الأمر الرائع حقًا هو مدى كفاءة هذا النظام. نظرًا لأن الذكاء الاصطناي ينظر إلى صورة واحدة فقط في كل مرة بدلاً من مجموعة كاملة، فهو لا يحتاج إلى كمبيوتر ضخم ومكلف للغاية لتشغيله. وجد الباحثون أن نظامهم يكلف جزءًا ضئيلًا مما تكلفه قضاة الذكاء الاصطناعي الأخرى — أقل بمئات المرات من استخدام نموذج ضخم مغلق المصدر. إنه يشبه الفرق بين توظيف فريق من الخبراء المحليين الذين ينظر كل منهم إلى دليل واحد مقابل بضعة دولارات، مقابل توظيف محقق مشهور يتقاضى ثروة لقراءة ملف القضية بأكمله دفعة واحدة.

كما بنى الفريق "ساحة تدريب" جديدة تسمى CUAStepBench، وهي مجموعة من 278 مهمة كمبيوتر مختلفة حيث قام البشر بتسمية كل خطوة من رحلة الروبوت بعناية. ساعد هذا في تدريب فريق "المحققين" الخاص بهم ليكون حادًا للغاية. لقد أثبتوا أنه من خلال تقسيم المشكلة إلى إيجاد اللحظة المناسبة (التحديد المحلي) ثم قراءة التفاصيل (الاستخراج)، يمكنهم التعامل مع مهام أطول وأكثر تعقيدًا من الطرق السابقة.

باختصار، لا يحاول SeekJudge أن يكون عينًا خارقة ترى كل شيء، بل يعمل كفريق ذكي وفعال يعرف تمامًا متى يركز على أهم دليل. وهذا يجعل من الممكن تدريب الروبوتات التي تستخدم الكمبيوتر في العالم الحقيقي، حيث المهام طويلة، والشاشات تتغير، وكتب القواعد الصارمة لا تنجح ببساه. تشير الورقة البحثية إلى أن هذا النهج يمكن أن يكون المفتاح لجعل مساعدي الذكاء الاصطناعي قادرين فعليًا على مساعدتنا في مهام الكمبيوتر اليومية، من حجز الرحلات الجوية إلى تنظيم الملفات، دون الحاجة إلى كمبيوتر خارق لتصحيح واجباتهم المدرسية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →