Step-level Optimization for Efficient Computer-use Agents
تقترح هذه الورقة إطار عمل متتالٍ على مستوى الخطوة، معياريّاً وقائماً على الأحداث، يعمل على تحسين كفاءة وكلاء استخدام الحاسوب من خلال الاعتماد الافتراضي على سياسات صغيرة ومنخفضة التكلفة، واللجوء فقط إلى النماذج الكبيرة والمكلفة عندما تكتشف أدوات المراقبة خفيفة الوزن توقفاً في التقدم أو انحرافاً دلالياً.
تخيل أنك تقوم بتوظيف فريق من المساعدين لمساعدتك في التنقل عبر مدينة معقدة وغير مألوفة لإكمال قائمة طويلة من المهام.
المشكلة: فخ "الخبير الباهظ الثمن" في الوقت الحالي، تعمل معظم الوكلاء الحاسوبية بهذه الطريقة: أنت توظف خبيراً عالمياً فائق التكلفة (نموذج ذكاء اصطناعي ضخم) لاتخاذ كل قرار نيابة عنك. هو من يفحص الخريطة، ويختار المنعطف، ويمشي الطريق بأكمله.
الجيد: هم أذكياء جداً ونادراً ما يضلون الطريق.
السيء: هم بطيئون للغاية ومكلفون جداً. حتى عندما تحتاج فقط إلى الانعطاف يساراً عند زاوية مألوفة، فإنك تدفع مقابل سعر الساعة المرتفع للخبير. وإذا علق الوكيل في حلقة مفرغة (يمشي في دوائر) أو بدأ يتجه في الاتجاه الخاطئ دون أن تلاحظ، سيستمر الخبير في المشي، مستنزفاً المال والوقت حتى تفشل المهمة.
الحل: "التدفق الذكي" (STEPWISE) يقترح مؤلفو هذه الورقة طريقة جديدة لتوظيف المساعدة. بدلاً من الدفع للخبير مقابل كل خطوة، تقوم بتوظيف دليل محلي سريع ورخيص (نموذج ذكاء اصطناعي أصغر) للقيام بعملية المشي. هذا الدليل يعرف الأساسيات ويمكنه التعامل مع 90% من الخطوات الروتينية بشكل مثالي.
ومع ذلك، أنت تبقي الخبير الباهظ الثمن على اتصال سريع. أنت تستدعيه فقط في حالتين محددتين، يتم اكتشافهما بواسطة "مجسات ذكية" (مراقبين) يراقبون الدليل المحلي:
"مجس التعثر" (مراقب التقدم):
الاستعارة: تخيل أن دليلك المحلي يمشي في دوائر أو ينقر على نفس مقبض الباب مراراً وتكراراً. يلاحظ المجس: "مهلاً، نحن لا نتقدم للأمام!"
الإجراء: يستدعي الخبير فوراً ليقول له: "لقد علقنا! تولَّ القيادة، وحدد مساراً جديداً، وأعدنا للمضي قدماً". وبمجرد أن يكسر الخبير الحلقة، تعود السيطرة إلى الدليل الرخيص.
"مجس المعالم" (مراقب الانحراف):
الاستعارة: أحياناً، لا يمشي الدليل في دوائر، لكنه يمشي بثقة في الاتجاه الخاطئ (على سبيل المثال، يتجه إلى البقالة بينما طلبت منه الذهاب إلى المكتبة). يُسمى هذا "الانحراف الصامت". يبدو الدليل مشغولاً، لكنه يفشل في المهمة.
الإجراء: ينتظر المجس "نقطة تفتيش" طبيعية (مثل الانتهاء من مهمة رئيسية). ثم يسأل الخبير: "هل انتهينا للتو من الشيء الصحيح، أم أننا انحرفنا عن المسار؟" إذا قال الخبير: "لا، أنت في المتجر الخاطئ"، يتولى الخبير القيادة لتصحيح المسار. أما إذا قال الخبير: "نعم، عمل جيد"، فيستمر الدليل الرخيص في المشي.
لماذا ينجح هذا؟ اختبرت الورقة هذا النظام في "مدينتين" حقيقيتين (مهام حاسوبية معقدة تتضمن برامج سطح المكتب وتصفح الويب). وهذا ما وجدوه:
إنه أرخص: من خلال ترك الدليل الرخيص يقوم بمعظم العمل، تمكنوا من تقليل تكلفة تشغيل هؤلاء الوكلاء بنسبة تصل إلى 75%.
إنه أسرع: أنهى الوكلاء المهام بشكل أسرع بنسبة تصل إلى 45% لأنهم لم يضطروا لانتظار الخبير البطيء لكل خطوة صغيرة.
إنه بنفس الجودة: كانت نسبة النجاح (إنجاز المهمة بشكل صحيح) مماثلة تقريباً لما لو استخدموا الخبير الباهظ الثمن طوال الرحلة.
الخلاصة تجادل الورقة بأن ليست كل خطوة في المهمة الحاسوبية متساوية في الصعوبة. معظم الخطوات روتينية؛ القليل منها فقط هو الذي يكون خطيراً أو صعباً. من خلال استخدام "تدفق ذكي" ينتقل بين عامل رخيص وخبير باهظ الثمن عند الضرورة فقط، يمكننا بناء وكلاء حاسوبيين سريعين، ميسوري التكلفة، وذوي ذكاء عالٍ جداً. إنه يحول العملية المكلفة التي تعمل "بشكل دائم" إلى نظام ذكي "عند الطلب".
إليك ملخص تقني مفصل لورقة البحث بعنوان "التحسين على مستوى الخطوة لوكلاء استخدام الكمبيوتر الفعالين" (STEPWISE).
1. بيان المشكلة
يواجه وكلاء استخدام الكمبيوتر، الذين يتفاعلون مباشرة مع واجهات المستخدم الرسومية (GUIs) لأتمتة مهام البرمجيات، عقبة حرجة وهي: كفاءة الاستدلال (Inference Efficiency).
الوضع الحالي: تستدعي معظم الأنظمة الحالية نماذج متعددة الوسائط (LMMs) ضخمة ومكلفة عند كل خطوة تفاعل لإدراك الشاشة، والتخطيط، والعمل.
عدم الكفاءة: مسارات واجهة المستخدم الرسومية طويلة المدى غير متجانسة للغاية. فالعديد من الخطوات روتينية ويمكن التعامل معها بواسطة نماذج أصغر وأرخص. ومع ذلك، تميل الإخفاقات إلى التركز في لحظات محددة عالية المخاطر.
أنماط الفشل: حدد المؤلفون نمطين متكررين للفشل في المسارات طويلة المدى:
تعثر التقدم (Progress Stalls): يدخل الوكيل في حلقة مفرغة، أو يكرر أفعالاً غير فعالة، أو يفشل في تغيير الحالة (مثل النقر على نفس الزر بشكل متكرر).
الانحراف الدلالي الصامت (Silent Semantic Drift): يستمر الوكيل في اتخاذ إجراءات تبدو منطقية محلياً، لكنه يكون قد انحرف بالفعل عن هدف المستخدم الحقيقي (مثل الانتقال إلى صفحة خاطئة). يظل المسار متسقاً محلياً ولكنه محكوم عليه بالفشل عالمياً.
النتيجة: يؤدي التخصيص الموحد للحوسبة إلى زمن استجابة مفرط، وتكاليف مالية عالية (غالباً أكثر من دولار واحد لكل مهمة)، وإنتاجية بطيئة، مما يجعل النشر في بيئات الإنتاج أمراً صعباً.
2. المنهجية: إطار عمل STEPWISE
يقترح المؤلفون STEPWISE، وهو إطار عمل متتالي مدفوع بالأحداث ويعمل على مستوى الخطوة. بدلاً من استخدام نموذج كبير لكل خطوة، يقوم النظام بتشغيل سياسة صغيرة وغير مكلفة بشكل افتراضي، ويصعد إلى نموذج أقوى فقط عندما تكتشف مراقبات خفيفة الوزن ارتفاعاً في مستوى المخاطر.
البنية الأساسية
يتكون النظام من سياسة صغيرة (Small Policy) (افتراضية) وسياسة كبيرة (Large Policy) (هدف التصعيد)، ويتم التحكم فيهما بواسطة مراقبين متعلمين:
مراقب العلوق (Stuck Monitor - إشارة التعافي):
المدخلات: نافذة مدمجة من سجل التفكير والعمل الأخير (wt).
الوظيفة: يكتشف التدهور السلوكي (مثل تكرار الأفعال، أو التخطيط المتذبذب).
الإجراء: إذا تجاوز "درجة العلوق" (stuck score) عتبة معينة، يقوم النظام فوراً بالتصعيد إلى النموذج الكبير للتعافي واستئناف الاستكشاف المنتج.
مراقب المعالم (Milestone Monitor - إشارة التحقق):
المدخلات: وصف المهمة (u) والسجل الأخير (wt).
الوظيفة: يحدد نقاط التفتيش ذات المعنى الدلالي حيث ينبغي للوكيل أن يكون قد أحرز تقدماً نحو الهدف.
الإجراء: عند اكتشاف معلم (milestone)، يطلق النظام استدعاء تحقق متفرق (sparse verification) للنموذج الكبير. يتحقق النموذج الكبير من:
صلاحية التقدم: هل المسار يتقدم نحو الهدف؟
اتساق القصد: هل انحرف الوكيل عن قصد المستخدم؟
النتيجة: إذا فشل التحقق، يصعد النظام إلى النموذج الكبير للخطوة التالية. إذا نجح، يتم اعتماد المعلم، وتستمر السياسة الصغيرة.
التدريب والنشر
جمع البيانات: يتم إنشاء المسارات باستخدام السياسة الصغيرة. ثم يقوم نموذج لغوي كبير أقوى (مثل GPT-5 أو Claude Sonnet) بتصنيف المقاطع كـ "عالق/غير عالق" أو "معلم/ليس معلماً".
النموذج: يتم تدريب مشفرات ModernBERT خفيفة الوزن للتنبؤ بهذه التصنيفات بناءً على الآثار النصية (التفكير + الأفعال)، مما يتجنب الحاجة إلى معالجة لقطات الشاشة الخام للمتحكم.
جاهز للتشغيل (Plug-and-Play): إطار العمل معياري؛ حيث يمكن وضعه فوق الوكلاء الحاليين دون الحاجة لإعادة تدريب النموذج الكبير أو تغيير البنية الأساسية.
3. المساهمات الرئيسية
التحليل المنهجي لتكاليف الاستدلال: توضح الورقة أن تكاليف الاستدلال في وكلاء استخدام الكمبيوتر مدفوعة بمجموعة فرعية صغيرة من الخطوات "الصعبة"، بينما تظل غالبية الخطوات روتينية. وتثبت أن الإخفاقات ليست موحدة بل مركزة في أنماط محددة (التعثر والانحراف).
التتالي المتتالي على مستوى الخطوة والمدفوع بالأحداث: إطار عمل مبتكر ينتقل من الاستدلال المستمر للنماذج الرائدة إلى تخصيص الحوسبة التكيفي وعند الطلب. فهو يجمع بين إشارتين متكاملتين (اكتشاف العلوق للتعافي المحلي، والتحقق من المعالم لتصحيح الانحراف العالمي).
الكفاءة الجاهزة للتشغيل: لا يتطلب المنهج إعادة تدريب النموذج الكبير الأساسي ويمكن نشره فوراً على الوكلاء الحاليين.
التحقق التجريبي: يثبت أن هذا النهج يحسن بشكل كبير جبهة الأداء والكفاءة، محققاً تقارباً في الأداء مع السياسات التي تستخدم النماذج الكبيرة دائماً، مع تقليل التكلفة وزمن الاستجابة بشكل هائل.
4. النتائج التجريبية
تم تقييم إطار العمل على OSWorld (مهام سطح المكتب) و WebArena (التنقل عبر الويب).
الأداء مقابل التكلفة:
OSWorld: حقق نظام التتالي (على سبيل المثال، Qwen3-VL-8B + Kimi K2.5) نسبة نجاح 59.3%، وهو ما يكاد يطابق نموذج Kimi K2.5 المستقل (60.1%)، ولكن بتكلفة أقل بنسبة 61.4% (0.078 مقابل 0.208 دولار لكل مهمة).
WebArena: لوحظت توجهات مماثلة. حقق نظام التتالي نجاحاً بنسبة 58.8% (مقابل 60.1% لنموذج GPT-5.2 المستقل) مع تقليل كبير في زمن الاستجابة والتكلفة.
مكاسب الكفاءة:
تقليل التكلفة: انخفاض يصل إلى 74.6% في تكلفة الاستدلال مقارنة بالسياسات التي تستخدم النماذج الكبيرة دائماً.
تقليل زمن الاستجابة: انخفاض يصل إلى 45.8% في وقت التنفيذ الفعلي.
استخدام النموذج: تم استدعاء النماذج الكبيرة فقط عند الضرورة (على سبيل المثال، حوالي 40-60% من الخطوات في حالات التتالي مقابل 100% في النماذج المرجعية).
دراسات الاستئصال (Ablation Studies):
كلا الكاشفين ضروريان. "المراقب الخاص بالعلوق فقط" يساعد في حل الحلقات المفرغة؛ و"المراقب الخاص بالمعالم فقط" يساعد في معالجة الانحراف الدلالي. استخدام كليهما يعطي أفضل النتائج، مما يثبت أنهما يعالجان أنماط فشل مختلفة.
المدفوع بالأحداث مقابل الفترات الثابتة: يتفوق النهج المدفوع بالأحداث بشكل كبير على التحقق ذو الفترات الثابتة (التحقق كل k خطوة)، والذي يكون إما مكلفاً للغاية أو يفشل في رصد نقاط الانحراف الحرجة.
5. الأهمية
تحول في النموذج (Paradigm Shift): تجادل الورقة بأن استدلال وكيل استخدام الكمبيوتر يجب أن يُعامل كـ مشكلة أنظمة ديناميكية وليس كمشكلة تنبؤ ثابتة لكل خطوة. فالأخطاء غالباً ما تظهر تدريجياً، مما يتطلب تدخلاً مستهدفاً بدلاً من إنفاق حوسبي موحد.
النشر العملي: من خلال فصل السياسة "الافتراضية" عن السياسة "الخبيرة"، يجعل إطار STEPWISE وكلاء استخدام الكمبيوتر عالي القدرة مجدية اقتصادياً للاستخدام في الإنتاج الواقعي، حيث تعتبر التكلفة وزمن الاستجابة بنفس أهمية الدقة الخام.
القابلية للتعميم: تشير الطبيعة المعيارية لإطار العمل إلى إمكانية تطبيقه على مختلف بنيات الوكلاء وأزواج النماذج، مما يوفر مساراً قابلاً للتوسع نحو أتمتة البرمجيات العامة والفعالة.