Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
يقدم Harness-R1 طريقة مبتكرة تستخدم التعلم التعزيزي عبر الإنترنت لتدريب "مهندس حزام" (harness engineer) مخصص لتوليد رقع برمجية قابلة للتنفيذ تلقائياً من مسارات فشل الوكيل، مما يحسن معدلات نجاح المهام بشكل كبير عبر معايير قياسية متعددة دون الحاجة إلى تحديث أوزان نموذج الوكيل المستهدف.
تخيل أن لديك مساعداً آلياً عبقرياً وفائق الذكاء. تعطي هذا الروبوت مهمة، مثل "ابحث عن القميص الأحمر المثالي بسعر أقل من 20 دولاراً"، فيبدأ بالعمل. ولكن في بعض الأحيان، قد يرتبك الروبوت. ربما يضغط على الزر الخطأ، أو ينسى ما كان يبحث عنه، أو يعلق في حلقة مفرغة من محاولة شراء نفس السلعة مراراً وتكراراً. في عالم الذكاء الاصطناعي، يُسمى هذا الروبوت "عميلاً" (Agent)، ويُسمى المسار الفوضوي لأفكاره وأفعاله وأخطائه "مسار الحركة" (Trajectory).
عادةً، عندما يرتكب الروبوت خطأً، فإن الطريقة الوحيدة لإصلاحه هي العودة إلى نقطة البداية وإعادة تدريب دماغه بالكامل. وهذا يستغرق الكثير من الوقت والطاقة. ولكن هناك طريقة أخرى: بدلاً من تغيير دماغ الروبوت، يمكنك تغيير "الحزام" (Harness) الذي يرتديه. فكر في الحزام كأنه معدات السلامة الخاصة بالروبوت، وقائمة التحقق الخاصة به، ودليل التواصل الخاص به، وكل ذلك مدمج في شيء واحد. إنه الكود الذي يخبر الروبوت بكيفية التحدث مع العالم، وكيفية مراجعة عمله، وكيفية التعافي عندما يتعثر. السؤال الكبير الذي يطرحه الباحثون هو: هل يمكننا تعليم الروبوت إصلاح حزامه الخاص بناءً على إخفاقاته الماضية، دون الحاجة إلى إعادة تدريب دماغه في كل مرة؟
هذا بالضبط ما تستكشفه ورقة بحثية بعنوان "Harness-R1". فقد بنى الباحثون نظاماً حيث يتعلم ذكاء اصطناعي خاص يسمى "المهندس" (Engineer) كيفية إعادة كتابة حزام الروبوت من خلال دراسة أخطائه الماضية. إليك كيف يعمل الأمر: أولاً، يتركون روبوتاً عادياً (الهدف - Target) يحاول حل المهام ويفشل. ثم ينظر "المهندس" إلى قصص الفشل تلك ويكتب مجموعة جديدة من التعليمات — "رقعة" (Patch) — لإصلاح الحزام. والأهم من ذلك، هم لا يخمنون فقط ما إذا كانت الرقعة جيدة؛ بل يقومون بالفعل بوضع الرقعة على الروبوت ويتركونه يجرب المهام مرة أخرى. إذا نجح الروبوت في المهمة بشكل متكرر، يحصل "المهندس" على مكافأة ويتعلم كتابة رقع أفضل. وإذا جعلت الرقعة الأمور أسوأ، يتعلم "المهندس" ألا يفعل ذلك مرة أخرى.
النتائج رائعة حقاً. فعندما اختبروا ذلك على ثلاث ألعاب مختلفة وصعبة (التسوق عبر الإنترنت، والتنقل في منزل قائم على النصوص، وإدارة قاعدة بيانات)، نجح الروبوت العادي بنسبة 44.3% فقط. وبعد أن تعلم "مهندس Harness-R1" كيفية إصلاح حزامه، قفز معدل النجاح إلى 53.6%. هذا تحسن قدره 9.3 نقطة مئوية بمجرد تعديل الحزام، وليس الدماغ. والأفضل من ذلك، أنهم جربوا ذلك على روبوت تم تدريبه بالفعل ليكون أكثر ذكاءً، ومع ذلك تمكن "المهندس" من رفع أدائه بنسبة 5.0 نقاط إضافية.
كما تظهر الورقة البحثية أن هذا ليس مجرد صدفة لروبوت واحد بعينه. فالمهندس الذي قاموا بتدريبه استطاع النظر إلى روبوت جديد ومختلف لم يره من قبل، ودراسة إخفاقاته، وكتابة إصلاح مخصص ساعد ذلك الروبوت الجديد على النجاح أيضاً. وهذا يشير إلى أن تعلم تحرير "الحزام" هو مهارة يمكن تعليمها للذكاء الاصطناعي، مما يسمح له بالتطور المشترك مع الروبوتات التي يساعدها، مما يجعلها أكثر ذكاءً وموثوقية بمرور الوقت دون الحاجة أبداً إلى إعادة تدريب عقولها الأساسية.
ملخص تقني: Harness-R1
بيان المشكلة
تراكم وكلاء نماذج اللغات الكبيرة (LLM) المنشورين في بيئات ديناميكية مسارات تفاعلية تحتوي على تجارب ناجحة وإخفاقات منهجية (مثل سوء استخدام الأدوات، فقدان الحالة، أو انتهاك البروتوكولات). وبينما تركز النهج الحالية لتحسين الوكيل بشكل أساسي على تحديث أوزان النموذج عبر الضبط الدقيق (fine-tuning) أو التعلم التعزيزي (reinforcement learning)، فإن "حامل الوكيل" (agent harness) — وهو كود وقت التشغيل القابل للتنفيذ الذي يبني السياق، ويتوسط في الأدوات، ويتحقق من الإجراءات، ويدير الاسترداد — يظل عادةً ثابتًا.
إن تعديل هذا الحامل أمر بالغ الأهمية لأن أوزان النموذج المتطابقة يمكن أن تنتج قدرات متفاوتة تمامًا تحت تكوينات مختلفة للحامل. ومع ذلك، فإن تعديل الحامل بشكل مباشر هو أمر غير موثوق؛ فالقواعد الثابتة (مثل Self-Refine) غالبًا ما تؤدي إلى تدهور الأداء، كما أن حث النماذج الأمامية الضخمة لتعديل الحامل يؤدي إلى مكاسب غير مستقرة لأن هذه النماذج تعمل على تحسين "المعقولية النصية" بدلاً من "النجاح المثبت في المهمة". التحدي الجوهري يكمن في تطوير طريقة تتعلم كيفية تعديل وقت تشغيل قابل للتنفيذ بناءً على إخفاقات الوكيل الملحوظة، مع ضمان التحقق من التعديلات من خلال تحسينات الأداء الفعلية بدلاً من الاستدلال النظري.
المنهجية: Harness-R1
يقدم Harness-R1 نموذجًا تدريبيًا يعامل تعديل الحامل كمسألة تعلم تعزيزي (RL) عبر الإنترنت لنموذج "مهندس الحامل" (harness engineer) مخصص، مع إبقاء الوكيل المستهدف ثابتًا. يعمل النظام وفق حلقة: "فشل ← تعديل ← إعادة تشغيل":
1. صياغة المشكلة
الهدف الثابت (Frozen Target): يظل الوكيل المستهدف A (النموذج + وقت التشغيل الأساسي) ثابتًا.
حزم الفشل (Failure Packets): يتم تشغيل دفعة من المهام B، ويقوم مستخرج محدد (deterministic extractor) بتجميع الحلقات الفاشلة في "حزم فشل" (sB) تحتوي على قيود المهمة، ومقتطفات من الإجراء والملاحظة، والنتائج.
المهندس (Hθ): يعمل نموذج مخصص بحجم 9 مليار بارامتر كـ "محرر". يقرأ حزمة الفشل ويولد طبقة تغطية قابلة للتنفيذ (patch) P.
خطافات التنفيذ (Executable Hooks): تغلف الرقعة P دورة حياة الوكيل عند أربع نقاط محددة دون تغيير أوزان النموذج:
ما قبل القرار (Pre-Decision): تعزيز السياق بالتوجيهات/القيود.
ما قبل الإجراء (Pre-Action): التحقق من الإجراءات المقترحة، أو إعادة كتابتها، أو الاعتراض عليها.
ما بعد التغذية الراجعة (Post-Feedback): فحص الملاحظات وتفعيل عملية الاسترداد.
إشارة المكافأة (Reward Signal): يعيد الهدف المُرقع تشغيل نفس دفعة المهام. المكافأة هي الفرق في الأداء (ΔB) بين عمليات التشغيل المُرقعة وغير المُرقعة. وهذا يخلق هدفًا استنتاجيًا (transductive) لنفس الدفعة، حيث تكون المكافأة غير قابلة للاشتقاق ولا يمكن ملاحظتها إلا بعد التنفيذ.
2. خط أنابيب التدريب (Training Pipeline)
يستخدم Harness-R1 عملية تدريب مكونة من مرحلتين:
الضبط الدقيق الخاضع للإشراف للبداية الباردة (Cold-Start SFT): يقترح نموذج معلم قوي استجابات التعديل من حزم الفشل. يتم التحقق من هذه الاستجابات مقابل الهدف الثابت؛ ويتم الاحتفاظ فقط بالرقع القابلة للتنفيذ وغير المتراجعة لتشكيل مجموعة بيانات لتهيئة سياسة المهندس.
تحسين السياسة النسبي الجماعي القائم على النتيجة (Outcome-Grounded GRPO):
يقوم المهندس بأخذ عينات من K رقعة مرشحة لحزمة فشل واحدة.
يتم التحقق من كل مرشح وتثبيته؛ ثم يعيد الهدف الثابت تشغيل دفعة المهام.
يتم تطبيع المكافآت ضمن مجموعة المرشحين K لحساب المزايا (advantages).
يتم تحديث بارامترات المهندس لتعظيم هدف البديل المقطوع (clipped surrogate objective) بمتوسط الرموز، بهدف تحسين "المنفعة المحققة" للرقع.
المساهمات الرئيسية
الصياغة: تصيغ الورقة تعديل الحامل المشروط بالفشل عبر دورة الحياة كمسألة تعلم تعزيزي عبر الإنترنت لمهندس مخصص، متميزة عن تحديث أوزان النموذج.
إطار عمل Harness-R1: تقترح نظامًا يجمع بين SFT للبداية الباردة و GRPO القائم على النتيجة. بخلاف الأعمال السابقة التي تستخدم المحررين للبحث في البرامج أو اختيار المرشحين، يقوم Harness-R1 بتحديث سياسة المحرر مباشرة بناءً على نتائج تنفيذ رقعهم على هدف ثابت.
التطور المشترك (Co-evolution): تُظهر الطريقة أن مهندس الحامل والوكيل المستهدف يمكنهما التطور بشكل مشترك؛ حيث يحسن مهندس تم تدريبه على هدف "خام" (vanilla) من أداء الهدف، ويمكن لمهندس تمت إعادة تدريبه أن يحسن أيضًا هدفًا خضع بالفعل للضبط الدقيق المباشر.
النتائج التجريبية
تم تقييم الطريقة على ثلاثة اختبارات تفاعلية: WebShop (التنقل عبر الويب)، و ALFWorld (مهام نصية مجسدة)، و DBBench (الاستعلام من قواعد البيانات).
مكاسب الأداء (الهدف الخام - Vanilla Target): بالنسبة لوكيل Qwen3.5-9B ثابت، زاد Harness-R1 متوسط معدل النجاح من 44.3% إلى 53.6% (+9.3 نقطة مئوية). وقد تفوق هذا على الاستراتيجيات القائمة على الحث (مثل Self-Refine، التي أدت إلى انخفاض الأداء) وعلى النماذج الأمامية التي تم حثها كمحررات (مثل GLM-5.2 التي حققت 48.8%).
مكاسب الأداء (الهدف المضبوط دقيقًا - Fine-Tuned Target): بعد الضبط الدقيق المباشر للوكيل المستهدف (مما رفع خط الأساس إلى 59.2%)، قام مهندس Harness-R1 الخاص بالهدف بزيادة النجاح إلى 64.2% (+5.0 نقطة)، مما يثبت أن تحسين الحامل يظل فعالًا حتى بعد تحديث أوزان النموذج.
التعميم (Generalization):
عبر النماذج (Cross-Model): انتقلت سياسة التعديل المتعلمة إلى 20 نموذجًا مستهدفًا غير مرئي (تتراوح من 1B إلى 70B بارامتر عبر عائلات Llama و Gemma و Qwen)، محققة مكاسب إيجابية على كل هدف دون الحاجة لإعادة ضبط لكل نموذج.
عبر المهام (Cross-Task): باستخدام أدلة فشل ضئيلة (10 حالات فشل)، أنتج المهندس رقعًا حسنت المهام المحجوزة بنسبة +8.9 نقطة، متفوقًا بشكل كبير على النماذج الأمامية الضخمة التي أظهرت نتائج سلبية أو غير مستقرة على البيانات المحجوزة.
الدراسة الاستقصائية (Ablation): أدى إزالة خطافات دورة الحياة المحددة (مثل الوساطة قبل الإجراء أو استرداد ما بعد التغذية الراجعة) إلى تقليل الأداء، مما يؤكد أن المكاسب موزعة عبر دورة حياة الوكيل وتعتمد على بيئة محددة.
الأهمية والادعاءات
تفترض الورقة أن بناء الحامل هو قدرة قابلة للتعلم تكمل التحديثات التقليدية للأوزان. تكمن أهميتها الأساسية في نقل هدف التحسين من اتخاذ القرار الداخلي للوكيل (الأوزان) إلى آليات وقت التشغيل الخارجية (الحامل).
الواقعية فوق المعقولية: يجادل المؤلفون بأن حث النماذج الكبيرة لتعديل الكود غير موثوق لأنها تحسن "المظهر الصحيح". يتعلم Harness-R1 من النتائج المحققة، مما يضمن أن التعديلات مفيدة حقًا.
القابلية للتكيف: على عكس الاستراتيجيات الثابتة (مثل Self-Refine) التي تطبق قواعد موحدة، يولد Harness-R1 تعديلات مشروطة بأنماط فشل محددة، متكيفًا مع نقاط الضعف الفريدة للوكيل المستهدف.
التطور المشترك: تشير النتائج إلى مسار نحو وكلاء يمكنهم التحسن المستمر بعد النشر ليس فقط عبر إعادة تدريب النموذج، بل عبر تطوير بيئة وقت التشغيل التي تحيط به. وتخلص الورقة إلى أن هذا النهج يسمح للمهندس والهدف بالتطور معًا، مما يوفر مسارًا قويًا لتحسين الوكيل بعد النشر.