ملخص تقني: Co-Harness: تطور مشترك للأحزمة وأوزان النماذج لوكلاء النماذج اللغوية الكبيرة (LLM Agents)
1. بيان المشكلة
تتضمن مرحلة ما بعد التدريب للوكلاء المخصصين للبحث الآلي للذكاء الاصطنا-عي تقليديًا تحسين معلمات النموذج (model parameters) مع التعامل مع نظام التشغيل وقت التشغيل — "الحزام" (Harness) — كبنية ثابتة وساكنة. يشمل الحزام المطالبات (prompts)، والأدوات، والمهارات، والبرمجيات الوسيطة (middleware)، وسياسات إعادة المحاولة. تخلق مسارات العمل الحالية عدم توافق جوهري: حيث يتم تحديث النموذج عبر التعلم الخاضع للإشراف (SFT) أو التعلم المعزز (RL) بناءً على مسارات ناتجة عن حزام ساكن، ومع ذلك لا يتم أبدًا تحسين الحزام نفسه بناءً على الإخفاقات المرصودة أثناء التدريب.
يؤدي هذا التباين إلى خلق عنق زجاجة حيث تمنع السقالات دون المستوى الأمثل (مثل المطالبات الغامضة، أو مخططات الأدوات غير الصحيحة، أو فقدان خطافات إعادة المحاولة، أو تجاوز سعة الذاكرة) توليد مسارات تدريب عالية الجودة. وبناءً على ذلك، لا يستطيع النموذج التعلم للتغلب على هذه القيود البيئية، ويصبح الحامل الثابت سقفًا لأداء الوكيل، خاصة في إعدادات الاستدلال المتكامل مع الأدوات (TIR) المعقدة حيث يمكن لخطأ واحد في المخطط (schema) أن يؤدي إلى إبطال جلسة كاملة متعددة الأدوار.
2. المنهجية: إطار عمل Co-Harness
يقترح المؤلفون إطار عمل Co-Harness، وهو إطار ثنائي الحلقة يعمل على تحسين كل من حزام الوكيل (ϕ) ومعلمات النموذج (θ) بشكل مشترك من خلال عملية تبادلية. الفرضية الأساسية هي أن الحزام الأفضل ينتج مسارات أكثر نقاءً وإفادة، مما يدرب نموذجًا أقوى؛ وهذا النموذج الأقوى بدوره يكشف عن اختناقات الحزام ذات الرتبة الأعلى التي كانت غير مرئية سابقًا، مما يسمح بمزيد من التحسينات في السقالات.
يعمل إطار العمل عبر حلقتين متبادلتين في كل جولة t:
أ. حلقة Co-Harness (تحسين الحزام)
في هذه المرحلة، يتم تثبيت النموذج θt بينما يتم تطوير الحزام ϕt.
- جمع الإخفاقات: ينفذ الوكيل المهام تحت ظروف (θt,ϕt)، ويجمع مجموعة من المسارات الفاشلة Ft−.
- تحليل HarnessCritic: يقوم مكون يعتمد على النماذج اللغوية الكبيرة يسمى HarnessCritic (C) بتحليل هذه الإخفاقات. ويعزو كل فشل إلى سبب جذري مهيكل داخل تكوين الحزام (مثل غموض المطالبة، أو خطأ في مخطط الأداة، أو مهارة مفقودة، أو عدم توافق البرمجيات الوسيطة، أو تجاوز سعة الذاكرة).
- توليد الفروقات والتحقق من الصحة: يقترح HarnessCritic إصلاحات محلية (differences) للحزام. ويتم التحقق من صحة هذه الإصلاحات عبر تشغيل اختبارات "التشغيل التجريبي" (rollout tests) لضمان تحسين نمط الفشل المستهدف دون التسبب في تراجع في السلوكيات المحفوظة.
- تحديث السجل: يتم اعتماد الإصلاحات التي تم التحقق منها في سجل نسخة من الحزام، مما يؤدي لتحديث التكوين النشط إلى ϕt∗.
ب. حلقة محاذاة النموذج (تحسين النموذج)
في هذه المرحلة، يتم تثبيت الحزام المطور ϕt∗ بينما يتم تحديث النموذج.
- جمع المسارات عالية الجودة: يتم تشغيل النموذج الحالي θt تحت الحزام المحسن ϕt∗ لتوليد مجموعة بيانات جديدة Dt من المسارات عالية الجودة.
- التعلم الخاضع للإشراف (SFT): يتم ضبط النموذج بدقة (fine-tuning) على Dt لاستيعاب السلوكيات التي مكنتها السقالات المحسنة، مما ينتج عنه نموذج محدث θt+1.
- التكرار: يصبح النموذج الجديد θt+1 والحزام المطور ϕt∗ نقطة البداية للجولة التالية، حيث قد يكشف النموذج الأقوى عن قيود أكثر تعقيدًا في الحزام.
تصنيف عزو الفشل
يصنف HarnessCritic الإخفاقات إلى خمسة أبعاد قابلة للتنفيذ للحزام وتسمية واحدة للامتناع:
- غموض المطالبة (P): عدم تحديد التعليمات أو تضارب الأهداف.
- خطأ مخطط الأداة (T): استدعاءات أدوات غير صالحة، أو مخططات وسائط سيئة، أو عدم توافق مع الخلفية البرمجية.
- المهارة المفقودة (S): غياب الإجراءات القابلة لإعادة الاستخدام أو بدائيات التفكيك.
- عدم توافق البرمجيات الوسيطة ($Mid$): بروتوكولات حلقات معيبة، أو سلوكيات الخطافات، أو منطق إدارة السياق.
- تجاوز سعة الذاكرة (M): تجاوز الحالة المستمرة، أو الذاكرة القديمة، أو فشل الاسترجاع.
- خطأ الوكيل: الحالات التي يكون فيها الفشل متأصلًا في استدلال النموذج بدلاً من الحزام.
3. المساهمات الرئيسية
- صياغة التحسين المشترك: يصيغ البحث عملية ما بعد تدريب الوكيل كمسألة تحسين مشتركة فوق أوزان النموذج وحزام وقت التشغيل، متجاوزًا بذلك نموذج التعامل مع المطالبات والأدوات كبنية تحتية ثابتة.
- HarnessCritic: تقديم إجراء مدفوع بالفشل يقوم بعملية عزو مهيكلة للأخطاء إلى مكونات محددة في الحزام ويقترح فروقات محلية مصححة ومحققة.
- آلية المكاسب التراكمية: إثبات أن التناوب بين تطور الحزام ومحاذاة النموذج يخلق حلقة تغذية راجعة إيجابية، حيث تؤدي التحسينات في السقالات إلى بيانات تدريب أفضل، مما ينتج نماذج أقوى قادرة على الاستفادة من سقالات أكثر تطورًا.
4. النتائج التجريبية
تم تقييم إطار العمل على مهام الاستدلال المتكامل مع الأدوات (TIR) باستخدام معايير رياضية (AIME 2024, AIME 2025, HMMT 2025) وعلى مقيلي نماذج (Qwen3-8B و Qwen3-32B).
- مكاسب الأداء: أدت جولتان من التطور المشترك لـ Co-Harness إلى متوسط تحسن في الدقة قدره +20.4 نقطة مئوية (pp) عبر المعايير ومقاييس النماذج مقارنة بالخط المرجعي (حيث تطور الحزام مرة واحدة دون SFT للنموذج).
- لوحظ أكبر تحسن في المعيار الأكثر صعوبة (HMMT 2025) لنموذج Qwen3-32B، بزيادة قدرها +27.2 نقطة مئوية.
- تفوق النظام على التكوينات المصممة يدويًا وثابتة للحزام بمتوسط +24.7 نقطة مئوية.
- دراسة حالة ذاتية القيادة: في تشغيل ذاتي استمر لأكثر من 200 ساعة على AIME 2024، قام النظام بـ:
- التعافي من انهيار أولي للنظام (خطأ vllm KV cache).
- تحسين كفاءة الاستدلال بمقدار 8.7 ضعفًا (تقليل وقت التشغيل الفعلي من 3.78 ساعة إلى 1.11 ساعة) من خلال الاستدلال بالدفعات العالمية (global-batched inference).
- اكتشاف استراتيجية تجميع (تصويت الأغلبية بين بذور متنوعة) حققت أفضل دقة (63.3%) ضمن الميزونة الزمنية، وكل ذلك دون تدخل بشري.
- المتانة: نجح النظام في اكتشاف والتراجع عن حالات التراجع (مثل المطالبات الخاصة بنطاق معين التي تتعارض مع الاستدلال الداخلي للنموذج) باستخدام سجله الذي يدعم التحكم في النسخ.
5. الأهمية والادعاءات
يجادل البحث بأن Co-Harness يعالج قصورًا حرجًا في تطوير الوكلاء الحالي: وهو فصل تدريب النموذج عن البيئة التي تولد بيانات التدريب. من خلال التعامل مع الحزام كمتغير قابل للتعلم وليس كسقالة ثابتة، يتيح Co-Harness تحسينًا ذاتيًا تراكميًا.
يدعي المؤلفون أن هذا النهج يحقق "لولب التغذية الراجعة الإيجابية" حيث:
- ينتج الحزام الأفضل استخدامًا أنقى للأدوات وأخطاء أقل يمكن تجنبها.
- تدرب هذه المسارات الأنقى نموذجًا أقوى.
- يمكن للنموذج الأقوى استغلال تكوينات حزام أغنى وأكثر تعقيدًا كانت غير قابلة للاستخدام سابقًا.
يتناقض هذا مع الأعمال السابقة التي إما تُحسن النموذج لحامل ثابت (SFT/RL قياسي) أو تُحسن الحامل لنموذج ثابت (البحث في وقت الاستدلال). يُقدم Co-Harness كأول إطار عمل يطور كليهما معًا، مما يشير إلى أن الترابط بين السقالات وأوزان النماذج هو محور أساسي لتحسين قدرات الوكيل بما يتجاوز تدريب ما بعد الحامل الثابت.
القيود التي لاحظها المؤلفون: يتطلب النهج نموذجًا ناقدًا (critic LLM) قادرًا، وحجمًا كافيًا من مسارات الفشل للبداية الباردة (cold-start)، وقدرة حوسبية كبيرة لعمليات SFT متعددة الجولات. بالإضافة إلى ذلك، قد تتدهور دقة العزو بالنسبة لأنماط الفشل التي تتطلب استدلالًا مضادًا للواقع (counterfactual reasoning) معقدًا، وتظل إعادة التصميم الهيكلي للحزام من مسؤولية البشر.