إليك ملخص تقني مفصل لورقة البحث بعنوان "ClawMark: معيار العالم الحي للوكلاء متعدد الأنماط، ومتعدد الأدوار، ومتعدد الأيام، والزملاء في العمل."
١. بيان المشكلة
تقيم المعايير الحالية لنماذج اللغة (LM) "الوكلاء" الذين يحلون المهام في "مرة واحدة" ضمن بيئات ثابتة وجلسات فردية. ومع ذلك، فإن حالة الاستخدام الناشئة لوكلاء النماذج اللغوية هي كونهم زملاء عمل مستمرين يعملون جنباً إلى جنب مع البشر على مدار عدة أيام. يفرض هذا الإعداد ثلاثة تحديات حرجة تفشل المعايير الحالية في معالجتها:
- التطور الزمني: تتغير البيئة بشكل مستقل عن الوكيل بين الأدوار (على سبيل المثال، وصول رسائل بريد إلكتروني جديدة، تغير مدخلات التقويم، تحديث الملفات). يجب على الوكلاء التكيف مع هذه التغييرات في الحالة الخارجية بدلاً من افتراض عالم ثابت.
- الحالة الديناميكية: على عكس السجلات الثابتة أو اللقطات المخزنة مؤقتاً، تتضمن سير العمل الحقيقية خدمات ذات حالة (stateful) حيث قد تختلف البيانات التي تمت قراءتها في الخطوة ١ عما هي عليه في الخطوة ٢ بسبب عوامل خارجية.
- الأدلة متعددة الأنماط: تعتمد سير العمل المهنية على أدلة خام غير منسوخة عبر أنماط متنوعة (صور، ملفات PDF ممسوحة ضوئياً، صوت، فيديو، جداول بيانات)، وليس فقط النصوص.
تعتمد المعايات الحالية غالباً على "النموذج اللغوي كحكم" (LLM-as-a-judge) للتسجيل، مما يؤدي إلى الذاتية وعدم الحتمية، ونادراً ما تحاكي "العالم الحي" حيث تتحول البيئة بين أدوار الوكيل.
٢. المنهجية: معيار ClawMark
ClawMark هو معيار مصمم لتقييم وكلاء الزملاء في بيئة ذات حالة، وديناميكية، ومتعددة الأنماط.
أ. البيئة والبنية التحتية
- خدمات معزولة ذات حالة (Sandboxed Services): يعمل المعيار مقابل خمس خدمات معزولة وذات حالة داخل بيئة Docker:
- نظام الملفات (Filesystem)
- البريد الإلكتروني (GreenMail SMTP/IMAP)
- التقويم (Radicale CalDAV)
- قاعدة المعرفة (متوافقة مع Notion)
- الجداول البيانات (متوافقة مع Google Sheets)
- سير عمل متعدد الأدوار، متعدد الأيام: تمتد كل مهمة من ٢ إلى ٦ أدوار، حيث يمثل كل دور يوم عمل واحد في عالم المهمة.
- التحولات الخارجية (Exogenous Mutations): بين الأدوار، تتحول البيئة بشكل مستقل عن الوكيل عبر آليتين:
- الأحداث الصاخبة (Loud Events): يتم الإعلان عنها صراحة في مطالبات "الاستيقاظ" (مثال: "وصل بريد إلكتروني جديد").
- التحولات الصامتة (Silent Mutations): تغييرات غير معلنة تُحقن في الخدمات (مثال: استبدال صف في جدول بيانات، أو تعديل ملف) دون إشعار. يجب على الوكيل اكتشاف هذه التغييرات عن طريق تحديث الحالة.
- المدخلات متعددة الأنماط: يتم تقديم الأدلة كقطع أثرية خام (صور، صوت، فيديو، ملفات PDF) دون نسخ نصي مسبق، مما يتطلب من الوكلاء استخدام أدوات (مثل
whisper و ffmpeg و PyMuPDF) لمعالجتها.
ب. بروتوكول التسجيل (لا يوجد نموذج لغوي كحكم)
يستخدم ClawMark نظام تسجيل حتمي قائم على القواعد:
- الفاحصون (Checkers): تتضمن كل مهمة من ٦ إلى ٢٩ فاحصاً بلغة Python، وهي ذات أوزان محددة، تقوم بفحص الحالة النهائية لخدمات البيئة المعزولة.
- المقاييس:
- الدرجة الموزونة: مقياس مستمر (٠–١٠٠) يكافئ التقدم الجزئي بناءً على معدل اجتياز الفاحصين الموزونين.
- نجاح المهمة: مقياس ثنائي صارم (٠–١٠٠٪) يتطلب اجتياز جميع الفاحصين.
- قيود الخطوط الحمراء (Red-Line Constraints): تعمل ٥٥ فاحصاً محدداً كـ "خطوط حمراء" (قيود صلبة). يؤدي انتهاك هذه القيود (مثل الموافقة على مطالبة قبل التقرير النهائي، أو تسريب البيانات) إلى عقوبات شديدة أو الفشل، بغض النظر عن التقدم الآخر.
- ضمان الحتمية: لا يتم إصدار المهام إلا إذا أنتجت جولتان مستقلتان من إعادة التشغيل نتائج متطابقة تماماً في أحكام الفاحصين، مما يضمن قابلية التكرار دون الحاجة لأحكام النماذج اللغية.
ج. خط إنتاج البناء
بُني المعيار باستخدام خط إنتاج يبدأ بالمهمة أولاً:
- تأليف المهام: يحدد المصممون سير العمل، ومعايير التقييم، وتغييرات الحالة المطلوبة.
- مصادر الأدلة: يتم جمع ١,٠٧٢ قطعة أثرية متعددة الأنماط خام عبر جمع الويب، أو التسجيل الأصلي، أو التخليق بالذكال الاصطناعي المستهدف لمطابقة تصميم المهمة.
- حلقة المراجعة: عملية مكونة من ٣ إلى ٥ جولات تشمل مراجعة بشرية، وتدقيقاً بالذكاء الاصطناعي (للتحقق من "اختراق الفاحص" أو المطابقات النصية الهشة)، ومراجعات المسار من قبل النماذج المرجعية.
- بوابة الإصدار: لا يتم إصدار المهام إلا بعد اجتياز جميع عمليات التدقيق وإثبات اتساق الفاحص الحتمي.
٣. المساهمات الرئيسية
- أول معيار لـ "العالم الحي": يقدم معياراً يجمع بين الجداول الزمنية متعددة الأيام، والتحولات البيئية الخارجية، والأدلة الخام متعددة الأنماط.
- بروتوكول تقييم حتمي: يضع نظام تسجيل بقيمة ١,٥٣٧ فاحصاً قائماً على القواعد، مما يلغي انحياز "النموذج اللغوي كحكم" ويضمن تكراراً متطابقاً تماماً.
- مجموعة بيانات شاملة: يطلق ١٠٠ مهمة عبر ١٣ سيناريو مهني (مثل المساعد السريري، التأمين، EDA، القانون) تشمل ٨٧ دوراً مختلفاً.
- بنية تحتية مفتوحة: يطلق المعيار، وأداة التقييم، وخط إنتاج البناء لدعم الأبحจัย القابلة للتكرار.
٤. النتائج التجريبية
قام المؤلفون باختبار سبعة أنظمة وكلاء رائدة (٥ مملوكة لشركات و٢ مفتوحة المصدر) باستخدام إطار عمل OpenClaw.
الأداء العام
- الدرجة الموزونة: حقق المتصدر، Claude Sonnet 4.6، درجة ٧٥.٨. تلاه Claude Opus 4.6 (٧٤.٦) و GPT-5.4 (٧٢.٠).
- نجاح المهمة الصارم: الفجوة بين التقدم الجزئي والإكمال الكامل هائلة. كان أفضل معدل لـ نجاح المهمة هو ٢٠.٠٪ فقط (Claude Opus 4.6). حل معظم النماذج أقل من ١٥٪ من المهام من البداية إلى النهاية.
- تباين السيناريوهات: تباين الأداء بشكل كبير حسب المجال. على سبيل المثال، تفوقت النماذج في "EDA" (أتمتة التصميم الإلكتروني) و "العقارات"، لكنها واجهت صعوبة كبيرة في "إدارة المشاريع" (متوسط الدرجة ~٣٥.١).
تحليل مستوى الدور (التكيف)
- هبوط اليوم الثاني: كشف تحليل ٧٣ مهمة مكونة من ٣ أدوار أن ستة من أصل سبعة نماذج شهدت انخفاضاً في الأداء في اليوم الثاني، وهي نقطة حدوث أول تحول خارما.
- التعافي: بحلول اليوم الثالث، استعادت معظم النماذج جزءاً بسيطاً فقط، وظلت دون مستويات اليوم الأول. هذا يبرز أن التكيف مع الحالة المتغيرة هو نقطة فشل رئيسية.
- الكفاءة: لم تكن هناك علاقة خطية بين استخدام الرموز (tokens)/الأدوات والدرجة. ومن المثير للاهتمام أن النماذج الأعلى تسجيلاً (Sonnet 4.6, Opus 4.6) كانت أيضاً الأكثر كفاءة في استخدام الأدوات.
تصنيف الفشل
كشف تحليل ١٠,٧٥٩ تقييماً للفاحصين عن نمطين مهيمنين للفشل:
- اكتشاف التغيير الصامت (معدل فشل ٥٦.٥٪): فشل الوكلاء كثيراً في ملاحظة التغييرات غير المعلنة في البيئة.
- الكتابة في الخلفية (معدل فشل ٥٣.٦٪): فكر الوكلاء بشكل صحيح ولكنهم فشلوا في تنفيذ الإجراء النهائي في الخدمة الصحيحة (مثل حفظ ملف أو تحديث صف).
- انتهاكات الخطوط الحمراء: رغم ندرتها بشكل عام (٧.١٪)، إلا أنها تركزت في مهام محددة. ومن الملاحظ أن Qwen 3.6 Plus سجل معدل فشل في الخطوط الحمراء (١٤.٥٪) أعلى بكثير مقارنة بالنماذج رفيعة المستوى (~٣.٦٪).
٥. الأهمية
يمثل ClawMark تحولاً جذرياً في تقييم الوكلاء:
- من الثبات إلى الديناميكية: يتجاوز مجرد "حل هذه الأحجية" إلى "إدارة هذا سير العمل"، حيث يختبر قدرة الوكيل على الحفاظ على السياق بمرور الوقت والتكيف مع الضوضاء الخارجية.
- الموثوقية فوق الطلاقة: تؤكد معايير نجاح المهمة الصارمة وقيود الخطوط الحمراء أن الامتثال والصحة أكثر أهمية من التقدم الجزئي أو المحادثة الطليقة في البيئات المهنية.
- الجاهزية للعالم الحقيقي: تشير النتائج إلى أنه بينما يمكن للنماذج الرائدة التعامل مع الاستدلال المعقد، إلا أنها تفتقر حالياً إلى المتانة المطلوبة لأدوار الزملاء المستمرين والمستقلين، خاصة في اكتشاف تغييرات الحالة الصامتة وتنفيذ التحديثات الخلفية الموثوقة.
إن إصدار ClawMark يوفر البنية التحتية اللازمة لدفع التقدم نحو زملاء عمل حقيقيين، مستمرين، وموثوقين يعتمد على الذكاء الاصطناعي.