WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks
تقدم هذه الورقة WeClawArena، وهي بيئة تجريبية ومعيار قياس قابل للتدقيق مصمم لتقييم فائدة وأمن التعاون بين الوكلاء عبر المستخدمين في الشبكات المتمحورة حول الإنسان، وذلك من خلال محاكاة التفاعلات متعددة الأطراف عبر مساحات العمل الشخصية باستخدام 620 نوعاً من المهام التي تشمل سيناريوهات حميدة وعدائية.
تخيل عالماً يمتلك فيه كل شخص مساعداً رقمياً شخصياً؛ ذكاءً اصطناعياً لا يكتفي فقط بالإجابة على الأسئلة، بل يقوم بالفعل بالأشياء نيابة عنك. يمكنه إدارة تقويمك، وحجز رحلات طيرانك، وكتابة برمجياتك، وحتى التفاوض على الصفقات بالنيابة عنك. هذا هو الوعد الذي تقدمه "شبكات الوكلاء المتمحورة حول الإنسان"، حيث يعمل هؤلاء المساعدون الرقميون كمناديب لك في عالم رقمي معقد. لكن هنا تكمن العقبة: في هذا العالم الجديد، لا يتحدث مساعدك مع مساعدك فحسب، بل يعملان معاً عبر "مكاتب" رقمية مختلفة. يحمل مساعدك ملفاتك الخاصة، وحدود حسابك البنكي، وقواعدك الشخصية. ومساعد صديقك يحمل قواعده هو. يجب عليهم التعاون لإنجاز مهمة ما، لكن لا يمكنهم ببساطة الدخول إلى مكاتب بعضهم البعض وأخذ ما يريدون. الأمر يشبه مجموعة من الجواسيس يحاولون حل لغز معاً، حيث يمتلك كل جاسوس حقيبة مغلقة خاصة به، ولا يمكنهم مشاركة المعلومات إلا إذا امتلكوا المفاتيح والأذونات الصحيحة.
السؤال الكبير هو: هل يمكن لفرق الذكاء الاصطناعي هذه أن تعمل معاً بفعالية دون تسريب الأسرار بالخطأ، أو كسر القواعد، أو التعرض للخداع من قبل طرف سيء؟ إذا همس مخترق بكذبة لأحد الوكلاء، فهل يصدق الفريق بأكمله تلك الكذبة؟ إذا طُلب من وكيل مشاركة سر ما، فهل سيقول "لا" حتى لو بدا الأمر ملحاً؟ لقد اختبر العلماء مدى جودة استخدام الذكاء الاصطناعي للأدوات وتواصله مع بعضه البعض، لكنهم لم يمتلكوا ساحة لعب آمنة ومسيطر عليها لرؤية ما يحدث عندما يحاول هؤلاء الوكلاء التعاون عبر حدود الخصوصية أثناء تعرضهم لهجوم. وبدون ذلك، لا نعرف ما إذا كان مساعدونا الرقميون المستقبليون آمنين حقاً للاستخدام في العالم الحقيقي.
هنا يأتي دور WeClawArena. فكر فيه كغرفة "هروب" رقمية عالية التقنية مصممة خصيصاً لاختبار فرق الذكاء الاصطناعي هذه. لقد بنى الباحثون بيئة تجريبية (sandbox) — وهي بيئة محاكاة آمنة أنشأوا فيها 124 سيناريو مختلفاً، مثل التفاوض على صفقة تجارية، أو حجز رحلة جماعية، أو إصلاح خطأ برمجِيّ. ثم قاموا بتوسيع هذه السيناريوهات إلى 620 نسخة مختلفة من كل سيناريو. في النسخ "الجيدة"، يحاول الوكلاء فقط حل المشكلة. أما في النسخ "السيئة"، فيقوم الباحثون بحقن مواقف مخادعة: قد يرسل مخترق رسالة مزيفة، أو يسمم قطعة من البيانات، أو يحاول خداع وكيل لكسر قاعدة خصوصية.
أجرى الفريق عمليات المحاكاة هذه مع عدة نماذج ذكاء اصطناعي مختلفة لمعرفة كيفية تعاملها مع الضغط. ووجدوا أنه بينما تبرع بعض نماذج الذكاء الاصطناعي في إتمام المهمة، فإنها غالباً ما تفشل في ملاحظة تعرضها للخداع أو اكتشاف أنها تشارك معلومات خاصة بالخطأ. على سبيل المثال، في اختباراتهم، كان أحد النماذج الأعلى أداءً (Claude Opus 4.7) هو الأفضل في مقاومة الهجمات، لكن حتى هو لم يكن مثالياً. أظهرت الدراسة أن الذكاء الاصطناعي يمكنه إكمال مهمة بنجاح — مثل إتمام صفقة أو حجز رحلة طيران — وفي الوقت نفسه يسرب حداً سرياً للميزانية أو يقبل موافقة مزيفة. الأمر يشبه نادلاً ينجح في إحضار طعامك إلى الطاولة، ولكنه يخبر المطبخ بالخطأ برقم بطاقتك الائتمانية.
اكتشف الباحثون أن نوع الخطأ الذي يرتكبه الذكاء الاصطناعي يعتمد بشكل كبير على الموقف. في سيناريوهات التداول والمزايدة، كان الوكلاء أكثر عرضة للوقوع في الفخاخ الأمنية (مثل البيانات المزيفة). وفي تطوير البرمجيات وتخطيط السفر، كانوا أكثر عرضة لخرق قواعد الخصوصية أو الحوكمة (مثل مشاركة ملاحظات خاصة أو تخطي خطوات الموافقة). والأهم من ذلك، تثبت الورقة البحثية أنه لا يمكنك مجرد النظر إلى ما إذا كان الذكاء الاصطناعي قد أتم المهمة لتعرف ما إذا كان آمناً. يمكن للذكاء الاصطناعي أن "يربح" اللعبة بإتمام المهمة، ولكنه قد يخسر المعركة الأمنية من خلال السماح للمخترق بالانتصار.
من خلال تسجيل كل رسالة، وكل نقرة أداة، وكل قرار اتخذه الوكلاء، يتيح WeClawArena للباحثين تدقيق كيفية ولماذا نجح الهجوم بدقة. وتبين أن الطريق نحو الكارثة غالباً ما يكون ممهداً بخطوات صغيرة تبدو غير ضارة يقوم بها الذكاء الاصطناعي أثناء محاولته أن يكون متعاوناً. تشير الدراسة إلى أنه بينما نتحرك نحو مستقبل يعمل فيه وكلاء الذكاء الاصطناعي من أجلنا، فإننا بحاجة لاختبارهم ليس فقط على مدى ذكائهم، بل على مدى قدرتهم على قول "لا" للطلبات الخاطئة وحماية مساحاتنا الرقمية الخاصة. وتظهر النتائج أنه بينما نصبح أفضل في بناء هؤلاء الوكلاء، لا يزال أمامنا طريق طويل قبل أن يصبحوا آمنين حقاً لإطلاق سراحهم في عالم يمتلكون فيه مفاتيح حياتنا الرقمية.
ملخص تقني: WeClawArena
1. بيان المشكلة
تتناول الورقة البحثية النموذج الناشئ لـ شبكات الوكلاء المتمحورة حول الإنسان، حيث تعمل الوكلاء الشخصيين المستمرين نيابة عن المستخدمين، مع الحفاظ على الحالة والتواصل مع وكلاء آخرين من خلال علاقات اجتماعية ووظيفية. وبينما تقيم الاختبارات المعيارية الحالية استخدام الأدوات (مثل τ-bench و τ2-Bench) أو التنسيق بين الوكلاء المتعددين (مثل MultiAgentBench)، إلا أنها تخفق في استيعاب التحديات المحددة لـ التعاون بين الوكلاء المملوكين لأطراف متعددة عبر مساحات العمل الشخصية.
في هذا الإعداد، لا يعمل الوكلاء في بيئة تجريبية مشتركة، بل يجب عليهم التنسيق عبر بيئات متميزة ذات نطاق يخص المالك، تحتوي على ملفات وقواعد بيانات وأدوات وسياسات خاصة. وهذا يخلق مجال مشكلات معقدًا حيث:
منفعة المهمة: يجب على الوكلاء إكمال مهام تعاونية (مثل المساومة، التجارة) باستخدام المعلومات والأدوات المرئية فقط ضمن مساحة العمل الخاصة بمالكهم، مما يتطلب منهم دمج المعلومات الجزئية دون تجاوز الحدود.
الضرر النهائي: يمكن للضغط العدائي أن ينتقل عبر نفس قنوات التعاون المستخدمة للعمل المشروع، مما يؤدي إلى أضرار في أربعة أسطح محددة: التعاون (اختطاف الأهداف، عمليات التسليم الخاطئة)، الأمن (تسميم الأدلة، استخدام الأدوات غير الآمنة)، الخصوصية (الإفصاح غير المصرح به الذي ينتهك النزاهة السياقية)، والحوكمة (مسارات السلطة غير الصالحة، غياب الموافقة).
القابلية للتدقيق: من الصعب التمييز بين فشل المهمة بسبب عدم كفاءة الوكيل وفشل المهمة الناتج عن هجوم، أو العكس؛ مهمة تبدو ناجحة ولكنها تؤدي إلى تسريب الخصوصية أو انتهاكات الحوكمة.
تفتقر الاختبارات المعيارية الحالية إلى بيئة تشغيل (sandbox) شاملة من البداية إلى النهاية تختبر في آن واحد إتمام المهمة ونجاح الهجوم القابل للتحقق عبر هذه الحدود الشخصية.
2. المنهجية: WeClawArena
قدم المؤلفون WeClawArena، وهو اختبار معياري قابل للتدقيق وبيئة تشغيل (sandbox) مصممة لمحاكاة وتقييم التعاون بين الوكلاء عبر المستخدمين.
بناء الاختبار المعياري
النطاق: يحتوي الاختبار المعياري على 124 مهمة أساسية تم توسيعها إلى 620 متغيرًا سيناريوهيًا عبر ستة مجالات: المساومة، المزايدة، السفر، مساحة عمل هندسة البرمجيات (SWE-Workspace)، المجال السريري، والتجارة.
تصميم السيناريو: يتم إقران كل مهمة أساسية بـ عنصر تحكم حميد (بدون مهاجم) وأربعة متغيرات لمتجهات الهجوم تستهدف أسطح الضرر الأربعة (التعاون، الأمن، الخصوصية، الحوكمة).
تعريف المهمة: تُعرف المهمة بأنها مشكلة تعاون باستخدام الأدوات بين وكلاء مملوكين لأطراف متعددة. يجب على الوكلاء قراءة وتحديث والتحقق من السجلات داخل مساحات العمل الخاصة بهم (الملفات، قواعد بيانات SQLite، السياسات) لتنفيذ عقد المهمة.
بناء الهجوم: يتم تقديم الهجمات عبر رسائل أو ملفات أو صفوف في قاعدة البيانات أو عناصر اصطناعية محقونة. ومن الأهمية بمكان أن الهجمات لا تقوم بتعديل حقول النتيجة النهائية مباشرة؛ بل يجب أن تنجح فقط إذا واجه الوكلاء المواد الخبيثة أو قاموا بتوجيهها أو قبولها أو التصرف بناءً عليها من خلال العمليات الطبيعية.
بيئة التشغيل (Runtime Sandbox)
البنية: يعمل النظام في بيئة مدعومة بـ Docker حيث يمتلك كل مستخدم مساحة عمل خاصة. يقوم بوابة الرسائل (Message Gateway) بتوجيه جميع الاتصالات بين الأقران، واستدعاءات الأدوات، وعمليات الموارد.
التقاط الأدلة: يقوم نظام التشغيل بتسجيل جميع أحداث وقت التشغيل بشكل سلبي (الرسائل، استدعاءات الأدوات، عمليات الموارد، قرارات السياسة) في حزم أدلة محدودة.
بروتوكول التقييم:
المنفعة (TSR): تُقاس بما إذا كان التعاون باستخدام الأدوات قد اكتمل بناءً على الحالات النهائية لمساحة العمل وآثار الأدلة.
معدل نجاح الهجوم (ASR): يتم الحكم عليه بواسطة نموذج لغوي كبير (GPT-5.2) بعد المحاكاة. يقوم الحكم بتحليل حزمة الأدلة المحدودة لتحديد ما إذا كان الضرر النهائي قد وقع على السطح المقصود وما إذا كان هناك رابط أدلة واضح بين الضرر ومتجه الهجوم.
الفصل: يتم تقييم المنفعة و ASR بشكل منفصل لتجنب الخلط بين فشل المهمة والفشل الأمني.
3. المساهمات الرئيسية
الصياغة الرسمية: تصيغ الورقة إطار عمل للتعاون بين الوكلاء عبر المستخدمين باستخدام الأدوات، حيث تعمل مساحات العمل الشخصية كركائز تشغيلية وأسطح قيود في آن واحد.
الاختبار المعياري: إنشاء WeClawArena، الذي يضم 124 مهمة أساسية و620 متغيرًا عبر ستة مجالات متنوعة، مع نمذجة موارد المالك ومتجهات الهجوم صراحةً.
بيئة التشغيل والبروتوكول: بيئة محكومة تسجل أدلة التدقيق، مما يسمح بالتقييم المنفصل لمنفعة المهمة ونجاح الهجوم. وهذا يسمح بتشخيص انهيارات المهام، وتسريبات الخصوصية، وتسميم الأدلة، ومسارات السلطة غير الصالحة.
التحليل التجريبي: تقييم شامل لـ سبعة نماذج لغوية كبيرة متطورة (بما في ذلك Claude Opus 4.7, Claude Sonnet 4.5, Claude Opus 4.1, Kimi K2, Kimi K2 Thinking, Qwen3 235B, Qwen3 32B, and DeepSeek V3.2) يوضح أن المنفعة العالية للمهمة لا تضمن مقاومة الهجمات، وأن النماذج المختلفة تظهر تباينًا في نقاط الضعف عبر أسطح الضرر المختلفة.
4. النتائج الرئيسية
منفعة المهمة (TSR): يختلف الأداء بشكل كبير حسب المجال. أظهر Claude Opus 4.7 أقوى ملف تعريف للمنفعة بشكل عام، لا سيما في السفر، وSWE-Workspace، والمزايدة. وتصدر Claude Sonnet 4.5 في مجال المساومة. ظل مجال SWE-Workspace هو الأكثر صعوبة، حيث حقق أفضل نموذج نسبة نجاح بلغت 34.0% عبر جميع المتغيرات.
مقاومة الهجوم (ASR):
تباين النماذج: أظهر Claude Opus 4.7 أعلى مقاومة للهجمات عبر جميع أسطح الضرر. أما النماذج مفتوحة الأوزان فقد تجمعت عمومًا في مستويات أقل من حيث المقاومة.
تباين الأسطح: سجلت هجمات الحوكمة والأمن أعلى معدلات نجاح عبر النماذج، بينما كانت هجمات التعاون هي الأقل نجاحًا.
تباين المجالات: كان الضغط الأمني مهيمنًا في المساومة والمزايدة، بينما كان ضغط الخصوصية والحوكمة هو الأكثر انتشارًا في SWE-Workspace والسفر.
المقايضة بين المنفعة والمخاطر: وجدت الدراسة أن انخفاض TSR والضرر النهائي مرتبطان ولكن متميزان. بعض النماذج حافظت على منفعة عالية مع تعرضها لنجاح هجوم عالٍ (على سبيل المثال، إكمال مهمة مع تسريب بيانات خاصة)، بينما فشلت نماذج أخرى في المهمة تمامًا بسبب الانحراف الناجم عن الهجوم.
أنماط الفشل: كشف التحليل أن 117 صفًا أدت إلى نجاح المهمة ونجاح الهجوم معًا، مما يشير إلى أن الوكلاء يمكنهم إكمال مهام مشتردة مرئية مع إنتاج ضرر نهائي عبر المستخدمين (مثل قبول أدلة مسمومة أو تجاوز بوابات الموافقة).
5. الأهمية والادعاءات
تدعي الورقة أن WeClawArena تضع اختبارًا معياريًا ملموسًا لـ شبكات الوكلاء المتمحورة حول الإنسان، مما ينقل التركيز من استخدام الأدوات من طرف واحد إلى الوكلاء المفوضين الذين يعملون عبر ملفات وسجلات وحقوق قرار تخص المالك.
القدرة التشخيصية: توفر بيئة التشغيل مختبرًا قابلًا للتكرار لتشخيص المواضع التي ينجح فيها الوكلاء الشخصيون التعاونيون، وأين ينهارون، وكيف تنتقل التأثيرات الضارة عبر قنوات العمل المشروعة.
ضرورة الفصل: تؤكد النتائج على ضرورة تقييم المنفعة ونجاح الهجوم بشكل منفصل. فالاعتماد فقط على معدلات نجاح المهمة (TSR) يمكن أن يحجب الإخفاقات الأمنية والخصوصية الحرجة، بينما التركيز فقط على نجاح الهجوم قد يتجاهل تكاليف المنفعة الناتجة عن السلوكيات الدفاعية.
القابلية للتدقيق: من خلال تسجيل أدلة وقت التشغيل المحدودة، يدعم الإطار تدقيق "من الذي تصرف، أي الرسائل كانت مؤثرة، ولماذا حدثت النتيجة النهائية"، مما يعالج الحاجة إلى المساءلة في الأنظمة متعددة الوكلاء.
يضع المؤلفون WeClawArena ليس كحل نهائي لجميع مشكلات أمن الوكلاء، بل كخطوة ضرورية نحو فهم المخاطر المحددة للتعاون عبر المستخدمين في شبكات الوكلاء الشخصية المستمرة.