← أحدث الأبحاث
💻 computer science

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

تقدم هذه الورقة ClawMark، وهو معيار مرجعي جديد مصمم لتقييم وكلاء الزملاء متعددي الأنماط، ومتعددي الأدوار، ومتعددي الأيام في بيئة ديناميكية وحالة مستمرة، مما يكشف أنه بينما تظهر النماذج الرائدة تقدماً جزئياً، إلا أنها تعاني بشكل كبير في التكيف مع التغييرات الخارجية وتحقيق نجاح كامل للمهام من البداية إلى النهاية.

المؤلفون الأصليون: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xi
نُشر 2026-04-28
📖 2 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعداً جديداً لمساعدتك في إدارة مكتبك. معظم اختبارات المساعدين الذكيّين (AI) اليوم تشبه الاختبار القصير المفاجئ: حيث يُعطى الذكاء الاصطناعي سؤالاً واحداً، فيجيب عليه، وينتهي الاختبار. في هذه الحالة، يكون العالم متجمداً في الزمن خلال ذلك الاختبار.

لكن في الحياة الواقعية، لا يكتفي المساعد بالإجابة على سؤال واحد ثم يرحل؛ بل يبقى معك لأيام. وبينما هو يعمل، يستمر العالم من حوله في التغير. تصل رسائل بريد إلكتروني جديدة، ويتغير جدول مواعيدك، وتُحدث الملفات، وتظهر أدلة جديدة (مثل الصور أو الملاحظات الصوتية) فجأة. إذا لم يلاحظ مساعدك هذه التغييرات، فقد يتخذ قرارات بناءً على معلومات قديمة، مما يؤدي إلى وقوع أخطاء.

ClawMark هو "تجربة قيادة" جديدة مصمم خصيصاً لمعرفة ما إذا كان بإمكان المساعدين الذكيّين التعامل مع هذا الواقع المتغير والفوضوي.

اختبار "المكتب الحي"

بدلاً من الاختبار الجامد، ClawMark يشبه مكتبًا يحاكي الواقع ويتنفس.

  • الإعداد: يُعطى الذكاء الاصطناي مهمة (مثل التعامل مع مطالبة تأمين أو إدارة مشروع) تمتد عبر عدة "أيام عمل".
  • التحول المفاجئ: بين كل يوم وآخر، تتغير البيئة من تلقاء نفسها. ربما يصل بريد إلكتروني جديد، أو يتم تحديث جدول بيانات، أو يتم وضع ملف صامت في المجلد دون أن يخبر أحد الذكاء الاصطناي بذلك.
  • الأدلة: لا يقتصر الأمر على قراءة النصوص فقط؛ بل يجب على الذكاء الاصطناعي النظر في صور خام، والاستماع إلى تسجيلات صوتية، وقراءة ملفات PDF ممسوحة ضوئياً، وتحليل الفيديو، تماماً كما يفعل البشر.

كيف يتم تقييم الذكاء الاصطناعي

في العديد من اختبارات الذكاء الاصطناي، يقرأ إنسان أو ذكاء اصطناعي آخر الإجابة ويقول: "تبدو جيدة". لكن ClawMark يفعل شيئاً أكثر صرامة: إنه يستخدم حكماً آلياً (روبوت حَكَم).

  • لا توجد "آراء" هنا. يستخدم الاختبار 1,537 نصاً برمجياً (سكربت) صغيراً وتلقائياً (من لغة Python) للتحقق من الحالة الفعلية للحاسوب بعد انتهاء عمل الذكاء الاصطناي.
  • هل قام الذكاء الاصطناي فعلاً بحفظ الملف؟ هل قام بتحديث التقويم؟ هل رصد الصورة المخفية؟
  • إذا قال الذكاء الاصطناي "لقد فعلت ذلك" ولكن الملف ليس موجوداً، فإن الحكم الآلي يعطيه صفراً. إنه يشبه اختبار الرياضيات حيث تحصل على نقاط فقط إذا كُتبت الإجابة في المربع الصحيح، وليس فقط إذا نطقت بالرقم الصحي_

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →