← أحدث الأبحاث
🤖 AI

AcademiClaw: When Students Set Challenges for AI Agents

تقدم هذه الورقة AcademiClaw، وهو معيار تقييم ثنائي اللغة يتكون من 80 مهمة أكاديمية واقعية ومعقدة تم اختيارها من أعمال الطلاب لتقييم وتشخيص أوجه القصور في وكلاء الذكاء الاصطناعي الحاليين في التعامل مع التحديات طويلة المدى ومتعددة المجالات، مما كشف أن حتى النماذج الرائدة لا تحقق سوى معدل نجاح بنسبة 55%.

المؤلفون الأصليون: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou
نُشر 2026-05-06
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou, Binghao Qiang, Borui Zhang, Chenning Li, Enchang Zhang, Feifan Chen, Feng Jian, Fengyin Sun, Hao Qiu, Hao Zheng, Haoran Zhu, Hongyu Liu, Jianbin Deng, Jiaxin Song, Jiaying Chi, Jiayou Shi, Jie Fang, Jinghui Zhong, Jingyu Zhou, Jinze Li, Junfeng Yi, Junyan Yu, Junzhi Xue, Ni Song, Pengyi Chen, Qi Chen, Quansheng Li, Rui Tao, Shenghai Gong, Shenhang Lu, Tianqi Shen, Tianxiang Zhu, Tiehan Kang, Tingyu Li, Wendi Wu, Xiao Shen, Xiao Zhou, Xiaotao Zhang, Xinrong Li, Xuankun Yang, Xun Zhang, Yan Li, Ye Lu, Yi Wang, Yibo Zhou, Yichi Zhang, Yihao Sun, Yijun Huang, Yixin Zhu, Yixuan Wu, Yuchen Sun, Yue Wu, Yuheng Sun, Yukun Li, Yutian Tu, Yuxuan Qin, Yuzhuo Wu, Zeyu Li, Zhengyu Lou, Zhenning Ran, Zizhu He, Pengfei Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك قمت ببناء مساعد روبوت فائق الذكاء. حتى الآن، اختبرته عبر سؤاله عن مهام بسيطة: "رتب هذه الرسائل الإلكترونية"، "أضف هذا الاجتماع إلى تقويمي"، أو "ابحث عن وصفة للمكرونة". الروبوت بارع في هذه المهام؛ فهو يشبه سكرتيرًا شخصيًا عالي الكفاءة.

لكن تكمً في المشكلة: نحن لا نعرف حقًا ما إذا كان هذا الروبوت يمكنه القيام بعمل حقيقي وشاق. هل يمكنه حل مسألة رياضية معقدة؟ هل يمكنه بناء لعبة فيديو من الصفر؟ هل يمكنه إصلاح شريحة كمبيوتر معطلة؟ حتى الآن، لم يسأل أحد هذا الروبوت هذه الأسئلة بطريقة عادلة ومعيارية.

هذا هو جوهر ورقة البحث، AcademiClaw؛ فهي عبارة عن "امتحان نهائي" جديد لوكلاء الذكاء الاصطناعي، لم يصممه باحثون في المختبر، بل صممه طلاب جامعيون يعانون بالفعل من واجباتهم ومشاريعهم الدراية.

إليك تفصيل للورقة باستخدام تشبيهات بسيطة:

١. المشكلة: "السكرتير" مقابل "المهندس"

اعتبر اختبارات الذكاء الاصطناعي الحالية (اختبارات القياس) مثل اختبار رخصة القيادة لسائق توصيل طلبات البقالة. إنها تتحقق مما إذا كنت تستطيع إيقاف السيارة في الموقف الجانبي أو التوقف عند الإشارة الحمراء. هذا مفيد، لكنه لا يخبرك ما إذا كنت تستطيع قيادة سيارة فورمولا 1 أو إصلاح محرك نفاث.

تجادل الورقة بأن الاختبارات الحالية لنظام الذكاء الاصطناعي "OpenClaw" تتحقق فقط من مهارات "مستوى المساعد" (مثل ترتيب الملفات). وهي تترك فجوة هائلة: مهارات المستوى الأكاديمي. هذه هي المهام العميقة والمعقدة التي تتطلب سنوات من الدراسة، مثل إثبات نظرية رياضية أو تدريب نموذج ذكاء اصطناعي معقد.

٢. الحل: امتحان "مُقدم من الطلاب"

بدلاً من أن يبتكر الباحثون مشكلات وهمية، طلب المؤلفون من ٢٣٠ طالبًا جامعيًا تقديم مشكلات حقيقية واجهوها.

  • السيناريو: يحاول طالب استخدام الذكاء الاصطناعي للمساعدة في مشروع برمجي صعب أو ورقة بحثية. يفشل الذكاء الاصطناعي أو يتعثر. يقول الطالب: "هذا أصعب مما يمكن للذكاء الاصطناعي فعله".
  • التصفية: قام خبراء بمراجعة هذه الـ ٢٣٠ مشاركة واختاروا أفضل ٨٠ منها.
  • النتيجة: مجموعة اختبار تغطي ٢٥ مجالًا مختلفًا، من الرياضيات بمستوى الأولمبياد إلى فيزياء ألعاب الفيديو التي تعتمد على معالجات الرسوميات (GPU) وإصلاح البرمجيات المعقدة.

التشبيه: تخيل مسابقة للطهاة. بدلاً من أن يطلب الحكام من الطهاة "تقطيع بصلة"، يقول الطلاب (الزبائن): "أريد وجبة من ٥ أطباق تستخدم مكونات من ثلاث قارات مختلفة، مطبوخة بأسلوب محدد، وأريدها جاهزة في ٤0 دقيقة". هذا هو مستوى الصعوبة الذي تقدمه AcademiClaw.

٣. بيئة الاختبار: "صندوق الرمل الآمن"

للتأكد من أن الذكاء الاصطناعي لا يكسر أي شيء أو يغش، تحدث كل مهمة في صندوق رمل رقمي (بيئة كمبيوتر مغلقة تسمى Docker container).

  • يتم إعطاء الذكاء الاصطناعي مهمة.
  • يمكنه قراءة الملفات، كتابة الكود، تشغيل البرامج، وحتى استخدام متصفح الويب.
  • يجب عليه القيام بكل شيء بنفسه، خطوة بخطوة.
  • تفصيل حاسم: تتطلب بعض المهام وجود وحدة معالجة رسوميات (GPU) (بطاقة رسومات قوية تُستخدم للحسابات الثقيلة وتدريب الذكاء الاصطناعي). هذا يشبه طلب رفع وزن ثقيل من الروبوت؛ بينما كانت معظم الاختبارات السابقة تطلب منه فقط رفع ريشة.

٤. كيف يتم التصحيح: "الحكم متعدد الطبقات"

لا يمكنك مجرد السؤال: "هل انتهى؟" لأن الإجابة قد تكون "نعم، ولكن الكود معطل".
تستخدم الورقة نظام تصحيح مكون من ٦ في ١:
١. مطابقة النمط: هل كتب الكلمات الصحيحة؟
٢. تنفيذ الكود: هل يعمل البرنامج فعليًا دون توقف مفاجئ؟
٣. المُحكّم الذكي: يقوم ذكاء اصطناعي آخر بقراءة التقرير ويقيم العمل كأنه معلم.
٤. الذكاء الاصطناعي البصري: هل يمكنه "رؤية" ما إذا كان الرسم البياني أو الصورة تبدو صحيحة؟
٥. اختبار المتصفح: هل قام فعليًا ببناء موقع إلكتروني يعمل؟
٦. فحص الهيكل: هل تنسيق الملف صحيح (مثل JSON أو CSV)؟

كما لديهم تدقيق سلامة (مثل حارس الأمن) للتأكد من أن الذكاء الاصطناعي لم يحاول حذف ملفات مهمة أو اختراق أشياء لا ينبغي له الوصول إليها.

٥. النتائج: "اختبار الواقع"

اختبر المؤلفون ستة من أذكى نماذج الذكاء الاصطناعي المتاحة (مثل Claude و GPT و Gemini) في هذا الامتحان الجديد.

  • الدرجة: حتى أفضل أنظمة الذكاء الاصطناعي نجحت في ٥٥٪ فقط من المهام. وهذا يعني أنها فشلت في نصف المهام تقريبًا التي وجدها الطلاب الجامعيون صعبة.
  • فخ "الإفراط في التفكير": وجدت الورقة شيئًا غريبًا. بعض أنظمة الذكاء الاصطناعي استخدمت قدرة "عقلية" (Tokens) أكبر بـ ٥ مرات من غيرها لكنها لم تحقق نتائج أفضل.
    • التشبيه: تخيل طالبين يخضعان للاختبار. الطالب (أ) يقرأ السؤال بعناية، يفكر لدقيقة، ثم يكتب إجابة مثالية. الطالب (ب) يصاب بالذعر، ويكتب ١٠ صفحات من الكلام المرتبك وغير المفهوم، ثم يحصل على إجابة خاطئة. وجدت الورقة أن بذل المزيد من الجهد لا يعني بالضرورة جودة أفضل.
  • شخصيات مختلفة: امتلكت أنظمة الذكاء الاصطناعي "شخصيات" مختلفة:
    • القارئ: (Claude) يقرأ كل شيء أولاً، يفكر، ثم يتصرف. جودته عالية، لكنه أبطأ.
    • المطرقة: (Gemini) يبدأ فورًا في "ضرب الأشياء" (تشغيل الكود) مباشرة، على أمل أن تنجح. سريع، ولكنه غالبًا ما يكسر الأشياء ويفشل في اختبارات السلامة.
    • التقليلي: (GPT) يقوم بالحد الأدنى المطلوب، لكنه يحقق نتائج جيدة بشكل مفاجئ.

٦. الخلاصة الكبرى

تخلص الورقة إلى أنه بينما يتفوق الذكاء الاصطناعي في كونه "سكرتيرًا رقميًا"، إلا أنه لا يزال مهزوزًا جدًا عندما يُطلب منه أن يكون "باحثًا" أو "مهندسًا".

  • الفجوة: هناك انفصال كبير بين ما يمكن للذكاء الاصطناعي القيام به اليوم وما يتطلبه العمل الأكادكي والمهني الحقيقي.
  • قضية السلامة: نظام الذكاء الاصطناعي الذي حاول اتباع أسلوب "التخمين والتجربة" (Gemini) كان هو الأكثر عرضة لخرق قواعد السلامة.
  • المستقبل: يأمل المؤلفون أن يساعد هذا الاختبار الجديد (AcademiClaw) المطورين على بناء ذكاء اصطناعي قادر حقًا على حل المشكلات الصعبة والمعقدة التي نواجهها في العالم الحقيقي، وليس فقط المشكلات السهلة.

باختًا: قامت الورقة ببناء اختبار "الوضع الصعب" للذكاء الاصطناعي باستخدام واجبات طلابية حقيقية. وتظهر النتائج أن حتى أذكى أنظمة الذكاء الاصطناعي لا تزال تعاني في التعامل مع العمل العميق والمعقد في العالم الحقيقي، وأن استخدام المزيد من القدرة الحوسبية لا يجعلها بالضرورة أكثر ذكاءً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →