← أحدث الأبحاث
🤖 AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

يقدم RoadmapBench معياراً يتكون من 115 مهمة برمجة معقدة وطويلة الأمد بناءً على عمليات ترقية إصدارات حقيقية لمصادر مفتوحة لإثبات أن وكلاء الذكاء الاصطناعي الرائدين الحاليين يعانون بشكل كبير مع تطوير البرمجيات واسعة النطاق ومتعددة الأهداف، حيث يحلون أقل من 40% من المهام حتى مع أكثر النماذج تقدماً.

المؤلفون الأصليون: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتوظيف فريق من المطورين المبتدئين الأذكياء للغاية والمدعومين بالذكاء الاصطناعي. تريد أن تعرف ما إذا كان بإمكانهم التعامل مع وظيفة حقيقية: ليس مجرد إصلاح خطأ مطبعي في وصفة طعام، بل إعادة كتابة كتاب طبخ ضخم مكون من 500 صفحة لإضافة فصول جديدة، وتغيير كيفية قياس المكونات، وإصلاح الأفران المعطلة؛ كل ذلك مع الحفاظ على عمل الوصفات القديمة للأشخاص الذين لا يزالون يستخدمون النسخة القديمة.

هذا هو بالضبط ما يدور حوله بحث ROADMAPBENCH.

إليك تفصيل البحث بكلمات بسيطة:

1. المشكلة: "الخطأ المطبعي" مقابل "إعادة الهيكلة"

لفترة طويلة، كنا نختبر مساعدي البرمجة بالذكاء الاصطناعي في مهام صغيرة وسهلة. الأمر يشبه سؤال: "هل يمكنك إصلاح هذه الجملة الواحدة في هذه الفقرة؟". عادة ما يجيب الذكاء الاصطناعي: "نعم!" ويحصل على درجة امتياز.

لكن في العالم الحقيقي، لا يتوقف تطوير البرمجيات عند إصلاح جملة واحدة. بل يتعلق الأمر بترميم ناطحة سحاب. يجب عليك تغيير السباكة، والأسلاك الكهربائية، وأنظمة المصاعد عبر 50 طابقاً مختلفاً، وكل ذلك في وقت واحد، دون أن ينهار المبنى.

أدرك المؤلفون أن الاختبارات الحالية كانت سهلة للغاية. لقد كانت كأن تسأل مهندساً معمارياً عن إصلاح صنبور يسرب الماء، بينما الوظيفة الحقيقية هي تصميم جناح جديد لمستشفى. لذا، قاموا ببناء اختبار جديد أكثر صعوبة يسمى ROADMAPBENCH.

2. الاختبار الجديد: تحدي "ترقية الإصدار"

بدلاً من طلب إصلاح خطأ برمجي (bug)، يعطي ROADMAPBENCH الذكاء الاصطناعي "خارطة طريق" (roadmap).

  • الإعداد: يتم وضع الذكاء الاصطناعي في ورشة عمل رقمية تحتوي على نسخة قديمة من مشروع برمجيات حقيقي (مثل أداة مفتوحة المصدر مشهورة).
  • المهمة: يتم تسليم الذكاء الاصطناعي وثيقة "خارطة الطريق". تقول هذه الوثيقة: "في الإصدار القادم من هذا البرنامج، نحتاج إلى إضافة هذه الميزات الـ 5 الجديدة، وتغيير طريقة عمل هذه الأشياء الـ 3، وإصلاح هذين الخطأين".
  • النطاق: هذا ليس تغييراً طفيفاً. في المتوسط، يتعين على الذكاء الاصطناعي إعادة كتابة 3,7 ألف سطر من الكود عبر 51 ملفاً مختلفاً. الأمر يشبه مطالبة الذكاء الاصطناعي بإعادة كتابة سيناريو فيلم كامل، وتغيير الملابس، وإعادة تصوير المشاهد، كل ذلك في خطوة واحدة.
  • القواعد: لا يمكن للذكاء الاصطناعي التلصص على "نموذج الإجابة" (النسخة الجديدة من البرنامج). عليه أن يستنتج كل شيء من التعليمات وحدها.

3. النتائج: لا يزال الذكاء الاصطناعي في مرحلة "المبتدئ"

اختبر الباحثون 13 نموذجاً من أذكى نماذج الذكاء الاصطناعي المتاحة (بما في ذلك أحدث الإصدارات من شركات مثل Anthropic وOpenAI وGoogle). وضعوا هذه النماذج في اختبار ROADMAPBENCH.

كانت النتيجة واقعية ومثبطة:

  • حتى أذكى ذكاء اصطناعي (Claude-Opus-4.7) نجح في 39.1% فقط من المهام.
  • أما أضعف ذكاء اصطناعي فقد نجح في 5.2% فقط من المهام.

التشبيه:
إذا سألت مطوراً بشرياً مبتدئاً لترميم منزل، ولم يكمل المهمة بشكل صحيح إلا 4 مرات من أصل 10، فستقول: "إنه لا يزال يتعلم". يظهر البحث أن حتى أكثر أنظمة الذكاء الاصطناعي تقدماً لا تزال في مرحلة "التعلم" عندما يتعلق الأمر بمشاريع البرمجيات الطويلة والمعقدة.

4. أين يقع الفشل؟

لم يكتفِ البحث بعدّ الإخفاقات فحسب؛ بل بحث في سبب فشلها. وجدوا نمطاً يعتمد على مدى "ذكاء" النموذج:

  • النماذج القوية: غالباً ما تمكنت من جعل الكود يعمل (compile) واستطاعت كتابة معظم الميزات. لكنها فشلت في التفاصيل. الأمر يشبه بناء منزل مثالي، لكن مقبض الباب في الجانب الخاطئ، أو مفتاح الضوء لا يضيء المصباح فعلياً. لقد فهموا الصورة الكبيرة لكنهم أغفلوا المنطق الدقيق الصغير.
  • النماذج الأضعف: غالباً ما فشلت حتى في بناء المنزل نفسه. لقد نسوا تركيب السقف، أو حاولوا وضع المطبخ في القبو. لقد فشلوا في مستوى البناء الأساسي.

5. لماذا هذا مهم (وفقاً للبحث)

يجادل المؤلفون بأننا بحاجة للتوقف عن اختبار الذكاء الاصطناعي على "الأخطاء المطبعية" لأن ذلك يعطينا شعوراً زائفاً بالأمان. مجرد قدرة الذكاء الاصطناعي على إصلاح خطأ برمجي لا يعني أنه قادر على بناء ميزة جديدة.

ROADMAPBENCH هو مسطرة جديدة تتسم بالأمانة. فهي تخبرنا أنه بينما يتحسن الذكاء الاصطناعي، فإن القدرة على التعامل مع مشاريع البرمجيات الطويلة والمعقدة والمتعددة الخطوات لا تزال تحدياً كبيراً وغير محلول. الذكاء الاصطناعي حالياً يشبه متدرباً موهوباً جداً يمكنه اتباع التعليمات جيداً لخطوات قليلة، ولكنه يرتبك عندما يصبح المشروع كبيراً ومعقداً للغاية.

ملخص

  • الاختبارات القديمة: "هل يمكنك إصلاح هذه الكلمة المكسورة؟" (الذكاء الاصطناعي: نعم!).
  • ROADMAPBENCH: "إليك خطة لترقية نظام برمجيات كامل. هل يمكنك القيام بذلك؟" (الذكاء الاصطناعي: يمكنني المحاولة، لكني سأخطئ على الأرجح في التفاصيل أو أنسى خطوة ما).
  • الاستنتاج: لم نصل إلى هناك بعد. الذكاء الاصطناعي ذكي، لكنه ليس مستعداً ليكون المهندس الرئيسي في مشروع برمجيات ضخم بعد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →